在本节课中,我们将学习如何解释那些我们不太熟悉的研究效应。核心方法是:将未知效应与已知的基准效应进行比较,从而获得更直观的理解。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_2.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_3.png
概述
当我们研究一个全新的或不太熟悉的领域时,直接解读效应大小或显著性水平可能非常困难。这些数字本身可能缺乏直观意义。本节将介绍一种解决方案:通过将新效应与一个广为人知的基准效应进行对比,来帮助我们和他人更好地理解其实际含义。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_5.png
问题阐述
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_7.png
我们面临的核心数据分析问题是:如何解释一个效应或其量级?当这个效应来自于一个新研究的构念时,解释工作尤其具有挑战性。
解决方案:与已知构念对比
为了解决上述问题,我提出的方案是:将待研究的效应、P值、效应量或显著性水平,与一个已知的构念进行对比。
案例分析:铅暴露与脑容量
为了具体说明这个方法,让我们来看一个例子。我的同事布莱恩·施瓦茨发表了一篇论文,题为《过去的成人铅暴露与通过脑部MRI测量的神经退行性变相关》。
他们的研究发现了一个未经调整的效应估计值:骨矿物质每增加1微克铅/克,脑容量减少1.41毫升。更简单的理解是:铅暴露每增加一个单位,脑容量大约减少1.14毫升。
这项研究关注的是在铅制造厂工作的人群。研究者担心长期铅暴露会导致脑容量加速下降,其速度超过正常衰老过程。
那么,我们该如何理解这个“-1.14”的效应呢?虽然我们给出了单位解释,但问题在于,我仍然不太清楚这个数字到底意味着什么。
引入基准:正常衰老
将新效应置于相关现象的背景下进行理解,这就是我们的核心思路。在这个案例中,虽然我不是铅暴露领域的专家,但我对正常衰老过程有所了解。
已知在40岁以后,正常衰老每年会导致脑容量下降约0.5%。这个估算可能略高,但大致在这个范围。
如果我们取这个“每年0.5%”的下降率,并参照布莱恩研究中的平均脑容量数据,就可以计算出:1.41毫升的减少量,大致相当于正常衰老情况下约20%的年下降量。
因此,我们可以这样重新表述:铅暴露每增加一个单位所导致的脑容量损失,大约相当于40岁以上人群在一年中经历的正常脑容量损失的20%。
方法优势
对我而言,这个对比后的解释更加清晰。因为我熟悉健康脑衰老领域,但不熟悉铅暴露对大脑的影响。通过将陌生的铅暴露效应与熟悉的正常衰老效应进行对比,我获得了更深刻的理解。
我建议你在分析中尝试使用这种技术:当你面对一个复杂的效应度量时,将其与你非常熟悉的某个事物进行对比。这是一种非常强大的解释和沟通工具,尤其适用于向不同背景的听众解释新概念时。将新构念置于一个房间里所有人都熟悉的框架内,能极大地提升沟通效果。
这种与基准效应对比的技术在流行病学、公共卫生和生物统计学领域被广泛使用。
总结
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_9.png
本节课中,我们一起学习了如何通过与基准效应进行比较,来更好地解释和理解新研究中的效应。当直接解读效应大小有困难时,将其与一个已知的、易于理解的效应(如本例中的正常脑衰老)进行对比,可以化抽象为具体,使分析结果更具实际意义和沟通力。
065:阴性对照 🧪
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_0.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_2.png
在本节课中,我们将学习一种称为“阴性对照”的实用技术。这项技术用于检验统计分析结果的可靠性,帮助我们判断一个显著的发现是真实存在的效应,还是仅仅由数据处理过程或偶然因素造成的假象。
上一节我们讨论了如何评估统计结果的显著性。本节中,我们来看看如何通过阴性对照来验证我们的分析过程本身是否可靠。
核心问题:过程还是真实效应?
我们担心分析结果更多是由数据处理过程(如数据清理、模型选择、算法偏差)导致的,而非真实存在的内在效应。如何检验这一点呢?统计学中的显著性检验等方法虽然能评估数据不确定性,但阴性对照提供了一种更贴近数据科学实践的、非常实用的解决方案。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_4.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_5.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_7.png
什么是阴性对照?
阴性对照的核心思想是:对一个已知不存在关联的变量重复整个研究分析过程。
如果在这个“明知不会有结果”的测试中,你的分析过程仍然产出了“显著”的结果,那就强烈表明你的分析流程本身存在问题,可能会制造出虚假的关联。
一个经典案例:大脑“连接性”研究
让我用一个我所在领域的著名例子来说明。
在脑科学研究中,“连接性”是一个热门概念,它指的是大脑不同区域的活动会相互关联、同步变化。研究者们开发了各种工具来测量这种连接性。
有趣的是,有研究者将这些工具应用到了大脑的一个特殊区域——脑室。脑室内充满的是脑脊液,并没有脑组织。因此,理论上,脑室内的两个点之间不应该存在由大脑活动驱动的“连接性”。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_9.png
然而,当研究者使用与分析大脑区域完全相同的技术流程,去分析脑室内两个位置的信号时,他们竟然发现了“显著”的连接性结果。
这个发现非常关键,因为它证明了所观察到的“显著关联”并非真实的大脑活动连接,而纯粹是分析过程或数据本身的问题所导致的。后续研究发现,这主要与两个因素有关:
头部运动:受试者头部移动会在脑室的两个位置产生相似的模式,从而造成虚假的相关性。
生理噪声:呼吸和心跳等生理活动会动态改变信号特征,也可能产生伪相关。
这个案例的精髓在于:研究者通过在一个已知理论上不应有效应的场景下,完整复现了备受关注的分析流程,并发现了效应,从而揭示了原有分析流程中存在的系统性偏差。
阴性对照的作用与特点
这类阴性对照为调查由混杂因素或多重比较等问题引起的虚假效应,提供了一种简单有效的方法。在上述案例中,两个体素(脑成像的最小单位)之间的相关性实际上就被头部运动混杂了。
以下是选择一个好的阴性对照变量的关键特征:
真实性:该变量应存在于你的数据集中,并经历与目标变量完全相同的处理流程(如数据清洗、变换、建模)。
已知无关联:你必须能从逻辑或理论上确信,该变量与你的研究结果之间不可能存在真正的因果关系或关联。
实施建议与替代方案
这是一个简单的技术。如果你对团队成员执行的漫长、复杂的数据整理和分析过程感到不安,或者他们构建了多个模型,一个很好的检验方法是:要求他们针对一个从表面看就绝不可能有关联的变量,重复整个分析过程,看看会得出什么结果。这是一个极佳的“理智检查”方法,可以有效检验过程本身的影响。
当然,阴性对照的一个常见批评是:很难找到百分之百确定不存在任何效应的变量。因此,人们也常采用其他策略,例如:
- 置换检验:这是一种更高级的方法,通过随机打乱其中一个变量的顺序,从而人为地打破变量间可能存在的任何关联,然后在多次置换中构建一个“无效应”的零分布,用于检验原假设。
总结
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_11.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_12.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_13.png
本节课我们一起学习了阴性对照技术。我们了解到,阴性对照是通过对一个已知无关联的变量重复分析流程,来检验该流程是否会产生虚假显著结果的有效方法。它像一个“照妖镜”,能帮助我们区分一个发现是真实的科学效应,还是分析过程制造的幻影。在复杂的数据分析项目中,引入阴性对照是提升结果可信度、进行质量控制的实用策略。
066:非显著性结果解读 🧐
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_0.png
概述
在本节课中,我们将探讨当统计检验结果处于“临界”或“模棱两可”状态时,应如何解读和处理。我们将重点关注“统计功效”这一核心概念,并讨论在结果不显著或接近显著性阈值时,研究者应如何思考和行动。
临界结果的挑战
上一节我们介绍了统计显著性的基本概念。本节中,我们来看看当检验结果处于临界状态时的情况。例如,你可能会得到一个P值为0.051的结果,它略高于0.05的常用显著性阈值。此时,结论并非一目了然。
面对一个边际效应,你最关心的是什么?可能有多种情况。
以下是几种可能性:
你只是运气不佳。实际上并不存在效应,只是系统中存在一些随机噪声,导致你恰好得到一个接近显著或略低于显著水平的P值或假设检验结果。这是一种不幸的情况。
另一个我们经常关心的问题是“功效”的概念。即,这项研究最初的设计是否真的足以判断效应是否存在?
理解统计功效
在出现模棱两可的结果时,你首先要问自己的问题是:这项研究是否因为功效不足而注定失败?
那么,什么是功效?功效是检测出真实存在的效应的概率。你希望功效越高越好。
例如,在设计研究时:
样本量越大的研究,功效通常越高。
试图检测更大效应的研究,功效也越高。这就像看见一头大象比看见一只老鼠更容易。如果真实效应更大,就更容易被发现。
系统中的噪声越小,方差越小,你的功效就越高。你所研究的系统不确定性越低,你的功效就越高。
因此,人们经常在研究开始前进行功效计算,以确保他们为成功做好了准备,确保如果效应确实存在,他们有很高的概率能够检测到它。
研究后的考量
我认为,在研究结束后,你经常关心的是功效是否充足,或者至少应该讨论这项研究是否真的为成功做好了准备。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_2.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_3.png
不幸的是,事后在功效方面能做的并不多。最显而易见的方法(虽然大多数情况下不可行)是收集更多数据或进行另一项研究。这显然会有效,但这通常超出了你的控制范围。
但每个人都曾考虑过一个想法,即事后检查功效——利用你观察到的效应进行某种事后功效计算。这通常是个坏主意。如果你这样做,你需要在统计学领域非常精通才能理解其中的陷阱。通常所谓的“事后功效计算”是一个糟糕的想法。
总的来说,试图通过数据来推算你已经完成的研究的功效,几乎总是一个坏主意。
可行的应对策略
如果我们不能收集更多数据或进行另一项研究,并且我们已经说过,进行某种事后计算来量化功效通常是个坏主意(或者,如果你打算这样做但了解不多,至少应该咨询一位统计学博士,而他/她很可能也会试图劝阻你),那么我们还能做什么?
你剩下的唯一途径就是对研究强度进行批判性讨论。这是你的主要应对方法,基本上是试图弄清楚:我们在这项研究中是否应该看到了一个效应?样本量是否与我们看到效应的其他研究相似?这种批判性审视是你此刻理解这种模棱两可结果的主要手段。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_5.png
总结
本节课中,我们一起学习了如何解读和处理非显著性或临界显著的统计结果。我的主要观点是,在面对这类边际结果时,你想要进行的主要讨论点之一,就是讨论你的研究是否通过具备足够的功效而为成功做好了准备。关键在于理解功效的重要性,并在研究设计和结果解读中保持批判性思维,而不是依赖于事后的、有缺陷的计算。
067:相关的估计目标 📊
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_0.png
在本节课中,我们将学习一个数据分析中非常普遍的情况:当你无法直接测量真正关心的目标变量时,该如何处理。我们将探讨替代变量的概念、其优缺点,以及在实际工作中可以采取的策略。
引言:无法测量理想,就测量现实
上一节我们讨论了估计目标的重要性,本节中我们来看看当理想的测量目标无法直接获得时,我们该怎么办。这引出了“替代变量”的概念。
核心思想是:如果你无法测量你想要的变量,那就测量你能得到的变量。这就像一句老话说的:“如果你不能和你爱的人在一起,那就爱你身边的人。” 在数据分析中,这意味着我们常常需要用替代变量来近似我们真正关心的目标变量。
一个不那么鼓舞人心的经典笑话也描绘了类似困境:一个醉汉在路灯下找钥匙。警察问他是否在这里丢了钥匙,醉汉说“不,我丢在那边了”。警察问“那你为什么在这里找?”,醉汉回答“因为这里有光”。我们希望在使用替代变量时,不要像这个醉汉一样,仅仅因为“这里有光”(数据容易获得)就进行搜索,而应确保我们的“钥匙”(真实洞察)就在附近。
什么是替代变量?🤔
在许多调查或研究中,直接测量最相关或最理想的指标往往非常困难,甚至不可能。这时,我们会使用一个更容易测量、但与真实目标相关的变量作为替代。
以下是几个经典的替代变量例子:
身体质量指数:作为体脂百分比的替代。BMI仅通过身高和体重计算,而精确测量体脂百分比需要更复杂的技术。
国内生产总值:经济学家常用它作为经济福祉的替代指标,尽管他们承认这只是对经济福祉的一种粗略概括。
食物频率问卷:用于估算卡路里摄入量。通过询问人们上周吃了什么来推断其热量消耗,这是一个噪声很大的测量方法,但要精确记录人们的饮食数据本身就很困难。
选民意向调查:询问人们是否会投票,得到的是“可能投票者”,但这不等于“实际投票者”。
网站流量:测量的流量可能包含大量网络爬虫(如搜索引擎爬虫)的访问,而非真实的用户访问。
功能性磁共振成像:在神经科学领域,我们真正想测量的是神经元信号,但实际得到的是一个名为“血氧水平依赖信号”的粗略代理信号。
因此,无法测量目标变量,只能测量一个相近的替代变量,这是一个非常普遍的问题。
优秀替代变量的特征 ✅
那么,一个好的替代变量应该具备哪些特征呢?
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_2.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_3.png
以下是优秀替代变量的关键特征:
无偏性:即使替代变量有噪声,与真实目标变量不完全一致,它也不应存在系统性偏差(即不会系统地偏大或偏小)。理想情况下,替代变量围绕真实目标变量的方差是已知的。
可校准性:在部分样本中能获得真实值(金标准),从而可以研究和校准替代变量的准确性。
一个无偏替代变量的例子是:用一个有噪声但无偏的秤测量体重。虽然单次测量不准确,但多次测量的平均值会接近真实体重,并且你知道其测量误差的分布情况。在这种情况下,你可以在分析中使用这些信息。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_5.png
然而,这种“无偏且方差已知”的情况非常少见。更常见且可实现的是第二种情况:进行金标准研究。
策略:金标准研究与校准 🔬
如果你有条件,最好的策略之一是在一个子集样本上进行金标准研究。
例如,在研究智能手环(如Fitbit)的计步功能时,它并非直接测量步数,而是测量手腕的加速度,并通过算法预测步数。其估算的卡路里消耗则更不直接。
一个严谨的研究方法是:让受试者在实验室环境中佩戴设备,同时使用更精确的方法(如代谢面罩)直接测量其真实的步数和卡路里消耗。这样,你就在这部分样本上获得了“金标准”数据。
利用这部分数据,你可以:
评估设备的准确性。
建立校准模型:
预测步数 = f(加速度数据)。将这个模型应用到那些只有设备数据、没有金标准数据的大规模样本中。
进行金标准研究非常有益。根据科学界的经验,当我们深入研究这些替代变量的准确性时,常常会惊讶地发现它们比我们想象的要不准确得多。因此,如果条件允许,强烈建议花时间对你使用的替代变量进行校准研究。
当缺乏金标准时:承认局限与敏感性分析 ⚠️
如果上述策略都不可行(即没有金标准数据,也无法从外部数据验证),那么你必须承认分析的局限性。
在这种情况下,你需要:
对结果保持怀疑态度:时刻意识到你的结果基于一个有噪声的替代变量。
进行敏感性分析:评估替代变量的偏差和变异性对结论的影响。
敏感性分析是指,假设替代变量存在一定程度的误差(例如,食物频率问卷可能每天平均低估100卡路里的摄入),然后将这种误差纳入分析,观察你的核心结论是否会因此改变。这是一种“试探”方法,用于理解未测量真实目标所带来的后果。
何时应该放弃? 🚫
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_7.png
最后,我们需要思考:什么时候应该放弃使用某个替代变量进行分析?
一个实用的判断标准是:在开始分析或收集数据之前,先思考你将如何解释结果。
问自己:考虑到你使用的替代变量相对于真实目标如此不准确和不可靠,是否任何可能的结果(无论是你希望看到的,还是完全相反的)都不会真正改变你的决策或认知状态?如果答案是肯定的,那么进行这项分析可能就没有意义。
在这种情况下,你需要:
改进你的替代变量。
设法进行金标准研究。
寻找新的、更好的变量。
或者直接放弃这个分析方向。
在投入成本进行一项分析之前,先思考能否从嘈杂的替代变量中获得任何有价值的信息,这是非常必要的。
总结 📝
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_9.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_10.png
本节课我们一起学习了如何处理无法直接测量目标变量的情况。我们介绍了替代变量的概念,探讨了优秀替代变量的特征(无偏、可校准)。我们学习了两种主要策略:进行金标准研究以校准替代变量,以及在缺乏金标准时通过敏感性分析和保持怀疑态度来评估局限性。最后,我们讨论了在替代变量质量过差时,应考虑放弃分析,转而寻求更好的测量方法。理解并妥善处理替代变量的局限性,是做出稳健数据决策的关键一步。
068:报告写作 📝
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_0.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_2.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_4.png
在本节课中,我们将学习如何撰写清晰、可复现的数据科学报告。报告写作是数据科学项目中的关键环节,但常常存在问题。我们将探讨三个核心策略,帮助你或你的团队提升报告质量。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_6.png
上一节我们介绍了报告写作的重要性,本节中我们来看看提升报告质量的第一项策略:检查效应。
检查符号、量级与单位
一份优质报告的基础是确保其内容的准确性。以下是三个需要重点检查的方面:
符号:检查效应的方向是否符合预期。例如,在分析阿尔茨海默症症状与脑容量的关系时,我们预期脑容量随症状加重而减少。如果报告中的系数显示为正(即脑容量增加),这就值得警惕并需要解释。
量级:将所研究效应的量级与其他已知效应进行比较。例如,可以说“由某因素导致的脑容量损失,相当于正常衰老十年的损失量”。这有助于读者直观理解效应的大小。
单位:确保所有效应的单位清晰明确,并标注在所有图表坐标轴上。混淆单位可能导致荒谬的结论(例如,得出人脑每年增长到房屋大小的错误结果)。深入理解单位有助于从根本上理解问题。
上一节我们讨论了如何确保报告的准确性,本节中我们来看看如何让报告更容易被理解。
聚焦于解释与可解释性
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_8.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_10.png
报告的核心价值在于传达洞见,而不仅仅是展示数字。提升解释性的方法如下:
与已知效应对比:这不仅是检查量级的方法,也是增强解释力的有力工具。通过对比,让陌生的概念变得熟悉。
鼓励简约性:在模型选择上,应崇尚简约原则,即使用尽可能简单且不失效的模型。例如,如果一个回归模型能达到复杂机器学习算法95%的预测性能,那么牺牲5%的性能以换取模型极强的可解释性通常是值得的。在报告中,应着重解释回归系数等易于理解的结果。
进行效应批判:当发现一个显著或令人兴奋的效应时,应主动扮演“怀疑者”的角色。思考可能的替代解释或混杂因素。例如,发现铅暴露与脑容量损失相关时,需质疑:“这真的是铅暴露导致的,还是暴露组与非暴露组人群的体重指数不同造成的?”这种批判性思维将引导你进行更深入的分析(例如,在模型中同时纳入铅暴露和体重指数),以巩固或修正你的结论。
上一节我们探讨了如何让报告内容更易于理解,本节中我们来看看如何确保报告的分析过程可以被他人验证和复现。
使用可复现的研究工具
可复现性是现代数据科学的基石。它确保报告中的每一个数字都能被追溯和重新生成。Ben Hammer 有一条精辟的推文:“写代码时,请记住你是在与未来的自己合作。”
为了实现报告的可复现性,应鼓励使用将数据分析与报告撰写合二为一的工具。这类工具能自动生成包含所有分析步骤的文档。目前最流行的两种工具是:
knitr:这是一个专门用于R语言的工具,其理念是将分析与报告“编织”在一起。Jupyter Notebook:这是一个支持多种编程语言(如 Python、R)的交互式笔记本工具。
使用这类工具,可以确保报告不仅呈现结果,还完整记录了从原始数据到最终分析结果的全部路径。
总结
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_12.png
本节课中我们一起学习了提升数据科学报告质量的三个核心策略:
严格检查报告中效应的符号、量级和单位,确保基础准确性。
聚焦于解释与可解释性,通过对比、崇尚简约模型和进行自我批判,让报告清晰传达洞见。
采用可复现的研究工具(如
knitr或Jupyter Notebook),将分析与报告无缝结合,确保结果可被验证和追溯。遵循这些策略,将能显著提高报告的专业性、可信度和沟通效率。
069:版本控制 📚
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_0.png
在本节课中,我们将要学习版本控制的概念、重要性以及如何在数据分析工作中实践它。版本控制是确保代码可追溯、可协作和可恢复的关键工具。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_2.png
上一节我们讨论了撰写可重复报告的重要性。本节中,我们来看看如何通过版本控制来管理代码和分析过程的历史记录。
记住本课程的核心主题:对比现实与理想的数据分析实践。我认为版本控制是少数几个能够轻松达到理想状态的主题之一。它只需要投入少量工作,却常常能节省大量时间。
请思考这句话:当你编写代码时,请记住你正在与未来的自己合作。能够查看代码、回溯到之前的版本并了解分析过程的历史,是数据分析中极其重要的一环。我们在报告撰写部分讨论过创建可重复报告的重要性。这当然是完成高质量、有良好文档记录的分析的一个组成部分。而持续保存代码的所有版本是另一个关键部分。它不仅有助于备份和归档,还能精确记录你所做的每一步,这对数据分析目的至关重要。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_4.png
总而言之,版本控制是一种良好的实践。与本课程中许多其他主题不同,它相对容易实现,并且完全在你的掌控之中。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_6.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_7.png
以下是关于版本控制工具演变的个人经历分享。
说到这里,我想借此机会“抱怨”一下Roger Pang。我使用版本控制已经很久了。我认为我最早使用的是RCS,一个相当古老的版本控制系统,然后是CVS。后来有一天,Roger Pang走进我的办公室说,所有人都在用一个叫Subversion的程序,我必须切换,因为没人再用CVS了。我抗拒了一段时间。但我想,Roger在计算方面几乎总是对的。于是我切换到了Subversion,这是一个将我的所有CVS仓库转换为Subversion仓库的巨大工程。
然而,就在第二天,Roger又走进我的办公室说,所有人都在用Git,我必须停止使用Subversion。于是我又抗拒了很长一段时间,坚持使用Subversion。但当我最终切换到Git后,我感到非常满意。我注意到Git已经存在了一段时间,并且似乎会持续下去,至少在可预见的未来不会被下一个版本控制系统取代。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_9.png
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_10.png
上一节我们了解了版本控制工具的演变。本节中,我们来看看当前推荐的工具和实践。
对于你管理的团队成员,你应该鼓励他们在分析中使用Git、Subversion、Mercurial等版本控制工具。为了让你对软件有所了解,如果我必须给出一个建议,我会推荐Git。
Git是版本控制软件。它帮助你完整保存代码和分析文件(甚至数据文件)的历史记录。你可以回溯到任何时间点,或者在回退后再次前进。任何被提交到Git仓库的内容都不会丢失。因此,Git是实现版本控制的工具。
然后,你需要一个地方来托管它。你可以自己搭建。如果你在一家公司,公司可能已经部署了版本控制系统。如果你在一家较小的公司,你可能需要考虑使用Git托管服务。最流行的托管服务中,我最熟悉的两个是GitHub(我认为它显然是最大的)和Bitbucket。这些不是版本控制工具本身,而是托管你代码和文件的地方。本质上,它们为你托管Git软件并跟踪你的文件。这些都是极好的工具。
我强烈建议将使用Git和版本控制作为最佳实践和管理策略的一部分,鼓励甚至要求使用这些工具。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_12.png
本节课中,我们一起学习了版本控制的核心价值。我们了解到,版本控制不仅是与未来自己协作的关键,也是确保分析过程可追溯、可恢复的最佳实践。我们回顾了版本控制工具的演变,并重点推荐了当前主流的Git工具及其托管服务(如GitHub和Bitbucket)。作为管理者,推动团队采纳版本控制,是提升数据分析工作质量和效率的重要一步。
070:顶点项目欢迎信息 🎓
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_0.png
在本节课中,我们将介绍《高管数据科学》专项课程的最终环节——顶点项目。我们将概述项目的目标、合作伙伴以及它如何评估你在整个专项课程中所学的管理技能。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_0.png
欢迎来到《高管数据科学》顶点项目。此时,你已经完成了所有课程。我们希望评估你作为高管管理一个小型数据科学项目的能力。作为高管,你可能不会直接参与数据分析或处理具体细节,但你很可能需要管理那些执行这些任务的人员。因此,在这个顶点项目中,我们希望评估你运用专项课程所涵盖主题进行决策的技能。
上一节我们介绍了顶点项目的总体目标,本节中我们来看看项目的具体合作伙伴和背景。
我们与 Zillow 合作设计了本次顶点项目。Zillow 是领先的房地产和租赁市场平台,在全美范围内提供关于购房和租房的关键数据。在这个顶点项目中,你将管理一个基于 Zillow 在日常运营中经常处理的问题而设计的小型数据科学项目。
以下是项目执行过程中的评估方式:
在整个顶点项目期间,我们将评估你的表现并跟踪你的进展,观察你如何应对出现的各种挑战。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_2.png
我们希望你能享受这次顶点项目的体验,并感到从整个专项课程中学有所获。
https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_2.png
我们期待看到你的表现。
本节课中我们一起学习了《高管数据科学》顶点项目的引入信息,包括其评估目标、与 Zillow 的合作背景以及项目的基本执行框架。