JHU 高管数据科学笔记(三)
2026/9/20 14:45:34 网站建设 项目流程

在本节课中,我们将学习如何解释那些我们不太熟悉的研究效应。核心方法是:将未知效应与已知的基准效应进行比较,从而获得更直观的理解。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_2.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_3.png

概述

当我们研究一个全新的或不太熟悉的领域时,直接解读效应大小或显著性水平可能非常困难。这些数字本身可能缺乏直观意义。本节将介绍一种解决方案:通过将新效应与一个广为人知的基准效应进行对比,来帮助我们和他人更好地理解其实际含义。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_5.png

问题阐述

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_7.png

我们面临的核心数据分析问题是:如何解释一个效应或其量级?当这个效应来自于一个新研究的构念时,解释工作尤其具有挑战性。

解决方案:与已知构念对比

为了解决上述问题,我提出的方案是:将待研究的效应、P值、效应量或显著性水平,与一个已知的构念进行对比。

案例分析:铅暴露与脑容量

为了具体说明这个方法,让我们来看一个例子。我的同事布莱恩·施瓦茨发表了一篇论文,题为《过去的成人铅暴露与通过脑部MRI测量的神经退行性变相关》。

他们的研究发现了一个未经调整的效应估计值:骨矿物质每增加1微克铅/克,脑容量减少1.41毫升。更简单的理解是:铅暴露每增加一个单位,脑容量大约减少1.14毫升。

这项研究关注的是在铅制造厂工作的人群。研究者担心长期铅暴露会导致脑容量加速下降,其速度超过正常衰老过程。

那么,我们该如何理解这个“-1.14”的效应呢?虽然我们给出了单位解释,但问题在于,我仍然不太清楚这个数字到底意味着什么。

引入基准:正常衰老

将新效应置于相关现象的背景下进行理解,这就是我们的核心思路。在这个案例中,虽然我不是铅暴露领域的专家,但我对正常衰老过程有所了解。

已知在40岁以后,正常衰老每年会导致脑容量下降约0.5%。这个估算可能略高,但大致在这个范围。

如果我们取这个“每年0.5%”的下降率,并参照布莱恩研究中的平均脑容量数据,就可以计算出:1.41毫升的减少量,大致相当于正常衰老情况下约20%的年下降量

因此,我们可以这样重新表述:铅暴露每增加一个单位所导致的脑容量损失,大约相当于40岁以上人群在一年中经历的正常脑容量损失的20%。

方法优势

对我而言,这个对比后的解释更加清晰。因为我熟悉健康脑衰老领域,但不熟悉铅暴露对大脑的影响。通过将陌生的铅暴露效应与熟悉的正常衰老效应进行对比,我获得了更深刻的理解。

我建议你在分析中尝试使用这种技术:当你面对一个复杂的效应度量时,将其与你非常熟悉的某个事物进行对比。这是一种非常强大的解释和沟通工具,尤其适用于向不同背景的听众解释新概念时。将新构念置于一个房间里所有人都熟悉的框架内,能极大地提升沟通效果。

这种与基准效应对比的技术在流行病学、公共卫生和生物统计学领域被广泛使用。

总结

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_9.png

本节课中,我们一起学习了如何通过与基准效应进行比较,来更好地解释和理解新研究中的效应。当直接解读效应大小有困难时,将其与一个已知的、易于理解的效应(如本例中的正常脑衰老)进行对比,可以化抽象为具体,使分析结果更具实际意义和沟通力。

065:阴性对照 🧪

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_0.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_2.png

在本节课中,我们将学习一种称为“阴性对照”的实用技术。这项技术用于检验统计分析结果的可靠性,帮助我们判断一个显著的发现是真实存在的效应,还是仅仅由数据处理过程或偶然因素造成的假象。

上一节我们讨论了如何评估统计结果的显著性。本节中,我们来看看如何通过阴性对照来验证我们的分析过程本身是否可靠。

核心问题:过程还是真实效应?

我们担心分析结果更多是由数据处理过程(如数据清理、模型选择、算法偏差)导致的,而非真实存在的内在效应。如何检验这一点呢?统计学中的显著性检验等方法虽然能评估数据不确定性,但阴性对照提供了一种更贴近数据科学实践的、非常实用的解决方案。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_4.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_5.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_7.png

什么是阴性对照?

阴性对照的核心思想是:对一个已知不存在关联的变量重复整个研究分析过程

如果在这个“明知不会有结果”的测试中,你的分析过程仍然产出了“显著”的结果,那就强烈表明你的分析流程本身存在问题,可能会制造出虚假的关联。

一个经典案例:大脑“连接性”研究

让我用一个我所在领域的著名例子来说明。

在脑科学研究中,“连接性”是一个热门概念,它指的是大脑不同区域的活动会相互关联、同步变化。研究者们开发了各种工具来测量这种连接性。

有趣的是,有研究者将这些工具应用到了大脑的一个特殊区域——脑室。脑室内充满的是脑脊液,并没有脑组织。因此,理论上,脑室内的两个点之间不应该存在由大脑活动驱动的“连接性”。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_9.png

然而,当研究者使用与分析大脑区域完全相同的技术流程,去分析脑室内两个位置的信号时,他们竟然发现了“显著”的连接性结果。

这个发现非常关键,因为它证明了所观察到的“显著关联”并非真实的大脑活动连接,而纯粹是分析过程或数据本身的问题所导致的。后续研究发现,这主要与两个因素有关:

  1. 头部运动:受试者头部移动会在脑室的两个位置产生相似的模式,从而造成虚假的相关性。

  2. 生理噪声:呼吸和心跳等生理活动会动态改变信号特征,也可能产生伪相关。

这个案例的精髓在于:研究者通过在一个已知理论上不应有效应的场景下,完整复现了备受关注的分析流程,并发现了效应,从而揭示了原有分析流程中存在的系统性偏差。

阴性对照的作用与特点

这类阴性对照为调查由混杂因素或多重比较等问题引起的虚假效应,提供了一种简单有效的方法。在上述案例中,两个体素(脑成像的最小单位)之间的相关性实际上就被头部运动混杂了。

以下是选择一个好的阴性对照变量的关键特征:

  • 真实性:该变量应存在于你的数据集中,并经历与目标变量完全相同的处理流程(如数据清洗、变换、建模)。

  • 已知无关联:你必须能从逻辑或理论上确信,该变量与你的研究结果之间不可能存在真正的因果关系或关联。

实施建议与替代方案

这是一个简单的技术。如果你对团队成员执行的漫长、复杂的数据整理和分析过程感到不安,或者他们构建了多个模型,一个很好的检验方法是:要求他们针对一个从表面看就绝不可能有关联的变量,重复整个分析过程,看看会得出什么结果。这是一个极佳的“理智检查”方法,可以有效检验过程本身的影响。

当然,阴性对照的一个常见批评是:很难找到百分之百确定不存在任何效应的变量。因此,人们也常采用其他策略,例如:

  • 置换检验:这是一种更高级的方法,通过随机打乱其中一个变量的顺序,从而人为地打破变量间可能存在的任何关联,然后在多次置换中构建一个“无效应”的零分布,用于检验原假设。

总结

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_11.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_12.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_13.png

本节课我们一起学习了阴性对照技术。我们了解到,阴性对照是通过对一个已知无关联的变量重复分析流程,来检验该流程是否会产生虚假显著结果的有效方法。它像一个“照妖镜”,能帮助我们区分一个发现是真实的科学效应,还是分析过程制造的幻影。在复杂的数据分析项目中,引入阴性对照是提升结果可信度、进行质量控制的实用策略。

066:非显著性结果解读 🧐

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_0.png

概述

在本节课中,我们将探讨当统计检验结果处于“临界”或“模棱两可”状态时,应如何解读和处理。我们将重点关注“统计功效”这一核心概念,并讨论在结果不显著或接近显著性阈值时,研究者应如何思考和行动。


临界结果的挑战

上一节我们介绍了统计显著性的基本概念。本节中,我们来看看当检验结果处于临界状态时的情况。例如,你可能会得到一个P值为0.051的结果,它略高于0.05的常用显著性阈值。此时,结论并非一目了然。

面对一个边际效应,你最关心的是什么?可能有多种情况。

以下是几种可能性:

  1. 你只是运气不佳。实际上并不存在效应,只是系统中存在一些随机噪声,导致你恰好得到一个接近显著或略低于显著水平的P值或假设检验结果。这是一种不幸的情况。

  2. 另一个我们经常关心的问题是“功效”的概念。即,这项研究最初的设计是否真的足以判断效应是否存在?


理解统计功效

在出现模棱两可的结果时,你首先要问自己的问题是:这项研究是否因为功效不足而注定失败?

那么,什么是功效?功效是检测出真实存在的效应的概率。你希望功效越高越好。

例如,在设计研究时:

  • 样本量越大的研究,功效通常越高。

  • 试图检测更大效应的研究,功效也越高。这就像看见一头大象比看见一只老鼠更容易。如果真实效应更大,就更容易被发现。

  • 系统中的噪声越小,方差越小,你的功效就越高。你所研究的系统不确定性越低,你的功效就越高。

因此,人们经常在研究开始前进行功效计算,以确保他们为成功做好了准备,确保如果效应确实存在,他们有很高的概率能够检测到它。


研究后的考量

我认为,在研究结束后,你经常关心的是功效是否充足,或者至少应该讨论这项研究是否真的为成功做好了准备。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_2.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_3.png

不幸的是,事后在功效方面能做的并不多。最显而易见的方法(虽然大多数情况下不可行)是收集更多数据或进行另一项研究。这显然会有效,但这通常超出了你的控制范围。

但每个人都曾考虑过一个想法,即事后检查功效——利用你观察到的效应进行某种事后功效计算。这通常是个坏主意。如果你这样做,你需要在统计学领域非常精通才能理解其中的陷阱。通常所谓的“事后功效计算”是一个糟糕的想法。

总的来说,试图通过数据来推算你已经完成的研究的功效,几乎总是一个坏主意。


可行的应对策略

如果我们不能收集更多数据或进行另一项研究,并且我们已经说过,进行某种事后计算来量化功效通常是个坏主意(或者,如果你打算这样做但了解不多,至少应该咨询一位统计学博士,而他/她很可能也会试图劝阻你),那么我们还能做什么?

你剩下的唯一途径就是对研究强度进行批判性讨论。这是你的主要应对方法,基本上是试图弄清楚:我们在这项研究中是否应该看到了一个效应?样本量是否与我们看到效应的其他研究相似?这种批判性审视是你此刻理解这种模棱两可结果的主要手段。


https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_5.png

总结

本节课中,我们一起学习了如何解读和处理非显著性或临界显著的统计结果。我的主要观点是,在面对这类边际结果时,你想要进行的主要讨论点之一,就是讨论你的研究是否通过具备足够的功效而为成功做好了准备。关键在于理解功效的重要性,并在研究设计和结果解读中保持批判性思维,而不是依赖于事后的、有缺陷的计算。

067:相关的估计目标 📊

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_0.png

在本节课中,我们将学习一个数据分析中非常普遍的情况:当你无法直接测量真正关心的目标变量时,该如何处理。我们将探讨替代变量的概念、其优缺点,以及在实际工作中可以采取的策略。

引言:无法测量理想,就测量现实

上一节我们讨论了估计目标的重要性,本节中我们来看看当理想的测量目标无法直接获得时,我们该怎么办。这引出了“替代变量”的概念。

核心思想是:如果你无法测量你想要的变量,那就测量你能得到的变量。这就像一句老话说的:“如果你不能和你爱的人在一起,那就爱你身边的人。” 在数据分析中,这意味着我们常常需要用替代变量来近似我们真正关心的目标变量

一个不那么鼓舞人心的经典笑话也描绘了类似困境:一个醉汉在路灯下找钥匙。警察问他是否在这里丢了钥匙,醉汉说“不,我丢在那边了”。警察问“那你为什么在这里找?”,醉汉回答“因为这里有光”。我们希望在使用替代变量时,不要像这个醉汉一样,仅仅因为“这里有光”(数据容易获得)就进行搜索,而应确保我们的“钥匙”(真实洞察)就在附近。

什么是替代变量?🤔

在许多调查或研究中,直接测量最相关或最理想的指标往往非常困难,甚至不可能。这时,我们会使用一个更容易测量、但与真实目标相关的变量作为替代。

以下是几个经典的替代变量例子:

  • 身体质量指数:作为体脂百分比的替代。BMI仅通过身高和体重计算,而精确测量体脂百分比需要更复杂的技术。

  • 国内生产总值:经济学家常用它作为经济福祉的替代指标,尽管他们承认这只是对经济福祉的一种粗略概括。

  • 食物频率问卷:用于估算卡路里摄入量。通过询问人们上周吃了什么来推断其热量消耗,这是一个噪声很大的测量方法,但要精确记录人们的饮食数据本身就很困难。

  • 选民意向调查:询问人们是否会投票,得到的是“可能投票者”,但这不等于“实际投票者”。

  • 网站流量:测量的流量可能包含大量网络爬虫(如搜索引擎爬虫)的访问,而非真实的用户访问。

  • 功能性磁共振成像:在神经科学领域,我们真正想测量的是神经元信号,但实际得到的是一个名为“血氧水平依赖信号”的粗略代理信号。

因此,无法测量目标变量,只能测量一个相近的替代变量,这是一个非常普遍的问题。

优秀替代变量的特征 ✅

那么,一个好的替代变量应该具备哪些特征呢?

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_2.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_3.png

以下是优秀替代变量的关键特征:

  1. 无偏性:即使替代变量有噪声,与真实目标变量不完全一致,它也不应存在系统性偏差(即不会系统地偏大或偏小)。理想情况下,替代变量围绕真实目标变量的方差是已知的。

  2. 可校准性:在部分样本中能获得真实值(金标准),从而可以研究和校准替代变量的准确性。

一个无偏替代变量的例子是:用一个有噪声但无偏的秤测量体重。虽然单次测量不准确,但多次测量的平均值会接近真实体重,并且你知道其测量误差的分布情况。在这种情况下,你可以在分析中使用这些信息。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_5.png

然而,这种“无偏且方差已知”的情况非常少见。更常见且可实现的是第二种情况:进行金标准研究

策略:金标准研究与校准 🔬

如果你有条件,最好的策略之一是在一个子集样本上进行金标准研究。

例如,在研究智能手环(如Fitbit)的计步功能时,它并非直接测量步数,而是测量手腕的加速度,并通过算法预测步数。其估算的卡路里消耗则更不直接。

一个严谨的研究方法是:让受试者在实验室环境中佩戴设备,同时使用更精确的方法(如代谢面罩)直接测量其真实的步数和卡路里消耗。这样,你就在这部分样本上获得了“金标准”数据。

利用这部分数据,你可以:

  • 评估设备的准确性。

  • 建立校准模型:预测步数 = f(加速度数据)

  • 将这个模型应用到那些只有设备数据、没有金标准数据的大规模样本中。

进行金标准研究非常有益。根据科学界的经验,当我们深入研究这些替代变量的准确性时,常常会惊讶地发现它们比我们想象的要不准确得多。因此,如果条件允许,强烈建议花时间对你使用的替代变量进行校准研究。

当缺乏金标准时:承认局限与敏感性分析 ⚠️

如果上述策略都不可行(即没有金标准数据,也无法从外部数据验证),那么你必须承认分析的局限性。

在这种情况下,你需要:

  1. 对结果保持怀疑态度:时刻意识到你的结果基于一个有噪声的替代变量。

  2. 进行敏感性分析:评估替代变量的偏差和变异性对结论的影响。

敏感性分析是指,假设替代变量存在一定程度的误差(例如,食物频率问卷可能每天平均低估100卡路里的摄入),然后将这种误差纳入分析,观察你的核心结论是否会因此改变。这是一种“试探”方法,用于理解未测量真实目标所带来的后果。

何时应该放弃? 🚫

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_7.png

最后,我们需要思考:什么时候应该放弃使用某个替代变量进行分析?

一个实用的判断标准是:在开始分析或收集数据之前,先思考你将如何解释结果

问自己:考虑到你使用的替代变量相对于真实目标如此不准确和不可靠,是否任何可能的结果(无论是你希望看到的,还是完全相反的)都不会真正改变你的决策或认知状态?如果答案是肯定的,那么进行这项分析可能就没有意义。

在这种情况下,你需要:

  • 改进你的替代变量。

  • 设法进行金标准研究。

  • 寻找新的、更好的变量。

  • 或者直接放弃这个分析方向。

在投入成本进行一项分析之前,先思考能否从嘈杂的替代变量中获得任何有价值的信息,这是非常必要的。

总结 📝

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_9.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_10.png

本节课我们一起学习了如何处理无法直接测量目标变量的情况。我们介绍了替代变量的概念,探讨了优秀替代变量的特征(无偏、可校准)。我们学习了两种主要策略:进行金标准研究以校准替代变量,以及在缺乏金标准时通过敏感性分析和保持怀疑态度来评估局限性。最后,我们讨论了在替代变量质量过差时,应考虑放弃分析,转而寻求更好的测量方法。理解并妥善处理替代变量的局限性,是做出稳健数据决策的关键一步。

068:报告写作 📝

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_0.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_2.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_4.png

在本节课中,我们将学习如何撰写清晰、可复现的数据科学报告。报告写作是数据科学项目中的关键环节,但常常存在问题。我们将探讨三个核心策略,帮助你或你的团队提升报告质量。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_6.png

上一节我们介绍了报告写作的重要性,本节中我们来看看提升报告质量的第一项策略:检查效应。

检查符号、量级与单位

一份优质报告的基础是确保其内容的准确性。以下是三个需要重点检查的方面:

  • 符号:检查效应的方向是否符合预期。例如,在分析阿尔茨海默症症状与脑容量的关系时,我们预期脑容量随症状加重而减少。如果报告中的系数显示为正(即脑容量增加),这就值得警惕并需要解释。

  • 量级:将所研究效应的量级与其他已知效应进行比较。例如,可以说“由某因素导致的脑容量损失,相当于正常衰老十年的损失量”。这有助于读者直观理解效应的大小。

  • 单位:确保所有效应的单位清晰明确,并标注在所有图表坐标轴上。混淆单位可能导致荒谬的结论(例如,得出人脑每年增长到房屋大小的错误结果)。深入理解单位有助于从根本上理解问题。

上一节我们讨论了如何确保报告的准确性,本节中我们来看看如何让报告更容易被理解。

聚焦于解释与可解释性

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_8.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_10.png

报告的核心价值在于传达洞见,而不仅仅是展示数字。提升解释性的方法如下:

  • 与已知效应对比:这不仅是检查量级的方法,也是增强解释力的有力工具。通过对比,让陌生的概念变得熟悉。

  • 鼓励简约性:在模型选择上,应崇尚简约原则,即使用尽可能简单且不失效的模型。例如,如果一个回归模型能达到复杂机器学习算法95%的预测性能,那么牺牲5%的性能以换取模型极强的可解释性通常是值得的。在报告中,应着重解释回归系数等易于理解的结果。

  • 进行效应批判:当发现一个显著或令人兴奋的效应时,应主动扮演“怀疑者”的角色。思考可能的替代解释或混杂因素。例如,发现铅暴露与脑容量损失相关时,需质疑:“这真的是铅暴露导致的,还是暴露组与非暴露组人群的体重指数不同造成的?”这种批判性思维将引导你进行更深入的分析(例如,在模型中同时纳入铅暴露和体重指数),以巩固或修正你的结论。

上一节我们探讨了如何让报告内容更易于理解,本节中我们来看看如何确保报告的分析过程可以被他人验证和复现。

使用可复现的研究工具

可复现性是现代数据科学的基石。它确保报告中的每一个数字都能被追溯和重新生成。Ben Hammer 有一条精辟的推文:“写代码时,请记住你是在与未来的自己合作。”

为了实现报告的可复现性,应鼓励使用将数据分析与报告撰写合二为一的工具。这类工具能自动生成包含所有分析步骤的文档。目前最流行的两种工具是:

  • knitr:这是一个专门用于R语言的工具,其理念是将分析与报告“编织”在一起。

  • Jupyter Notebook:这是一个支持多种编程语言(如 Python、R)的交互式笔记本工具。

使用这类工具,可以确保报告不仅呈现结果,还完整记录了从原始数据到最终分析结果的全部路径。

总结

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_12.png

本节课中我们一起学习了提升数据科学报告质量的三个核心策略:

  1. 严格检查报告中效应的符号、量级和单位,确保基础准确性。

  2. 聚焦于解释与可解释性,通过对比、崇尚简约模型和进行自我批判,让报告清晰传达洞见。

  3. 采用可复现的研究工具(如knitrJupyter Notebook),将分析与报告无缝结合,确保结果可被验证和追溯。遵循这些策略,将能显著提高报告的专业性、可信度和沟通效率。

069:版本控制 📚

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_0.png

在本节课中,我们将要学习版本控制的概念、重要性以及如何在数据分析工作中实践它。版本控制是确保代码可追溯、可协作和可恢复的关键工具。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_2.png


上一节我们讨论了撰写可重复报告的重要性。本节中,我们来看看如何通过版本控制来管理代码和分析过程的历史记录。

记住本课程的核心主题:对比现实与理想的数据分析实践。我认为版本控制是少数几个能够轻松达到理想状态的主题之一。它只需要投入少量工作,却常常能节省大量时间。

请思考这句话:当你编写代码时,请记住你正在与未来的自己合作。能够查看代码、回溯到之前的版本并了解分析过程的历史,是数据分析中极其重要的一环。我们在报告撰写部分讨论过创建可重复报告的重要性。这当然是完成高质量、有良好文档记录的分析的一个组成部分。而持续保存代码的所有版本是另一个关键部分。它不仅有助于备份和归档,还能精确记录你所做的每一步,这对数据分析目的至关重要。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_4.png

总而言之,版本控制是一种良好的实践。与本课程中许多其他主题不同,它相对容易实现,并且完全在你的掌控之中。


https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_6.png

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_7.png

以下是关于版本控制工具演变的个人经历分享。

说到这里,我想借此机会“抱怨”一下Roger Pang。我使用版本控制已经很久了。我认为我最早使用的是RCS,一个相当古老的版本控制系统,然后是CVS。后来有一天,Roger Pang走进我的办公室说,所有人都在用一个叫Subversion的程序,我必须切换,因为没人再用CVS了。我抗拒了一段时间。但我想,Roger在计算方面几乎总是对的。于是我切换到了Subversion,这是一个将我的所有CVS仓库转换为Subversion仓库的巨大工程。

然而,就在第二天,Roger又走进我的办公室说,所有人都在用Git,我必须停止使用Subversion。于是我又抗拒了很长一段时间,坚持使用Subversion。但当我最终切换到Git后,我感到非常满意。我注意到Git已经存在了一段时间,并且似乎会持续下去,至少在可预见的未来不会被下一个版本控制系统取代。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_9.png


https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_10.png

上一节我们了解了版本控制工具的演变。本节中,我们来看看当前推荐的工具和实践。

对于你管理的团队成员,你应该鼓励他们在分析中使用Git、Subversion、Mercurial等版本控制工具。为了让你对软件有所了解,如果我必须给出一个建议,我会推荐Git。

Git是版本控制软件。它帮助你完整保存代码和分析文件(甚至数据文件)的历史记录。你可以回溯到任何时间点,或者在回退后再次前进。任何被提交到Git仓库的内容都不会丢失。因此,Git是实现版本控制的工具。

然后,你需要一个地方来托管它。你可以自己搭建。如果你在一家公司,公司可能已经部署了版本控制系统。如果你在一家较小的公司,你可能需要考虑使用Git托管服务。最流行的托管服务中,我最熟悉的两个是GitHub(我认为它显然是最大的)和Bitbucket。这些不是版本控制工具本身,而是托管你代码和文件的地方。本质上,它们为你托管Git软件并跟踪你的文件。这些都是极好的工具。

我强烈建议将使用Git和版本控制作为最佳实践和管理策略的一部分,鼓励甚至要求使用这些工具。


https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_12.png

本节课中,我们一起学习了版本控制的核心价值。我们了解到,版本控制不仅是与未来自己协作的关键,也是确保分析过程可追溯、可恢复的最佳实践。我们回顾了版本控制工具的演变,并重点推荐了当前主流的Git工具及其托管服务(如GitHub和Bitbucket)。作为管理者,推动团队采纳版本控制,是提升数据分析工作质量和效率的重要一步。

070:顶点项目欢迎信息 🎓

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_0.png

在本节课中,我们将介绍《高管数据科学》专项课程的最终环节——顶点项目。我们将概述项目的目标、合作伙伴以及它如何评估你在整个专项课程中所学的管理技能。


https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_0.png

欢迎来到《高管数据科学》顶点项目。此时,你已经完成了所有课程。我们希望评估你作为高管管理一个小型数据科学项目的能力。作为高管,你可能不会直接参与数据分析或处理具体细节,但你很可能需要管理那些执行这些任务的人员。因此,在这个顶点项目中,我们希望评估你运用专项课程所涵盖主题进行决策的技能。


上一节我们介绍了顶点项目的总体目标,本节中我们来看看项目的具体合作伙伴和背景。

我们与 Zillow 合作设计了本次顶点项目。Zillow 是领先的房地产和租赁市场平台,在全美范围内提供关于购房和租房的关键数据。在这个顶点项目中,你将管理一个基于 Zillow 在日常运营中经常处理的问题而设计的小型数据科学项目。


以下是项目执行过程中的评估方式:

在整个顶点项目期间,我们将评估你的表现并跟踪你的进展,观察你如何应对出现的各种挑战。


https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_2.png

我们希望你能享受这次顶点项目的体验,并感到从整个专项课程中学有所获。

https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_2.png

我们期待看到你的表现。


本节课中我们一起学习了《高管数据科学》顶点项目的引入信息,包括其评估目标、与 Zillow 的合作背景以及项目的基本执行框架。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询