数据科学场景化思考实战:Data-Science-For-Beginners 第一课作业完整解析与拓展
2026/9/15 1:36:21 网站建设 项目流程

数据科学场景化思考实战:Data-Science-For-Beginners 第一课作业完整解析与拓展

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

导读

本文以开源课程 Data-Science-For-Beginners("10 Weeks, 20 Lessons, Data Science for All!")第一课《Defining Data Science》配套作业为核心,完整解析这份题为《Devoir : Scénarios en Science des Données》(数据科学场景)的法语版作业:它要求学习者围绕教育、疫苗接种、工作生产力三大领域,从"收集哪些数据、如何收集、如何存储、能得出什么洞察与决策"四个维度展开场景化思考。读完本文,你将掌握数据科学项目立项阶段的四问框架、数据采集与存储选型的方法论、以及对照仓库真实数据集进行方案验证的完整思路,并能据此独立完成这份作业及其评分要求。

一、作业定位:第一课的"数据科学场景"思考题

本作业是课程第一课 Defining Data Science 的收尾任务,位于 translations/fr/1-Introduction/01-defining-data-science/assignment.md(法语版,内容与 英文原版 一致)。它紧承第一课的核心主张:数据科学的价值不在于"处理数据"本身,而在于用数据改进真实世界的流程与决策。因此作业要求学习者面向现实中的业务流程或问题,模拟数据科学家的第一步——不写代码、不做模型,而是先把问题拆解为可被数据回答的问题。

作业要求针对每一个问题领域,逐一回答以下四个问题:

  1. 你能收集哪些数据(Quelles données pouvez-vous collecter)?
  2. 你打算如何收集这些数据(Comment les collecteriez-vous)?
  3. 你会如何存储这些数据?数据的规模大概有多大(Comment stockeriez-vous les données ? Quelle serait probablement la taille des données)?
  4. 你能从这些数据中得出什么洞察(aperçus)?基于这些数据我们能做出什么决策(Quelles décisions pourrions-nous prendre)?

这四个问题并非随意罗列,而是对应了第一课 README 中归纳的数据旅程五步:数据获取(Data Acquisition)→ 数据存储(Data Storage)→ 数据处理(Data Processing)→ 可视化/人工洞察(Visualization / Human Insights)→ 预测模型训练(Training a predictive model)。换言之,这份作业就是让你在动手编码之前,先把这五个环节在脑子里各走一遍——这正是数据科学项目立项阶段最关键的"需求分析"。

二、四问框架逐条拆解:怎么把"想法"变成"数据方案"

2.1 问题一:收集哪些数据?

判断"该收集什么数据"的核心原则是:数据必须能反向回答你要解决的业务问题。第一课将数据划分为结构化(structured)、半结构化(semi-structured)与非结构化(unstructured)三类,并给出了常见数据来源清单:

  • 结构化数据:IoT 传感器读数(温度、压力)、购买/访问后的用户问卷、用户行为分析(如用户在站点内的浏览深度与离开原因);
  • 非结构化数据:文本(可用于情感分析、关键词提取)、图片/视频(如监控视频用于估算道路交通流量)、Web 服务器日志(哪些页面被访问最多、停留多久);
  • 半结构化数据:社交网络关系图(可刻画用户性格与信息传播潜力)、聚会合影中的人际关系图(Group Dynamics)。

仓库的 data 目录 恰好提供了一批真实可查的结构化数据集,可作为"该收集什么数据"的参照物:例如 honey.csv 记录各州、各年份的蜂群数、单群产量、总产量、库存与单价;birds.csv 记录鸟类物种的目、科、属与体型/翼展/体重区间;diabetes.tsv 为糖尿病患者的年龄、性别、BMI、血压及多项生理指标;emails.csv 则是典型的词频矩阵(每封邮件中各单词的出现次数)。这些文件说明:好的数据集 = 明确的行(对象)+ 明确的列(指标)+ 可追溯的时间/空间维度。你在作业中设计"收集什么数据"时,应当能想象出最终落成的表头长什么样。

2.2 问题二:如何收集?

收集方式取决于数据源类型。第一课给出的典型路径包括:

  • IoT / 传感采集:若场景依赖传感器(如教室温湿度、车间设备状态),通常需要缓冲端点(如 IoT Hub)先汇聚海量原始信号,再做后续处理;
  • 问卷/表单:面向用户的主观反馈,成本低、可批量;仓库 data/form.csv 即是一份问卷回收数据的样例;
  • 日志与行为埋点:被动采集用户在系统内的操作轨迹;
  • 公开数据集与爬取:利用现成的开放数据(课程中挑战环节就通过抓取维基百科文本生成词云,代码见 notebook.ipynb)。

作业中你不需要真正实施采集,但必须明确"数据从哪里来、以什么频率/渠道进入系统",这决定了后续存储与处理的成本。

2.3 问题三:如何存储?数据规模多大?

第一课 README 给出三种典型存储方案,这也是作业评分中明确会考察的一环(评分标准要求"讨论了数据存储方式"):

存储方案适用场景关键特征
关系型数据库(Relational)结构化、表间有关联的数据以 SQL 查询;表按 schema 组织,通常需将原始数据转换为符合表结构的形式
NoSQL 数据库(如 CosmosDB)层次化 JSON 文档、图结构等复杂数据不强制 schema,可存更复杂数据;但查询能力弱于 SQL,且无法强制参照完整性
数据湖(Data Lake)海量原始、非结构化数据常与大数据结合,数据无法单机容纳时由集群存储处理;常配合 Parquet 格式

规模估算要与存储选型联动:若每天仅产生几百条问卷记录,一张关系表即可承载;若场景是全校每间教室每分钟一次的传感器读数,数年累计将达千万级行——此时就需要考虑数据湖或分布式方案。仓库 2-Working-With-Data 部分专门用两课讲解关系型与非关系型数据(对应目录 05-relational-databases 与 06-non-relational),后者还提供了 JSON 样例(PersonsData.json、TwitterData.json)可供参考。

2.4 问题四:能得出什么洞察与决策?

这是四问的"落点":数据必须转化为可行动的洞察(actionable insights)。第一课强调,数据科学的最终目标是基于数据做决策,而洞察通常需要经过可视化或统计检验才能被"看见"——这正是课程 3-Data-Visualization 部分(共 5 课:数量、分布、比例、关系与有意义可视化)要训练的能力。在作业阶段,你只需要合情合理地推演:"假如我拿到这些数据,我能发现什么规律,并据此做什么改变"。注意:洞察应当可验证、可执行,而不是空泛的"了解情况"。

三、三大示例场景:从"提示"到"可落地的数据方案"

作业给出了三个起始领域(也允许你替换为自己的想法),下面给出每个领域的完整推演示范。完成作业时,可对照此思路填充官方表格。

3.1 场景一:用数据改进儿童的在校教育过程

  • 收集哪些数据:学生学习行为数据(各模块/章节的完成时长、作业提交时间与成绩、测验得分、课堂出勤)、教师的评价记录、学生的年龄/年级等属性数据;非结构化数据可包括作业文本与课堂讨论记录(用于理解难点)。
  • 如何收集:学习管理系统(LMS)自动埋点记录学习行为;课后测验与作业通过系统提交;学生属性通过注册表单维护。注意保护未成年人数据的合规性。
  • 如何存储:学习行为与成绩属于高度结构化的关系数据,宜用关系型数据库按"学生表—课程表—成绩表"建模(主键/外键关联);讨论文本等非结构化内容可放入 NoSQL 或文件存储。规模上,一所学校数千学生、每年数千条行为记录,单机关系库即可承载。
  • 洞察与决策:第一课 README 中的课程优化例子正属于此类——统计每名学生完成每个模块的平均时长(考虑按模块字符数归一化),找出学生普遍卡壳的模块并简化内容;分析测验中每道题的错误率,定位学生理解薄弱的概念点并改进讲义;进一步将完成时长与学生年龄分段交叉分析,可给出分年龄段的课程推荐,减少因预期不符导致的退课。

3.2 场景二:用数据控制疫情期间的疫苗接种

  • 收集哪些数据:接种记录(疫苗批号、接种时间、接种点)、人口信息(年龄、地区、慢性病史、职业)、疫情传播数据(每日新增病例、住院率、死亡率)、疫苗库存与有效期数据。
  • 如何收集:接种点在接种时通过信息系统实时登记;医疗机构按日上报病例;人口信息来自既有卫生档案;疫苗库存由供应链系统维护。仓库 data/COVID 下的time_series_covid19_confirmed_global.csvtime_series_covid19_deaths_global.csvtime_series_covid19_recovered_global.csv正是这类"按国家/地区+日期"累积的典型时序公开数据,可直接作为"如何组织疫情数据"的参照。
  • 如何存储:接种与病例数据为典型的表格时序数据,关系型数据库 + 分区表足以支撑按日期、地区的聚合查询;若涉及全人口级的细粒度轨迹与图谱分析,可引入 NoSQL 或数据湖。规模取决于人口量级:国家级每日千万级记录的聚合运算需考虑集群或列式存储(如 Parquet)。
  • 洞察与决策:识别接种率低的人群与地区,定向投放接种宣传与增设临时接种点;监测不同疫苗批次的副作用报告率,辅助安全性决策;结合病例曲线评估某地区疫苗覆盖率与住院率的关系,动态调整分配优先级与解封策略。

3.3 场景三:用数据保证工作生产力

  • 收集哪些数据:任务管理系统中的任务完成时间、工作时长记录、会议时长与数量、干扰事件日志(消息/邮件打断频次)、个人健康数据(睡眠时长,若有穿戴设备)。
  • 如何收集:项目管理/待办工具自动记录任务耗时;日历与通讯工具导出会议与消息元数据;穿戴设备或手记补充健康维度。注意这类数据高度个人化,需在隐私允许的范围内使用。
  • 如何存储:个人量级数据量很小(每天几十到几百条记录),关系型数据库或本地 CSV/电子表格即可;若要跨团队分析,可统一入库并按人员、周聚合。
  • 洞察与决策:发现"深度工作时段"与任务产出效率的相关性,据此调整日程安排(把高难度任务排进高效时段、减少中断);识别会议占比过高的团队并推动会议瘦身;结合任务预估与实际耗时偏差,改进工作估时模型。

3.4 官方作业表格(可直接复制使用)

作业要求填写下表,可用自己的领域替换建议领域(原表共 3 行,务必全部填写):

领域问题收集哪些数据如何存储数据能得出哪些洞察/决策
教育
疫苗接种
生产力

四、评分标准解读:三个等级差在哪里

作业末尾附带的评分表(Rubric)是自我校验的标尺,共分三档:

优秀(Exemplary)合格(Adéquat)待改进(À améliorer)
能为所有问题领域识别出合理的数据来源、存储方式以及可行的决策/洞察方案的某些方面不够详细,未讨论数据存储,至少描述了 2 个领域只描述了方案的部分内容,仅考虑了 1 个领域

从评分表可以提炼出三条硬性要求:① 领域数量要足够(至少 2 个,理想是 3 个全部覆盖);② 存储环节不可缺(这是最容易被忽略、也最容易被扣分的一项,务必回到本文 2.3 节的三种存储方案去说明);③ 洞察与决策必须落到"可采取的行动",而非泛泛而谈。建议在提交前逐行检查:每一行是否都填满了四列?"存储方式"是否结合了数据规模说明?"洞察/决策"是否具体到"据此可以做什么改变"?

五、拓展:把作业升维成"数据旅程"的完整推演

如果你想让作业质量超出评分表要求,可以在四个问题之外,主动补充以下两层思考——它们全部源于第一课正文,属于课程明确传授的方法论:

  1. 数据旅程的完整性:第一课将数据生命周期归纳为"获取→存储→处理→可视化→建模"五步,作业四问其实覆盖了前两步和第四步(决策即"洞察")。你可以在方案中额外说明:原始数据如何清洗转换(对应课程第 8 课 数据准备),以及最终是否需要训练预测模型(课程第 10 周内容的前置铺垫)。例如疫苗接种场景中,"预测未来两周某地区的确诊趋势"就需要在历史时序数据之上构建预测模型——仓库中的 COVID 时序文件正是这类建模任务的输入素材。

  2. 数字化与数字化转型:第一课指出,先要把业务流程转化为数字形式(数字化,digitalization),再对其应用数据科学技术驱动决策、甚至改变业务方向(数字化转型,digital transformation)。在作业的场景描述里点明"该流程中哪些环节目前还是纸面/人工的,需要先数字化",会让你的方案更贴合数据科学的真实落地逻辑。

此外,仓库为每个主要板块都提供了配套的练习数据集与 Notebook,完成作业后可以挑选一个场景实际动手:例如用 04-stats-and-probability 的统计方法检验你设想中的相关性,或用 3-Data-Visualization 的图表验证你的"洞察假设"。这样就从"纸上推演"跨入了"真实数据科学流程",与第一课的挑战环节(用 notebook.ipynb 处理维基百科文本生成词云)形成闭环。

六、总结:完成本作业的行动清单

  1. 为每个领域写清楚四问答案,至少覆盖教育、疫苗接种、生产力 3 个领域(或用自选领域替换);
  2. 每一问都落到具体:数据要能说出"哪张表、哪些列",存储要指定"关系型 / NoSQL / 数据湖"并估算规模,决策要具体到"据此做什么行动";
  3. 用本文 3.4 节的表格组织答案,逐格检查是否填满;
  4. 对照评分表自我评分:存储是否讨论、领域是否 ≥2、洞察是否可行动;
  5. 有余力时,把方案中的关键假设与仓库 data 目录 的真实数据集(如 COVID 时序数据、honey.csv、birds.csv)对照,验证你的数据模型设想是否成立。

完成这份作业,你就完成了数据科学学习的第一步:在写第一行代码之前,学会用数据的眼光重新审视世界上的问题

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询