数据科学场景化思考实战:Data-Science-For-Beginners 第一课作业完整解析与拓展
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
导读
本文以开源课程 Data-Science-For-Beginners("10 Weeks, 20 Lessons, Data Science for All!")第一课《Defining Data Science》配套作业为核心,完整解析这份题为《Devoir : Scénarios en Science des Données》(数据科学场景)的法语版作业:它要求学习者围绕教育、疫苗接种、工作生产力三大领域,从"收集哪些数据、如何收集、如何存储、能得出什么洞察与决策"四个维度展开场景化思考。读完本文,你将掌握数据科学项目立项阶段的四问框架、数据采集与存储选型的方法论、以及对照仓库真实数据集进行方案验证的完整思路,并能据此独立完成这份作业及其评分要求。
一、作业定位:第一课的"数据科学场景"思考题
本作业是课程第一课 Defining Data Science 的收尾任务,位于 translations/fr/1-Introduction/01-defining-data-science/assignment.md(法语版,内容与 英文原版 一致)。它紧承第一课的核心主张:数据科学的价值不在于"处理数据"本身,而在于用数据改进真实世界的流程与决策。因此作业要求学习者面向现实中的业务流程或问题,模拟数据科学家的第一步——不写代码、不做模型,而是先把问题拆解为可被数据回答的问题。
作业要求针对每一个问题领域,逐一回答以下四个问题:
- 你能收集哪些数据(Quelles données pouvez-vous collecter)?
- 你打算如何收集这些数据(Comment les collecteriez-vous)?
- 你会如何存储这些数据?数据的规模大概有多大(Comment stockeriez-vous les données ? Quelle serait probablement la taille des données)?
- 你能从这些数据中得出什么洞察(aperçus)?基于这些数据我们能做出什么决策(Quelles décisions pourrions-nous prendre)?
这四个问题并非随意罗列,而是对应了第一课 README 中归纳的数据旅程五步:数据获取(Data Acquisition)→ 数据存储(Data Storage)→ 数据处理(Data Processing)→ 可视化/人工洞察(Visualization / Human Insights)→ 预测模型训练(Training a predictive model)。换言之,这份作业就是让你在动手编码之前,先把这五个环节在脑子里各走一遍——这正是数据科学项目立项阶段最关键的"需求分析"。
二、四问框架逐条拆解:怎么把"想法"变成"数据方案"
2.1 问题一:收集哪些数据?
判断"该收集什么数据"的核心原则是:数据必须能反向回答你要解决的业务问题。第一课将数据划分为结构化(structured)、半结构化(semi-structured)与非结构化(unstructured)三类,并给出了常见数据来源清单:
- 结构化数据:IoT 传感器读数(温度、压力)、购买/访问后的用户问卷、用户行为分析(如用户在站点内的浏览深度与离开原因);
- 非结构化数据:文本(可用于情感分析、关键词提取)、图片/视频(如监控视频用于估算道路交通流量)、Web 服务器日志(哪些页面被访问最多、停留多久);
- 半结构化数据:社交网络关系图(可刻画用户性格与信息传播潜力)、聚会合影中的人际关系图(Group Dynamics)。
仓库的 data 目录 恰好提供了一批真实可查的结构化数据集,可作为"该收集什么数据"的参照物:例如 honey.csv 记录各州、各年份的蜂群数、单群产量、总产量、库存与单价;birds.csv 记录鸟类物种的目、科、属与体型/翼展/体重区间;diabetes.tsv 为糖尿病患者的年龄、性别、BMI、血压及多项生理指标;emails.csv 则是典型的词频矩阵(每封邮件中各单词的出现次数)。这些文件说明:好的数据集 = 明确的行(对象)+ 明确的列(指标)+ 可追溯的时间/空间维度。你在作业中设计"收集什么数据"时,应当能想象出最终落成的表头长什么样。
2.2 问题二:如何收集?
收集方式取决于数据源类型。第一课给出的典型路径包括:
- IoT / 传感采集:若场景依赖传感器(如教室温湿度、车间设备状态),通常需要缓冲端点(如 IoT Hub)先汇聚海量原始信号,再做后续处理;
- 问卷/表单:面向用户的主观反馈,成本低、可批量;仓库 data/form.csv 即是一份问卷回收数据的样例;
- 日志与行为埋点:被动采集用户在系统内的操作轨迹;
- 公开数据集与爬取:利用现成的开放数据(课程中挑战环节就通过抓取维基百科文本生成词云,代码见 notebook.ipynb)。
作业中你不需要真正实施采集,但必须明确"数据从哪里来、以什么频率/渠道进入系统",这决定了后续存储与处理的成本。
2.3 问题三:如何存储?数据规模多大?
第一课 README 给出三种典型存储方案,这也是作业评分中明确会考察的一环(评分标准要求"讨论了数据存储方式"):
| 存储方案 | 适用场景 | 关键特征 |
|---|---|---|
| 关系型数据库(Relational) | 结构化、表间有关联的数据 | 以 SQL 查询;表按 schema 组织,通常需将原始数据转换为符合表结构的形式 |
| NoSQL 数据库(如 CosmosDB) | 层次化 JSON 文档、图结构等复杂数据 | 不强制 schema,可存更复杂数据;但查询能力弱于 SQL,且无法强制参照完整性 |
| 数据湖(Data Lake) | 海量原始、非结构化数据 | 常与大数据结合,数据无法单机容纳时由集群存储处理;常配合 Parquet 格式 |
规模估算要与存储选型联动:若每天仅产生几百条问卷记录,一张关系表即可承载;若场景是全校每间教室每分钟一次的传感器读数,数年累计将达千万级行——此时就需要考虑数据湖或分布式方案。仓库 2-Working-With-Data 部分专门用两课讲解关系型与非关系型数据(对应目录 05-relational-databases 与 06-non-relational),后者还提供了 JSON 样例(PersonsData.json、TwitterData.json)可供参考。
2.4 问题四:能得出什么洞察与决策?
这是四问的"落点":数据必须转化为可行动的洞察(actionable insights)。第一课强调,数据科学的最终目标是基于数据做决策,而洞察通常需要经过可视化或统计检验才能被"看见"——这正是课程 3-Data-Visualization 部分(共 5 课:数量、分布、比例、关系与有意义可视化)要训练的能力。在作业阶段,你只需要合情合理地推演:"假如我拿到这些数据,我能发现什么规律,并据此做什么改变"。注意:洞察应当可验证、可执行,而不是空泛的"了解情况"。
三、三大示例场景:从"提示"到"可落地的数据方案"
作业给出了三个起始领域(也允许你替换为自己的想法),下面给出每个领域的完整推演示范。完成作业时,可对照此思路填充官方表格。
3.1 场景一:用数据改进儿童的在校教育过程
- 收集哪些数据:学生学习行为数据(各模块/章节的完成时长、作业提交时间与成绩、测验得分、课堂出勤)、教师的评价记录、学生的年龄/年级等属性数据;非结构化数据可包括作业文本与课堂讨论记录(用于理解难点)。
- 如何收集:学习管理系统(LMS)自动埋点记录学习行为;课后测验与作业通过系统提交;学生属性通过注册表单维护。注意保护未成年人数据的合规性。
- 如何存储:学习行为与成绩属于高度结构化的关系数据,宜用关系型数据库按"学生表—课程表—成绩表"建模(主键/外键关联);讨论文本等非结构化内容可放入 NoSQL 或文件存储。规模上,一所学校数千学生、每年数千条行为记录,单机关系库即可承载。
- 洞察与决策:第一课 README 中的课程优化例子正属于此类——统计每名学生完成每个模块的平均时长(考虑按模块字符数归一化),找出学生普遍卡壳的模块并简化内容;分析测验中每道题的错误率,定位学生理解薄弱的概念点并改进讲义;进一步将完成时长与学生年龄分段交叉分析,可给出分年龄段的课程推荐,减少因预期不符导致的退课。
3.2 场景二:用数据控制疫情期间的疫苗接种
- 收集哪些数据:接种记录(疫苗批号、接种时间、接种点)、人口信息(年龄、地区、慢性病史、职业)、疫情传播数据(每日新增病例、住院率、死亡率)、疫苗库存与有效期数据。
- 如何收集:接种点在接种时通过信息系统实时登记;医疗机构按日上报病例;人口信息来自既有卫生档案;疫苗库存由供应链系统维护。仓库 data/COVID 下的
time_series_covid19_confirmed_global.csv、time_series_covid19_deaths_global.csv、time_series_covid19_recovered_global.csv正是这类"按国家/地区+日期"累积的典型时序公开数据,可直接作为"如何组织疫情数据"的参照。 - 如何存储:接种与病例数据为典型的表格时序数据,关系型数据库 + 分区表足以支撑按日期、地区的聚合查询;若涉及全人口级的细粒度轨迹与图谱分析,可引入 NoSQL 或数据湖。规模取决于人口量级:国家级每日千万级记录的聚合运算需考虑集群或列式存储(如 Parquet)。
- 洞察与决策:识别接种率低的人群与地区,定向投放接种宣传与增设临时接种点;监测不同疫苗批次的副作用报告率,辅助安全性决策;结合病例曲线评估某地区疫苗覆盖率与住院率的关系,动态调整分配优先级与解封策略。
3.3 场景三:用数据保证工作生产力
- 收集哪些数据:任务管理系统中的任务完成时间、工作时长记录、会议时长与数量、干扰事件日志(消息/邮件打断频次)、个人健康数据(睡眠时长,若有穿戴设备)。
- 如何收集:项目管理/待办工具自动记录任务耗时;日历与通讯工具导出会议与消息元数据;穿戴设备或手记补充健康维度。注意这类数据高度个人化,需在隐私允许的范围内使用。
- 如何存储:个人量级数据量很小(每天几十到几百条记录),关系型数据库或本地 CSV/电子表格即可;若要跨团队分析,可统一入库并按人员、周聚合。
- 洞察与决策:发现"深度工作时段"与任务产出效率的相关性,据此调整日程安排(把高难度任务排进高效时段、减少中断);识别会议占比过高的团队并推动会议瘦身;结合任务预估与实际耗时偏差,改进工作估时模型。
3.4 官方作业表格(可直接复制使用)
作业要求填写下表,可用自己的领域替换建议领域(原表共 3 行,务必全部填写):
| 领域 | 问题 | 收集哪些数据 | 如何存储数据 | 能得出哪些洞察/决策 |
|---|---|---|---|---|
| 教育 | ||||
| 疫苗接种 | ||||
| 生产力 |
四、评分标准解读:三个等级差在哪里
作业末尾附带的评分表(Rubric)是自我校验的标尺,共分三档:
| 优秀(Exemplary) | 合格(Adéquat) | 待改进(À améliorer) |
|---|---|---|
| 能为所有问题领域识别出合理的数据来源、存储方式以及可行的决策/洞察 | 方案的某些方面不够详细,未讨论数据存储,至少描述了 2 个领域 | 只描述了方案的部分内容,仅考虑了 1 个领域 |
从评分表可以提炼出三条硬性要求:① 领域数量要足够(至少 2 个,理想是 3 个全部覆盖);② 存储环节不可缺(这是最容易被忽略、也最容易被扣分的一项,务必回到本文 2.3 节的三种存储方案去说明);③ 洞察与决策必须落到"可采取的行动",而非泛泛而谈。建议在提交前逐行检查:每一行是否都填满了四列?"存储方式"是否结合了数据规模说明?"洞察/决策"是否具体到"据此可以做什么改变"?
五、拓展:把作业升维成"数据旅程"的完整推演
如果你想让作业质量超出评分表要求,可以在四个问题之外,主动补充以下两层思考——它们全部源于第一课正文,属于课程明确传授的方法论:
数据旅程的完整性:第一课将数据生命周期归纳为"获取→存储→处理→可视化→建模"五步,作业四问其实覆盖了前两步和第四步(决策即"洞察")。你可以在方案中额外说明:原始数据如何清洗转换(对应课程第 8 课 数据准备),以及最终是否需要训练预测模型(课程第 10 周内容的前置铺垫)。例如疫苗接种场景中,"预测未来两周某地区的确诊趋势"就需要在历史时序数据之上构建预测模型——仓库中的 COVID 时序文件正是这类建模任务的输入素材。
数字化与数字化转型:第一课指出,先要把业务流程转化为数字形式(数字化,digitalization),再对其应用数据科学技术驱动决策、甚至改变业务方向(数字化转型,digital transformation)。在作业的场景描述里点明"该流程中哪些环节目前还是纸面/人工的,需要先数字化",会让你的方案更贴合数据科学的真实落地逻辑。
此外,仓库为每个主要板块都提供了配套的练习数据集与 Notebook,完成作业后可以挑选一个场景实际动手:例如用 04-stats-and-probability 的统计方法检验你设想中的相关性,或用 3-Data-Visualization 的图表验证你的"洞察假设"。这样就从"纸上推演"跨入了"真实数据科学流程",与第一课的挑战环节(用 notebook.ipynb 处理维基百科文本生成词云)形成闭环。
六、总结:完成本作业的行动清单
- 为每个领域写清楚四问答案,至少覆盖教育、疫苗接种、生产力 3 个领域(或用自选领域替换);
- 每一问都落到具体:数据要能说出"哪张表、哪些列",存储要指定"关系型 / NoSQL / 数据湖"并估算规模,决策要具体到"据此做什么行动";
- 用本文 3.4 节的表格组织答案,逐格检查是否填满;
- 对照评分表自我评分:存储是否讨论、领域是否 ≥2、洞察是否可行动;
- 有余力时,把方案中的关键假设与仓库 data 目录 的真实数据集(如 COVID 时序数据、honey.csv、birds.csv)对照,验证你的数据模型设想是否成立。
完成这份作业,你就完成了数据科学学习的第一步:在写第一行代码之前,学会用数据的眼光重新审视世界上的问题。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考