Data-Science-For-Beginners 第 1 课配套作业解析:用"数据科学四问"拆解真实业务场景
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本篇技术指南以 Data-Science-For-Beginners 课程中第 1 课(定义数据科学)的德语译本作业文档 solution/assignment.md 为主体,系统讲解"数据科学场景分析"作业的作答框架、教育场景完整示例、疫苗接种与生产力场景的思考路径,并结合仓库内课程正文、配套 Notebook 与数据文件给出源码级佐证。读完本文,你将掌握一套可直接复用的四问分析方法(收集什么数据、如何收集、如何存储与规模预估、可得出什么洞察与决策),能够针对任意业务领域独立完成此类数据科学场景设计。
一、作业背景:本作业在课程中的定位
本作业是课程第 1 课 Defining Data Science 的两项课后任务之一(该课另一项任务是修改文本挖掘 Notebook,探索 Big Data 与 Machine Learning 的相关概念)。第 1 课的核心是建立数据科学的整体认知:数据科学是从结构化与非结构化数据中提取知识、产出可行动洞察(actionable insights)的科学领域,其完整流程可概括为五步"数据旅程":
- 数据获取(Data Acquisition):采集原始数据,必要时借助 IoT Hub 等缓冲端点;
- 数据存储(Data Storage):根据未来查询方式选择关系型数据库、NoSQL 数据库或数据湖(Data Lake);
- 数据处理(Data Processing):将原始数据转换为可用于可视化与模型训练的形式,例如用 AI 技术从非结构化数据中提取特征;
- 可视化 / 人工洞察(Visualization / Human Insights):借助多种可视化手段与统计方法验证假设、发现相关性;
- 训练预测模型(Training a Predictive Model):在需要做出数据驱动决策时,用机器学习构建预测模型。
本作业正是要求学习者把上述流程反向应用到真实业务问题上:给定一个现实过程或问题,回答"数据从哪来、怎么存、能得出什么结论"。它检验的是学习者是否真正理解数据科学"数据 → 洞察 → 决策"的闭环,而非仅仅记住概念定义。
二、作答框架:数据科学四问
作业要求对每个问题领域依次思考以下四个问题(原文见 德语作业文档):
| 序号 | 核心问题 | 对应数据旅程环节 |
|---|---|---|
| 1 | 可以收集哪些数据(Welche Daten können Sie sammeln?) | 数据获取 |
| 2 | 如何收集这些数据(Wie würden Sie diese Daten sammeln?) | 数据获取 / 数据处理 |
| 3 | 如何存储数据,数据规模预计多大(Wie würden Sie die Daten speichern? Wie groß werden die Daten voraussichtlich sein?) | 数据存储 |
| 4 | 能从数据中获得哪些洞察,可据此做出哪些决策(Welche Erkenntnisse könnten Sie aus diesen Daten gewinnen? Welche Entscheidungen könnten wir auf Basis der Daten treffen?) | 可视化 / 洞察 / 决策 |
要求是"对 3 个不同的问题/过程,逐项描述上述每一点",并将结果填入五列表格:
| Problembereich(问题领域) | Problem(问题) | Welche Daten sammeln(收集哪些数据) | Wie die Daten speichern(如何存储) | Welche Erkenntnisse/Entscheidungen(可得的洞察/决策) |
|---|
作业文档给出了三个建议领域:教育(如何用数据改进学校儿童的教育过程)、疫苗接种(如何用数据在疫情期间管理疫苗接种)、生产力(如何用数据保证工作效率)。作答时可用自己的领域替换建议领域。
三、教育场景完整示例:逐列拆解参考解答
作业文档为"教育"领域提供了一行完整的示例答案(也是唯一一行),目的是让学习者理解每列应填什么。下面按列拆解其设计逻辑。
3.1 问题列:提出可检验的假设
在大学中,讲座出勤率通常偏低。我们假设"更频繁出席讲座的学生,平均而言在考试中表现更好"。我们希望通过激励出勤来验证这一假设。
一个好的问题列需要同时包含业务痛点(出勤率低)与可检验的假设(出勤与考试成绩正相关)。假设的存在意味着后续可以用统计手段验证,这正是课程第 4 课 概率与统计 中"相关性"分析的应用场景。
3.2 数据收集列:多种采集手段的取舍
示例给出两条并行的采集路径:
- 教室监控摄像头拍摄的照片:利用图像识别统计到场学生;
- 追踪学生手机在教室内的蓝牙/Wi-Fi 地址:通过设备 MAC 地址出现情况判断出勤。
同时指出考试成绩数据已存在于大学数据库中,无需重新采集——这是数据科学实践中非常关键的一点:先盘点已有数据资产,再决定新增采集量,避免重复建设。
课程正文 Where to get Data 一节系统列举了典型数据来源,可为该列提供更丰富的选项:IoT 传感器(如教室温湿度)、购买或访问网站后的问卷调查、用户行为分析、文本(情感分析、关键词提取)、图像/视频(如监控视频用于路况估计)、Web 服务器日志、社交网络图等。作答时数据来源越具体、越贴近业务,得分越高。
3.3 数据存储列:非结构化 → 结构化的转换
若采用监控摄像头图像,则需在课堂上保存少量(5–10 张)照片(非结构化数据),再用 AI 识别学生人脸(将数据转换为结构化形式)。
这一列揭示了三层含义:
- 存储量预估:5–10 张照片/课时,数量级很小,无需大数据架构即可处理;
- 数据类型判断:照片属于非结构化数据;课程正文 Types of Data 中给出的非结构化示例正是"监控摄像头的原始视频流";
- 结构化转换:原始照片无法直接参与统计分析,必须先用 AI(人脸识别)把"照片里有哪些人"提取成结构化记录(学生 ID × 时间 × 出勤标记),才能进入关系型数据库做聚合查询。
这正好呼应了课程正文数据旅程第 3 步"数据处理"的论述:面对文本、图像等非结构化数据,通常需要借助 AI 技术提取特征,将其转换为结构化形式。存储选型上,结构化出勤记录可放入关系型数据库(用 SQL 查询),而原始照片可存放在文件存储或数据湖中;课程 2-Working-With-Data 部分会系统讲解关系型数据库、NoSQL 与数据湖的取舍。
3.4 洞察与决策列:从统计检验到激励行动
我们可以计算每位学生的平均出勤数据,并检验其与考试成绩之间是否存在相关性(相关性将在概率与统计一节详述)。为激励出勤,可在学校门户发布每周出勤排行榜,并在出勤最高者中抽奖。
该列同样分两层:
- 洞察层:用描述性统计(平均出勤率)与相关性分析回答"出勤是否影响成绩"这一初始假设。课程第 4 课提供了完整的统计工具链——均值/方差/标准差、中位数与四分位数、箱线图、直方图、正态分布、置信区间等;其中"Real-world Data"一节用棒球运动员体重数据(data/SOCR_MLB.tsv)演示了如何按角色分组做箱线图并比较组间差异,这与按出勤分组比较成绩的思路完全同构。
- 决策层:给出可落地的激励动作——每周发布出勤排行榜、对最高出勤者抽奖。这正是课程反复强调的"可行动洞察":洞察只有转化为具体业务动作才有价值。
四、疫苗接种与生产力场景:思考路径示范
作业文档中"疫苗接种"与"生产力"两行留空,作为练习交由学习者填写。为帮助理解作答标准,下面基于课程正文的数据来源与存储章节,示范两套思考路径(均为示例性质,非仓库既定答案)。
4.1 疫苗接种场景
- 问题:疫情期间如何用数据管理疫苗的分发、接种与效果评估,例如确保优先人群覆盖、避免疫苗浪费、监控不良反应。
- 收集哪些数据:接种登记记录(接种人、时间、剂次、疫苗批次)、各区域人口结构与优先等级、疫苗库存与冷链运输数据(可由温度传感器等 IoT 设备产生)、接种后的不良反应报告、疫情流行数据(如仓库 data/COVID 下的时间序列确诊、死亡、康复数据)。
- 如何存储:接种与库存记录适合关系型数据库(结构化、需 SQL 聚合查询);不良反应的文本描述、疫苗批次照片等适合非结构化存储;若做全国范围覆盖分析,可能触及大数据规模,需要考虑数据湖与分布式存储方案。
- 洞察与决策:计算各区域/人群覆盖率,识别覆盖率偏低区域并定向调配疫苗;分析冷链温度异常与疫苗报废的关联;结合疫情数据评估接种对感染率/重症率的影响,据此调整接种优先级与宣传策略。
4.2 生产力场景
- 问题:如何用数据判断员工或个人的工作效率,并找到改进点。
- 收集哪些数据:工作日志与 Web 服务器/应用使用日志(可用于理解哪些任务耗时最长)、任务管理工具中的任务完成时间与周期、日历安排、会议时长与数量、可选的键盘/鼠标活动等行为数据;课程正文将"行为分析"与"Web 服务器日志"列为典型数据来源,正适用于此场景。
- 如何存储:日志数据通常是半结构化/非结构化且持续增长,适合先进入数据湖或 NoSQL 存储再做加工,加工后的统计指标入关系型数据库;需预估日志随时间增长带来的存储规模。
- 洞察与决策:识别时间黑洞(如过多低效会议)、对比不同工作方式下的产出差异,进而调整工作流程、优化任务分配、设定更合理的排期。
这两条示范路径均遵循"问题 → 数据来源 → 存储与规模 → 洞察与决策"的闭环,学习者在自填表格时可对照检查每一列是否都有具体、可执行的答案。
五、评分标准解读:Vorbildlich / Angemessen / Verbesserungswürdig
作业文档末尾的评分表(Bewertungskriterien)定义了三个等级:
| 等级 | 要求 |
|---|---|
| Vorbildlich(优秀) | 为所有问题领域识别出合理的数据来源、存储方法以及可能的决策/洞察 |
| Angemessen(合格) | 解决方案的某些方面不够详细、未讨论数据存储,但至少描述了 2 个问题领域 |
| Verbesserungswürdig(需改进) | 仅描述了部分数据解决方案,且只考虑 1 个问题领域 |
从中可以提炼出三个核心评分维度:覆盖广度(是否覆盖全部 3 个领域)、环节完整性(数据来源、存储、洞察/决策四问是否逐项回答,存储环节最容易缺失)、具体性(数据源与决策是否落地到可执行的细节)。对照此标准,作答时应优先保证三领域全覆盖、四问不缺项,再逐项打磨细节。
六、仓库配套资源:从作业到实战的延伸路径
本作业与仓库内以下资源形成完整学习闭环:
- 第 1 课正文 README.md:数据定义、数据科学范式(经验/理论/计算/数据驱动)、数据类型(结构化/半结构化/非结构化)、数据来源与五步数据旅程,是作答四问的理论基础;
- 文本挖掘挑战 notebook.ipynb:用
requests抓取维基百科文本、BeautifulSoup 解析 HTML、RAKE 关键词提取并生成词云,完整走了一遍"获取 → 转换 → 洞察"流程,可作为理解数据旅程每一步的可运行范例; - 概率与统计课 04-stats-and-probability:相关性、假设检验、均值/中位数/分位数、箱线图等工具,用于支撑作业中"检验假设、寻找相关性"的环节;
- 数据处理课 2-Working-With-Data 与可视化课 3-Data-Visualization:分别对应存储选型与洞察呈现环节的进阶知识;
- 示例数据 data/:如棒球运动员数据 SOCR_MLB.tsv、疫情时间序列 data/COVID/,可用来为自己的场景设计做简单验证。
七、实践建议与常见误区
- 误区一:只写"收集数据",不写存储。评分标准明确将"未讨论数据存储"作为降级项,存储与规模预估(第 3 问)是硬性要求,务必给出存储介质与数量级判断。
- 误区二:洞察与决策混为一谈。洞察是"从数据中发现了什么"(如出勤与成绩相关),决策是"据此采取什么行动"(如发布排行榜、抽奖激励),二者应分开表述并保持因果连贯。
- 误区三:数据来源假大空。优先选择可落地的采集手段(传感器、摄像头、系统日志、已有数据库),并像示例那样考虑"哪些数据已经存在、哪些需要新采集"。
- 建议一:先写假设再设计数据。把"问题列"写成可检验的假设,能让后续数据设计与统计检验有的放矢。
- 建议二:善用课程五步数据旅程自检。作答完成后,对照"获取 → 存储 → 处理 → 可视化/洞察 → 建模"核对是否有环节遗漏。
通过完成本作业,学习者将把数据科学从概念层面落到具体的业务设计层面——这正是 Data-Science-For-Beginners 课程"为所有人提供数据科学"(Data Science for All)的入门第一步。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考