Data-Science-For-Beginners 第 1 课配套作业解析:用“数据科学四问“拆解真实业务场景
2026/9/12 16:42:05 网站建设 项目流程

Data-Science-For-Beginners 第 1 课配套作业解析:用"数据科学四问"拆解真实业务场景

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

本篇技术指南以 Data-Science-For-Beginners 课程中第 1 课(定义数据科学)的德语译本作业文档 solution/assignment.md 为主体,系统讲解"数据科学场景分析"作业的作答框架、教育场景完整示例、疫苗接种与生产力场景的思考路径,并结合仓库内课程正文、配套 Notebook 与数据文件给出源码级佐证。读完本文,你将掌握一套可直接复用的四问分析方法(收集什么数据、如何收集、如何存储与规模预估、可得出什么洞察与决策),能够针对任意业务领域独立完成此类数据科学场景设计。

一、作业背景:本作业在课程中的定位

本作业是课程第 1 课 Defining Data Science 的两项课后任务之一(该课另一项任务是修改文本挖掘 Notebook,探索 Big Data 与 Machine Learning 的相关概念)。第 1 课的核心是建立数据科学的整体认知:数据科学是从结构化与非结构化数据中提取知识、产出可行动洞察(actionable insights)的科学领域,其完整流程可概括为五步"数据旅程":

  1. 数据获取(Data Acquisition):采集原始数据,必要时借助 IoT Hub 等缓冲端点;
  2. 数据存储(Data Storage):根据未来查询方式选择关系型数据库、NoSQL 数据库或数据湖(Data Lake);
  3. 数据处理(Data Processing):将原始数据转换为可用于可视化与模型训练的形式,例如用 AI 技术从非结构化数据中提取特征;
  4. 可视化 / 人工洞察(Visualization / Human Insights):借助多种可视化手段与统计方法验证假设、发现相关性;
  5. 训练预测模型(Training a Predictive Model):在需要做出数据驱动决策时,用机器学习构建预测模型。

本作业正是要求学习者把上述流程反向应用到真实业务问题上:给定一个现实过程或问题,回答"数据从哪来、怎么存、能得出什么结论"。它检验的是学习者是否真正理解数据科学"数据 → 洞察 → 决策"的闭环,而非仅仅记住概念定义。

二、作答框架:数据科学四问

作业要求对每个问题领域依次思考以下四个问题(原文见 德语作业文档):

序号核心问题对应数据旅程环节
1可以收集哪些数据(Welche Daten können Sie sammeln?)数据获取
2如何收集这些数据(Wie würden Sie diese Daten sammeln?)数据获取 / 数据处理
3如何存储数据,数据规模预计多大(Wie würden Sie die Daten speichern? Wie groß werden die Daten voraussichtlich sein?)数据存储
4能从数据中获得哪些洞察,可据此做出哪些决策(Welche Erkenntnisse könnten Sie aus diesen Daten gewinnen? Welche Entscheidungen könnten wir auf Basis der Daten treffen?)可视化 / 洞察 / 决策

要求是"对 3 个不同的问题/过程,逐项描述上述每一点",并将结果填入五列表格:

Problembereich(问题领域)Problem(问题)Welche Daten sammeln(收集哪些数据)Wie die Daten speichern(如何存储)Welche Erkenntnisse/Entscheidungen(可得的洞察/决策)

作业文档给出了三个建议领域:教育(如何用数据改进学校儿童的教育过程)、疫苗接种(如何用数据在疫情期间管理疫苗接种)、生产力(如何用数据保证工作效率)。作答时可用自己的领域替换建议领域。

三、教育场景完整示例:逐列拆解参考解答

作业文档为"教育"领域提供了一行完整的示例答案(也是唯一一行),目的是让学习者理解每列应填什么。下面按列拆解其设计逻辑。

3.1 问题列:提出可检验的假设

在大学中,讲座出勤率通常偏低。我们假设"更频繁出席讲座的学生,平均而言在考试中表现更好"。我们希望通过激励出勤来验证这一假设。

一个好的问题列需要同时包含业务痛点(出勤率低)与可检验的假设(出勤与考试成绩正相关)。假设的存在意味着后续可以用统计手段验证,这正是课程第 4 课 概率与统计 中"相关性"分析的应用场景。

3.2 数据收集列:多种采集手段的取舍

示例给出两条并行的采集路径:

  • 教室监控摄像头拍摄的照片:利用图像识别统计到场学生;
  • 追踪学生手机在教室内的蓝牙/Wi-Fi 地址:通过设备 MAC 地址出现情况判断出勤。

同时指出考试成绩数据已存在于大学数据库中,无需重新采集——这是数据科学实践中非常关键的一点:先盘点已有数据资产,再决定新增采集量,避免重复建设。

课程正文 Where to get Data 一节系统列举了典型数据来源,可为该列提供更丰富的选项:IoT 传感器(如教室温湿度)、购买或访问网站后的问卷调查、用户行为分析、文本(情感分析、关键词提取)、图像/视频(如监控视频用于路况估计)、Web 服务器日志、社交网络图等。作答时数据来源越具体、越贴近业务,得分越高。

3.3 数据存储列:非结构化 → 结构化的转换

若采用监控摄像头图像,则需在课堂上保存少量(5–10 张)照片(非结构化数据),再用 AI 识别学生人脸(将数据转换为结构化形式)。

这一列揭示了三层含义:

  1. 存储量预估:5–10 张照片/课时,数量级很小,无需大数据架构即可处理;
  2. 数据类型判断:照片属于非结构化数据;课程正文 Types of Data 中给出的非结构化示例正是"监控摄像头的原始视频流";
  3. 结构化转换:原始照片无法直接参与统计分析,必须先用 AI(人脸识别)把"照片里有哪些人"提取成结构化记录(学生 ID × 时间 × 出勤标记),才能进入关系型数据库做聚合查询。

这正好呼应了课程正文数据旅程第 3 步"数据处理"的论述:面对文本、图像等非结构化数据,通常需要借助 AI 技术提取特征,将其转换为结构化形式。存储选型上,结构化出勤记录可放入关系型数据库(用 SQL 查询),而原始照片可存放在文件存储或数据湖中;课程 2-Working-With-Data 部分会系统讲解关系型数据库、NoSQL 与数据湖的取舍。

3.4 洞察与决策列:从统计检验到激励行动

我们可以计算每位学生的平均出勤数据,并检验其与考试成绩之间是否存在相关性(相关性将在概率与统计一节详述)。为激励出勤,可在学校门户发布每周出勤排行榜,并在出勤最高者中抽奖。

该列同样分两层:

  • 洞察层:用描述性统计(平均出勤率)与相关性分析回答"出勤是否影响成绩"这一初始假设。课程第 4 课提供了完整的统计工具链——均值/方差/标准差、中位数与四分位数、箱线图、直方图、正态分布、置信区间等;其中"Real-world Data"一节用棒球运动员体重数据(data/SOCR_MLB.tsv)演示了如何按角色分组做箱线图并比较组间差异,这与按出勤分组比较成绩的思路完全同构。
  • 决策层:给出可落地的激励动作——每周发布出勤排行榜、对最高出勤者抽奖。这正是课程反复强调的"可行动洞察":洞察只有转化为具体业务动作才有价值。

四、疫苗接种与生产力场景:思考路径示范

作业文档中"疫苗接种"与"生产力"两行留空,作为练习交由学习者填写。为帮助理解作答标准,下面基于课程正文的数据来源与存储章节,示范两套思考路径(均为示例性质,非仓库既定答案)。

4.1 疫苗接种场景

  • 问题:疫情期间如何用数据管理疫苗的分发、接种与效果评估,例如确保优先人群覆盖、避免疫苗浪费、监控不良反应。
  • 收集哪些数据:接种登记记录(接种人、时间、剂次、疫苗批次)、各区域人口结构与优先等级、疫苗库存与冷链运输数据(可由温度传感器等 IoT 设备产生)、接种后的不良反应报告、疫情流行数据(如仓库 data/COVID 下的时间序列确诊、死亡、康复数据)。
  • 如何存储:接种与库存记录适合关系型数据库(结构化、需 SQL 聚合查询);不良反应的文本描述、疫苗批次照片等适合非结构化存储;若做全国范围覆盖分析,可能触及大数据规模,需要考虑数据湖与分布式存储方案。
  • 洞察与决策:计算各区域/人群覆盖率,识别覆盖率偏低区域并定向调配疫苗;分析冷链温度异常与疫苗报废的关联;结合疫情数据评估接种对感染率/重症率的影响,据此调整接种优先级与宣传策略。

4.2 生产力场景

  • 问题:如何用数据判断员工或个人的工作效率,并找到改进点。
  • 收集哪些数据:工作日志与 Web 服务器/应用使用日志(可用于理解哪些任务耗时最长)、任务管理工具中的任务完成时间与周期、日历安排、会议时长与数量、可选的键盘/鼠标活动等行为数据;课程正文将"行为分析"与"Web 服务器日志"列为典型数据来源,正适用于此场景。
  • 如何存储:日志数据通常是半结构化/非结构化且持续增长,适合先进入数据湖或 NoSQL 存储再做加工,加工后的统计指标入关系型数据库;需预估日志随时间增长带来的存储规模。
  • 洞察与决策:识别时间黑洞(如过多低效会议)、对比不同工作方式下的产出差异,进而调整工作流程、优化任务分配、设定更合理的排期。

这两条示范路径均遵循"问题 → 数据来源 → 存储与规模 → 洞察与决策"的闭环,学习者在自填表格时可对照检查每一列是否都有具体、可执行的答案。

五、评分标准解读:Vorbildlich / Angemessen / Verbesserungswürdig

作业文档末尾的评分表(Bewertungskriterien)定义了三个等级:

等级要求
Vorbildlich(优秀)为所有问题领域识别出合理的数据来源、存储方法以及可能的决策/洞察
Angemessen(合格)解决方案的某些方面不够详细、未讨论数据存储,但至少描述了 2 个问题领域
Verbesserungswürdig(需改进)仅描述了部分数据解决方案,且只考虑 1 个问题领域

从中可以提炼出三个核心评分维度:覆盖广度(是否覆盖全部 3 个领域)、环节完整性(数据来源、存储、洞察/决策四问是否逐项回答,存储环节最容易缺失)、具体性(数据源与决策是否落地到可执行的细节)。对照此标准,作答时应优先保证三领域全覆盖、四问不缺项,再逐项打磨细节。

六、仓库配套资源:从作业到实战的延伸路径

本作业与仓库内以下资源形成完整学习闭环:

  • 第 1 课正文 README.md:数据定义、数据科学范式(经验/理论/计算/数据驱动)、数据类型(结构化/半结构化/非结构化)、数据来源与五步数据旅程,是作答四问的理论基础;
  • 文本挖掘挑战 notebook.ipynb:用requests抓取维基百科文本、BeautifulSoup 解析 HTML、RAKE 关键词提取并生成词云,完整走了一遍"获取 → 转换 → 洞察"流程,可作为理解数据旅程每一步的可运行范例;
  • 概率与统计课 04-stats-and-probability:相关性、假设检验、均值/中位数/分位数、箱线图等工具,用于支撑作业中"检验假设、寻找相关性"的环节;
  • 数据处理课 2-Working-With-Data 与可视化课 3-Data-Visualization:分别对应存储选型与洞察呈现环节的进阶知识;
  • 示例数据 data/:如棒球运动员数据 SOCR_MLB.tsv、疫情时间序列 data/COVID/,可用来为自己的场景设计做简单验证。

七、实践建议与常见误区

  • 误区一:只写"收集数据",不写存储。评分标准明确将"未讨论数据存储"作为降级项,存储与规模预估(第 3 问)是硬性要求,务必给出存储介质与数量级判断。
  • 误区二:洞察与决策混为一谈。洞察是"从数据中发现了什么"(如出勤与成绩相关),决策是"据此采取什么行动"(如发布排行榜、抽奖激励),二者应分开表述并保持因果连贯。
  • 误区三:数据来源假大空。优先选择可落地的采集手段(传感器、摄像头、系统日志、已有数据库),并像示例那样考虑"哪些数据已经存在、哪些需要新采集"。
  • 建议一:先写假设再设计数据。把"问题列"写成可检验的假设,能让后续数据设计与统计检验有的放矢。
  • 建议二:善用课程五步数据旅程自检。作答完成后,对照"获取 → 存储 → 处理 → 可视化/洞察 → 建模"核对是否有环节遗漏。

通过完成本作业,学习者将把数据科学从概念层面落到具体的业务设计层面——这正是 Data-Science-For-Beginners 课程"为所有人提供数据科学"(Data Science for All)的入门第一步。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询