Data Science for Beginners 第一课作业精解:如何用数据思维拆解真实业务场景(附示例答案与评估标准)
2026/9/23 4:28:20 网站建设 项目流程

Data Science for Beginners 第一课作业精解:如何用数据思维拆解真实业务场景(附示例答案与评估标准)

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

导读

本文完整拆解 Data-Science-For-Beginners 课程第 1 课(Defining Data Science)的配套作业 ——Data Science Scenarios(数据科学场景分析)。作业要求学习者针对不同问题领域,运用数据科学流程思考四个核心问题:收集什么数据、如何收集、如何存储、能得出哪些洞见与决策。本文将结合仓库中的示例答案、课程正文与配套源码,给出可直接照做的作答框架、教育场景的完整参考答案,以及评判标准解读,帮助初学者建立"从业务问题到数据方案"的完整思维链路。

作业背景:第一课的核心任务

本作业是课程第 1 课《Defining Data Science》的第二个任务(Task 2),对应课程目录中的 assignment.md,而 solution/assignment.md 是官方给出的参考答案(其孟加拉语翻译版位于 translations/bn/1-Introduction/01-defining-data-science/solution/assignment.md)。

作业的前提是学习者已掌握第 1 课正文中"数据旅程"(Data Journey)的五步框架,即:

  1. 数据获取(Data Acquisition)—— 收集数据;
  2. 数据存储(Data Storage)—— 决定如何存储,并预判未来的查询方式;
  3. 数据处理(Data Processing)—— 将原始数据转换为可用于可视化/建模的形式;
  4. 可视化与人工洞见(Visualization / Human Insights)—— 通过图表和统计手段发现关系、检验假设;
  5. 训练预测模型(Training a Predictive Model)—— 用机器学习构建可用于新数据预测的模型。

作业正是要求你把这套流程反向应用:先选定一个真实问题,再逐层推导出数据方案。

作业要求:围绕四个问题构建你的方案

作业原文要求针对每个问题领域,依次思考以下四个问题(这也是任何数据科学项目立项时都需要回答的四大问题):

  1. 可以收集哪些数据?(Which data can you collect?)
  2. 如何收集这些数据?(How would you collect it?)
  3. 如何存储数据?数据规模大概有多大?(How would you store the data? How large the data is likely to be?)
  4. 从这些数据中能获得哪些洞见?基于数据可以做出哪些决策?(Which insights you might be able to get from this data? Which decisions we would be able to take based on the data?)

作业要求尝试思考3 个不同的问题/流程,并为每个问题领域分别描述上述四点。官方给出了 3 个备选问题领域作为思考起点:

  • 如何用数据改进学校中儿童的教育过程?
  • 如何用数据在疫情期间控制疫苗接种?
  • 如何用数据确保自己在工作中保持高效产出?

你可以用自己熟悉的问题领域替换这些建议题目,但数量上保持至少 3 个。

官方示例答案:教育场景全解析

官方答案以"教育"领域为例给出了一份完整填写,其思路值得逐格拆解学习。

问题领域问题收集哪些数据如何存储数据能得出哪些洞见/决策
教育大学里讲座出勤率普遍偏低,我们假设"经常出席讲座的学生在考试中平均表现更好"。我们想激励出勤,并检验这个假设。通过教室安全摄像头拍摄的照片,或追踪学生手机在教室内的蓝牙/Wi-Fi 地址来记录出勤;考试成绩数据已经存在于大学数据库中。若使用安全摄像头照片——需要存储上课期间的几张(5–10 张)照片(非结构化数据),然后使用 AI 识别学生面部(将数据转换为结构化形式)。计算每名学生的平均出勤数据,观察其与考试成绩之间是否存在相关性(相关性的详细讨论见概率与统计章节)。为激励出勤,可在学校门户上发布每周出勤率榜单,并在出勤率最高的学生中抽奖。

逐格拆解:示例答案中的思维过程

问题定义(Problem):示例把"出勤率低"定义为待改善的业务问题,同时提出了一个可检验的假设——"出勤与考试成绩正相关"。注意这里的关键词是"检验假设":数据科学不只是描述现状,还要用统计方法验证因果关系是否存在,这正是课程概率与统计章节(相关性、假设检验、置信区间)的用武之地。

数据收集(Which data / How to collect):示例给出了两条互补的数据源路线:

  • 摄像头照片(非结构化数据,需后续用 AI 人脸识别转成结构化记录);
  • 蓝牙/Wi-Fi 探针追踪学生手机地址(半自动的传感数据);
  • 考试成绩则"已在大学数据库中",即复用既有数据,而非重新采集。

这体现了课程正文的观点:数据获取不一定都是从零开始,很多场景下关键数据已经存在于业务系统中。

数据存储(How to store):示例明确区分了非结构化数据(原始照片)与结构化数据(识别后的出勤记录),并指出存储决策与后续处理方式绑定。这与课程正文中关于存储方式的三种主流选择一一对应,可进一步展开为:

  • 关系型数据库:以表(tables)和模式(schema)组织数据,用 SQL 查询。适合存储"学生 ID—出勤次数—考试成绩"这类强结构、强关系的记录;
  • NoSQL 数据库:不强制模式,适合层级化的 JSON 文档或图数据。若出勤数据要携带大量上下文(如每张照片的元数据、人脸特征向量),这类数据库更灵活;
  • 数据湖(Data Lake):用于海量原始非结构化数据的分布式存储,常配合 Parquet 格式与大数据的集群处理。若全校摄像头长期录制视频,原始数据就可能落入这一层。

关于规模估算(How large):示例的估算逻辑很务实——每节课只保存 5–10 张照片,而不是整段视频,从而把存储与算力成本控制在合理范围。作答时应给出类似的量级估计(如"每班每节课 10 张图 × 全校 100 个教室 × 每学期 30 节课"),体现成本意识。

洞见与决策(Insights / Decisions):示例给出了"观察型结论"(平均出勤率与成绩的相关性)与"行动型决策"(发布每周出勤榜单、对高出勤者抽奖激励)两个层次。这正对应课程正文强调的actionable insights(可行动的洞见):数据科学的价值终点是支撑实际业务决策,而非仅仅描述数据。

作业输出格式:按表格填写

作业要求按如下表格填写(列名与示例答案一致):

问题领域问题收集哪些数据如何存储数据能得出哪些洞见/决策
教育............
疫苗接种............
生产效率............

填写时的进阶建议:

  • 每个格子都应有具体细节:避免写"收集学生数据"这种空话,而要写明数据类型(结构化/非结构化)、采集手段(传感器/问卷/日志/摄像头)、粒度(每条记录代表什么)与频率;
  • 存储要与查询方式联动:预判未来如何查询数据——是频繁按学生 ID 聚合(适合关系型),还是检索嵌套文档(适合 NoSQL),抑或对原始文件做批量分析(适合数据湖)——课程正文明确指出"决定如何存储数据时,预判未来的查询方式是有意义的";
  • 洞见要区分"描述"与"决策":相关性分析、聚类等是"描述",而基于分析结果采取的运营动作(激励、排班、干预、营销)才是"决策"。

结合课程资源做纵深拓展:剩余两个领域的参考思路

作业要求你自行填写"疫苗接种"与"生产效率"两格,以下基于课程正文的数据来源与存储讨论,给出可直接取用的素材(非官方答案,仅供参考):

  • 疫苗接种:可收集的数据包括每日接种剂数、各接种点排队时长、疫苗库存、接种者年龄段与地区分布(多为结构化数据,来自预约系统与库存数据库);若要监测副作用或冷链温度,则涉及 IoT 传感器时序数据。存储上,预约与库存适合关系型数据库,传感器流数据可先经缓冲端点(如 IoT Hub)汇入数据湖。洞见层面:可发现接种速度与供应量的匹配缺口、判断哪个地区/年龄段覆盖率偏低,从而决策疫苗分配优先级与增设接种点。
  • 生产效率:可收集的数据包括任务完成时间、工作时段分布、会议数量与时长、产出指标(如代码提交数、工单关闭数),来源包括项目管理软件、日历与通信工具的日志;这些多为半结构化日志。存储上可按时间段做日志库或数仓。洞见层面:分析产出高峰时段、会议对连续工作时间的打断影响,据此决策调整会议安排、推行深度工作时段。

如需动手实践完整的数据处理链路(获取 → 转换 → 关键词提取 → 可视化),可运行第 1 课的 notebook.ipynb(含 solution/notebook.ipynb 对照版),它演示了用requests抓取文本、BeautifulSoup 清洗 HTML、RAKE 提取关键词、matplotlib/WordCloud 可视化的全过程,与作业中"从原始素材到结构化洞见"的思路完全同构。

评估标准(Rubric)解读

官方给出的三档评估标准,实质就是本次作业的自查清单:

优秀(Exemplary)合格(Adequate)需改进(Needs Improvement)
对所有问题领域都能识别出合理的数据来源、存储方式以及可能的决策/洞见方案的某些方面不够详细;未讨论数据存储;至少描述了 2 个问题领域只描述了数据方案的零散部分;仅考虑了 1 个问题领域

对照自查要点:

  1. 覆盖数量:至少 3 个问题领域(合格线为 2 个);
  2. 数据来源合理性:每个领域的数据源是否具体、可获得、与问题强相关;
  3. 存储方案是否被讨论:这是最容易丢分的一格,务必说明存储介质(关系型/NoSQL/数据湖)并给出规模量级;
  4. 洞见与决策的完整性:既要能"看出什么",也要能"决定做什么"。

小结

本作业表面上是填一张表,实际上是在训练数据科学立项最核心的能力——把模糊的业务问题翻译成"数据可收集、可存储、可分析、可决策"的四步方案。官方示例(教育场景)完整展示了:提出可检验假设 → 设计非结构化/结构化混合的数据采集 → 根据处理方式选择存储 → 输出"相关性发现 + 激励决策"的双层洞见。配合课程正文的数据旅程框架、数据库与存储类型以及可视化章节,你可以把这张表格填得又快又完整。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询