Data Science for Beginners 第一课作业精解:如何用数据思维拆解真实业务场景(附示例答案与评估标准)
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
导读
本文完整拆解 Data-Science-For-Beginners 课程第 1 课(Defining Data Science)的配套作业 ——Data Science Scenarios(数据科学场景分析)。作业要求学习者针对不同问题领域,运用数据科学流程思考四个核心问题:收集什么数据、如何收集、如何存储、能得出哪些洞见与决策。本文将结合仓库中的示例答案、课程正文与配套源码,给出可直接照做的作答框架、教育场景的完整参考答案,以及评判标准解读,帮助初学者建立"从业务问题到数据方案"的完整思维链路。
作业背景:第一课的核心任务
本作业是课程第 1 课《Defining Data Science》的第二个任务(Task 2),对应课程目录中的 assignment.md,而 solution/assignment.md 是官方给出的参考答案(其孟加拉语翻译版位于 translations/bn/1-Introduction/01-defining-data-science/solution/assignment.md)。
作业的前提是学习者已掌握第 1 课正文中"数据旅程"(Data Journey)的五步框架,即:
- 数据获取(Data Acquisition)—— 收集数据;
- 数据存储(Data Storage)—— 决定如何存储,并预判未来的查询方式;
- 数据处理(Data Processing)—— 将原始数据转换为可用于可视化/建模的形式;
- 可视化与人工洞见(Visualization / Human Insights)—— 通过图表和统计手段发现关系、检验假设;
- 训练预测模型(Training a Predictive Model)—— 用机器学习构建可用于新数据预测的模型。
作业正是要求你把这套流程反向应用:先选定一个真实问题,再逐层推导出数据方案。
作业要求:围绕四个问题构建你的方案
作业原文要求针对每个问题领域,依次思考以下四个问题(这也是任何数据科学项目立项时都需要回答的四大问题):
- 可以收集哪些数据?(Which data can you collect?)
- 如何收集这些数据?(How would you collect it?)
- 如何存储数据?数据规模大概有多大?(How would you store the data? How large the data is likely to be?)
- 从这些数据中能获得哪些洞见?基于数据可以做出哪些决策?(Which insights you might be able to get from this data? Which decisions we would be able to take based on the data?)
作业要求尝试思考3 个不同的问题/流程,并为每个问题领域分别描述上述四点。官方给出了 3 个备选问题领域作为思考起点:
- 如何用数据改进学校中儿童的教育过程?
- 如何用数据在疫情期间控制疫苗接种?
- 如何用数据确保自己在工作中保持高效产出?
你可以用自己熟悉的问题领域替换这些建议题目,但数量上保持至少 3 个。
官方示例答案:教育场景全解析
官方答案以"教育"领域为例给出了一份完整填写,其思路值得逐格拆解学习。
| 问题领域 | 问题 | 收集哪些数据 | 如何存储数据 | 能得出哪些洞见/决策 |
|---|---|---|---|---|
| 教育 | 大学里讲座出勤率普遍偏低,我们假设"经常出席讲座的学生在考试中平均表现更好"。我们想激励出勤,并检验这个假设。 | 通过教室安全摄像头拍摄的照片,或追踪学生手机在教室内的蓝牙/Wi-Fi 地址来记录出勤;考试成绩数据已经存在于大学数据库中。 | 若使用安全摄像头照片——需要存储上课期间的几张(5–10 张)照片(非结构化数据),然后使用 AI 识别学生面部(将数据转换为结构化形式)。 | 计算每名学生的平均出勤数据,观察其与考试成绩之间是否存在相关性(相关性的详细讨论见概率与统计章节)。为激励出勤,可在学校门户上发布每周出勤率榜单,并在出勤率最高的学生中抽奖。 |
逐格拆解:示例答案中的思维过程
问题定义(Problem):示例把"出勤率低"定义为待改善的业务问题,同时提出了一个可检验的假设——"出勤与考试成绩正相关"。注意这里的关键词是"检验假设":数据科学不只是描述现状,还要用统计方法验证因果关系是否存在,这正是课程概率与统计章节(相关性、假设检验、置信区间)的用武之地。
数据收集(Which data / How to collect):示例给出了两条互补的数据源路线:
- 摄像头照片(非结构化数据,需后续用 AI 人脸识别转成结构化记录);
- 蓝牙/Wi-Fi 探针追踪学生手机地址(半自动的传感数据);
- 考试成绩则"已在大学数据库中",即复用既有数据,而非重新采集。
这体现了课程正文的观点:数据获取不一定都是从零开始,很多场景下关键数据已经存在于业务系统中。
数据存储(How to store):示例明确区分了非结构化数据(原始照片)与结构化数据(识别后的出勤记录),并指出存储决策与后续处理方式绑定。这与课程正文中关于存储方式的三种主流选择一一对应,可进一步展开为:
- 关系型数据库:以表(tables)和模式(schema)组织数据,用 SQL 查询。适合存储"学生 ID—出勤次数—考试成绩"这类强结构、强关系的记录;
- NoSQL 数据库:不强制模式,适合层级化的 JSON 文档或图数据。若出勤数据要携带大量上下文(如每张照片的元数据、人脸特征向量),这类数据库更灵活;
- 数据湖(Data Lake):用于海量原始非结构化数据的分布式存储,常配合 Parquet 格式与大数据的集群处理。若全校摄像头长期录制视频,原始数据就可能落入这一层。
关于规模估算(How large):示例的估算逻辑很务实——每节课只保存 5–10 张照片,而不是整段视频,从而把存储与算力成本控制在合理范围。作答时应给出类似的量级估计(如"每班每节课 10 张图 × 全校 100 个教室 × 每学期 30 节课"),体现成本意识。
洞见与决策(Insights / Decisions):示例给出了"观察型结论"(平均出勤率与成绩的相关性)与"行动型决策"(发布每周出勤榜单、对高出勤者抽奖激励)两个层次。这正对应课程正文强调的actionable insights(可行动的洞见):数据科学的价值终点是支撑实际业务决策,而非仅仅描述数据。
作业输出格式:按表格填写
作业要求按如下表格填写(列名与示例答案一致):
| 问题领域 | 问题 | 收集哪些数据 | 如何存储数据 | 能得出哪些洞见/决策 |
|---|---|---|---|---|
| 教育 | ... | ... | ... | ... |
| 疫苗接种 | ... | ... | ... | ... |
| 生产效率 | ... | ... | ... | ... |
填写时的进阶建议:
- 每个格子都应有具体细节:避免写"收集学生数据"这种空话,而要写明数据类型(结构化/非结构化)、采集手段(传感器/问卷/日志/摄像头)、粒度(每条记录代表什么)与频率;
- 存储要与查询方式联动:预判未来如何查询数据——是频繁按学生 ID 聚合(适合关系型),还是检索嵌套文档(适合 NoSQL),抑或对原始文件做批量分析(适合数据湖)——课程正文明确指出"决定如何存储数据时,预判未来的查询方式是有意义的";
- 洞见要区分"描述"与"决策":相关性分析、聚类等是"描述",而基于分析结果采取的运营动作(激励、排班、干预、营销)才是"决策"。
结合课程资源做纵深拓展:剩余两个领域的参考思路
作业要求你自行填写"疫苗接种"与"生产效率"两格,以下基于课程正文的数据来源与存储讨论,给出可直接取用的素材(非官方答案,仅供参考):
- 疫苗接种:可收集的数据包括每日接种剂数、各接种点排队时长、疫苗库存、接种者年龄段与地区分布(多为结构化数据,来自预约系统与库存数据库);若要监测副作用或冷链温度,则涉及 IoT 传感器时序数据。存储上,预约与库存适合关系型数据库,传感器流数据可先经缓冲端点(如 IoT Hub)汇入数据湖。洞见层面:可发现接种速度与供应量的匹配缺口、判断哪个地区/年龄段覆盖率偏低,从而决策疫苗分配优先级与增设接种点。
- 生产效率:可收集的数据包括任务完成时间、工作时段分布、会议数量与时长、产出指标(如代码提交数、工单关闭数),来源包括项目管理软件、日历与通信工具的日志;这些多为半结构化日志。存储上可按时间段做日志库或数仓。洞见层面:分析产出高峰时段、会议对连续工作时间的打断影响,据此决策调整会议安排、推行深度工作时段。
如需动手实践完整的数据处理链路(获取 → 转换 → 关键词提取 → 可视化),可运行第 1 课的 notebook.ipynb(含 solution/notebook.ipynb 对照版),它演示了用requests抓取文本、BeautifulSoup 清洗 HTML、RAKE 提取关键词、matplotlib/WordCloud 可视化的全过程,与作业中"从原始素材到结构化洞见"的思路完全同构。
评估标准(Rubric)解读
官方给出的三档评估标准,实质就是本次作业的自查清单:
| 优秀(Exemplary) | 合格(Adequate) | 需改进(Needs Improvement) |
|---|---|---|
| 对所有问题领域都能识别出合理的数据来源、存储方式以及可能的决策/洞见 | 方案的某些方面不够详细;未讨论数据存储;至少描述了 2 个问题领域 | 只描述了数据方案的零散部分;仅考虑了 1 个问题领域 |
对照自查要点:
- 覆盖数量:至少 3 个问题领域(合格线为 2 个);
- 数据来源合理性:每个领域的数据源是否具体、可获得、与问题强相关;
- 存储方案是否被讨论:这是最容易丢分的一格,务必说明存储介质(关系型/NoSQL/数据湖)并给出规模量级;
- 洞见与决策的完整性:既要能"看出什么",也要能"决定做什么"。
小结
本作业表面上是填一张表,实际上是在训练数据科学立项最核心的能力——把模糊的业务问题翻译成"数据可收集、可存储、可分析、可决策"的四步方案。官方示例(教育场景)完整展示了:提出可检验假设 → 设计非结构化/结构化混合的数据采集 → 根据处理方式选择存储 → 输出"相关性发现 + 激励决策"的双层洞见。配合课程正文的数据旅程框架、数据库与存储类型以及可视化章节,你可以把这张表格填得又快又完整。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考