
Data Science for Beginners 第一课作业全解用数据科学过程设计真实场景方案【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本文围绕 Data-Science-For-Beginners 课程第一课《Defining Data Science》的配套作业作业参考答案展开系统讲解如何运用数据科学过程去分析真实业务问题从该收集什么数据到如何收集、如何存储、最终能得到什么洞察与决策的四问框架。读完本文你将掌握一套可直接复用的场景设计方法论并了解课程给出的教育场景完整示例答案与三档评分标准为后续的概率统计、数据准备与可视化课程打下实践基础。作业背景从数据科学定义到实战练习在 1-Introduction/01-defining-data-science/README.md 中课程将数据科学定义为用科学方法从结构化与非结构化数据中提取知识并将可执行的洞察应用到广泛业务领域的学科其核心数据旅程包含五个步骤数据获取Data Acquisition——从传感器、问卷、行为分析、文本、图像、日志等来源采集数据数据存储Data Storage——在关系数据库、NoSQL 或 Data Lake 中组织数据数据处理Data Processing——把原始数据转换为可用于可视化与建模的形式例如用 AI 从非结构化数据中提取特征可视化 / 人类洞察Visualization / Human Insights——通过图表与统计方法发现关系、检验假设训练预测模型Training a Predictive Model——基于数据构建可对新数据做出预测的模型。本作业正是要求学习者把这一过程反向应用给定一个真实问题先设计数据方案再推演洞察与决策。作业原文英文版与捷克语翻译版要求你思考不同问题领域中的真实流程或问题并回答四个固定问题。核心方法论设计数据科学场景的四问框架作业要求围绕任意真实流程/问题依次回答以下四个问题这是整个场景设计的骨架#思考维度核心关注点1可以收集哪些数据Which data can you collect?识别与问题相关、可观测、可获取的数据信号2如何收集How would you collect it?明确采集手段传感器、摄像头、日志、问卷、数据库抽取等3如何存储数据规模大概多大How to store? How large is the data likely to be?判断数据是结构化、半结构化还是非结构化选择存储方案并预估量级4能从数据中得到哪些洞察基于数据能做哪些决策Which insights/decisions?由数据推演可验证的结论以及由此触发的业务动作这四个问题恰好映射课程 README 中数据旅程的前四个环节获取→存储→处理→可视化/洞察并将第五个环节模型训练隐含在洞察与决策之中——当数据规模与复杂度上升时就可以引入机器学习构建预测模型。作业建议你至少思考3 个不同的问题领域并为每个领域逐一回答上述四个问题。课程给出了三个可选的起步领域如何用数据改进学校中儿童的教育过程如何用数据在大流行期间管控疫苗接种如何用数据确保自己工作中的生产力你可以用自己感兴趣的问题领域替换这三个建议方向。教育场景完整示例答案拆解课程在作业中提供了一条完整示例答案表格形式用于示范合格答案应该长什么样。以**教育Education**领域为例维度示例答案内容问题大学课堂上通常出勤率较低且存在一个假设参加课堂讲授的学生在考试中的平均表现更好。目标是通过数据验证该假设并激励出勤。收集哪些数据通过教室安防摄像头拍摄的照片跟踪出勤或跟踪学生在教室中的手机蓝牙/Wi-Fi 地址考试成绩数据已存在于大学数据库中。如何存储数据若采用安防摄像头方案课堂期间需存储少量5-10 张照片非结构化数据随后用 AI 识别学生人脸将数据转换为结构化形式。洞察与决策计算每个学生的平均出勤数据检验其与考试成绩之间是否存在相关性为激励出勤可在学校门户发布每周出勤排名并在出勤率最高的学生中抽奖。这个示例有三个值得注意的技术要点非结构化 → 结构化的转化摄像头照片属于非结构化数据必须经过 AI 人脸识别转换成结构化记录学生 ID、日期、是否出席才能进入后续统计分析。这与课程 1-Introduction/01-defining-data-science/README.md 中数据处理步骤的描述一致面对文本、图像等非结构化数据时需要使用 AI 技术提取特征从而转为结构化形式。混合数据源答案同时利用了新采集的数据出勤照片与既有数据大学数据库中的考试成绩这是真实数据项目中非常常见的组合方式。从相关性到决策闭环答案不只是算出相关性还设计了后续业务动作公布排名、抽奖激励完整走通了洞察 → 决策的闭环。作业原文还特别提示相关性correlation这一概念会在后续课程 1-Introduction/04-stats-and-probability/README.md 的概率与统计章节中详细讨论——那里会讲解协方差、相关系数、置信区间与假设检验如 Student t-test正好是验证出勤与成绩相关这一假设的统计工具。作业表格中**疫苗接种Vaccination与生产力Productivity**两行留空留给学习者自行完成。以同样的框架可以这样推演仅作思路示范非课程原文内容疫苗接种场景可收集接种登记记录、各地区的接种覆盖率与确诊/住院数据结构化存于关系数据库用以发现接种率与感染率的关系并指导疫苗分配决策生产力场景可收集任务完成时间、会议时长、干扰事件日志等结构化/半结构化用以识别低效时段并调整工作安排。结合仓库数据资产的进阶练习本作业的最佳进阶方式是拿着四问框架去看真实数据。仓库 data 目录中提供了多个可直接用于练习的数据集例如data/emails.csv——可用于垃圾邮件分类、文本挖掘场景data/taxi.csv——可用于出行行为分析、时间序列场景data/birds.csv 与 data/honey.csv——可用于物种特征分析与农业产量场景data/diabetes.tsv 与 data/mushrooms.csv——可用于医疗与分类预测场景。选一个数据集回答它是结构化还是非结构化数据存储在什么数据库/格式中最合适能回答哪些问题、支撑哪些决策即可把作业中的抽象设计落实到具体数据上。同时第一课的 notebook.ipynb 展示了完整的文本挖掘流程用requests抓取维基百科页面、用 BeautifulSoup 清洗 HTML、用nlp_rake提取关键词solution 目录下的 notebook 还演示了针对 Machine Learning 词条的进阶清洗方法——这是数据获取与处理环节最直观的代码级参考。评分标准如何交付一份高质量答案作业最后给出了明确的评分标准Rubric共三档等级要求优秀Exemplary对所有问题领域都识别出合理的数据来源、数据存储方式以及可能的决策/洞察合格Adequate部分解决细节不足、未讨论数据存储但至少描述了2 个问题领域需改进Needs Improvement只描述了数据解决方案的部分内容且只考虑了1 个问题领域从评分标准可以提炼出三条实战要点覆盖面尽量完成全部 3 个领域这是拿到优秀的前提存储环节不可省略评分标准明确将未讨论数据存储列为降档条件回答第三个问题如何存储、数据规模多大是区分合格与优秀答案的关键每个领域都要形成闭环数据来源、存储方式、洞察/决策三要素缺一不可且要与问题本身对应。总结本作业是 Data-Science-For-Beginners 课程的第一项实战任务其本质是用数据获取 → 数据存储 → 数据处理 → 可视化/洞察 → 决策的数据科学过程为一个真实问题设计端到端的数据方案。掌握四问框架收集什么、如何收集、如何存储、得到什么洞察与决策参考教育场景的完整示例答案再结合仓库中的真实数据集与 notebook 代码进行练习你就能写出达到优秀标准的场景设计。后续课程 2-Working-With-Data/README.md关系数据库与非关系数据库、3-Data-Visualization/README.md可视化与 1-Introduction/04-stats-and-probability/README.md概率统计与相关性检验将分别深化本作业涉及的存储、洞察与假设验证能力。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考