分析数据集并交付报告
本页根据 OpenAI 官方
Codex use cases页面重新整理,核对时间为2026-03-30。这里保留原文的任务边界、推荐技能和工作流重点,但改写成更适合课程、工作坊和机构授课的中文版本。
官方原始定位
- 官方标题:
分析数据集并交付报告 - 官方难度:
Intermediate - 官方预估时长:
1h - 官方核心说明:用 Codex 清洗数据、连接多源文件、探索假设、建模并把结果包装成可复用的分析产物。
这节课最适合哪些人
- 起点是脏数据,终点是图表、备忘录、报告、仪表板的分析任务
- 想把清洗、连接、探索分析、可复用脚本串在一起的分析师
- 需要可审阅、可复跑产物,而不是一次性 notebook 状态的团队
课上应该带学员理解什么
- 数据分析不是为了“做完分析”,而是为了产生一个别人能据此行动的产物
- 官方特别强调可复现 workflow,而不是一次性 notebook 魔法
- 一个好的数据课题要先有具体问题,再谈 join、清洗和建模
官方强调的工作流
- 先定义一个足够具体的问题,不要让分析目标停留在“看看数据里有什么”
- 让 Codex 先解释数据文件、可能的 join key 和显而易见的数据质量问题
- 优先用脚本和保存下来的工件,而不是只在 notebook 里堆临时状态
- 沿着“导入与整理 -> 转换、可视化、建模 -> 沟通结果”的循环推进
课堂演示顺序
- 先给学员一个业务问题,让他们先说“最终要交什么”
- 再让 Codex 盘点数据、提出清洗计划和分析计划
- 挑一个图表或结论,追问它背后的 join 依据和口径风险
- 最后把结果收束成一页摘要或一份正式小报告,强调“交付物意识”
推荐技能与插件
- Spreadsheet:快速检查 CSV、TSV、Excel 的字段、公式和导出问题
- Jupyter Notebook:做探索式分析、实验和可讲解的过程展示
- Doc / PDF:把分析结果整理成领导、客户或合作方能直接看的正式交付物
课堂版起手提示词
text
我正在做一个数据分析项目,请把它整理成可复现的工作流。
目标:
- 回答一个明确业务问题,而不是泛泛看数据
开始时请先做这些事:
1. 读取 AGENTS.md,并说明推荐的 Python 环境
2. 加载我提供的数据文件
3. 解释每个文件包含什么、可能的 join key 是什么、有哪些明显质量问题
4. 提出从导入与整理到可视化、建模和报告输出的可复现流程
约束:
- 优先脚本和保存下来的工件,不要只依赖临时 notebook 状态
- 不要凭空编造缺失值或 merge key
- 最终输出 setup plan、data inventory、analysis plan 和第一批命令或文件课堂验收与交付物
- 一份数据盘点清单
- 一份清洗与分析流程说明
- 一份可复现脚本或 notebook
- 一份可分享的图表、备忘录或报告
讲师讲这节课时最容易踩的坑
- 这节课最容易讲浅的地方,是只展示图表,不解释字段和 join 风险
- 如果学员不是技术岗,更要把“为什么这个结论可信”讲出来
- 特别适合成人效率营和成人行业实战营