迭代攻克难题
本页根据 OpenAI 官方
Codex use cases页面重新整理,核对时间为2026-03-30。这里保留原文的任务边界、推荐技能和工作流重点,但改写成更适合课程、工作坊和机构授课的中文版本。
官方原始定位
- 官方标题:
迭代攻克难题 - 官方难度:
Advanced - 官方预估时长:
Long-running - 官方核心说明:给 Codex 一个明确的评估系统,让它围绕得分、工件和日志持续改进一个困难任务。
这节课最适合哪些人
- 每一轮都可以打分,但最佳结果需要多轮迭代的问题
- 既有客观检查,也有主观或视觉判断的复杂任务
- 希望把长期任务做成“可见进展”而不是只靠上下文堆叠的团队
课上应该带学员理解什么
- 难题的关键不是第一版答案,而是“每一轮怎么判断更好了”
- 官方建议一次只做一个 focused improvement,避免多变量混在一起
- 让 Codex 记录得分和变更,是避免长任务失控的核心
官方强调的工作流
- 先读
AGENTS.md,找到评分脚本或验证命令 - 建立基线分数,不要一开始就大幅改动
- 每轮只做一个聚焦改进,改完立刻重新跑评估
- 记录分数、改动和产物,视觉输出则直接检查图片
课堂演示顺序
- 先给学员一个很难一次做对的问题,并要求他们先想“如何打分”
- 再让 Codex 做第一轮基线,实现之后马上评估
- 挑一项指标继续改,不允许一轮里同时改太多东西
- 最后把每轮得分、改动和结论串成一条清晰进展线
推荐技能与插件
- AGENTS.md:明确迭代纪律、记录方式和必须执行的验证命令
- Evals / scoring scripts:让每一轮都有可对比指标
- view_image 或可视化检查:当产物不是纯文本时,把图像和工件也纳入评估
课堂版起手提示词
text
我希望你把这个困难任务当成一个“评估驱动的改进循环”来做。
在改任何东西之前:
1. 先读 AGENTS.md
2. 找出当前用于评分或验证的脚本 / 命令
迭代规则:
1. 一次只做一个 focused improvement
2. 每轮有意义的改动后都重新跑评估
3. 记录分数和本轮改了什么
4. 直接检查生成的工件;如果是视觉输出,请把图像也纳入检查
5. 当分数足够好时,再总结当前最佳方案课堂验收与交付物
- 一份基线得分与评估方法说明
- 多轮改进日志
- 一份当前最佳方案总结
- 一套适合继续长期迭代的流程
讲师讲这节课时最容易踩的坑
- 这节课的重点不是把难题做完,而是把“怎么持续改进”教会
- 讲师要严格控制每轮只改一个核心点,否则课堂会失去对照性
- 很适合高级开发、研究型项目和机构定制训练营