Skip to content

迭代攻克难题

本页根据 OpenAI 官方 Codex use cases 页面重新整理,核对时间为 2026-03-30。这里保留原文的任务边界、推荐技能和工作流重点,但改写成更适合课程、工作坊和机构授课的中文版本。

官方原始定位

  • 官方标题:迭代攻克难题
  • 官方难度:Advanced
  • 官方预估时长:Long-running
  • 官方核心说明:给 Codex 一个明确的评估系统,让它围绕得分、工件和日志持续改进一个困难任务。

这节课最适合哪些人

  • 每一轮都可以打分,但最佳结果需要多轮迭代的问题
  • 既有客观检查,也有主观或视觉判断的复杂任务
  • 希望把长期任务做成“可见进展”而不是只靠上下文堆叠的团队

课上应该带学员理解什么

  • 难题的关键不是第一版答案,而是“每一轮怎么判断更好了”
  • 官方建议一次只做一个 focused improvement,避免多变量混在一起
  • 让 Codex 记录得分和变更,是避免长任务失控的核心

官方强调的工作流

  1. 先读 AGENTS.md,找到评分脚本或验证命令
  2. 建立基线分数,不要一开始就大幅改动
  3. 每轮只做一个聚焦改进,改完立刻重新跑评估
  4. 记录分数、改动和产物,视觉输出则直接检查图片

课堂演示顺序

  1. 先给学员一个很难一次做对的问题,并要求他们先想“如何打分”
  2. 再让 Codex 做第一轮基线,实现之后马上评估
  3. 挑一项指标继续改,不允许一轮里同时改太多东西
  4. 最后把每轮得分、改动和结论串成一条清晰进展线

推荐技能与插件

  • AGENTS.md:明确迭代纪律、记录方式和必须执行的验证命令
  • Evals / scoring scripts:让每一轮都有可对比指标
  • view_image 或可视化检查:当产物不是纯文本时,把图像和工件也纳入评估

课堂版起手提示词

text
我希望你把这个困难任务当成一个“评估驱动的改进循环”来做。

在改任何东西之前:
1. 先读 AGENTS.md
2. 找出当前用于评分或验证的脚本 / 命令

迭代规则:
1. 一次只做一个 focused improvement
2. 每轮有意义的改动后都重新跑评估
3. 记录分数和本轮改了什么
4. 直接检查生成的工件;如果是视觉输出,请把图像也纳入检查
5. 当分数足够好时,再总结当前最佳方案

课堂验收与交付物

  • 一份基线得分与评估方法说明
  • 多轮改进日志
  • 一份当前最佳方案总结
  • 一套适合继续长期迭代的流程

讲师讲这节课时最容易踩的坑

  • 这节课的重点不是把难题做完,而是把“怎么持续改进”教会
  • 讲师要严格控制每轮只改一个核心点,否则课堂会失去对照性
  • 很适合高级开发、研究型项目和机构定制训练营

建议搭配本站这些内容

官方参考