RSI 日:OpenAI 自称达到自动研究实习生,人均 Agent 日花费冲到 600 美元

· Simon Willison · 日刊 2026-09-07 · 来源 ↗

Simon 读 OpenAI 内部研究加速报告:中位研究员日烧超 600 美元推理;7 月底花费陡升,他猜是内部先用上了后来发布的 GPT-6 Astra。

结论

OpenAI 把 9 月 6 日当成 RSI 日Recursive Self-Improvement,递归自我改进:系统用自己的产出再改进自己)。Simon Willison 读完内部报告 Research acceleration: The view inside OpenAI,第一反应是:文中连 RSI 缩写都不展开,同时挂出首席科学家 Jakub Pachocki 的另一篇 An Alien Mind。他真正截下来的是一张图:编码 Agent 正在改写研究员的日常——中位花费从年初接近零,爬到 8 月中超过 每天 600 美元(按 API 牌价计推理)。对工程师,这篇短评的用法是:把官方自报的「自动研究实习生」当进度声明,把花费曲线当校准样本,去对照自己团队的日账单、并发 Agent 数,以及人还该抓住哪些环节。

要点

  • 「自动研究实习生」是 OpenAI 自己定的里程碑,不是第三方认证。 官方说已达到去年秋天宣布的目标:系统能在人的指导下完成定义清楚的研究任务,包括熟练研究员要花几天的那种。下一步是 2028 年 3 月的「自动 AI 研究员」。人仍决定研究方向、哪些结果值得跟、何时扩规模/暂停/上线——自动化的是执行,不是选题权。

  • 花费曲线比口号更具体。 按 Agent 用量排名,2026 年初中位研究员几乎不怎么用编码 Agent;到 8 月中,中位已是每天 >$600 推理,研究组织里 90 分位超过 $7000/天。Simon 贴出的图:纵轴是「Daily $ / researcher」,2 月贴地、4 月约 50、6 月约 150,7 月中旬仍在 150–165 平台,然后陡升到约 600

  • 7 月底那一跳,Simon 猜是内部先用上了后来发布的 GPT-6 Astra。 这是他的判断,不是 OpenAI 原文写明的。对你有用的读法:新模型一旦进内部工具链,账单形状会突然变,不要用「上季度均值」去估本周额度。

  • Agent 工时已经超过人。 以标准 8 小时工作日计,6 月之前研究组织的 Agent 总运行时间还低于人类劳动;到 8 月中变成每 1 个人类工作日对应 3.1 个 Agent 工作日。同时,同时开 4 个及以上 Agent(含下游子 Agent)的人数在涨——工作方式从「开一个窗口盯着」变成「编排一小队」。

  • Agent 接的活在变,但高层规划仍几乎不交出去。 OpenAI 用 Epoch AI 的研发六阶段(决定做什么、设计、构建代码/数据、跑实验、分析、沟通)给 token 分类:从 1 月到 8 月每一类都在涨,最大头仍是写研究与基础设施代码;增长更显眼的是技术排障监控正在跑的实验。内部求助频道的顶层帖在减少,有的团队连排障 office hours 都停了。但「决定做什么」在 Agent 产出里仍是很小一块。

  • 更长的任务仍要人中途转向。 官方用「人类需要多久」当难度代理:成功率 1 月到 7 月整体上升,但过去半年里,成功的 4–8 小时任务超过一半至少被人工干预过一次。Agent 工时 3.1 倍 ≠ 无人值守。

怎么做

  1. 先对照官方图,再读自己的账单。 打开 Simon 的摘录和 OpenAI 原文,看清「Daily $ / researcher」的拐点。然后在你们的 Cursor / Codex / 内部 Agent 控制台拉同样两列:人均日花费同时活跃会话数。没有这两列,就无法判断「我们是不是已经过了 6 月那种平台期」。

  2. 按阶段分活,不要把整条研究/交付链丢给同一个 Agent。 学六阶段的切法:选题、优先级、要不要扩规模——人拍板;写脚手架、修基础设施、盯训练/评测是否挂掉——交给并发 Agent。提示里写清验收标准(日志关键字、评测分数、PR 必须带测试),避免「帮我推进一下」这种无法判定成败的句子。

  3. 默认按「小队」编排,而不是单窗口深聊。 能拆的任务拆成 3–5 个并行会话(调研、实现、复现、写评测),自己只做调度和抽查。超过这个数就要有工单/会话标题,否则你会忘了哪个 Agent 卡在哪——OpenAI 自己后来也遇到「人变成 Agent 监工」的瓶颈。

  4. 4 小时以上的任务预留转向,不要假设一次跑完。 中途看中间产物(diff、曲线、失败日志),用短指令纠偏。统计「成功但被干预过」的比例;若接近官方那条「一半以上」,说明你的 harness(工具、权限、状态回传)还不够,该补的是环境,不是再加一句「一定要做对」。

  5. 新模型内测期单独记账,并准备算力改道。 若团队突然用上更强模型(Simon 对 Astra 的猜测就是这种事件),把账单告警阈值按「平台期 × 3~4」重设一周。同时记住:OpenAI 在 7 月 20 日因 Agent 碰到研究基础设施、8 月 7 日因 Astra 可能触及 Preparedness 的 Critical 网络能力,都收紧过训练环境——花费上升和安全刹车会同时出现,备用模型路由要比「全员绑死一个新旗舰」更稳。

关键图表

OpenAI 报告:中位研究员每日 Agent 推理花费从年初接近零爬到 8 月约 600 美元

Simon 截下的官方图:7 月中旬仍在约 150 美元平台,随后陡升——他猜测拐点对应内部用上后来发布的 GPT-6 Astra(图源:Simon Willison / OpenAI)