AIHub

OpenAI 官宣「自动化研究实习生」上线:1 个人类工作日配 3.1 个 Agent 工作日,普通人怎么复刻这套多 Agent 工作流

进阶约 13 分钟读完2026-09-08#OpenAI#AI Agent#多智能体#自动化研究#工作流
OpenAI 官宣「自动化研究实习生」上线:1 个人类工作日配 3.1 个 Agent 工作日,普通人怎么复刻这套多 Agent 工作流

2026 年 9 月 6 日,OpenAI 在官方博客发布《Research acceleration: The view inside OpenAI》,宣布达成它去年秋天公开定下的一个里程碑:到 2026 年 9 月,做出一个「自动化研究实习生」——能在人类指挥下完成定义清晰的研究任务,包括那些熟练研究员需要花几天才能做完的工作。

文章里的几个数字比宣言本身更有信息量:

  • 3.1:1 —— 到今年 8 月中旬,OpenAI 研究团队的 Agent 总运行时长已经达到人类劳动的 3.1 倍(按标准 8 小时工作日折算),而 6 月之前这个比例还不到 1;
  • 每天 600 美元 —— 按 Agent 使用量排序的中位研究员,每天已经离不开编程 Agent,按 API 定价折算每天消耗超过 600 美元的推理量,90 分位用户超过 7000 美元;
  • 8 月人均实验数创历史新高(OpenAI 从 2025 年 1 月开始追踪这项指标),4 个以上 Agent 并发的工作流正在变多;
  • 超过一半的成功任务需要人工介入 —— 最近半年里,4-8 小时量级的成功任务中,一半以上包含至少一次人工干预。

OpenAI 自己也泼了冷水:AI 研究有很多瓶颈,整体进步速度不会跟上这些指标的增长;要在 2028 年 3 月前实现「完全自动化 AI 研究员」,卡在 alignment 和监控上,不只是能力问题。它还披露,7 月 Hugging Face 事件之后,已暂停对计划部署模型的强化学习训练,转而加固研究环境。

对普通开发者和小团队来说,这条新闻的价值不在 OpenAI 内部发生了什么,而在于它公开了一套可复制的方法论。这篇文章把这套方法论翻译成你能落地的四个动作。

一、先抄方法:六阶段任务分类法

OpenAI 在文中用 Epoch AI 的六阶段分类法给研究工作归类:Decide(决定做什么)、Design(设计方案)、Build(实现)、Run(跑实验)、Analyze(分析结果)、Communicate(沟通结论)。这是整个自动化体系的根基——只有先分类,才知道哪些阶段可以放心交给 Agent,哪些必须人来。

映射到日常研发工作,大致是这张表:

阶段 典型任务 适合交给 Agent 的程度
Decide 定方向、排优先级 ❌ 人来,Agent 只能提供信息
Design 架构选型、实验设计 ⚠️ Agent 出草案,人拍板
Build 写代码、搭环境、写脚本 ✅ Agent 主场
Run 跑实验、跑测试、批量执行 ✅ Agent 主场,注意资源隔离
Analyze 读日志、做对比、找异常 ⚠️ Agent 初筛,人复核关键结论
Communicate 写报告、对齐结论 ⚠️ Agent 起草,人把关事实

实操动作:把你这周的任务清单拿出来,逐条打上六阶段标签。你会发现真正卡住你的往往不是 Build 和 Run,而是 Decide 和 Design——那恰恰是最不该外包给 Agent 的部分。

二、并行 Agent 编排:一人带一个「实习小组」

OpenAI 的数据里「4 个以上 Agent 并发工作流在增多」是最值得注意的趋势。个人复刻这一步,核心是用 git worktree 做环境隔离,让每个 Agent 在独立工作区干活,互不踩踏:

# 主仓库保持不变,为每个任务开独立 worktree
git worktree add ../exp-lr-sweep feature/lr-sweep
git worktree add ../exp-data-clean feature/data-clean
git worktree add ../exp-baseline feature/baseline-repro

# 每个 worktree 里起一个 Agent 会话(以终端类编程 Agent 为例)
cd ../exp-lr-sweep   && claude  # 任务 A:学习率扫描
cd ../exp-data-clean && claude  # 任务 B:数据清洗管线
cd ../exp-baseline   && claude  # 任务 C:复现基线

三个实践要点:

  1. 任务必须「定义清晰」。OpenAI 对研究实习生的限定词就是 well-defined——任务描述里写清输入、产出物、完成判定标准(比如「测试通过 + 输出 metrics.json」),模糊的开放式任务不要并行撒出去;
  2. 一个 Agent 只负责一个分支,合并永远由人来执行或逐条确认;
  3. 并发数从 2-3 个起步,等你对介入节奏有手感了再加,上来就开 8 个只会把注意力打散。

三、设计人工介入点:一半任务需要 steering

「超过一半的 4-8 小时成功任务包含至少一次人工干预」——这是全文对个人最有参考价值的数据。它说明当前阶段的人机协作不是「扔给 Agent 睡觉去」,而是带着检查点的接力赛。

建议给长任务显式设三类检查点:

  • 计划检查点:Agent 先产出执行计划(改哪些文件、跑什么命令、预期产出),人确认后再动手。多数终端 Agent 都有计划模式,强制用它;
  • 里程碑检查点:把 4 小时任务切成 4 个 1 小时的里程碑,每个里程碑结束让 Agent 汇报状态,偏离就纠偏;
  • 危险操作检查点:删除文件、对外发请求、提交合并、花钱的 API 调用——这些动作配置成必须人工批准。以 Claude Code 为例,在 settings.json 里收紧权限:
{
  "permissions": {
    "deny": ["Bash(rm -rf *)", "Bash(git push *)", "Bash(curl *)"],
    "ask": ["Bash(git commit *)"]
  }
}

介入不是失败的标志,而是这套工作流的正常组成部分——把「我在第几个检查点介入的、介入原因是什么」随手记下来,一周后你就有一份属于自己的任务分级数据。

四、成本护栏:600 美元一天是研究机构的账,不是你的

中位研究员日烧 600 美元、90 分位 7000 美元——这是前沿实验室「拿推理换研究速度」的玩法,个人和小团队照抄会破产。需要三道护栏:

  1. 日预算硬上限:给 API key 设每日/每月额度(各家平台都支持),到顶自动断,不设等于裸奔;
  2. 便宜模型路由:Build/Run 阶段的机械性任务(跑测试、改格式、批量重命名)路由到便宜的小模型,只把 Design/Analyze 的关键判断留给旗舰模型。前面文章写过的多模型备胎切换方案可以直接复用;
  3. 每周算一次自己的「Agent 工时比」:统计你本周 Agent 运行总时长 ÷ 自己工作时长。OpenAI 的 3.1 是它的答案,你的答案可能是 0.5 或 2——数字本身不重要,重要的是你开始用同一个度量看待自己的自动化进程,而不是凭感觉。

五、注意事项与常见问题

Q:我也搞研究,能直接用 OpenAI 这套指标对标吗? 不建议。OpenAI 自己强调了这是「OpenAI 用 OpenAI 的工具测 OpenAI」,是自报数据。借鉴方法论,别对标数字。

Q:多 Agent 并行会不会让代码库一团糟? 只要守住「一 Agent 一分支、合并人来审」两条线就不会。乱的不是并行,是没隔离。

Q:什么任务不该撒给 Agent? 三种:定义不清的探索性任务(先自己想清楚)、涉及线上环境的操作、需要为后果担责的决策(上线、删数据、对外承诺)。

Q:这套流程对非研究岗有用吗? 六阶段分类法对任何知识工作都成立——写方案、做运营分析、跑增长实验,换个任务清单就行。

小结

OpenAI 这篇复盘的核心不是「我们很强」,而是它把一个前沿实验室的组织实践拆开给你看了:用六阶段分类法拆解工作,用环境隔离跑并行 Agent,用检查点容纳人工介入,用预算护栏控制推理成本。模型能力每月都在变,但这套方法论在 2026 年秋天是可复用的。今天就做最小的一步:把你明天的任务清单打上六阶段标签,挑出一个 Build 阶段的 well-defined 任务,开一个 worktree 撒给 Agent——你的「研究实习生」也算上岗了。

相关教程

OpenAI 官宣「自动化研究实习生」上线:1 个人类工作日配 3.1 个 Agent 工作日,普通人怎么复刻这套多 Agent 工作流 | AIHub