9 月 14 日,上海人工智能实验室(InternLM 团队)在几乎没有预热的情况下放出了一枚重磅模型:Atria Dawn Preview。这件事的戏剧性在于:它建立在 Z.ai 六月份发布的 744B 参数 MoE 模型 GLM-5.2 完全相同的基座上——同一个硅片,Z.ai 作为开源旗舰按 $1.40/$4.40 每百万 Token 收费,而上海 AI Lab 用一套面向 Agent 场景的后训练流程重新加工后,连权重带代码以 MIT 协议免费放出,官方报出的成绩里 BrowseComp 92.5、BFCL v4 77.0、DeepSearchQA 96.0,压过了付费前沿模型 GPT-5.6 Sol。
9 月 15 日起,各 AI 日报把它列为头条。但热闹背后有个实际问题:没有任何厂商托管端点,要么走官方限量 API,要么自己下载 756GB(FP8)权重扛回机房。本文把三条路都走一遍:先看懂它凭什么免费还更强,再给出可直接照抄的 API 接入代码、多卡部署命令和接入 Agent 框架的配置,最后泼四盆冷水讲清真实限制。
一、凭什么同一个基座,后训练能「越级」:可验证经验管线
Atria 技术报告里最值得读的不是模型卡,而是一个叫 Verifiable Experience Pipeline(可验证经验管线) 的训练方法。一句话概括:训练数据不只保留问题和答案,而是连同模型采取的步骤、调用的工具、产出的文件、以及外部检查的结果一起保存。
具体做法是:模型在一个长任务中先选错工具、测试失败,管线会保留它如何读取报错信息、修改做法、再次验证的完整过程,再剔除不完整、互相矛盾或重复的轨迹。模型因此学到的不是某个固定工作流,而是面对环境反馈时如何继续推进。这直接解释了为什么它的强项集中在「能被外部验证」的任务上:
| 评测 | Atria Dawn Preview | 说明 |
|---|---|---|
| BrowseComp(浏览检索) | 92.5 | 超过付费前沿模型 GPT-5.6 Sol |
| BFCL v4(工具调用) | 77.0 | 16 项评测中 5 项拿到表内最高分 |
| DeepSearchQA(深度搜索问答) | 96.0 | |
| CyberGym(网络安全) | 86.5 | |
| SkillsBench | 66.4 | 与表内最高 66.7 几乎打平 |
要冷静的是:这是团队自报的评测成绩,SWE-bench Pro、Terminal-Bench 2.1 等项目里仍有其他模型领先,部分工作区评测还混用了不同的 Agent 框架和模型裁判。把它当成「值得立刻实测的强证据」,而不是采购决策本身。
二、路线一:官方 API,三种兼容接口任选
官方 API 提供 OpenAI Chat Completions、Anthropic Messages 和 OpenAI Responses 三种兼容接口,模型 ID 固定为 Atria-Dawn-Preview。先在控制台创建 API Key(务必存进环境变量),然后:
export ATRIA_API_KEY="sk-..."
OpenAI SDK(Python):
from openai import OpenAI
client = OpenAI(
api_key=os.environ["ATRIA_API_KEY"],
base_url="https://api.atria-asi.ai/v1", # 官方仓库给出的端点,按所在地区选择
)
resp = client.chat.completions.create(
model="Atria-Dawn-Preview",
messages=[
{"role": "system", "content": "You are a research agent. Cite sources and verify before concluding."},
{"role": "user", "content": "调研 2026 年 9 月开源 Agent 模型的发布情况,输出带来源链接的简报"},
],
max_tokens=8192,
)
print(resp.choices[0].message.content)
Anthropic SDK 同理,把 base_url 指向官方 Anthropic 兼容端点即可——这让已有 Claude Code 工作流的团队几乎零改动就能切换模型做对照测试。
三、路线二:多卡本地部署(SGLang / vLLM)
如果你有数据中心级资源,FP8 版是理性选择:权重约 756GB(BF16 完整版约 1.51TB),FP8 省一半存储和显存。
SGLang(官方推荐,需 ≥ 0.5.13.post1):
pip install "sglang[all]>=0.5.13.post1"
python -m sglang.launch_server --model-path atria-asi/Atria-Dawn-Preview-FP8 --tp 8 --mem-fraction-static 0.85 --max-running-requests 8 --context-length 262144
vLLM(需 ≥ 0.23.0):
python -m vllm.entrypoints.openai.api_server --model atria-asi/Atria-Dawn-Preview-FP8 --tensor-parallel-size 8 --max-model-len 262144 --gpu-memory-utilization 0.92
几个关键数字要算清楚:
- TP 8:8 卡张量并行是最低舒适线,单卡 141GB(H20-3e)×8 才装得下权重加 KV 缓存;256K 上下文意味着 KV 缓存本身就是吞显存巨兽,
--context-length不要盲目拉满; - 权重可以从 Hugging Face 或 ModelScope 下载,国内机房走 ModelScope 更顺;
- 部署起来后就是一个标准 OpenAI 兼容端点,接入方式与第二节完全一致。
四、路线三:接进你的 Agent 框架
官方仓库直接给出了 Codex、Claude Code、WorkBuddy、Qoder、OpenClaw、Hermes 六个框架的接入示例。以 Claude Code 为例,核心是把它配置成一个自定义模型提供者:
export ANTHROPIC_BASE_URL="https://api.atria-asi.ai" # 或你的自建 SGLang 端点
export ANTHROPIC_AUTH_TOKEN="$ATRIA_API_KEY"
export ANTHROPIC_MODEL="Atria-Dawn-Preview"
这种接法最适合跑对照实验:同一批长流程任务(例如「从空白仓库搭建一个带测试的 CLI 工具」),分别用原模型和 Atria 跑,比较完成率、人工介入次数、结果可验证性三个指标——技术报告里 769 件任务的分析也印证了这个姿势:AI 提案、人类拍板仍是 55.4% 任务的主模式,遇到重大困难时 76% 靠人类介入才能继续。
五、四盆冷水:上线前必须知道的限制
- 纯文本输入。官方文档明确标注 Atria Dawn Preview 不能直接接收图片、截图或 PDF。用支持多模态的 Agent 工具接入时,要么先关掉图像输入,要么在外部做 OCR/文字抽取后再喂给模型。
- MoE 不等于 744B 全部激活。每次推理只路由到部分专家,总参数量≠单次计算量,别拿 744B 去对别人的稠密模型比推理成本。
- 个人电脑别想了。即使 FP8 也要 756GB 起步,加上运行时开销是多 GPU 服务器命题;个人验证请老老实实走 API。
- 「权重开源」≠「完全可复现」。MIT 覆盖了代码与权重,但训练数据与完整管线的开放程度以仓库实际内容为准;官方案例(气象预测、MiniOS、CAD)是选定展示,不是平均成功率。导入生产前,用自己的数据、错误情境和验收标准跑一轮小规模评估。
常见问题
Q:它和 GLM-5.2 是什么关系? 同一个 744B MoE 基座,两种后训练方向:GLM-5.2 走通用对话与编码,Atria Dawn Preview 走可验证的 Agent 长任务。买 Z.ai 的 API 和用 Atria 的开源权重,付的是不同工位的钱。
Q:成绩可信吗? BrowseComp 92.5 这类数字来自团队自报,评测协议已随技术报告公开,第三方复现正在进行。稳妥的态度是:先用 5-10 件你真实业务里的长流程任务做小规模对照测试,再决定投入深度。
Q:最省事的体验方式是什么? 控制台申请 API Key,用第二节的 OpenAI SDK 代码跑通第一个请求,整个过程 10 分钟以内——部署 756GB 权重是有了明确业务价值之后才需要考虑的事。
小结
Atria Dawn Preview 的价值不在 744B 这个数字,而在它把 Agent 训练的核心从「回答得更漂亮」转向了「交出可被外部验证的完成」。对从业者的行动建议很具体:今天就去申请 API Key,挑几件真实任务跑一轮对照评测;对有 GPU 机房的团队,SGLang 一条命令就能把权重扛起来。这是一个值得认真测试的强证据,而不是可以闭眼全押的成品——但 MIT 协议 + 权重全开放,意味着测试本身零门槛。
