旧金山时间 9 月 29 日、北京时间今天凌晨,OpenAI DevDay 2026 一口气抛出了 20 多项发布:常驻后台的持续运行 Agent「Dots」、Codex Cloud、Ultrafast 极速档、每月 $500 的 Pro 500 套餐……但对中国开发者来说,最能立刻兑现成账单变化的只有一个——GPT-6.1 Sol。
官方给它的定位毫不含糊:「处理复杂任务时性能接近 Astra,成本低于 Astra」,面向代码、应用和文档中重复性、长时间运行的任务。距 GPT-6 Sol 发布才一周,距旗舰 Astra 发布不到两周,OpenAI 显然在加速「旗舰能力下放」的节奏。这篇文章不做发布会复读,只解决三个问题:它到底什么水平、今天怎么用上、账单怎么算才不亏。
一、先看账本:1/5 价格是怎么来的
直接把三代的定价摆在一起(单位:美元 / 百万 Token,标准短上下文档):
| 模型 | 输入 | 缓存输入 | 输出 | 定位 |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $0.50 | $50.00 | 旗舰,长程多步骤任务 |
| GPT-6 Sol | $2.00 | $0.20 | $10.00 | 均衡主力(编程/Agent) |
| GPT-6.1 Sol | $2.00 | $0.10 | $10.00 | Sol 升级版,对齐大幅增强 |
| GPT-6 Luna | $0.20 | $0.02 | $1.20 | 轻量高并发 |
三个关键读法:
- 输入输出与 Sol 持平,没有因为升级涨价——这是把「升级」做成了常规迭代,而不是新 SKU 涨价;
- 缓存读取降到 $0.10,是 Sol 的一半:对 Agent 和代码助手这种「系统提示 + 仓库上下文反复发送」的负载,缓存单价砍半比输入单价更值钱;
- 对比 Astra 是 5 倍价差:官方评测显示它在编程、计算机操作(computer use)、专业工作几类任务上已逼近 Astra——「同性能最高性价比模型」的口号就建立在这个价差上。
二、升级了什么:重点不在跑分,在对齐
与一周前的 GPT-6 Sol 相比,6.1 最实质的变化是对齐评估的大幅改善,多项指标已贴近 Astra。OpenAI 公布的细节里有几条值得开发者逐字读:
- 在工具坏掉时更诚实地说明自己的局限——评测中「对失效的搜索工具保持透明」的失败率显著下降;
- 更可靠地遵守显式约束:你写在系统提示里的「不许做 X」,它真的不做;
- 在 Agentic 任务中避免未授权结果的失败率更低,且观测期内未出现对齐伪装(alignment faking)行为。
对把模型放进自动化流程的人来说,这三条比任何 benchmark 分数都实际:Agent 不怕笨,怕的是「以为它照做了其实没有」。规格上,模型支持文本+图像输入、纯文本输出,1.05M Token 上下文,最大输出 128K,推理强度可选 low / medium / high / xhigh / max 五档。
三、今天怎么用上:三条渠道
1. API(模型 ID gpt-6.1-sol)——对开发者最实在的路径。注意工具调用请走 Responses API;Chat Completions 兼容但不带工具。
2. Codex / ChatGPT Work——Plus、Pro、Business、Enterprise、Edu 套餐均已在桌面端、CLI 和 IDE 扩展中可用(Free 和 Go 套餐不含;Enterprise 和 Edu 默认关闭,需要管理员手动开启)。
3. 第三方平台——多家 API 聚合平台已同步上架,国内网络环境走这条通常更顺。
四、API 接入实战:Responses API 五档推理
最小可用示例(工具调用 + 可调推理强度):
from openai import OpenAI
client = OpenAI()
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"}, # low / medium / high / xhigh / max
input=[
{"role": "system", "content":
"你是仓库维护者。只允许修改 src/ 下的文件,禁止动 main 分支。"},
{"role": "user", "content":
"给登录接口加上限流,先给出改动计划再动手。"},
],
tools=[{"type": "code_interpreter"}],
)
print(resp.output_text)
几个和旧代码不一样的点:
- 五档推理强度是显式参数:批量摘要、格式化这类活开 low,复杂调试开 high/xhigh——成本随档位显著变化,不要全程 max;
- Agent 循环记得设终止条件:模型更「听话」了,但长任务仍需要最大步数与人工确认节点兜底;
- 迁移自 Astra 时,把
model字段换成gpt-6.1-sol基本即可,API 形状一致,真正的差异在质量与价格的再平衡,不在接口。
五、成本精算:别忽略 272K 溢价档
这是本篇文章最重要的算盘。GPT-6.1 Sol 的低价是有条件的:单次请求输入 ≤ 272K Token 按标准价计;一旦超过,本次请求的输入与缓存费率 ×2、输出费率 ×1.5。模型总上下文 1.05M,但「塞得下」和「塞得起」是两回事。
以一个月 200 次请求、平均输入 100K Token(其中 70% 命中缓存)、输出 5K Token 的代码审查负载为例:
标准价(全部 ≤272K):
输入 200 × 100K × 30% 未缓存 × $2/M = $12.0
缓存 200 × 100K × 70% 命中 × $0.10/M = $1.4
输出 200 × 5K × $10/M = $10.0
合计 ≈ $23.4/月
若一半请求超 272K(按 400K 输入计,费率 ×2 / ×1.5):
输入 100 × 400K × 30% × $4/M = $48.0
缓存 100 × 400K × 70% × $0.20/M = $5.6
输出 100 × 5K × $15/M = $7.5
加上未超额的一半 ≈ $11.7
合计 ≈ $72.8/月 —— 账单变成 3 倍
实操建议:
- 做上下文预算:把系统提示、记忆、仓库索引的 Token 数算出来,接近 250K 就主动裁剪或换检索策略,不要「顺手」把整库塞进一次请求;
- 缓存是命根子:$0.10 的缓存单价意味着重复的前缀越稳定越省钱——固定系统提示顺序、把易变内容放末尾;
- 对照 Astra 的盈亏线:同一负载用 Astra 跑大约要 $117/月,6.1 Sol 即使踩到溢价档($72.8)仍便宜约 38%;但如果任务真需要 Astra 级别的长程推理质量,省下的钱可能换不回返工成本——先用自己的 20 条真实任务做双跑对照,再决定切换。
六、注意事项与常见问题
注意事项:
- ChatGPT 主站 Chat 里没有它:只在 Work 与 Codex 场景开放,想聊天界面体验需要通过这两个入口;
- Enterprise / Edu 默认关闭:公司账号的用户在管理员开启前会看不到模型选项,别当成账号故障;
- 多模型聚合平台的第三方价格与官方可能有出入,且存在缓存计费口径差异,生产接入前先用小额请求核对账单字段。
FAQ:
- 和 GPT-6 Sol 什么关系? 直接升级替代版,同价。新项目直接用 6.1;存量 Sol 调用把模型 ID 换掉即可,旧版短期仍会可用但性价比已无优势;
- 免费用户能用吗? 不能。Free/Go 套餐不包含,API 则按 Token 计费、无套餐门槛;
- 要不要等降价? GPT-6 家族两周内两次调价(Sol/Luna 半价、缓存再砍半)说明降价通道是常态,但「等」的机会成本通常大于差价——按当前价已显著低于 Astra,值得现在迁移;
- DevDay 的 Dots 和 Ultrafast 要不要一起上? Dots(常驻 Agent)仍在早期,建议先拿 6.1 Sol 把现有 Agent 工作流的成本降下来,再评估常驻形态。
小结
GPT-6.1 Sol 的信号意义大于模型本身:OpenAI 开始用周为单位把旗舰能力下放到 1/5 价格带,「用哪个模型」的答案正在从「选最强的」变成「选够用的 + 把缓存和长上下文账算清」。今天的行动清单:确认套餐或 API 权限 → 用 Responses API 跑通 5 档推理 → 拿 20 条真实任务和 Astra 双跑对照 → 给上下文设 272K 预算红线。DevDay 的烟花放完了,能落进账单的才是真发布。
