AIHub

Sakana Fugu Max 上手实战:$2/百万 Token 的「模型调度器」,一个 API 背后是一整个模型池

进阶约 12 分钟读完2026-09-15#Sakana#Fugu Max#模型编排#API 接入#成本控制#Agent
Sakana Fugu Max 上手实战:$2/百万 Token 的「模型调度器」,一个 API 背后是一整个模型池

过去一周 AI 圈最热的话题之一,不是某个参数更大的模型,而是一个「不干活、只派活」的模型。

9 月 11 日,由 Transformer 论文八位作者之一 Llion Jones 参与创立的东京实验室 Sakana AI,发布了 Fugu 家族的新成员 Fugu Max。它的定位很反常:你自己的请求发给一个端点,背后却是一个编排器(orchestrator)——一个专门训练过「怎么分工」的小模型,实时决定这个任务该拆给池子里的哪个模型做,最后把结果缝合起来还给你。9 月 14 日的 Agentic 周刊把它评为本周最有代表性的发布:「一个产品,全部价值在于决定别人的模型该干你的活。」

本文把这件事讲透:它和普通大模型到底有什么本质区别、Fugu 家族四款怎么选、怎么写代码接入,以及定价表背后三个会悄悄吃掉预算的坑。

一、Fugu Max 到底是什么:你调用的是一个调度器

先建立一个心智模型。普通大模型是「一个脑子读完你的输入、写出答案」;Fugu Max 是「一个工头看着你提交的活,把它拆成几道工序,每道工序挑池子里最便宜但能胜任的工人,验收后拼成成品交给你」。

这个「工头」不是规则引擎,而是用强化学习训练出来的协调模型,Sakana 把它的方法论发表在了两篇 ICLR 2026 论文里:TRINITY 让一组 LLM 在多轮对话中自动分配思考者(Thinker)、执行者(Worker)、校验者(Verifier)三种角色;Conductor 则让协调策略本身被「学」出来而不是手写。最狠的一点是它能递归调用自己——拆出来的子任务如果还太复杂,子任务里可以再开一个工头。

对开发者来说,这一切藏在同一个 OpenAI 兼容端点后面:你拿到的收益是多模型系统的质量,付出的维护成本却是单模型 API 的成本。

二、Fugu 家族四兄弟:一个端点,一行参数切换

Fugu 全系共用一个 API,切换模型只是改 model 字段的一行字符串:

型号 定位 输入/百万 Token 输出/百万 Token 适合谁
Fugu 均衡款,日常默认 中端 中端 编码工具(如 Codex)里的常规任务
Fugu Max 成本性能比优先,池子最大 $2.00 $6.00 大批量、预算敏感的生产任务
Fugu Ultra v2 质量优先,难题攻坚 $5.00(>272K 上下文 $10) $30.00(>272K 时 $45) 高风险复杂推理
Fugu Cyber 安全专项(漏洞研究等) 专项定价 专项定价 安全团队

两个 Max 的数字值得单独记住:

  • 100 万 Token 上下文,文本、图片、PDF 都能直接喂;
  • 价格与上下文长度无关——90 万 Token 的长文档和一句话的每 Token 单价一样,这在长上下文普遍加收「超长附加费」的今天是少见的。

三、API 接入:和调 OpenAI 没有区别

以 OpenAI Python SDK 为例,把 base_url 指向 Sakana 端点即可:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_SAKANA_API_KEY",
    base_url="https://api.sakana.ai/v1",  # Sakana Fugu 端点
)

resp = client.chat.completions.create(
    model="fugu-max",               # 换成 fugu / fugu-ultra / fugu-cyber 即切换家族成员
    messages=[
        {"role": "system", "content": "You are a careful code reviewer."},
        {"role": "user", "content": [
            {"type": "text", "text": "Review this module and list the three riskiest spots:"},
            {"type": "file", "file": {"file_data": "https://example.com/module.py"}},
        ]},
    ],
    reasoning_effort="high",        # 可选:high / xhigh / max
    # response_format={"type": "json_object"},  # 结构化输出同样支持
)
print(resp.choices[0].message.content)

Node.js 侧同理,new OpenAI({ baseURL: "https://api.sakana.ai/v1", apiKey }) 之后照常调用。函数调用(function calling)、结构化输出、内置联网搜索($0.007/次)都是标配。

四、账单上的三个坑,官方不会替你算

Fugu Max 的标价是真便宜——输入 $2、输出 $6、缓存命中输入只要 $0.25。但有三个机制会让实际账单偏离直觉:

1. 编排 Token 照常计费。 你的一个请求在池子里扇出成多个子任务时,工头之间通信、子模型读写、校验回读的 Token 全部计入你的账单。Sakana 的缓解政策是「不叠加收费,按涉及的最高档模型单一费率计」,但「每 Token 便宜」不等于「每个答案便宜」。一个扇出 5 个代理的复杂请求,实际消耗可能是单模型调用的数倍。

2. 缓存命中率决定真实成本。 OpenRouter 上架头几天的实测面板显示,Fugu Max 的加权实际输入价约 $0.61/百万(对比 $2 牌价),靠的是 79% 以上的缓存命中率——说明池子内部对重复上下文复用得相当激进。这对「多轮对话、重复喂系统提示」的场景是利好;对每次都是全新长文档的场景,你要按牌价做预算。

3. 路由不透明,你审计不了。 Sakana 不会告诉你某个请求实际用了池子里哪些模型。对合规敏感、需要向客户解释「数据经过了什么模型」的团队,这是硬约束,选型前要先想清楚。

五、冷静看待它的基准测试

官方口径是 Fugu Max 在六个基准上拿到最佳综合分、十个基准里七个扩展了成本-性能帕累托前沿。看这类数字时记住三条:SWEFish 是 Sakana 自建的内部基准;旗舰模型(Fable 5.1、GPT-6 Astra)不在它的池子里,「以开源池中档模型打败旗舰价」正是它的卖点而非心虚;以及所有分数都是厂商自报。Hacker News 上对 Fugu 家族最尖刻的评论是「你已经在给 Anthropic、OpenAI、Google 各交 $200/月,现在再交 $200 给 Sakana 替你把它们拧到一起」——反过来也有真实用户报告,把 Fugu Ultra 当顾问、更快的模型当执行者的组合「值得,前提是你的工具链能把顾问和执行者分开」。

六、什么团队现在就该试,什么团队再等等

值得立刻试的:调用量大、任务杂、已经在手动维护「哪个任务用哪个模型」路由表的团队——Fugu Max 把这条路由层做成了托管服务,$2/$6 的扁平价让成本预测非常简单。长文档场景(百万上下文不涨价)也明显受益。

建议再等等的:对输出可审计性有硬要求的行业(金融合规、医疗)、任务类型单一且已锁定最优模型的团队(你自己调一个模型反而更便宜),以及需要指定池子成员的场景——注意 Max 的池子是固定的,不能自选(家族基础款可以)。

小结

Fugu Max 代表了一个清晰的行业信号:模型层正在像数据库层一样「基础设施化」——它很重要、很贵,但你卖给客户的不再是它,而是它上面的调度、工具与流程。如果你的痛点是「任务太杂、模型太多、账单太散」,花半天时间把一条非关键业务流量切到 Fugu Max 上跑一周,对照自己手工路由的成本和质量,数据会给你答案。

相关教程

Sakana Fugu Max 上手实战:$2/百万 Token 的「模型调度器」,一个 API 背后是一整个模型池 | AIHub