AIHub

腾讯混元 Hy4 preview 上手实战:770B 参数只激活 49B,产品、Tokenhub API、OpenRouter 三条路一次走通

入门约 12 分钟读完2026-08-29#腾讯混元#Hy4 preview#开源大模型#MoE#API 接入
腾讯混元 Hy4 preview 上手实战:770B 参数只激活 49B,产品、Tokenhub API、OpenRouter 三条路一次走通

8 月 28 日下午,腾讯混元发布并开源了新一代大语言模型 Hy4 preview。这不是一次常规的小版本更新:总参数从 Hy3 的 295B 直接拉到 770B,激活参数 49B,上下文长度突破 1M tokens。腾讯给它的定位很明确——"为生产力而生",主攻代码、办公分析、游戏开发和科学研究四类真实工作场景。

这篇文章不聊发布会话术,按我一贯的上手顺序走三条路:先在腾讯自家产品里免费试手感,再接入腾讯云 Tokenhub 的 API,最后走 OpenRouter 作为备用通道,顺带把定价和 1M 上下文怎么用算清楚。

一、先看清楚这是个什么模型

项目 规格
总参数 770B(MoE 混合专家架构)
每 token 激活 49B
上下文长度 突破 1M tokens
开源情况 已开源,权重可下载
输入价格 6 元 / 百万 tokens
输出价格 18 元 / 百万 tokens
缓存命中 0.3 元 / 百万 tokens

几个值得注意的点:

  • 激活比例约 6.4%。770B 的盘子里每个 token 只唤醒 49B,推理成本被压到了中等模型的水平,这是它敢定 6 元/百万 tokens 的底气。
  • 它参与了自己的研发。腾讯披露 Hy4 preview 首次参与了自身训练方法、数据策略、评估体系和底层算子的优化——模型提出方案、跑实验、根据结果迭代,形成了初步的递归自我改进闭环。它还自主分析推理系统瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐量比基线提升 31.8%。
  • 内部盲测成绩。腾讯组织 163 名内部专家、203 个工程任务的盲测中,Hy4 preview 均分 2.99/4,略优于 Kimi K3(2.94)和 GLM 5.3(2.92)。注意这是腾讯内部测试,参考着看就好。
  • 迭代节奏很快。自 2 月重建 AI 基础设施以来,混元平均每两个月出一个大版本,采取"preview 先行、正式版跟进"的策略,Hy4 的下一版近期就会上线。

二、路径一:产品里免费试手感(零成本)

不想写代码的话,Hy4 preview 已经在腾讯全系产品里同步首发,开箱即用:

  1. 元宝:腾讯的 C 端 AI 助手,日常问答、写作、读文档直接选最新模型即可。
  2. WorkBuddy:办公场景 Agent,适合做数据分析、跨文件协作这类"从信息处理到交付文档/表格/PPT"的完整流程——这正是 Hy4 preview 重点优化的方向。
  3. CodeBuddy:编程助手,国内版和国际版都已接入,适合先拿几个真实开发任务试试它的长程规划与调试能力。
  4. ima:知识库工具,配合 1M 上下文可以一次喂入大量资料做问答。

建议先试两类任务:一是丢一个几百页的 PDF 或一整个代码仓库让它总结,检验长上下文的实际质量;二是给一个多步骤的办公任务(比如"读这三张表,算出环比,生成一份带结论的周报"),看它跨文件协作的完整度。

三、路径二:腾讯云 Tokenhub API 接入

正式用进自己的应用,走腾讯云 Tokenhub。流程:

  1. 登录腾讯云控制台,开通 Tokenhub 服务并创建 API Key。
  2. 在模型列表里选择 Hy4 preview,确认计费方式(按 token 计费,价格见上表)。
  3. 用 OpenAI 兼容的方式调用。Python 示例:
from openai import OpenAI

client = OpenAI(
    api_key="你的 Tokenhub API Key",
    base_url="控制台提供的接入地址",  # 以 Tokenhub 控制台实际给出的 base_url 为准
)

resp = client.chat.completions.create(
    model="hy4-preview",  # 模型 ID 以控制台为准
    messages=[
        {"role": "system", "content": "你是一个资深后端工程师"},
        {"role": "user", "content": " review 这段代码并给出修改建议:..."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

两个实操建议:

  • 代码类任务把 temperature 压低(0.1-0.3),长程开发任务的规划稳定性会明显更好。
  • 善用缓存命中价。0.3 元/百万 tokens 的缓存价只有标准输入价的 1/20,多轮对话或反复带同一份长文档时,把不变的内容放在 prompt 前部,命中率会高很多。

四、路径三:OpenRouter 备用通道

如果腾讯云账号不方便(比如海外团队或只想快速验证),Hy4 preview 也同步上架了 OpenRouter:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tencent/hy4-preview",
    "messages": [{"role": "user", "content": "用一句话解释 MoE 的激活参数"}]
  }'

模型 ID 以 OpenRouter 模型列表页实际显示的为准。OpenRouter 按美元计价且通常略高于官方直连价,适合当备用通道和 A/B 对比工具,不适合跑大批量任务。

五、成本算账与 1M 上下文怎么用

按官方定价粗算几笔账:

  • 日常编程助手:一次典型会话按 5 万输入 + 5 千输出算,约 0.39 元。一天二十次重度使用不到 8 元。
  • 整库代码审查:20 万 tokens 的仓库上下文 + 1 万输出,单次约 1.38 元。
  • 1M 长文档分析:塞满整个上下文窗口(100 万输入)+ 5 千输出,单次约 6.09 元——如果文档可以复用、命中缓存,后续每次只要 0.39 元左右。

1M 上下文最值的用法不是"把什么都塞进去",而是这几类:整库级别的代码理解与重构规划、跨多文件的财报/合同对比分析、长篇科研文献的交叉综述。日常短任务就别硬凑长上下文了,token 也是钱。

六、注意事项与常见问题

  • preview 意味着会迭代。腾讯的策略是 preview 先行、正式版跟进,正式版上线后 preview 版的行为和定价可能调整,写进生产环境前留意官方公告。
  • 内部盲测成绩仅供参考。2.99 vs 2.94 vs 2.92 的分差很小,且是腾讯自家测试。选型时用自己的真实任务集跑一遍评测,比任何榜单都可靠。
  • 开源权重不等于本地跑得动。770B 总参数的 MoE 即便只激活 49B,权重本身也需要数百 GB 显存或内存,本地部署是多卡服务器的事,个人开发者老老实实走 API。
  • 缓存定价有触发条件。缓存命中价依赖上下文前缀复用,具体命中规则以 Tokenhub 文档为准,别按理想值做预算。

小结

混元 Hy4 preview 的核心看点是"大容量、小激活、长上下文":770B 参数换来 49B 的推理成本和 1M 的上下文窗口,6 元/百万 tokens 的输入价在旗舰级模型里相当能打,递归自我改进的研发方式也是一个值得持续观察的信号。上手路径很简单:今天就可以在元宝或 WorkBuddy 里免费体验,写代码的直接 CodeBuddy;要接进自己的系统就走 Tokenhub API,海外或快速验证走 OpenRouter。preview 阶段正是试用窗口,建议拿自己的真实任务测一轮,等正式版落地时心里就有数了。

相关教程

腾讯混元 Hy4 preview 上手实战:770B 参数只激活 49B,产品、Tokenhub API、OpenRouter 三条路一次走通 | AIHub