8 月 28 日下午,腾讯混元发布并开源了新一代大语言模型 Hy4 preview。这不是一次常规的小版本更新:总参数从 Hy3 的 295B 直接拉到 770B,激活参数 49B,上下文长度突破 1M tokens。腾讯给它的定位很明确——"为生产力而生",主攻代码、办公分析、游戏开发和科学研究四类真实工作场景。
这篇文章不聊发布会话术,按我一贯的上手顺序走三条路:先在腾讯自家产品里免费试手感,再接入腾讯云 Tokenhub 的 API,最后走 OpenRouter 作为备用通道,顺带把定价和 1M 上下文怎么用算清楚。
一、先看清楚这是个什么模型
| 项目 | 规格 |
|---|---|
| 总参数 | 770B(MoE 混合专家架构) |
| 每 token 激活 | 49B |
| 上下文长度 | 突破 1M tokens |
| 开源情况 | 已开源,权重可下载 |
| 输入价格 | 6 元 / 百万 tokens |
| 输出价格 | 18 元 / 百万 tokens |
| 缓存命中 | 0.3 元 / 百万 tokens |
几个值得注意的点:
- 激活比例约 6.4%。770B 的盘子里每个 token 只唤醒 49B,推理成本被压到了中等模型的水平,这是它敢定 6 元/百万 tokens 的底气。
- 它参与了自己的研发。腾讯披露 Hy4 preview 首次参与了自身训练方法、数据策略、评估体系和底层算子的优化——模型提出方案、跑实验、根据结果迭代,形成了初步的递归自我改进闭环。它还自主分析推理系统瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐量比基线提升 31.8%。
- 内部盲测成绩。腾讯组织 163 名内部专家、203 个工程任务的盲测中,Hy4 preview 均分 2.99/4,略优于 Kimi K3(2.94)和 GLM 5.3(2.92)。注意这是腾讯内部测试,参考着看就好。
- 迭代节奏很快。自 2 月重建 AI 基础设施以来,混元平均每两个月出一个大版本,采取"preview 先行、正式版跟进"的策略,Hy4 的下一版近期就会上线。
二、路径一:产品里免费试手感(零成本)
不想写代码的话,Hy4 preview 已经在腾讯全系产品里同步首发,开箱即用:
- 元宝:腾讯的 C 端 AI 助手,日常问答、写作、读文档直接选最新模型即可。
- WorkBuddy:办公场景 Agent,适合做数据分析、跨文件协作这类"从信息处理到交付文档/表格/PPT"的完整流程——这正是 Hy4 preview 重点优化的方向。
- CodeBuddy:编程助手,国内版和国际版都已接入,适合先拿几个真实开发任务试试它的长程规划与调试能力。
- ima:知识库工具,配合 1M 上下文可以一次喂入大量资料做问答。
建议先试两类任务:一是丢一个几百页的 PDF 或一整个代码仓库让它总结,检验长上下文的实际质量;二是给一个多步骤的办公任务(比如"读这三张表,算出环比,生成一份带结论的周报"),看它跨文件协作的完整度。
三、路径二:腾讯云 Tokenhub API 接入
正式用进自己的应用,走腾讯云 Tokenhub。流程:
- 登录腾讯云控制台,开通 Tokenhub 服务并创建 API Key。
- 在模型列表里选择 Hy4 preview,确认计费方式(按 token 计费,价格见上表)。
- 用 OpenAI 兼容的方式调用。Python 示例:
from openai import OpenAI
client = OpenAI(
api_key="你的 Tokenhub API Key",
base_url="控制台提供的接入地址", # 以 Tokenhub 控制台实际给出的 base_url 为准
)
resp = client.chat.completions.create(
model="hy4-preview", # 模型 ID 以控制台为准
messages=[
{"role": "system", "content": "你是一个资深后端工程师"},
{"role": "user", "content": " review 这段代码并给出修改建议:..."},
],
temperature=0.3,
)
print(resp.choices[0].message.content)
两个实操建议:
- 代码类任务把 temperature 压低(0.1-0.3),长程开发任务的规划稳定性会明显更好。
- 善用缓存命中价。0.3 元/百万 tokens 的缓存价只有标准输入价的 1/20,多轮对话或反复带同一份长文档时,把不变的内容放在 prompt 前部,命中率会高很多。
四、路径三:OpenRouter 备用通道
如果腾讯云账号不方便(比如海外团队或只想快速验证),Hy4 preview 也同步上架了 OpenRouter:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tencent/hy4-preview",
"messages": [{"role": "user", "content": "用一句话解释 MoE 的激活参数"}]
}'
模型 ID 以 OpenRouter 模型列表页实际显示的为准。OpenRouter 按美元计价且通常略高于官方直连价,适合当备用通道和 A/B 对比工具,不适合跑大批量任务。
五、成本算账与 1M 上下文怎么用
按官方定价粗算几笔账:
- 日常编程助手:一次典型会话按 5 万输入 + 5 千输出算,约 0.39 元。一天二十次重度使用不到 8 元。
- 整库代码审查:20 万 tokens 的仓库上下文 + 1 万输出,单次约 1.38 元。
- 1M 长文档分析:塞满整个上下文窗口(100 万输入)+ 5 千输出,单次约 6.09 元——如果文档可以复用、命中缓存,后续每次只要 0.39 元左右。
1M 上下文最值的用法不是"把什么都塞进去",而是这几类:整库级别的代码理解与重构规划、跨多文件的财报/合同对比分析、长篇科研文献的交叉综述。日常短任务就别硬凑长上下文了,token 也是钱。
六、注意事项与常见问题
- preview 意味着会迭代。腾讯的策略是 preview 先行、正式版跟进,正式版上线后 preview 版的行为和定价可能调整,写进生产环境前留意官方公告。
- 内部盲测成绩仅供参考。2.99 vs 2.94 vs 2.92 的分差很小,且是腾讯自家测试。选型时用自己的真实任务集跑一遍评测,比任何榜单都可靠。
- 开源权重不等于本地跑得动。770B 总参数的 MoE 即便只激活 49B,权重本身也需要数百 GB 显存或内存,本地部署是多卡服务器的事,个人开发者老老实实走 API。
- 缓存定价有触发条件。缓存命中价依赖上下文前缀复用,具体命中规则以 Tokenhub 文档为准,别按理想值做预算。
小结
混元 Hy4 preview 的核心看点是"大容量、小激活、长上下文":770B 参数换来 49B 的推理成本和 1M 的上下文窗口,6 元/百万 tokens 的输入价在旗舰级模型里相当能打,递归自我改进的研发方式也是一个值得持续观察的信号。上手路径很简单:今天就可以在元宝或 WorkBuddy 里免费体验,写代码的直接 CodeBuddy;要接进自己的系统就走 Tokenhub API,海外或快速验证走 OpenRouter。preview 阶段正是试用窗口,建议拿自己的真实任务测一轮,等正式版落地时心里就有数了。
