AIHub

Qwen3.8-Flash-Next 上手实战:125B 参数每 token 只激活 6B,Qwen4 架构预览版三条路一次走通

进阶约 14 分钟读完2026-08-28#Qwen3.8-Flash-Next#阿里通义千问#MoE#开源大模型#本地部署
Qwen3.8-Flash-Next 上手实战:125B 参数每 token 只激活 6B,Qwen4 架构预览版三条路一次走通

8 月 26 日是 2026 年开源大模型圈少有的"双黄蛋"日子:智谱在晚间开源了 GLM-5.3-Flash(也就是此前屠榜的神秘模型 Ox-Alpha"牛来"),阿里则在同一天放出了 Qwen3.8-Flash-Next。如果说 GLM 那场是营销好戏,阿里这场对开发者更实在——它是 Qwen4 架构的技术预览,权重直接开源,而且把"每 token 激活参数量"压到了约 6B。

这篇文章按"先网页试手感、再接 API、最后评估本地部署"的顺序,把 Qwen3.8-Flash-Next 的上手路径走一遍,顺便把它和同天发布的 GLM-5.3-Flash 摆在一起看清楚。

一、它到底是什么:125B 的盘子,6B 的饭量

先把模型结构里几个关键数字摆出来:

项目 规格
主干参数 约 125B(MoE 混合专家)
每 token 激活 约 6B
N-gram 嵌入表 51B(放主机内存,几乎不增加计算)
多 token 预测模块 4B(MTP,用于加速解码)
上下文 官方宣称百万 token 级,多模态输入
版本 标准版 + FP8 版,权重已在 ModelScope 开源

这个"125B 总量 / 6B 激活"的比例就是整个模型的故事:推理时的计算量和显存带宽压力接近一个 6B 小模型,但知识容量是一个 125B 大模型。架构上的四个变化值得记住:Gated DeltaNet 与 Qwen Sparse Attention(QSA)的混合注意力、支持 FP8 的四分支门控残差流、以及训练侧换用的 Muon 优化器。阿里对它的定位与当年 Qwen3-Next 之于 Qwen3.5 一样——先把新架构放出来让生态适配,正式的 Qwen4 全家桶随后就到。

阿里官方口径里,它的能力对标 Opus 4.6 和 DeepSeek V4-Flash 这一档。注意:发布时没有第三方独立跑分,所有数字都来自厂商,建议以"待社区复测"的心态看待。

二、路径一:网页端零成本体验

写代码之前先花十分钟试手感。目前两个入口:

  1. Qwen 官方对话页:模型选择器里切换到 Flash-Next(若尚未全量,可用 ModelScope 的在线体验页);
  2. ModelScope 模型页:搜 Qwen3.8-Flash-Next,页面右侧有在线推理体验,还能直接看到权重文件列表和 FP8 版本。

建议用三类任务试:一道需要多步推理的数学题、一段几百行的代码审查、一次长文档问答。重点感受的不是"答得对不对",而是响应速度——6B 激活带来的出字速度相比同体量模型是肉眼可见的快,这也是它叫 Flash 的原因。

三、路径二:API 接入(百炼 OpenAI 兼容模式)

对大多数应用开发者,API 是最省事的路径。阿里系模型统一走百炼(DashScope)的 OpenAI 兼容端点,已有 OpenAI SDK 的项目改两行就能切:

curl https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions   -H "Authorization: Bearer $DASHSCOPE_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "qwen3.8-flash-next",
    "messages": [{"role": "user", "content": "用三句话解释 MoE 的激活参数是什么意思"}],
    "stream": true
  }'

两个注意点:一是模型 ID 以百炼控制台"模型广场"里的实际名称为准,新模型上线初期命名可能有后缀变化;二是如果你正在用 Qwen3.7-Plus 或 Qwen3.8-Max,切换前务必跑一遍自己的评测集——架构预览版的行为风格和正式版常有差异,尤其是 system prompt 的遵循方式。

成本直觉:激活参数决定推理成本的大头,6B 激活意味着它的定价档位会对标 Flash 级而非 Max 级,适合放进高并发的 Agent 干活层——比如代码 Agent 的反复读写、长链路工具调用这类"token 消耗大户"场景。

四、路径三:本地部署,先算清硬件账

开源权重意味着可以自托管,但 125B 总参数决定了它不是消费级玩具。按权重体积粗算(不含 KV cache):

版本 权重体积估算 可行硬件
FP8 版 约 125GB+ 单卡 B200(192GB)或双卡 H100/H200
标准 BF16 版 约 250GB+ 4×H100 或 8 卡消费级工作站
社区 4bit 量化 约 60–70GB 待社区发布,Mac Studio 高内存版可观望

vLLM 和 SGLang 对 Qwen 新架构的支持通常在发布后几天到两周内跟上,部署命令大致是:

# 以 vLLM 为例,待官方支持合并后(关注 release note)
pip install -U vllm
vllm serve Qwen/Qwen3.8-Flash-Next-FP8   --tensor-parallel-size 2   --max-model-len 131072   --enable-auto-tool-choice

务实建议:如果你只有单卡 24GB–48GB,这个模型现阶段不适合你,别硬上;等 GGUF/AWQ 量化版,或者直接用 API。自托管的真正受众是有推理服务器、且对数据不出内网有硬要求的团队。

五、和 GLM-5.3-Flash 摆在一起看

同天发布难免被比较,两者其实是不同取向:

  • GLM-5.3-Flash:320B 总参数 / 18B 激活,MIT 协议(商用零摩擦),发布前以匿名模型"牛来"在 OpenRouter 拿下 7 天 23.2T 调用量第一,实测口碑已经过一轮社区检验;
  • Qwen3.8-Flash-Next:125B / 6B,效率更极致,但发布时缺第三方跑分,价值更多在"提前锁定 Qwen4 架构"——你的推理框架、部署脚本、量化工具链现在适配好,Qwen4 正式版发布时就能无缝切换。

一句话:要现在就上生产,GLM-5.3-Flash 的确定性更高;要为下一代架构提前布局,Flash-Next 值得现在就开始适配。

六、注意事项与常见问题

  • "架构预览版"意味着接口可能变:Qwen3-Next 到 Qwen3.5 正式版之间就有过配置结构变化,本地部署的转换脚本要有重写的心理准备。
  • 51B 的 N-gram 嵌入表放内存:官方说"near-zero extra compute",但内存占用是实打实的,规划机器时别把内存忘了。
  • 多模态能力以实际开放为准:宣称多模态输入,但图文混排的稳定性建议自己拿样本测。
  • Q:和 Qwen3.8-Max 怎么选? Max 是 2.4T 的旗舰天花板,Flash-Next 是效率层,两者不是替代关系。日常 Agent 干活用 Flash 档,关键难点任务路由到 Max。
  • Q:现在值得迁生产吗? 建议先灰度:把 10% 流量切过去跑一周,盯准确率和延迟两个指标再决定。

小结

Qwen3.8-Flash-Next 的本质是阿里把 Qwen4 的架构提前开源出来练兵:125B 总量、6B 激活的极致效率比,加上 FP8 版本和百万上下文,方向非常清晰。上手顺序建议:网页端试手感 → 百炼 API 灰度接入 → 有硬件条件的团队用 FP8 版评估自托管。同天的 GLM-5.3-Flash 给了"现在就能用"的选项,Flash-Next 给的是"下一代架构"的船票——两个都值得放进你的评测清单,这周就跑起来。

相关教程

Qwen3.8-Flash-Next 上手实战:125B 参数每 token 只激活 6B,Qwen4 架构预览版三条路一次走通 | AIHub