2026 年 9 月 7 日,科大讯飞正式发布星火 X2.5-293B 通用基座模型,在代码生成、智能体协作等核心能力上进一步升级。这是一周内讯飞在模型上的第二个大动作:9 月 1 日它刚开源了 星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型——端侧模型里第一个原生支持 100 万 token(1M)上下文窗口的产品,权重同步上线 Hugging Face 和 GitHub,对应 API 在讯飞星辰 MaaS 平台限时免费开放。
一个 293B 的云端旗舰 + 两个能跑在本地的小模型,构成了 X2.5 家族的完整梯队。这篇文章把三条使用路线全部走通:网页版快速体验、OpenAI 兼容 API 接入、开源权重的本地部署,最后给一张选型对照表。
一、X2.5 家族盘点:三个模型各自管什么
先把三个成员的定位分清楚,这决定你该把功夫花在哪条路上:
| 模型 | 规模 | 上下文 | 获取方式 | 适合场景 |
|---|---|---|---|---|
| 星火 X2.5-293B | 293B | 待官方公布 | 星火网页版/App、星辰 MaaS | 复杂代码、智能体协作、深度推理 |
| 星火 X2.5-4B | 4B | 原生 1M token | 开源权重(Hugging Face/GitHub)+ MaaS API | 手机/PC/车载等端侧长文档处理 |
| 星火 X2.5-1.7B | 1.7B | 原生 1M token | 同上 | 智能家居控制、机器人本体、边缘设备 |
几个值得注意的点:
- 端侧 1M 上下文是行业首次。两款小模型采用混合注意力架构、基于全国产算力训练,此前长上下文基本是大参数云端模型的专利。一本几十万字的资料书、数小时的会议转写,现在可以在本地设备上整本喂进去;
- 小模型也能干活。官方披露在 Domux 智能家居测试集上,X2.5-1.7B 的控制指令端到端执行正确率达 90.3%,平均响应 0.85 秒——离线场景这个延迟很有竞争力;
- 硬件适配面很广:英伟达、华为、海光、后摩等平台都支持,兼容 vLLM、SGLang、llama.cpp 等主流推理框架,可用 Ollama、LM Studio 快速部署,支持用 Llama-Factory 微调;
- 293B 基座今天刚发布,细粒度评测数据官方会陆续放出。按讯飞在半年度业绩会上的说法,今年 1024 开发者节还会推出基于全国产算力的全新主力通用大模型,X2.5-293B 是这一波的先行军。
二、路线一:网页版/App,三分钟体验 293B
只想感受新基座的能力,不需要写任何代码:
- 打开星火网页版
xinghuo.xfyun.cn,手机号注册并完成实名认证(国内产品,实名是硬性要求); - 在模型选择里切到最新的星火模型入口(新基座会陆续全量,刚发布这几天如果网页版还没切换,可以先体验 App,iOS/安卓搜"讯飞星火");
- 建议用三类任务测试:让它写一个带边界条件处理的完整函数、给一个多步骤的 Agent 任务(如"规划一个数据采集脚本,要求失败自动重试并输出报告")、喂一段长需求文档让它提炼验收标准。
网页版的意义是快速判断这个新基座值不值得你接入 API。如果你的主力场景是编程,重点关注它对复杂逻辑的分步规划能力——这正是本次升级的主打方向。
三、路线二:API 接入(星辰 MaaS 限时免费 + 开放平台)
开发者有两扇门,别搞混:
- 讯飞星辰 MaaS 平台(
maas.xfyun.cn):X2.5 系列新模型的 API 入口,当前限时免费,适合先跑通流程再谈预算; - 讯飞开放平台(
console.xfyun.cn):成熟模型(Spark X2 旗舰、Ultra、Lite 等)的按量计费入口。参考定价:Spark X2 旗舰约 ¥2/百万 tokens,Ultra 约 ¥0.8/百万,Lite 永久免费;个人认证送 20 万 tokens 免费包,企业认证送 100 万。
两个平台的调用都是 OpenAI 兼容协议,鉴权用 Bearer Token,base URL 形如 https://spark-api-open.xf-yun.com/v1(星辰 MaaS 的 Key 与开放平台 Key 相互独立,在各自控制台获取)。Python 最小示例:
from openai import OpenAI
client = OpenAI(
api_key="你的API Key", # 控制台获取
base_url="https://spark-api-open.xf-yun.com/v1",
)
resp = client.chat.completions.create(
model="spark-x2.5", # 以控制台模型列表为准
messages=[
{"role": "system", "content": "你是一个资深后端工程师"},
{"role": "user", "content": "用 Python 写一个带指数退避重试的 HTTP 客户端"},
],
stream=True,
)
for chunk in resp:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
因为协议兼容,迁移成本约等于零:把已有项目里的 base_url 和 api_key 换掉即可。另外星辰 MaaS 的 Coding Plan 同时支持 OpenAI 与 Anthropic 协议,能直接喂给 Claude Code、Cursor 这类编程工具当后端——配置方式和换 OpenAI 端点一样,在工具设置里改 API 地址和 Key。
四、路线三:本地部署开源端侧模型
想在本地跑 X2.5-4B/1.7B,权重在 Hugging Face 的 XHToken/spark-x25 合集和 GitHub XHToken/Spark-X2.5 仓库开放。两条部署路径:
Ollama(最快上手):适合个人开发机试玩。如果官方 Ollama 模型库已收录,一行命令;未收录就下载 GGUF 后自建 Modelfile:
# 方式一:模型库已收录时
ollama run spark-x2.5:4b
# 方式二:手动导入 GGUF
cat > Modelfile <<'EOF'
FROM ./spark-x2.5-4b-q4_k_m.gguf
PARAMETER num_ctx 131072
EOF
ollama create spark-x2.5-4b -f Modelfile
ollama run spark-x2.5-4b
vLLM(生产向):适合需要并发服务的场景,4B 量化后在消费级显卡上也能跑:
pip install vllm
vllm serve XHToken/spark-x2.5-4b \
--max-model-len 131072 \
--gpu-memory-utilization 0.85
注意 1M 上下文是模型能力上限,不是默认配置:上下文越长 KV 缓存占的显存越大,4B 模型跑满 1M 上下文需要可观的显存,建议按实际需求设置 max-model-len(16K~128K 通常够用),需要超长上下文再上量化 KV 缓存或 CPU 卸载。微调需求直接用 Llama-Factory,官方确认支持。
五、选型对照:三个模型怎么用才不浪费
- 日常编程/复杂推理 → 293B 基座走 API 或 Coding Plan,能力优先;
- 隐私敏感的长文档分析(合同、病历、内部资料)→ X2.5-4B 本地部署,数据不出设备,1M 上下文整本处理;
- IoT/机器人/车载等边缘控制 → X2.5-1.7B,0.85 秒级响应,离线可用;
- 预算极低的轻量任务 → 开放平台 Lite 模型永久免费,作为兜底备胎。
六、注意事项与常见问题
- 两个平台的 Key 不通用:星辰 MaaS 和开放平台的 API Key 分别申请,混用会 401;
- 限时免费有期限:MaaS 平台 X2.5 的免费窗口以官方公告为准,生产接入前先确认计费规则,避免免费期结束账单失控;
- 293B 不开源:今天发布的是云端基座,开放权重的是 4B/1.7B,别去 Hugging Face 上找 293B;
- 端侧模型不是万能的:1.7B/4B 适合结构化任务(控制指令、格式化工单、本地摘要),开放式创作和复杂代码还是交给云端大模型;
- 实名认证是前提:网页版、API 都需要实名,企业调用建议直接做企业认证拿 100 万 tokens 免费包。
小结
星火 X2.5 这一波的节奏很清晰:开源端侧模型抢"长上下文本地化"的心智,293B 基座撑云端能力上限, Coding Plan 和双协议兼容降低接入门槛。对开发者来说,现在的最佳动作是:网页版试 293B 找感觉,星辰 MaaS 限时免费期把 API 流程跑通,再把 X2.5-4B 拉到本地验证你的长文档场景——三件事都不花钱,花的是半天时间。
