9 月 1 日,美团正式发布并开源 LongCat-Flash 系列大模型。这个系列有两个版本同时亮相:
- LongCat-Flash-Chat:纯文本对话模型,560B 总参数、平均 27B 激活参数,推理速度超过 100 tokens/秒。
- LongCat-Flash-Omni:全模态版本,同样 560B/27B 的规格,但额外支持图像、视频理解和实时语音交互,官方把它定位为「业界首个全模态覆盖、端到端架构、大参数量高效推理」的开源模型。
两个模型都已在 Hugging Face 和 GitHub 开放权重,采用宽松的 MIT 风格协议。这篇文章不念发布会参数,直接按开发者最关心的顺序走:先搞清楚模型能干什么,再本地跑起来,最后接进自己的应用。
一、LongCat-Flash 是什么:三张图看懂定位
1.1 与近期开源旗舰的横向对比
| 模型 | 总参数 | 激活参数 | 上下文 | 多模态 | 开源协议 | 特色 |
|---|---|---|---|---|---|---|
| LongCat-Flash-Chat | 560B | ~27B | 128K | 否 | MIT | 推理速度 >100 tps,Agent 任务强 |
| LongCat-Flash-Omni | 560B | ~27B | 128K | 是 | MIT | 端到端全模态,实时音视频 |
| 腾讯 Hy4 preview | 770B | 49B | >1M | 否 | 开源 | 长上下文、代码/办公/科研 |
| 智谱 GLM-5.3-Flash | 320B | 18B | 未公开 | 是 | 开源 | 性价比、国产芯片算力 |
| DeepSeek V4 Pro | 未公开 | 未公开 | 1M | 否 | 开源 | 推理与 Agent 任务 |
LongCat-Flash 的差异化很明显:用 560B/27B 的 MoE 配比,把「大模型能力」和「小模型推理成本」同时压进一个权重包里,而且 Omni 版不是简单的「语言模型 + 视觉适配器」,而是端到端训练的多模态架构。
1.2 架构关键词
- Shortcut-Connected MoE(ScMoE):带捷径连接的混合专家架构,额外引入「零计算专家」来降低激活负载。
- 分块式音视频特征交织机制:把视频、音频按时间片切分后与文本 token 交织输入,保证时序信息不丢。
- 流式推理设计:视觉编码器、音频编解码器都是轻量级组件(各约 0.6B 参数),LLM 直接输出文本与语音 token,再经音频解码器还原成波形,延迟压到毫秒级。
1.3 适合干什么
- Chat 版:代码生成、长文档问答、Agent 任务编排、多轮工具调用。
- Omni 版:实时语音助手、视频内容理解、图文混合分析、多模态客服、直播/会议实时摘要。
二、本地部署:从 Hugging Face 到能跑起来
2.1 硬件与软件门槛
虽然模型每 token 只激活 27B,但总权重本身还是 560B。实测部署需要满足以下条件之一:
- 多卡服务器:4×H100 80GB 或 8×A100 80GB,用 vLLM / SGLang 的 TP/PP 并行加载。
- 单卡体验:借助量化工具(如 AWQ / GPTQ 8-bit 或 4-bit)压缩后,可在单张 A100 40GB 或 RTX 4090 24GB 上跑小 batch,但会损失部分多模态能力。
- 消费级用户:建议直接用 API 或 Hugging Face Inference API,别硬上本地。
2.2 环境准备
# 1. 创建独立环境
conda create -n longcat python=3.11 -y
conda activate longcat
# 2. 安装 PyTorch(以 CUDA 12.4 为例)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124
# 3. 安装推理框架(二选一)
pip install vllm>=0.8.0 # 推荐,多卡并行成熟
# 或
pip install sglang[all]>=0.4.0 # 若追求更高吞吐
# 4. 安装多模态依赖(Omni 版必需)
pip install transformers accelerate sentencepiece pillow soundfile librosa
2.3 下载权重
# 需要提前在 Hugging Face 登录(部分仓库可能需要申请)
huggingface-cli login
# Chat 版
huggingface-cli download meituan-longcat/LongCat-Flash-Chat --local-dir ./LongCat-Flash-Chat --local-dir-use-symlinks False
# Omni 版
huggingface-cli download meituan-longcat/LongCat-Flash-Omni --local-dir ./LongCat-Flash-Omni --local-dir-use-symlinks False
下载前确认磁盘空间:560B 参数的 FP16/BF16 权重约需 1.1TB 存储空间,建议用 NVMe SSD。
2.4 启动 vLLM 推理服务
# 4 卡张量并行示例
python -m vllm.entrypoints.openai.api_server --model ./LongCat-Flash-Chat --tensor-parallel-size 4 --max-model-len 32768 --dtype bfloat16 --served-model-name longcat-flash-chat --port 8000
如果是 Omni 版,需要启动配套的多模态服务(官方仓库会提供 serve_omni.py 或类似脚本),大致命令如下:
python scripts/serve_omni.py --model-path ./LongCat-Flash-Omni --tensor-parallel-size 4 --port 8000
具体脚本名和参数以 GitHub 仓库 meituan-longcat/LongCat-Flash-Omni 的 README 为准。
三、用 OpenAI 兼容接口调用
vLLM / SGLang 启动后,默认会暴露 /v1/chat/completions 接口,和 OpenAI 格式一致。
3.1 Chat 版调用
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="not-needed"
)
resp = client.chat.completions.create(
model="longcat-flash-chat",
messages=[
{"role": "system", "content": "你是一位资深后端工程师,回答简洁、给出可运行代码。"},
{"role": "user", "content": "用 Python 写一个带限流的异步 HTTP 客户端,要求支持并发控制和指数退避重试。"},
],
temperature=0.3,
max_tokens=2048,
)
print(resp.choices[0].message.content)
3.2 Omni 版多模态调用
Omni 版支持图像、视频、音频三种输入。下面给出一个图像 + 文本的示例:
import base64
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
with open("./chart.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
resp = client.chat.completions.create(
model="longcat-flash-omni",
messages=[
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}},
{"type": "text", "text": "这张图表的趋势是什么?请用一句话总结,并列出三个关键数据点。"},
],
}
],
temperature=0.2,
max_tokens=512,
)
print(resp.choices[0].message.content)
视频和音频的输入格式与当前主流多模态模型类似,通常也是 base64 编码后通过 video_url 或 audio_url 字段传入。具体字段名以官方推理脚本的 OpenAI 兼容实现为准。
四、Omni 实时语音交互:最值得关注的能力
LongCat-Flash-Omni 最大的亮点不是「能看懂图」,而是端到端实时语音对话。它的流程和传统 TTS + STT + LLM 拼接方案完全不同:
| 方案 | 延迟来源 | 音色一致性 | 打断支持 | 情感表达 |
|---|---|---|---|---|
| 传统拼接(ASR+LLM+TTS) | 三段串行,延迟 1-3 秒 | 固定音色 | 难 | 弱 |
| LongCat-Flash-Omni 端到端 | 单模型流式输出 | 由 prompt 控制 | 原生支持 | 较强 |
这意味着你可以用它直接做一个「能听、能看、能说」的 AI 助手,而不需要维护三个独立模型。实际接入时,前端需要用 WebRTC 或 WebSocket 把音频流喂给后端,后端再调用 Omni 的流式接口。
一个最小化的伪代码示例:
# 后端伪代码:WebSocket 接收音频,流式调用 Omni
async def handle_audio_stream(websocket):
async for audio_chunk in websocket:
# 1. 把音频 chunk 送入 Omni 的流式推理
async for text_token, audio_token in omni_model.stream(audio_chunk):
# 2. 文本可以实时显示在对话气泡
await websocket.send({"type": "text", "data": text_token})
# 3. 音频 token 解码后流回前端播放
pcm = audio_decoder.decode(audio_token)
await websocket.send({"type": "audio", "data": pcm})
美团官方仓库预计会放出完整的语音对话 Demo,个人开发者建议直接基于官方 Demo 改,不要从零拼。
五、把模型接进生产环境的 checklist
如果你打算把 LongCat-Flash 接进自己的应用,建议按下面这个清单走:
- 确认部署方式:本地多卡 / 云 GPU 实例 / 等待第三方 API 平台接入。
- 用真实任务集跑一轮评测:代码生成、长文档问答、图像理解、语音交互各 20 条以上。
- 设置温度与 max_tokens:代码任务 temperature=0.1-0.3,创意任务 0.5-0.7,语音任务 0.4-0.6。
- 加一层 fallback:大模型服务不稳定时,自动降级到更便宜的模型或返回缓存结果。
- 监控 token 成本:560B 模型即便只激活 27B,输入输出价格也不会太低,先小流量灰度。
- 处理多模态输入安全:Omni 能接收图片/视频/音频,务必在接入层做内容审核和输入大小限制。
六、注意事项与常见问题
- 权重体积是真的大。560B 参数的 FP16 权重超过 1TB,别指望普通云盘或笔记本硬盘能轻松放下,下载前确认存储和带宽。
- 本地部署成本不低。虽然激活参数只有 27B,但加载完整权重需要多卡大显存,个人玩家建议等 OpenRouter、SiliconFlow、TokenHub 等平台接入 API。
- Omni 的语音能力需要官方推理脚本。vLLM 当前对端到端语音模型的支持还在快速演进,建议优先用美团官方放出的 serving 脚本。
- MIT 协议宽松,但商用前仍要检查。仓库的 LICENSE 文件以实际下载的为准,医疗、金融等敏感场景建议先做合规评估。
- preview/开源首发版迭代会快。美团已经放出 Chat 和 Omni 两个版本,后续很可能继续更新,生产环境接入时留好模型版本切换的口子。
小结
美团 LongCat-Flash 系列的开源,给中文开源模型阵营又加了一块重量级拼图:560B 总参数、27B 激活参数的 MoE 设计,让「大模型能力」和「小模型成本」之间的天平往中间挪了一大步;而 Omni 版的端到端全模态能力,则把实时语音、视频理解这些过去闭源模型占优的场景也拉进了开源竞争。
对于开发者来说,今天最直接的玩法是三步:去 Hugging Face 下载权重,用 vLLM 或官方脚本把服务跑起来,再用 OpenAI 兼容接口接进自己的应用。如果本地硬件不够,可以先关注各家 API 平台的接入进度,或者拿 Chat 版在代码任务上做一轮评测,等 Omni 的 API 成熟后再上多模态功能。
开源模型越卷,普通开发者能摸到的前沿能力就越多。LongCat-Flash 值得放进你接下来一周的评测清单里。
