AIHub

美团 LongCat-Flash-Omni 上手实战:560B 参数只激活 27B,开源多模态模型本地部署与 API 接入全指南

进阶约 14 分钟读完2026-09-01#美团#LongCat-Flash#开源大模型#多模态#Omni#本地部署
美团 LongCat-Flash-Omni 上手实战:560B 参数只激活 27B,开源多模态模型本地部署与 API 接入全指南

9 月 1 日,美团正式发布并开源 LongCat-Flash 系列大模型。这个系列有两个版本同时亮相:

  • LongCat-Flash-Chat:纯文本对话模型,560B 总参数、平均 27B 激活参数,推理速度超过 100 tokens/秒。
  • LongCat-Flash-Omni:全模态版本,同样 560B/27B 的规格,但额外支持图像、视频理解和实时语音交互,官方把它定位为「业界首个全模态覆盖、端到端架构、大参数量高效推理」的开源模型。

两个模型都已在 Hugging Face 和 GitHub 开放权重,采用宽松的 MIT 风格协议。这篇文章不念发布会参数,直接按开发者最关心的顺序走:先搞清楚模型能干什么,再本地跑起来,最后接进自己的应用。

一、LongCat-Flash 是什么:三张图看懂定位

1.1 与近期开源旗舰的横向对比

模型 总参数 激活参数 上下文 多模态 开源协议 特色
LongCat-Flash-Chat 560B ~27B 128K 否 MIT 推理速度 >100 tps,Agent 任务强
LongCat-Flash-Omni 560B ~27B 128K 是 MIT 端到端全模态,实时音视频
腾讯 Hy4 preview 770B 49B >1M 否 开源 长上下文、代码/办公/科研
智谱 GLM-5.3-Flash 320B 18B 未公开 是 开源 性价比、国产芯片算力
DeepSeek V4 Pro 未公开 未公开 1M 否 开源 推理与 Agent 任务

LongCat-Flash 的差异化很明显:用 560B/27B 的 MoE 配比,把「大模型能力」和「小模型推理成本」同时压进一个权重包里,而且 Omni 版不是简单的「语言模型 + 视觉适配器」,而是端到端训练的多模态架构。

1.2 架构关键词

  • Shortcut-Connected MoE(ScMoE):带捷径连接的混合专家架构,额外引入「零计算专家」来降低激活负载。
  • 分块式音视频特征交织机制:把视频、音频按时间片切分后与文本 token 交织输入,保证时序信息不丢。
  • 流式推理设计:视觉编码器、音频编解码器都是轻量级组件(各约 0.6B 参数),LLM 直接输出文本与语音 token,再经音频解码器还原成波形,延迟压到毫秒级。

1.3 适合干什么

  • Chat 版:代码生成、长文档问答、Agent 任务编排、多轮工具调用。
  • Omni 版:实时语音助手、视频内容理解、图文混合分析、多模态客服、直播/会议实时摘要。

二、本地部署:从 Hugging Face 到能跑起来

2.1 硬件与软件门槛

虽然模型每 token 只激活 27B,但总权重本身还是 560B。实测部署需要满足以下条件之一:

  • 多卡服务器:4×H100 80GB 或 8×A100 80GB,用 vLLM / SGLang 的 TP/PP 并行加载。
  • 单卡体验:借助量化工具(如 AWQ / GPTQ 8-bit 或 4-bit)压缩后,可在单张 A100 40GB 或 RTX 4090 24GB 上跑小 batch,但会损失部分多模态能力。
  • 消费级用户:建议直接用 API 或 Hugging Face Inference API,别硬上本地。

2.2 环境准备

# 1. 创建独立环境
conda create -n longcat python=3.11 -y
conda activate longcat

# 2. 安装 PyTorch(以 CUDA 12.4 为例)
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124

# 3. 安装推理框架(二选一)
pip install vllm>=0.8.0          # 推荐,多卡并行成熟
# 或
pip install sglang[all]>=0.4.0   # 若追求更高吞吐

# 4. 安装多模态依赖(Omni 版必需)
pip install transformers accelerate sentencepiece pillow soundfile librosa

2.3 下载权重

# 需要提前在 Hugging Face 登录(部分仓库可能需要申请)
huggingface-cli login

# Chat 版
huggingface-cli download meituan-longcat/LongCat-Flash-Chat   --local-dir ./LongCat-Flash-Chat   --local-dir-use-symlinks False

# Omni 版
huggingface-cli download meituan-longcat/LongCat-Flash-Omni   --local-dir ./LongCat-Flash-Omni   --local-dir-use-symlinks False

下载前确认磁盘空间:560B 参数的 FP16/BF16 权重约需 1.1TB 存储空间,建议用 NVMe SSD。

2.4 启动 vLLM 推理服务

# 4 卡张量并行示例
python -m vllm.entrypoints.openai.api_server   --model ./LongCat-Flash-Chat   --tensor-parallel-size 4   --max-model-len 32768   --dtype bfloat16   --served-model-name longcat-flash-chat   --port 8000

如果是 Omni 版,需要启动配套的多模态服务(官方仓库会提供 serve_omni.py 或类似脚本),大致命令如下:

python scripts/serve_omni.py   --model-path ./LongCat-Flash-Omni   --tensor-parallel-size 4   --port 8000

具体脚本名和参数以 GitHub 仓库 meituan-longcat/LongCat-Flash-Omni 的 README 为准。

三、用 OpenAI 兼容接口调用

vLLM / SGLang 启动后,默认会暴露 /v1/chat/completions 接口,和 OpenAI 格式一致。

3.1 Chat 版调用

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

resp = client.chat.completions.create(
    model="longcat-flash-chat",
    messages=[
        {"role": "system", "content": "你是一位资深后端工程师,回答简洁、给出可运行代码。"},
        {"role": "user", "content": "用 Python 写一个带限流的异步 HTTP 客户端,要求支持并发控制和指数退避重试。"},
    ],
    temperature=0.3,
    max_tokens=2048,
)
print(resp.choices[0].message.content)

3.2 Omni 版多模态调用

Omni 版支持图像、视频、音频三种输入。下面给出一个图像 + 文本的示例:

import base64
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")

with open("./chart.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

resp = client.chat.completions.create(
    model="longcat-flash-omni",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}},
                {"type": "text", "text": "这张图表的趋势是什么?请用一句话总结,并列出三个关键数据点。"},
            ],
        }
    ],
    temperature=0.2,
    max_tokens=512,
)
print(resp.choices[0].message.content)

视频和音频的输入格式与当前主流多模态模型类似,通常也是 base64 编码后通过 video_url 或 audio_url 字段传入。具体字段名以官方推理脚本的 OpenAI 兼容实现为准。

四、Omni 实时语音交互:最值得关注的能力

LongCat-Flash-Omni 最大的亮点不是「能看懂图」,而是端到端实时语音对话。它的流程和传统 TTS + STT + LLM 拼接方案完全不同:

方案 延迟来源 音色一致性 打断支持 情感表达
传统拼接(ASR+LLM+TTS) 三段串行,延迟 1-3 秒 固定音色 难 弱
LongCat-Flash-Omni 端到端 单模型流式输出 由 prompt 控制 原生支持 较强

这意味着你可以用它直接做一个「能听、能看、能说」的 AI 助手,而不需要维护三个独立模型。实际接入时,前端需要用 WebRTC 或 WebSocket 把音频流喂给后端,后端再调用 Omni 的流式接口。

一个最小化的伪代码示例:

# 后端伪代码:WebSocket 接收音频,流式调用 Omni
async def handle_audio_stream(websocket):
    async for audio_chunk in websocket:
        # 1. 把音频 chunk 送入 Omni 的流式推理
        async for text_token, audio_token in omni_model.stream(audio_chunk):
            # 2. 文本可以实时显示在对话气泡
            await websocket.send({"type": "text", "data": text_token})
            # 3. 音频 token 解码后流回前端播放
            pcm = audio_decoder.decode(audio_token)
            await websocket.send({"type": "audio", "data": pcm})

美团官方仓库预计会放出完整的语音对话 Demo,个人开发者建议直接基于官方 Demo 改,不要从零拼。

五、把模型接进生产环境的 checklist

如果你打算把 LongCat-Flash 接进自己的应用,建议按下面这个清单走:

  • 确认部署方式:本地多卡 / 云 GPU 实例 / 等待第三方 API 平台接入。
  • 用真实任务集跑一轮评测:代码生成、长文档问答、图像理解、语音交互各 20 条以上。
  • 设置温度与 max_tokens:代码任务 temperature=0.1-0.3,创意任务 0.5-0.7,语音任务 0.4-0.6。
  • 加一层 fallback:大模型服务不稳定时,自动降级到更便宜的模型或返回缓存结果。
  • 监控 token 成本:560B 模型即便只激活 27B,输入输出价格也不会太低,先小流量灰度。
  • 处理多模态输入安全:Omni 能接收图片/视频/音频,务必在接入层做内容审核和输入大小限制。

六、注意事项与常见问题

  • 权重体积是真的大。560B 参数的 FP16 权重超过 1TB,别指望普通云盘或笔记本硬盘能轻松放下,下载前确认存储和带宽。
  • 本地部署成本不低。虽然激活参数只有 27B,但加载完整权重需要多卡大显存,个人玩家建议等 OpenRouter、SiliconFlow、TokenHub 等平台接入 API。
  • Omni 的语音能力需要官方推理脚本。vLLM 当前对端到端语音模型的支持还在快速演进,建议优先用美团官方放出的 serving 脚本。
  • MIT 协议宽松,但商用前仍要检查。仓库的 LICENSE 文件以实际下载的为准,医疗、金融等敏感场景建议先做合规评估。
  • preview/开源首发版迭代会快。美团已经放出 Chat 和 Omni 两个版本,后续很可能继续更新,生产环境接入时留好模型版本切换的口子。

小结

美团 LongCat-Flash 系列的开源,给中文开源模型阵营又加了一块重量级拼图:560B 总参数、27B 激活参数的 MoE 设计,让「大模型能力」和「小模型成本」之间的天平往中间挪了一大步;而 Omni 版的端到端全模态能力,则把实时语音、视频理解这些过去闭源模型占优的场景也拉进了开源竞争。

对于开发者来说,今天最直接的玩法是三步:去 Hugging Face 下载权重,用 vLLM 或官方脚本把服务跑起来,再用 OpenAI 兼容接口接进自己的应用。如果本地硬件不够,可以先关注各家 API 平台的接入进度,或者拿 Chat 版在代码任务上做一轮评测,等 Omni 的 API 成熟后再上多模态功能。

开源模型越卷,普通开发者能摸到的前沿能力就越多。LongCat-Flash 值得放进你接下来一周的评测清单里。

相关教程

美团 LongCat-Flash-Omni 上手实战:560B 参数只激活 27B,开源多模态模型本地部署与 API 接入全指南 | AIHub