AIHub

DeepSeek 宣布 API 大幅涨价之后:把 Token 账单降下来的七件事

进阶约 13 分钟读完2026-08-11#DeepSeek#API#成本优化#Token#大模型
DeepSeek 宣布 API 大幅涨价之后:把 Token 账单降下来的七件事

8 月 6 日,DeepSeek 在开放平台公告:计划近期整体上调 API 服务定价,预计涨幅较大。此前一天,平台刚发布过容量不足的提示;再往前看,OpenCode 平台披露其 8 月 1 日单日 Token 用量已达 8 万亿。曾经把输入价格打到 1 元/百万 Token 的"价格屠夫",现在被自己的流量压得开始算账了。

具体数字上,DeepSeek 目前已在执行峰谷定价,V4-Pro 高峰时段的输出价格达到 12 元/百万 Token。回看它的定价史——2024 年 4 月降到行业地板价,去年 9 月再降一半以上,今年 4 月还有过 2.5 折促销——这轮转向基本宣告了"白菜价 API"时代的结束。对个人开发者和中小团队来说,抱怨没有意义,把调用层的浪费挤掉,才是自己说了算的事。下面七件事按见效速度排序,照着做一遍,大多数项目的账单能降三到七成。

一、先算清账:你的 Token 都花在哪了

优化前先量化。给每次 API 调用加一行日志,记录输入、输出、缓存命中三类 Token:

// 每次调用后记录 usage
function logUsage(model, usage, latencyMs) {
  const { prompt_tokens, completion_tokens, prompt_cache_hit_tokens } = usage;
  console.log(JSON.stringify({
    ts: Date.now(), model,
    in: prompt_tokens,
    cached: prompt_cache_hit_tokens ?? 0,
    out: completion_tokens,
    latency: latencyMs,
  }));
}

跑一两天就能看出结构。通常会发现三个大头:重复的长 system prompt(每次都原样发)、无限追加的对话历史(越聊越贵)、冗长的模型输出(废话按输出价收费,而输出通常是输入价的 2-4 倍)。知道钱花在哪儿,后面的动作才有针对性。

二、上下文瘦身:别再把整个聊天记录塞进去

对话历史是账单膨胀的第一元凶。三个做法按成本从低到高:

  1. 滑动窗口:只保留最近 6-10 轮完整对话,更早的丢弃;
  2. 摘要压缩:历史超过窗口后,让模型把旧对话压成 200 字摘要,之后只带摘要继续;
  3. System prompt 审计:把提示词里"示例越多越好"的习惯改掉——每个 few-shot 示例都在每次请求里重复计费,保留 2 个最有代表性的即可。

如果你的应用用了 RAG,同样原则:检索结果取 top 3-5 条、每条截断到必要长度,而不是把十篇文档全文灌进上下文。上下文从 8K 压到 2K,这一项就是四倍的差距。

三、用满 Prompt 缓存:公共前缀放前面

DeepSeek 等主流厂商对缓存命中的输入 Token 单独低价计费(今年 4 月还专门下调过缓存价)。缓存机制的关键是前缀匹配:只有从消息开头连续一致的部分才能命中。所以:

  • 把不变的内容(system prompt、工具定义、知识库片段)放在消息数组最前面;
  • 会变的部分(用户问题、时间戳、随机 ID)一律放最后;
  • 千万不要在 system prompt 里动态拼当前时间——每次请求前缀都变,缓存全废。

一个常见的反例是把"当前时间:xxx"写在 system prompt 开头,光是改掉这一行,长 system prompt 的应用缓存命中率就能从 0 拉到 80% 以上。

四、峰谷调度:不急的任务挪到便宜时段

既然峰谷定价已经落地,非实时任务就不该在高峰期跑。内容生成、数据清洗、批量翻译、夜间报表这类任务,用队列攒着,低谷时段集中消费:

// 简化版:低谷时段(以平台公告为准)才放行批量任务
function isOffPeak(now = new Date()) {
  const h = now.getUTCHours() + 8 >> 0; // 转北京时间小时
  return h >= 0 && h < 8; // 示例:凌晨 0-8 点视为低谷
}

async function drainQueue(queue) {
  if (!isOffPeak()) return; // 高峰期跳过,等下个调度周期
  while (queue.length) await runTask(queue.shift());
}

配合 cron 或系统定时器即可,不需要引入重型任务框架。峰谷价差在输出端可能接近一倍,批量任务多的项目值得专门做这层。

五、分级路由:别让旗舰模型回答"今天周几"

最贵的浪费是用万亿参数模型干分类、提取、格式转换这类小活。给请求分级:

任务类型 典型例子 推荐档位
简单判别/提取 情感分类、关键词抽取、格式转换 小模型或本地开源模型
常规生成 摘要、改写、客服应答 中档模型
复杂推理 代码生成、多步分析、数学证明 旗舰模型

实现上就是一个前置的分类器(甚至一组正则加关键词规则),把请求路由到不同档位的端点。实测下来,大量业务里六成以上的请求根本用不到旗舰模型。

六、管住输出:输出 Token 才是单价最高的

  • 显式设置 max_tokens,给输出封顶;
  • 要结构化数据就要求 JSON,并在 prompt 里写明"只输出 JSON,不要解释";
  • 流式场景下,拿到需要的内容就中断连接,别让模型把客套话说完;
  • 审查你的 prompt 里有没有"请详细分析""尽可能全面"这类开放表述——它们都是在给账单加油。

七、预算告警:给账单装个保险丝

最后一步是兜底。按日统计 Token 消耗,超过阈值就告警甚至自动降级(比如从旗舰模型切到中档)。十行代码的日志加一个每日汇总的 cron 任务就够了,关键是别等月底看到账单才发现异常——一次失控的重试循环,一晚上就能烧掉一个月的预算。

注意事项与常见问题

  • 缓存命中率要看官方口径:不同厂商对缓存前缀的最小长度要求不同(有的要求 1024 Token 起),太短的前缀不触发缓存。
  • 压缩历史有损:摘要压缩会丢失细节,法律、医疗等对上下文敏感的场景慎用,或改用"保留首轮需求+最近 N 轮"的混合策略。
  • 涨价节奏:截至本文发布(8 月 11 日),DeepSeek 只公布了涨价预告,具体幅度和新价格尚未落地,建议订阅其开放平台公告,并在代码里把单价做成配置项,方便随时调整。
  • 别把鸡蛋放回一个篮子:成本优化的另一面是供应风险,多模型备胎方案可以参考本站的限流应对实战,两者配合食用。

小结

DeepSeek 涨价不是孤立事件,而是整个行业从"烧钱换规模"转向"算账经营"的信号。调用层的七件事——算清账、瘦身上下文、用满缓存、峰谷调度、分级路由、管住输出、预算告警——都不需要等新模型或新工具,今天就能动手。涨价你说了不算,账单你说了算。

相关教程

DeepSeek 宣布 API 大幅涨价之后:把 Token 账单降下来的七件事 | AIHub