昨晚十一点,我在实验室跑完最后一批文献筛选,顺手看了一眼 API 账单,愣了一下。8月17号 DeepSeek 调价正式生效,我白天在高峰时段跑的那几个批量任务,费用直接翻倍。作为把 DeepSeek 当主力 API 用了大半年的穷研究生,这波"价格屠夫收刀"我是实实在在挨了一刀。
写这篇文章,一是记录这次调价的关键事实(网上信息太碎),二是分享我踩坑之后整理出来的省钱方案,给同样用 agent 写科研脚本的同学参考。
先看事实:这次调价是怎么落地的
时间线其实很紧凑:
- 8月6日:DeepSeek 在开发者平台发公告,全文很短:“计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大”。没有幅度、没有时间表,但开发者圈直接炸了——毕竟 DeepSeek 是过去两年的行业价格地板。
- 8月13日:具体方案公布:改用峰谷定价。
- 8月17日 0时:新价格正式生效,同时 V4-Pro 结束测试、转为正式版商用。
新价格表(元/百万 tokens),高峰时段为北京时间 9:00-12:00 和 14:00-18:00,空闲时段是高峰价的一半:
| 模型 | 场景 | 空闲时段 | 高峰时段 |
|---|---|---|---|
| V4-Flash | 输入(缓存命中) | 0.05 | 0.10 |
| V4-Flash | 输入(缓存未命中) | 1.5 | 3.0 |
| V4-Flash | 输出 | 4.5 | 9.0 |
| V4-Pro | 输入(缓存命中) | 0.15 | 0.30 |
| V4-Pro | 输入(缓存未命中) | 4.5 | 9.0 |
| V4-Pro | 输出 | 13.5 | 27.0 |
对比调价前 V4-Pro 的 0.025 / 3 / 6,缓存命中输入这项从 0.025 涨到高峰 0.30,涨幅高达 1100%。注意:缓存未命中的输入和输出其实涨得没有缓存命中那么夸张,但输出价 6 → 13.5(高峰 27)也够肉疼的。
为什么涨:单日 8 万亿 token 的"甜蜜的负担"
涨价的直接导火索是需求海啸。据 OpenCode 披露,8月1日单日 V4-Flash 在其平台处理了 8 万亿 token——其中 5 万亿还是免费额度。8月4日,V4-Flash 因为"前所未有的访问量"出现容量不足,官方 API 上午几乎不可用。OpenRouter 周榜上,V4-Flash 在 7月27日-8月2日以 7.22 万亿 token 登顶全球第一,之后两周又分别以 8.83 万亿、11.2 万亿连庄。
深层原因是算力硬约束:业内信息称 DeepSeek 持有约两万张 H 系等效芯片,且训练与推理共用。中国发展高层论坛 2026 年年会披露,今年3月国内日均 token 调用量已突破 140 万亿,比 2024 年初的约 1000 亿涨了千倍以上;信通院数据显示一季度算力需求同比增长 417%,供给只涨了 128%。需求端涨千倍、供给端跟不上,涨价成了最直接的算力再分配手段。
这也不是孤例:智谱年内已经三次提价(一季度提价 83%,调用量反而涨了 400%),月之暗面 Kimi K3 发布后输入价涨超 3 倍、输出价涨近 4 倍。摩根士丹利 8月9日研报显示,2026 年二季度国内大模型平均 API 输入价 4.9 元、输出价 21.9 元/百万 token,比 2025 年一季度分别上涨约 48% 和 80%。"白菜价"时代确实在收尾。
有意思的是,海外这波是反向操作:OpenAI 把 GPT-5.6 Luna 的价格下调 80%,Anthropic 的 Claude Fable 5 干脆取消了订阅制、纯按量计费($10/$50 每百万 token)。一涨一降背后是算力自有度和商业模式的差别——OpenAI 靠订阅收入补贴 API 获客,DeepSeek 几乎是纯 API 变现,涨价就是它的损益表本身。Artificial Analysis 的实测数据很能说明问题:V4-Flash 跑完一次基准任务成本约 $0.03,Kimi K3 约 $0.86,Claude Fable 5 要 $3.15——便宜超过 100 倍。所以"DeepSeek 斩杀线"(性价比散点图上把又贵又菜的模型全部划进斩杀区的那条线)能上热搜,是因为这条线本身太夸张了;也正因如此,它迟早要动一动。
对研究生来说,最痛的是什么
个人聊天的同学基本无感——网页版和 App 不按 API 计费。最痛的是我们这种把 agent 当苦力跑批量任务的人。我的典型场景是:让 agent 读几十篇 PFAS 文献做筛选、写 PMF 输入文件的预处理脚本、跑 SHAP 特征贡献分析。一个任务动辄几十轮工具调用,上下文反复膨胀,token 消耗是聊天场景的几十上百倍。
我踩的第一个坑:不知道峰谷定价已经生效,白天照常跑批量任务。我 8月17日上午十点启动了一轮文献筛选,四小时后看账单,发现同一批任务如果挪到晚上跑能省一半。第二个坑:上下文缓存命中率低。之前为了省事,每次任务都把同一份方法学文档重新塞进 prompt,缓存全 miss,等于按最贵的输入价计费。
我现在的省钱四件套
1. 错峰调度。把重活挪到高峰时段之外。我在服务器上加了 cron,凌晨 2 点自动跑批量任务:
# 每天凌晨 2:00 跑文献筛选批处理(空闲时段,输出价减半)02* * *cd/home/lixna/pfas_screen&&uv run python batch_screen.py>>logs/screen.log2>&12. 提高缓存命中率。缓存命中输入只要 0.05 元(Flash),和 miss 的 1.5 元差 30 倍。做法:把 system prompt、方法学文档固定下来不换,多轮对话里不重复贴大段上下文,能用同一个 session 就别开新的。
3. 模型路由。简单任务(格式转换、正则提取)用 V4-Flash,复杂推理(写 PMF 脚本、解释模型结果)才用 V4-Pro。我写了个小函数做成本估算,跑之前先算一笔账:
defest_cost(n_input,n_output,cache_hit=0.5,peak=False,model="flash"):"""估算一次 API 调用的成本(元)。"""price={"flash":(0.05,1.5,4.5),"pro":(0.15,4.5,13.5)}[model]hit,miss,out=priceifpeak:# 高峰时段价格翻倍hit,miss,out=hit*2,miss*2,out*2in_cost=n_input*(cache_hit*hit+(1-cache_hit)*miss)/1e6returnin_cost+n_output*out/1e6# 例:一次 20 万输入 + 5 万输出、缓存命中 50% 的 Flash 调用print(est_cost(2e5,5e4,cache_hit=0.5,peak=False))# 约 0.38 元print(est_cost(2e5,5e4,cache_hit=0.5,peak=True))# 约 0.75 元4. 本地部署开源权重。V4 系列是 MIT 开源,处理涉及原始监测数据(我们组的 PFAS 浓度数据还没发表,不适合走外部 API)的活,我直接跑本地量化版,贵是贵在电费,但数据安全、没有计价波动。
一点心态
说句公道话:即便翻倍,DeepSeek 依然是全球最便宜的一档。国盛证券测算 V4-Pro 高峰输出价也只有 Claude 旗舰的约 1/13,闲时约 1/25。这次调价真正改变的是计价方式从"一口价"变成"按资源紧张程度定价",对用量大的 agent 用户来说,省钱的本质变成:把算力需求从高峰挪走、把缓存用满。这不是坏事,至少让我这种穷学生学会了对 token 用量有概念——以后毕业了做任何跟模型调用相关的事,这都是基本功。
参考来源:
- 网易/新快报:DeepSeek 预告 API 价格大幅上调,AI 大模型行业定价逻辑生变(2026-08-08)
- 雷达财经:DeepSeek涨价,“价格屠夫"梁文锋"收刀”(2026-08-18)
- 快科技:DeepSeek-V4系列今日起价格上涨:峰谷定价 高峰期贵一倍(2026-08-17)
- 虎嗅:DeepSeek调价方案公布,8月17日生效(2026-08-13)
- Caixin Global:DeepSeek Launches V4-Pro and Raises API Prices by as Much as 1,100%(2026-08-14)
- AI工具宝箱:DeepSeek 预告 API「大幅涨价」:单日 8 万亿 Token 压垮价格屠夫(2026-08-07)