这两天 AI 圈被一条消息刷了不少屏:DeepSeek 开放平台发公告,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称它在性能、费用、速度、总用时等指标上全面超过此前的 V4 Pro;同时宣布自 9 月 10 日 12:00 起下调 Flash 系列 API 价格(据新浪财经、IT之家等报道)。一边发新模型,一边降价,还紧挨着科创板 IPO 的传闻,信息密度确实高。
对普通开发者来说,最该关心的不是发布会话术,而是两件事:新模型到底变强在哪,以及这次降价之后我的账单会怎么变。
一、价格回调,但没回到"原点"
先看官方给出的调价细节,据多家媒体转述,调整后(空闲时段):
| 项目 | 调整前 | 调整后 |
|---|---|---|
| 输入(缓存命中) | 0.05 元/百万 token | 0.02 元/百万 token |
| 输入(缓存未命中) | 1.5 元/百万 token | 1 元/百万 token |
| 输出 | 4.5 元/百万 token | 4 元/百万 token |
高峰时段价格翻倍,峰谷分时的规则仍然保留。
乍一看是"降到两分钱",但把时间线拉开就知道不是简单的回退。据公开报道,2026 年 4 月 DeepSeek 就把 Flash 的缓存命中价打到过 0.02 元;8 月中旬上调,缓存命中涨到 0.05、输出涨到 4.5。所以这次:
- 缓存命中:回到了 4 月的水平;
- 输出价:从 4.5 降到 4,但仍高于涨价前的 2 元。
也就是说,涨价没有完全撤回,只是把最影响高频调用成本的那一项拉回了低点。这个细节很关键,因为它直接决定了什么样的应用更划算。
- 输出价:从 4.5 降到 4,但仍高于涨价前的 2 元。
二、"两分钱"背后真正的定价逻辑
很多人拿输入价去比价,其实看错了地方。大模型 API 成本的大头,往往在缓存命中。
原理不复杂:如果你每次请求都带上大段相同的上下文(系统提示词、长文档、代码库摘要),推理服务可以直接从缓存里读已算好的部分,不用重新计算。缓存命中率越高,实际花的钱越少。
据报道,有开发者做过实测,用类似编码 Agent 的方式连续工作几小时、消耗近亿 token,缓存命中率能达到 99% 量级。这种场景下,缓存命中价从 0.05 降到 0.02,意义远大于输出价降那 0.5 元。DeepSeek 的定价思路也很清楚:用极低的缓存价锁定"高频、长上下文、稳定前缀"的重度用户,用输出价覆盖边际成本。
三、V4.1 Flash 变了什么、没变什么
变了的:
采用全新的模型结构,原生支持多模态(据 CNBeta、站长之家等报道);
- 内测反馈的速度提升明显,有说法称 SVG 代码生成快约 6 倍、长上下文检索快 5 倍多(据极道等转述,属开发者内测体验,非官方跑分);
- 官方问卷直接问内测用户"V4.1 Flash 能不能全面替换 V4 Pro",暗示这款轻量模型可能上探到主力位。
没变的:
- 官方问卷直接问内测用户"V4.1 Flash 能不能全面替换 V4 Pro",暗示这款轻量模型可能上探到主力位。
Flash 依旧是"更快更省"的定位,不是堆参数走旗舰路线;
- 峰谷分时定价还在,忙时翻倍;
- 缓存命中依旧是成本结构的核心。
从更底层说,V4 系列在 100 万 token 场景下的单 token 推理计算量已压到 V3.2 的约 27%,KV Cache 占用降到约 10%,MoE 每层稀疏激活(据极道转述)。这些数字意味着同一套硬件能承载更多并发——这才是能降价的底气,而不是单纯让利。
- 缓存命中依旧是成本结构的核心。
四、给开发者的实用建议
1. 优化缓存命中率,比挑单价更省钱
把稳定的内容放前面、多变的内容放后面,保持前缀一致,别随意改动系统提示词,这是最直接的省钱手段。一个粗略的账可以这么算:
# 粗略估算:单位:元/百万 token(按空闲时段、官方调价后)PRICE={"input_cache_hit":0.02,# 缓存命中"input_cache_miss":1.0,# 缓存未命中"output":4.0,# 输出}defestimate(in_tokens,out_tokens,hit_rate):"""hit_rate: 输入里命中缓存的比例, 0~1"""hit=in_tokens*hit_rate miss=in_tokens*(1-hit_rate)cost=(hit*PRICE["input_cache_hit"]+miss*PRICE["input_cache_miss"]++out_tokens*PRICE["output"])/1_000_000+returnround(cost,4)# 例:单次请求输入 20 万 token、输出 2 千 token、缓存命中 90%print(estimate(200_000,2_000,0.9))# 约 0.0484 元print(estimate(200_000,2_000,0.0))# 命中率为 0 时约 0.208 元同样一次调用,命中率从 0 拉到 90%,成本差了 4 倍以上。先测命中率,再谈选型。
2. 调用方式基本不用改
DeepSeek 的 API 兼容 OpenAI 的接口格式,切换模型一般只需改model名,base_url不变(据官方内测说明)。示意:
fromopenaiimportOpenAI client=OpenAI(api_key="你的 API Key",base_url="https://api.deepseek.com",# 保持 base_url 不变)resp=client.chat.completions.create(model="deepseek-chat",# 具体模型名以官方文档为准,切换 Flash/Pro 改这里messages=[{"role":"user","content":"写一个二分查找"}],stream=True,)``` 注意:上面用的是官方文档里的通用模型别名,**新版本的具体模型 ID 请以 DeepSeek 开放平台最新文档为准**,别照着旧博客里的名字硬填。### 3. 三个容易踩的坑-**别只看单价看总账。**有内测开发者反馈,模型更快了、token 消耗也跟着涨,单位价格没变,账单反而更高(据极道转述)。速度提升会诱导你用更长的上下文,成本要按"总用量"算。--**批量任务放空闲时段。**峰谷分时还在,离线批处理、数据清洗这类不急的任务挪到空闲时段,能省一半。--**别把鸡蛋放一个篮子里。**国产模型这两月动作很密,智谱 GLM-5.3-Flash 还搞过夜间额度全免(据报道9月3日至20日、每天23时至次日9时)。在代码里做一层模型适配层,换供应商的成本会低很多。## 五、小结这次 V4.1Flash 上线加 Flash 系列降价,本质是一次"用新能力重新定价":缓存价回到低点锁定高频用户,输出价小幅下调稳住基本盘,再用新模型的多模态和速度讲新故事。对开发者来说,短期是利好,但**真正的成本控制权在自己手里——命中率、峰谷、上下文长度,哪一项都比单价比价更值得花时间。**价格战打到最后,赢的不一定是最便宜的那家,而是最稳、最容易迁移的那家。你现在的项目用的是哪家 API,会因为这次降价换回来吗?评论区聊聊。