ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSeek Flash 明天降价?不,是“回调“——一笔账算给你看

DeepSeek Flash 明天降价?不,是“回调“——一笔账算给你看 DeepSeek Flash 明天降价不是回调——一笔账算给你看TL;DR 速览定性9/10 12:00 起 Flash 系列回调价格而非全面降价最大降幅缓存命中输入从 0.05→0.02 元/百万token降 60%输出只降一点4.5→4 元没回到 8/17 涨价前的 2 元谁受益缓存命中率高、输入占比大的应用省得多一、先说清楚这次是回调不是普降9 月 9 日 DeepSeek 在开放平台发了公告9 月 10 日 12:00 起调整 Flash 系列deepseek-v4-flash和deepseek-v4-flash-vision-exp的调用价格。我把现在正在执行的价和9/10 起生效的新价并排放在一起单位每百万 token空闲时段计费项现价9/10 起新价降幅输入·缓存命中0.05 元0.02 元↓60%输入·缓存未命中1.5 元1 元↓33%输出4.5 元4 元↓11%高峰时段工作日 9:00-12:00、14:00-18:00价格是空闲时段的2 倍这个规则不变。注意一个细节输入部分这次是回到 8 月涨价前但输出没有。8/17 前输出是 2 元现在降完还是 4 元——输出的降幅远小于输入。所以严格说这次是输入回调、输出只降一点不是全部回到原价。看到最高降 60%的标题先别急着高兴——那个 60% 是缓存命中输入跟你关系大不大得看你的调用结构。二、先把缓存命中这层讲透这次降幅最大的缓存命中很多人没细想它到底是什么意思。DeepSeek 的计费把输入分成两档缓存命中你发给模型的这部分内容模型之前已经处理过直接复用结果。典型如固定系统提示词、长期不变的 few-shot 示例、长对话里反复出现的历史上下文。缓存未命中模型第一次见的新内容需要从头算一遍。这是最贵的输入档。为什么缓存命中便宜因为模型推理最耗算力的往往不是You think而是你读一遍上下文。上下文里重复出现的部分已经被预计算好了直接拿出来用自然便宜。这次缓存命中输入从 0.05 降到 0.02等于把这部分几乎砍到零成本。所以如果你平时构建的是长系统提示 固定上下文 多轮重复对话这类应用你才是这次降价最大的受益人。三、给你算一笔实账到底省多少光看百分比容易晕我用几个典型场景算给你看。场景 A·通用任务空闲时段跑一次任务消耗100 万 token 输入缓存未命中 100 万 token 输出。按现价1.5 4.5 6 元按新价1 4 5 元单次省 1 元降幅约 16.7%单看 16.7% 好像不高但如果你日调用量是千万级甚至亿级这 16.7% 就是实打实压下来的成本。场景 B·重缓存应用假设某客服机器人80% 的输入都能命中缓存每百万 token 输入、百万 token 输出。按现价输入0.8×0.05 0.2×1.5 0.34加输出 4.5共4.84 元按新价输入0.8×0.02 0.2×1 0.216加输出 4共4.216 元降幅约 12.9%且随着缓存命中率越来越高降幅会更接近那砍六成的红利场景 C·纯生成输出占比 90% 以上的应用写长文、批量生成。按现价0.1×1.5 0.9×4.5 4.2 元按新价0.1×1 0.9×4 3.7 元降幅仅 11.9%——输出只降 11%你省得最少三个场景对比下来结论很清楚这次降价是偏科的重缓存、重输入的应用吃肉纯生成的应用只能喝汤。四、一个容易被忽略的点它是怎么赚回来的很多人只看到降价了忽略了两件事高峰翻倍还在——工作日 9:00-12:00、14:00-18:00 价格翻倍。如果你的任务不急挪到晚上或周末跑价格直接减半。DeepSeek 在更明显地用价格信号引导你把任务错峰等于用时间差换价格优惠。它在给新一代 Flash 铺路——9/8 官方开始内测v4.1 flash中间版本宣传点是能力更强、速度更快、成本更低。这次 Flash 降价很大程度是先把价格水位放低给新模型的面世做铺垫——先用价格稳住存量开发者等新模型来了再承接性能升级。所以更值得留意的不是这次降了多少而是这轮降价背后DeepSeek 打算怎么抢 API 市场。用低价稳住存量用新一代模型完成性能跃迁这套组合拳的意图很明显。五、和8 月涨价连起来看这轮降价的背景值得单独讲。8 月 13 日DeepSeek V4 Pro 正式版上线时官方同时宣布 API 涨价V4 Pro 系列最高涨幅达 11 倍。当时就有不少开发者吐槽高峰涨价太多没有性价比了甚至有团队开始考虑迁移。所以这次 Flash 的降价更像是对上一轮涨价的部分回调而不是亲民降价输入端缓存命中、缓存未命中回到 8/17 涨价前水平输出端仍比 8/17 前贵一倍2 元 → 4 元换句话说DeepSeek 在不同的计费项上做了取舍——把输入打下来留住存量把输出留着支撑新模型的成本结构。这个策略对谁有利、对谁不利前面场景 B/C 已经说得很清楚。六、那段对开发者意味着什么如果你是 API 调用方我的建议是别急着改代码先改调用策略能错峰的错峰——把批量、非实时任务挪到晚上或周末成本直接减半。这是最简单、见效最快的优化。提高缓存命中——固定系统提示词、复用长上下文让更多输入走缓存命中价。这比单纯看单价更重要因为缓存命中输入已经低到 0.02把未命中转成命中差价远比等降价来得大。评估输出占比——如果你的应用输出大这次降价对你的收益有限别被降了 60%的标题带偏真正影响你账单的是输出量。输出是这次降得最少的一档。长期成本规划——下次衡量用不用 DeepSeek别只看这一次的降价把高峰翻倍“缓存命中率”输入输出占比都纳入你的成本模型里。做一个简单的 token 成本试算比盲目信任某个降价 60%的宣传可靠得多。七、一个实用的成本试算方法前面讲了那么多落到实操我推荐你做一个简单的token 成本试算表。不用写代码Excel 或一张纸就能做步骤做法① 采样抓一段你真实的调用日志记录prompt_tokens/completion_tokens/cache_hit_tokens② 拆分把输入拆成缓存命中和缓存未命中两部分看比例③ 套价分别套旧价、新价算出单次调用成本④ 月化乘以月调用次数得到月度成本⑤ 对比对比新旧价看你的真实降幅别信宣传的60%很多团队算完才发现自己寄希望于降价 60%实际因为输出占比高真正降幅只有十几个点。而这个试算5 分钟就能做出来比任何宣传都靠谱。八、几个常见的成本误区最后提醒几个容易踩的坑都是我在实际项目里常看到的只盯着单价不看用量——很多团队纠结每百万 token 多少钱却忽略了真正烧钱的是调用量。一个应用如果调用量翻 10 倍单价降 20% 也没用成本照样爆炸。把缓存命中当天然生效——缓存命中率不是白来的它依赖你把提示词做稳定、把上下文做得可复用。如果每次调用都带上随机的时间戳、随机 ID缓存命中率会掉到接近 0那砍六成的红利你就吃不到。指望一次降价解决成本问题——降价是平台策略随时可能变动8 月刚涨过9 月又降。真正靠谱的是把成本模型建起来让什么场景用什么模型、什么时候跑成为一套可复用的决策逻辑而不是跟着平台价格波动走。说到底定价是平台的成本是技术的。平台怎么定价你控制不了但你的调用结构输入输出占比、缓存命中率、是否错峰是可以优化的。与其盯着别人的价格表不如先把自家应用的成本画像画出来——这才是能长期帮你省钱的、真正握在自己手里的东西。我的判断这次不是DeepSeek 良心发现更像一次精准的价格战——用输入端的降幅去抢输入密集型的开发者场景RAG、文档处理、客服同时保留峰值翻倍做错峰引导还顺手给新一代 Flash 铺路。对大多数开发者来说最该做的不是记住降了多少而是算清楚自己的调用里输入、输出、缓存命中各占多少——这笔账才是决定你月底账单的关键。DeepSeek 这套降输入、稳输出、加高峰的组合本质上是在用价格锚定自己的生态位它要的不是最便宜而是让一批重输入的开发者离不开它。对开发者而言唯一确定的是变化本身——把成本测算变成习惯比抓住某一次降价更有用。
返回列表