DeepSeek 这波操作很凶
AI 的"工作记忆"砍掉 3/4,价格跟着降 60%
9 月 10 日那天,DeepSeek 悄悄把一项价格调到了 0.02 元——比之前便宜了 60%。
很多人看到这条,随手划走,心想"又降价"。但这次降价不是促销,是结果。真正发生的事藏在 AI 的"草稿纸"里:DeepSeek 把这张纸撕掉了四分之三。
AI 也有"草稿纸",而且很贵
你每次跟 AI 聊天,它都得先把你说过的话"记"下来,好在你追问的时候能接得上。这段被临时记下的东西,行内叫 KV Cache,你可以把它理解成 AI 的草稿纸或者工作记忆。
普通聊两句,这张纸不大,费不了多少。但有两种情况,纸会越铺越厚:
- 你甩给它一篇长文、一堆资料;
- 或者,你让它自己连续干一堆活(查资料、调工具、跑几十轮),它得一直惦记着前面发生了什么。
纸越厚,占的"内存"就越多,账单就越长。对那种自己连轴转的 AI(行内叫 Agent,你可以理解为"AI 打工人"),这笔"草稿纸"的费用往往是总成本里最厚的一层——因为它要反复回头看自己记的东西。
关键改动:把草稿纸缩小到 1/4
DeepSeek 这次发的新模型叫 V4.1 Flash。它干了一件很实在的事:让 AI 记东西更省地方了。
官方给的数字是,新模型把 KV Cache 占的内存压到了前一代的 1/4,连带把对硬盘的需求压到了 1/8。
它是怎么做到的?一句话版:换了个"读"和"写"分开的大脑结构。
过去大多数 AI,读你的问题和写答案,用的是同一套脑子。DeepSeek 这次把它拆开——读你输入用一套轻量脑子(每次只唤醒约 8B 参数),写答案用另一套(约 16B)。既然读只需要一次,就把读的那部分做得更紧凑,记下来的"草稿"自然更短;写答案时每次回头看这份更短的草稿,占用就小了。
(参数这东西你可以这么理解:这个模型总共有 552B 个"神经元",但每次干活只唤醒其中一小撮——这叫 MoE 混合专家,像一家 552 人的公司,每次只叫 8 到 16 个人上场。)
对你有什么用
如果你只是聊天:
更直接——便宜了。闲时调用缓存命中单价从 0.05 元降到 0.02 元,降幅 60%;而且分峰谷,闲时价是高峰的一半,鼓励你半夜或白天低谷时段把重活排开。
如果你是做产品的 / 玩 AI 自动化的:
这才是重点。以前"AI 打工人"因为记性太占内存,长任务跑久了贵得离谱,很多产品只好把上下文切得稀碎、不敢让它多记。现在草稿纸只剩 1/4,同样长的任务、同样的记忆命中率,单次成本变成原来的四分之一。意味着一类此前因为太贵而不敢做的东西——长程自动助手、带持久记忆的客服、跑几百轮的调研 AI——第一次在账面上站得住。
说白了,DeepSeek 改的不是"单次回答更便宜",而是长任务的成本曲线被压平了。
顺手一个变化:模式合并了
同一天,DeepSeek 把原来的"快速 / 专家 / 识图"三个模式合成了一个"智能模式"。
以前你得自己判断:这问题简单用快速档,烧脑的用专家档,发图片用识图档。现在不用选了——AI 自己看你的输入有多难、是不是图文,自动决定用轻量算力还是深度思考。底层模型够聪明了,上层就不需要你手动换挡。
一个背景:同行股价先绿了
有意思的是,发布新模型、宣布降价的同一天,港股的大模型公司集体下跌:智谱一天跌了 11%,MinMax 跌了约 9%。市场把这归因为 DeepSeek 同时"发新模型 + 大幅降价",投行也跳出来提醒"价格战可能要打响了"。
一个公司还没上市,先把同行的股价砸了——这本身也是个故事。
结尾落在这张纸上
技术迭代有时候挺朴素:最贵的一行,往往不在参数表上,而在 AI 的草稿纸里。
当缓存命中的费用从 0.05 元落到 0.02 元,那张被撕掉四分之三的草稿纸,终究是工程师从内存里一点点省出来的。
- 点赞
- 收藏
- 关注作者
评论(0)