昨晚在外网博客圈刷到一篇文章,标题挺挑衅的:《为什么行业对 DeepSeek 4.1 Flash 一点都不激动?》。作者是个重度用户,拿这模型实打实干了一个月的活,十几个项目,他的原话翻译过来大概是:不开字幕看演出,我分不清背后是 DeepSeek 还是 Opus。更扎心的在后头——他说他一天跑到底的编码会话,成本经常不到 1 美元。
先交代一下背景,这条新闻的落点其实不在"又便宜了",在 KV Cache(键值缓存,模型推理时用来存历史上下文中间结果的显存区域)上。自回归模型每生成一个字,都要回头读前面所有字的中间状态,这些状态就堆在 KV Cache 里。上下文越长,这块缓存越肥,长编码会话跑到几十万 token 的时候,光养这块缓存的显存和算力,就是推理成本里最粗的一根梁。DeepSeek 从 V1 到 4.1 Flash,把这块缓存压了大约 437 倍。
为什么值得单独拎出来说?讲个我自己踩过的坑。去年我在公司内部跑一个长文档问答服务,上下文动辄十几万 token,账单里最贵的不是"生成",是"重读"——每次请求都要把那一大坨历史重新算一遍 attention(注意力计算)。当时的解法是缓存命中:前缀没变的部分直接复用。但用户哪会老老实实按同一个前缀提问,命中率惨不忍睹。那时候我就明白了一件事:长上下文的成本瓶颈,不在模型有多大,在缓存有多肥。437 倍是什么概念?原来要一卡车拉的货,现在一个背包就背走了。同样的显存,能同时服务的会话数翻了几十个数量级里的好几档,单价被打下来是必然结果。
所以那位博主说的"全天会话不到 1 美元",不是营销话术,是架构红利。我拿自己的场景粗粗算了一笔账:按这个单价水平,重排桌面文件这种"辱 PhD 任务"真的只要几厘钱。成本掉到这个位置,改变的不只是账单,是使用姿势——以前你舍不得让大模型干探索性、试错性的杂活,现在敢了,随手套个 UI 测试、撒一把开源项目做调研,都不心疼。便宜到临界点之后,用量会反着涨上去,到头来总开销未必变少,但每一次调用的心理门槛确实塌了。
不过这篇文章里最让我愣住的,反而是另一段:博主劝自托管党别折腾了。他说 4.1 Flash 的经济性意味着,自建推理服务在省钱这件事上已经没有回本的可能。这话说得挺狠,但细想站得住。自托管的真实成本从来不是模型权重下载下来那一刻,而是显存租金、卡的用户率、运维值夜班。云上单价被压到几厘钱一次调用之后,你自家那几张卡的折旧摊下来,单次成本大概率更高——你省下的是 API 费,赔上的是电费、人力和本可以拿去做业务的注意力。我认识一位朋友,去年兴冲冲买了两张 4090 打算跑自家知识库,三个月后默默转成了混合方案:日常调用走 API,敏感数据本地跑小模型。当时我觉得他"叛变"得太快,现在看,他只是比我早算明白这笔账。
把镜头拉远一点,这件事有意思的地方在于它的反直觉。业界惯性一直是谁贵谁强,FAANG 式采购更是默认花最多的钱买最高的智力。可"足够好"这个词的杀伤力,过去几十年里反复上演过:云计算对自建机房、SQLite 对重型数据库,都是够用加便宜,把"豪华方案"逼成小众选择。LLM 这轮看起来也在走向同一个剧本——前沿模型继续冲智力天花板,但真正吃掉大部分调用量的,会是那个"你根本注意不到它不是 Opus"的便宜货。给关键任务留一次 Opus 级别的终审,其余交给 Flash 执行,这个"便宜主力加贵 Brain 兜底"的搭配,可能就是接下来一年多数团队的标准编队。
当然,硬币另一面也得说。437 倍的压缩不是白来的,缓存压得越狠,和长上下文记忆精度之间的取舍就越微妙——超长会话里模型偶尔"忘事",到底是缓存压缩的锅还是注意力稀释的锅,目前没有谁给出干净的结论。另外蒸馏模型的训练数据来源争议、以及"便宜导致滥用调用量暴涨"的杰文斯悖论,都还悬着。技术上的账好算,生态上的账还得慢慢算。
回到开头那篇博客的标题。行业确实没激动,但我觉得激动错了对象——该激动的不是又出了一个强模型,而是"强"和"便宜"头一回在同一个小模型身上不吵架了。那么问题来了:如果明天你就有一个每天百万次调用的业务,你敢把九成流量交给一个"用起来感觉不到差别"的便宜模型吗?你们团队现在的小模型用量占比是多少?评论区聊聊,这个数字可能比任何跑分都有信息量。