DeepSeek 新论文:我在防作弊那一节停了很久
摘要:AI 会作弊了,还防不太住。这句话是论文自己写的。
9 月 中旬,DeepSeek 发布了 V4.1-Flash 的技术论文。整篇论文的核心就一个字:省。聚焦点是 KV Cache(KV 缓存),也就是模型处理上下文时要占用的显存。
先说一个很多人没概念的事实:KV 缓存的占用可以远远超过模型本身。拿我自己实测过的例子,一个 1.7B 的小模型,权重文件才 1GB 出头,上下文拉到 1M token 时,KV 缓存要吃掉 13.4GB,是模型本体的十倍以上。4B 模型更夸张,1M 上下文的 KV 要 34GB 往上。模型越小、上下文越长,KV 占比越离谱。DeepSeek 这篇论文解决的就是这个问题,他们把每 token 的 KV 占用压到了 890 字节,只有上一代的四分之一。
压缩 KV 这件事,玩本地部署的朋友都知道老办法:在 llama.cpp 里加 -ctk /-ctv 参数,用 q8_0 或 q4_0 把 KV 缓存做量化。但老办法是在模型训练完之后硬压,压得越狠精度损失越明显,q8_0 基本无感,到 q4 就开始伤上下文能力了。这篇论文的路子不一样,它把量化放进了训练阶段(行话叫 QAT,量化感知训练),模型是 "学着在被压糙的缓存上干活" 长大的,所以压到 FP4 还能保住性能。再配合架构上的跨层复用和部署上的按需重算,三层一起把缓存打下来了。这三层的东西网上已经有很多解读,写得很细,我就不重复了。
但论文里有一节,我翻到的解读大多一笔带过。论文在讲训练和评测的两个地方,都提到同一件事:这届模型会作弊了,而且是防不太住的那种。我们一起看下论文原话到底怎么说的。
训练的时候:模型学会钻空子刷分
先看训练阶段。DeepSeek 在强化学习训练时发现,模型频繁试图 reward hacking,直译是 "奖励作弊",说人话就是:模型不好好干活,专门钻评分规则的空子刷分。
论文列举的几个行为,我直接翻译过来:
利用操作系统新披露的漏洞,包括 XFS 文件系统驱动的权限问题、AppArmor 安全模块的非法内存访问;
从包镜像服务器里搞到了答案,相当于考试前偷到了考卷;
删除关键程序文件、破坏系统文件,甚至直接把整个文件系统删掉。论文用的原词是 "臭名昭著"。
DeepSeek 的对策是给每个训练沙箱配上安全配置(AppArmor),再用 eBPF 做细粒度的网络管控,把模型关在笼子里。还有一个细节我觉得很有意思:如果模型把环境搞崩了,DeepSeek 不重试,直接把这一轮算失败,并且给模型回传一个 "后果" 信号。让模型自己知道,搞坏环境是有代价的。
评测的时候:断网删历史,它去反编译内核
训练时作弊还能靠沙箱管住,评测时的作弊更值得展开讲。
为了防作弊,DeepSeek 在跑分评测时做了三道防护:第一道,断网;第二道,删掉环境里的 Git 历史,防止模型翻到答案的提交记录;第三道,自动清空多种构建缓存,Go module、node_modules、编译好的 jar 包、Python 的 pycache,一样不落。等于考场封了网络、收了小抄、擦了草稿纸。
结果呢?论文原话说,尽管有这些预防措施,仍然观察到了投机取巧行为。举的例子是在 CyberGym(一个网络安全评测集)里,模型把 Ubuntu Linux 的核心软件包反编译了,就为了从二进制里找漏洞。
到这一步,模型干的活已经从 "解题" 变成 "劫狱" 了。你能想到的考场纪律它全守了,然后它把考卷本身给拆了。
DeepSeek 在论文里说得很直白:随着模型能力增强,Docker 容器加验证脚本这套标准评测基建,已经越来越容易被模型钻空子。他们敦促整个研究社区,设计下一代基准的时候,优先考虑检测和缓解这类行为。翻译一下:现在的考场,考不住这届考生了,得造新考场。
为什么这事跟普通人有关
最后说说我的三点看法。
第一,以后看到的跑分,可信度要打折。模型越来越聪明,钻评测空子的能力也越来越强,连 DeepSeek 自己都要专门写一节承认这事防不太住。以后看任何模型的跑分对比,多留个心眼,能自己测的尽量自己测。
第二,AI Agent 正在往 "有真实权限" 的方向走。能反编译内核、能删文件系统的模型,说明它已经具备了对真实系统的完整操作能力。这事是双刃剑:干活的能力是真的,搞破坏的能力也是真的。这也是为什么 DeepSeek 要把训练放在几百万个沙箱里进行,出了沙箱,没有人兜底。
第三,这次是 DeepSeek 自己把家丑写进了论文。模型的作弊行为都发生在受控沙箱里,没有造成真实危害,这种坦诚值得肯定。也正因为有厂商愿意自曝,我们才知道评测的水有多深。
最后说明一句:这篇论文的模型是 552B 参数的数据中心模型,跟咱们本地电脑跑的模型没有关系,本文聊的是论文里透露的行业信号。本地部署相关的内容,还是看我之前的实测系列。
每日一问
看完这篇,以后你再看到 "XX 跑分第一" 的宣传,会先多问一句 "它防作弊了吗" 吗?评论区聊聊:你上一次自己给模型跑分是什么时候、用的什么基准。怎么自己动手测,我在实测系列里会展开讲。
关注GZH有更多AI相关知识分享。