前阵子家里小侄女开始学说话,一岁多点的孩子,家里方言、普通话混着来,她居然能自动切换,跟爷爷奶奶讲方言,跟幼儿园老师讲普通话。我一边觉得神奇,一边想到自己天天打交道的AI大模型,两者放在一起看,特别有意思。人类语言作为一种符号系统,核心特征是无限嵌套结构,而且完全靠后天习得,婴儿放到任何语言环境里都能学会当地语言;而AI学语言,看起来是另一个故事,但底层逻辑又有惊人的呼应。这篇就把这些观察掰开揉碎讲清楚,也聊聊我踩过的坑。
很多人以为AI会说话,是因为它“背”了很多语料,其实远不止这么简单,语言本身也不是大家以为的“单词表+语法规则”。要理解AI和语言的关系,得先从语言到底是什么说起,尤其是那个让无数研究者头疼又着迷的无限嵌套结构。
1. 语言不是“单词表”:符号系统的底层逻辑
1.1 为什么“无限嵌套结构”才是语言最核心的特征
先做一个思想实验。“张三说李四认为王五知道陈六不喜欢赵七”,这句话听着绕,但任何一个母语者都能秒懂,而且能继续往下套:“张三说李四认为王五知道陈六不喜欢赵七养的猫的毛色”。理论上,这个句子可以无限加长,永远不重样,这就是语言的递归性,或者叫无限嵌套结构。
这个特征在动物沟通里是不存在的。蜜蜂跳舞能传递蜜源方位,猴子报警声能区分老鹰和蛇,但它们的信号系统是封闭的,永远无法表达“昨天我梦见一只猴子说隔壁山头有一棵新的果树”。人类语言之所以能承载文明、法律、哲学、科学,靠的就是这个“有限规则生成无限句子”的能力,就像用一套有限的乐高积木块,能拼出理论上无限多种造型。
我见过很多非语言学背景的人理解不了这个概念,觉得“不就是套娃嘛”。对,但正是这个“套娃”区分了人类符号系统和动物的信号系统。每一次嵌套都意味着一个新的语法层级,而人类大脑能实时解构这些层级,不用打草稿。这个能力,至今没有任何一个AI模型能真正复现,哪怕它已经能写出漂亮的文章。
有一阵我把相同逻辑的中文长句丢给不同的大模型,让它们判断主语和谓语的关系,结果参差不齐。深层嵌套超过三四层,模型的准确率就开始跳水。这不是工程优化能简单解决的问题,背后触碰的是“递归能力到底能不能被统计学习涌现出来”的根本问题。
1.2 后天习得的证据:婴儿语言学习与输入驱动
标题里有一句很关键的话:婴儿在任何语言环境中都可以习得当地语言。这句话背后是语言学里著名的“先天后天之争”。一个中国婴儿被美国家庭收养,长大说话就是地道英语,反过来也一样。语言不是靠血脉遗传的,它完完全全是后天习得的,靠的是环境里源源不断的语言输入。
但这里有个特别诡异的点:婴儿接收到的语言输入,质量并不高。大人对小孩说话有“儿向语”,有停顿、重复、夸张的语调,但也有很多破碎的句子。理论上这么差的输入,任何统计模型都很难学会一门语言,但婴儿在三四岁内就搞定了。这就是所谓的“刺激贫乏”问题,也是乔姆斯基提出普遍语法的核心理据:如果输入不足以解释习得结果,那大脑里必然有一些先天结构在帮忙。
我做了十几年跟语言相关的研究和工程,越来越觉得这个问题的分量。把婴儿扔进英语环境,他学会英语;扔进日语环境,他学会日语。这说明人类大脑的语言习得机制,并不是为某一种特定语言定制的,而是一个通用的、能适配任何符号系统的“语言机”。这台“机器”接收环境输入,然后自动提取规律、生成规则、建立层级结构。
对比来看,AI大模型的训练也是输入驱动:扔给它海量英文语料,它学会英文;扔给它中文语料,它学会中文;扔给它双语文料,它自动学会翻译。从“适应输入环境”这个角度,AI和婴儿惊人地相似,都是“给什么语言环境,就习得什么语言”。但相似也就到此为止,往深了看差别巨大。
2. AI“学”语言的路径:预测下一个词是怎么演变成能力的
2.1 大语言模型与统计学习的底层机制
大语言模型的核心任务,说穿了就一个:预测下一个token(词元)。给定一串前文,算出下一个最可能出现的词是什么。这个机制简单到有点无聊,但规模上去之后,涌现出语法能力、推理能力、甚至某种类似于理解的行为。
我用一个比喻解释给朋友听:大模型像一个极度擅长接词的游戏玩家。你给它“今天天气真”,它接“好”。你给它“张三说李四认为”,它接“王五”。在几万亿个token的训练中,它其实是在对全世界人类说过的话做了一次超级压缩,把语言中的统计规律、句法偏好、语义关联,全部压进了几千亿个参数里。
关键转折发生在模型的规模跨越某个阈值之后。三年前我一个做NLP的朋友跟我说,他们当时训了个小模型,让它填空“因为下雨,所以___”,模型勉强填“带伞”;后来换了更大的模型,同一个空位,它能填出“比赛推迟”“路面湿滑”“心情烦躁”这种有推理色彩的答案。这不是谁写了规则,而是统计规律在海量参数下自动涌现的。
训练过程本身不近人情:模型没有“童年”,没有“跟妈妈学说话”的温暖场景。它面对的是从互联网抓取的万亿级文本,在里面找规律。它能学会形容词修饰名词、从句嵌套、转折关系,全凭自监督学习,没有人给它标注过“这是主语”“这是从句”。
2.2 AI学的到底是符号还是语义
这是我最常被人问到的问题:AI处理的是符号,但它真的懂语义吗?我的观点是:它学的并不是传统意义上的符号规则,而是一种分布式的、稠密的“语义空间”。每一个词被映射成高维空间里的一个向量,中文的“苹果”和英文的“apple”,在各自语言空间里的向量位置非常接近,因为它们在上下文中扮演的角色相似。
这个思路跟人类语言习得有相通之处。婴儿学“苹果”这个词,并不是先学“苹果的定义”,而是通过无数次听到“吃苹果”“红苹果”“苹果熟了”这样的搭配,慢慢在大脑里建立一个“苹果”的语义簇。人类和AI都在用“上下文统计”来逼近语义,只不过人类有物理世界的感知做锚点,AI只有文本的共现关系。
但这里有一个致命差异:人类能说“其实我不太会形容那种感觉,就是很……你懂吧?”,因为我有身体经验、有情感、有对世界的触觉。AI说同样的话,只是因为它学到“当人类表达局限时会这样措辞”,它并不真的“懂”那种感觉。Grasshopper理解不了“青草的味道”,因为它没有嗅觉;AI理解不了“疼”,因为它没有神经。
所以在做AI应用的时候,我始终提醒自己和团队:别把AI当成人来要求。它是世界上最好的“文字接龙选手”,但它的“理解”是一种高阶统计建模的结果,不是符号系统里那种基于指称和真值的理解。理解了这一点,很多技术选型和产品设计就不会走弯路。
3. 递归难题:AI最像人又最不像人的地方
3.1 模型为什么经常栽在深层嵌套句子上
我给市面上主流的大模型做过一个“递归压力测试”:构造不同嵌套深度的句子,要求模型回答主语是谁、宾语是谁、谁说了什么。
- 嵌套一层:“小王说小李喜欢读书。”问:谁喜欢读书?模型基本全对。
- 嵌套两层:“小王说小李认为小张讨厌开会。”问:谁讨厌开会?部分模型开始犹豫。
- 嵌套三层:“小王说小李认为小张知道小赵不喜欢加班。”问:小张知道什么?大量模型答错。
这个现象在学术圈有个专有名词:递归瓶颈。大模型是“前馈式”地处理文本,注意力机制虽然能看到整句话,但它在建立深层嵌套关系的时候,需要跨越多层依赖,这会让模型内部的注意力分散。
做一个类比:人类的短期工作记忆大约能同时处理四到七个信息块。如果你连续读一串嵌套从句,到第五层也会卡壳,需要回读。人类靠“回读+句法树构建”处理递归;而大模型没有真正的“回读”机制,它一次性把整句话编码进上下文窗口,然后直接输出答案。它不能像人一样“边读边构建层级树,藏几层在脑子里,再逐层展开”。
我经常说,大模型有“广度”没有“深度”。它能同时关注一万个token的统计关联,但没法在这万个token里精确维护一个深度为五的句法树。这跟人类正好相反,人的工作记忆上限很低,但递归层级处理能力极强。
3.2 工作记忆与递归层级:人类和机器的分岔路
人类婴儿学语言时,并不是在学“序列概率”,而是在学“结构”。一个两岁孩子说出“妈妈不让我吃糖”,已经体现了三个层次:妈妈(主语)+不让(否定+使令)+我吃糖(宾语从句)。孩子能说出这句话,说明他脑子里构建了一个句法层级,而不是靠背下来的。
人类大脑对递归的处理,有一个被广泛讨论的神经基础:布罗卡区。这个脑区与语法加工密切相关,而且有意思的是,它同时参与音乐结构、动作序列的层级组织。也就是说,人类大脑里可能存在一个通用的“层级生成器”,语言只是它的一个输出通道。
大模型没有这样的结构,它靠的是注意力矩阵里的大量线性和非线性变换,去近似那些层级关系。近似在简单场景下够用,但在深层嵌套、逻辑推理、跨步骤规划这些任务上,就暴露了本质上的短板。
这是我在很多项目里反复遇到的情况:要求AI写一段复杂的多条件判断代码,它写得头头是道,但执行起来逻辑漏了一环;让它解析一个多层嵌套的JSON结构并提取某条深层路径,它可能路径拼接出错。因为这些任务都依赖真正的“结构递归能力”,而目前的大模型只是从概率上“模仿”了这种能力。
4. AI反哺语言研究:“符号系统”是否需要被重新审视
4.1 从乔姆斯基的语言观到大模型的分布式表征
乔姆斯基的语言学革命,核心是把语言当成一种符号计算系统:有限的规则生成无限的句子。这个框架统治了语言学半个多世纪,也催生了计算机科学的很多基础概念,形式语言、上下文无关文法、编译原理的“递归下降解析器”,源头都在这里。
但大模型的成功,让一部分人开始反思:也许语言并不需要一个显式的、人工设计的规则系统。大模型没有任何显式语法,它照样能写出合乎语法的句子。这个事实是不是说明,人类语言的底层可能也不是“规则”而是“统计”?
我持一个折中的看法:乔姆斯基是对的,人类语言确实有递归生成能力,这是统计学习难以解释的。但大模型的成功也证明,许多我们认为需要“规则”才能完成的任务,可以通过大规模统计建模实现惊人的近似。语言既是“规则系统”,也是“统计系统”,人类的习得过程中两者都在起作用。
想象一下:婴儿确实有某种先天的语言倾向,但这不意味着它脑子里已经写好了“把动词放第二位”的德语规则。更像是一个“结构搜索器”,它非常擅长从输入中提取句法模式。而大模型恰好也是在提取句法模式,只是用了完全不同的机制。殊途同归,但未必同归到同一个终点。
4.2 语言研究的方法论转向:从“规则推导”到“分布验证”
大模型的另一个贡献,是给了语言学研究一整套新的工具和方法。以前语言学家靠内省判断一句话是否合法,“这个句子我读着别扭”就是证据。现在可以做大规模的语料库统计,用模型来验证或挑战这些直觉判断。
我认识一个做句法学的老师,最开始对大模型嗤之以鼻,后来真香了。他用模型做了一项研究:把两种有争议的歧义句式各生成五千个变体,让模型打分,看哪些变体被模型认为是自然的。结果发现模型的偏好和人类母语者的判断高度相关。他说这给了他一个“数字化的内省渠道”。
当然这种方法有它的局限:模型的学习材料来自人类语料,它的“语感”本质上是人类语感的压缩和平均化。但恰恰是这个特性,让它成了研究“语言统计规律”的利器。过去我们只能盯着有限的语言样本猜测规律,现在可以用模型的表征来计算词的语义距离、句法的复杂度、语言的演化轨迹。
这种转向,对于“语言是先天还是后天”这个老问题也有新启示。如果大模型完全靠后天输入就能表现出像样的语言能力,那说明后天输入里包含的信息量,可能比乔姆斯基当年估计的要大得多。反过来,人类婴儿输入的质量远低于大模型,但习得效率远高于大模型,这说明人类大脑里确实有某种“高效学习算法”。两相对照,反而把先天论和后天论之间的张力,推到了一个更清晰的层面上。
5. 实操心得:带着这个认知用AI,能少走很多弯路
5.1 如何正确评估一个模型的语言能力
基于上面的分析,我总结了几个实操经验,专门讲怎么评判一个大模型到底“行不行”,而不是被它自然流畅的输出迷惑。
第一,测复杂度分级输入。不要只测日常对话,要设计包含让步、转折、多层嵌套、抽象指代连贯的文本。比如:“虽然项目A的利润率比项目B低,但考虑到项目B的交付周期更长且存在供应链风险,因此最终我们决定……请归纳决策原因。”能处理好这种句子的模型,语言能力才算及格。
第二,做“反向印证”测试。让模型解释自己之前给出的答案,或者换一种表达复述一遍。一个真正“理解”了结构的模型,应该能用不同句式还原同一个逻辑。如果它复述时逻辑变了,说明它之前只是“概率上接对了词”。
第三,留意跨语言一致性。一个语言能力强的模型,用中文输入和用英文输入同一个复杂逻辑,应该给出等价的答案。我见过很多模型中文表现很好,一换到英文细节就丢失,这是分布式语义空间建设不均衡的表现。这也侧面印证了“任何语言环境都能习得语言”这个特性:AI也是一样,语料足就强,语料少就弱。
5.2 几个提高模型嵌套理解效果的提示词技巧
实测下来,有几个提示词写法能明显提升模型在递归类问题上的表现,都是踩坑换来的。
把长句拆细,显式标注层级。“请按下面的层级关系解析——第一层、第二层、第三层——然后回答问题。”模型在输出时就多了一层结构化引导,能抵消一部分注意力离散。
用“自问自答法”引导思维链。不要直接问“谁被谁说服了”,而是让模型先列出问题涉及的实体,再分别描述实体关系,最后给出结论。这个从“回忆某类任务”到“结构化推理”的过程,本质上是在给模型搭树干,帮它建立层级感。
给模型做“翻译式预演”。把原始复杂句改写为更简单的同义短句,再基于改写版本作答。这个操作能帮你判断模型是理解了结构,还是只记住了措辞。如果改写版本的回答和原文版本不一致,那基本可以断定是后者。
另外,千万不要让模型一次性处理太多嵌套层级。实测超过四层的复杂指令,几乎没有模型能稳定完成。这不是说以后不会突破,但就目前而言,把任务拆成多轮,每轮处理一层结构,是最稳妥的做法。
还有一个小技巧:让模型先在代码块里画一个文本形式的层级树(不用真画树,用缩进列表即可),再基于这个“树”来回答。模型在生成带缩进的结构时,会迫使其内部表征更接近树状,回答准确率明显提高。这个技巧在我做的几个文档解析项目里效果非常好。
5.3 语言习得视角下的AI产品设计启示
最后聊点产品层面的体会。做AI产品的人,与其整天追求“更像人”,不如抓住语言习得的本质:适应输入环境。
你给系统设计什么样的语境、什么样的反馈机制,它就会变成什么样的“语言者”。婴儿习得语言靠的是大量真实互动中的输入输出循环,而不是死记硬背。AI产品如果只是被动接收指令,不设计反馈循环,那它的能力天花板就会锁死在语料的平均表现里。
我做一个客服机器人项目的时候,初期模型表现很僵,什么话都按标准答案答。后来我们改变了策略:让模型在每次对话结束时主动总结用户的意图,并反问一句确认。这个简单的“反馈循环”让模型在一周内对用户意图的识别准确率提升了近20%。原理不复杂:它通过总结和确认,获得了“更高层的语义上下文”,类似于人类在对话中通过回应来校准语言理解。
只要抓住“结构嵌套能力+输入环境适配”这两个核心维度去设计和评估AI,你会发现很多过去“玄学”的现象都变得可以解释、可以预期。
我自己在做项目复盘时有一个很深的感触:语言真的是人类区别于其他物种的独特符号系统,无限嵌套结构是它的灵魂;而AI最让人着迷的地方,恰恰是它在没有“灵魂”的前提下,用统计逼近了这门符号系统的门面。婴儿在任何一个语言环境里都能习得当地语言,这是亿万年进化出来的奇迹算法;大模型在任何一个语料环境里都能习得当地语言,这是人类造出来的另一个奇迹。两者之间隔着一道递归的鸿沟,但也正因为这道鸿沟,我们才更清楚地看到人类智能的特别之处。
以上这些经验,都是我实际摸爬滚打总结出来的,不敢说对每个模型每个场景都适用,但方向是稳的。下次你再被某段AI生成的行云流水的文本惊艳到,不妨拿一组嵌套结构去测测它,看看它到底是真懂结构,还是又一次漂亮的文字接龙。