☰
用墨子的兼爱与非攻,构建AI伦理自检框架
2026/10/7 17:17:27 网站建设 项目流程

如果让我从两千年的思想家里挑一位来当AI伦理顾问,我不会选孔子,不会选柏拉图,我会直接去战国找一个叫墨翟的人。理由是,这家伙大概是人类历史上第一个把“平等”和“工程”揉进同一条道德纲领的人。他一边讲着“兼爱”“非攻”,一边亲手设计了守城机械、做过木鸢,还研究过小孔成像。这种“理念先行、动手验证”的做派,和今天做AI产品的人几乎一模一样。

在“AI中国故事”这个系列里,我想做的第一场跨时空对话,就是和墨子。这几年AI大模型、智能体、生成式应用遍地开花,算法歧视、深度伪造、数据安全、AI agent失控的新闻轮番上热搜。大家聊伦理时,要么搬出一堆抽象原则,要么止步于“要负责任”的口号,真正能落进产品评审和代码审查里的方法论少得可怜。于是我把墨子拉进了会议室,用他的三个核心命题——兼爱、非攻、技术中立,重写了一份AI伦理自检框架。这篇文章就是那次思想实验的完整记录,适合AI产品经理、算法工程师、创业者,以及任何一个被“这件事AI能不能做”问住的人。

1. 为什么是墨子:AI伦理需要一套“反直觉”的底层逻辑

1.1 现代AI伦理的三个痛点,墨子恰好都踩过

最近这一轮AI热词里,“AI agent”“AI大模型”“AI编程”满天飞,看起来是技术狂奔,实际上一地鸡毛。招聘算法在筛选简历时默默偏向某些人群,信贷模型对特定地区的申请人给出离谱的评分,deepfake换脸视频在社交网络里泛滥,没有人说得清责任到底在哪。我参与过多次AI伦理评审,最强烈的感受是:大家不是没有原则,而是原则太抽象,落到代码和指标上根本没法用。

墨子的可贵之处在于,他给的不是一句口号,而是一组能执行的判断规则。他提出“兼爱”来处理人和人的关系,提出“非攻”来划定暴力与防御的边界,又用“三表法”来检验任何主张是否靠谱。这三件武器正好对应AI伦理的三大难题:算法公平、内容安全、技术责任。这不是巧合,因为墨子本人就是一个必须对实际后果负责的工程师,他知道一条规则如果没法指导施工,就只是纸上谈兵。

1.2 墨子是谁:一个被哲学史严重低估的工程师

很多人知道墨子是思想家,却忘了他是一个顶级工程师。他做木鸢,造云梯,研究小孔成像,还总结出一套工程方法。《墨子》里那些“备城门”“备梯”“备突”的篇章,全是实战守则,哪个地方要堆土、哪种器械用在哪种地形、守城时人员怎么分配,写得清清楚楚。他不像某些哲学家那样坐在树荫下空想“什么是善”,而是直接问:这个机关能不能守住一座城?那个防御方案会不会让百姓少死几个人?

这种工程师视角决定了墨子的伦理观是后果论和实用主义的。他衡量一件事的好坏,不看动机多高尚,而看能不能给最多人带来可检验的好处。这和AI伦理需要的“可度量、可回溯、可迭代”本质上是一个路子。今天我们要给大模型写安全规范,给推荐系统设公平约束,给智能体定行为边界,缺的恰恰不是价值观,而是一套能把价值观翻译成指标和流程的操作系统。墨子就是这套操作系统的原型。

1.3 为什么不是儒家、道家或康德

做选择的时候,我先把另外几个选项排除掉了。儒家的爱有差等,从自己出发一层层推出去,亲疏有别,落到算法里很容易变成“分群加权”,给核心用户更高的权重,给边缘用户降权,这本身就是对平等的损害。道家的无为而治适合做慢下来的提醒,但解决不了AI系统的责任归属问题——模型出错了,你不可能对着数据说一句“道法自然”就完事。康德的义务论讲绝对命令,听起来很高大,但操作时没人知道“普遍化原则”怎么转换成损失函数,怎么设置评估指标。墨子是少有的把“平等主义目标”和“工程实用手段”结合得非常紧密的思想体系,所以拿他做AI伦理底座,比从哲学史教材里随便抓一个流派都要顺。

当然,我不是说要回到两千年前去照抄答案。墨子的世界没有深度神经网络,也没有自主无人系统,但他的提问方式比答案更值钱:这件事有没有让弱者更安全?这套规则有没有给所有人同样的进入机会?当技术带来的好处和伤害交织时,你用什么东西来判断该不该继续?

2. “兼爱”的工程化解读:平等主义如何改写成算法守则

2.1 兼爱不是平均,而是“爱无差等”的权重设计

墨子说“视人之身若视其身”,讲的是“爱无差等”。这里最容易被人误解成平均主义——觉得平等就是把所有人的结果拉成一样。实际上墨子的兼爱更像一种“权重设计原则”:在决策模型里,每个个体的基本利益都应该被同等对待,不允许提前给某类人设定更高的道德权重。在AI场景里,这句话非常具体:你不能在训练样本中天然让某些群体缺席,也不能在特征工程里夹带身份歧视。

比如医疗AI,对不同发病率的人群采取不同的筛查策略,这是合理的差别化处理,不违反兼爱——因为目标是让每个人活下去的机会一样大。又比如内容推荐,给不同兴趣类别的用户推荐不同内容,也是合理的,只要背后的信息获取权利是平等的。差别化处理必须服务于底层权利的平等,而不是相反。如果一个系统因为用户的手机型号、居住地或口音而给出截然不同的服务质量,那它就是“爱有差等”,需要在设计阶段被纠正。

2.2 平等主义落地的四步审查法

在实际做算法公平审查时,我总结了一套可以照着做的流程,被称为“兼爱四步”。

第一步,拆数据。看训练集的人口分布、来源、标签是否完整,有没有系统性缺席。比如一个全国性的服务模型,训练数据如果集中在一线城市,它天然就不懂县域用户的表达方式。这个阶段要输出一份数据覆盖报告,列清楚每个关键人群的样本量。

第二步,测偏差。把测试集按性别、年龄、地区、设备类型等维度切分成多个子群体,分别跑模型,记录准确率、假阳性率、召回率的差异。很多模型在总准确率上很漂亮,一旦切到老年用户或少数语言人群,性能就断崖式下跌。

第三步,看特征。检查有没有使用敏感属性作为代理特征。最经典的例子是用居住地推测收入,用姓名推断出生地。有时候模型没有直接用“性别”这个字段,但它用了“兴趣爱好”“浏览内容”这些和性别高度相关的代理特征,效果是一样的歧视。

第四步,做逆向。专门构造边缘案例,去试探模型会不会给出羞辱性、歧视性的输出。一个招聘模型怎么评价体育特长突出的候选人?一个信贷模型怎么处理刚毕业且没有信用记录的人?这类案例在日常测试里很少出现,但恰恰是最容易暴露兼爱缺口的。

四步做完,最重要的是留下可审计的记录。否则后期出了问题,你连“当时为什么这么做”都说不清,那时候谈伦理就成了纯粹的事后背书。

2.3 一个真实案例:招聘AI的性别偏向与兼爱修正

我在一个流程中处理过一起典型的招聘AI性别偏向事件。某公司用历史简历数据训练简历筛选模型,上线后内部员工投诉模型对女性候选人打分明显偏低。排查时发现,训练数据里过去十年录用记录中男性占比超过70%,再加上男性在某些岗位的留任率更高,模型就悄悄学到了“男性特征=高录用概率”。没有任何人写“歧视男性或女性”的逻辑,但系统行为已经带上了历史偏见。

用兼爱视角来看,问题不是模型有恶意,而是训练数据里的“差等”被模型固化了。修正过程做了四件事:重采样历史数据,按职位层级做分层平衡,避免基层岗位全是男性样本;去掉姓名、性别相关的原始特征和代理特征;在损失函数里增加公平正则项,让模型在性别维度上的预测差异受到惩罚;最后设置一个外部队列,每月抽一批新简历做对比测试,监督修复效果。

修复后,女性候选人在技术岗的召回率上升了十几个百分点,而整体录用效率没有明显下降。这个案例说明,平等主义不是慈善,而是让系统做决策时不被错误历史绑架。兼爱原则落进工程,不靠道德宣导,靠的是具体的数据操作和模型约束。

3. “非攻”的边界思维:AI安全与内容治理的防御性优先

3.1 非攻的本义是反对“攻”,不是反对“用”

墨子反对的不是战争本身,而是“攻伐无罪之国”。他支持的战争只有一种,就是防御——你好好的守城,敌人来了你要挡回去,这叫“守”。放到AI语境里,这句话可以直接翻译成一道技术边界:AI的能力没有阵营,但你不能用它去“攻”——不能用它制作高精度诈骗、自动生成投毒言论、绕过安全措施去牟利;用AI做防御——反欺诈、漏洞检测、威胁情报分析、敏感信息过滤——则应该大胆支持。

这条边界在工程伦理里经常被绕过。做网络安全的人会说“研究攻击方法是为了防御”,做营销AI的人会说“我只是优化转化率”,做语音克隆的人会说“这个技术也有正用处”。非攻原则要求一个额外的判断:这个系统的最终服务对象是谁?如果主要服务对象是一群试图伤害他人的人,那不管它声称有多少“顺带的好处”,在伦理评审里都应该被叫停。

3.2 AI军事化与自主武器:为什么防御性应用可以接受

关于自主武器,国际上的讨论已经很多,这里不需要重复所有条款,我只想引用墨子的一条分界线:不可用于“攻”,可保留于“守”。用AI做目标识别辅助人工决策,做无人机集群的防御拦截,做网络攻击的溯源与止损,这些属于“守”,应鼓励继续探索。让AI在无人监督的情况下自主决定是否对一个目标发起攻击,无论声称有多少战术优势,都越过了非攻的红线。

有人会说,攻和守很难分,一个系统既能拦截攻击,也能发起攻击。墨子的答案也很实用:看主要用途和实际影响,看它是不是让更多普通人更有安全感。一个能防住勒索软件的AI系统,和一个能自动生成钓鱼邮件的AI系统,就算底层技术是同一套,它们在伦理审查里的命运也应该完全不同。技术底座共享,但部署意图和目标决定性质。

3.3 生成式内容的安全边界:从深度伪造到无限制聊天

现在生成式AI的滥用,最典型的就是deepfake换脸和虚拟人诈骗。深伪让公众不再相信视频证据,也让人工审核越来越难。我自己在做内容合规时,最头疼的不是模型不会写,而是模型太会写,让你分不清哪一句是真的。如果一个AI可以在几秒内生成一段以假乱真的“某人说过的话”,那它对整个信息空间的伤害是结构性的。

应对方案上,非攻原则给了明确方向:AI生成的内容必须能被识别,必须保留来源标记。水印、数字签名、来源追溯,这些技术不是限制创新,而是给信息空间装上“守城器械”。对于市面上那些宣称“无限制聊天”“没有任何边界的生成模型”,我的态度一直是:真正的自由不是没有边界,而是边界内的自由。一个连自己生成什么都不能被追溯的模型,不该被直接暴露给公众。限制指令不是目的,防止伤害才是。

这条逻辑可以直接落地到产品设计:生成内容要加不可见水印,公开平台要提供来源校验工具,模型服务要设置滥用检测与熔断机制。每一项都是在做“守城”,防止技术这个曾经的守具被拿去攻城。

4. 技术中立与实用主义:墨子教我们如何评价AI的善恶

4.1 技术中立不等于价值中立:工具本身无辜,目标不是

“技术中立”这四个字已经被滥用得太狠了。每次AI出了问题,就有人跳出来说“算法只是工具,人才是坏的”。墨子不会同意这种甩锅。他承认技术本身有中性面,但认为技术的具体形态和部署方式已经包含了设计者的取舍。一把刀不能决定自己是切菜还是伤人,但制刀的人可以决定卖给谁、怎么用。

在AI伦理评审里,我最反感的一句话是“我们只提供技术,不负责使用”。正确的做法是:如果你明知某个能力大概率会被用来做坏事,就不能假装自己不知道。比如一个文本生成接口,如果放出去三天就被玩家用来自动生产诈骗话术,那就应该在上线前就加好风控,而不是等新闻曝光后再补条款。技术中立只能作为起点,不能作为终点。起点是承认技术可能做好事也可能做坏事,终点是要求设计者和管理者对实际后果负责。

4.2 墨子的“三表法”:一套适用于AI项目的价值评估模型

墨子提出检验真知的“三表”:有本之者,有原之者,有用之者。翻译成今天的AI项目语言,就是三张必须填的表。

“本”是理论依据和历史经验。对应到模型,就是你的基准测试有没有根据?训练数据来源是否清晰?模型架构和论文复现链是否可靠?很多团队喜欢拿一个公开榜单的分数说事,但换到自己的业务数据上就失灵。这里要填的是“你的模型为什么值得信任”。

“原”是现实情况和民众反应。对应到项目,就是有没有倾听真实用户和受影响者的反馈?用户访谈里有多少样本来自真实使用场景?被系统误伤的人有没有渠道说出自己的遭遇?很多产品上线前只做了“我朋友觉得挺好”,这远远不够。

“用”是实际效果和长期影响。对应到上线后的指标监控和伤害复盘:除了转化率、留存率这些增长指标,有没有关注投诉率、退出率、被拒用户的感受变化?长期影响往往是反直觉的,一个让活跃用户变多的推荐策略,可能正在悄悄加深信息茧房。

我在做项目评审时,要求每个AI功能都要填一张三表。这张表不是摆设,而是逼着团队说清楚:你的跑分是真实的泛化能力,还是只在特定数据集上自嗨?你的用户研究有没有覆盖到那些被算法“分配”到边缘的人?你的业务指标里有没有包含对受害者侧的度量?这些问题听着不酷,但能挡住绝大多数表面光鲜的坏方案。

4.3 实用主义的底线:有用性必须通过“兼爱/非攻”校验

墨子的实用主义不是唯利润论,而是“兴天下之利,除天下之害”。一项AI技术的“有用”,必须同时满足两个条件:它能给大多数人带来可观察的好处;它没有系统性地伤害某个群体。如果一项技术确实能提高效率,但代价是让某个弱势群体无法获得同等的服务,那在兼爱框架下就是不义,不管它多赚钱。

这个逻辑可以直接指导商业决策。比如贷款风控模型,通过率提升5%是功,但误伤率提升2%就是害。如果团队只盯着前者,就是在用“局部有用”掩盖“整体有害”。把“有用”定义成净收益,而且是分布相对公平的净收益,才是真正的实用主义。

有时候团队会问:那我们是不是不该追求商业回报了?不是。墨子自己也很务实,他强调“交相利”,认为好政策必须让参与的人得到好处。关键是好处不能只给少数人,负担不能总压在另一些人身上。AI商业化不是问题,问题是收益和风险是不是被公平分配。

5. 把墨子搬进产品决策:一份可复用的AI伦理自检清单

5.1 步骤一:列出受影响者,检查“兼爱”缺口

每次启动一个AI项目,我都会先做一张“受影响者地图”。列几类人:主要用户是谁,次要用户是谁,谁会被排除在服务之外,谁对系统结果没有申诉能力。然后逐条检查:训练数据里有没有覆盖所有人?模型对不同身份、地域、设备类型的人表现是否一致?被系统判定为“低质量用户”或被拒绝服务的人,有没有明确的解释和申诉通道?

比如做一个语音客服机器人,如果你只测试普通话标准口音的用户,那带方言口音的用户就是受影响者地图里的“结构缺席”。一个连基本服务都听不懂的群体,会在系统里越用越愤怒,最终被无形排除。兼爱缺口检查的核心,就是找到这些没有被看见的人。

5.2 步骤二:评估应用场景,标记“非攻”风险

对AI能力做风险分级,我把它分成“守”“误”“攻”三档。“守”是防御性应用,比如垃圾邮件过滤、欺诈识别,可以放心搞。“误”是可能有滥用风险但有正当用途的场景,比如文本生成、语音合成,必须加护栏。“攻”是初始目的就包含伤害他人的应用,比如自动生成钓鱼内容、深度伪造性内容,直接砍掉,不考虑任何商业上的辩解。

关键问题有三个:这个能力会产生伤害性内容吗?它可能被哪些恶意角色利用?如果被滥用,防御成本高吗?在做风险标记时,我习惯把“被滥用后的最小代价”也写下来:一个技术如果被滥用后会造成现实世界的暴力伤害,那无论它的正常使用比例有多高,都必须被当作高风险处理。

5.3 步骤三:用三表法做技术中立审查

接着填三张表:理论证据、用户反馈、上线效果。理论证据包括基准测试、数据集说明、模型卡片;用户反馈包括访谈记录、投诉分析、可用性测试;上线效果包括核心指标、伤害指标、回滚预案。如果任何一列缺失,开发计划里必须补上,否则不允许发布。

这三张表听起来很重,但如果从项目第一天就开始维护,其实只是日常工作的留痕。怕的是上线前一天才开始补材料,那只能变成编材料。三表法最大的价值,是让伦理审查从“开会讨论知道”变成“写进流程必须做”。以后审计或出问题时,你拿出的是一堆可追溯的文档,而不是一句“我们当时认为”。

5.4 综合评分与迭代:一个简单的门槛规则

最后把三步结果汇总成一张评价表。我给客户团队看的时候通常用下面这种格式:

维度核心问题通过标准
兼爱受影响者是否有结构性代表缺失?训练数据覆盖可接受,子群性能差异在阈值内
非攻是否存在被恶意利用的高风险路径?高风险路径都有护栏,防御成本低于滥用收益
三表理论、现实、效果三个证据是否齐全?证据有可审计记录,缺项有明确的补齐计划

每一项按0到10打分。兼爱项低于6分,就必须回炉做数据补采和公平性修正;非攻项只要有“攻”场景,直接一票否决;三表项低于7分,暂缓上线直到证据补齐。这个打分不是绝对标准,每个团队可以按自己的领域调阈值,但流程本身很有价值:它把模糊的“感觉不太对”转化成了具体的“哪里不对、差多少分、怎么补”。

5.5 我在一次智能客服项目里的实测记录

最后分享一个我自己的实测案例。某次帮一家公司做智能客服升级,模型在整体测试集上表现不错,但用兼爱清单一查,发现老年用户群体上的任务完成率远低于平均值。原因不复杂:训练语料里年轻人表达的句子比重过高,模型对“手机怎么充话费”这类老年常见问题的理解很弱,而且回复风格偏短、偏网络化,老年人看着费劲。于是我们补采了一批老年用户语料,调整了回复的语速和复杂度,增加了“转人工”的优先级,上线后老年用户满意度明显上升。

同一个项目里,我们还发现客服AI可以被用来发送恶意内容,比如有人故意用特定Prompt诱导模型输出辱骂性回复。按照非攻风险标记,这属于“误”级场景,需要加护栏。我们加了一道输出安全过滤,并在敏感区域保留人工抽检能力。处理完之后,系统既保留了AI客服的高效,也没有变成一台无人看守的自动骂人机器。

那次实测给我最深的体会是,墨子伦理看起来古老,实际运行起来每一个都是具体而微的修正。技术中立是对真实世界的诚实,兼爱是对每个具体人的承诺,非攻是对边界感的自觉。下一次做AI伦理评审,我大概还是会请墨子来会议室坐镇。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询