☰
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
2026/10/3 8:32:00 网站建设 项目流程

文章主要内容总结

本文针对大型语言模型(LLMs)的价值观对齐问题,提出了一种名为Controlled Value Vector Activation (ConVA)的框架,旨在通过直接调控模型内部的价值表征,使LLMs与人类价值观(基于Schwartz的10种基本价值观理论)保持一致,同时避免牺牲模型性能和输出流畅性。

具体而言,ConVA包含两个核心部分:

  1. 上下文控制的价值向量识别:通过构建上下文可控的数据集(确保正负样本仅在目标价值观上对立,其他无关上下文一致),消除传统数据集的上下文偏差,准确识别模型潜在空间中编码价值观的向量。
  2. 门控价值向量激活:基于识别出的价值向量,引入门控机制判断输入是否与目标价值观相关,仅对相关输入施加最小程度的激活调控,在保证价值观一致性的同时,维持模型在无关任务上的性能。

实验表明,ConVA在10种基本价值观上的控制成功率(CSR)显著高于现有方法(如ICA、CAA、SFT),且输出流畅率(FR)保持在97%以上,即使面对包含相反或恶意引导的输入,仍能稳定输出符合目标价值观的结果。

创新点

  1. 上下文控制的价值向量识别:通过成对生成正负样本(仅价值观对立,其他上下文一致),消除数据集的上下文偏差,首次实现了对LLMs内部价值表征的无偏解读。
  2. 门控价值向量激活:扩展概念激活向量(CAV),引入门控机制和约束优化,实现对模型激活

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询