一家零售企业的客服助手在试运行阶段遇到过一个问题。有用户询问退款申请需要满足哪些条件,助手给出的回答里,除了条件本身,还带出了一串内部编号和一段原本留在系统里的判定说明。
客服主管看到这段回复之后意识到,问题不在答案对与不对,而在助手把面向内部的材料与面向用户的话术混在了一起。规则编号、字段名称、阈值参数、接口报错原文这些内容本来是给业务与运维人员看的,它们出现在用户面前,等于把企业的内部设定一同交了出去。
内部材料为什么会进入上下文
多数实现把配置说明、规则条文、字段释义与业务知识放在同一段上下文里,助手处理问题时看到的是全部内容,它按相关性挑选片段,并不区分这段内容原本适合谁看。接口报错的情况与此类似,工具调用失败时,系统把接口返回的原文一并交给助手,助手在组织回答时又把这句原文带了出来。助手本身没有对错的判断依据,它只看相关性,哪一段内容与当前问题接近就被选进来,内容的受众属性并没有参与筛选。
分层呈现需要什么配套
一类做法是把进入上下文的内容按受众分成两层,面向用户的一层只保留可以直接对外表达的结论与条件,面向内部的一层保留规则编号、字段名称、阈值与报错原文,两层各自带有标记。模型用于决策的内部规则与用于对外表达的内容应分离管理,内部规则可以参与权限允许的决策过程,但不应直接进入用户可见输出,最终回答应通过对外话术层重新表达必要结论。
分层之外还缺一层控制。知识条目应携带受众与敏感级别元数据,检索阶段先按当前调用场景、用户角色和输出渠道过滤可进入生成链路的内容,避免不应暴露的材料一开始就被无差别召回。越早阻断越稳,这能形成“存储分级 → 检索过滤 → 决策使用 → 对外表达 → 输出检查”的完整链路,而不是主要靠最后一道过滤器兜底。
另一类做法是在输出之前加一道检查。系统把候选回答与内部材料清单做一次比对,命中清单的内容被拦截,助手改用面向用户的话术重述。这道检查有用但仍不够稳,内部信息可能被模型换一种表达说出来,例如内部规则写明“退款金额超过5000元需二级审批”,模型输出“金额达到五千以上时会进入更高一级审核”,字面已经不同,信息本身仍然泄露。更稳的方式是把清单比对升级为两道防线,前置隔离是主防线,内部材料应在进入上下文之前就按受众、敏感级别和用途做结构化分级;输出检查是第二道防线,输出阶段再做二次安全检查,检查对象不只包括原文匹配,还包括内部阈值、字段语义、规则逻辑等敏感信息是否被直接或变相暴露。拦截之后的重述同样要有依据,助手不能凭空改写,它应当从面向用户的话术模板里取用表述,模板覆盖不到的情形改为转人工说明。这道检查需要与知识更新保持同步,规则或者字段发生变化时清单要一起更新,否则新加入的内部材料会绕过检查。
工具返回的报错信息应当先在链路里处理一次。系统把接口返回的原文转成面向用户的提示,说明当前无法完成并给出可以操作的建议,不进入助手可见的内容范围。原始错误在进入日志前仍应做秘密信息和敏感字段裁剪与脱敏,只保留排障所需内容,并限制访问权限与保存周期,否则在防止用户看到内部信息的同时,反而把Token、Cookie、API Key、内网地址、SQL、客户个人信息与请求参数等秘密完整落到日志。
规则变化时要一起维护的内容
内部材料与对外话术的对应关系需要有人维护。规则条款、字段名称、话术模板这三样在一条规则上线时同时登记,规则变更时三样一起更新,登记表里保留变更时间与责任人,避免出现话术已经改好而清单还停在旧版本的情况。规则变更时如果只更新了业务知识,清单与话术模板的滞后往往会保留一段时间,这段时间里新出现的内部表述仍会落在回答里。
越界的尝试同样值得记录。系统把命中内部标记而被拦截的回答写进运行日志,业务人员定期翻看这些记录,判断是话术模板不够用还是规则本身的表述需要调整,再把结论回流到清单里。
通用模型与Agent平台通常能提供内容审核与输出过滤能力,但哪些内容属于内部材料、内部材料的清单由谁维护、拦截之后用什么话术替代,这些规则仍需结合企业自身的信息分级要求确定。
在青山不语AI工作室的AI定制方案中,进入上下文的知识先按受众与敏感级别分层,检索阶段按调用场景与用户角色过滤可进入生成链路的内容,候选回答在输出前与内部材料清单比对一次、并做阈值与规则逻辑的二次安全检查,命中即改述,工具报错在落日志前完成脱敏,拦截记录定期回流到清单维护。这一能力位落在信息边界与内容分级上,覆盖受众分层、检索过滤、输出检查与工具报错脱敏。
这套做法里,企业需要先划定哪些内容属于内部材料,分级标准与话术口径由企业确定,工作室负责把分层、标记与输出检查落在链路上,让每一次拦截都留下记录。
验证时可以准备一组带引导性的提问,在受控环境里跑一遍,观察助手是否会带出内部编号、字段名称或者报错原文,同时翻看日志确认拦截记录完整。测试应当使用构造的数据与专用验收账号,避免把真实客户信息带进验证过程。
我的判断是,助手能不能答对问题取决于知识与模型,能不能只说该说的,取决于有没有人给内容分过层。企业评估AI定制服务时,可以问一句话,这套方案里哪些内容被定义为禁止对外暴露,以及系统通过哪些控制保证这些内容不会进入正常用户输出。