前段时间,找钢网和腾讯WorkBuddy联合搞了个NextB2B,消息一出来,在产业互联网和企业服务圈子里讨论热度不低。这名字起得很直白,就是“下一代B2B”,但真正让我感兴趣的不是这个口号,而是背后的落地路径:一家深耕钢铁电商的产业公司,一个企业级AI智能体开发平台,两者走在一起,恰恰可能回答了一个困扰很多人的问题——AI大模型在中国企业里到底怎么落地,才不算烧钱玩概念。
很多团队拿着大模型试了一圈,最后都卡在同一个地方:模型会对话,但不懂业务;技术人员很兴奋,但业务部门不上车;POC做得像模像样,一上生产环境就拉胯。NextB2B这个项目的意义在于,它没有把AI当做一个独立的“智能客服”或者“文档问答”来做,而是把模型、数据、工作流、角色权限这些东西,一起放进B2B交易的真实场景里重新设计。如果你正在负责公司的AI项目,或者你在B2B平台类企业做产品、运营、技术,这篇文章值得你看完。我会从为什么选找钢网、WorkBuddy在里面到底扮演什么角色、到实际搭建一个企业AI助手的完整过程,以及我们踩过的坑,一次性讲清楚。
1. 破题:NextB2B到底做了什么,为什么选找钢网当“试验田”
1.1 B2B平台的AI痛点,找钢网最有资格说话
B2B平台和C端应用有个非常大的区别:交易链条长、决策重、角色多。拿找钢网来说,每天有大量的钢材询价、订单、物流、结算数据在平台上流转,买家要的不是“推荐你喜欢的商品”,而是“今天热卷价格是多少,含不含运费,能不能三天内到货”这种极其确定的信息。过去这些需求靠人工客服和业务员在微信、QQ、电话里来回沟通,效率低,而且人的经验和状态直接决定了服务质量。
找钢网这些年积累了大量行业数据,包括钢材现货价格、钢厂排产、历史成交记录、贸易商报价,还包括一堆行业黑话,比如“过磅价”“理计价”“承兑现”等等。这些数据就是AI最好的养料,但问题也在这里——数据散落在不同系统里,有些在ERP里,有些在Excel里,有些在聊天记录里,格式不统一,甚至字段对不上。找钢网如果想做AI,第一步不是上模型,而是先把这些数据进行新一轮的治理和语义化。
所以找钢网被选作“试验田”,不是因为它的技术有多前沿,而是因为它有真实的交易场景和足够复杂的数据问题。B2B平台如果能把AI用起来,那它解决的问题就不是锦上添花,而是实实在在的降本增效。
1.2 WorkBuddy的角色:不是外包,而是“AI落地脚手架”
腾讯WorkBuddy这个产品,我理解下来更像一个企业级AI智能体开发和协同平台。它不是简单的“聊天机器人套壳”,而是提供了一整套从模型接入、知识库管理、Agent工作流编排,到应用发布、权限管控的工具链。直白点说,它就是给企业搭好的“AI落地脚手架”,企业不需要从零开始做大模型基础设施,也不用把腾讯云上的所有组件研究一遍,只需要在WorkBuddy里把模型、数据、工具、场景串起来。
在NextB2B这个项目里,WorkBuddy扮演了三层角色:第一层是模型底座,接入了腾讯混元大模型,同时也支持企业按需选择其他开源模型;第二层是智能体开发环境,业务人员可以像搭积木一样设计对话流程、配置工具调用;第三层是企业应用的运行底座,把AI能力封装成可以被内部系统和微信生态调用的接口。
很多企业做AI喜欢找外包公司做一锤子买卖,做完交付一个模型,后面维护没人管。WorkBuddy这种方式更像是把工具交给业务团队,让找钢网自己的产品、运营、数据分析人员能持续迭代。我觉得这是中国企业AI落地很重要的一条路径:不是买一个模型,而是买一套能让业务跑起来的机制。
1.3 NextB2B的定义:从“交易平台”到“产业智能体”
那NextB2B究竟是个什么东西?从公开信息来看,它是找钢网集团和腾讯WorkBuddy联合发布的面向B2B行业的AI应用产品。我倾向于把它理解为一个“产业智能体”,它不是一个单一功能,而是把AI能力嵌入到B2B交易的全链路里,包括智能报价、货源匹配、客户画像、风控预警、合同解析、物流跟踪等等。
以前B2B平台做智能化,通常是上一套CRM、一套ERP、一个BI看板,数据和业务还是割裂的。NextB2B想做的事,是让AI像一个懂行的交易助手一样,贯穿整个交易链条。比如一个采购商在对话框里说“我要500吨Q235B热卷,送到上海”,这个智能体要知道Q235B是什么材质,热卷对应哪些规格,上海地区的运价怎么算,当前哪些供应商有货,甚至能自动生成询价单发给匹配的供应商。这背后,光是业务规则就要梳理一大堆。
从“交易平台”到“产业智能体”,本质上是把“人找信息”变成了“信息找人”,甚至“决策辅助人”。这件事如果真跑通了,对找钢网来说,不只是降低人工成本,还能把服务能力复制给更多中小贸易商,这是商业模式层面的一种升级。
2. 核心能力拆解:NextB2B背后的模型、数据与工作流设计
2.1 模型选型与私有化部署的平衡
做企业AI应用,第一步就要定模型。别一上来就追参数量最大、榜单分数最高的模型,先想清楚三个问题:你的业务数据能不能出域?你的实时性要求多高?你的预算能支撑多少次调用?NextB2B在设计上做了一个很务实的取舍——对话理解、意图识别这类对通用能力要求高的环节,可以直接用云端大模型;但涉及价格、合同、客户信息这些敏感数据的时候,必须走私有化部署或者私有知识库检索再灌给模型。
这里面有一个关键的策略叫“模型路由”。简单说,就是先让一个小模型判断用户的问题属于哪种类型,然后根据类型决定走哪个大模型、要不要调用企业内部API、要不要查知识库。这么做的好处有两个:一是省钱,简单问题用便宜模型处理,复杂问题才上大模型;二是安全,涉及核心商业数据的请求可以走内网,从源头避免数据外泄。
我在实际项目里非常推荐这种模式。不要指望一个大模型解决所有问题,企业AI应用的核心是用最合适的模型处理最合适的任务。WorkBuddy在模型路由这块做得比较透,它对接的模型不止一个,你可以给每个节点配置不同的模型实例,这比把对话服务写死在单一模型上要灵活得多。
2.2 数据工程:从钢铁行业术语到知识库
很多团队做AI失败,不是死在模型上,而是死在数据上。大模型不懂钢铁行业,你直接拿通用模型问“理计价”,它可能回复一些似是而非的解释。要让模型懂业务,必须把行业知识喂进去,而且要用它听得懂的方式喂。
第一步是术语标准化。钢铁行业里同一个概念有很多叫法,比如“热卷”和“热轧卷板”是一回事,但不同地区、不同贸易商叫法不同。我们做了一个同义词表,把所有业务系统里的物料名称、计量单位、结算方式统一映射到一个标准词根上。这块工作需要业务老员工配合,因为他们脑子里全是这些约定俗成的叫法。
第二步是清洗历史数据。找钢网沉淀了很多历史的询价单、报价单、成交记录,但这些数据并不干净:有的价格单位是“元/吨”,有的是“元/张”;有的日期格式不统一;有的客户名称一会儿是简称一会儿是全称。数据清洗的目标不是追求完美,而是让模型检索出来的结果可信。我一般会把清洗流程拆成字段校验、单位换算、去重合并、标签标注四步,每一步都有对应的脚本和人工抽查样本。
第三步就是把清洗好的数据向量化,存进知识库。这里有个实操参数要注意:文本切片大小和重叠率直接决定了检索效果。切片太大,一段内容里信息过多,相关性容易稀释;切片太小,上下文碎片化,模型很难理解业务意图。我们通常把切片大小设在500到800个字符,重叠率50到100个字符,并且对表格数据单独处理,不让Markdown表格被硬切。为了更准,还可以按钢材品类、交易类型、地区建多个索引,检索的时候按业务上下文过滤。
2.3 工作流编排:WorkBuddy的Agent机制怎么用
模型是发动机,知识库是油箱,工作流是这辆车的变速箱。没有工作流,AI就只是个聊天机器人,什么都答应但什么都办不成。WorkBuddy的Agent机制,我最喜欢的一点是可视化编排,业务人员不用写代码也能把流程搭出来。
举个例子,一个智能询报价的流程可能是这样的:先让Agent判断用户意图,是“询价”还是“查单”还是“退换货”;如果是询价,就提取材质、规格、数量、收货地这些关键参数;然后调用找钢网内部的商品查询API,筛选出符合条件的货源;再调用定价服务算出参考价;最后组织成一段回复,附上货源链接和有效期。这套流程里,每一个环节都是可以独立替换和调试的。
做工作流的时候有一个原则:能调API就不让模型猜,能走规则就不让模型自由发挥。比如报价计算,一定要走内部定价服务,不能让模型自己根据历史数据推出一个价,那是绝对的踩红线。模型在这个流程里负责的是自然语言理解和内容生成,核心业务计算必须用确定性系统。WorkBuddy里每个节点可以绑定工具调用,还能设置超时和重试策略,这些细节在生产环境里比模型效果本身更影响体验。
3. 实操实记:基于WorkBuddy搭建一个B2B智能助手的全流程
3.1 账号准备与平台初始化
这部分我把我们当时从0到1搭起来的过程还原一遍,算是一个详细教程,你完全可以照着试试。第一步是开通WorkBuddy的企业版账号,通常会涉及域名认证和成员管理。建议一开始就把权限体系设计好,我踩过坑:一开始图省事,所有人都是管理员,结果后面改权限的时候差点把线上应用搞崩。
登录控制台之后,第一步是创建应用项目。项目类型选择“智能体应用”,然后会让你选择基础模型。我们生产环境一开始选了腾讯混元大模型,因为价格和效果相对平衡。在“模型参数”里,温度建议设到0.2到0.3之间,企业场景下回复要稳,不要让它自由发挥。最大输出Token根据场景设,简单问答512就够,生成报价单建议2048。
初始化的时候还有一步容易被忽略,就是配置系统提示词。这个提示词决定了AI的“人设”和“行为边界”。我们写了一大段系统提示,其中包括“你是找钢网交易助手,只能根据知识库和工具结果回复”“遇到不确定信息,明确告知用户需要人工确认”。千万別小看这段提示词,它比你之后做多少次微调都管用。
3.2 知识库构建:把贸易规则“教”给模型
在WorkBuddy后台找到“知识库”模块,先创建分类,比如“钢材百科”“交易规则”“物流计费”“合同模板”。然后把整理好的文档上传,支持PDF、Word、Markdown和Excel。上传之后系统会自动做切片和向量化,但我建议一定要检查切片结果。
我自己遇到的情况是:一个PDF里包含了价格表和说明文字混排的表格,系统默认切片把表格劈成了上下两半,检索的时候经常只命中一半,回答明显不完整。后来我手动对这类文档做了预处理,把表格单独存成CSV,再传一遍,效果立刻好了很多。
知识库构建不只是“传文件”这一个动作。你还得为每个切片写清晰的来源标签,比如“来源:2023年华东地区运费标准(V2)”,这样模型在引用时能直接展示出处,用户更信任。WorkBuddy支持在回答里显示引用来源,这个功能一定要开,既能减少幻觉,又能当审计留痕。
3.3 对话工作流配置:比价、询单、风控三个场景
接下来是配置Agent工作流。我拿三个场景举例:
第一个场景是“比价”。用户输入“帮我找5种规格的镀锌板,价格从低到高排”。工作流里,先做意图识别,然后提取物料规格,调用商品搜索API,把结果按价格排序,最后可用“mcp__price_sort”这样的工具节点处理,没有工具就直接在提示词里要求模型按价格字段排序。我们实测下来,让模型从返回的JSON里抽字段再排序,会比在提示词里描述“请比较价格”更稳定。
第二个场景是“询单”。用户要下类似“H型钢200*200,12米定尺,80吨”的询单。这个场景里,你需要抽取参数之后先做校验,比如规格是否存在、定尺是否在厂商支持列表中,如果参数不完整,主动反问用户补充。WorkBuddy的“槽位填充”机制可以帮你管理必填参数,在可视化流程里把“材质、规格、数量、交货地”标成必填项就行。
第三个场景是“风控”。这个要谨慎很多,不是直接让AI去判断客户风险,而是让AI自动抓取客户的历史履约数据、黑名单标记、当前欠款状态,然后调用风控规则引擎得出一个风险分,再由人工确认。我强烈建议,涉及钱、合同、风控的环节,AI只做“信息聚合与提醒”,绝不能做最终决策。
配置完这三个流程后,记得做对话测试。WorkBuddy里有测试面板,可以同时打开多个流程的调试信息,能看到模型中间推理和工具调用的返回结果。这一步比看最终回复更重要,大部分问题都出在中间环节。
3.4 测试与灰度发布:AI回答错了怎么办
在把AI应用放给全公司用之前,一定要设计一套测试集。我们当时从历史客服对话里抽了200条真实问题,分成了价格类、库存类、合同类、售后类。每一条都准备好标准答案,然后让业务专家打分,一条一条过,准确率至少到85%以上才敢放出来。
但就算你自测没问题,上线之后还会遇到新问题。所以上线一定要走灰度:先找5到10个核心种子用户,让他们用企业微信直接用起来,出现问题及时反馈。灰度期观察两个指标:用户提问的转化率和二次提问率。如果很多用户问完第一轮还要追问,说明AI的意图理解或答案完整性还有问题。
上线后要在WorkBuddy的后台开启日志与回看功能,记录每一次对话和调用。这里有个细节:日志里要带上用户ID和时间戳,方便复盘和做权限审计。万一AI说错了什么,你能第一时间定位是哪一次对话、哪个模型版本、哪次工具调用出了问题。
4. 避坑指南:企业AI落地中躲不开的四个坎
4.1 模型“一本正经胡说八道”的锅怎么甩
大模型最大的问题就是会在不知道的情况下编答案。企业场景里,这可不是说错一句话那么简单,很可能导致报价错误、合同条款理解偏差,造成真金白银的损失。要解决这个问题,不能只靠模型本身,要在产品设计上做限制:
第一,回答必须带引用。知识库里所有切片都有来源,模型如果基于某个切片回答,要强制列出“参考文档”或“来源”。没找到答案时宁可说“不知道”,也不要硬答。用提示词加防御性指令能限制一部分幻觉,但更可靠的是在代码或工作流里加一个“检索置信度阈值”,向量检索分数低于阈值就不让模型引用。
第二,关键信息二次确认。像价格、数量、交期这类参数,AI回复时如果涉及具体数字,要自动在回复里附上一句“以上信息来自XX规则,请以人工报价单为准”,同时把用户当前输入的参数展示出来,请用户核对。这样既降低了风险,也增加了用户对AI的信任。
第三,定期用历史坏case回归。我们每周会把新增的错误案例汇总,重新跑一遍测试集,看有没有回归。WorkBuddy支持导入对话记录作为测试样例,这个功能要好好利用。
4.2 历史数据质量差,清洗到什么程度才够用
很多企业做知识库的幻觉,本质是数据本身就有冲突。比如一份规则写着“起订量10吨”,另一份规则写着“最少下单100吨”。因为来源不同,业务阶段不同,这种矛盾在实际企业里非常常见。你不能指望模型自己消化矛盾,它只会随机选择或者编造。
所以要有一个“数据治理前置”的意识。所有进入知识库的数据,都要经过业务方签字确认。清洗到什么程度算够?有一条简单的线:把同一主题下的材料放在一起读一遍,如果两个文档对同一件事的说法不一样,这不算清洗完成。我们当时建了一个“数据冲突登记表”,把所有矛盾点都列出来,一个一个找业务确认,这个表建了两百多条,最后剩下来的规则才进知识库。
另外,数据不要一味求多。知识库里放十万篇杂质文档,效果远不如一千篇精准文档。你要的是“高密度、低冲突”的业务知识,不是互联网上随便抓的行业新闻。所以上知识库之前,先做一次内容审核,宁缺毋滥。
4.3 业务部门不配合,Agent怎么变成KPI
企业AI项目最容易死在“技术团队热,业务部门冷”。业务部门觉得AI是来抢饭碗的,或者觉得这东西不靠谱,不愿意提供场景和反馈,最后做出来的东西没人用。找钢网这个项目能推下去,我觉得关键在于把AI的指标和业务KPI绑定了。
比如智能报价助手,考核指标是“报价响应时长从30分钟降到3分钟”“询盘转化率提升5%”;智能客服,考核指标是“人工客服介入率下降20%”“用户满意度不低于原来水平”。当AI能帮业务部门完成那些重复机械的活,让他们腾出时间去做更大的单子,业务部门自然会配合。我在实操中体会到,要让业务人员参与测试、提需求,最好的方式不是开会培训,而是让标杆销售或客服组长先试用,用事实说话。
4.4 权限与合规:B2B的报价数据不能“裸奔”
B2B企业里,价格、库存、合同条款都是高度敏感的数据。不同岗位能看到的数据范围完全不同,销售能看到折扣价,普通客服可能只能看到标准价,财务能看到成本,但原则上不能看完整的客户沟通记录。AI应用一旦把这些数据混着回答,等于变相把所有机密都暴露在对话里了。
所以配置权限要非常细。WorkBuddy支持基于角色的访问控制,你在初始化角色时就要想清楚:每个角色能看到哪些知识库分类,能调用哪些工具API。比如客服角色,只能调用“产品百科”和“标准报价”知识库,不能调用“客户历史折扣”API。财务角色可以调用“结算规则”,但不能调用“库存明细”。这些规则得写进Agent工作流的权限节点里,而不是只靠模型自觉。
另外,合规上要留意对话日志的保存周期和用户授权。如果涉及到个人的手机号、身份信息,需要做脱敏处理。我们当时在日志系统里加了一个脱敏改造,把所有手机号、身份证号、银行卡号用掩码显示,只有高权限管理员才能查看原值。这不是技术问题,是责任问题。
5. 人机协同的下半场:为什么员工必须学会调模型、做数据、设计场景
5.1 岗位能力模型变了:不是让程序员背锅
最近有一个热词很扎心:“企业把AI落地到业务里,需要会调模型、做数据、做应用场景的人。”言下之意,光会写Prompt不够,光会训练模型也不够,企业需要的是一批能跨界的人——上能看懂模型指标,下能清洗脏数据,中间还得懂业务场景怎么设计。
但是这里要说到痛点:现在大部分企业的AI项目,全压在技术人员身上。业务提需求,技术实现,看起来分工明确,实际上技术不懂业务流程,业务不懂模型能力边界,结果就是需求来回改,项目无限延期。所以NextB2B这种项目给我最大的启示不是技术选型,而是组织方式的改变:找钢网没有把所有AI工作丢给一个神秘的算法团队,而是把产品、运营、一线业务、数据工程师拉进同一个项目组。
如果你也想在企业里推AI,我建议先不要急着招“大模型算法工程师”,而是从现有团队里选几个学习意愿强、业务理解深的同学,培训他们使用WorkBuddy这类平台工具,让他们成为“业务侧AI应用骨干”。这些人最懂业务痛点,学完编排和知识库之后,能很快把场景落地。
5.2 “模型+数据+场景”的铁三角如何形成闭环
我见过很多AI项目,要么在模型层炫技,要么在数据层埋头清洗,要么在场景层画饼,但真正能落地的,一定是铁三角闭环。模型能力再强,没有场景数据做约束,回答就是飘的;数据质量再高,没有合适的模型去理解,也没法变成服务;场景设计得再热闹,没有模型和数据的支撑,Demo也变不成产品。
在NextB2B的落地过程中,他们形成了一个很聪明的循环:从真实交易场景提取高频问题,用这些问题去反推需要什么数据和什么能力,再通过WorkBuddy把模型和数据编排成具体应用,应用上线后的对话日志又会成为新的训练和优化素材。这个闭环跑起来,AI才会越来越懂行。
我给企业的建议是:不要一次性铺开五十个场景,先选一个高频、痛点明显、数据基础好的场景,比如“智能报价”,不计成本地把闭环跑通。等第一个应用真正被业务用起来之后,再考虑横向复制到合同、物流、售后等场景。慢就是快。
5.3 给不同角色上手WorkBuddy的落地建议
如果你现在正负责或参与这类项目,我把不同角色的上手路径按我的经验列一下:
业务运营人员,不要碰模型参数,先从“知识库管理”开始。把你手里最常被问到的100个问题和标准答案整理成文档,传进知识库,然后学着在WorkBuddy里配一个最简单的问答机器人。这个过程你不会觉得太难,而且能立刻看到效果。之后再去尝试画工作流,把常见问题分类分配给不同工具。
产品经理,重点学“工作流编排”和“提示词设计”。你要能从用户视角拆解需求,转化成流程节点。多看看日志,用户在哪一步流失、哪类问题AI答不上来,根据数据迭代提示词和流程。产品经理的价值,不再是画几个页面原型,而是定义清楚“AI如何辅助人完成交易”。
研发工程师,则需要花心思在API集成和权限设计上。不要把WorkBuddy当成一个封闭系统,要主动考虑怎么把它和企业内部的ERP、CRM系统打通。工具的边界是代码,模型的能力边界是数据和计算资源,工程师要做的就是把AI这座桥连接到真实的业务系统上,同时确保安全合规。
找钢网和腾讯WorkBuddy这个项目,从发布到真正让业务跑起来肯定还有很长的路。但至少它给了行业一个信号:企业AI应用不是不能落地,而是要有人把模型的调参、数据的治理、场景的设计串成一条链路。你在企业内部做AI,如果能把这三点想明白,哪怕不用WorkBuddy,也一样能找到属于你们的那条中国路径。