☰
玩转大模型(二):RAG 知识库调参,与 Coze / Dify 智能体开发实战
2026/10/6 8:00:19 网站建设 项目流程

玩转大模型(二):RAG 知识库调参,与 Coze / Dify 智能体开发实战

💡第二天开始动手:RAG 知识库搭建 + 低代码智能体开发。这一天是整门课里"看起来最简单、实际坑最多"的部分。

RAG 的原理确实一句话就能说完:检索相关内容,拼进提示词,让模型照着答。但真自己搭一遍就会发现,效果差在分段长度、Top K、Score 阈值这些数字上,而不是差在模型上。

Coze 和 Dify 更是要面对一堆现实问题:零代码平台到底能走多远、同样的案例两个平台做起来差在哪、发布出去的别人为什么复制不了。

这篇把这两件事的具体参数和平台差异记录清楚。


5. RAG 落地:流程、参数和知识库选型

RAG 是 4 天里第一个真正动手的模块。它的原理一句话就能说完,效果差异全在细节参数上。

5.1 为什么需要 RAG:两个痛点

知识冻结——模型越大训练成本和周期越高,最新信息根本来不及融进去,问"推荐当前热门影片"必然翻车。幻觉——训练用的是海量公开静态数据,企业内部资料、专有技术文档压根不在里面。

课件里有个类比很直白:LLM 面对陌生领域准备放飞自我时,RAG 递给它一张小抄,正确率从 60% 提到 90%。做法就是引入向量数据库作为外部知识源。

5.2 九步流程,难点只有四个

【知识更新】文件解析 → 文件切割(chunks) → 向量化(Embedding) → 知识入库 【知识检索】query 向量化 → 向量库检索 → 重排序 → 增强(拼 Prompt) → LLM 生成

其中解析、切割、检索、重排序这四步是真正决定效果的难点,向量化和入库反而是体力活。结构化和非结构化数据都能进:非结构化走Unstructured Loader → Text Spliter → Text Chunk → Embedding Model → Vector Database,检索时Similarity Search命中的向量作为 Context 填进Prompt Template。

5.3 具体参数:这才是能落地的部分

以 Dify 建知识库为例(源文件是一部刑法 txt,按自然段对应法条):

参数课程取值说明
分段标识符\n\n用\n是换行切,\n\n是段落切
分段最大长度1024 characters—
分段重叠长度50 characters一般为最大长度的10%~20%
分段模式通用 /父子分段父子分段:子块用于检索,父块用作上下文
索引方式高质量 / 经济经济模式每块 10 个关键词,不耗 token 但准确性低;高质量嵌入后无法切回经济模式
Embedding 模型bge-large-zh-v1.5中文 1024 维
Rerank 模型bge-reranker-base—
Top K3最相似的前 n 条
Score 阈值0.5默认未开启
检索模式向量 / 全文 /混合检索(推荐)混合 = 向量检索(走 rerank)+ 全文检索

清洗选项里可以勾选"替换连续空格/换行/制表符"“删除所有 URL 和邮箱”。如果文档本身是问答形式,应该选Q&A 分段模式。

测试用的提示词值得抄:你是一个法律小助手,请只根据知识库中的信息,简要回答用户提问的案件触犯了哪些法律——“只根据知识库”这半句是防幻觉的关键约束。

5.4 平台选型:别一上来就上企业级

场景开发成本推荐理由
个人知识管理≤1 周Cherry Studio/ AnythingLLM以能用为主,文档是 Markdown/PDF/网页
应用化交付、团队协作中Dify/ FastGPT要封装成可复用应用、多成员权限、流程编排
企业级文档解析高RAGFlow长 PDF、复杂版式、表格图片混排、扫描件,要求可追溯引用

Cherry Studio是本地客户端,五个特点我觉得挺实用:小白友好、一问多答(多个模型同时回复做对比)、内置千余个行业助手、聚合 OpenAI/Gemini/Anthropic/Azure 规范的服务商模型、全本地数据安全。配 API 时注意一个细节:API 地址不需要填com后面的部分,它会自动补全。模型可以走硅基流动,手机号注册有免费 token,嵌入模型在模型广场里确认名称(如BAAI/bge-m3,免费、多语言、1024 维、8K)后回客户端添加。

ima(腾讯)走的是另一条路:客户端/小程序/网页多端同步,支持混元和 DeepSeek-R1 满血版,可以直接通过微信提问,还能把微信公众号文章攒成知识库、订阅第三方知识库。

Q1:为什么我上传的 PDF 检索效果一塌糊涂?

大概率死在解析这一步。课程原话:手写内容、表格、复杂数据公式,解析效果都会较差。检索结果里会带占比得分,可以据此判断是解析问题还是检索问题。补救方案是先过一遍Doc2X这类文档解析工具再入库。RAGFlow 那类平台的核心卖点也正是这个——分块结果可视化,能逐块查看、启用/禁用,人工可干预。

Q2:RAG 效果不好,是不是该上微调?

第一篇里那张成本递增的选型图。RAG 和微调解决的不是同一个问题:RAG 适合融合新知识,微调适合优化模型内部知识、输出格式和复杂指令执行能力。知识不够就补检索,行为不对才调模型。


6. 低代码搭智能体:Coze 与 Dify,以及三个 level

课程有句判断我觉得说得过了点但方向对:"现在搭建一个智能体,就好比 2013 年做公众号、2016 年注册抖音。"抛开流量红利不谈,它确实把 AI 应用的门槛压到了不会写代码的人也能上手。

6.1 先分清智能体的三个层次

Level做法本质代表
Level 1写一段预设提示词立人设直接和 LLM 对话,课件称之为"阉割版的智能体"GPTs、Cherry Studio、豆包
Level 2编排工作流,每步可指定不同模型面向过程,按既定流程执行讯飞星辰 Agent、Coze/Dify Workflow
Level 3给定目标,自主拆任务、选工具、控进度自主决策,达成目标后自行结束Coze/Dify Agent

智能体的五个核心要素,可以直接当 checklist 用:

LLM(大脑) + 记忆 Memory + 工具 Tool Use + 规划 Planning + 行动 Action

记忆这块值得展开:短期记忆是单次对话上下文的 token 序列,受上下文窗口限制;长期记忆跨任务跨时间,实现方式有三种——模型参数微调(固化知识)、知识图谱(结构化语义网络)、向量数据库(相似性检索)。

6.2 Function Call 到 MCP:一次标准化

Function Call 让模型能调外部工具,DeepSeek API 的完整链路是五步:

定义 tools → 模型返回 tool_calls(finish_reason="tool_calls") → 本地执行函数 → 回传 role:"tool" 结果 → 模型整理答案(finish_reason="stop")

注意第三步必须在自己的代码里完成,模型只是"说"它要调什么,不会替你执行。

Function Call 有三个结构性问题:工具要开发者自己实现并写描述,和业务绑定、难复用共享;各家厂商规范不同,同一工具要写多份描述;工具描述不完善时模型可能调不对。MCP 就是来解这个问题的——Anthropic 于 2024 年 11 月提出的标准协议,课件的比喻我认为是全场最佳:AI 时代的 USB-C 接口。写一次 MCP Server,任何支持协议的应用即插即用,形成多对多双向数据流。关键变化是:工具的定义和调用方从 AI 应用变成了 MCP 服务器。

站点特点
mcp.so收录超8000个 MCP Server,支持 STDIO(本地)与 SSE(云端托管),带实时接口调试
smithery.ai/servers新手友好,4500+资源,一键生成 Cursor 配置
阿里云百炼 MCP 市场全周期托管服务

6.3 Coze vs Dify vs n8n:一张表选完

维度Coze(扣子)Difyn8n
上线时间2024.02.01,2025.07.26 宣布全面开源2023 年,苏州语灵人工智能2019 年,德国开源工作流自动化
适用用户零技术背景个人、小团队、自媒体开发者、技术团队、需定制 AI 的企业开发者、需复杂自动化的企业
核心优势零代码、快速上线、字节生态大模型专精、企业级功能、LLMOps 全链路开源免费、集成能力强、数据自主
学习曲线低(几小时上手)中(1~2 天)高(3~5 天)
扩展性有限,依赖预设模板和插件中等,支持自定义模型和外部工具极强,400+ 节点,可写代码
部署云端托管 + 私有化云端 + 私有化自托管 + 云端
生态数据100+ 预制模板50+ 内置工具400+ 节点

三句话判断:

  • Coze:上手极其简单,和抖音/飞书深度集成、一键发布到豆包/飞书/公众号,试错成本低。但功能偏浅、复杂逻辑难做,数据存云端;虽然宣布开源,插件开发者生态仍闭源,私有化版本远不如云托管版本易用。
  • Dify:低代码和高扩展性平衡得最好,企业级功能(多模型热切换、权限管理、操作审计)齐全。代价是模型调用依赖第三方付费 API,成本偏高,且非技术用户要理解"向量数据库"这类概念。
  • n8n:数据自主、集成最强,但学习门槛高、中文资源少。

如果是我:验证想法和做内容类应用用 Coze,要交付给企业或自己长期维护用 Dify,纯系统集成(AI 只是其中一环)用 n8n。

6.4 Coze 三个案例,各解决一个能力缺口

案例补的能力关键做法
深夜情感主持人设与话术纯提示词:# 角色+## 技能(倾听与理解/分析与建议/情绪安抚),每个技能配===回复示例===模板,## 限制圈定话题范围;再配模型参数、开场白、预设问题
高考报考指南联网 + 多模态检索装头条搜索、头条图片搜索插件。课程特意先演示"不装插件的局限",再装插件对比
家庭记账助手数据持久化变量+数据库

第三个案例的坑最值得记。记账场景下,课程原话是"聊天中的上下文一旦清空,就没法获取之前的交互数据"——因为模型本身无状态(第一篇讲过原因)。解法是在记忆 → 变量 → 添加变量建变量保存用户信息,设置后清除历史记录仍能保留;再进一步,用数据库建表持久化流水,可以自定义表结构或基于模板创建(示例表account_notes)。另外还有长期记忆(自动总结所有聊天记录作为后续上下文)和文件盒子(管理用户发的图片/视频/音频/文档)。

Dify 侧的两个案例(时事评论助手、北京旅行助手)里,我觉得北京旅行助手的一个配置细节特别实在:内容审查。把"偷东西"“吃饭不给钱”“打架"配成敏感词,用户提问直接被拦截回复"问题中涉及敏感内容,请重新提问”——这是上线前必须做的一步,但很多教程会跳过。

顺带一个发布权限的坑,很多人会踩:

发布方式别人能看到什么
发布到商店只能体验,看不到也复制不了工作流(没有复制入口)
发布到模板能看到应用/智能体的设置细节,但权限管理很严格

想让别人(或未来的自己)能复用编排逻辑,必须走模板发布。

6.5 工作流:为什么流程固定时它比 Agent 更好用

工作流的定义是"为完成某项任务而设计的一系列自动化步骤的有序组合",课件把它定位成一种智能体的设计模式。核心权衡是:

Agent :自主拆解 → 灵活但结果不可控、每次路径可能不同 Workflow:预定义 → 流程固定、结果可控、可复用、可解释

所以很多开发平台把 Workflow 作为独立于 Agent 的另一种应用形态。需要它的场景也很具体:电商订单处理、AI 批改作业(识别错误→生成反馈→推荐练习)、企业审批流、自媒体流水线(提取爆款标题→重生成大纲→分镜生图→图生视频→合成字幕)。

Q1:Coze、Dify、豆包、元宝里的智能体,差别在哪?

课程的答案挺反直觉:主要区别不在客户端或平台,而在于底层用的大模型不同。平台只是编排壳子,能力上限由模型决定。

Q2:那自建 Agent 的能力边界到哪了?

课件对 Dify Agent 的评价可以直接引用:“根据现有资料,Dify 搭建的智能体和 Coze 搭建的智能体一样,检索资料解决问题的能力仍有待提高。” 这句话基本界定了低代码平台的适用面——流程编排可靠,自主检索+多步推理还别指望太多。


最后总结

  • RAG 的成败在解析和分块,不在模型。分段 1024 / 重叠 50 / Top K 3 / Score 阈值 0.5 / 混合检索,这套值是课程实测的起点,但表格和扫描件必须先过解析工具。
  • 平台选型的本质是"要不要交付"。自用选 Cherry Studio / ima,要封装成应用选 Dify / FastGPT,企业级文档解析选 RAGFlow。
  • Coze 赢在上手和生态,Dify 赢在可扩展和企业级。但两家共同短板是自主检索与多步推理仍偏弱——流程确定的场景交给 Workflow,别硬上 Agent。

上一篇:大模型概述与落地手段选型。下一篇:Coze / Dify 工作流案例集。

参考资料

[1] Coze 扣子官网
[2] Dify 官网
[3] Cherry Studio 官网
[4] ima 官网
[5] 硅基流动模型广场
[6] Doc2X 文档解析
[7] 讯飞星辰 Agent 平台
[8] 腾讯元器智能体商店
[9] 秘塔 AI 搜索
[10] Perplexity
[11] MCP 服务器市场 mcp.so
[12] Smithery MCP Servers

本文整理自《尚硅谷大模型智能体线上速成班 V2.0》Day02《低代码智能体开发》课件,参数与结论以课件为准,个人判断部分已标注。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询