玩转大模型(二):RAG 知识库调参,与 Coze / Dify 智能体开发实战
💡第二天开始动手:RAG 知识库搭建 + 低代码智能体开发。这一天是整门课里"看起来最简单、实际坑最多"的部分。
RAG 的原理确实一句话就能说完:检索相关内容,拼进提示词,让模型照着答。但真自己搭一遍就会发现,效果差在分段长度、Top K、Score 阈值这些数字上,而不是差在模型上。
Coze 和 Dify 更是要面对一堆现实问题:零代码平台到底能走多远、同样的案例两个平台做起来差在哪、发布出去的别人为什么复制不了。
这篇把这两件事的具体参数和平台差异记录清楚。
5. RAG 落地:流程、参数和知识库选型
RAG 是 4 天里第一个真正动手的模块。它的原理一句话就能说完,效果差异全在细节参数上。
5.1 为什么需要 RAG:两个痛点
知识冻结——模型越大训练成本和周期越高,最新信息根本来不及融进去,问"推荐当前热门影片"必然翻车。幻觉——训练用的是海量公开静态数据,企业内部资料、专有技术文档压根不在里面。
课件里有个类比很直白:LLM 面对陌生领域准备放飞自我时,RAG 递给它一张小抄,正确率从 60% 提到 90%。做法就是引入向量数据库作为外部知识源。
5.2 九步流程,难点只有四个
【知识更新】文件解析 → 文件切割(chunks) → 向量化(Embedding) → 知识入库 【知识检索】query 向量化 → 向量库检索 → 重排序 → 增强(拼 Prompt) → LLM 生成其中解析、切割、检索、重排序这四步是真正决定效果的难点,向量化和入库反而是体力活。结构化和非结构化数据都能进:非结构化走Unstructured Loader → Text Spliter → Text Chunk → Embedding Model → Vector Database,检索时Similarity Search命中的向量作为 Context 填进Prompt Template。
5.3 具体参数:这才是能落地的部分
以 Dify 建知识库为例(源文件是一部刑法 txt,按自然段对应法条):
| 参数 | 课程取值 | 说明 |
|---|---|---|
| 分段标识符 | \n\n | 用\n是换行切,\n\n是段落切 |
| 分段最大长度 | 1024 characters | — |
| 分段重叠长度 | 50 characters | 一般为最大长度的10%~20% |
| 分段模式 | 通用 /父子分段 | 父子分段:子块用于检索,父块用作上下文 |
| 索引方式 | 高质量 / 经济 | 经济模式每块 10 个关键词,不耗 token 但准确性低;高质量嵌入后无法切回经济模式 |
| Embedding 模型 | bge-large-zh-v1.5 | 中文 1024 维 |
| Rerank 模型 | bge-reranker-base | — |
| Top K | 3 | 最相似的前 n 条 |
| Score 阈值 | 0.5 | 默认未开启 |
| 检索模式 | 向量 / 全文 /混合检索(推荐) | 混合 = 向量检索(走 rerank)+ 全文检索 |
清洗选项里可以勾选"替换连续空格/换行/制表符"“删除所有 URL 和邮箱”。如果文档本身是问答形式,应该选Q&A 分段模式。
测试用的提示词值得抄:你是一个法律小助手,请只根据知识库中的信息,简要回答用户提问的案件触犯了哪些法律——“只根据知识库”这半句是防幻觉的关键约束。
5.4 平台选型:别一上来就上企业级
| 场景 | 开发成本 | 推荐 | 理由 |
|---|---|---|---|
| 个人知识管理 | ≤1 周 | Cherry Studio/ AnythingLLM | 以能用为主,文档是 Markdown/PDF/网页 |
| 应用化交付、团队协作 | 中 | Dify/ FastGPT | 要封装成可复用应用、多成员权限、流程编排 |
| 企业级文档解析 | 高 | RAGFlow | 长 PDF、复杂版式、表格图片混排、扫描件,要求可追溯引用 |
Cherry Studio是本地客户端,五个特点我觉得挺实用:小白友好、一问多答(多个模型同时回复做对比)、内置千余个行业助手、聚合 OpenAI/Gemini/Anthropic/Azure 规范的服务商模型、全本地数据安全。配 API 时注意一个细节:API 地址不需要填com后面的部分,它会自动补全。模型可以走硅基流动,手机号注册有免费 token,嵌入模型在模型广场里确认名称(如BAAI/bge-m3,免费、多语言、1024 维、8K)后回客户端添加。
ima(腾讯)走的是另一条路:客户端/小程序/网页多端同步,支持混元和 DeepSeek-R1 满血版,可以直接通过微信提问,还能把微信公众号文章攒成知识库、订阅第三方知识库。
Q1:为什么我上传的 PDF 检索效果一塌糊涂?
大概率死在解析这一步。课程原话:手写内容、表格、复杂数据公式,解析效果都会较差。检索结果里会带占比得分,可以据此判断是解析问题还是检索问题。补救方案是先过一遍Doc2X这类文档解析工具再入库。RAGFlow 那类平台的核心卖点也正是这个——分块结果可视化,能逐块查看、启用/禁用,人工可干预。
Q2:RAG 效果不好,是不是该上微调?
第一篇里那张成本递增的选型图。RAG 和微调解决的不是同一个问题:RAG 适合融合新知识,微调适合优化模型内部知识、输出格式和复杂指令执行能力。知识不够就补检索,行为不对才调模型。
6. 低代码搭智能体:Coze 与 Dify,以及三个 level
课程有句判断我觉得说得过了点但方向对:"现在搭建一个智能体,就好比 2013 年做公众号、2016 年注册抖音。"抛开流量红利不谈,它确实把 AI 应用的门槛压到了不会写代码的人也能上手。
6.1 先分清智能体的三个层次
| Level | 做法 | 本质 | 代表 |
|---|---|---|---|
| Level 1 | 写一段预设提示词立人设 | 直接和 LLM 对话,课件称之为"阉割版的智能体" | GPTs、Cherry Studio、豆包 |
| Level 2 | 编排工作流,每步可指定不同模型 | 面向过程,按既定流程执行 | 讯飞星辰 Agent、Coze/Dify Workflow |
| Level 3 | 给定目标,自主拆任务、选工具、控进度 | 自主决策,达成目标后自行结束 | Coze/Dify Agent |
智能体的五个核心要素,可以直接当 checklist 用:
LLM(大脑) + 记忆 Memory + 工具 Tool Use + 规划 Planning + 行动 Action记忆这块值得展开:短期记忆是单次对话上下文的 token 序列,受上下文窗口限制;长期记忆跨任务跨时间,实现方式有三种——模型参数微调(固化知识)、知识图谱(结构化语义网络)、向量数据库(相似性检索)。
6.2 Function Call 到 MCP:一次标准化
Function Call 让模型能调外部工具,DeepSeek API 的完整链路是五步:
定义 tools → 模型返回 tool_calls(finish_reason="tool_calls") → 本地执行函数 → 回传 role:"tool" 结果 → 模型整理答案(finish_reason="stop")注意第三步必须在自己的代码里完成,模型只是"说"它要调什么,不会替你执行。
Function Call 有三个结构性问题:工具要开发者自己实现并写描述,和业务绑定、难复用共享;各家厂商规范不同,同一工具要写多份描述;工具描述不完善时模型可能调不对。MCP 就是来解这个问题的——Anthropic 于 2024 年 11 月提出的标准协议,课件的比喻我认为是全场最佳:AI 时代的 USB-C 接口。写一次 MCP Server,任何支持协议的应用即插即用,形成多对多双向数据流。关键变化是:工具的定义和调用方从 AI 应用变成了 MCP 服务器。
| 站点 | 特点 |
|---|---|
| mcp.so | 收录超8000个 MCP Server,支持 STDIO(本地)与 SSE(云端托管),带实时接口调试 |
| smithery.ai/servers | 新手友好,4500+资源,一键生成 Cursor 配置 |
| 阿里云百炼 MCP 市场 | 全周期托管服务 |
6.3 Coze vs Dify vs n8n:一张表选完
| 维度 | Coze(扣子) | Dify | n8n |
|---|---|---|---|
| 上线时间 | 2024.02.01,2025.07.26 宣布全面开源 | 2023 年,苏州语灵人工智能 | 2019 年,德国开源工作流自动化 |
| 适用用户 | 零技术背景个人、小团队、自媒体 | 开发者、技术团队、需定制 AI 的企业 | 开发者、需复杂自动化的企业 |
| 核心优势 | 零代码、快速上线、字节生态 | 大模型专精、企业级功能、LLMOps 全链路 | 开源免费、集成能力强、数据自主 |
| 学习曲线 | 低(几小时上手) | 中(1~2 天) | 高(3~5 天) |
| 扩展性 | 有限,依赖预设模板和插件 | 中等,支持自定义模型和外部工具 | 极强,400+ 节点,可写代码 |
| 部署 | 云端托管 + 私有化 | 云端 + 私有化 | 自托管 + 云端 |
| 生态数据 | 100+ 预制模板 | 50+ 内置工具 | 400+ 节点 |
三句话判断:
- Coze:上手极其简单,和抖音/飞书深度集成、一键发布到豆包/飞书/公众号,试错成本低。但功能偏浅、复杂逻辑难做,数据存云端;虽然宣布开源,插件开发者生态仍闭源,私有化版本远不如云托管版本易用。
- Dify:低代码和高扩展性平衡得最好,企业级功能(多模型热切换、权限管理、操作审计)齐全。代价是模型调用依赖第三方付费 API,成本偏高,且非技术用户要理解"向量数据库"这类概念。
- n8n:数据自主、集成最强,但学习门槛高、中文资源少。
如果是我:验证想法和做内容类应用用 Coze,要交付给企业或自己长期维护用 Dify,纯系统集成(AI 只是其中一环)用 n8n。
6.4 Coze 三个案例,各解决一个能力缺口
| 案例 | 补的能力 | 关键做法 |
|---|---|---|
| 深夜情感主持 | 人设与话术 | 纯提示词:# 角色+## 技能(倾听与理解/分析与建议/情绪安抚),每个技能配===回复示例===模板,## 限制圈定话题范围;再配模型参数、开场白、预设问题 |
| 高考报考指南 | 联网 + 多模态检索 | 装头条搜索、头条图片搜索插件。课程特意先演示"不装插件的局限",再装插件对比 |
| 家庭记账助手 | 数据持久化 | 变量+数据库 |
第三个案例的坑最值得记。记账场景下,课程原话是"聊天中的上下文一旦清空,就没法获取之前的交互数据"——因为模型本身无状态(第一篇讲过原因)。解法是在记忆 → 变量 → 添加变量建变量保存用户信息,设置后清除历史记录仍能保留;再进一步,用数据库建表持久化流水,可以自定义表结构或基于模板创建(示例表account_notes)。另外还有长期记忆(自动总结所有聊天记录作为后续上下文)和文件盒子(管理用户发的图片/视频/音频/文档)。
Dify 侧的两个案例(时事评论助手、北京旅行助手)里,我觉得北京旅行助手的一个配置细节特别实在:内容审查。把"偷东西"“吃饭不给钱”“打架"配成敏感词,用户提问直接被拦截回复"问题中涉及敏感内容,请重新提问”——这是上线前必须做的一步,但很多教程会跳过。
顺带一个发布权限的坑,很多人会踩:
| 发布方式 | 别人能看到什么 |
|---|---|
| 发布到商店 | 只能体验,看不到也复制不了工作流(没有复制入口) |
| 发布到模板 | 能看到应用/智能体的设置细节,但权限管理很严格 |
想让别人(或未来的自己)能复用编排逻辑,必须走模板发布。
6.5 工作流:为什么流程固定时它比 Agent 更好用
工作流的定义是"为完成某项任务而设计的一系列自动化步骤的有序组合",课件把它定位成一种智能体的设计模式。核心权衡是:
Agent :自主拆解 → 灵活但结果不可控、每次路径可能不同 Workflow:预定义 → 流程固定、结果可控、可复用、可解释所以很多开发平台把 Workflow 作为独立于 Agent 的另一种应用形态。需要它的场景也很具体:电商订单处理、AI 批改作业(识别错误→生成反馈→推荐练习)、企业审批流、自媒体流水线(提取爆款标题→重生成大纲→分镜生图→图生视频→合成字幕)。
Q1:Coze、Dify、豆包、元宝里的智能体,差别在哪?
课程的答案挺反直觉:主要区别不在客户端或平台,而在于底层用的大模型不同。平台只是编排壳子,能力上限由模型决定。
Q2:那自建 Agent 的能力边界到哪了?
课件对 Dify Agent 的评价可以直接引用:“根据现有资料,Dify 搭建的智能体和 Coze 搭建的智能体一样,检索资料解决问题的能力仍有待提高。” 这句话基本界定了低代码平台的适用面——流程编排可靠,自主检索+多步推理还别指望太多。
最后总结
- RAG 的成败在解析和分块,不在模型。分段 1024 / 重叠 50 / Top K 3 / Score 阈值 0.5 / 混合检索,这套值是课程实测的起点,但表格和扫描件必须先过解析工具。
- 平台选型的本质是"要不要交付"。自用选 Cherry Studio / ima,要封装成应用选 Dify / FastGPT,企业级文档解析选 RAGFlow。
- Coze 赢在上手和生态,Dify 赢在可扩展和企业级。但两家共同短板是自主检索与多步推理仍偏弱——流程确定的场景交给 Workflow,别硬上 Agent。
上一篇:大模型概述与落地手段选型。下一篇:Coze / Dify 工作流案例集。
参考资料
[1] Coze 扣子官网
[2] Dify 官网
[3] Cherry Studio 官网
[4] ima 官网
[5] 硅基流动模型广场
[6] Doc2X 文档解析
[7] 讯飞星辰 Agent 平台
[8] 腾讯元器智能体商店
[9] 秘塔 AI 搜索
[10] Perplexity
[11] MCP 服务器市场 mcp.so
[12] Smithery MCP Servers
本文整理自《尚硅谷大模型智能体线上速成班 V2.0》Day02《低代码智能体开发》课件,参数与结论以课件为准,个人判断部分已标注。