本文梳理了从传统Web开发转向AI Agent开发的学习路径,核心在于将Agent拆解为“大模型+插件”的形式,包括工具调用、记忆管理和知识库检索等。文章强调前端和Node.js技能的可迁移性,并提供了分阶段的学习路线图,帮助程序员系统掌握AI Agent开发,最终实现全栈产品开发。同时,也提醒读者接受模型的不确定性,注重传统软件工程实践。
最近梳理了一下自己从传统 Web 开发转到 AI Agent 开发的过程,把要学的东西和已有的能力盘点了一下,写成这篇笔记。
刚接触那阵子,打开任何教程都是一堆没见过的词:Embedding、RAG、LangChain、Agent Loop、Tool Calling……每个字都认识,连在一起不知道在说什么。啃了半年代码之后发现,情况没那么糟,前端和 Node.js 的底子大部分都能直接用上。
下面是我整理的内容:先搞懂 Agent 到底是什么,然后盘一下手里已有的牌,最后给一张按工程依赖关系排好的路线图。
一、拆开 Agent:它就是模型加几个插件
你问刚入行的人 Agent 是什么,大概会听到一堆高级词汇:自主决策、多步推理、任务编排、智能体协作。这些词没错,但都是描述结果的,不是解释本质的。
把外层包装撕掉,Agent 的内核特别简单:一个大模型加上几个插件。
插件 1:工具调用
大模型你自己用过。你问它一个问题,它回你一段文字。但如果问题是"帮我把这个 CSV 文件里的第三行删掉"——它只能告诉你"你可以用 Python 的 pandas 库,先 read_csv 再 drop……“它只能"说”,不能"做"。
给大模型接一个 Tool,它就能真的去执行 shell 命令、读写文件、调 HTTP 接口、操作浏览器。Cursor 能直接改你的代码文件,不是什么黑科技,是它调了一个文件写入工具。Manus 能打开浏览器、访问网页、点击按钮、把结果总结成 Markdown,背后也是一堆工具的串联调用。
工具的能力边界,就是 Agent 的行动边界。
插件 2:记忆管理
你试试跟 ChatGPT 聊一个长线程。聊到第 20 轮的时候,它还记得第 3 轮你说过什么吗?大概率不记得。
大模型本身是无状态的。你看到的"对话记忆",是应用层把之前的聊天记录作为上下文一起发了进去。但上下文窗口有大小限制,塞满之后最早的消息就被挤掉了。至于跨会话的记忆——上周聊过什么——模型完全不知道,因为新会话不会带上旧会话的历史。
要让 Agent 真正有记忆,你得自己在外面做一整套管理:短期记忆(当前会话上下文)、长期记忆(跨会话持久化)、记忆的压缩和淘汰策略。记忆管理是工程问题,不是模型问题。
插件 3:知识库检索
你公司内部的运维手册、产品文档、客户 FAQ——这些数据没有喂给任何公开大模型。你问 ChatGPT"我们公司那个 BUG-2301 怎么修的",它不可能答出来。
让 Agent 能"查内部资料再回答",靠的是 RAG:把文档切成小段,转成向量存起来,用户提问时先检索最相关的段落,塞进 prompt 里一起发给模型。
严格说,RAG 也是一种工具——检索工具。但它涉及文档处理、向量索引、检索调优一整套复杂工程,所以通常单独拿出来讲。
然后呢?加一个 while 循环
模型判断下一步要干什么 → 调用对应的工具 → 拿到工具返回的结果 → 再判断下一步 → 再调工具 → 直到任务完成或者触发停止条件。
这不就是编程里最基础的东西。Agent 不过是一个能调用工具、能查资料、能记住你的带 while 循环的聊天机器人。拆开看了,它吓人的只是那层包装。
二、前端和 Node.js 的底子能用上多少
搞清楚 Agent 的本质之后,我盘了一下自己手里已有的牌,发现能迁移的比想象中多。
前端交互经验,直接对应 Streaming UI
Agent 的前端不是普通表单提交。你在页面上发一条"帮我查一下上个月销售额并生成图表",Agent 的回复是一段一段流式吐出来的,中间可能穿插着"正在调用数据查询工具"、"查询已完成,正在生成图表"这样的状态。
做过前端交互开发的人,天然就懂这套东西。WebSocket、EventSource、状态机、loading/error/success 三态切换,这些是 Agent 前端的核心体验,而我之前在日常开发里已经做烂了。
Node.js 后端经验
Agent 的核心代码跑在后端。你要写 API 把前端请求传给 Agent Loop。Agent 调工具时你要处理异步任务的超时和重试。对话历史要持久化到 Redis。用户配额要限制。权限要校验。
盘下来发现,Agent 只是我服务端逻辑里的一个新模块。它周围全是我在 Node.js 开发中已经熟悉的东西——Nest/Koa/Express、消息队列、数据库、缓存、鉴权中间件。
全栈经验
做过全栈的人有一个直觉:一个功能在命令行里能跑,跟在线上几千人同时用是两回事。
Agent 开发同理。写一个"帮我读 CSV 然后画个图"的 Demo,一个下午就搞出来了。但做成产品:用户断网重连后任务能恢复吗?恶意 prompt 注入怎么防?每次调 OpenAI API 花多少钱谁记?十万用户同时跑 Agent,Redis 扛不扛得住?
这些问题跟我之前做的全栈项目遇到的问题,本质上是同一类。类型系统、单元测试、日志、监控、权限、部署流水线,这些在 AI 应用开发里没消失。因为模型输出的不确定性,它们反而更关键了。
三、我整理的 4 阶段路线图
下面是要补的东西。我按工程依赖关系分成 4 个阶段。顺序重要——不是因为"先学什么后学什么"的教条,是后一个阶段直接依赖前一个阶段做出来的东西。
阶段 1:AI 编程与 LLM 工程基础
别被"AI 编程"这个词吓到。不是让你学机器学习,是让你学会让 AI 参与你的开发流程,同时保持对产出的控制力。
具体几件事:
- 写项目规则和上下文描述,让 AI 生成的代码符合项目规范,不只是"能用"
- 让模型返回结构化输出(JSON Schema),并做校验——因为模型有时候会少字段、多字段、格式正确但语义错误
- 把反复用的能力封装成可复用的模块——提示词可以做成 Skills,外部工具和数据源可以通过 MCP 协议标准化接入
- 给 AI 生成的代码写测试、跑回归
这个阶段的目标不是收集一堆提示词模板,是建立一套"AI 参与开发但不失控"的工作流。
阶段 2:RAG 知识库工程
我把 RAG 放在第二阶段,有一个很实际的原因。RAG 是第一个能把模型、数据、检索、前端、后端全部串起来的完整项目,而且它最容易暴露 AI 应用开发中最核心的痛苦——系统能跑,但跑出来的结果不稳定、不靠谱。
一个落地的 RAG 项目需要处理:
- 文档解析(PDF、Word、Markdown、网页——格式不同,解析策略完全不同)
- 文本切片(切太大检索不准,切太小语义丢失,怎么分是工程问题)
- Embedding 和向量检索(选什么模型?什么向量数据库?混合检索怎么配权重?)
- 查询改写和 Reranker(用户问"那个东西怎么配",你得把"那个东西"展开成具体产品名)
- 引用溯源(答案要附引用来源,用户才会信)
- 评测(你怎么知道改了一个参数之后,效果是变好了还是变坏了?)
做完这个阶段,你会得到一个真正能用的企业知识库。更重要的是,你会拿到"AI 系统出问题时该从哪一环开始排查"的肌肉记忆。
阶段 3:AI Agent 核心实现
这个阶段要做一件很多人跳过的事:自己从零写一个 Agent。不用 LangChain,不用任何 Agent 框架。用 TypeScript 写一个最小 Agent Loop:模型给一个 action → 你的代码执行对应的工具 → 结果还给模型 → 继续循环。
然后逐步加上:工具注册和分发、文件读写、命令执行、用户确认和权限校验、上下文太长时的压缩策略、单次任务的最大预算(防止无限循环)。
最后会得到一个能在命令行里帮你写代码、查文件、跑命令的 Mini Coding Agent。
这件事情值钱的地方不在做出来的东西本身。在于你以后再用 LangGraph、Vercel AI SDK 或者 OpenAI Agents SDK 的时候,你能清楚地区分:这里框架替我省了什么,那里把什么复杂性藏起来了,藏起来的东西在什么场景下会炸。框架替你省掉的是打字,替你藏起来的才是你要懂的。
阶段 4:Agent 全栈产品开发
命令行里的 Agent 跑通了,下一步是把它变成别人也能用的产品。这一阶段处理的是真正的工程交付:
- 前端怎么做流式 UI?工具调用过程中怎么展示"正在执行"的中间状态?用户怎么打断或者取消一个正在跑的 Agent?
- 会话和任务怎么持久化?用户刷新页面后之前的对话还在不在?
- 长任务(比如跑一个要 20 分钟的代码审查)怎么处理?
- 安全边界画在哪?Agent 能读写哪些目录?能访问哪些 API?用户能通过 prompt 注入让 Agent 做不该做的事吗?
- 成本怎么算?每一次 API 调用花多少钱?怎么记录、怎么展示给用户?
- 部署:Docker、数据库、消息队列、日志、监控,一样不能少
做完这个阶段,手里不是一个技术 demo,是一个可以上线、可以收费、可以持续迭代的 AI Agent 产品。
四、从学会到做出东西的几个坎
路线图给的是方向。真正转型的时候,卡住大部分人的不是"不知道学什么",是几个心理关。
别等学完再动手
搞技术的人容易掉进一个坑——想先把所有前置知识补完了再写第一行代码。AI Agent 领域千万别这么干。
今天就可以做一个最小 RAG 项目:把一篇技术文档扔进去,搭一个只答这个文档的问答机器人。做的过程中你会立刻撞上文本切片不对、检索召回太差、模型幻觉乱答这些问题。撞了再去查文档、调参数、理解为什么,比你先把 Embedding 和向量检索的理论啃一遍再动手,效率高十倍。
AI 应用开发不是学完了再做,做完了才算学会。
TypeScript 还是 Python
我是前端出身,Node.js 用了七八年。TypeScript 可以同时覆盖服务端、流式 API、前端交互,一套语言搞定 AI Agent 全栈,对我来说这条路最顺。
但这不代表所有场景都得死磕 TypeScript。RAG 评测框架、复杂数据处理、某些工作流编排工具,Python 生态确实有更成熟的方案。我的做法是核心应用逻辑用 TypeScript,评测和数据处理模块用 Python,通过 API 或子进程对接。
如果你最舒服的语言是 TypeScript,就用它起步。先跑起来,比先选对语言重要。
接受模型的不确定性
这是最大的心态转变。传统开发中,你调一个 API,返回的 JSON 结构是确定的。你写一个 if-else,执行路径是确定的。AI 应用不是这样。
同一个 prompt,连续调 10 次,如果什么都不约束,返回结果可能五花八门——有的 JSON 格式不对,有的字段名拼错,有的干脆返回一段解释而不是 JSON。用上 JSON mode 和 structured output 之后,格式问题能解决大部分。但语义层面的不确定性还在:格式对了,内容可能错。模型可能调错工具,可能给出格式正确但逻辑不对的答案。
所以类型校验、错误重试、fallback 逻辑、日志追踪,这些东西在 AI 应用开发里不但没消失,反而更重了。会调 API 只是第一步,后面全是传统软件工程的老本行。
写在最后
AI Agent 开发没有你想的那么新。把那些吓人的概念词剥掉——Tool 就是函数调用,Memory 就是状态管理,RAG 就是搜索加拼接,Agent Loop 就是 while 循环。
要补的增量是理解模型这个不确定的组件,然后用你已经掌握的工程能力把它管住、放进产品里。
你现在处于哪个阶段?是刚调通第一个 LLM API,还是在纠结用 LangChain 的 AgentExecutor 还是上 LangGraph 编排多步工作流?来留言区聊聊。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2026 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要《AI大模型入门+进阶学习资源包》,下方扫码获取~
① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)
② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!
③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。
④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。
⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。
以上资料如何领取?
为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!
不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!
这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。