从 Prompt 到 Agent:2026 年 LLM 应用的四层架构

发布时间:2026/7/22 5:22:02
从 Prompt 到 Agent:2026 年 LLM 应用的四层架构 《大模型实战》第 2/10 篇上篇选型一张图下篇预告RAG 还值不值得做很多人把「会写 Prompt」当成会做大模型应用。2026 年真正能交付的系统通常要分清四层Prompt → RAG → Tool Calling → Agent本篇给你一张分层图以及每层该上、不该上的判断标准。你将学到四层分别解决什么问题「会聊天」和「能交付」怎么区分每层常见技术栈与踩坑什么时候停在某一层就够了一张分层总表层级核心问题输入→输出典型技术L1 Prompt怎么问得更好文本→文本Prompt / 模板 / few-shotL2 RAG模型不知道的私有知识怎么办问题→检索→生成向量库 / 分块 / 重排L3 Tool如何从回答变成做事意图→工具调用→结果Function Calling / MCPL4 Agent多步任务如何规划与恢复目标→计划→执行→反思状态机 / 多 Agent / 记忆一句话L1 解决「说清楚」L2 解决「知道得更多」L3 解决「能动手」L4 解决「能连续把事做完」L1Prompt Engineering——何时够用何时不够够用的场景改写、摘要、翻译、分类结构化抽取JSON 字段少且稳定单轮问答不依赖最新私有数据不够用的信号答案依赖你们内部文档 / 数据库需要查天气、下单、改代码、发通知任务要多步中途可能失败重试此时继续堆 Prompt通常是在用自然语言硬扛系统能力缺口。最小实践角色 任务 约束 输出格式 示例先把输出格式钉死JSON Schema / 字段表再谈「更聪明的措辞」。L2RAG——给模型外挂知识而不是硬背进 Prompt解决什么模型训练截止后不知道的内容产品文档、制度、工单、代码注释、FAQ。不该用 RAG 硬上的情况知识其实很小直接放进上下文更稳需要精确计算 / 强事务该查库或跑代码权限复杂到「检索到了也不能给这人看」却没做过滤关键认知RAG 质量差时换更大模型往往救不了。分块、召回、重排没做好旗舰模型也会一本正经胡说。下篇会专门展开向量库、分块、重排与评测。L3Tool Calling——从「生成文本」到「触发动作」解决什么让模型决定调用哪个工具并带上参数{tool: search_docs, args: {q: 退款规则}}系统执行工具后把结果喂回模型再生成最终回答。工程要点比 Prompt 更重要Schema 少而精工具太多模型更容易选错权限白名单默认只读写操作要确认超时 / 重试 / 幂等网络抖动是常态可观测每次工具调用都要有日志与 trace和前端的关系Tool 进度、错误、确认框是产品体验的一部分不是后端私货。可对照前端系列第 4 篇Tool Calling UI。L4Agent——多步规划、记忆与失败恢复Agent 不是「更长的 Prompt」Agent 至少要有目标分解plan工具循环act状态与记忆state / memory停止条件与人工介入stop / HITL什么时候上 Agent任务天然多步调研→对比→起草→校验需要根据中间结果改路线允许一定自主性且有沙箱与审计什么时候不要上单次工具调用就能结束流程固定用普通工作流 / 状态机更清晰团队还没有权限、日志、回滚能力没有治理的 Agent是高速制造事故的机器。「会聊天」vs「能交付」判断清单问题会聊天能交付私有知识从哪来靠模型记忆RAG / 业务 API出错怎么办再问一遍重试、降级、人工确认能否改系统状态不能或很危险受控工具 权限能否复盘难有 trace / 日志成本是否可控不清楚有预算与路由如果你的系统只能回答、不能安全行动、不能复盘它还停在 L1L2 的 Demo 阶段。推荐演进路径别一步登天先做 L1稳定输出格式需要私有知识再上 L2需要查/写系统再上 L3多步且多分支再上 L4每一层都先有评测和失败路径再加深自主性。和本系列后续篇的对应本篇层级后续展开L2 RAG第 3 篇向量库 / 分块 / 重排L3 Tool第 45 篇MCP、Tool 工程化L4 Agent第 68、10 篇多 Agent、安全、上线小结2026 年做 LLM 应用建议把能力拆开看Prompt 解决表达RAG 解决知识Tool 解决行动Agent 解决连续交付选层比选模型更先。模型可以换分层错了会一直痛。下篇预告《大模型实战》第 3/10 篇RAG 还值不值得做向量库、分块、重排与评测一次讲透。