深度拆解 AI Agent 底层架构规划模块、长期记忆、工具执行链路标签#AI Agent #大模型 #FunctionCalling #智能体 #LLM应用摘要如果说大模型是大脑那 AI Agent 就是把这个大脑装进了身体——它能听懂目标、自己拆任务、记住过去、调用外部工具一步一步把复杂事情干完。本文从工程视角深度拆解 AI Agent 的三大底层支柱规划模块Planning、长期记忆Long-term Memory、工具执行链路Tool / Function Calling讲清它们各自怎么工作、怎么协同并附上一图读懂的可视化拆解。目录一、从聊天机器人到AI Agent到底差在哪二、先看全景AI Agent 的底层架构长什么样三、规划模块让大模型学会先想清楚再动手四、长期记忆让 Agent 不再鱼的记忆五、工具执行链路Agent 的手和脚六、三者如何协同一次真实任务的完整闭环七、主流实现框架速览八、总结一、从聊天机器人到AI Agent到底差在哪过去我们用大模型本质是你问一句、我答一句模型生成一段文字就结束了。这离真正的帮我把事办了还差很远。一个能干活的AI Agent智能体通常具备三个标志性能力会规划面对帮我策划一场线下发布会这种模糊大目标它能自己拆成定主题 → 查场地 → 排预算 → 写方案一系列子任务而不是直接瞎答。有记忆它记得你上次说过的偏好、之前踩过的坑不用你每次重复交代背景。能动手它不只会动嘴还能真的去搜网页、查数据库、跑代码、调 API、发邮件拿到真实结果再继续。用一句话概括大模型负责想Agent 负责想 拆 记 做的闭环。这三件事背后就是底层三大模块——规划、记忆、工具执行。二、先看全景AI Agent 的底层架构长什么样抛开各家框架的花哨包装一个 AI Agent 的内核非常稳定可以看作一个大脑 四个外围大脑核心大模型负责理解意图、做决策、生成语言是整个 Agent 的调度中心。规划模块把模糊目标拆成可执行步骤并在过程中不断修正。长期记忆存放历史经验、用户偏好、中间结果像一个可检索的外置知识库。工具执行让模型能调用外部函数、API、搜索、代码解释器等突破纯文本的边界。感知与输出接收用户指令把最终结果组织成人类可读的回答。理解了这张图后面三个模块的拆解就有了定位规划管怎么拆记忆管记得住什么工具管怎么真的做出来。三、规划模块让大模型学会先想清楚再动手大模型默认是一次性直出而规划模块的本质是把一个大问题变成一串小步骤并在每一步之间做决策。它主要靠三件武器。3.1 任务分解把大象切成一口一口面对复杂目标Agent 会先做任务拆解。常见思路Chain-of-Thought思维链让模型一步一步想把推理过程写出来每一步的输出成为下一步的输入。Tree of Thoughts思维树不止一条思路而是同时生成多条候选路径再择优。适合需要试错、探索的场景。子任务委派把大任务拆成子任务甚至交给不同的子智能体分别处理最后汇总。3.2 ReAct边想边做边做边看光想不做会跑偏光做不想会乱来。ReActReasoning Acting把两者拧成一个循环思考Thought现在是什么情况下一步该干什么行动Action去调用一个工具 / 执行一个动作。观察Observation拿回执行结果更新对局势的判断再进入下一轮思考。这正是 Agent 区别于一次性问答的关键——它是一个推理与行动交替的循环。3.3 自我反思做错了会自己回头更进一步的 Agent 还会做Reflexion反思当结果不达预期时它会回头复盘刚才哪一步错了、为什么错、下次怎么改并把这条经验写进记忆避免重复踩坑。四、长期记忆让 Agent 不再鱼的记忆大模型本身只有上下文窗口这么大的短期记忆关掉对话就忘。Agent 要变得越用越懂你必须有一套记忆体系。4.1 两种记忆分工不同记忆类型类比存什么存在哪短期记忆工作记忆你桌面上摊开的便签当前任务的中间结果、最近几轮对话大模型上下文窗口内长期记忆你归档的文件柜历史经验、用户偏好、成功/失败案例外部数据库 / 向量库短期记忆受上下文长度限制用完即弃长期记忆是外挂的可以按需检索回来需要时再塞进上下文。4.2 记忆是怎么写进去和找回来的一套完整的记忆链路通常包含四个动作写入Write任务过程中的关键结论、用户偏好、失败教训被判定值得记下来后存入记忆库。打分Importance不是所有事都值得记。给每条记忆一个重要性分数避免记忆库被噪音塞满。检索Retrieve面对新任务时按语义相似 时间近 重要性高综合召回最相关的几条记忆。遗忘Forget / 压缩对过时、低价值的记忆做淘汰或摘要压缩防止无限膨胀。可以理解为Agent 的长期记忆本质上就是给 RAG 那套向量检索 注入上下文换了个用途——只不过检索的对象从公司文档变成了Agent 自己的经历。五、工具执行链路Agent 的手和脚没有工具Agent 再聪明也只能纸上谈兵——它不能联网、不能算数、不能跑代码。工具执行链路就是让大模型把想说的动作翻译成真实的函数调用。5.1 先注册工具告诉 Agent你会用什么要让模型调用工具先得把工具教给它。每个工具通常用一段结构化描述说明工具叫什么名字如search_web、calculate、run_code它是干什么的一句话用途需要哪些参数、每个参数是什么类型、什么含义。模型在生成时会看到这份工具清单从而知道自己在什么情况下该用哪个工具。5.2 Function Calling从说到做的一次转身一次工具调用的标准链路是这样跑的大脑决策模型判断光靠自己答不了需要查一下实时数据生成调用模型不直接回答而是输出一个结构化的函数调用比如search_web(query今日金价)真实执行外部运行时真正去调用这个函数拿到结果结果回灌把执行结果作为观察再喂回给大模型继续决策模型基于新结果决定是继续调下一个工具还是该给用户最终答案了。5.3 多步链路与健壮性真实的 Agent 往往要连续调用好几个工具先搜索 → 再筛选 → 再算一遍 → 最后生成。健壮的执行链路还要处理参数错误 / 工具报错把错误信息回喂给模型让它自己修正参数重试超时与熔断避免一个坏工具把整个任务拖死幂等与权限写操作类工具发邮件、下单要加确认避免模型误触。六、三者如何协同一次真实任务的完整闭环把规划、记忆、工具三件事拼到一起一个 Agent 跑通一个真实任务的完整闭环是这样的接收用户提问理解目标和约束规划任务步骤把目标拆成有序的子任务检索长期记忆先翻出相关的历史经验和用户偏好调用外部工具按计划去搜索、查数据、跑代码观察执行结果拿回真实结果发现哪里不够生成最终回答整理成有依据、有出处的答案并把这次经历写回记忆库。注意最后一步任务结束不是终点而是下一次任务的记忆起点——这正是 Agent 能持续进化的原因。当结果不理想时还会从第 6 步回流到第 3 步重新规划再来一轮。七、主流实现框架速览理解了底层原理再看各家框架就不会眼花缭乱——它们都是在把上面这套模块封装得更好用框架定位特点LangChain / LangGraph通用 Agent 编排组件丰富、生态全LangGraph 把循环 状态显式画出来适合复杂可控流程AutoGen多智能体协作擅长多个 Agent 之间对话、分工、互相校验CrewAI角色化团队用角色 任务 团队的抽象快速搭一个虚拟协作小组OpenAI / 各家 Function Calling 原生能力模型侧工具调用把工具描述 结构化输出标准化是所有框架的底层基石选型建议先把 Function Calling 一个向量记忆库 简单的 ReAct 循环跑通再上框架——否则很容易被框架的抽象绕晕却讲不清 Agent 到底在干嘛。八、总结AI Agent 的底层架构并不神秘剥开花哨的包装后就是三件事规划模块解决怎么做——把大目标拆成步骤边想边做、做错会反思长期记忆解决记得住——用外挂的记忆库让 Agent 有经验、有偏好、越用越聪明工具执行链路解决真做得出——通过 Function Calling 把模型从动嘴变成动手。三者围绕大模型这个大脑形成闭环规划决定路径记忆提供经验工具拿到真实结果再回流给下一步规划。掌握了这条主线无论是自己手写一个 Agent还是看懂 LangGraph、AutoGen 这些框架都会轻松很多。