引言先分清三个容易混淆的概念概念是什么类比例子Chatbot聊天机器人只负责对话你问它答一轮一轮不主动做事一位博学但只能动嘴的顾问早期 ChatGPT 网页版Workflow工作流按人写死的固定流程执行一条流水线每个工位干什么早就规定好了收到邮件→提取关键词→存数据库规则是程序员写的Agent智能体大模型自己决定下一步做什么观察环境→思考→调用工具→再根据结果调整一位被雇来干活的实习生你给目标它自己规划步骤、查资料、用软件、发现走不通就换方案帮我规划一次三天两夜的杭州旅行预算 2000把机票酒店都订好一句话定义AI Agent 以大语言模型为大脑具备感知Perception、规划Planning、记忆Memory、工具使用Tool Use、行动Action五种能力能在循环中自主朝着目标推进的系统。判断标准很简单目标是给定的路径是模型自己找的。这就是 Agent 与 Chatbot/Workflow 的分界线。第一部分Agent 的解剖——五大模块逐个拆一个 Agent 内部长这样┌─────────────────────────────┐ 用户目标 → │ 规 划 │ ← 大脑LLM └──────┬──────────────────────┘ │ ┌──────────┼──────────┐ ▼ ▼ ▼ 感知 记忆 工具/行动 眼睛耳朵笔记本 手和脚 │ │ │ └──────────┼──────────┘ ▼ 环境反馈观察 │ └────→ 回到规划继续循环下面逐个模块讲透。1.1 大脑大语言模型LLMAgent 的大脑就是一个 LLMGPT-5、Claude、Kimi 等。注意它在这个角色里干的核心活不是聊天而是做决策把用户的模糊目标拆解成步骤规划判断当前该调用哪个工具、传什么参数决策读工具返回的结果判断任务是否完成、下一步怎么走反思。新手需要理解的一个关键机制大模型本身其实没有循环能力。它本质是一个函数输入一段文字提示词对话历史工具结果输出一段文字。所谓循环是外面的程序在驱动while 任务未完成: 输出 LLM(提示词 历史) if 输出要求调用工具: 结果 执行工具(输出.参数) 历史.append(结果) # 把工具结果追加进历史 else: 返回最终答案机理讲解就像一位只能说一句、等一句的远程顾问。你外围程序负责把它的每句话翻译成实际行动调工具把行动结果反馈给它再问接下来呢——循环往复直到它说搞定了或达到轮次上限。这就是为什么 Agent 的能力上限 模型智力 × 外围框架质量。有一项 2026 年的对照研究结论非常震撼脚手架框架/提示/重试逻辑不同同一模型得分最多相差 22%而换不同模型得分只差约 1%。 翻译成人话怎么搭这个循环比用哪个模型更重要。1.2 感知Perception眼睛和耳朵感知 把环境信息变成模型能读的文本或 token。三种典型形式① 用户直接输入文字、图片、语音、文件。② 工具回传的环境状态网页内容、数据库查询结果、程序报错信息。③ 截图/界面感知Computer Use 类 Agent把屏幕截图喂给多模态模型让它看到按钮在哪。2026 年 GPT-5.4 和 Gemini 3.1 Pro 在 OSWorld 计算机操作评测中都达到 75.0%已超过人类专家基线 72.4%——意味着模型看屏幕点按钮这件事已经追平了人。举例 机理图文问答你上传一张冰箱内部照片问我能做什么菜感知阶段图像编码器上一章讲过的 ViT把照片变成一串视觉 token黄瓜、鸡蛋、剩米饭、半瓶老干妈这些视觉概念被激活语言模型把视觉 token 和你的文字问题一起理解——这一步就是多模态感知模型看到了食材然后进入规划缺什么信息是否需要查菜谱工具是否需要确认你忌口行动可能直接给出黄瓜炒蛋 老干妈炒饭的方案也可能先反问你有几个人的量价值讲解纯 Chatbot 也会说黄瓜炒蛋但它看不到你的冰箱里其实只剩一根黄瓜——感知让 Agent 的回答锚定在真实环境上而不是凭常识泛泛而谈。1.3 规划Planning把目标变成步骤规划的复杂度从低到高新手按这个顺序理解层级 1单步反应——用户问什么答什么Chatbot 模式。层级 2思维链Chain-of-Thought, CoT——让模型先想后说。举例你问我 3 点有个会现在 2:40从这里到会议室要 25 分钟来得及吗纯回答模型可能脱口而出来不及CoT 的机理是提示模型显式写出中间推理3:00 - 2:40 20 分钟 25 分钟所以来不及需要推迟 5 分钟或请人代开。写出推理过程后答案的错误率大幅下降。这不是模型变聪明了而是它被迫把计算过程展开而不是一步跳答案。层级 3ReActReasoning Acting推理行动交替——Agent 的主流工作模式也是你必须记住的核心范式思考(Thought)我现在缺什么信息→ 行动(Action)调用搜索工具 观察(Observation)搜索返回了结果 → 思考够了吗→ ...举例完整轨迹演示你说帮我查一下明天北京飞上海最早的高铁然后把车次发给我 思考用户要明天最早的高铁。我需要①明天的日期 ②高铁时刻表数据 行动call_tool(get_current_date) → 返回 2026-09-11 思考好明天是 9 月 11 日。现在查高铁 行动call_tool(search_train, {from:北京, to:上海, date:2026-09-11}) 观察G1(06:43), G3(07:00), G5(07:40)... 思考最早的是 G1。任务完成整理输出 ✅ 最终答案明天最早的高铁是 G1 次06:43 从北京南出发...机理讲解注意每一轮思考的输出并不是给你看的答案而是给下一行动的内部决策调什么工具、传什么参数。观察结果回填进对话历史后模型基于新信息重新决策。这就是边想边做——人类解决问题的真实方式查一下→想想→再查一下被压缩进了一个循环。层级 4复杂规划——面对大任务先出完整计划再执行或并行探索多条路径如 Tree-of-Thoughts 树状思考像下棋一样评估多个分支。2026 年主流模型大多在 RL 训练中内化了长程规划不再需要显式 prompting。1.4 记忆Memory上下文窗口是工作记忆不是全部记忆① 短期记忆 对话上下文Context Window模型能记住对话本质是把历史对话塞进输入。这像人的工作记忆——容量有限窗口 32K~100 万 token 不等但越塞越贵、注意力越稀释。② 长期记忆 向量数据库 RAG检索增强生成机理当用户说我喜欢喝拿铁Agent 不把它留在对话里对话一关就没了而是用 Embedding 模型把用户喜欢喝拿铁转成高维向量存进向量数据库以后用户问推荐一款咖啡时把这个问题也转成向量在库里做相似度搜索捞出相关记忆一起喂给模型。举例 机理讲解三个月后你再次打开应用老样子来一杯。Agent 的检索把老样子来一杯向量化 → 在记忆库中检索 → 命中拿铁相关记忆 → 拼进提示词 → 模型据此回答好的一杯拿铁还是和往常一样吗关键机理模型本身三个月前的对话一个字都不记得——每次对话都是从零开始的状态机。所谓记住你是外围系统每次开场前偷偷把相关记忆检索出来塞进了提示词。模型看到此用户喜欢拿铁就自然接住了话。记忆系统 一个会预判这次对话需要哪些背景的图书管理员。③ 情景记忆 / 程序性记忆更高阶的形态——记住上次订机票失败是因为没有登录这类经验下次自动先登录。这是 2026 年研究热点。1.5 工具使用Tool Use从动嘴到动手这是 Agent 从顾问变成员工的关键能力技术上叫Function Calling函数调用。工作机制四步注册开发者把工具写成说明书提供给模型包括函数名、功能描述、参数格式。例如{ name: search_flights, description: 查询航班信息, parameters: { type: object, properties: { origin: {type: string, description: 出发城市}, destination: {type: string, description: 到达城市}, date: {type: string, description: 日期格式YYYY-MM-DD} }, required: [origin, destination, date] } }选择模型阅读说明书后输出一段结构化 JSON我决定调用 search_flights参数是北京/上海/2026-09-11。执行模型自己并不执行——是外围程序解析这段 JSON、真正去调航班 API把结果拿回来。重要机理模型是指挥官不是士兵所有真实世界的副作用发邮件、下单、转账都由程序层执行这也给安全控制留了卡口。回填工具结果作为新消息追加进历史模型继续思考。举例 机理讲解图像描述生成调用外部工具版任务给这张照片生成一段适合发小红书的文案并按爆款风格配图模型规划的完整轨迹可能是plain 思考先理解图片内容 → 需要视觉理解能力模型自带直接看图 观察图里是一个人在洱海边骑车日落 思考内容有了。用户要配图——我生成不了图片但有 image_gen 工具 行动call_tool(image_gen, {prompt: 洱海日落骑行日系胶片风}) 观察返回图片 URL 思考图片生成成功。现在写文案结合图片内容和平台风格 ✅ 输出文案 配图价值讲解注意这个任务里模型既有内置能力看图、写文案又调了外部工具生图——Agent 的厉害之处在于它能自己权衡哪部分我来做哪部分交给工具。这和纯多模态模型一条龙包办不同工具是即插即用的专业外包模型是调度它们的项目经理。1.6 MCP工具生态的USB-C 接口2024 年底 Anthropic 提出 MCPModel Context Protocol到 2026 年 7 月累计下载 9700 万次被 OpenAI、Google、Microsoft 采纳。解决什么问题MCP 之前每个 Agent 框架各搞一套工具接口OpenAI 有 Function Calling、LangChain 有自己的 Tool 抽象互不兼容——一个天气工具要给十家框架各写一遍适配如同 2000 年代的手机充电器一家一个口。MCP 的机理统一成USB-C。工具开发者只写一个 MCP Server暴露工具、资源、提示词任何支持 MCP 的 AgentClaude Desktop、各类 IDE、ChatGPT 等插上就能用传输层走标准 JSON-RPC 协议。 进一步A2A 协议Agent-to-AgentGoogle 提出已捐给 Linux 基金会解决Agent 与 Agent 之间的通信——MCP 是 Agent 的工具插头A2A 是 Agent 的外交语言两者分层互补。第二部分一个完整的多模态 Agent 案例全程解剖选语音方向用户点名语音与文本转换演示一个语音客服 Agent的完整链路场景你对着手机说我要退上周三买的那件蓝色外套太薄了。第 1 步 · 语音感知耳朵声音波形 → ASR语音识别或原生音频编码器 → 文本我要退上周三买的那件蓝色外套。机理讲解早期做法是级联——先调专门的 ASR 模型转文字再交给语言模型。问题前面提过语气、情绪、说话人身份在转文字时被丢掉ASR 听错太薄了→太破了下游无法纠正。2024 年后主流转向原生语音输入音频 token 直接进统一模型一步到位。第 2 步 · 意图理解 规划大脑模型解析出意图退货实体商品蓝色外套、时间上周三、原因太薄。规划出步骤①查到那笔订单 ②确认是否符合退货政策 ③发起退货 ④告知结果。第 3 步 · 工具调用循环手脚 call_tool(query_orders, {keyword:外套, date_range:上周}) 观察订单 #88231蓝色防风外套¥299签收 4 天 思考签收 7 天内符合7天无理由。发起退货 call_tool(create_return, {order_id:88231, reason:太薄}) 观察退货单已创建上门取件时间可选 思考还需要确认用户方便的时间 ✅ 输出转为语音已为您申请退货快递明早 9-11 点上门取件可以吗第 4 步 · 语音输出嘴文本 → TTS语音合成→ 声波。2026 年的语音合成已能控制音色、语速、情绪——太薄了这种轻微抱怨的场景回应的语气会相应柔和。机理讲解这个案例串起了全链条——感知语音→文本→ 规划拆步骤→ 记忆需要查订单历史长期记忆工具→ 工具调用订单系统、退货系统→ 生成语音合成。单看每一环都是老技术ASR、TTS、RAG 都二十年了Agent 的质变在于LLM 成了总调度把各环节串成了能自主闭环的完整系统。第三部分多 Agent 协作——从一个人干活到一个团队复杂任务写一份行业研究报告一个 Agent 既当研究员又当写手又当审核容易顾此失彼。多 Agent 的思路角色分工 互相讨论。经典架构举例研究报告团队┌─────────────┐ │ 主管 Agent │ ← 拆解任务、分派、汇总 └──┬─────┬────┘ ┌─────┘ └─────┐ ▼ ▼ 研究员 Agent 写手 Agent 搜索阅读工具 写作无工具权限 │ │ └────────┬────────┘ ▼ 审核 Agent事实核查可驳回返工机理讲解每个 Agent 是独立的进程有自己的系统提示词人设/职责、自己的工具权限、自己的记忆。它们通过消息传递协作研究员把资料发给写手审核把修改意见发回写手。微软 AutoGen 的实验表明多 Agent 对话在复杂推理基准上一致优于单 Agent 系统。 原因类似人类社会写作时你很难同时保持创造力和自我批判拆给两个角色各自专注。工程现实2026 年的共识是——能用一个 Agent 解决的不要上多 Agent。多 Agent 引入的通信开销、错误传播一个 Agent 理解偏了全队跑偏、成本翻倍常常得不偿失。多 Agent 适合职责天然分离且单角色上下文会爆炸的场景如软件团队架构师/编码/测试。第四部分为什么 Agent 在 2026 年突然爆发三个条件刚好凑齐工具调用终于可靠了。2024 年初 GPT-3.5 时代的工具调用准确率只有 70-80%——20 步的任务每 5 步卡壳一次根本没法用到 2025-2026 年前沿模型在 BFCL 基准上达到 95%且学会了自己从报错中恢复API 限流了会重试、页面结构变了会换选择器而不是假装成功或直接放弃。成本降到了可用线。2024 年跑一个 Agent 任务要 $0.50-2.00一次订餐厅可能调 6-8 次模型纯玩具2026 年降到 $0.05 以下——和单位任务的人类注意力成本相比已有竞争力。基础设施标准化。MCP 统一工具接口、LangGraph 提供带状态检查点的工作流编排崩溃可恢复、关键节点可人工审批、协议层MCP/A2A/AP2让 Agent 能跨厂商协作。 2023 年六周才能上线的 Agent2026 年 8-12 天就能交付。第五部分清醒认识——Agent 现在做不到什么① 错误的复利效应。单步工具调用准确率 95% 听起来很美但 20 步的任务全程不出错的概率是 0.95²⁰ ≈ 36%。这是 Agent 可靠性的根本敌人工程上的对策是关键步骤加人工审批human-in-the-loop、自动重试、多路径验证。② 幻觉会行动化。Chatbot 幻觉只是说错话Agent 幻觉是做错事——它可能自信地给一个并不存在的航班下单。所以生产环境的 Agent 必须做到工具执行层有权限校验、支付类操作必须人工确认、所有动作可审计。③ 长程任务会迷路。任务步数越长性能衰减越陡——模型在长历史中丢失最初目标的目的漂移问题尚未根治。GAIA 基准考察多步工具使用网页浏览文件处理多模态推理的综合任务上人类得分 92%2026 年初最好的 Agent 约 75%。第六部分新手学习路线第一周用起来。在支持工具调用的模型里各类带深度研究/智能体模式的应用完成 3 个真实任务订行程、整理文献、分析数据表——注意观察和截屏它的思考轨迹这是最好的教材。第二周读懂循环。把本章的 ReAct 轨迹自己手写一遍看懂一篇极简 Agent 代码约 40-120 行Hugging Face Smolagents 是最简入门LangGraph 是生产级标准。第三周动手造一个。给一个 LLM 接上 2 个工具如搜索计算器用循环工具结果回填的最简框架跑通再尝试接入一个现成 MCP Server。之后按兴趣深入——想走工程路线学 LangGraph 状态机与检查点想走研究路线读 ReAct、Toolformer、Voyager自动学工具三篇论文想走应用路线研究你所在行业的工具生态。