文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载本篇文章基于浙大 Daily 实验室开源仓库Foundations-of-LLMs中收录的 Arxiv 一周进展报告深入解读西安交通大学与上海 AI Lab 等机构于 2024 年 10 月提出的AgentStore框架论文编号 arXiv:2410.18603作者 Miao Yu、Shilong Wang 等。文章将依次剖析其研究动机、三大核心组件AgentPool / AgentEnroll / MetaAgent、创新性的MetaAgent 与 AgentToken 策略、AgentToken 训练流程Self-Instruct 数据生成 BERTScore 筛选 负对数似然优化以及在OSWorld 真实环境基准上的管理模式消融设计。读完本文你将完整掌握 AgentStore Agent 版 App Store 的架构思路、AgentToken 选择机制的原理与训练细节并了解如何借助本仓库的论文列表与教材章节继续深挖智能体与大模型底层基础。一、研究背景与动机为什么需要Agent 的 App Store在真实世界环境中大模型 Agent 往往被要求处理开放式任务Open-ended Tasks——这类任务类型多样、边界模糊难以预先穷举。现有的 Agent 方法在处理这类任务时普遍暴露出两方面短板泛化能力不足单一通用 Agent 很难在所有任务类别上都表现稳定其在某些特定任务类别上表现较弱专业化能力欠缺任务往往需要特定领域的专长如操作某个具体应用、处理某种模态的输入而通用 Agent 不具备这种专项技能。更深层的矛盾在于即使手头已经拥有大量各有所长的专门 Agent也缺乏一套有效的集成与管理机制来把合适的工作交给合适的 Agent。这正是 AgentStore 要解决的问题。论文的灵感来源非常直观——App Store。智能手机生态里用户不会指望一款 App 搞定所有事而是从应用商店中按需下载、组合各类专用 App。AgentStore 把同样的理念搬到计算机 Agent 世界动态集成异构 Agent并借助高效的管理策略实现系统任务的自动化。一方面让专门 Agent 在各自擅长的领域发挥作用另一方面由统一调度者根据任务动态选择、组合它们从而同时获得专业性与通用性。该主题与本仓库的方向高度契合仓库 readme.md 中明确说明作者团队后续还将继续探索大模型推理加速、大模型智能体等方向本报告正是这一方向探索的阶段性积累。二、总体框架AgentPool、AgentEnroll 与 MetaAgent 三大组件AgentStore 平台的整体架构由三个核心组件构成分别承担存储、注册与调度职责形成了一条从 Agent 入库到任务分发再到执行反馈的完整链路。AgentPool异构 Agent 的应用市场AgentPool 是平台中存储具有不同功能 Agent 的池子类比 App Store 中的应用库。其关键特征是异构性模态维度涵盖从单模态到多模态的 Agent模型来源维度涵盖从开源到闭源模型的 Agent交互界面维度涵盖命令行界面CLI到图形用户界面GUI等多种类型的 Agent。这种异构设计保证了 AgentPool 能够满足多样化的任务需求——不同任务可能落在不同模态、不同模型、不同交互界面上AgentPool 的价值就在于广覆盖、可挑选。AgentEnroll标准化的 Agent 注册协议AgentPool 中的 Agent 并非随意堆放而是通过AgentEnroll定义的一套集成协议规范地上架。该协议要求每个新增 Agent 提供并登记以下信息能力Agent 能做什么限制Agent 不能做什么 / 边界条件交互的应用程序Agent 面向哪些应用操作功能演示Agent 的示例用法。通过这套协议所有 Agent 的注册信息以标准化格式存储确保它们规范地融入平台、便于统一管理与查询。可以理解为AgentEnroll 保证了上架环节的数据质量与一致性为后续 MetaAgent 的检索与调度提供了可靠的基础设施。MetaAgent平台的核心调度者MetaAgent 是整个平台的核心组件职责是根据任务描述和系统状态从 AgentPool 中选择合适的 Agent单个或多个独立或协作地完成任务。它相当于 App Store 里的智能推荐与派单系统输入是任务描述与系统状态输出是选谁、怎么分工、如何执行的决策。三、MetaAgent 与 AgentToken 策略MetaAgent 是 AgentStore 管理能力的集中体现。对于不同的任务MetaAgent 采用思维链Chain-of-Thought的方式进行分析并在两种执行模式中进行选择单 Agent 路由任务适合由单个 Agent 独立完成时采用多 Agent 协作任务需要多个 Agent 分工配合时采用。关于思维链本身的概念与机理可参见仓库教材 第3章 Prompt 工程 中的思维链小节。而驱动这一选择过程的关键技术正是论文的核心创新——AgentToken 策略。AgentToken 嵌入让 Agent 成为可预测的 tokenAgentToken 策略的第一步是把Agent变成模型可以直接处理的对象每个 Agent 被表示为一个可学习的 token 嵌入learnable token embedding这些嵌入被添加到 MetaAgent 的词汇表中。也就是说MetaAgent 原本的词汇表被扩张新增了一批与各 Agent 一一对应的虚拟 token。既然 Agent 有了自己的 token 表示那么选择哪个 Agent这一决策就可以被自然地转化成一个标准的 token 预测问题——这正是后续单/多 Agent 路由机制能够成立的前提。从技术渊源上看这种为模型引入少量可学习向量、并围绕它们做决策的做法与参数高效微调中 Prompt Tuning、Prefix-Tuning 等参数附加方法的思路一脉相承——相关论文在仓库的 大模型经典论文列表参数高效微调章节中均有收录可供对照研读。单 Agent 路由把 Agent 选择转化为下一个 token 预测在推理阶段单 Agent 路由的执行过程非常简洁优雅MetaAgent 以任务描述与系统状态为上下文通过最大化条件概率来预测最可能的下一个 token如果预测出的 token 是某个 Agent token则激活对应的 Agent 去执行任务。这里的精髓在于MetaAgent 不需要任何复杂的工具选择打分器它复用了自回归语言模型最擅长的能力——预测下一个 token。当下一个 token恰好落在 Agent token 词汇上时选择决策便自动完成。这使得Agent 路由与模型的自然语言生成融为一体无需在生成过程之外另起一套选择逻辑。多 Agent 协作TopK 选择与 Manager 模式对于需要多个 Agent 协作完成的任务单 token 预测就不够了。此时 MetaAgent 采用多 token 预测机制使用 TopK 函数选择概率最高的 K 个 Agent token即一次选出 K 个最合适的 AgentMetaAgent 切换到 Manager管理者模式使用构建好的提示模板将任务分解为多个子任务并分配给选定的 Agent。这一规划—分工—执行的协作范式与业界经典的 HuggingGPT由 ChatGPT 规划任务、调度 Hugging Face 上的各专家模型等中央调度 专家执行架构一脉相承——HuggingGPT 论文同样收录在本仓库的 大模型经典论文列表Prompt 工程相关应用部分。四、AgentToken 训练低成本教会 MetaAgent选谁干活AgentToken 策略并不是靠提示词碰运气而是有完整的训练流程来保证 MetaAgent 学会正确的 Agent 选择。训练分为数据生成与训练过程两个阶段。数据生成Self-Instruct 与 BERTScore 质量筛选高质量的训练数据是 AgentToken 策略有效的前提。AgentStore 采用Self-Instruct 方式自动化生成演示数据流程如下种子启动从少量原始演示集和Agent 描述出发自动生成让 MetaAgent 依据这些信息生成新的演示集即新的任务—Agent 选择样例质量筛选BERTScore生成新演示后用BERTScore计算新演示与现有演示的相似度并设定阈值范围进行过滤相似度高于上界 → 与现有数据过于相似视为冗余剔除相似度低于下界 → 与现有数据过于不相似可能是错误或不相关的样例剔除落在阈值范围内 → 保留形成精炼后的演示集合迭代扩充重复上述生成—筛选过程直至生成足够的演示用于训练。值得展开说明的是两个关键技术点Self-Instruct这一数据增强思路源自 Self-Instruct 论文Self-Instruct: Aligning Language Models with Self-Generated Instructions其核心是让模型自己教自己——从少量人工种子出发利用模型本身生成大规模指令与演示。该方法可以显著降低对人工标注的依赖与本仓库 大模型经典论文列表 中 Prompt 工程与参数高效微调两章收录的 Self-Instruct 论文相对应。BERTScore一种基于 BERT 的文本生成自动评估指标利用 BERT 的上下文语义嵌入计算生成文本与参考文本的语义相似度精度、召回与 F1相比逐字匹配的 BLEU/ROUGE 更能捕捉语义层面的相似。其原始论文BERTScore: Evaluating Text Generation with BERTZhang et al., ICLR 2020收录于仓库论文列表语言模型的评测部分。训练过程只更新 Embedding 矩阵的负对数似然优化有了精炼后的演示数据接下来就是训练。AgentToken 训练的目标非常明确让 MetaAgent 学会在给定任务时点选正确的 Agent。具体做法是构造监督信号把任务描述和初始状态作为前缀prefix在其后附上 Agent token 作为下一个 token 预测的正确答案——即告诉模型面对这个任务正确的下一个 token应该是代表某 Agent 的 token训练目标通过更新与 Agent 对应的 Embedding 矩阵参数使模型预测正确 Agent token 的概率尽量高损失函数具体通过计算**负对数似然损失Negative Log-LikelihoodNLL**来衡量预测误差即最小化 $-\log P(\text{正确 Agent token} \mid \text{前缀})$参数冻结无需更新模型其他参数——MetaAgent 的主干网络保持不动只有新增的 Agent token 嵌入矩阵参与训练。为什么只训练 Embedding——与参数高效微调思想的呼应只更新少量新增参数、冻结主体模型这一设计并非偶然它带来三方面直接收益训练成本低仅需优化一个 token 嵌入矩阵规模远小于全量微调普通 GPU 即可负担避免灾难性遗忘主干模型的通用能力不被扰动新增 Agent 或更新 Agent 能力时只需调整对应嵌入可扩展性强新增一个 Agent 等价于在词表中加一个可学习嵌入 为其生成训练数据天然契合Agent 商店持续上架新应用的产品形态。这种冻结主干、只调小参数的思想与仓库教材 第4章 参数高效微调 所系统讲授的参数高效微调PEFT方法论完全一致——教材第四章涵盖了参数附加方法Prompt Tuning、Prefix-Tuning 等、参数选择方法与低秩适配方法LoRA等主流路线是理解 AgentToken 训练哲学的极佳背景读物。五、实验验证在 OSWorld 真实环境中评估OSWorld369 个任务的真实计算机环境基准实验的主要平台是OSWorld——一个包含 369 个任务的可扩展真实环境其中涉及真实的网络应用和桌面应用程序专门用于评估计算机 Agent 处理开放域任务的能力。与纯文本问答基准不同OSWorld 要求 Agent 与真实 GUI 环境交互对泛化性与专业操作能力都提出了更高要求因此是检验 AgentStore 价值的关键战场。四种任务管理模式的消融设计为验证 AgentTokenAT策略的独立贡献实验设定了 AgentStore 的四种管理模式形成完整的消融对照模式全称/含义机制说明定位GTGround-Truth 分配一种理想的任务分配方式将每个任务分配给最适合的 Agent可视为当前 AgentStore 实现的性能上限OracleICL上下文学习在模型输入中提供任务描述和少量示例让模型学习如何选择 Agent无训练、零成本基线FT全面微调在大量任务数据上训练模型通过调整模型参数学习不同任务与 Agent 的关系强训练成本基线ATAgentToken 策略论文提出的创新方案Agent 嵌入词表 token 预测路由 嵌入级训练本文核心方法其中ICL上下文学习正是仓库教材 第3章 Prompt 工程 的上下文学习小节所讲授的核心概念可在对比中体会提示词驱动与参数训练驱动两条 Agent 管理路线的差异。实验结果与关键结论实验的整体设定与结论如下异构 Agent 集成有效AgentStore集成了 20 多个专门 Agent克服了先前方法的局限性。这些专门 Agent在各自擅长的领域表现出色在几乎所有任务领域都能稳定发挥而通用 Agent 则在某些特定任务类别中表现较弱。这说明专用 Agent 组合在覆盖面与稳定性上优于单一大而全 Agent。Agent 管理策略普遍有效在不同任务管理方法下AgentStore 均优于单 Agent 系统——即无论用 ICL、FT 还是 AT 做调度只要接入 AgentPool 的异构 Agent 组合整体表现就超过单个通用 Agent。AgentTokenAT管理能力最佳在四种管理模式中AT 策略显著超过其他方法包括昂贵的全面微调 FT 与无需训练的 ICL是当前最优的管理方式。结合其只训练嵌入、冻结主干的极低成本AT 在效果与开销两个维度上都占据了明显优势。需要说明的是原报告以图表形式呈现的具体数值结果未随文本保留上述结论均忠实于原文的文字性表述如需逐项数据建议查阅论文正文的对应图表。六、延伸学习在本仓库中继续深挖AgentStore 涉及大模型基础能力 智能体编排 数据自举 参数高效训练等多个知识层。本仓库恰好为每一层都提供了系统性的学习资源相关论文清单仓库的 大模型经典论文列表 收录了与 AgentStore 直接相关的多篇关键论文可按图索骥智能体方向大语言模型智能体综述A survey on large language model based autonomous agents、Generative Agents、HuggingGPT 等位于Prompt 工程 → 相关应用部分可了解 Agent 编排的整体脉络数据自举方向Self-Instruct 论文位于Prompt 工程 → 相关应用与参数高效微调 → 实践与应用两部分对应 AgentToken 训练的数据生成阶段评估指标方向BERTScore 论文位于语言模型基础 → 语言模型的评测部分对应演示数据质量筛选环节参数高效训练方向Prompt Tuning、Prefix-Tuning、LoRA 等论文位于参数高效微调章节对应只训练 Agent 嵌入的轻量训练哲学。教材章节衔接第1章 语言模型基础理解 token、词表、条件概率与负对数似然等概念是读懂 AgentToken 嵌入与训练损失的地基第3章 Prompt 工程思维链CoT与上下文学习ICL正是 MetaAgent 分析与 ICL 管理模式的直接来源第4章 参数高效微调AgentToken 只更新嵌入矩阵的训练方式是参数高效微调思想在 Agent 选择场景的落地完整内容可查阅 《大模型基础》完整版 PDF。同系列周报关联在本仓库的 Arxiv 周报系列中可找到与 AgentStore 形成互补的智能体主题文章例如StepAgent从小白到大神过程奖励助力 Agent 进化关注过程奖励如何提升 Agent 任务完成能力可与 AgentToken 的选择式训练对照理解Flow-DPO像数学老师一样思考多智能体推理链自动生成多 LLM 组件在线协作生成推理路径展示了多智能体协作 在线训练的另一条技术路线。总结AgentStore 提供了一套极具工程落地价值的 Agent 集成与管理范式用AgentPool解决Agent 从哪来异构池化、用AgentEnroll解决Agent 怎么入库标准化协议、用MetaAgent AgentToken解决任务交给谁可学习 token 路由与协作调度、用Self-Instruct BERTScore 嵌入级 NLL 训练解决调度能力如何获得低成本自动化训练。其核心洞察在于把选择 Agent这一高层决策降维成语言模型最擅长的下一个 token 预测从而让 Agent 管理从精心设计提示与接口演进为用梯度教会模型选人。结合 OSWorld 上的消融结果——AT 策略优于 ICL 与全量微调 FT、且各类调度均优于单 Agent 系统——这一范式为构建可扩展的通用计算机助手提供了一条清晰可行的路径。无论你是想复现该方法还是想为自身的多智能体系统设计调度层AgentStore 的组件划分与训练细节都值得反复咀嚼。赞分享文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载相关推荐Makefile Tutor调试指南解决Makefile常见问题的实用方法Makefile Tutor调试指南解决Makefile常见问题的实用方法 Makefile Tutor是一个专注于通过逐步演进的C语言模板来教授Makefi美团内部如何使用MyFlash生产环境回滚操作的标准化流程美团内部如何使用MyFlash生产环境回滚操作的标准化流程 MyFlash是由美团点评公司技术工程部开发维护的一个回滚DML操作的工具该工具已经在美团点评内Unity终极角色移动系统架构构建可扩展的状态机驱动方案Unity终极角色移动系统架构构建可扩展的状态机驱动方案 在Unity游戏开发中一个优秀的角色移动系统架构能够为游戏体验带来质的飞跃。现代游戏对角色移动的流上一篇如何零基础上手ComfyUI WanVideoWrapper视频生成从安装到出片的第一条AI视频手把手完整指南下一篇一步成图革命Consistency Model如何重塑2025生成式AI生态创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考