Prime Agent:一套具备自我改进能力的递归语言模型运行框架原论文信息:arXiv:2608.23552v1 [cs.AI],2026‑08‑24,许可证:CC‑BY‑4.0代码仓库:https://github.com/PrimeIntellect‑ai/prime‑agent摘要大语言模型本质为串行处理器,长时序智能体任务需要模型权重与上下文窗口之外的外部信息与计算资源。Prime Agent是一套开源运行框架,面向长时序评测与代码智能体工作流。框架内置持久 IPython 交互式解释器 REPL,遵循递归语言模型 RLM 抽象,用于可编程上下文处理与测试时计算;Continual Harness组件可以跨任务轨迹持久保存历史记录、记忆、技能、提示词、子智能体配置。递归子智能体之间支持直接点对点通信;Agents View可视化界面可供人类查看与管理后台守护进程托管的会话。Prime Agent 标准化执行、异常恢复、结果核验与资源统计,将策略构建工作留给大模型本身。这套低摩擦、高表达能力的中间层,避免框架自身故障被误判为模型能力缺陷,让评测结果更贴近模型真实上限能力。在 ARC‑AGI‑3 基准上,Prime Agent 将 RHAE Best@1 指标从 30% 提升至 95.5%;在长上下文编码、GPU 内核生成、模拟器构建、自主 nanoGPT 加速复现等任务上,性能持平或优于原生与主流智能体框架。在 Factorio 沙盒环境中,框架支持迭代式技术持续演进,专用子智能体可以实现并行工作。完整代码开源于 GitHub。1 引言大语言模型本身并不具备完整计算机的能力。LLM 是有界串行处理器,每一步决策仅能使用权重参数以及当前激活上下文内的状态信息。**运行框架(Harness)**补充缺失的计算底层,通过工具调用完成外部动作,同时管理模型权重知识之外的信息。智能体压缩(agentic compaction)实现最初的上下文管理:模型选择性分析自身上下文,压缩 token 数量同时保留关键信息。但完整信息状态早已超出权重与 token 上下文的范围,可以类比冯・诺依曼体系存储层级:L0:模型权重;L1:当前激活上下文窗口;L2:持久 REPL 交互式环境 + 递归子智能体会话;L3:磁盘持久化历史、记忆库、可复用技能库。这套层级让模型可以读写、转换、修改指令序列之外可寻址的状态。高表达性是框架的核心特性:不固化单一工作流,对外暴露基础原语,允许模型在推理时自行构建程序、子智能体、反馈循环。递归语言模型 RLM 让上下文与递归调用可编程;Continual Harness支持从历史轨迹中修改提示词、子智能体、技能、记忆。点对点智能体通信支持大规模多智能体集群编排。固定基座大模型借助信息管理与测试时计算,拓展自身可实现的策略集合。Prime Agent 首要定位是长时序任务标准化评测框架。长时序评测有两类核心指标:固定资源开销下得分;性能平台期得分(分析性能随时间变化曲线)。框架作为模型观察、交互外部世界的中间层,模型任务失败应当源于任务本身难度,而不是框架丢失状态、限制合法动作、资源统计错误、提前终止会话。Prime Agent 结合标准化可靠执行,同时提供可编程工具、信息管理、集群编排的低摩擦接口,充分释放模型测试时计算能力,让评测结果逼近模型真实能力上限,而不是被框架短板限制。Prime Agent 统一管理信息与计算:信息管理:通过可编程上下文处理、压缩、持久化历史、可修订记忆,完成 L1‑L3 层级状态流转;计算管理:将测试时计算分配给程序脚本、工具调用、可复用技能、并行递归子智能体;智能体点对点通信:打通分布式计算之间信息路由,实现动态集群协同,同时支持人类查看会话、发送消息、附加会话、干预子智能体,不需要逐条查看全部交互记录。交互产生完整可回放轨迹,可用于后续模型迭代训练。本文贡献:开源 Prime Agent 框架,集成激活上下文、持久化程序执行、递归子智能体、历史轨迹记忆、可复用技能库;提供点对点智能体通信与人机交互;可视化Agents View界面管理后台守护进程会话。标准化评测基础设施,同时保留模型自主构建策略的自由度。实验表明 ARC‑AGI‑3 性能从 30% 提升至 95.5%;在长上下文编码、GPU 内核生成、模拟器构建、nanoGPT 多日自主实验、Factorio、MazeBench 任务上取得优异表现。2 Prime Agent 架构本章详细阐述架构组件:信息与计算管理;权重‑上下文‑REPL‑磁盘多层状态;持久 REPL 与 RLM 可编程计算;递归会话通信与人机交互;Continual Harness 将轨迹证据转化为可复用状态;长时序执行、终止、评测统计语义。2.1 架构总览Prime Agent 将信息管理与计算管理解耦。信息管理:控制哪些状态输入模型调用,压缩、重启后哪些信息可以保留;计算管理:把模型输出动作映射为代码、工具调用、递归子智能体会话;点对点智能体通信连接各个会话节点;人机交互接口允许人工查看、干预单个会话;模型使用 Python 代码操作中间变量;会话在压缩、断开连接、重启过程保留历史;子智能体继承根会话全部执行与通信原语;运行时完整记录模型调用、工具使