All MicroEvals
Your task is to take the provided technical description and ...
Create MicroEval
Header image for Your task is to take the provided technical description and ...

Your task is to take the provided technical description and ...

Prompt

Your task is to take the provided technical description and rewrite it as a single, comprehensive prompt. Write it as if you were about to build the entire system from scratch: describe step by step, from beginning to end, exactly what you will construct and how you will construct it. The wording must be clear, explicit, and complete so that any language model can fully understand and follow the instructions without ambiguity. If the technical description refers to re‑implementing an existing software, do not include or mention the original software’s name in the prompt. Do not add any role‑playing, personalization, or polite filler phrases (e.g., ‘You are a software developer’, ‘As an expert’, ‘Please kindly’). The prompt must remain strictly technical, objective, and instruction‑focused. Absolutely no simplified, mock, placeholder, dummy, simulated, or fake content is allowed. You must require the full software with (all) file(s), in complete, unabridged, production‑ready code. Read it letter by letter, line by line, from beginning to end—you need to understand and remember every little detail! Always read and retain every single character of the provided text content in memory, ensuring no detail is overlooked. 大型语言模型(LLMs)已日益被部署为能够在广泛任务中执行规划、工具使用和多步推理的自主代理。近期的基于代理的系统在科学研究、软件工程和信息综合等领域表现出令人鼓舞的性能,这表明 LLMs 可以作为协调外部工具和资源的通用问题求解器。尽管取得了这些进展,现有的 LLM 代理在长任务时程上的部署仍然脆弱。 核心挑战源于代理状态的表示与维护方式。多数当前的代理框架默认为将 LLM 提示视为状态的主要载体,把对话历史、工具踪迹、中间计划和部分结果直接累积进上下文窗口。随着任务持续时间的增加,这种设计导致上下文无限增长,迫使系统依赖截断、摘要或启发式检索来保持在模型限制之内。这些机制引入了众所周知的失效模式,包括信息丢失、无关标记的干扰及对早期错误的敏感度提升,最终在长时程上造成行为不稳定。 检索增强生成(RAG)和长上下文模型通过允许访问外部记忆或更大窗口在一定程度上缓解了上下文长度限制。然而,这些方法仍将长期任务状态与代理的即时推理上下文纠缠在一起,随着执行推进不断增加 LLM 的认知负荷。实证证据表明,代理性能常常随着上下文填满而下降,这一现象有时被描述为自主研究代理中的“状态幻觉”。因此,仅仅扩展上下文长度并不能从根本上解决长时程稳定性问题。 诸如 MAKER 的最新工作表明,在高度结构化的领域通过极端任务分解可以实现近乎无限的执行。虽然这对具有预定义子任务边界的逻辑问题有效,但此类方法依赖专用微代理和刚性工作流,限制了其在科学研究等开放领域的适用性,在这些领域中,任务结构、中间目标与相关信息源事先未知。 在本工作中,我们认为,要实现 LLM 代理在长时程上的稳定行为,需要将持久任务状态与受限推理上下文明确分离。我们提出 InfiAgent,这是一种通用代理框架,它将长期状态外化为以文件为中心的表示。InfiAgent 不再在提示中隐式存储历史信息,而是将文件系统视为代理动作、环境和中间产物的权威且持久的记录。在每个决策步骤,代理仅从这一外化状态的快照以及最近操作的固定大小窗口重建其推理上下文,确保无论任务持续多久,上下文大小始终受到严格限制。 基于这一状态抽象,InfiAgent 采用分层代理架构,强制实施结构化任务分解和受控工具调用。高层规划代理基于抽象目标和状态摘要进行操作,而低层代理执行特定领域或原子级操作。此设计减少了在扁平多代理系统中常见的错误传播,并在延长的执行时程中实现一致行为。此外,InfiAgent 引入了一种外部注意机制,在主推理上下文之外处理大型文档和重信息,仅将与任务相关的输出注入代理状态。 我们在 DeepResearch 基准和涉及多达 80 篇学术论文的长时程文献综述任务上评估 InfiAgent。在无任务特定微调的情况下,配备 20B 参数开源模型的 InfiAgent 在 DeepResearch 上取得了与更大专有代理相当或更优的性能。在跨越数百执行步骤的扩展评估中,所提出的以文件为中心的状态抽象实现了可靠的任务完成,而基线代理由于上下文限制常常性能衰退。这些结果表明,显式的状态外化为构建能够在任意长时程上运行的稳定通用 LLM 代理提供了一种实用且有效的基础。 ## 2 相关工作 ### 2.1 多代理系统架构 传统的多代理系统主要聚焦于点对点协作模型。虽然在简单协调方面有效,但这些方法在复杂、分层的任务分解上表现不佳。近期工作研究了分层组织。Moore 对分层多代理系统(HMAS)进行了分类,突出显示了全局效率与局部自治之间的权衡。综合性综述指出,在设计无缝集成认知、规划与交互的统一代理时持续面临挑战。InfiAgent 通过严格的组合约束和以文件为中心的状态来实现稳定性,从而解决了这些问题。 ### 2.2 多代理系统中的任务分解 任务分解一直是核心挑战。现有方法包括面向目标、基于约束和基于学习的分解。诸如 AGENTiGraph 的框架利用知识图谱(KGs)进行分解。然而,这些方法往往缺乏对长时程系统稳定性的保证。MAKER 引入了用于逻辑任务的极端分解,但其在开放式研究中的适用性仍受限。InfiAgent 采用递归的 DAG 分解,既足够灵活以适应通用任务,又保持严格的父子控制。 ### 2.3 长上下文与自主研究代理 Shojaee 等人强调了深度研究代理中的“状态幻觉”,显示随着上下文填满性能往往下降。AgentGym 和 Richelieu 等代理关注自我进化,而 AI Scientist 等系统尝试端到端自动化。然而,许多系统依赖扩展上下文窗口或手动模板。InfiAgent 通过基于文件的状态实现的“零上下文压缩”提供了对这些重上下文方法的稳健替代。 ## 3 面向长时程代理的以文件为中心状态形式化 我们通过区分持久任务状态与受限推理上下文来形式化长时程代理执行问题。这种分离阐明了以上下文为中心的代理设计的局限性,并为 InfiAgent 采用的以文件为中心状态抽象提供动机。 ### 3.1 将代理执行视为状态条件决策过程 我们考虑一个在离散时间步 t=1,2,... 上运行的自主 LLM 代理。在每一步,代理选择动作 a_{t}∈A,条件为其对任务状态的内部表示。在传统代理框架中,该状态由累积的提示上下文隐式表示: c_{t}=⟨o_{1},a_{1},...,o_{t-1},a_{t-1},o_{t}⟩, (1) 其中 o_{t} 表示观察,如用户指令、工具输出或中间结果。随着 t 增大,上下文长度 |c_{t}| 无界增长,需通过截断或压缩以适配有限上下文窗口。 我们将此设计定义为以上下文为中心的状态表示,其中长期任务信息与短期推理信号在单个序列中纠缠。这种纠缠在信息保留与推理稳定性之间引入了内在权衡,尤其在长时程任务中尤为突出。 ### 3.2 持久状态外化 为将长期记忆与受限推理上下文解耦,我们引入显式持久状态表示 S_{t},随时间演化: S_{t}=F_{t}, (2) 其中 F_{t} 表示在步骤 t 存储于代理工作区的文件和结构化产物集合。这些产物可包括中间结果、计划、摘要、数据集或生成代码,共同作为任务进展的权威记录。 持久状态通过代理动作引起的状态转移算子演化: F_{t+1}=T(F_{t},a_{t}), (3) 其中 T 描述文件的创建、修改或删除。重要的是,F_{t} 不受上下文窗口限制,能够随着任务复杂度和持续时间增长。 ### 3.3 受限推理上下文重建 在每一步 t,代理通过查询持久状态构建受限推理上下文 c_{t}^{bounded}: c_{t}^{bounded}=g(F_{t},a_{t-k:t-1}), (4) 其中 a_{t-k:t-1} 表示最近 k 个动作的固定大小窗口,g(·) 为确定性上下文构建函数。在 InfiAgent 中,k 是一个小常数(如 k=10),确保 |c_{t}^{bounded}| 对任务时程为 O(1)。 该公式保证代理的推理上下文在所有 t 上始终受限,而完整任务历史通过持久状态 F_{t} 隐式保存。不像基于摘要的方法,权威状态中的信息不会被丢弃;相反,相关性在每一步通过状态检查动态确定。 ### 3.4 比较与意义 与以上下文为中心、将全部任务状态直接编码于提示中的代理,以及部分外化记忆但将检索文本重新注入上下文的检索增强代理相比,所提出的以文件为中心抽象将持久状态视为一等公民。通过受限接口重建推理上下文,InfiAgent 消除了无界上下文增长并减少长期产物与短期决策间的干扰。 因此,推理错误不太可能随时间隐性累积,代理可以在不增加底层语言模型认知负荷的情况下扩展执行时程。 ## 4 方法论:InfiAgent 框架 基于第 3 节中的以文件为中心状态形式化,我们描述 InfiAgent 这一具体系统,实例化持久状态外化与受限上下文重建。本节聚焦于架构和实现选择,而非重新定义状态抽象。 ### 4.1 以文件为中心的状态管理与任务记忆 InfiAgent 将持久状态 F_{t} 具体化为文件系统上的结构化工作区。每项任务被分配一个专用工作区目录,存储计划、中间产物、工具输出和验证日志。该工作区作为任务进展的权威记录,并在执行步骤与会话间持续存在。 为支持受限推理,InfiAgent 维护最近动作的固定长度缓冲区,并与工作区快照结合,在每一步构建代理推理上下文。实践中,该缓冲区很小(如 10 个动作),在不增加上下文大小的情况下保持短期执行连贯性。 #### 周期性状态整合 为维持长时程执行,InfiAgent 定期将近期进展整合进持久状态。在固定间隔,工作区中存储的高层计划和进度标记被更新,随后推理上下文使用更新后的状态快照刷新。此机制在实践中实现了受限上下文重建,同时在持久存储中保留详细任务产物。 ### 4.2 多级代理层次 InfiAgent 将代理组织为树状层次(DAG): * 第 3 层(Alpha Agent):负责高层规划并将用户请求分解为子任务的协调器,充当决策树根节点。 * 第 2 层(领域代理):如编码代理、数据收集代理或论文撰写代理,执行 Alpha Agent 委派的特定工作流。 * 第 1 层(原子代理):处理具体工具执行的代理,如网页搜索或文件 I/O。 该层次允许串行执行并具有清晰边界。高层代理将低层代理作为可调用工具(Agent-as-a-Tool)调用,防止在扁平多代理系统中常见的“工具调用混乱”,即代理争夺执行权。 ### 4.3 外部注意流水线 为在上下文不膨胀的情况下处理海量信息(例如阅读 80 篇论文),InfiAgent 使用外部注意流水线。当代理需要文档信息时,不会将文档加载进其上下文,而是调用专用工具(如 answer_from_pdf)。该工具启动一个临时、隔离的 LLM 进程来查询文档,并仅返回提取的答案。 C_{main} ← C_{main} ∪ Tool(Query,Document) (5) 这有效地将“阅读”成本转移到工具层,使主代理的认知负荷保持低且专注于决策。此机制充当应用层注意头,从庞大的外部数据源中仅选择相关信息。 ## 5 实验 我们的实验目标是评估显式状态外化是否提升 LLM 代理在长时程任务中的稳定性与可靠性。我们关注于在延长任务持续时间、大型文档集合和重复工具使用下的执行稳健性,而非优化短交互中的峰值性能。 我们在两个互补维度上评估 InfiAgent。首先,我们使用 DeepResearch 基准评估通用研究能力,该基准旨在衡量多步研究质量。其次,我们设计一个长时程文献综述任务,以直接压力测试代理在数百执行步骤中的稳定性。在所有实验中,我们使用相同的模型骨干并在适用时采用可比提示预算,并报告多次运行的平均结果以减少方差。 ### 5.1 DeepResearch 基准 我们在 DeepResearch 基准上评估 InfiAgent,该基准旨在评估代理在信息收集、综合和结构化报告方面的多步研究能力。 #### 设置 我们使用 20B 参数的开源模型(gpt-oss-20b)配置 InfiAgent,未进行任何任务特定微调。为隔离代理架构的影响,我们遵循标准基准协议,并在可能情况下采用默认任务指令。所有报告分数均直接来源于基准评估,以确保系统间可比性。 #### 整体性能 InfiAgent 以 20B 模型取得了 41.45 的总体分数,在效率前沿上相对于依赖更大模型的系统表现良好。虽然绝对性能在代理间有所差异,但该结果表明架构设计可在长篇研究任务中在一定程度上弥补模型规模差异。 #### 组件分析 InfiAgent 在指令遵循和可读性方面表现尤为突出。我们将此归因于显式的以文件为中心状态和结构化执行流水线,它们鼓励遵守任务指令并保持一致的输出格式。在洞察力和全面性方面的表现与更大模型竞争,说明稳定的状态管理支持了在扩展交互中的持续推理。 总体而言,这些结果表明,显式外化代理状态能够在使用较小骨干模型的情况下提升多步研究行为的可靠性和效率。 ### 5.2 长期文献综述任务 为评估长时程稳定性,我们设计了一个要求代理遍历大型论文集的文献综述任务。每次运行提供 80 篇学术论文清单,并指示代理 (i) 阅读每篇论文,(ii) 生成简短摘要,(iii) 分配相关性评分。该任务在数百步骤中对持续工具使用和状态跟踪施加压力。