Agent Papers Focused Reading 0 Categories / 0 Tags / 2.2k Words
Agents Note

Agent Papers

收集整理Agent相关的优质论文

2026.06.18 Updated 2026.08.30 2.2k Words

Agent Papers

1.Agent Architecture

  • Cognitive Architecture

2.Execution Paradigms

📄CoT:

  • Paper: Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
  • Year: NeurIPS 2022
  • Link: https://arxiv.org/abs/2201.11903
  • Description: 提出了Chain-of-Thought Prompting 即思维链提示方法思维链是指一系列导向最终输出的中间自然语言推理步骤. 这种提示方法能够引导语言模型生成一系列连贯的中间推理步骤,引导出问题的最终答案。实验发现,这种方法对大规模模型更有效,能显著提升其在算术、常识和符号推理任务上的表现。

论文中的CoT触发方式:

这篇论文思维链是通过 few-shot prompting:给模型少量示例,每个示例都带 question -> reasoning process -> answer,让它学会把中间步骤写出来。同时论文实验发现思维链提示是模型规模的涌现能力,它发现这种方式对 更大规模的模型 效果明显更好,小模型不稳定。

📄Zero-shot CoT:

  • Paper: Large Language Models are Zero-Shot Reasoners
  • Year: NeurIPS 2022
  • Link:https://arxiv.org/pdf/2205.11916
  • Description: 提出了zero-shot CoT , 一种基于零样本的思维链提示方法. 与原始的CoT不同,因为它不需要一步一步的少量示例,因为它本质上是与任务无关的,通过在问题后附加简单触发语(let's think step by step)来诱导模型显式生成中间推理步骤的方法。实验表明,该方法在较大规模模型上效果更明显,尤其适用于算术和推理类任务。

zero-shot CoT 触发方式:

通过在每个答案前简单地添加这句话-----Let’s think step by step.

📄ReAct:

  • Paper: ReAct: Synergizing Reasoning and Acting in Language Models
  • Year: ICLR 2023
  • Link: https://arxiv.org/abs/2210.03629
  • Description: 提出了ReAct ,一种将reasoningacting交替结合的基于提示的Agent范式。模型通过 few-shot 轨迹示例学习在任务中生成 Thought -> Action -> Observation 的交互循环:先推理当前状态,再调用工具或环境获得反馈,并据此修正后续推理与行动。适用于需要检索、规划和执行的复杂任务。

ReAct Prompt 轨迹示例:

论文是通过 few-shot ReAct prompt 案例来让 frozen LLM 学会 Thought -> Action -> Observation 的交替模式,不是主要靠训练。

  • Question Musician and satirist Allie Goertz wrote a song about the “The Simpsons” character Milhouse, who Matt Groening named after who?
  • Thought 1 The question simplifies to “The Simpsons” character Milhouse is named after who. I only need to search Milhouse and find who it is named after.
  • Action 1 Search[Milhouse] Observation 1 Milhouse Mussolini Van Houten is a recurring character in the Fox animated television series The Simpsons voiced by Pamela Hayden and created by Matt Groening.
  • Thought 2 The paragraph does not tell who Milhouse is named after, maybe I can look up “named after”.
  • Action 2 Lookup[named after] Observation 2 (Result 1 / 1) Milhouse was named after U.S. president Richard Nixon, whose middle name was Milhous.
  • Thought 3 Milhouse was named after U.S. president Richard Nixon, so the answer is Richard Nixon.
  • Action 3 Finish[Richard Nixon]

📄Plan-and-Execute:

  • Paper: Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models
  • Year: ACL 2023
  • Link: https://arxiv.org/abs/2305.04091
  • Description: 提出了Plan-and-Solve 的零样本提示方法,来引导LLM首先制定一个计划,将整个任务划分为若干较小的子任务,然后按照该计划逐步完成这些子任务。

对比:

Method Trigger Sentence
CoT Let’s think step by step.
PS Let’s first understand the problem and devise a plan to solve the problem. Then, let’s carry out the plan to solve the problem step by step.
PS+ Let’s first understand the problem, extract relevant variables and their corresponding numerals, and devise a plan. Then, let’s carry out the plan, calculate intermediate variables (pay attention to correct numeral calculation and commonsense), solve the problem step by step, and show the answer.

📄Decomposed Prompting:

3. Planning

  • Task Decomposition
  • Hierarchical Planning
  • Long-horizon Planning
  • Dynamic Replanning

4. Tool Use

📄VADAR:

  • Paper: Visual Agentic AI for Spatial Reasoning with a Dynamic API
  • Year: CVPR 2025
  • Institution: California Institute of Technology (Caltech)
  • Link: https://arxiv.org/abs/2502.06787
  • Description: 提出一种面向3D空间推理的Agentic Program Synthesis方法。与依赖静态人工 API 的视觉程序方法不同,VADAR由多个LLM Agent 协作,根据当前问题动态生成 Python API:先生成待解决子问题的函数签名,再实现相应方法,最后合成并执行完整程序。生成的 API 可以调用目标检测、分割、单目深度估计等视觉专家模块,将复杂的空间问题拆解为多个 grounding 与 inference 步骤,从而处理多步、非模板化的三维推理查询。论文同时提出Omni3D-Bench,包含来自真实场景的500个三维空间推理问题,并在Omni3D-BenchCLEVRGQA上验证了该training-free的动态工具调用框架。

📄pySpatial:

  • Paper: pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning
  • Year: ICLR 2026
  • Institution: Carnegie Mellon University (CMU)
  • Link: https://arxiv.org/abs/2603.00905
  • Description: 提出一种面向MLLM3D视觉程序生成框架,通过统一的 Python 空间 API,让模型在零样本条件下组合和调用多种空间工具,包括3D场景重建、相机位姿估计和新视角合成。给定稀疏多视角图像与自然语言问题,模型生成可执行的 Python 程序,将二维观测转换为可探索的三维场景,并在显式几何结构上完成空间关系推理。与依赖隐式空间想象的端到端方法不同,pySpatial生成的程序具有可解释、可检查和可组合的特点,且不需要针对任务进行梯度微调。在MindCube上相较GPT-4.1-mini提升12.94个百分点,并在Omni3D-Bench和真实室内机器人导航实验中表现出较好的泛化能力。

📄SpaceTools:

  • Paper: Tool-Augmented Spatial Reasoning via Double Interactive RL
  • Year: CVPR 2026
  • Link: https://arxiv.org/abs/2512.04069
  • Description: 提出了一个名为DIRL双重交互强化学习的两阶段训练框架。第一个阶段即教学阶段,为VLM建立基础的工具使用能力;第二个阶段是探索阶段,主要通过持续强化学习进一步完善VLM多工具协调能力。本质上是通过这个训练框架教VLM 在空间推理时如何自主协调多种视觉/机器人工具

📄SpatialClaw:

  • Paper: SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
  • Year: 2026
  • Institution: NVIDIA
  • Link: https://arxiv.org/abs/2606.13673
  • Description: 提出一种用于空间推理的training-free Agent框架,将code作为action interface。VLM在持久化Python kernel中每次生成一个Python cell,将深度、分割、点云等感知工具与NumPy/SciPy运算动态组合,并根据中间文本、可视化结果和报错修改后续分析,形成plan -> code -> execute -> inspect -> revise循环。相比single-pass codestructured tool-call,SpatialClaw同时保留了代码的组合能力、多轮反馈能力和持久化状态,在20个空间推理基准上取得59.9%的平均准确率。

📄S-Agent:

  • Paper: S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
  • Year: 2026
  • Institution: NTU / THU / Ropedia
  • Link: https://arxiv.org/abs/2606.20515
  • Description: 提出面向连续多视角图像与视频空间推理的空间工具调用 Agent 框架。其将VLM作为语义规划器,按需调用三级空间证据:Level 1进行关键帧选择、目标检测与二维定位;Level 2利用深度、相机位姿和三维坐标将二维线索提升为几何证据;Level 3通过计数、测距、朝向、相对位置和物体中心视角等专家,将原始几何信息转换为可直接推理的结构化空间知识。框架同时维护Scene Memory(跨帧实体与空间事实)和Agent Memory(工具调用与中间推理轨迹),将单帧预测转变为跨时空的证据累积。作者还从强规划器生成并筛选工具使用轨迹构建S-300K,微调Qwen3-VL-8B得到S-Agent-8B;论文表明,小模型仅外挂工具并不稳定,而学习完整轨迹后能显著改善工具选择和证据整合能力。

5. Memory

  • Short-term Memory
  • Long-term Memory
  • Episodic Memory
  • Retrieval-Augmented Memory
  • Memory Management

6. Multi-Agent

  • Cooperation
  • Debate
  • Role-playing
  • Communication Protocols
  • Swarm / Society

7. Learning and Improvement /Reflection

  • Self-Refinement
  • Preference Learning
  • RL for Agents
  • Experience Replay

8. Evaluation

  • Benchmarks
  • Metrics
  • Failure Analysis
  • Agent Robustness