Agent Papers
1.Agent Architecture
- Cognitive Architecture
2.Execution Paradigms
📄CoT:
- Paper:
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models - Year:
NeurIPS 2022
- Link: https://arxiv.org/abs/2201.11903
- Description: 提出了
Chain-of-Thought Prompting即思维链提示方法,思维链是指一系列导向最终输出的中间自然语言推理步骤. 这种提示方法能够引导语言模型生成一系列连贯的中间推理步骤,引导出问题的最终答案。实验发现,这种方法对大规模模型更有效,能显著提升其在算术、常识和符号推理任务上的表现。
论文中的CoT触发方式:
这篇论文思维链是通过 few-shot prompting:给模型少量示例,每个示例都带
question -> reasoning process -> answer,让它学会把中间步骤写出来。同时论文实验发现思维链提示是模型规模的涌现能力,它发现这种方式对 更大规模的模型 效果明显更好,小模型不稳定。
📄Zero-shot CoT:
- Paper:
Large Language Models are Zero-Shot Reasoners - Year:
NeurIPS 2022
- Link:https://arxiv.org/pdf/2205.11916
- Description: 提出了
zero-shot CoT, 一种基于零样本的思维链提示方法. 与原始的CoT不同,因为它不需要一步一步的少量示例,因为它本质上是与任务无关的,通过在问题后附加简单触发语(let's think step by step)来诱导模型显式生成中间推理步骤的方法。实验表明,该方法在较大规模模型上效果更明显,尤其适用于算术和推理类任务。
zero-shot CoT 触发方式:
通过在每个答案前简单地添加这句话-----Let’s think step by step.
📄ReAct:
- Paper:
ReAct: Synergizing Reasoning and Acting in Language Models - Year:
ICLR 2023
- Link: https://arxiv.org/abs/2210.03629
- Description: 提出了
ReAct,一种将reasoning和acting交替结合的基于提示的Agent范式。模型通过few-shot轨迹示例学习在任务中生成Thought -> Action -> Observation的交互循环:先推理当前状态,再调用工具或环境获得反馈,并据此修正后续推理与行动。适用于需要检索、规划和执行的复杂任务。
ReAct Prompt 轨迹示例::
论文是通过 few-shot ReAct prompt 案例来让 frozen LLM 学会
Thought -> Action -> Observation的交替模式,不是主要靠训练。
- Question Musician and satirist Allie Goertz wrote a song about the “The Simpsons” character Milhouse, who Matt Groening named after who?
- Thought 1 The question simplifies to “The Simpsons” character Milhouse is named after who. I only need to search Milhouse and find who it is named after.
- Action 1 Search[Milhouse] Observation 1 Milhouse Mussolini Van Houten is a recurring character in the Fox animated television series The Simpsons voiced by Pamela Hayden and created by Matt Groening.
- Thought 2 The paragraph does not tell who Milhouse is named after, maybe I can look up “named after”.
- Action 2 Lookup[named after] Observation 2 (Result 1 / 1) Milhouse was named after U.S. president Richard Nixon, whose middle name was Milhous.
- Thought 3 Milhouse was named after U.S. president Richard Nixon, so the answer is Richard Nixon.
- Action 3 Finish[Richard Nixon]
- …
📄Plan-and-Execute:
- Paper:
Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models - Year:
ACL 2023 - Link: https://arxiv.org/abs/2305.04091
- Description: 提出了
Plan-and-Solve的零样本提示方法,来引导LLM首先制定一个计划,将整个任务划分为若干较小的子任务,然后按照该计划逐步完成这些子任务。
对比:
| Method | Trigger Sentence |
|---|---|
| CoT | Let’s think step by step. |
| PS | Let’s first understand the problem and devise a plan to solve the problem. Then, let’s carry out the plan to solve the problem step by step. |
| PS+ | Let’s first understand the problem, extract relevant variables and their corresponding numerals, and devise a plan. Then, let’s carry out the plan, calculate intermediate variables (pay attention to correct numeral calculation and commonsense), solve the problem step by step, and show the answer. |
📄Decomposed Prompting:
- Paper:
Decomposed Prompting: A Modular Approach for Solving Complex Tasks - Year:
ICLR 2023
- Link: https://arxiv.org/pdf/2210.02406
- Description:
3. Planning
- Task Decomposition
- Hierarchical Planning
- Long-horizon Planning
- Dynamic Replanning
4. Tool Use
📄VADAR:
- Paper:
Visual Agentic AI for Spatial Reasoning with a Dynamic API - Year:
CVPR 2025 - Institution:
California Institute of Technology (Caltech) - Link: https://arxiv.org/abs/2502.06787
- Description: 提出一种面向
3D空间推理的Agentic Program Synthesis方法。与依赖静态人工 API 的视觉程序方法不同,VADAR由多个LLMAgent 协作,根据当前问题动态生成 Python API:先生成待解决子问题的函数签名,再实现相应方法,最后合成并执行完整程序。生成的 API 可以调用目标检测、分割、单目深度估计等视觉专家模块,将复杂的空间问题拆解为多个 grounding 与 inference 步骤,从而处理多步、非模板化的三维推理查询。论文同时提出Omni3D-Bench,包含来自真实场景的500个三维空间推理问题,并在Omni3D-Bench、CLEVR和GQA上验证了该training-free的动态工具调用框架。
📄pySpatial:
- Paper:
pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning - Year:
ICLR 2026 - Institution:
Carnegie Mellon University (CMU) - Link: https://arxiv.org/abs/2603.00905
- Description: 提出一种面向
MLLM的3D视觉程序生成框架,通过统一的 Python 空间 API,让模型在零样本条件下组合和调用多种空间工具,包括3D场景重建、相机位姿估计和新视角合成。给定稀疏多视角图像与自然语言问题,模型生成可执行的 Python 程序,将二维观测转换为可探索的三维场景,并在显式几何结构上完成空间关系推理。与依赖隐式空间想象的端到端方法不同,pySpatial生成的程序具有可解释、可检查和可组合的特点,且不需要针对任务进行梯度微调。在MindCube上相较GPT-4.1-mini提升12.94个百分点,并在Omni3D-Bench和真实室内机器人导航实验中表现出较好的泛化能力。
📄SpaceTools:
- Paper:
Tool-Augmented Spatial Reasoning via Double Interactive RL - Year:
CVPR 2026
- Link: https://arxiv.org/abs/2512.04069
- Description: 提出了一个名为
DIRL双重交互强化学习的两阶段训练框架。第一个阶段即教学阶段,为VLM建立基础的工具使用能力;第二个阶段是探索阶段,主要通过持续强化学习进一步完善VLM多工具协调能力。本质上是通过这个训练框架教VLM在空间推理时如何自主协调多种视觉/机器人工具。
📄SpatialClaw:
- Paper:
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning - Year:
2026
- Institution:
NVIDIA - Link: https://arxiv.org/abs/2606.13673
- Description: 提出一种用于空间推理的
training-freeAgent框架,将code作为action interface。VLM在持久化Python kernel中每次生成一个Python cell,将深度、分割、点云等感知工具与NumPy/SciPy运算动态组合,并根据中间文本、可视化结果和报错修改后续分析,形成plan -> code -> execute -> inspect -> revise循环。相比single-pass code和structured tool-call,SpatialClaw同时保留了代码的组合能力、多轮反馈能力和持久化状态,在20个空间推理基准上取得59.9%的平均准确率。
📄S-Agent:
- Paper:
S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence - Year:
2026 - Institution:
NTU / THU / Ropedia - Link: https://arxiv.org/abs/2606.20515
- Description: 提出面向连续多视角图像与视频空间推理的空间工具调用 Agent 框架。其将
VLM作为语义规划器,按需调用三级空间证据:Level 1进行关键帧选择、目标检测与二维定位;Level 2利用深度、相机位姿和三维坐标将二维线索提升为几何证据;Level 3通过计数、测距、朝向、相对位置和物体中心视角等专家,将原始几何信息转换为可直接推理的结构化空间知识。框架同时维护Scene Memory(跨帧实体与空间事实)和Agent Memory(工具调用与中间推理轨迹),将单帧预测转变为跨时空的证据累积。作者还从强规划器生成并筛选工具使用轨迹构建S-300K,微调Qwen3-VL-8B得到S-Agent-8B;论文表明,小模型仅外挂工具并不稳定,而学习完整轨迹后能显著改善工具选择和证据整合能力。
5. Memory
- Short-term Memory
- Long-term Memory
- Episodic Memory
- Retrieval-Augmented Memory
- Memory Management
6. Multi-Agent
- Cooperation
- Debate
- Role-playing
- Communication Protocols
- Swarm / Society
7. Learning and Improvement /Reflection
- Self-Refinement
- Preference Learning
- RL for Agents
- Experience Replay
8. Evaluation
- Benchmarks
- Metrics
- Failure Analysis
- Agent Robustness