·1 min read
"Paper: ReAct — Synergizing Reasoning and Acting in Language Models"
"Yao et al. (2022) — 提出ReAct框架,让LLM交替进行推理轨迹生成和动作执行,显著提升Agent决策能力。"
Paper Reading
AI Agents
Research
ReAct
Paper Info
- 标题: ReAct: Synergizing Reasoning and Acting in Language Models
- 作者: Yao et al. (Princeton)
- 年份: 2022
- 链接: arXiv
Problem
LLM 在推理任务中表现良好(Chain-of-Thought),但无法与外部环境交互。传统 Agent 方法可以执行动作,但缺乏推理能力。
Method
ReAct 将 Reasoning 和 Acting 交替融合:
Thought: 我需要查找今年的财报数据
Action: search_docs("2025 financial report")
Observation: [检索结果: 收入增长15%]
Thought: 根据数据,可以计算利润率
Action: calculate(revenue, costs)
关键优势:
- 推理轨迹帮助模型处理不确定性
- 外部交互提供实时信息
- 交替机制防止 Agent 偏离目标
Key Results
| 任务 | ReAct | CoT | Act-only | |------|-------|-----|----------| | HotpotQA (问答) | 64.5 | 52.3 | 42.1 | | ALFWorld (操作) | 78% | 58% | 51% |
My Understanding
ReAct 的优雅之处在于它的简单:不需要复杂的架构修改,只需改变 Prompt 设计就能让模型同时具备推理和行动能力。这种交替模式比单独使用 CoT 或 Act-only 效果都好,说明二者是互补的。
Engineering Application
在 AuditFlow 中,ReAct 模式被用于:
- 多步审计流程:Agent 交替推理("当前需要检查什么")和行动("执行查询")
- 异常处理:当检索结果不足时,Agent 能推理出需要调整搜索策略
- 结果验证:Agent 先推理预期结果,再与实际数据对比
Related Papers
- Reflexion (2023) — 在 ReAct 基础上加入自我反思机制
- Toolformer (2023) — 教会模型自主使用工具
- Tree-of-Thoughts (2023) — 探索多条推理路径