Agent中级50 分钟Track 2

智能体运行时循环 (Agent Runtime Loop)

运行时循环可视化 - Think→Plan→Act→Observe→Reflect 全链路推演

ATLAS NODE #03

Agent Runtime Loop

实时观察智能体的运行时循环:Think → Plan → Act → Observe → Reflect,循环迭代直至目标达成

预计掌握时间
50 分钟
阶段等级
Track 2 · 中级
关联 · 提示工程技术全景查看完整技术地图

本节点承载《提示工程技术全景》中 #7 思维树(已配真演练场,见下方真实树搜索)与 #15 Reflexion(已配真演练场,见下方:真实反思闭环 第1轮→评估→反思记忆→第2轮)。

已覆盖技术承载(强覆盖)

已覆盖
#7

思维树 (ToT)

把线性推理扩展为树状搜索——在关键节点分叉出多个候选『思路』,用启发式评估各分支并剪枝/回溯,最终汇聚最优解。本节点的 Think→Plan→Act→Observe→Reflect 循环是其『单链』特例;要升级为 ToT,只需在 Reflect 阶段引入多候选评估与回溯。

强覆盖 · 本节点已配专门承载
Root → [分支A, 分支B, 分支C] 评估: A=0.9, B=0.4, C=0.7 剪枝 B → 从 A/C 继续展开
优势
  • 适合需要探索/规划的任务
  • 避免一条道走到黑
局限
  • 搜索与评估成本高
  • 需设计分支与打分策略
#15

Reflexion (反思闭环)

在任务结束后让智能体对自身轨迹做「反思」,把失败/偏差写成可持久化的经验记忆,下一轮据此调整——把试错变成可累积的学习。本节点的 Reflect 节点正是其落地形态。

强覆盖 · 本节点已配专门承载
第1轮: 行动 → 结果错误 反思: 『我误判了工具返回格式』 第2轮: 带上反思记忆重做 → 成功
优势
  • 错误可累积为经验
  • 少样本即可持续变好
局限
  • 反思质量依赖模型自省
  • 需管理记忆容量与噪声

思维树 (ToT) 真演练场(强覆盖)

真实树搜索

与上方承载卡不同,这里是 真·演练场:在 5×5 网格中从起点 真实展开搜索树——每个节点按曼哈顿距离 真实评估(距终点越近分越高),你可 剪枝低分分支、再从兄弟节点 回溯展开,最终抵达终点。这正是 ToT「分叉-评估-剪枝-回溯」替代线性推理的核心。

1. 搜索空间(网格)
S
×
×
×
G
起点终点已探索墙
操作

提示:先展开起点,对比各分支的「距终点」分数,剪掉明显偏离的,再展开更优分支,直到触达终点并选定。

2. 推理树(展开 / 评估 / 剪枝 / 回溯)
(0,0)距终点 8
诚实说明:网格、墙与启发式(曼哈顿距离)均为真实计算的搜索环境;展开/剪枝/回溯状态真实维护。 真实场景里每个节点的「候选思路」由 LLM 生成、评分由另一个模型或规则给出,但 树搜索的算法骨架与本演练场一致。
树搜索状态真实维护(展开 / 剪枝 / 回溯)
Branching + Pruning
下方为 Agent Runtime Loop 主可视化(Think→Plan→Act→Observe→Reflect 单链循环)

Reflexion 真演练场(强覆盖)

真实 反思闭环

与 #14 ReAct 的 单轮内 step 级循环不同,Reflexion 是 episode 级循环:先跑完第 1 轮 → 真实评估器逐条检查硬约束并列出违规 → 真实反思决策把违规映射成可持久化的「经验记忆」与下一轮策略 → 第 2 轮携带记忆重做,违规真实归零、分数提升。错误因此可被累积为经验。

1. 任务
为一次团队聚餐点菜(预算 ¥100,至少 1 荤 1 素,禁用含花生菜品)。 第 1 轮用「最便宜优先」朴素策略;第 2 轮携带反思记忆重做。

进度:未开始。 注意:第 2 轮的挑选策略由第 1 轮的 真实违规推导——反思真实驱动了行为改变。

2. 两轮轨迹 × 真实评估 × 反思记忆
Round 1朴素策略(最便宜优先,忽略约束)

点击「运行第 1 轮」

诚实说明:真实 LLM 的 Reflexion 中,反思文字由模型生成;本演练场的 评估器(预算/标签/过敏原逐条检查)、反思决策(违规→策略映射)、第 2 轮挑选与分数比较均为真实执行,仅「点菜」结果按策略确定性产出。Reflexion「试错→反思→累积经验→再试」闭环与本演练场一致。
评估 + 反思决策 + 经验记忆 真实执行(反思真实驱动第 2 轮)
Reflexion Loop
上方为 #15 Reflexion 思想承载 + 真演练场;下方继续 Agent Runtime Loop 主可视化
思考
Reason
规划
Plan
行动
Act
观察
Observe
反思
Reflect
未达成目标时,从 Reflect 循环回 Think
迭代轮次:0 / 3
状态:就绪

运行时轨迹 (Execution Trace)

点击「运行」开始模拟智能体循环

循环阶段详解

思考 / Reason

理解当前状态与目标,推理下一步该做什么

规划 / Plan

将目标拆解为可执行的步骤序列

行动 / Act

调用工具或 API 执行具体操作

观察 / Observe

解析执行结果,更新对环境的认知

反思 / Reflect

评估进展,判断是否达成目标或需要调整

核心要点

迭代收敛

Agent 通过多轮循环逐步逼近目标,每轮的反思结果决定是否继续迭代或退出循环。

状态可观测

每个阶段的输入输出都被记录到执行轨迹中,便于调试、回放和审计 Agent 行为。

终止条件

必须设定明确的退出条件(目标达成、最大迭代次数、错误阈值),避免无限循环。