Agent Runtime Loop
实时观察智能体的运行时循环:Think → Plan → Act → Observe → Reflect,循环迭代直至目标达成
本节点承载《提示工程技术全景》中 #7 思维树(已配真演练场,见下方真实树搜索)与 #15 Reflexion(已配真演练场,见下方:真实反思闭环 第1轮→评估→反思记忆→第2轮)。
已覆盖技术承载(强覆盖)
已覆盖思维树 (ToT)
把线性推理扩展为树状搜索——在关键节点分叉出多个候选『思路』,用启发式评估各分支并剪枝/回溯,最终汇聚最优解。本节点的 Think→Plan→Act→Observe→Reflect 循环是其『单链』特例;要升级为 ToT,只需在 Reflect 阶段引入多候选评估与回溯。
- 适合需要探索/规划的任务
- 避免一条道走到黑
- 搜索与评估成本高
- 需设计分支与打分策略
Reflexion (反思闭环)
在任务结束后让智能体对自身轨迹做「反思」,把失败/偏差写成可持久化的经验记忆,下一轮据此调整——把试错变成可累积的学习。本节点的 Reflect 节点正是其落地形态。
- 错误可累积为经验
- 少样本即可持续变好
- 反思质量依赖模型自省
- 需管理记忆容量与噪声
思维树 (ToT) 真演练场(强覆盖)
真实树搜索与上方承载卡不同,这里是 真·演练场:在 5×5 网格中从起点 真实展开搜索树——每个节点按曼哈顿距离 真实评估(距终点越近分越高),你可 剪枝低分分支、再从兄弟节点 回溯展开,最终抵达终点。这正是 ToT「分叉-评估-剪枝-回溯」替代线性推理的核心。
提示:先展开起点,对比各分支的「距终点」分数,剪掉明显偏离的,再展开更优分支,直到触达终点并选定。
Reflexion 真演练场(强覆盖)
真实 反思闭环与 #14 ReAct 的 单轮内 step 级循环不同,Reflexion 是 episode 级循环:先跑完第 1 轮 → 真实评估器逐条检查硬约束并列出违规 → 真实反思决策把违规映射成可持久化的「经验记忆」与下一轮策略 → 第 2 轮携带记忆重做,违规真实归零、分数提升。错误因此可被累积为经验。
进度:未开始。 注意:第 2 轮的挑选策略由第 1 轮的 真实违规推导——反思真实驱动了行为改变。
点击「运行第 1 轮」
运行时轨迹 (Execution Trace)
循环阶段详解
理解当前状态与目标,推理下一步该做什么
将目标拆解为可执行的步骤序列
调用工具或 API 执行具体操作
解析执行结果,更新对环境的认知
评估进展,判断是否达成目标或需要调整
核心要点
Agent 通过多轮循环逐步逼近目标,每轮的反思结果决定是否继续迭代或退出循环。
每个阶段的输入输出都被记录到执行轨迹中,便于调试、回放和审计 Agent 行为。
必须设定明确的退出条件(目标达成、最大迭代次数、错误阈值),避免无限循环。