LLMOps 核心 / Evaluation
从经验性调试到自动化黄金标准 (Golden Dataset)
单步 Prompt 调试在面对复杂的、具有自主运行循环 (Agent Loop) 的非确定性系统时会彻底失效。T4 统御的首要任务,是在 Agent 代码合入主分支前,通过判官模型与断言,构建工业级自动驾驶评估防线。
预计掌握时间
80 分钟
阶段等级
Track 4 · 专家
关联 · 提示工程技术全景查看完整技术地图
以下 1 项原为《提示工程技术全景》中的空白项,现作为扩展承载补充至此。本节点的『轨迹评估 / 断言测试』体系正是量化『模型何时不可靠』的基础设施,天然支撑 Active-Prompt 的样本筛选。
扩展技术承载(弱覆盖)
弱 / 泛化#11
Active-Prompt(主动提示)
先让模型对一批问题作答并估计『不确定性』,挑出最不确定的样本交由人类标注,据此构造 Few-Shot 示例——把标注预算花在刀刃上。本节点的评估/断言测试体系量化了『模型何时不可靠』,正是 Active-Prompt 筛选难例的基础设施。
强覆盖 · 本节点已配专门承载
1) 模型对 100 题自答并打分置信度
2) 取置信度最低的 10 题 → 人工标注
3) 用这 10 题作为 Few-Shot 示例
优势
- 用更少标注达到更高基线
- 聚焦模型真正拿不准的难例
局限
- 需要不确定性估计机制
- 标注闭环带来时延
Active-Prompt 真演练场(强覆盖)
不确定性采样筛选与上方承载卡不同,这里是 真·演练场: 对一批问题 真实多次采样(复用 Self-Consistency 思想), 用 一致性估计不确定性(采样越分散 = 模型越拿不准), 再把 最不确定的 K 题挑出来交人工标注,据此构造 Few-Shot——把标注预算花在刀刃上。
1. 采样次数 M(估计不确定性)
2. 标注预算 K(挑最难例)
共 6 题。排序后不确定性最高的 3 题将被标记为「需人工标注」。
3. 不确定性排序(实时计算)
点击「采样并筛选难例」
诚实说明:答案为预设池(用于制造一致性差异),非真实 LLM 解码;但 多次采样 → 一致性 → 不确定性排序 → 难例筛选均为真实算法执行。本节点的评估/断言体系正是量化「模型何时不可靠」的基础设施。
不确定性估计 + 难例筛选真实执行
Label budget → hard cases下方为 evaluation-engineering 主交互区(判官 / CI 断言的门禁体系)
1. 选择 Agent 运行轨迹 Trace
选择一个待评估的 Agent 思考和工具执行链路片段:
2. 选择评测指标与准则
选择大模型裁判判定该轨迹时使用的核心度量衡:
Agent 运行历史快照 (Trace Details)
User
帮我查询上个月超过 500 元的账单,并简短总结。
Agent (Thought)
用户需要查询上月超过 500 元的账单。我需要调用 get_bills_api 并设置过滤参数。
Agent (Call)工具: get_bills_api
{"limit":100,"month":"previous"}System (Observe)
[{"id":1,"amount":680,"desc":"云服务器续费","date":"2026-06-15"},{"id":2,"amount":120,"desc":"下午茶外卖","date":"2026-06-18"}]Agent (Thought)
API 返回了 2 笔账单。其中云服务器续费(680元)超过 500 元,下午茶外卖(120元)未超过。我需要将超额结果返回给用户。
Agent (Response)
为您查询到上个月超过 500 元的账单共 1 笔: - **云服务器续费**:680 元(2026-06-15) 其他账单金额均低于 500 元限制。
裁判评估报告 (LLM-as-a-Judge Report)
请在左侧选择对应指标与 Agent 轨迹,点击“启动”生成 LLM 判分报告
Metrics standard: Ragas & Promptfoo Assertions查看 Ragas 数学公式