Prompt Engineering Playroom
系统化提示词优化方法论。从单点、简陋的硬编码指令,到具备版本化、可预测、强类型及具备自反思能力的生产级大模型核心控制层。
本节点是 Atlas《提示工程技术全景》中「已覆盖」技术的主承载。下方技术库每一项都已纳入该技术地图的对照审计:
已覆盖技术承载(强覆盖)
已覆盖本节点承载《提示工程技术全景》中 #4 自我一致性、#5 生成知识提示、#10 自动提示工程师、#12 方向性刺激提示(已配真演练场,见下方真实执行),以及 #1 零样本(思想说明 + 示例)、#18 meta-prompting(已配真演练场,见下方:设计者 persona × 迭代精炼)。
零样本 (Zero-Shot)
不给任何示例,直接让模型基于指令与自身参数知识完成任务。是少样本 / 思维链的前提基线,考验指令清晰度与模型泛化。
- 零示例成本、最快
- 依赖指令而非样本
- 复杂/长尾任务易跑偏
- 对指令措辞敏感
自我一致性 (Self-Consistency)
对同一个问题采样多条推理路径(如多次 CoT),再用多数投票汇聚最终答案。把『单次推理』升级为『多条路径 + 聚合』,显著提升复杂推理的稳健性。
- 显著提升算术/常识推理准确率
- 对单条 CoT 的偶发失败鲁棒
- 多次采样推高推理成本
- 需要额外的聚合/投票逻辑
生成知识提示 (Generated Knowledge)
先让模型生成与问题相关的背景知识段落,再带着这些知识去回答——把『开卷检索』环节显式化,缓解知识缺失与幻觉。
- 缓解知识缺失与幻觉
- 推理过程更可解释
- 生成的知识本身可能错误
- 拉长上下文、增加延迟
自动提示工程师 (APE)
用 LLM 自动生成并筛选候选提示词,以目标任务的评分作为搜索目标,把『提示设计』变成可程序化优化的过程。
- 减少对人工调参的依赖
- 可批量探索提示空间
- 需要可靠的评估器
- 搜索与重跑成本高
方向性刺激提示 (Directional Stimulus)
在 prompt 中插入一句引导性刺激(如期望的作答方向或关键词),软性地引导解码走向,而非硬编码硬性指令。
- 轻量、即插即用
- 可微调风格与信息侧重
- 引导过强会压制模型判断
- 效果随任务波动
Meta-Prompting (元提示)
让 LLM 站在「提示设计者」视角,自动产出或迭代优化下游任务的提示词——把提示本身当作可被生成的对象,而非人手写死。
- 把提示工程本身自动化
- 适合规模化、跨任务
- 元提示质量依赖基座能力
- 迭代成本需评估器约束
Self-Consistency 真演练场(强覆盖)
真实投票聚合与上方承载卡不同,这里是 真·演练场:对一个问题 真实有放回抽样 N 条推理路径(候选池多数正确、少数走偏,模拟模型偶发错误),再用 多数投票真实汇聚。 还可以跑 50 次批量实验,看成功率如何随采样数 N 提升——这就是 Self-Consistency「用成本换稳健」的本质。
N 越大,偶发错误路径越难在投票中占优——这正是稳健性的来源。
选择问题并点击「采样并投票」
生成知识提示 真演练场(强覆盖)
两段式 prompt 真实拼接与上方承载卡不同,这里是 真·演练场: 选好问题后点击「生成背景知识」,系统会 真实从知识库检索 top-k 事实(确定性),并 真实拼接出两段式 prompt(先生成知识、再基于知识作答)。 对比「无知识直接答」的易错点,体会 Generated Knowledge 如何缓解幻觉。
k 越大,喂给模型的事实越充分;但也会拉长上下文、增加延迟。
选择问题并点击「生成背景知识」
自动提示工程师 (APE) 真演练场(强覆盖)
真实评分择优与上方承载卡不同,这里是 真·演练场: 给定任务,系统 真实生成 N 条候选提示(不同风格/结构), 再用 真实打分器(覆盖任务关键能力词的比例 + 简洁性加权)在「验证集」上评分, 自动选出最高分提示作为最终模板——把「提示设计」变成可程序化优化的过程。
点击「评分并择优」
方向性刺激提示 真演练场(强覆盖)
侧重强度真实计算与上方承载卡不同,这里是 真·演练场: 在 prompt 中插入一句 引导性刺激(如期望的作答方向), 系统会 真实检测刺激命中了哪些维度, 并 真实调整各维度的呈现强度——直观看到「轻量引导」如何软性改变输出侧重。
试试把刺激改成「侧重体验与时效」,看维度强度如何变化。留空 = 无刺激(均匀)。
编辑刺激并点击「应用」
Meta-Prompting 真演练场(强覆盖)
设计者 persona × 迭代精炼与同页 #10 APE(单轮「候选评分择优」)不同,Meta-Prompting 突出 元层: 用若干 设计者 persona(结构化工程师 / 少样本示范者 / 约束清单派 / 对话引导派)各自驱动一条候选提示的生成; 真实 批判者评分器(覆盖度 + 清晰度 + 去歧义)择优;再把胜出者真实 迭代精炼一圈、重新评分——把「提示工程本身」变成可自动迭代的对象。
进度:未生成。 注意:候选由 persona 模板生成,但 persona 路由、批判评分、迭代精炼与再评分均为真实执行。
点击「① 生成候选」
基础提示词 (Direct)
直接描述需求,无额外上下文或约束。适用于低复杂度、高容错场景。
- 极低延迟
- Token 消耗极小
- 格式不固定
- 复杂逻辑容易出错
思维链 (Chain-of-Thought)
引导模型展示完整的逻辑推导过程。显著提升多步骤逻辑与计算的准确度。
- 突破逻辑推理上限
- 决策逻辑高可解释性
- 输出长度增加
- 首包延迟 (TTFT) 变长
少样本学习 (Few-Shot)
提供 2-5 个标准的高质量示例,让模型直接学习并精确拟合目标模式与行文风格。
- 格式高度一致
- 对新任务冷启动极佳
- Token 预算压力大
- 过拟合高频特例样本
角色设定 (Role-Playing)
赋予模型特定的专家人设和视角,激发模型权重生成更具专业度和深度的话语体系。
- 回答专业度强
- 语气风格极度拟合
- 潜在的偏见泛化
- 可能限制通用发散思维
结构化输出 (Structured)
利用 Schema 强力限制输出为 JSON、XML 等标准数据结构,是前后端结合的基础。
- 易于后端解析
- 接口具备高鲁棒性
- 丧失文本丰富性
- 格式解析失败会阻断系统
自省反思 (Self-Refinement)
引导模型生成初稿,进而扮演评论家找出漏洞,最后自我修正并输出高度润色的定稿。
- 品质逼近出版级
- 能自动过滤低级逻辑错漏
- 推理成本翻倍
- 平均响应时间显著增加