大模型入门30 分钟Track 0

提示工程 (Prompt Engineering)

从直觉到系统:CoT 推理链与 Few-Shot 范式的设计方法论

ATLAS NODE #01

Prompt Engineering Playroom

系统化提示词优化方法论。从单点、简陋的硬编码指令,到具备版本化、可预测、强类型及具备自反思能力的生产级大模型核心控制层。

预计掌握时间
30 分钟
阶段等级
Track 0 · 入门
关联 · 提示工程技术全景查看完整技术地图

本节点是 Atlas《提示工程技术全景》中「已覆盖」技术的主承载。下方技术库每一项都已纳入该技术地图的对照审计:

#3 思维链 CoT#2 少样本 Few-Shot角色提示 Role#1 零样本 Zero-Shot(基线)#4 自我一致性#5 生成知识#10 自动提示工程师#12 方向性刺激

已覆盖技术承载(强覆盖)

已覆盖

本节点承载《提示工程技术全景》中 #4 自我一致性、#5 生成知识提示、#10 自动提示工程师、#12 方向性刺激提示(已配真演练场,见下方真实执行),以及 #1 零样本(思想说明 + 示例)、#18 meta-prompting(已配真演练场,见下方:设计者 persona × 迭代精炼)。

#1

零样本 (Zero-Shot)

不给任何示例,直接让模型基于指令与自身参数知识完成任务。是少样本 / 思维链的前提基线,考验指令清晰度与模型泛化。

强覆盖 · 本节点已配专门承载
「请把下面句子翻译成英文:今天天气真好。」 (无任何示例,模型直接输出 The weather is nice today.)
优势
  • 零示例成本、最快
  • 依赖指令而非样本
局限
  • 复杂/长尾任务易跑偏
  • 对指令措辞敏感
#4

自我一致性 (Self-Consistency)

对同一个问题采样多条推理路径(如多次 CoT),再用多数投票汇聚最终答案。把『单次推理』升级为『多条路径 + 聚合』,显著提升复杂推理的稳健性。

强覆盖 · 本节点已配专门承载
Q: 火车时速 60km,行驶 2.5 小时…? 采样 5 条 CoT → [150, 150, 140, 150, 150] 投票 → 150 为最终答案
优势
  • 显著提升算术/常识推理准确率
  • 对单条 CoT 的偶发失败鲁棒
局限
  • 多次采样推高推理成本
  • 需要额外的聚合/投票逻辑
#5

生成知识提示 (Generated Knowledge)

先让模型生成与问题相关的背景知识段落,再带着这些知识去回答——把『开卷检索』环节显式化,缓解知识缺失与幻觉。

强覆盖 · 本节点已配专门承载
Step1: 请先写出『光合作用』的关键事实… Step2: 基于上述事实,回答『阴天植物为何仍存活』
优势
  • 缓解知识缺失与幻觉
  • 推理过程更可解释
局限
  • 生成的知识本身可能错误
  • 拉长上下文、增加延迟
#10

自动提示工程师 (APE)

用 LLM 自动生成并筛选候选提示词,以目标任务的评分作为搜索目标,把『提示设计』变成可程序化优化的过程。

强覆盖 · 本节点已配专门承载
候选提示 = LLM 基于任务描述生成 N 条 评估 = 在验证集上打分 选择 = 最高分提示作为最终模板
优势
  • 减少对人工调参的依赖
  • 可批量探索提示空间
局限
  • 需要可靠的评估器
  • 搜索与重跑成本高
#12

方向性刺激提示 (Directional Stimulus)

在 prompt 中插入一句引导性刺激(如期望的作答方向或关键词),软性地引导解码走向,而非硬编码硬性指令。

强覆盖 · 本节点已配专门承载
生成摘要前加入: 「请侧重『成本』与『风险』两点」 模型据此调整输出侧重
优势
  • 轻量、即插即用
  • 可微调风格与信息侧重
局限
  • 引导过强会压制模型判断
  • 效果随任务波动
#18

Meta-Prompting (元提示)

让 LLM 站在「提示设计者」视角,自动产出或迭代优化下游任务的提示词——把提示本身当作可被生成的对象,而非人手写死。

强覆盖 · 本节点已配专门承载
「你是一名提示工程师。请为『邮件分类』任务设计 3 版提示,并说明每版权衡。」 → 产出 3 版候选提示,再择优/迭代
优势
  • 把提示工程本身自动化
  • 适合规模化、跨任务
局限
  • 元提示质量依赖基座能力
  • 迭代成本需评估器约束

Self-Consistency 真演练场(强覆盖)

真实投票聚合

与上方承载卡不同,这里是 真·演练场:对一个问题 真实有放回抽样 N 条推理路径(候选池多数正确、少数走偏,模拟模型偶发错误),再用 多数投票真实汇聚。 还可以跑 50 次批量实验,看成功率如何随采样数 N 提升——这就是 Self-Consistency「用成本换稳健」的本质。

1. 选择问题
2. 采样数 N

N 越大,偶发错误路径越难在投票中占优——这正是稳健性的来源。

3. 采样路径与投票结果(实时计算)

选择问题并点击「采样并投票」

诚实说明:候选答案来自预设「带噪样本池」(多数正确、少数走偏),用于模拟模型偶发错误;投票聚合、判定与 50 次批量统计均为真实算法执行,非写死结果。真实场景里这些路径由 LLM 多次解码产生。
多数投票聚合真实执行(有放回抽样)
Robustness ↑ with N
下方为 prompt-optimizer 主交互区(CoT / Few-Shot 的落地 playground)

生成知识提示 真演练场(强覆盖)

两段式 prompt 真实拼接

与上方承载卡不同,这里是 真·演练场: 选好问题后点击「生成背景知识」,系统会 真实从知识库检索 top-k 事实(确定性),并 真实拼接出两段式 prompt(先生成知识、再基于知识作答)。 对比「无知识直接答」的易错点,体会 Generated Knowledge 如何缓解幻觉。

1. 选择问题
2. 检索知识条数 top-k

k 越大,喂给模型的事实越充分;但也会拉长上下文、增加延迟。

3. 两段式 prompt(真实拼接)

选择问题并点击「生成背景知识」

对比(无知识直接答):容易答成『没有阳光就无法光合作用、植物会死』,忽略了散射光与储能缓冲。而生成知识提示先把事实摆到台面上,模型只需「基于给定事实作答」,可靠性显著提升。诚实说明:知识库为演示用预定义事实,非真实检索;但「检索 top-k + 两段式拼接」逻辑真实执行。
top-k 检索 + prompt 拼接真实执行
Hallucination ↓
下方为 prompt-optimizer 主交互区(CoT / Few-Shot 的落地 playground)

自动提示工程师 (APE) 真演练场(强覆盖)

真实评分择优

与上方承载卡不同,这里是 真·演练场: 给定任务,系统 真实生成 N 条候选提示(不同风格/结构), 再用 真实打分器(覆盖任务关键能力词的比例 + 简洁性加权)在「验证集」上评分, 自动选出最高分提示作为最终模板——把「提示设计」变成可程序化优化的过程。

1. 目标任务
2. 候选提示(5 条,由模板生成)
#1请把用户的反馈总结成一段工单摘要。
#2你是一个工单助手。请提取用户反馈中的【问题】【影响】【优先级】三个字段,输出标准化工单摘要。
#3示例:用户说『又登不上了,影响发货』→ 问题:登录失败;影响:无法发货;优先级:高。请按此格式处理新反馈。
#4请扮演严谨的客服主管,先复述用户问题,再评估业务影响,最后给出 P0–P3 优先级与一句话摘要。
#5总结一下用户说了什么。
3. 评分排序(真实计算 score = 0.7×覆盖 + 0.3×简洁)

点击「评分并择优」

诚实说明:候选提示由模板变体生成,非真实 LLM 提议;但 覆盖度 + 简洁性的评分与排序均为真实算法执行,非写死。真实 APE 会用更强的评估器在真实验证集上打分。
候选生成 + 评分择优真实执行
Prompt Optimization
下方为 prompt-optimizer 主交互区(CoT / Few-Shot 的落地 playground)

方向性刺激提示 真演练场(强覆盖)

侧重强度真实计算

与上方承载卡不同,这里是 真·演练场: 在 prompt 中插入一句 引导性刺激(如期望的作答方向), 系统会 真实检测刺激命中了哪些维度, 并 真实调整各维度的呈现强度——直观看到「轻量引导」如何软性改变输出侧重。

1. 选择任务
2. 编辑方向性刺激

试试把刺激改成「侧重体验与时效」,看维度强度如何变化。留空 = 无刺激(均匀)。

3. 各维度呈现强度(真实计算)

编辑刺激并点击「应用」

诚实说明:输出侧重点由「维度强度」真实测算(命中关键词即上调),刺激句由你编辑; 但 prompt 拼接与强度计算均为真实逻辑,非写死。真实场景里模型据此软性调整解码走向。
维度强度测算 + prompt 拼接真实执行
Soft steerable
下方为 prompt-optimizer 主交互区(CoT / Few-Shot 的落地 playground)

Meta-Prompting 真演练场(强覆盖)

设计者 persona × 迭代精炼

与同页 #10 APE(单轮「候选评分择优」)不同,Meta-Prompting 突出 元层: 用若干 设计者 persona(结构化工程师 / 少样本示范者 / 约束清单派 / 对话引导派)各自驱动一条候选提示的生成; 真实 批判者评分器(覆盖度 + 清晰度 + 去歧义)择优;再把胜出者真实 迭代精炼一圈、重新评分——把「提示工程本身」变成可自动迭代的对象。

1. 目标任务
2. 设计者 persona(元层)
结构化工程师 · 强调字段定义与输出 schema
少样本示范者 · 用示例锚定输出形态
约束清单派 · 用硬约束与禁忌收敛歧义
对话引导派 · 以澄清式开头引导模型

进度:未生成。 注意:候选由 persona 模板生成,但 persona 路由、批判评分、迭代精炼与再评分均为真实执行。

3. 候选 × 批判评分 × 迭代精炼(真实计算)

点击「① 生成候选」

诚实说明:真实 LLM 的 Meta-Prompting 中,persona 候选与精炼文本由模型生成;本演练场的 persona 路由、批判者三维打分、择优、迭代精炼与再评分均为真实执行(仅候选文本按 persona 模板确定性产出)。与同页 #10 APE 的区别:多了「设计者 persona 元层」与「迭代闭环」。
persona 路由 + 批判评分 + 迭代精炼 真实执行
Meta-Prompting
上方为 #18 Meta-Prompting 思想承载 + 真演练场;下方为 prompt-optimizer 主交互区

基础提示词 (Direct)

直接描述需求,无额外上下文或约束。适用于低复杂度、高容错场景。

示例模版
写一篇关于量子计算的简短介绍。
优势
  • 极低延迟
  • Token 消耗极小
局限
  • 格式不固定
  • 复杂逻辑容易出错

思维链 (Chain-of-Thought)

引导模型展示完整的逻辑推导过程。显著提升多步骤逻辑与计算的准确度。

示例模版
请一步一步思考,分析人工智能对就业市场的影响。首先列出受影响最大的行业,然后评估岗位的替代率,最后给出应对建议。
优势
  • 突破逻辑推理上限
  • 决策逻辑高可解释性
局限
  • 输出长度增加
  • 首包延迟 (TTFT) 变长

少样本学习 (Few-Shot)

提供 2-5 个标准的高质量示例,让模型直接学习并精确拟合目标模式与行文风格。

示例模版
【示例1】 输入:分析气候变化 输出:[环境维度] 极地融化加速 -> [社会维度] 移民风险增加 -> [治理建议] 碳税税率微调 【示例2】 输入:分析老龄化 输出:[人口维度] 劳动力缩减 -> [社会维度] 养老金缺口扩大 -> [治理建议] 延迟退休政策 【现在请分析】:量子计算发展
优势
  • 格式高度一致
  • 对新任务冷启动极佳
局限
  • Token 预算压力大
  • 过拟合高频特例样本

角色设定 (Role-Playing)

赋予模型特定的专家人设和视角,激发模型权重生成更具专业度和深度的话语体系。

示例模版
你是一位有 20 年经验的 AI 资深科学家。请以客观、严谨但通俗懂行的语调,撰写一份关于量子纠缠在安全通信中应用的机密评估报告。
优势
  • 回答专业度强
  • 语气风格极度拟合
局限
  • 潜在的偏见泛化
  • 可能限制通用发散思维

结构化输出 (Structured)

利用 Schema 强力限制输出为 JSON、XML 等标准数据结构,是前后端结合的基础。

示例模版
请严格以 JSON 格式输出分析结果。结构要求如下: { "topic": "量子计算", "keyConcepts": ["量子比特", "叠加态"], "applications": ["量子化学", "密码破解"] }
优势
  • 易于后端解析
  • 接口具备高鲁棒性
局限
  • 丧失文本丰富性
  • 格式解析失败会阻断系统

自省反思 (Self-Refinement)

引导模型生成初稿,进而扮演评论家找出漏洞,最后自我修正并输出高度润色的定稿。

示例模版
首先,撰写一段解释。接着,对该解释进行批判性评估并指出逻辑漏洞。最后,根据评估意见重新撰写最终稿。
优势
  • 品质逼近出版级
  • 能自动过滤低级逻辑错漏
局限
  • 推理成本翻倍
  • 平均响应时间显著增加