Prompt Engineering · 起点
提示工程:从手艺到工程
这份教程把"写提示"当成一门可以解释、可以测量、可以版本化的工程来教——不是技巧清单,而是一套能迁移到任何模型、任何框架的心智模型。
01适合谁
这份教程面向已经在用大模型 API、想把提示从"碰运气"变成"可控工程"的中级工程师。具体到能力,你应该:
- 能用 Python(或任意语言)调过一次 chat completions / messages API,知道
system/user/assistant三种角色是什么。 - 知道"token"大致是什么、为什么有上下文窗口长度限制,哪怕说不出精确定义。
- 正在或即将构建一个真实的东西——一个 Agent、一个抽取流水线、一个 RAG 问答——而不只是在聊天框里玩。
02不适合谁
如果你是下面任一种,先去别处更划算,回来再读不迟:
- 完全没碰过大模型 API:先跑通一次官方 quickstart(OpenAI / Anthropic),建立"请求进、文本出"的最小直觉。
- 只想要一份"复制就能用"的提示模板:promptingguide.ai 的模板库更对口。本教程教的是模板背后的原理,而不是模板本身。
- 研究者,想读机制论文原文:本教程会引用并解释这些论文,但不替代原文。每章末有论文直链。
03读完之后你能做到什么
这份教程想给你一样文档给不了的东西:把"写提示"从一种凭手感的手艺,变成一件能解释、能测量、能版本化的工程——你能说清楚 few-shot 为什么有时反而拖低推理模型的表现、为什么同一句提示换个模型就崩、以及什么时候根本不该再手写提示而该上评测和自动优化。
落到可验证的能力上,读完你能:
- 拿到一个含糊的提示,指出它会在哪种输入上失败,并给出一个降低失败率的改写——而且说得出为什么。
- 面对一个新任务,从 6 类核心技巧里选对组合(指令 / few-shot / 思维链 / 分解 / 结构化输出 / 检索增强),而不是无脑堆叠。
- 判断一个提示该不该跨模型复用,并解释脆弱性的来源。
- 为一个 Agent 设计系统提示与上下文布局,让它既省 token(缓存命中)又抗注入。
- 说清楚 prompt ops 与自动提示优化(DSPy / GEPA)解决的是手写提示的哪个根本问题——这是面试里最能拉开差距的一题。
一句话本质 · 两个核心认知
- 核心认知 ①(手艺层):提示不是你对一个聪明助手下达的"指令",而是你为一个固定的"下一个-token 概率分布"提供的条件上下文——你在从无数种续写里"选出"一条,而非命令一个会听话的智能体。few-shot 是任务定位、思维链是借 token 当草稿纸做串行计算、提示脆弱是因为模型抓住了 token 级表层特征——全都从这一个事实推出来。
- 核心认知 ②(工程层):模型变强后,"手写一句好提示"正被两件更大的事吸收——上下文工程(决定推理时窗口里放哪些 token)与 prompt ops(用评测集 + 回归把提示当成被测量、被版本化的工程产物,而非手艺)。
稳定(直接学):清晰指令、分隔符、few-shot、任务分解、结构化输出——这套核心手艺自 2022–2023 起就没怎么变,是地基。
在快速变化:① 推理模型(GPT-5.x、o 系列、Claude extended thinking、DeepSeek R1)反转了提示方式——讲"要什么"而非"怎么想",在它们身上 few-shot 和"一步步想"已从最佳实践变得有害;② "提示工程"被重新定位为上下文工程(Anthropic 2025-09)与 prompt ops;③ 自动提示优化 DSPy / GEPA(2025-07)开始取代手工调。
已被取代(别再学旧做法):堆砌"你是一位有 20 年经验的专家"式人设、对推理模型说"一步步想"、手动数 token 的小花招、Claude 的 prefill 续写(4.6+ 直接返回 400 报错)。
提示工程读起来特别顺——因为它看上去就是"用大白话说人话"。这种顺恰恰是最危险的,它会让你误以为自己学会了。读的时候盯住下面这三句话,一旦冒出来就停下:
· "我读得很顺"——顺只说明它没超出你已有的认知,不等于你学到了新东西。
· "我做题很快"——多半你做的是见过的题型,换个输入就露馅。
· "我没卡壳"——没卡壳往往意味着你根本没碰到那个会改变你理解的硬骨头。
真正学到东西的标志,是你在某个地方卡住、皱眉、想反驳。本教程每章末都埋了"刚好够不着"的题,就是用来制造这种卡壳的。
04概念地图
下面这张图是整份教程的骨架。每一个方块都会在后面某一章被讲透。现在不用看懂,记住它的形状:一根从"模型只会做一件事"出发、逐层放大的主轴,加上两个会改变你看法的核心认知。
05学习路径建议
四章按依赖顺序排:先讲是什么(01),再讲为什么有效、为什么脆弱(02),然后规模化到真实系统(03),最后自测与辨析(04)。按需求挑路径:
- 只想把日常提示写好(最短路径):01 全章 → 02 的"脆弱性"一节 → 04 自测的概念层。约 50 分钟。
- 在构建 Agent / 生产系统:01 速读 → 02 全章 → 03 全章(重点) → 04 应用判别层。这是给你的主线。
- 准备面试 / 想讲清"为什么":02 全章(机制 + 备选方案表)→ 03 的可靠性与 prompt ops → 04 应用判别层。重在能复述因果链。
- 带读别人的提示 / 做 code review:01 概念词汇表 → 02 脆弱性 → 03 跨厂商对比表。
06目录
07学完之后
这份教程是地基。建议的下一步,每个都在你的 schema 上加一块:
- 评测工程(Evals):把"提示好不好"变成可测量的数字。它给 prompt ops 补上"怎么测"这一环。参见同目录 agent-interview · 工程化。
- RAG 与检索:当上下文要从外部知识库动态拼装,检索质量直接决定提示质量。参见 agent-interview · RAG。
- Agent 架构与多智能体:把单条提示扩展到工具调用、子任务编排、长程记忆。参见 multi-agent-patterns。
- DSPy 实操:动手把一条手写提示交给优化器自动编译,体会"核心认知②"。