Few-shot
Few-shot给几个例子它就会了
Few-shot 提示是一种无需修改模型权重、仅靠在 Prompt 中提供少量输入-输出示例就能引导大语言模型完成新任务的推理范式。它是上下文学习(In-Context Learning)的核心形式,2020 年随 OpenAI GPT-3 论文的发布而被系统验证并广为人知。
概述
Few-shot 提示是一种无需修改模型权重、仅靠在 Prompt 中提供少量输入-输出示例就能引导大语言模型完成新任务的推理范式。它是上下文学习(In-Context Learning)的核心形式,2020 年随 OpenAI GPT-3 论文的发布而被系统验证并广为人知。
核心定义
Few-shot 提示让模型在不经过额外训练的前提下,仅凭 Prompt 中的示范样本推断任务逻辑。
- 示例数量:一般 2–8 个,超出此范围收益递减,过多示例还可能占满上下文窗口
- 无权重更新:模型参数完全冻结,学习发生在推理阶段的注意力计算中
- 格式为输入→输出对:每个示例呈现「问题:…\n答案:…」形式,让模型学会模式
- 与 Fine-tuning 的本质区别:Fine-tuning 持久改变权重,Few-shot 效果仅在当次推理有效
Zero / One / Few-shot 对比
按示例数量,可将提示策略分为三个层级。
- Zero-shot:不提供任何示例,完全依赖模型预训练知识;适用于通用指令能力强的大模型
- One-shot:提供 1 个示例,帮助模型理解输出格式;适合格式敏感但语义简单的任务
- Few-shot:提供 2 个及以上示例,显著提升复杂任务准确率;示例质量比数量更关键
- 选择依据:任务越复杂、输出格式越严格,需要的示例越多;模型能力越强,所需示例越少
工作机制
Few-shot 的有效性源于大语言模型在预训练中积累的模式匹配能力。
- 注意力检索:Transformer 的自注意力机制让模型动态关联示例与当前输入,识别输入-输出映射规律
- 任务归纳:模型并非死记示例,而是从中归纳出任务定义(如「将正式文本改写为口语」)
- 标签敏感性有限:研究发现即使示例标签随机打乱,模型仍能从格式中获益,说明核心作用是格式激活而非规则传授
- 示例顺序影响:示例顺序和选择对性能影响显著,不同排列可导致明显性能差异
实践建议
高质量示例的构建是 Few-shot 效果的关键。
- 代表性:示例应覆盖任务边界情况,而非仅选最容易的样本
- 格式一致:所有示例的 delimiter、字段顺序、标点风格必须统一
- 质量优先于数量:2–5 个精选示例通常优于 10 个噪声样本
- 避免标签偏置:若分类任务示例全为正例,模型会系统性偏向正类
- 动态选择:可用语义相似度检索与当前输入最相关的示例(即 Dynamic Few-shot / RAG 增强)
发展脉络
Few-shot 学习的概念演化跨越了经典机器学习与大模型两个时代。
- 2019:GPT-2 展示了在没有明确训练的情况下完成多项任务的潜力,埋下 In-Context Learning 的种子
- 2020:OpenAI 发布 GPT-3(「Language Models are Few-Shot Learners」,NeurIPS 2020),首次系统量化 Few-shot 能力,成为里程碑;论文展示随示例数量增加性能的变化曲线
- 2022:Google 提出 Chain-of-Thought Prompting,在 Few-shot 示例中加入逐步推理过程,大幅提升复杂推理性能
- 2022:Min 等人研究发现示例标签正确性对性能影响有限,深化了学界对 ICL 机制的理解
- 2024 起:超长上下文模型(支持 100K+ token)使 Many-shot 成为可能,Dynamic Few-shot 与 RAG 结合成为主流工程实践
局限性
Few-shot 并非万能,了解其边界有助于合理使用。
- 上下文窗口限制:示例占用 token,过多示例可能挤压真实输入的空间,推高推理成本
- 示例敏感性:顺序不同、措辞细微差异均可导致明显的性能波动
- 不适合专域任务:需要大量私有知识的任务(如企业内部规范)仍需 Fine-tuning 或 RAG 补充
- 无真正学习:每次对话结束后「学到」的模式消失,不能跨对话积累;对模型从未见过的新知识几乎无效
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「给几个例子它就会了」
- 「给范例就会」
- 「上下文里带例子」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级场景高频查看详解 →
一个 Prompt 效果不好,你会怎么一步步优化它?
先看 badcase 找失败模式,针对性改一处,固定评测集对照,用数据迭代而非凭感觉。
- 中级场景查看详解 →
Few-shot 的示例如何选择与排序更有效?
示例要多样且有代表性、与当前 query 相似(kNN 检索),标签平衡,且顺序敏感需注意近因效应。
- 初级概念高频查看详解 →
Few-shot 与 Zero-shot 提示有什么区别?什么时候用 few-shot?
Zero-shot 只给指令不给示例;few-shot 在提示中嵌入若干输入-输出示例,靠上下文学习引导格式与风格。
- 中级概念高频查看详解 →
什么是上下文学习(In-Context Learning)?模型为何不更新参数也能学?
模型从 prompt 中的示例推断任务模式并续写答案,是前向推理时的模式补全,不改变任何权重。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
Prompt Engineering 最佳实践
系统学习 CoT、Few-shot、ReAct 等 Prompt 设计模式与技巧
- 2
高级 Prompt 工程技术:Chain-of-Thought、Few-Shot 与结构化提示词的深度实践
从基础的提示词编写到高级推理策略的系统性进阶。深入解析 Chain-of-Thought(思维链)、Few-Shot Learning(少样本学习)、Self-Consistency(自一致性)、ReAct 推理框架、Tree of Thoughts 等高级 Prompt 技术,配以 Python 可运行代码和实战对比实验,帮助开发者构建生产级 Prompt 系统。
外部参考
维基百科:查看「Few-shot」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
