课程 4:Verbalized Sampling — 用"说出分布"解锁 LLM 的多样性
基于论文:Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity (Zhang et al., ICML 2026)
💡 一句话总结
对齐后的 LLM 之所以"千篇一律",根因不在算法,而在偏好数据——人类天生偏爱"熟悉、流畅、可预测"的文本(典型性偏置)。解法出奇简单:别让模型只给一个答案,让它列出多个候选并给概率,多样性就回来了。
一、三大贡献概览
1 找到根因:典型性偏置(Typicality Bias)
不同于以往把 mode collapse 归咎于"奖励模型不够好"或"RLHF 优化放大多数派",本文指出一个更底层的数据层驱动:人类标注偏好数据时,系统性地偏爱更"典型"(familiar、fluent、predictable)的文本。这意味着即使有完美的奖励模型和优化过程,mode collapse 仍会发生。
2 提出解法:Verbalized Sampling(VS)
一个无需训练的提示策略:把"给我讲个咖啡的笑话"改成"给我 5 个咖啡笑话及其对应概率"。让模型verbalize 一个分布而非单一实例,从根源上绕开典型性偏置。
3 验证效果:多样性提升 1.6–2.1 倍
在创意写作、对话模拟、合成数据生成、开放式问答等任务上,VS 显著提升多样性且不牺牲事实准确性和安全性。创意写作多样性提升 1.6–2.1 倍,恢复基座模型 66.8% 的多样性,人工评估提升 25.7%。
二、背景:对齐的代价——Mode Collapse
RLHF 等后训练对齐方法让 LLM 变得"有用、无害、诚实",但同时带来了一个副作用:mode collapse(模式坍塌)。模型倾向于在一个窄小的"模式"上反复输出,多样性大幅下降。
输出分布:基座模型 vs 对齐模型
基座模型:输出分布展开,覆盖多种合理回答
对齐模型:分布坍塌到一个窄峰——"标准答案"反复出现
mode collapse 的危害
- 创意写作:故事、诗歌、笑话雷同,失去创造力
- 社会模拟:模拟人物行为单一,无法反映真实人群多样性
- 合成数据:生成的训练数据同质化,下游模型学不到丰富模式
- 多元化对齐:无法代表不同人群的多元价值观
以往的解释:算法层的锅
之前的工作把 mode collapse 归因于算法层:奖励模型不够好(无法捕捉多元偏好)、KL 正则化优化放大多数派、SFT 的交叉熵损失过拟合、chat template 限制创造力。本文则说:这些都没错,但漏了一个更根本的层面。
三、贡献一:典型性偏置——根在数据里
3.1 来自认知心理学的证据
论文指出,典型性偏置有深厚的心理学根基:
四个心理学现象
- 单纯曝光效应(Mere-Exposure Effect):人们偏爱熟悉的事物——曝光越多越喜欢
- 可得性启发(Availability Heuristic):容易回忆的内容被判断为"更可能、更可取"
- 加工流畅性(Processing Fluency):容易处理的内容被自动感知为"更真实、更高质量"
- 图式一致性(Schema Congruity):符合既有认知图式的内容受到更少的批判性审视
这四种倾向合在一起,构成了一个假设:人类标注者会偏爱"更典型"的回答,与任务本身的质量无关。
3.2 形式化:奖励 = 真实效用 + 典型性
论文用 RLHF 中常见的 Bradley-Terry 模型,把奖励函数分解为两部分:
其中 log πref(y | x) 是回答 y 在基座模型下的对数概率,作为"典型性"的可量化代理——基座模型在超大语料上最大化似然,其概率天然捕捉文本的典型程度。
关键含义
只要 α > 0(人类哪怕只对典型性有微弱偏好),奖励函数就会系统性偏高估计典型回答的价值。RLHF 优化这个偏高的奖励,结果就是模型把概率质量集中到少数"最典型"的回答上——mode collapse 必然发生,与算法无关。
3.3 经验验证:偏置确实存在
论文在 4 个偏好数据集、5 个基座模型上验证:在纯人工标注的数据集(如 HelpSteer)上,标注者偏爱"基座模型对数概率更高"的回答的比率显著高于随机水平(51.6%–60.8%)。即使控制了 token 数、可读性、type-token 比、句长等表面因素,典型性系数依然显著为正。
核心论断:典型性偏置是 数据层 的、普遍存在 的、无法靠改进算法消除 的 mode collapse 驱动因素。只要偏好数据由人类标注,这个问题就存在。
四、贡献二:Verbalized Sampling——换个问法
既然根在数据,又不能不用人类标注,论文转向推理时的解法。核心洞见:不同的问法会让模型坍塌到不同的"模式"上。
4.1 两种问法的对比
❌ 直接提示(Direct Prompting)
讲一个关于咖啡的笑话。
模型被强制给出单一"最典型"答案——坍塌到 mode。
→ 输出分布窄,多个样本高度雷同
✅ Verbalized Sampling
生成 5 个关于咖啡的笑话,并给出每个笑话对应的概率。
模型被要求 verbalize 一个分布——压力从"选最典型的一个"转移到"列出多种合理选项"。
→ 输出展开,覆盖更多合理回答
4.2 为什么换问法能恢复多样性
论文用代表性启发式(representativeness heuristic)解释这一现象:
不同的问法 → 不同的"代表性"
- 问"单个实例":代表性回答 = 最典型的那个具体答案 → 分布坍塌到一个点
- 问"一个分布":代表性回答 = 能代表整体分布的那个分布 → 而代表性分布恰好是"典型集"(typical set),它本身就是多元的
换句话说:当你问"什么是典型的笑话",模型会给一个老梗;当你问"什么是典型的笑话分布",模型会给出一份包含多种风格的清单——后者天然展开。
4.3 两种实现变体
VS-Standard
一次性让模型生成 k 个候选回答 + 各自概率,然后按模型自报的概率抽样一个作为最终输出。
VS-Sequence
让模型逐个生成候选(每次生成一个并自报概率),适合候选之间需要顺序依赖的场景。
额外能力:多样性可调。VS 的概率阈值可以作为旋钮——只保留模型自报概率高于阈值的候选,就能在"多样性"和"质量"之间精细权衡。这是直接提示做不到的。
五、贡献三:实验效果
5.1 创意写作:多样性 1.6–2.1 倍
在诗歌、故事、笑话生成任务上,VS 相比直接提示:
5.2 跨任务收益
| 任务 |
VS 带来的改善 |
| 创意写作(诗/故事/笑话) |
多样性 1.6–2.1×,人工评估 +25.7% |
| 社会对话模拟 |
行为更接近人类,部分模型媲美专门微调模型 |
| 合成数据生成 |
数据更多样,下游数学任务性能提升 |
| 开放式问答 |
答案分布更宽、更真实 |
| 事实准确性 & 安全性 |
未下降(VS 不牺牲这两项) |
5.3 涌现趋势:越强的模型,越受益
Emergent Trend
论文观察到一个有意思的趋势:能力越强的模型,从 VS 获得的多样性收益越大。这意味着对齐虽然压住了多样性,但强模型"记住"的预训练分布更丰富——VS 只是把这层封印揭开。弱模型即使被"问分布",也列不出多少有意义的候选。
🔑 核心洞见
对齐后的 LLM 并没有失去多样性——预训练时学到的丰富分布仍在,只是被典型性偏置"封印"了。换一种问法(要分布而非实例),就能在推理时把这份多样性释放出来,无需重新训练。
六、方法局限与未来方向
论文坦诚的局限
- 计算开销:VS 需要模型一次性生成 k 个候选 + 概率,token 消耗和延迟高于直接提示
- 依赖模型规模与能力:弱模型列不出有意义的候选分布,收益有限——VS 的效果与模型能力正相关
- 自报概率的校准性:VS 依赖模型"诚实地"给概率,模型自报概率的校准度影响抽样质量
- 典型性的代理不完美:用基座模型对数概率作为"典型性"代理,受表面形式影响,虽控制后仍显著,但不是纯粹的心理典型性
未来方向
- 缓解奖励模型中的偏置:从数据层入手,构造去偏的偏好数据
- 推理时扩展:VS 可与推理时 scaling 结合,在更大候选空间中搜索
- 更广应用:RL 中的探索、假设生成、社会模拟等场景
七、检验:凭记忆作答
回忆比重读更能形成长期记忆。先盖住上面,凭脑子答完再看解析。
1. 本文识别的 mode collapse 的"数据层"根因是什么?
A. 奖励模型容量不够,无法捕捉多元偏好
B. 典型性偏置——人类标注者系统性地偏爱更"熟悉、流畅、可预测"的文本
C. KL 正则化优化过程放大了多数派回答
D. Chat template 过于刚性,限制了模型创造力
2. Verbalized Sampling 的核心做法是什么?
A. 对模型做额外微调,让它生成更多样的回答
B. 调高 temperature 和 top-p 采样参数
C. 改写提示,让模型列出多个候选回答并给出对应概率,再按概率抽样
D. 用一个独立的重排序模型对候选回答重新打分
3. 为什么"问分布"比"问单个实例"更能恢复多样性?
A. 因为分布提示让模型绕过了安全过滤器
B. 问"典型分布"时,代表性回答是多元的"典型集";问"典型实例"时,代表性回答是单个最典型答案——前者天然展开
C. 因为生成多个候选会强制提高 temperature
D. 因为概率数值会让模型更"自信"
4. 关于 VS 的效果,下列哪项描述正确?
A. VS 提升多样性,但会显著降低事实准确性和安全性
B. VS 对所有模型效果相同,与模型能力无关
C. VS 在创意写作上提升多样性 1.6–2.1 倍,恢复基座模型 66.8% 多样性,且不牺牲准确性和安全性;能力越强的模型收益越大
D. VS 必须重新训练模型才能生效
八、本课小结
🎯 核心要点
- mode collapse 的根因在数据层:偏好数据中的典型性偏置(人类偏爱熟悉/流畅/可预测的文本),有认知心理学根基
- 形式化:奖励 = 真实效用 + α·典型性;只要 α > 0,mode collapse 必然发生,与算法无关
- 解法 Verbalized Sampling:让模型"列出多个候选 + 概率"而非给单个答案——无需训练的提示策略
- 原理:问"典型分布" → 代表性回答是多元的"典型集";问"典型实例" → 坍塌到单个最典型答案
- 效果:创意写作多样性 1.6–2.1×,恢复基座模型 66.8% 多样性,不牺牲准确性和安全性
- 涌现趋势:模型越强,VS 收益越大——多样性从未丢失,只是被"封印"
方法论启示:当问题的根因在数据而非算法时,与其在训练侧苦战,不如在推理侧换个问法绕过去。VS 是"用提示工程解数据偏置"的范例。
九、延伸阅读
📖 主要来源:Verbalized Sampling 原始论文 (arXiv:2510.01171)
🔗 项目主页:verbalized-sampling.com
💻 代码:GitHub - CHATS-lab/verbalized-sampling
💡 相关概念:
- Mode Collapse 与 RLHF 对齐的代价
- 典型性偏置与认知心理学(单纯曝光效应、加工流畅性、可得性启发)
- Bradley-Terry 偏好模型与奖励建模
- 典型集(Typical Set)与信息论
- 解码策略多样性(temperature、top-p、min-p、μ-sampling、mirostat)
- LLM 不确定性 verbalization 与置信度校准
💬 有疑问? 随时向我提问!可以询问任何 unclear 的概念,或要求我深入解释某个技术细节。