课程 4:Verbalized Sampling — 用"说出分布"解锁 LLM 的多样性

基于论文:Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity (Zhang et al., ICML 2026)

📄 论文信息

标题:Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity

作者:Jiayi Zhang, Simon Yu, Derek Chong, Anthony Sicilia, Michael R. Tomz, Christopher D. Manning, Weiyan Shi

机构:Stanford University, Boston University (CHATS Lab)

来源:arXiv:2510.01171 · ICML 2026 · 代码仓库

核心贡献:找到对齐后 LLM 多样性下降(mode collapse)的数据层根因——偏好数据中的典型性偏置;提出无需训练的提示策略 Verbalized Sampling,让模型"说出一个分布"而非单一答案,恢复预训练时学到的多样性。

💡 一句话总结

对齐后的 LLM 之所以"千篇一律",根因不在算法,而在偏好数据——人类天生偏爱"熟悉、流畅、可预测"的文本(典型性偏置)。解法出奇简单:别让模型只给一个答案,让它列出多个候选并给概率,多样性就回来了。

一、三大贡献概览

1 找到根因:典型性偏置(Typicality Bias)

不同于以往把 mode collapse 归咎于"奖励模型不够好"或"RLHF 优化放大多数派",本文指出一个更底层的数据层驱动:人类标注偏好数据时,系统性地偏爱更"典型"(familiar、fluent、predictable)的文本。这意味着即使有完美的奖励模型和优化过程,mode collapse 仍会发生

2 提出解法:Verbalized Sampling(VS)

一个无需训练的提示策略:把"给我讲个咖啡的笑话"改成"给我 5 个咖啡笑话及其对应概率"。让模型verbalize 一个分布而非单一实例,从根源上绕开典型性偏置。

3 验证效果:多样性提升 1.6–2.1 倍

在创意写作、对话模拟、合成数据生成、开放式问答等任务上,VS 显著提升多样性且不牺牲事实准确性和安全性。创意写作多样性提升 1.6–2.1 倍,恢复基座模型 66.8% 的多样性,人工评估提升 25.7%。

二、背景:对齐的代价——Mode Collapse

RLHF 等后训练对齐方法让 LLM 变得"有用、无害、诚实",但同时带来了一个副作用:mode collapse(模式坍塌)。模型倾向于在一个窄小的"模式"上反复输出,多样性大幅下降。

输出分布:基座模型 vs 对齐模型

·
·
·
·
·
·
·
·

基座模型:输出分布展开,覆盖多种合理回答

对齐模型:分布坍塌到一个窄峰——"标准答案"反复出现

mode collapse 的危害

以往的解释:算法层的锅

之前的工作把 mode collapse 归因于算法层:奖励模型不够好(无法捕捉多元偏好)、KL 正则化优化放大多数派SFT 的交叉熵损失过拟合chat template 限制创造力。本文则说:这些都没错,但漏了一个更根本的层面

三、贡献一:典型性偏置——根在数据里

3.1 来自认知心理学的证据

论文指出,典型性偏置有深厚的心理学根基:

四个心理学现象

这四种倾向合在一起,构成了一个假设:人类标注者会偏爱"更典型"的回答,与任务本身的质量无关

3.2 形式化:奖励 = 真实效用 + 典型性

论文用 RLHF 中常见的 Bradley-Terry 模型,把奖励函数分解为两部分:

r(x, y) = rtrue(x, y) + α · log πref(y | x) + ε(x)
公式 (1):奖励 = 真实任务效用 + α·典型性 + 噪声

其中 log πref(y | x) 是回答 y 在基座模型下的对数概率,作为"典型性"的可量化代理——基座模型在超大语料上最大化似然,其概率天然捕捉文本的典型程度。

关键含义

只要 α > 0(人类哪怕只对典型性有微弱偏好),奖励函数就会系统性偏高估计典型回答的价值。RLHF 优化这个偏高的奖励,结果就是模型把概率质量集中到少数"最典型"的回答上——mode collapse 必然发生,与算法无关。

3.3 经验验证:偏置确实存在

论文在 4 个偏好数据集、5 个基座模型上验证:在纯人工标注的数据集(如 HelpSteer)上,标注者偏爱"基座模型对数概率更高"的回答的比率显著高于随机水平(51.6%–60.8%)。即使控制了 token 数、可读性、type-token 比、句长等表面因素,典型性系数依然显著为正。

核心论断:典型性偏置是 数据层 的、普遍存在 的、无法靠改进算法消除 的 mode collapse 驱动因素。只要偏好数据由人类标注,这个问题就存在。

四、贡献二:Verbalized Sampling——换个问法

既然根在数据,又不能不用人类标注,论文转向推理时的解法。核心洞见:不同的问法会让模型坍塌到不同的"模式"上。

4.1 两种问法的对比

❌ 直接提示(Direct Prompting)

讲一个关于咖啡的笑话。

模型被强制给出单一"最典型"答案——坍塌到 mode。

→ 输出分布窄,多个样本高度雷同

✅ Verbalized Sampling

生成 5 个关于咖啡的笑话,并给出每个笑话对应的概率。

模型被要求 verbalize 一个分布——压力从"选最典型的一个"转移到"列出多种合理选项"。

→ 输出展开,覆盖更多合理回答

4.2 为什么换问法能恢复多样性

论文用代表性启发式(representativeness heuristic)解释这一现象:

不同的问法 → 不同的"代表性"

换句话说:当你问"什么是典型的笑话",模型会给一个老梗;当你问"什么是典型的笑话分布",模型会给出一份包含多种风格的清单——后者天然展开。

4.3 两种实现变体

VS-Standard

一次性让模型生成 k 个候选回答 + 各自概率,然后按模型自报的概率抽样一个作为最终输出。

VS-Sequence

让模型逐个生成候选(每次生成一个并自报概率),适合候选之间需要顺序依赖的场景。

额外能力:多样性可调。VS 的概率阈值可以作为旋钮——只保留模型自报概率高于阈值的候选,就能在"多样性"和"质量"之间精细权衡。这是直接提示做不到的。

五、贡献三:实验效果

5.1 创意写作:多样性 1.6–2.1 倍

在诗歌、故事、笑话生成任务上,VS 相比直接提示:

1.6–2.1×
多样性提升倍数
66.8%
恢复基座模型多样性
+25.7%
人工评估分数提升
不降
质量未牺牲

5.2 跨任务收益

任务 VS 带来的改善
创意写作(诗/故事/笑话) 多样性 1.6–2.1×,人工评估 +25.7%
社会对话模拟 行为更接近人类,部分模型媲美专门微调模型
合成数据生成 数据更多样,下游数学任务性能提升
开放式问答 答案分布更宽、更真实
事实准确性 & 安全性 未下降(VS 不牺牲这两项)

5.3 涌现趋势:越强的模型,越受益

Emergent Trend

论文观察到一个有意思的趋势:能力越强的模型,从 VS 获得的多样性收益越大。这意味着对齐虽然压住了多样性,但强模型"记住"的预训练分布更丰富——VS 只是把这层封印揭开。弱模型即使被"问分布",也列不出多少有意义的候选。

🔑 核心洞见

对齐后的 LLM 并没有失去多样性——预训练时学到的丰富分布仍在,只是被典型性偏置"封印"了。换一种问法(要分布而非实例),就能在推理时把这份多样性释放出来,无需重新训练。

六、方法局限与未来方向

论文坦诚的局限

未来方向

七、检验:凭记忆作答

回忆比重读更能形成长期记忆。先盖住上面,凭脑子答完再看解析。

1. 本文识别的 mode collapse 的"数据层"根因是什么?
A. 奖励模型容量不够,无法捕捉多元偏好
B. 典型性偏置——人类标注者系统性地偏爱更"熟悉、流畅、可预测"的文本
C. KL 正则化优化过程放大了多数派回答
D. Chat template 过于刚性,限制了模型创造力
2. Verbalized Sampling 的核心做法是什么?
A. 对模型做额外微调,让它生成更多样的回答
B. 调高 temperature 和 top-p 采样参数
C. 改写提示,让模型列出多个候选回答并给出对应概率,再按概率抽样
D. 用一个独立的重排序模型对候选回答重新打分
3. 为什么"问分布"比"问单个实例"更能恢复多样性?
A. 因为分布提示让模型绕过了安全过滤器
B. 问"典型分布"时,代表性回答是多元的"典型集";问"典型实例"时,代表性回答是单个最典型答案——前者天然展开
C. 因为生成多个候选会强制提高 temperature
D. 因为概率数值会让模型更"自信"
4. 关于 VS 的效果,下列哪项描述正确?
A. VS 提升多样性,但会显著降低事实准确性和安全性
B. VS 对所有模型效果相同,与模型能力无关
C. VS 在创意写作上提升多样性 1.6–2.1 倍,恢复基座模型 66.8% 多样性,且不牺牲准确性和安全性;能力越强的模型收益越大
D. VS 必须重新训练模型才能生效

八、本课小结

🎯 核心要点

方法论启示:当问题的根因在数据而非算法时,与其在训练侧苦战,不如在推理侧换个问法绕过去。VS 是"用提示工程解数据偏置"的范例。

九、延伸阅读

📖 主要来源:Verbalized Sampling 原始论文 (arXiv:2510.01171)

🔗 项目主页:verbalized-sampling.com

💻 代码:GitHub - CHATS-lab/verbalized-sampling

💡 相关概念:

💬 有疑问? 随时向我提问!可以询问任何 unclear 的概念,或要求我深入解释某个技术细节。