Continuous Diffusion Language Models:连续扩散语言模型的回归?
事件概述
近日,Hacker News 首页推荐了 Sander Dieleman 的博客文章《Continuous diffusion language models》。该文回顾了连续扩散语言模型(Continuous Diffusion Language Models)近年来的发展轨迹,并指出这一研究方向在经历了一段沉寂后,似乎正在重新回到研究者的视野。文章发表于 2026 年 8 月 24 日,讨论的是一股“近期连续扩散语言模型研究的密集涌现”现象。
作者 Sander Dieleman 是 DeepMind 的研究科学家,曾参与 Imagen、Veo、Nano Banana 等图像/视频生成模型的研发。他在文中对连续扩散方法的历史、技术细节和当前复兴的原因给出了个人视角的分析,并欢迎不同意见在评论区讨论。
关键技术点
自回归范式的统治地位与挑战
现代语言模型大多采用自回归(autoregressive)方式生成序列:每次预测一个 token,基于之前的 token 进行条件生成。这种分解方式天然支持并行训练(通过 teacher forcing),但生成过程本身是串行的。非自回归生成、尤其是扩散模型,一直被视为替代路线之一。
扩散模型与语言数据的不兼容
扩散模型最初在图像、音频等连续信号领域取得成功。语言是离散的类别数据,如何将高斯噪声扩散过程适配到离散 token 上,是核心难点。历史上出现了两类解决方案:
- 离散扩散模型(Discrete Diffusion):用离散的噪声过程替代高斯噪声,直接对类别分布建模。代表工作包括 multinomial diffusion、D3PM、SUNDAE。
- 连续扩散模型(Continuous Diffusion):将离散 token 映射为连续 embedding 向量,再使用标准的连续高斯扩散过程。代表工作包括 Diffusion-LM、DiffuSeq、SSD-LM、Difformer、GENIE、SED、CDCD 等。
2021-2023:连续扩散的兴起与“灭绝”
2021 年,第一批针对语言的扩散尝试以离散扩散为主。2022 年,连续扩散方法大量出现,其吸引力在于可以借助当时在视觉/音频领域积累的采样、蒸馏工具,而离散扩散往往难以直接套用这些技术。
但到了 2023 年底,几乎新的研究都转向了离散扩散,连续扩散在语言领域几乎“灭绝”。文中引用了 2025 年一篇综述论文中的图表,清晰显示 2023 到 2024 年间黄色(连续)标记骤减、绿色(离散)标记占据绝对主导。
作者推测了几种可能原因:
- ChatGPT 时刻之后,研究重心从理论优雅转向 raw performance,大家更关心如何与大型自回归模型竞争。
- 离散方法在概念上更接近自回归,可能被认为更容易缩小性能差距。
- 2023 年 Gulrajani & Hashimoto 的研究表明,基于似然的连续扩散语言模型(Plaid-1B)训练效率比自回归基线低 64 倍。在 Chinchilla 最优训练理念主导的时代,这个数字几乎宣判了连续方法的死刑。
但作者也强调,这些推测高度主观,也可能只是偶然。
连续扩散的潜在优势
尽管训练效率不佳,连续扩散模型仍有几个关键优势:
- 能够在单个 token 级别表示不确定性;
- 有丰富的采样算法工具箱(来自图像/音频扩散);
- 在可控文本生成等任务上展示过独特价值。
对数据科学或 AI Agent 落地的意义
虽然原文并未直接讨论 AI Agent,但连续扩散语言模型的回归对生成式 AI 的应用层面有潜在影响:
- 非自回归生成范式可能带来并行解码、更快推理的路径,这对需要低延迟响应的 Agent 系统具有吸引力。
- 离散 token 级别的可控性和不确定性表达能力,有助于更精细地控制生成内容,这对 Agent 在任务规划、多轮交互中的稳定输出可能至关重要。
- 扩散模型天然适合 infilling 和 constrained generation 任务,这类能力在 Agent 需要修改、补全或基于约束生成文本时非常实用。
当然,目前连续扩散模型在语言上的效率劣势仍然明显,距离真正大规模落地还有不小距离。原文也没有提供关于 Agent 的任何具体论述,上述仅是基于技术的合理延伸。
技术点评
Sander Dieleman 的这篇文章是一个很有价值的历史复盘。它提醒我们,研究社区的集体选择并不总是纯粹由技术优劣决定,时代背景、工具成熟度和“主流叙事”也扮演着重要角色。连续扩散在 2023 年的“灭绝”很大程度上是效率劣势和 ChatGPT 冲击的产物,但这并不意味着它是一条死路——近期的大量新研究已经表明,人们正在重新审视这条路径。
不过,值得注意的是,原文在结尾处似乎被截断,我们只能看到“We will talk about what’s been happening in the diffusion langu”这样的片段,后续的完整讨论缺失。因此关于“当前发生了什么”以及“为什么是现在”的详细分析,本文无法完整呈现。建议有兴趣的读者直接阅读原文获取完整内容。
