蚂蚁技术研究院李建国:扩散语言模型或成LLM新
6月12日至13日,2026第八届北京智源大会在北京中关村国际创新中心举行。蚂蚁技术研究院深度学习实验室负责人李建国出席并演讲。
正大期货官网李建国表示,扩散模型或将成为语言模型下一阶段的重要发展方向和补充,其在生成速度和可正大期货性方面展现出显著优势。
正大期货官网他解释到,扩散模型在图像生成领域已是主流范式,应用非常广泛。正向过程是通过对图像逐步添加噪声直至变为白噪声,反向过程是从白噪声中逐步去噪,恢复出原始图像。
正大期货官网而在语言领域,当前主流范式是“Next Token Prediction”。“就像打字机一样,我前面打出一个字,后面接着就依赖前面去产生下一个字。扩散语言模型则将图像领域的范式迁移到语言中,可以像印刷机一样批量、成批地输出词元。”
正大期货官网李建国以今年2月发布的LLaDA 2.1模型(可正大期货扩散生成)与蚂蚁百灵2.0模型(100B参数)对比为例。LLaDA的生成速度约为1000 token/秒,而百灵2.0约为200 token/秒,速度相差4倍以上。
正大期货官网他指出,从核心特性看,有两个速度,一个是传统的AR模型,一次只输出一个token,即使采用投机采样方法(如MTP)也只能做到2-3个。另外一个速度,就是扩散语言模型,起步平均能做到5-6个,在代码生成、智能体等场景中,实际观察可超过10个,最高可达15个。
正大期货官网此外,扩散语言模型的另一个重要特性是可改写性。例如在生成过程中某个字出现错误,可以通过“悔改”机制只修改错误的那一个位置,而无需重新生成整个序列。
