扩散语言模型终破100B规模!蚂蚁LLaDA2.2正面叫板自回归,杀入Agent战场
ChatGPT出来快三年了,大模型圈几乎形成了一种共识,自回归(AR)似乎就是通往通用智能的主路线。
GPT-3、GPT-4、Llama、Qwen,主流大模型全在沿着同一条路径狂奔,更大的参数、更多的数据、更长的上下文。
路越走越宽,也越走越挤。
一个token接一个token往外蹦的生成方式,模型越来越大、需求越来越复杂,推理效率慢慢成了绕不过去的坎。
那能不能换种生成方式?扩散语言模型(dLLM)给了个不一样的答案。
理论上,扩散语言模型可以并行预测多个token,不用像AR模型那样死等前一个token生成完。同时它还天然具备双向上下文建模的能力。
但过去几年,扩散语言模型始终没进大模型的主战场。公开的最大离散扩散语言模型,规模长期卡在8B,而AR那边早就冲到几百B了。
关键问题一直没人答得上来,扩散语言模型的这些理论优势,在百B级规模还能站得住吗?规模持续放大后,它到底能不能跟成熟的AR路线正面掰手腕?
蚂蚁联合多所高校发了LLaDA系列技术报告,沿着一条清晰的路线连推三个版本。LLaDA2.0先把模型做到了100B,47个benchmark上综合追平同规模AR,编程和智能体任务已经领先。2.1在此基础上加了 T2T 编辑通道和EBPO强化学习,推理速度冲到1587 TPS,36个基准全面超过2.0。
但这两版有一个共同的限制,编辑只能一对一替换token,不能增删。到了Agent场景,面对缺失参数、重复n-gram、残缺代码块,替换根本兜不住。
于是有了LLaDA2.2。这次的重点不再是堆规模或提速度,而是直接把扩散语言模型推进 Agent 的核心战场,让扩散模型在工具交互任务中首次展现出超过同规模自回归模型的潜力。
- 技术报告链接:https://github.com/inclusionAI/LLaDA2.X
01
WSD三阶段持续预训练,
把dLLM推到100B
(一)LLaDA2.0,把扩散模型送上牌桌
之前扩散语言模型最大只有8B,AR那边几十B、几百B遍地跑。LLaDA2.0干了件别人没干成的事,把扩散语言模型做到了100B。
关键不是从零训,而是拿现成的AR模型,通过WSD三阶段持续预训练慢慢洗成扩散模型。
Warmup逐步放大块大小让模型适应扩散目标,Stable在全序列上充分训练,Decay再缩回来保留推理效率。再加上CAP训练让模型解码时更果断,推理速度反超AR最多2.1倍。
47个benchmark 上,100B的flash版综合73.18分,差不多追平同规模AR。编程和智能体已经领先了。
扩散语言模型上了桌。
但两个问题还悬着,速度还能更快吗?并行解码的局部不一致在复杂任务上会不会崩?
这俩问题,成了LLaDA2.1往下推的方向。光堆规模不够,下一步是让扩散模型具备那种回头看、改一改、纠个错的能力。
(二)LLaDA2.1,学会改错,速度翻倍
LLaDA2.1加了一条T2T编辑通道,模型能回头看了,能纠错了。
配合SMode和QMode,flash版编程峰值干到892 TPS,mini版冲到1587 TPS。同规模AR一般也就200到350。
还引入了EBPO强化学习,用ELBO替代精确对数似然来估计策略梯度,把dLLM 的RL训练拉到了规模化的水平。36个基准上QMode全面超过2.0。
但2.1的T2T只能一对一替换,不能增删token。碰上缺失参数、重复n-gram、残缺代码块,替换根本解决不了。在Agent场景里,这就不够灵活了。
普通文本生成的话,这个限制影响不大。可一旦进了Agent任务,模型面对的是不断变化的环境反馈,得持续修改自己的行动轨迹。光靠替换token,已经兜不住了。
02
扩散语言模型正式
进入Agent时代
Agent场景里,模型不是单轮生成一段文字就完事了。
它得读长的交互历史、规划多步动作、调用外部工具、根据环境反馈修正自己的行为。早期的一点点小错,可能像滚雪球一样把后面所有步骤全污染了。
LLaDA2.1的T2T编辑在这种场景下暴露了两个致命短板。
第一,固定长度替换解决不了结构性问题。JSON里多了一个括号,或者少了一个参数字段,替换没辙。
第二,块并行解码的任意顺序去噪容易导致推理路径坍缩。低不确定性的 token 先被定死,高不确定性的分叉点反而被推迟处理,上下文过早锁定了关键决策。
LLaDA2.2的答案很干脆,把编辑机制从一对一的替换升级成Levenshtein四操作编辑,KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。
不过,要让扩散语言模型真正服务Agent,光有编辑能力还不够。长上下文记忆、推理效率、专家路由的算力成本,这些问题一个都绕不过去。
(一)128K 长上下文
Agent任务的交互历史动不动就几十K token。
LLaDA2.2从2.1的8K底座出发,两阶段渐进式长上下文持续预训练,先在300B token的64K语料上训,再用200B token扩展到128K,最终原生支持128K上下文窗口。
另一个是MoE的推理开销。标准MoE每个token独立选专家,块扩散解码时一块32到64个token各自选top-k,活跃专家集合可能膨胀到好几十个,HBM流量和通信开销直接爆炸。
LLaDA2.2搞了个Block Routing,先在块级别做专家准入,选出固定容量C=48 的专家池,再在池内 token级路由。每个推理块的专家工作集有了可预测的上界,token级的专业化也保住了。
(二) Levenshtein编辑
这是2.2最核心的创新。
扩散解码过程中,模型不仅可以从[MASK]生成token(M2T),不仅可以把已有token换成另一个(T2T),还可以删掉多余的token,或者在指定位置插入新的[MASK]槽位。
训练标签通过LCS(最长公共子序列)对齐自动构造。
模型生成的中间草稿和ground-truth对齐后,匹配位置标KEEP,错位标SUBSTITUTE,多余标DELETE,缺失标INSERT。
训练目标同时覆盖了预测正确token和判断增删操作这两类决策。
效果很直接。
同一底座在相同SWE轨迹数据上做SFT,只开关Levenshtein编辑这一项差异,SWE-bench Verified从35.8分跳到44.4分,+8.6个点。删和插这两个操作,解决的是Token Editing改不动的硬骨头。
(三)L-EBPO
Agent场景下的编辑不是一个孤立的纠错动作,而是一系列跟环境交互的策略性决策。LLaDA2.2搞了个L-EBPO,把Levenshtein编辑操作纳入了强化学习的动作空间。
具体来说,动作空间从原来的猜下一个token扩展到了 {token词汇表} ∪ {DELETE, INSERT}。
L-EBPO在外层用EBPO优化轨迹级决策,在内层管理块内编辑,什么时候删、什么时候插、在哪插。奖励信号完全来自环境反馈,工具调用是否正确、输出格式是否合法、任务有没有完成。
训练基础设施用ASystem做分布式编排,SGLang做rollout生成,AKernel管理大规模沙箱集群。rollout收集、沙箱服务、环境执行和策略优化全部异步并行。
03
交互式工具使用全面反超AR参照
7个Agent基准上,LLaDA2.2-flash平均53.83分,AR参照Ling-2.6-flash是55.74,差距不到2分。
在交互式工具使用任务上,LLaDA2.2-flash全面反超了AR模型,τ²-Bench高出近4个点,PinchBench略占上风,MCP-Atlas领先超过5个点。扩散模型在需要动态感知和反馈闭环的场景里反而有优势。
主要弱项在仓库级软件工程。SWE-bench Verified 拿了49.28,比AR的61.20低了十几个点,多语言版本也只有25.00,落后AR近9个点。长程代码修复这块AR还是更稳。
通识能力方面,10个基准上2.2-flash平均56.81分,低于2.1的59.23和Ling-2.6的65.90。亮点是LongBench v2,2.2拿了45.13,略高于AR的42.94,128K长上下文的效果算验证了。
11个典型工作负载上,LLaDA2.2-flash的BF16推理吞吐平均是Ling-2.6-flash的 1.64倍。FP8量化再提18.6%。Agent 任务里的BFCL-v4冲到703.82 TPS,SWE-bench Verified 也到519 TPS。
同时放出Agent分数和TPS数据,LLaDA2.2想说的东西很清楚,扩散模型不是速度换质量,是可以同时拿到速度和竞争力。至少在多轮交互式Agent场景里,这已经是事实。
04
自回归之外,
Agent时代的另一条路线
LLaDA2.2并没有证明扩散语言模型已经全面超越自回归。它证明的是一件更重要的事,在大模型发展的下一阶段,自回归之外确实存在一条可扩展的新路线。
交互式Agent任务全面超过同规模AR,推理吞吐碾压1.64 倍,128K长上下文也站住了。
短板当然还在,指令遵循、知识推理、长程代码修复,这些AR还是更稳。通识能力差距依旧明显,Agent的优势还覆盖不了所有任务。
但方向已经很清楚了。并行解码、双向上下文、灵活编辑,这些架构层面的先天优势不是靠工程技巧能追平的。自回归卷了三年做到了千亿、万亿,扩散这条路才刚开始放大。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
