0
| 本文作者: 徐咪 | 2026-07-06 17:48 | 專題:ICML:國際機(jī)器學(xué)習(xí)會議 |
7月5日,阿里巴巴與清華大學(xué)合作的論文 The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models(靈活性陷阱:重新審視擴(kuò)散語言模型中任意順序生成的價(jià)值)入選AI頂會ICML杰出論文(Outstanding Paper),杰出論文是ICML最高榮譽(yù),代表當(dāng)年最具影響力的研究工作,通常只授予2-3篇,獲獎率僅占接受論文的千分之一。
圖說:2026年7月5日,ICML 2026 主席團(tuán)公布兩篇杰出論文名單,阿里巴巴與清華大學(xué)合作的論文入選。
dLLM(擴(kuò)散大語言模型)是當(dāng)前最受關(guān)注的下一代語言模型架構(gòu)之一,Google的Gemini Diffusion、中國人民大學(xué)的 LLaDA 等都屬于這一方向。主流大語言模型(LLM)如 GPT、Qwen 等生成文本就像打字,從左往右逐個生成 token,與 LLM 不同,dLLM 在生成文本時(shí)可以任意選擇生成順序,無需從左往右,理論上擁有更大的生成解空間,在近一兩年被寄予厚望。但這篇論文首次提出質(zhì)疑:在解決數(shù)學(xué)、編程等通用推理任務(wù)時(shí),任意順序生成非但不能提升模型能力,反而會成為陷阱。
研究發(fā)現(xiàn),不確定性高的關(guān)鍵邏輯節(jié)點(diǎn)(如“因此”“所以”),像是一個分叉口。若采用從左向右的順序,模型必須在此處當(dāng)場作出選擇,生成下一個 token,不能跳過。若采用任意選擇生成順序,模型會傾向于繞過這些難點(diǎn),優(yōu)先處理容易的部分。等回頭再填充這些節(jié)點(diǎn)時(shí),前后文已經(jīng)確立,原本的推理分叉口變成了填空題——答案被上下文鎖定了。
圖說:從左向右的自回歸順序(a)迫使模型在每個邏輯分叉口做出選擇;任意順序(b)繞過難點(diǎn),優(yōu)先處理容易部分,導(dǎo)致推理路徑被提前鎖死。(圖片翻譯自論文)
選擇權(quán)被悄悄消解,研究者將這一現(xiàn)象命名為“熵退化”。實(shí)證數(shù)據(jù)證實(shí)了這一現(xiàn)象:在 HumanEval 代碼生成任務(wù)上,從左往右順序能解出、而任意順序解不出的題目占 21.3%,反向僅 0.6%。且順序的自由度越大,推理性能越差。
基于這一發(fā)現(xiàn),團(tuán)隊(duì)提出的解決方案是“JustGRPO”——意為在強(qiáng)化學(xué)習(xí)訓(xùn)練階段放棄任意順序,強(qiáng)制模型從左到右生成,使用GRPO就可以了。GRPO是一種主流算法,讓模型對同一道題生成多組答案、通過組內(nèi)優(yōu)劣對比來優(yōu)化策略。
此前,為 dLLM 設(shè)計(jì)強(qiáng)化學(xué)習(xí)算法面臨一系列工程難題,比如生成順序不固定導(dǎo)致無法準(zhǔn)確歸因每個詞的貢獻(xiàn),各團(tuán)隊(duì)不得不引入各種復(fù)雜手段。“JustGRPO”則是一種大道至簡的方法,類似于當(dāng)所有人在給左手練力量,有人說:為什么不直接用右手?
“JustGRPO”訓(xùn)練完成后,模型推理速度不受影響,推理效果大幅提高。在 GSM8K(業(yè)界衡量大模型推理能力的標(biāo)準(zhǔn)測試集,包含約 8500 道多步推理小學(xué)數(shù)學(xué)應(yīng)用題)上達(dá)到 89.1% 準(zhǔn)確率,全面超越 d1、ESPO、SPG、GDPO 等所有為擴(kuò)散模型專門設(shè)計(jì)的復(fù)雜強(qiáng)化學(xué)習(xí)算法。
(附:論文下載地址 https://arxiv.org/abs/2601.15165)
本專題其他文章