0
| 本文作者: 叢末 | 2026-07-23 13:34 | 專題:ICML 2019 |

作者丨幸麗娟
編輯丨馬曉寧
AI 訓(xùn)練有個(gè)很棘手的問題:數(shù)據(jù)越來越多,但質(zhì)量參差不齊,直接往里倒反而可能把模型練壞。
那怎么辦?
2018年,一篇 ICML 論文提出了一個(gè)想法:讓 AI 自己學(xué)會挑選訓(xùn)練數(shù)據(jù)。
這個(gè)想法后來有了名字,叫做 Meta-learning for Training-data Selection(MTS) 。
具體怎么挑?用一個(gè)選擇網(wǎng)絡(luò),根據(jù)驗(yàn)證集的反饋,給每個(gè)樣本打分——質(zhì)量高的多學(xué),質(zhì)量差的少學(xué)。
在紙面上,框架優(yōu)雅,邏輯自洽。
然而,問題來了。
直接套用MTS,效果經(jīng)常出不來——甚至和不做任何篩選差不多。花了力氣選數(shù)據(jù),結(jié)果選和不選一個(gè)樣。
因此,做 MTS 方向的人,也越來越少。
更關(guān)鍵的是:沒人能說清楚——為什么一個(gè)看起來很美好的方法,在實(shí)踐中就是不行?
南洋理工大學(xué)李搏揚(yáng)團(tuán)隊(duì),花了一年時(shí)間死磕這個(gè)問題。
結(jié)果發(fā)現(xiàn):MTS 在數(shù)學(xué)層面,本身就存在內(nèi)生缺陷。
于是,他們揪出了兩個(gè)“元兇”,逐一擊破,第一次讓 MTS 這套被"數(shù)學(xué)缺陷"困了六年的框架,跑成功。
論文成果入選 ICML 2026 Oral,全名叫做《On the Difficulty of Learning a Meta-network for Training Data Selection》。

論文鏈接:https://arxiv.org/pdf/2606.00571
AI 科技評論采訪了論文通訊作者、南洋理工大學(xué)計(jì)算與數(shù)據(jù)科學(xué)學(xué)院副教授李搏揚(yáng)。他曾在百度美國研究院擔(dān)任高級研究科學(xué)家,在迪士尼匹茲堡研究院擔(dān)任研究科學(xué)家及研究組組長。
采訪中,他介紹了這項(xiàng)研究的動(dòng)機(jī)、理論突破和對行業(yè)的貢獻(xiàn)價(jià)值,還分享了本次在 ICML 現(xiàn)場的見聞以及對世界模型領(lǐng)域的看法。


01
我們先來看 MTS 方法的數(shù)學(xué)原理:
設(shè)主網(wǎng)絡(luò)為 f_θ(x),參數(shù)為 θ;
設(shè)數(shù)據(jù)選擇網(wǎng)絡(luò)(Selection Network)為 s_φ(x),參數(shù)為 φ,它為每個(gè)訓(xùn)練樣本 (x_i, y_i) 生成一個(gè)權(quán)重 w_i = s_φ(x_i);
訓(xùn)練集損失(帶權(quán)重)和驗(yàn)證集損失分別定義為:

這是一個(gè)雙層優(yōu)化問題:
內(nèi)層:主網(wǎng)絡(luò)在帶權(quán)重的訓(xùn)練損失上做梯度下降;
外層:選擇網(wǎng)絡(luò)的優(yōu)化目標(biāo)是讓更新后的主網(wǎng)絡(luò)在驗(yàn)證集上表現(xiàn)最好。
理論上,選擇網(wǎng)絡(luò)通過驗(yàn)證集這個(gè)“金標(biāo)準(zhǔn)”的反饋,應(yīng)該能自動(dòng)學(xué)會——哪些樣本對泛化有益(給高權(quán)重),哪些是有害噪聲(給低權(quán)重)。
這個(gè)設(shè)想聽起來很美好對吧?但現(xiàn)實(shí)給了這個(gè)想法一記悶棍:MTS在實(shí)際訓(xùn)練中經(jīng)常表現(xiàn)不如預(yù)期,甚至比不上不做任何數(shù)據(jù)篩選的基線。
也就是說:你花了半天力氣去選數(shù)據(jù),選和不選效果基本一樣。
那到底哪有問題?
這篇 ICML Oral 論文,通過嚴(yán)格的數(shù)學(xué)分析,揪出了MTS 失效的兩大“元兇”。

02
▎元兇一:軍師“學(xué)偏”了——梯度信噪比(GSNR)低得可憐
MTS的訓(xùn)練依賴于一個(gè)雙層優(yōu)化(bi-level optimization)過程:先更新主網(wǎng)絡(luò)θ,再根據(jù)驗(yàn)證集上的表現(xiàn)更新選擇網(wǎng)絡(luò)φ。
然而,論文通過數(shù)學(xué)推導(dǎo)和實(shí)驗(yàn)測量發(fā)現(xiàn),選擇網(wǎng)絡(luò)的梯度信噪比(Gradient Signal-to-Noise Ratio, GSNR),比主分類網(wǎng)絡(luò)低了差不多一個(gè)數(shù)量級。
為什么會這樣?
論文給出了一個(gè)非常關(guān)鍵的理論洞察:MTS 的訓(xùn)練,會導(dǎo)致數(shù)據(jù)權(quán)重分布越來越“尖銳”(spiky)——少數(shù)幾個(gè)樣本的權(quán)重越來越大,其他樣本的權(quán)重被壓到接近于零。
作者甚至證明了一個(gè)定理:在理想條件下,歸一化后的權(quán)重向量p會收斂到一個(gè)“one-hot”狀態(tài)——即只有一個(gè)樣本的權(quán)重為1,其余全部為0。
權(quán)重分布越尖銳,有效批次大小(Effective Batch Size, EBS)就越小,梯度的方差就越大,GSNR自然就越低。低GSNR意味著梯度更新方向被噪聲淹沒,選擇網(wǎng)絡(luò)根本學(xué)不到有用的東西。
什么意思?我們以一個(gè)“問路”場景來類比:假設(shè)你蒙著眼站在一個(gè)山丘上(代表模型訓(xùn)練),想通過“問路”找到最快下山(損失最小化)的方向。你雇了一個(gè)軍師(選擇網(wǎng)絡(luò) s_φ),他的工作是:攔下路人問方向,然后給每個(gè)路人打分——靠譜的人打高分(多聽他的),不靠譜的人打低分(少聽他的)。
正常的做法是:軍師隨機(jī)攔住100個(gè)路人(一個(gè)路人代表一個(gè)batch),問他們腳底下感覺哪邊是下坡。他把這100個(gè)人的建議平均一下,得到一個(gè)綜合方向。這樣,即使有幾個(gè)人亂指,綜合方向也大概率是對的(梯度信號穩(wěn)定,噪音被抵消)。
但訓(xùn)練過程中,軍師自己也在“學(xué)習(xí)”——他根據(jù)驗(yàn)證集的反饋來調(diào)整自己的打分策略。結(jié)果他學(xué)歪了:它把99.9%的信任權(quán)重都給了其中 1 個(gè)人(權(quán)重收斂到One-hot),其他 99 個(gè)人幾乎為 0。
這時(shí)候軍師“看似”攔了100個(gè)人,但實(shí)際上只聽那 1 個(gè)人的話(有效批次大小 EBS ≈ 1)。
而這個(gè)人他可能視力不好(樣本有噪聲);他可能站在一個(gè)奇怪的位置(樣本是離群點(diǎn));他可能根本不懂路(樣本標(biāo)注錯(cuò)誤)。
他告訴你“往北走”,但這個(gè)方向是錯(cuò)的。
更可怕的是,每次軍師重新攔100個(gè)人,那個(gè)被選中“獨(dú)攬大權(quán)”的人都不一樣。
第一次,A被選中,他告訴你“往北走”——你往北走了兩步;
第二次,B被選中,他告訴你“往西走”——你往西走了兩步;
第三次,C被選中,他告訴你“往東走”——你往東走了兩步。
你的路線是:北→西→東→南→北……結(jié)果,你只是在原地打轉(zhuǎn)。
結(jié)果就是,軍師的每一次“學(xué)習(xí)”都建立在被 A/B/C 這些帶偏的反饋上——他的梯度更新幾乎全是隨機(jī)游走,學(xué)不到任何有用的東西。這也就是 MTS 失效。
不過好消息是,論文作者不僅檢查出了病因,而且指出了一個(gè)簡單粗暴的補(bǔ)救方法:增大批次大小(batch size)。并且通過實(shí)驗(yàn)證明,當(dāng) batch size 從64提升到1024時(shí),GSNR顯著改善。

▎元兇二:軍師只會“聽聲辨位”——輸入特征不足以判斷數(shù)據(jù)質(zhì)量
好,假設(shè)現(xiàn)在解決了軍師“只聽一個(gè)人”的問題,他能做到公平地聽取所有人的意見了。
但新的問題來了:軍師雖然聽得見每個(gè)人的聲音,可他只有一個(gè)評估信息——每個(gè)人的“嗓門大小”(訓(xùn)練損失值)。
他給路人打分,只能憑這個(gè):
A 喊得撕心裂肺(損失高),軍師說:“這人這么用力,肯定靠譜!打高分!”
B 輕聲細(xì)語(損失低),軍師說:“這人沒啥信心,打低分吧。”
但實(shí)際情況完全不是這么回事。張三喊得大聲,是因?yàn)樗麆偤谜驹谝粔K翹起的石頭上硌得疼——他是個(gè)噪聲樣本,他的方向是錯(cuò)的,應(yīng)該給低分。李四輕聲細(xì)語,是因?yàn)樗驹谄降厣戏€(wěn)穩(wěn)當(dāng)當(dāng)——他是個(gè)干凈樣本,方向是對的,應(yīng)該給高分。
再看C,他也喊得很大聲,但他站在一個(gè)陡坡上,雖然站不穩(wěn)但那個(gè)方向確實(shí)是下坡——他是困難但有用的樣本,給高分是對的。D 也輕聲細(xì)語,但他站在平地上而且已經(jīng)會了——他是冗余樣本,給低分也是對的。
問題就出在這里:軍師只看“嗓門大小”,根本分不清同樣大聲喊的 A 和 C——一個(gè)是噪聲,一個(gè)是困難難例。他也分不清同樣小聲的 B 和 D ——一個(gè)是干凈樣本,一個(gè)是冗余樣本。
換句話說,這位軍師,沒有足夠的評估信息去判斷到底誰的話更加靠譜。
因此,就算解決了只聽單個(gè)人的話的問題(GSNR 低),軍師(選擇網(wǎng)絡(luò))可能還是無法幫你找到正確的路,因?yàn)?/span>他接收的輸入特征本身,就不包含判斷數(shù)據(jù)質(zhì)量所需的信息。
同樣值得慶幸的是,這篇論文也針對這個(gè)問題,提出了解決方案:為軍師 MTS 配上一套“多維信息雷達(dá)”(豐富的特征體系),包括:
局部特征(Local features):看這個(gè)人周圍的人在往哪走。如果周圍人都往南,他一個(gè)人往北,那他可能是個(gè)“離群點(diǎn)”。如果周圍人和他永遠(yuǎn)都向同樣的方向走,那他可能是個(gè)“冗余點(diǎn)”,刪除也不影響網(wǎng)絡(luò)訓(xùn)練。也就是說,通過計(jì)算每個(gè)樣本在訓(xùn)練集和驗(yàn)證集中的鄰居和它自己的相似度,判斷它是“冗余”還是“離群點(diǎn)”。
全局特征(Global features):看這個(gè)人在他這一類數(shù)據(jù)中有沒有代表性。如果他離中心很遠(yuǎn),可能是個(gè)“離群點(diǎn)”。如果他離中心很近,可能是個(gè)“冗余點(diǎn)”。也就是說,計(jì)算每個(gè)樣本和其類別中心的相似度,判斷它在類內(nèi)的“典型性”。
優(yōu)化動(dòng)態(tài)特征(Optimization dynamics features):看這個(gè)人過去的表現(xiàn)。是一直在瞎指路,還是曾經(jīng)指錯(cuò)過、后來又慢慢糾正過來了?“遺忘事件”這種動(dòng)態(tài)信號,能幫你區(qū)分“純粹的噪聲”和“值得反復(fù)學(xué)習(xí)的難例”。也就是,通過計(jì)算遺忘事件次數(shù)(Forgetting Events)、梯度范數(shù)等,追蹤樣本在訓(xùn)練過程中的穩(wěn)定性。
類別指示特征(Class-indicator features):為類別標(biāo)簽和數(shù)據(jù)來源(真實(shí)vs合成)學(xué)習(xí)可嵌入的表示。
有了這四個(gè)不同指向的信息,軍師才能看清每個(gè)人的位置、周圍的環(huán)境、歷史表現(xiàn)和身份背景,打出來的分?jǐn)?shù)才真正靠譜。

03
論文在四個(gè)基準(zhǔn)數(shù)據(jù)集上進(jìn)行了評估:
Waterbirds:用于評估模型在面對虛假相關(guān)性(Spurious Correlation)時(shí)的表現(xiàn)。
CelebA:人臉屬性數(shù)據(jù)集,常用于分布偏移研究。
Texture:紋理分類數(shù)據(jù)集。
PACS:包含4個(gè)領(lǐng)域——藝術(shù)畫(Art Painting)、卡通(Cartoon)、照片(Photo)、素描(Sketch),用于成對遷移學(xué)習(xí)(Pairwise Transfer Learning) 評估。
對比的基線方法包括:不做選擇的基線(No Selection)、CLIP 相似度篩選、遺忘事件(Forgetting Events)、GraNd、重要性加權(quán)(Importance Weighting),以及與本文最接近的已有方法 MetaWeightNet。
▎整體性能:躍升式領(lǐng)先

論文提出的方法(即配備了四維特征和大批量的選擇網(wǎng)絡(luò))取得了平均73.75%的準(zhǔn)確率。
相較于不做任何篩選的No Selection基線(準(zhǔn)確率 68.26%),提升了5.49%。這打破了“MTS不如不篩選”的魔咒。
相較于此前最強(qiáng)的基線Aux-Clf (Val)(硬選擇版本,準(zhǔn)確率70.86%),依然提升了2.89%。
論文的方法,在所有四個(gè)數(shù)據(jù)集上均取得了一致的提升,證明了方法的通用性和魯棒性。
▎消融實(shí)驗(yàn)一:驗(yàn)證“元兇一”——Batch Size 的作用
MetaWeightNet是最接近本文的已有方法,但它有三個(gè)關(guān)鍵差異:(1)使用batch size = 64;(2)僅使用在線訓(xùn)練損失作為唯一的輸入特征;(3)不對輸出的權(quán)重做歸一化。
在原始設(shè)定下,MetaWeightNet平均僅提升了0.62% ——幾乎無效。這正好印證了論文的核心論點(diǎn):簡單粗暴地套用MTS,效果就是不行。

當(dāng)論文給自己的方法換上小 batch size(64)時(shí),準(zhǔn)確率下降了2.79%。這定量證明了 “GSNR是MTS有效訓(xùn)練的必要條件” 。
論文進(jìn)一步展示了 batch size = 512 和 1024 時(shí)的結(jié)果,趨勢一致:越大的 batch size,權(quán)重分布越平坦,有效批次越大,GSNR 越高。
▎消融實(shí)驗(yàn)二:驗(yàn)證“元兇二”——特征豐富度的貢獻(xiàn)
為了證明“輸入特征缺乏信息量”確實(shí)是另一個(gè)獨(dú)立且同樣致命的元兇,論文固定 batch size,把輸入給選擇網(wǎng)絡(luò)的特征換成了不同類型,觀察性能差異。
Raw Image(原始圖像):直接把圖像像素作為輸入——平均68.20%,幾乎和 No Selection(68.26%)持平。說明原始圖像這種高維且未經(jīng)處理的信息,選擇網(wǎng)絡(luò)根本沒法從中提取出判斷數(shù)據(jù)質(zhì)量的有效信號。
ResNet Features(預(yù)訓(xùn)練特征):用ResNet提取的圖像特征——平均71.77%,比 Raw Image 高了不少。說明有一定語義信息的特征確實(shí)有幫助,但仍然不夠。
Training Loss(訓(xùn)練損失):只把損失值這一個(gè)標(biāo)量作為輸入——平均69.85%,比 No Selection 只略好一點(diǎn),但遠(yuǎn)低于完整方法(73.75%)。這正是 MetaWeightNet 的做法:只靠“嗓門大小”來判斷,信息太單薄。
而且值得注意的是,Training Loss在這個(gè)設(shè)置下(N=1024,GSNR已解決)只達(dá)到 69.85%,而完整四維特征在同樣N=1024下達(dá)到73.75%——差了近4個(gè)百分點(diǎn),這就是元兇二被解決之后帶來的增益。
▎兩個(gè)維度的關(guān)系:乘法,不是加法
而這項(xiàng)工作更關(guān)鍵的洞察在于:這兩個(gè)改進(jìn)維度是乘法關(guān)系,不是加法關(guān)系。
0乘以任何數(shù)都得0。你把GSNR解決得再好(Batch Size拉到1024),但如果選擇網(wǎng)絡(luò)接收的特征本身就不包含判斷數(shù)據(jù)質(zhì)量所需的信息,它依然學(xué)不對。
反過來,你給了再豐富、再好的四維特征,但如果梯度信號被噪聲淹沒、選擇網(wǎng)絡(luò)根本學(xué)不動(dòng),那再多信息也是白搭。
只有GSNR好 + 特征好,兩者同時(shí)具備,MTS 才能真正從“翻車”變成“翻身”。
實(shí)驗(yàn)也完美印證了這一點(diǎn):單獨(dú)增大batch size或單獨(dú)豐富特征,提升都有限;兩者結(jié)合,才相較于不做任何篩選的No Selection基線,實(shí)現(xiàn)了5.49%的平均增益。
因此,好的 GSNR 和高質(zhì)量的特征,兩者缺一不可,且相互補(bǔ)充。

04
在AI領(lǐng)域追逐“卷”創(chuàng)新、比拼工程技巧的大環(huán)境中,這種回歸本質(zhì)、追問"為什么"的研究,顯得尤為可貴。
而這篇論文的價(jià)值,不在于提出了一個(gè)多厲害的新方法,而在于用理論工具拆解了一個(gè)被廣泛使用卻未被充分理解的方法,并為后續(xù)研究指明了改進(jìn)方向。具體體現(xiàn)在三個(gè)層面:
第一,發(fā)現(xiàn)并診斷了MTS的“失效根源”。在這篇論文之前,MTS這套方法在理論層面幾乎是無懈可擊的——讓一個(gè)選擇網(wǎng)絡(luò)根據(jù)驗(yàn)證集的反饋來學(xué)習(xí)數(shù)據(jù)權(quán)重,聽起來既優(yōu)雅又合理。
但現(xiàn)實(shí)卻始終潑冷水。論文作者自己做的時(shí)候發(fā)現(xiàn)——這套理論上優(yōu)雅的方案,加上再精巧的工程 Tricks, 在實(shí)踐中就是跑不出該有的效果。更令人困惑的是,沒人知道為什么。
這篇論文第一次用嚴(yán)格的數(shù)學(xué)分析揭開了這個(gè)謎底:MTS的失效并非因?yàn)楣こ虒?shí)現(xiàn)不夠精巧,而是它在優(yōu)化層面存在兩個(gè)根本性的缺陷:梯度信噪比極低,導(dǎo)致選擇網(wǎng)絡(luò)的更新信號被噪聲淹沒,學(xué)不動(dòng);輸入特征嚴(yán)重不足,導(dǎo)致選擇網(wǎng)絡(luò)缺乏判斷數(shù)據(jù)質(zhì)量的依據(jù),學(xué)不對。
有了這個(gè)理解,后續(xù)優(yōu)化就擺脫了盲人摸象的狀態(tài),研究者可以精準(zhǔn)判斷瓶頸所在,把資源投入到正確方向。
第二,揭示了兩個(gè)失效原因之間"乘法而非加法"的關(guān)系。這意味著,研究者不能采取"先優(yōu)化一個(gè)、再優(yōu)化另一個(gè)"的線性累加策略,必須從一開始就同時(shí)滿足兩個(gè)條件。
這種解耦式的分析,把MTS從一個(gè)全盤調(diào)試的黑盒問題,簡化成了兩個(gè)可以獨(dú)立診斷、但必須同時(shí)達(dá)標(biāo)的工程指標(biāo)。
第三,追問"為什么"本身就是一種有價(jià)值的研究思路。 當(dāng)其他研究者追熱點(diǎn)的時(shí)候,論文作者做了一個(gè)不一樣的選擇——停下來追問一個(gè)更基本的問題:這套理論上完美的方法,為什么在實(shí)際中就是跑不出效果?
這個(gè)追問最終把他們引向了問題根源:它在數(shù)學(xué)上就存在根本性缺陷,學(xué)不動(dòng)也學(xué)不對。問題不在工程層面,在根基上。
這個(gè)教訓(xùn)不僅適用于MTS,也適用于整個(gè)AI領(lǐng)域——當(dāng)我們被一個(gè)優(yōu)雅的理論框架吸引時(shí),發(fā)現(xiàn)理論在實(shí)際中效果不佳時(shí),應(yīng)該先問一個(gè)更基本的問題:這個(gè)理論本身有沒有問題。追問"為什么",有時(shí)候比發(fā)明"新方法"更有價(jià)值。
論文之外,李搏揚(yáng)教授還向 AI 科技評論分享了本次 ICML 的見聞,對世界模型熱門研究方向的觀點(diǎn)以及對年輕研究者的建議。
以下為對話摘錄,AI 科技評論進(jìn)行不改變原意的編輯:
▎AI 科技評論:這次ICML有什么讓您印象深刻的報(bào)告?
李搏揚(yáng): 有兩個(gè)。
第一個(gè)是 Mark Schmidt 關(guān)于優(yōu)化理論的 Tutorial。他講了一個(gè)讓在場很多人深有感觸的問題:為什么優(yōu)化理論的研究做得很多,但對現(xiàn)實(shí)中深度學(xué)習(xí)的影響卻始終很小?而現(xiàn)實(shí)中好用的算法如Adam,在理論上的理解總是很弱?
他指出,理論為了在最壞情況下方便證明收斂,采取了一些非常保守的做法,比如很小的學(xué)習(xí)率。但在現(xiàn)實(shí)往往并沒有理論能設(shè)想的最壞情況那么壞。所以如果你采用理論上最好的學(xué)習(xí)率,在現(xiàn)實(shí)中反而優(yōu)化速度很慢。
最后,他也指出了應(yīng)該怎么做:我們需要思考理論和現(xiàn)實(shí)究竟哪里不一樣,怎樣去盡量彌合兩者的縫隙,而不是一味追求理論的優(yōu)美。為了這點(diǎn),他在兩個(gè)半小時(shí)的報(bào)告中,完全沒有提到收斂速度的證明,而這個(gè)問題通常在優(yōu)化領(lǐng)域被認(rèn)為是最核心的內(nèi)容。
這個(gè)分析和我們這篇 ICML工作有共通之處。我們的論文本質(zhì)上也是在問同樣的問題——MTS在理論上看起來很優(yōu)美,但為什么在現(xiàn)實(shí)中失效?
第二個(gè)是來自普林斯頓的Arvind Narayanan,他的報(bào)告主題是: AI 時(shí)代,人類會怎樣工作。
他舉了“電氣化”的例子——在電力剛剛出現(xiàn)時(shí),工廠主把蒸汽動(dòng)力的機(jī)器簡單的替換為以電力驅(qū)動(dòng)。但這沒有發(fā)揮電力的優(yōu)勢。經(jīng)過漫長的實(shí)踐,大家才發(fā)明現(xiàn)代的流水線作業(yè)。這種作業(yè)方式充分利用電機(jī)體積小的優(yōu)勢,把人類按工序排列,導(dǎo)致生產(chǎn)力的大幅提高。
在電氣時(shí)代,不能生搬硬套蒸汽時(shí)代的思維。AI時(shí)代也是一樣,目前我們只是把 AI 直接套入現(xiàn)有流程,但這是不合適的。怎樣讓人和AI更好地協(xié)同?這個(gè)問題還沒有答案。
我個(gè)人認(rèn)為這個(gè)問題即將成為重大的熱點(diǎn)研究方向。
▎AI 科技評論:您和學(xué)生怎么選研究課題?是從熱點(diǎn)方向找選題,還是有自己的節(jié)奏?
李搏揚(yáng):從熱點(diǎn)方向找選題,是學(xué)術(shù)界非常普遍的做法,也能比較快的看到效果。
我個(gè)人傾向于花更長的時(shí)間把文章做扎實(shí)。在美國求學(xué)的時(shí)候,有位同學(xué)的話徹底改變了我的思維方式——“不要只做現(xiàn)在的熱門問題,而要做即將成為熱門的問題。”
我覺得這篇論文就是例子。現(xiàn)在做MTS 的人其實(shí)不多,因?yàn)檫@個(gè)框架做不成功,而我們是第一個(gè)證實(shí)它能用的團(tuán)隊(duì),這或許也會是下一個(gè)熱門——至少我希望如此。
▎AI 科技評論:對想進(jìn)入這個(gè)方向的年輕研究者有什么建議?
李搏揚(yáng): 我有兩個(gè)可能有點(diǎn)反直覺的建議。
第一個(gè)建議:不要在最火的賽道里卷。
很多同學(xué)喜歡往熱門方向擠——因?yàn)橥段恼氯菀字小⒁萌菀赘摺⒄医搪毢啔v好看。但問題是:你很難卷過別人。最火的賽道里競爭也最激烈,idea容易撞車,容易被別人搶發(fā)。即使是工作發(fā)表了,也容易淹沒在相似論文里,很難真正體現(xiàn)出獨(dú)特的意義。
在教職的市場上,有很多申請者在同一賽道做同一方向。大學(xué)會把同一賽道的人互相比較,不太可能招收特別多同一方向的教授。除非你是那個(gè)做得最好的,否則你的競爭力并不突出。
我的建議是花時(shí)間去思考,哪些方向最有實(shí)際意義,哪些方向即將成為熱門。在這些方向的工作,才是開創(chuàng)性的工作,才是最有impact的工作。
第二個(gè)建議:打好基礎(chǔ)。
現(xiàn)在很多同學(xué)追求短平快。我們過去說調(diào)(tiao)參調(diào)(diao)包就可以發(fā)論文。但是在Claude Code和OpenClaw這樣的框架出來之后,可能都不需要寫代碼,只用自然語言寫skills都能出論文。
但這樣做的問題是:有太多的同學(xué)對這個(gè)領(lǐng)域缺乏真正的理解。雖然簡歷上很光鮮,到了面試階段稍微問兩個(gè)問題就露餡了。
所以我的建議是:把工作做得踏實(shí)一點(diǎn)。花時(shí)間去思考,去理解這個(gè)領(lǐng)域的基本問題、基本方法和基本矛盾。
想打基礎(chǔ)的同學(xué)可能不知道從何打起,論文那么多,哪些重要、哪些不重要?
有幾種做法。要么找一個(gè)經(jīng)驗(yàn)豐富的人來引導(dǎo)你,要么就是在網(wǎng)上多看大牛的講座和課程——他們會在課程里把重要的東西講出來,而不是讓你自己在幾千篇論文里摸索。
好比 Mark Schmidt 的 Tutorial,他可以從宏觀上告訴你,每個(gè)小領(lǐng)域的研究之間的關(guān)系是什么,里面有哪些最具代表性的工作,還有那些關(guān)鍵的未解之謎。沒有在這個(gè)領(lǐng)域長期的積累,甚至是十幾二十幾年的經(jīng)驗(yàn),不可能做到這點(diǎn)。
▎AI 科技評論:現(xiàn)在世界模型這個(gè)方向很火,看到您也有做一些因果相關(guān)的工作,您如何看待世界模型這個(gè)方向?
李搏揚(yáng):我認(rèn)為世界模型很重要,不過我做的因果更多的側(cè)重“事件”層面,理解層次是從像素 → 物體(人、狗、桌子)→ 活動(dòng)(人在讀書、狗在叫)→ 常識因果(狗叫因?yàn)楸惶吡艘荒_)→ 人類意圖(看門的狗叫,主人會想是不是遇到小偷,會來查看情況)。現(xiàn)在的世界模型,在這個(gè)層次做的工作可能還比較少。
對于世界模型路線,我認(rèn)為 Yann LeCun 主張?jiān)陔[空間做預(yù)測是對的,但關(guān)鍵是,要做到多深的隱空間。隱空間夠深、能表征到“事件”、“因果”和“人類意圖”的層面,實(shí)現(xiàn)常識因果,我認(rèn)為那才是真正的世界模型。雷峰網(wǎng)(公眾號:雷峰網(wǎng))雷峰網(wǎng)雷峰網(wǎng)
一個(gè)人讀論文太孤單,一群人刷頂會才好玩。
ICML 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內(nèi)主打實(shí)時(shí)論文跟蹤與硬核技術(shù)探討,拒絕灌水。
? 進(jìn)群傳送門: 掃碼進(jìn)群或添加微信Vin_Vivid,備注:論文群 + 關(guān)注的 AI 方向。

搞科研/搞技術(shù),信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華
可獨(dú)家暢覽:
專家演講PPT
大會報(bào)告全文
熱門論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點(diǎn)擊「閱讀原文」關(guān)注專區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。
本專題其他文章