0
| 本文作者: 吳思夢 | 2026-06-29 13:47 | 專題:ICML:國際機器學習會議 |
原文作者:公眾號“AI典型場景產品”
原文鏈接:https://mp.weixin.qq.com/s/zf6OJe5pM8JYkzywwlgyVQ
雷峰網(公眾號:雷峰網)轉載
近日國際頂級機器學習會議 ICML 2026 公布多篇核心論文成果,清華大學自動化系團隊帶來全新在線樣本篩選框架 UDS,徹底顛覆大模型監督微調 SFT “全量數據投喂” 的傳統模式。

該技術無需完整遍歷全部訓練數據集,依托模型前向傳播原生 logits 信息同步評判樣本價值與多樣性,自動過濾重復、低質量劣質樣本,在不損失模型精度的前提下大幅壓縮訓練算力消耗,實測可實現算力成本近乎腰斬,同時提升訓練吞吐量,為當下算力高企、資源緊張的 AI 行業提供輕量化微調全新解決方案,相關研究成果已由量子位等行業媒體完整披露。
行業長期存在一種固有認知,認為 SFT 階段訓練數據規模越大,模型最終效果越好,但落地工程實踐早已推翻這一結論。2026 年產業調研數據顯示,國內大模型訓練整體算力有效利用率不足五成,大量 GPU 算力消耗在重復、低信息量、存在偏見的冗余樣本之上。
全量樣本訓練不僅推高企業 GPU 采購、云算力租賃成本,還極易引發模型過擬合、認知偏見放大等問題,金融、醫療、工業等垂直領域企業開展定制化微調時,動輒數十萬條標注數據帶來極高時間與資金成本,算力浪費已經成為制約中小 AI 企業迭代模型的核心痛點。過往行業雖已意識到智能挑選樣本的價值,推出 MaxLoss、MaxGrad、GREATS 等在線批次選擇方案,但各類技術均存在難以調和的短板。
多數方法僅單一衡量樣本訓練難度,只優先選取損失值高的樣本,完全忽略樣本之間、樣本內部的信息多樣性,極易出現批量樣本高度同質化,持續訓練反而疊加偏差;部分方案需要額外引入驗證集、外部參考模型,或是多次反向傳播計算梯度,額外開銷甚至超過全量訓練,難以真正落地工業化場景,行業始終缺少兼顧效率、精度、輕量化的一體化篩選框架。
清華團隊提出的 UDS 框架跳出傳統評估思路,核心創新在于復用前向傳播生成的 logits 矩陣,無需額外計算開銷即可同步完成雙重維度打分。一方面利用 logits 矩陣核范數計算樣本內部重要性分數,量化單條文本自身的信息豐富度與訓練增益;另一方面通過低維投影壓縮樣本特征,借助緩存緩沖區計算樣本與歷史訓練數據的距離,保障批次內樣本差異化,兩套分數加權融合篩選最優樣本,整套流程不依賴外部數據集與第三方模型,完美適配 LoRA 微調、全參微調、長上下文推理等全場景。
低維投影與 FIFO 內存緩存的配套設計,解決了海量 logits 矩陣存儲占用內存過高的現實工程難題。若直接完整存儲原始 logits 向量,千級樣本就會占用數十 GB 顯存,極大限制訓練集群并發規模,UDS 采用隨機投影算法壓縮特征維度,在幾乎不損失樣本距離判斷精度的前提下,將內存開銷控制在極低水平。
消融實驗清晰驗證兩大核心模塊不可分割,單獨依靠樣本效用分數或是多樣性距離只能小幅提升精度,二者結合后模型綜合能力實現跨越式增長,充分證明雙重評判機制的互補價值。研究團隊選用 Llama-3.1-8B、通義千問 Qwen-2.5-7B 兩大主流開源基座,在 MMLU 通用知識、ScienceQA 科學問答、GSM8K 數學推理、HumanEval 代碼生成四大權威基準完成多輪對照實驗。
以國產 Qwen-2.5-7B 為例,采用 UDS 篩選樣本訓練后,MMLU 準確率達到 63.34%,較此前最優方案 GREATS 提升 5.15 個百分點,ScienceQA、數學、代碼評測同步全面領跑,并且訓練吞吐量顯著高于全量 SFT 模式,相同硬件條件下單位時間可處理更多有效樣本,實現精度與速度雙向提升。
整套技術具備極強的泛化適配能力,不受訓練參數規模、上下文長度、微調模式限制。實驗分別驗證 8/16 不同批次大小、LoRA 低秩微調、全參數微調、2048 超長文本推理、分布外 OOD 泛化測試等多種工況,UDS 在全部測試條件下均穩定優于全量訓練、隨機采樣、傳統 loss 篩選等基線方案;同時對比離線樣本篩選算法 FisherSFT,在同等樣本選取比例下四大基準指標全面領先,證明在線動態篩選比事前離線過濾更貼合實時訓練的真實需求。
站在產業發展視角,UDS 的落地恰逢行業算力降本增效的關鍵轉型節點。2026 年 AI 產業競爭邏輯已經從比拼硬件算力規模,轉向單位算力產出的模型效能,IDC 預測未來推理與微調算力需求將持續暴漲,HBM 高端存儲、GPU 硬件成本長期維持高位,中小企業難以持續承擔全量數據集訓練帶來的巨額開銷。清華這套原生輕量化篩選框架無需改造底層算力硬件,僅通過算法優化就能砍掉半數算力消耗,大幅降低垂直行業定制模型的落地門檻,對開源大模型生態商業化普及具備深遠意義。
國內開源產業迎來全新技術抓手,通義千問、Llama 系列作為國內企業微調主流基座,UDS 可直接無縫接入現有訓練流水線,無需重構數據處理架構。面向政務、制造、金融等垂直服務商,企業無需囤積大規模高端算力集群,依靠少量 GPU 即可完成高質量模型微調,縮短產品迭代周期;對于算力資源有限的科研團隊、初創 AI 公司,該技術大幅降低模型迭代試錯成本,推動細分場景專用小模型快速落地,進一步激活國內 AI 長尾創新活力。
綜合來看,清華 UDS 在 ICML 2026 交出的樣本篩選方案,標志大模型監督微調正式告別 “數據堆砌” 粗放發展階段。這套依托原生 logits、兼顧樣本效用與多樣性、極低額外開銷的在線篩選框架,既解決全量訓練算力浪費、模型過擬合等行業共性痛點,又適配國內外主流開源基座與各類工業微調場景。隨著該技術逐步開源落地,大模型訓練將邁入 “精準選樣本、高效練模型” 的精細化時代,持續緩解全行業算力成本壓力,加速人工智能技術在千行百業低成本規模化落地。
來源:量子位
如有侵權請聯系刪除


| 聯系我們 | ||
| 序號 | 負責內容 | 負責人及手機號 |
| 01 | 產品推廣&活動 | 林馳馳 15767949779 |
| 02 | 企業出海 | |
| 03 | 場景合作&推廣 | 尚嘉俊 13709577554 |
| 04 | 機器人合作&表演 | |
| 非誠勿擾,請根據實際需求咨詢相關工作人員 | ||