0
| 本文作者: 陸毅 | 2026-07-28 10:15 |

作者丨AI 科技評論
編輯丨AI 科技評論
近日,XYZ AI Lab 正式發布了兩款面向 Deep Search 場景的Agent:XYZ-Aquila-mini 和 XYZ-Aquila-pro,并在多項相關評測中取得領先成績。
通讀其技術報告后,我們發現,比榜單表現更值得追問的,是團隊在研發過程中采用的一套 AI4AI 方法:AI 不只是最終被訓練出來的產品,也開始參與發現問題、提出方案和驗證改進。
圍繞這套系統如何運作,以及它如何被用于 Agentic Post-Training,AI 科技評論采訪了 XYZ-Aquila 核心團隊。

圖 1:XYZ-Aquila 技術報告中的 Deep Search Benchmark 總覽。按照報告列出的比較口徑,XYZ-Aquila-mini 在總參數量低于 40B 的開放權重比較組中七項指標位居組內第一,XYZ-Aquila-pro 在總參數量低于 400B 的開放權重比較組中六項指標位居組內第一。由于不同系統的工具棧、評判器、運行框架和評測時間并不完全一致,圖中結果更適合被理解為公開結果對比,而非同一運行環境下的嚴格總排名。
Deep Search 并不是一次搜索、一次生成就能完成的任務。Agent 往往需要圍繞同一個問題連續進行網頁檢索、信息抽取、證據核驗、中間計算和答案提交,一條任務軌跡可能持續幾十步,甚至上百步。按照技術報告給出的比較口徑,Aquila-mini 和 Aquila-pro 在各自規模的開放權重比較組中都取得了領先表現。
如果只看這些數字,這已經是一次表現亮眼的 Deep Search Agent 發布。但比起榜單上的成績,真正引起我們興趣的,是技術報告《AI4AI at Scale》所披露的研發過程。
XYZ 在報告中將 Aquila 的研發方法概括為 AI4AI。這里的 AI,并不只是幫助工程師寫幾段代碼、整理文獻或者批量運行實驗。
按照團隊的描述,AI Agent 被放進了一個更完整的研發循環:它們讀取評測結果和失敗軌跡,分析問題可能出在數據、訓練、工具、上下文還是運行框架;提出候選改進,將方案落實到代碼、數據或系統配置中;再通過實驗和評測判斷改動是否有效,并把成功與失敗的經驗帶入下一輪研發。
換句話說,在 Aquila的研發過程中,AI 不只是最終被制造出來的 Agent,也開始成為參與制造Agent 的研發力量。
眼下,AI-driven AI R&D 正成為越來越多 Frontier AI Lab 關注的方向:AI 開始從研發助手,進一步參與提出假設、設計實驗和改進系統。它也因此常被放在 RSI,也就是遞歸式自我改進的語境下討論。兩者究竟是什么關系,Aquila 又走到了哪一步,正是我們在采訪中首先想厘清的問題。
今天,讓 Agent 寫代碼、跑實驗,已經不算新鮮。真正關鍵的區別在于:AI 有沒有進入研發判斷本身?它是否能夠從復雜的失敗軌跡中,發現人類沒有預先指出的問題?是否能夠提出人類初始方案清單之外的改進?這些改進如何被開發、評測、接受或否決?當 AI 開始承擔越來越多研發任務,人類又應該控制每一個執行步驟,還是轉而控制目標、權限、評測和風險邊界?
這些問題,也決定了AI4AI 究竟只是一種更高效的自動化工具,還是一種可能改變 Agent 研發方式的新范式。
為此,AI 科技評論圍繞五個方面采訪了 XYZ-Aquila 核心團隊:AI4AI 到底意味著什么,它與 RSI 是什么關系;AI4AI 在 Agent 研發中采用了怎樣的工作范式,又如何驅動 Agentic Post-Training;在 Aquila 的研發過程中,AI 是否提出過超出人類初始設想的改進,從而拓展團隊能夠探索的技術邊界;要支持這樣的研發方式,應該構建怎樣的人機協作和驗證架構;以及從 Aquila 出發,AI4AI 下一步可能走向哪里。
以下是經過編輯整理的對話內容。

01
AI4AI 到底是什么,
它離 RSI 還有多遠?
▎AI 科技評論:現在幾乎所有 AI 團隊都在用 Agent 寫代碼、跑實驗。為什么“研發中使用 AI”還不自動等于 AI4AI?
XYZ-Aquila 團隊:判斷標準不在于有沒有調用大模型,而在于 AI 有沒有進入研發閉環和研發判斷。普通的編碼 Agent 通常接到一個已經被人定義好的任務,例如修復某段代碼、復現實驗或生成一批數據;它可以把執行做得很快,但“為什么要做這件事”仍然由人預先決定。
在我們的 AI4AI 流程里,AI 需要讀取開發評測返回的指標、成本和可靠性信號,查看獲準訪問的失敗軌跡、歷史實驗與人類提案,判斷當前瓶頸更可能出在數據、訓練、工具、上下文、控制策略還是基礎設施。然后,它要提出一個有范圍、有預算、有驗收條件的候選改動,并把改動落成可運行、可復現的系統工件。
所以 AI4AI 的關鍵不是“AI 幫人干了多少活”,而是 AI 是否開始參與“下一步應該改哪里、為什么改、怎樣證明改對了”。
▎AI 科技評論:這聽起來像把 AutoML的搜索空間放大。二者真正的區別是什么?
XYZ-Aquila 團隊:兩者都包含“提出候選—運行實驗—根據結果繼續搜索”的思想,但優化對象不同。AutoML 通常在任務、數據、模型框架和評價目標基本確定的前提下,搜索架構、超參數或訓練配置。它解決的是一個已經被清楚定義的局部優化問題。
AI4AI 面向的是完整 AI 系統的研發。除了模型權重,它還可能修改數據生成與過濾方式、SFT 或 RL 策略、工具定義、檢索與控制策略、上下文渲染、評測 Harness、代碼執行環境、日志和回放系統。更重要的是,它還要先判斷“應該動哪一層”。這一步已經不只是參數搜索,而是研究問題的歸因與選擇。

圖 2:Aquila 把 Agent 能力視為系統設計問題。模型配置、學習過程、控制策略、工具接口、數據管線、評測系統和基礎設施共同構成一套可優化、可審計的完整配置。
▎AI 科技評論:AI4AI 和 RSI 到底是什么關系?它們是一回事嗎?
XYZ-Aquila 團隊:不是一回事。我們更愿意把AI4AI 理解為一組方法和能力:讓 AI 參與 AI 系統的研究、開發、評測和經驗積累。RSI 則描述一種更強的遞歸狀態——AI 不僅能參與研發,還能自主設計和開發更強的后繼系統,而新的系統又顯著提升下一輪 AI 研發能力,形成跨代復利。
一個系統可以用 AI 批量跑實驗,卻沒有改進研發流程本身;也可以在同一個固定任務上循環優化,卻沒有證明下一代系統更擅長繼續改進。真正接近 RSI,需要看到“改進者也被改進”,并且這種改進在后續循環里轉化成更強的研發能力。
Aquila 目前更準確的定位,是一種有邊界的系統級遞歸改進。遞歸體現在每一輪都會讀取上一輪留下的成功配方、失敗證據和人工反饋,改進對象也可以覆蓋研發系統的多個組件;但目標、評測、權限、資源邊界和最終發布權仍由人類控制。系統沒有自主決定下一代基礎模型的目標,也沒有完成“訓練一個后繼系統,再由后繼系統繼續訓練下一代”的閉環。因此,我們不會把它稱為完整 RSI。
▎AI 科技評論:從公開信息看,幾家前沿實驗室和專門團隊已經從不同方向推進 AI-driven AI R&D:Google DeepMind 的AlphaEvolve讓模型提出算法、由自動評測器篩選并持續演化;Sakana AI 的 Darwin G?del Machine嘗試讓 Agent 修改自己的代碼;Anthropic與OpenAI也都把自動化 AI 研發和 RSI 納入公開討論。Aquila 與這些工作的共同點和差異分別是什么?
XYZ-Aquila 團隊:共同點是,大家都在把 AI從執行工具推向研究循環:讓它提出候選、運行實驗、接受驗證,并把結果帶入下一輪。差異主要在優化對象和閉環邊界。AlphaEvolve 適合目標可以自動驗證的算法問題;Darwin G?del Machine 直接修改 Agent 自身的代碼與腳手架;Anthropic 和 OpenAI 更關注 AI 自動化研發能力的增長,以及它可能帶來的 RSI 與治理問題。
Aquila 關注的是一個真實 Agent 產品怎樣被系統性改進。優化器可以同時考慮數據、訓練、工具、上下文和運行時,但它不能修改成功標準,也不能一邊提出方案、一邊查看私有答案并批準自己上線。我們的核心 claim 不是“已經實現 RSI”,而是:我們把一套有邊界、可驗證、可追溯的 AI4AI 閉環真正用在了 Agent 發布上。

圖 3:有邊界的 AI4AI 探索循環。人類預先定義目標能力、私有評測、允許改動的范圍、資源預算、風險邊界和驗收標準;AI 在研究、開發、獨立評審和記錄的循環內探索,成功與失敗都會進入共享經驗。

02
上一部分討論的是 AI4AI 的含義和邊界。落到 Aquila,問題變得更具體:當研發對象不再只是一個模型,而是一整套 Deep Search Agent,AI4AI 究竟怎樣參與它的后訓練?
對 Aquila 團隊來說,Agentic Post-Training 并不是一條固定的“SFT 做完再做 RL”的訓練流水線。
一條長程搜索任務之所以失敗,可能是訓練數據存在捷徑,也可能是監督信號使用了模型當時沒有看到的證據;可能是網頁抽取丟失了信息,也可能是上下文壓縮刪除了關鍵內容;還有一種情況是,Agent 已經找到正確答案,卻沒有在最終提交時使用它。
這些問題橫跨數據、模型、工具、上下文和運行框架。AI4AI 的作用,是把它們放進同一套研發循環:從運行結果和失敗軌跡中定位問題,形成可以實現的候選改動,再通過隔離評測和人工門禁,決定哪些方案進入發布系統。

圖 4:外層 AI4AI 循環與內層 Agentic Post-Training。AI4AI 負責發現問題、形成候選改動并組織驗證;具體改動可以落在數據、SFT、RL、工具、上下文或運行框架上。
▎AI 科技評論:具體到 Aquila 這次發布,這套 AI4AI 流程最后留下了哪些改動?為什么有些方案進入了發布版,有些卻沒有?
XYZ-Aquila 團隊:最終完成開發和驗收、進入Aquila-mini 與 Aquila-pro 發布配置的,主要有三類改造:圖譜驅動且工具可達的數據構造、狀態一致性 SFT,以及圍繞上下文管理和精確回放展開的 Harness 改造。
它們看起來分別屬于數據、訓練和系統工程,但背后其實對應著同一個問題:怎樣讓 Agent 在真實工具環境中學到可以被驗證、也可以被復現的行為。
這三類改造并不是一開始寫死在訓練計劃里的固定步驟。AI4AI 會從失敗軌跡、聚合指標、審計日志、歷史實驗和人類提案中收集信號,判斷問題更可能出在哪一層;再把判斷轉化為候選系統,在既定的工具、上下文上限、輪次預算和私有評測邊界內比較。優化器看不到私有答案和逐題反饋,也不能通過增加工具或擴大資源邊界換取表面提升。
第一類改造發生在數據側。
普通問答數據并不天然適合訓練Deep Search Agent。有些問題看似復雜,實際上輸入一個關鍵詞就能直接找到答案;有些問題存在歧義或多個合理答案;還有一些問題在離線證據中成立,但關鍵網頁在真實的 search 和 scrape 工具中根本無法到達。
如果直接使用這些數據,模型可能學到答案記憶或數據集捷徑,而不是如何搜索、消歧和核驗證據。
因此,Aquila 從連通的證據圖中構造任務。網頁和證據單元構成節點,引用、鏈接、實體和時間關系構成可追溯的連接。生成任務之后,系統還要使用發布時相同的工具檢查:證據是否真的可達,答案是否唯一,簡單查詢能否繞過預期的搜索路徑。只有在真實工具環境中依然需要搜索、同時又能夠被核驗的問題,才會進入訓練數據。
第二類改造是狀態一致性 SFT。
Deep Search Agent 的一條運行軌跡可能持續幾十步甚至上百步。開發者事后能夠看到完整審計日志,但模型在某個決策點真正看到的內容,可能已經經過折疊、摘要或壓縮。
這會帶來一個很隱蔽的問題:關鍵證據可能仍然存在于完整日志里,卻已經不在模型當時的可見上下文中。如果直接使用完整日志進行監督,就相當于要求模型根據自己沒有看到的信息作出正確決定。
Aquila因此為每一個訓練決策重建模型當時真正可見的狀態。有效的推理、工具調用和最終答案進入監督;無效調用和重復循環只作為上下文保留;遇到網頁不可用或工具超時后產生的合理恢復行為,則繼續用于訓練。這里的重點不是簡單地把訓練序列做得更長,而是讓每一個監督信號都忠實于模型當時真實看到的內容。
第三類改造落在 Harness,也就是 Agent 的運行框架上。
同一個錯誤答案,背后可能有完全不同的原因:模型沒有搜到相關網頁,網頁抽取漏掉了關鍵段落,上下文策略刪除了證據,或者模型已經看到證據,卻沒有在最終答案里使用。只看最終對錯,很難區分這些原因。
因此,Aquila 在保持 search、scrape 和 python 三類工具接口不變的前提下,改進了網頁處理、上下文渲染、狀態保存和回放機制。每次運行不僅保留完整審計日志,也保存模型在每個決策點真正看到的狀態。這樣,系統才能判斷:證據究竟沒有被找到,還是找到后沒有進入上下文;模型沒有看到,還是看到以后沒有使用。同一套運行記錄也才能繼續服務于失敗診斷、訓練數據轉換和候選方案驗證。

圖 5:從優化契約到發布配置。圖譜驅動任務、狀態一致性 SFT 和運行時/回放完成開發與驗收后進入 XYZ-Aquila-mini 和 pro;答案條件 RL 只通過前期篩選,沒有計入發布能力。
RL 則展示了同一套流程的另一面。
長程搜索只根據最終答案給予獎勵,信號往往過于稀疏。團隊因此探索了一種答案條件的教師模型:在評測側向教師提供參考答案,再比較模型在有無答案輔助時的策略分布差異,以此判斷哪些步驟可能真正影響了最終結果。
前期實驗顯示,較強的歸因信號經常出現在信息獲取、消歧和答案提交等關鍵環節。這說明該方向值得繼續研究,但并不足以證明一套完整的 RL 訓練已經能夠穩定提升能力。
由于后續訓練和門控評測尚未完成,這項 RL 探索沒有進入 Aquila 的發布配置。它的實驗結果和未解決問題會被保留下來,供下一輪繼續驗證,但不能提前被算作發布成績的來源。
這里也可以看出,AI4AI 并不意味著所有想法都由 AI 獨立提出。候選方案可以來自 AI 對軌跡的分析,也可以來自人類專家,或者由雙方共同形成。真正變化的是,所有方案都必須經過同一套過程:形成可以實施的改動,接受隔離評測,留下完整證據,并允許最終結論是“暫不采用”。
因此,Aquila 的 Agentic Post-Training 并不是選中了某一種“神奇的訓練算法”。它更像是一條由AI4AI 驅動的研發管線:數據、訓練和運行系統都可以成為改進對象;通過驗證的方案進入發布版,證據不足的方案留在研究階段;無論成功還是失敗,結果都會成為下一輪可以繼續使用的經驗。

03
▎AI 科技評論:有沒有一個具體案例,能說明AI4AI 不只是替人執行,而是真的拓展了團隊能夠探索的技術方向?
XYZ-Aquila 團隊:有一類失敗很反直覺:Agent在中間步驟已經找到關鍵網頁,甚至抽取出了正確事實,但最終答案里沒有使用它。我們把它叫作 found-but-not-submitted,也就是“找到了,卻沒有提交”。
只看最終得分,它和普通的“沒找到答案”沒有區別;把軌跡展開后,原因可能完全不同:證據在上下文壓縮時被刪掉了,被工具響應折疊后沒有重新進入模型視野,或者模型已經看到證據,卻在停止策略和最終提交時沒有正確使用。
▎AI 科技評論:同一個錯誤答案背后可能有這么多原因,你們怎么判斷問題到底出在哪一層?
XYZ-Aquila 團隊:關鍵是同時保存兩種記錄。一種是只追加的完整審計日志,它保留整條運行歷史;另一種是模型在每個決策點真正看到的可見狀態 V_l。兩者不能混為一談。
如果關鍵證據出現在完整日志中,卻沒有進入當時的 V_l,問題更可能來自上下文渲染或壓縮;如果證據已經進入 V_l,最終答案仍然沒有使用,問題就更接近停止策略、約束檢查或答案提交。這樣才能把“模型不會”與“系統沒有把信息正確呈現給模型”分開。

圖 6:Aquila 長程軌跡的長度與工具調用分布。完整運行日志的中位長度為 102.7K 詞元,中位工具調用次數為72;5.5% 的保留正確軌跡在完整日志中超過 256K。長尾軌跡使上下文壓縮、證據保留和精確回放成為核心問題。
▎AI 科技評論:AI4AI 在這個案例里具體提出了什么?
XYZ-Aquila 團隊:AI 優化 Agent 讀取一組失敗軌跡,對照完整日志、逐步可見狀態與最終答案,沿著“證據何時進入上下文、何時消失、最后為什么沒有被提交”這條鏈路尋找重復模式。它沒有停留在“換一個更強模型”或“增加搜索次數”,而是把問題重新定義為長程任務中的狀態管理。
它提出了兩個不在人類初始方案清單里的方向。第一個是主動 compact:不等上下文逼近上限才被動壓縮,而是在任務狀態仍然清晰時,主動整理已經確認的事實、關鍵來源、未決問題、被否決的路徑和下一步計劃。第二個是研究記事本:把候選答案、證據鏈和關鍵中間結論放進獨立、可檢索的工作區,需要時再讀回主上下文。
▎AI 科技評論:看起來合理并不等于真的有效。你們怎么驗證?
XYZ-Aquila 團隊:兩個方向都要被實現成候選系統,并在相同工具、上下文上限、輪次預算和評測協議下接受端到端測試。評測不僅看分數,還看成本、延遲、證據鏈和副作用,再由人類 reviewer 檢查它有沒有改變任務邊界或引入不可控行為。
最終,這兩類方案都被實現并經過獨立評測和人工驗收:主動 compact 成為長程上下文管理的重要策略,研究記事本也被用于當前系統;它們的適用條件、資源開銷和潛在副作用則寫入共享經驗,供后續繼續迭代。重要的是,它們不是因為“AI 說得有道理”被采納,而是因為方案被做出來、被比較并經受了證據檢驗。
▎AI 科技評論:這能說明 AI 已經比人更會做研究了嗎?
XYZ-Aquila 團隊:不能從一個案例推出這么大的結論。它能說明的更具體:在一個人類已經定義目標和邊界的研發問題里,AI 可以從大量運行證據中提出人類沒有預先列出的干預方向,并且其中至少有一部分能夠經受獨立評測。
AI4AI 的價值因此不只在于提高實驗吞吐量,還在于擴大 solution space。人類仍然負責判斷這個方向是否值得、是否安全、是否能進入發布版;但 AI 讓團隊實際能夠探索的假設數量和組合深度明顯增加。

04
▎AI 科技評論:如果 AI 已經參與提出方案和組織實驗,人類會不會最后只剩下“蓋章”?
XYZ-Aquila 團隊:恰恰相反,人類負責的是最難被自動化、也最不該被默認交出去的部分。第一是定界:定義目標、優先級、資源、權限、風險邊界和驗收標準。第二是處理歧義:當證據互相矛盾、評測行為異常、疑似數據泄漏或需要改變任務定義時,AI 必須升級給人。
第三是發布:候選改動即便提分,也要判斷它代表了可遷移能力,還是對評測規則的投機。第四是復盤:把失敗原因、評審意見和新的邊界要求轉成下一輪可復用的規范。人類不需要審批每一次工具調用,但必須控制目標、權限、評測和最終采用權。
▎AI 科技評論:要讓這種分工真正運行起來,底層需要怎樣的人機協作架構?
XYZ-Aquila 團隊:我們把它理解成一個帶持久記憶的協作工作臺,而不是一個超級聊天機器人。復雜目標先被拆成可執行任務,再分給不同角色:coordinator 負責路由和進度,executor 負責數據、代碼與實驗,reviewer 負責尋找風險和反例,memory 負責檢索歷史記錄與沉淀經驗。人類專家作為同一系統里的參與者,在需要判斷和授權的節點介入。
系統要同時維護任務狀態、權限、資源配額、工件版本和審計鏈。誰提出了假設,誰改了哪一版代碼或數據,使用了多少資源,指標怎樣變化,為什么接受或拒絕,都必須能追溯。沒有這層基礎設施,300 個 Agent 只會產生 300 份互相找不到的聊天記錄。

圖 7:人機協作流程。共享空間同時承擔研究經驗蒸餾、人類提案管理、階段匯報和反饋綁定;每次貢獻都被記錄并可復用,但發布仍受人類定義的驗收標準約束。
▎AI 科技評論:你們一直強調“共享經驗”。記憶庫里到底存什么,怎么避免它把錯誤不斷帶入下一輪?
XYZ-Aquila 團隊:存的不是隨手聊天,而是結構化、帶版本的實驗條目:任務目標、當時的模型與工具配置、干預類型、約束、證據鏈接、評測結果、評審結論、人類理由、失敗類別、可復用配方和再次觸發的條件。每條經驗只在它被驗證過的上下文中成立,換了模型、數據或工具,必須重新驗證。
被拒絕的方案要和被接受的方案一樣完整地保存,否則記憶庫會變成只講成功故事的幸存者偏差。每條記錄都要能回到原始日志和評審工件;后續如果發現經驗失效,也要追加修正,而不是悄悄覆蓋。共享記憶不是“真理庫”,而是一套可追溯、可質疑、可更新的團隊實驗筆記。
▎AI 科技評論:提出方案的 AI、執行實驗的 AI 和評測 AI 之間,為什么要刻意分開?
XYZ-Aquila 團隊:因為角色合一會放大自我確認偏差。優化器知道自己想證明什么,如果同時能看到私有答案、選擇評測樣本并批準結果,很容易把系統推向局部投機。我們因此把優化路徑和評測路徑隔離:優化器只能獲得聚合反饋與獲準診斷,評測 Agent 才能訪問私有用例,Gate 按版本化規則作出決定,超出規則的情況再交給人。
這種分離并不能消除所有風險,但至少讓“誰提出、誰執行、誰驗證、誰發布”形成清晰責任鏈。AI4AI 的可擴展性不只來自更多 Agent,也來自驗證、權限和審計能夠隨規模一起擴展。
▎AI 科技評論:所以,300 多個 worker 真正拓展的是什么?
XYZ-Aquila 團隊:首先是并行探索和組織記憶的帶寬:人類無法逐條閱讀數萬條長軌跡,也很難同時維護數據、訓練、工具和基礎設施上的大量候選。AI 可以承擔高吞吐、可重復的工作,并把需要判斷的少數例外整理給人。
但 worker 越多,驗證瓶頸越明顯。未來最稀缺的可能不是“再生成一個想法”,而是快速判斷這個想法是否真實、可遷移、沒有破壞邊界。因此,人機協作架構的目標不是讓人退出,而是把人的判斷集中到杠桿最高的地方。

05
▎AI 科技評論:為什么先從 Deep Search 開始?它對 AI4AI 有什么特殊價值?
XYZ-Aquila 團隊:搜索是一個很好的系統級試驗場。它既有動態網頁環境,又有相對明確的答案與證據;既要求長程規劃,也要求工具調用、來源核驗、計算和失敗恢復。一個最終錯誤可能來自模型、網頁抽取、上下文、工具協議或提交邏輯,正好迫使研發流程做跨組件歸因。
不同搜索Benchmark 對工具的需求也明顯不同:有的主要依賴廣泛檢索,有的需要更多網頁抽取和 Python 計算。強 Agent 不能只學一套“多搜幾輪”的固定套路,而要根據任務的信息結構切換搜索、讀取、計算、核驗和停止策略。

圖 8:不同搜索 Benchmark 的工具使用組合。BrowseComp、BrowseComp-ZH 和 LiveBrowseComp 更依賴網頁檢索,GAIA 與 DeepSearchQA 的網頁抽取和 Python 占比更高,WideSearch 同時要求廣泛搜索與大量抽取。
▎AI 科技評論:這套方法接下來最自然的擴展場景是什么?
XYZ-Aquila 團隊:Coding Agent 是最近的一步。代碼、測試、編譯錯誤、運行時日志、Code Review 和線上事故復盤都可以成為研發證據,系統可以據此判斷應該改提示、工具路由、測試策略、數據配方還是模型。和搜索一樣,Coding能力也不是單一模型權重的屬性。
再往外是通用 Agent 和專業 Agent。通用 Agent 需要在多工具、跨領域、長流程任務中積累規劃、工具選擇和失敗恢復經驗;法律、醫學、科研和企業內部 Agent 則需要學習本地文檔、工作流約束、領域工具和專家反饋,同時把數據訪問、隱私、責任和人工門禁寫進契約。框架可以遷移,但評測和風險邊界必須按領域重建。
▎AI 科技評論:AI4AI 本身還需要改進什么?
XYZ-Aquila 團隊:首先是驗證能力。隨著提出假設和運行實驗越來越便宜,瓶頸會轉移到判斷結果是否可靠:評測是否被過度適配,指標是否代表真實能力,候選是否帶來隱藏副作用,經驗能否遷移到新的模型和任務。未來的 AI4AI 不只需要更強的優化 Agent,也需要更強的 evaluator、回放、因果歸因和反作弊機制。
其次是共享記憶和協作調度。循環從幾十輪擴展到幾千輪后,錯誤經驗、過期結論和重復實驗會迅速累積;Agent 數量從幾百擴到上千后,任務路由、資源競爭、權限隔離和審計存儲都會成為系統問題。規模會檢驗這套方法到底是一次演示,還是可持續的研發基礎設施。
▎AI 科技評論:在什么條件下,你們會認為這套系統真的更接近 RSI?
XYZ-Aquila 團隊:不能只看同一張榜單持續上漲。更關鍵的證據是:AI 是否開始改進負責研發的工作流本身;改進后的優化器、工具和記憶系統,是否讓下一輪更快發現問題、提出更好的方案;由它參與構建的后繼系統,是否又能繼續提升研發能力;這種復利是否能跨模型、跨任務和跨代成立。
如果這些條件逐步出現,人類的角色可能從執行和逐項檢查,更多轉向目標設定、驗證、治理與風險控制。但在那之前,把每一輪改動做成可解釋、可回滾、可審計的工程閉環,比提前爭奪“RSI”標簽更重要。
▎AI 科技評論:這條路上最需要警惕的風險是什么?
XYZ-Aquila 團隊:一是指標投機:系統學會提高分數,卻沒有提高可遷移能力。二是記憶污染:一次錯誤結論被反復引用,逐漸變成默認常識。三是驗證失速:候選數量增長得比評測和人類審核更快。四是探索收斂:大量 Agent 共享同一模型和經驗后,可能只是在重復相似假設。
還有成本問題。長程軌跡、隔離評測、回放和完整審計都很昂貴。AI4AI 不是“自動化之后成本歸零”,而是把研發資源重新分配到更多探索和更強驗證上。能否在能力、成本與風險之間形成穩定收益,是它能否走出實驗室的關鍵。
▎AI 科技評論:Aquila 之后,團隊下一步最想驗證什么?
XYZ-Aquila 團隊:一是繼續推進process reward 與上下文管理相關的 RL,增加完整訓練和門控評測,而不是停留在信號篩選。二是把循環擴展到更多任務和模型,驗證有效經驗是否真的可遷移。三是繼續加強評測隔離、狀態回放和人機協作基礎設施,讓更多 Agent 和更多迭代仍然保持證據紀律。
最終我們想驗證的,不是 AI 能不能偶爾提出一個好點子,而是一套 AI4AI 系統能不能穩定地制造更強 Agent:每一輪都留下可復用的知識,同時讓下一輪的研究更快、更廣,也更可靠。
▎AI 科技評論:最后,如果只讓讀者記住一句話,你們希望是什么?
XYZ-Aquila 團隊:AI4AI 不是把 AI“放養”成一個自行決定目標、自己給自己打分的系統,而是讓 AI 在人類定義的邊界內,成為能夠發現問題、提出方案、完成開發、接受驗證并積累經驗的研發參與者。
回到 Aquila,這次公開發布回答了“做出了什么”:兩款 Deep Search Agent,以及一張表現亮眼的成績表。采訪更想回答的,是“它們是怎么被做出來的”。
從這套流程看,XYZ 所說的 AI4AI 并不是一個神秘的自我進化黑箱。它更像一間被重新設計的研發實驗室:AI 進入研究、開發和證據整理,人類控制目標、邊界、評測與發布;數據、訓練、工具、上下文、回放和基礎設施不再分散,而被納入同一條可以接受、拒絕和積累經驗的循環。
Aquila 當然還不是完整 RSI,也不足以證明 AI4AI 已經適用于所有 Agent。但它至少提供了一個具體樣本:當 AI 真正進入研發判斷,Agentic Post-Training 的核心問題就不再只是“下一輪用 SFT 還是 RL”,而是如何讓 AI 和人類共同管理一個復雜系統的改進。
SOTA 是一次結果;能否持續制造更強 Agent,才是這場 AI4AI 競賽真正漫長的部分。