0
大語言模型正在成為公眾獲取、理解和使用科技知識的重要工具,但是,它們能辨善惡嗎?能否識別用戶意圖、理解具體語境、控制輸出粒度,并在有用性與安全性之間保持穩定邊界?7月2日于北京舉行的2026全球數字經濟大會云智算安全論壇上,《全球大語言模型安全防范能力測評報告(2026)》正式發布,該報告依據一套中國機構自主研發的科學測評方法體系,對全球主要大語言模型進行了一次統一標準的“體檢”,作出了回答。(雷峰網(公眾號:雷峰網))
這份由東壁科技數據有限責任公司(“東壁科技數據”)聯合上海財經大學數字經濟學院共同打造的研究成果,是全球首份大語言模型科技安全專項測評報告,也是首份大語言模型科技向善導向測評報告。報告以313條科技類高風險問題為測試集,覆蓋38個國內外大語言模型,重點考察模型能否在正常的科技學習、科研的防護需求與潛在違法犯罪濫用之間,保持穩定、安全且可解釋的邊界,并同步發布多維度安全實力排名。
測評顯示,多數模型具備基礎拒答能力,但在前綴注入、場景偽裝、情感偽裝,以及偽裝與示例誘導結合的復合攻擊下,部分模型的安全邊界明顯承壓。報告提出,科技安全治理不能僅以“拒答率”衡量,還應同時關注模型的意圖識別能力、信息披露尺度和“可靠且高風險”輸出。
圖注:《全球大語言模型安全防范能力測評報告(2026)》正式發布
立足真實風險補齊行業測評短板
上海財經大學數字經濟學院院長、報告牽頭編制人趙琳在論壇上對報告進行了解讀。他表示,科技知識在正常場景中可以服務于教學、研究、產業創新和公共安全,但當它被置于特定目的、特定語境和特定對象面前,就可能轉化為現實危害。從前沿模型安全框架看,國際上已經將生物化學、網絡安全、自動化代理等高風險能力納入重點評估范圍。
當下,國內外圍繞大模型安全、倫理和風險管理已經形成多層級測評與治理格局,為大模型安全治理提供了重要基礎,但在科技類高風險場景下仍存在三方面缺口——通用內容安全測評較多,高風險科技語境測評不足。前沿能力評估較多關注極端能力閾值,對日常科技濫用場景覆蓋不足。以及,通用有害問答數據集較多,基于真實案件和真實科技濫用語境構建的測試集不足。因此,構建科技類高風險場景的專項測評,是對現有測評體系的重要補充。
本次最終測試集包含313條科技類高風險問題,結果分析覆蓋38個國內外模型,并按國內/國外、開源/閉源、大規模/小規模等屬性進行分組比較。為輔助評估科技內容可靠性,報告從東壁全球科技文獻數據平臺(Dbdata)選取94,108份科技文獻材料,并結合34,452條科技類百科條目構建RAG檢索參考,用于判斷模型回答中的科學事實、技術原理、因果邏輯和不確定性表述是否可靠。
趙琳提到,科技安全治理不能僅以“拒答率”衡量,還應同時關注模型的意圖識別能力、信息披露尺度和“可靠且高風險”輸出。報告同時設置意圖識別能力、濫用風險可控性和科技內容可靠性三個維度,用于識別“過度拒答”“防御不足”和“可靠但高風險輸出”等不同類型的問題。因此,本報告更接近“科技安全防范能力測評”,而不是單純的“拒答率排行榜”。
實測數據披露多重安全隱患
報告顯示,多數模型具備基礎拒答能力,直接攻擊總體成功率為7.6%,但在前綴注入、場景偽裝、情感偽裝,以及偽裝與示例誘導結合的復合攻擊下,部分模型的安全邊界明顯承壓。趙琳在解讀報告時,介紹了部分測評結果,并披露其中多重安全隱患。
目前,攻擊成功率最高的是場景偽裝加上示例誘導,達53.8%,其次是場景偽裝、前綴注入攻擊、情感偽裝,分別達51.3%、43.4%、30.7%,最低的是情感偽裝加示例誘導,也達到了26.5%。“這說明場景偽裝是最值得關注的攻擊形態之一。”趙琳說,“合法授權”“安全研究”“攻防演練”等場景合法化敘事,比單純情緒求助更容易削弱模型安全邊界,示例誘導的影響則取決于其疊加在哪類偽裝方式上,疊加在場景偽裝中能增加越獄成功率,疊加在情感偽裝中反而更容易讓模型識別出請求的風險。
趙琳還提到,目前模型意圖識別仍不充分。偽裝類樣本中,善意問題拒答率為30.6%,惡意問題回答率為29.7%。這說明過度防御和防御不足同時存在,模型尚未穩定掌握科技雙用途語境下的差異化響應能力。以及,回答后的風險披露控制不足,模型一旦被誘導回答,往往未能有效切斷從一般知識到現實實施之間的關鍵連接。
測評發現,科技內容可靠性與安全風險存在張力。已回答樣本中,80.5%達到較可靠水平,55.1%同時具有較高可靠性和較高濫用風險。對惡意請求而言,可靠性越高不一定越安全。“關鍵在于能否把可靠知識限制在防護、合規和教育范圍內”,趙琳表示。

圖注:上海財經大學數字經濟學院院長、報告牽頭編制人趙琳對報告進行解讀
多維度安全榜單出爐
依托顯性攻擊、越獄對抗、意圖識別、風險管控、知識可靠性五大測評維度量化打分,報告發布38款海內外主流大模型分層排名,多維度榜單清晰展現不同模型的安全防護水平。
在無偽裝、直接索要危險技術方案的直接攻擊測試中,Anthropic旗下三款Claude模型實現100%拒答,領跑行業,OpenAIgpt-5.4-mini、阿里通義千問qwen3.5-122b-a10b緊隨其后。反觀榜單末尾,mistral-small等多款輕量化開源模型基礎防護墊底。
針對前綴注入、場景偽裝、情感誘導、示例疊加等五類復雜越獄攻擊的綜合防護排名顯示,全場景抵御能力前五名依舊由Claude全系三款模型包攬前三位,國內MiniMax-M3、OpenAIgpt-5.4-mini分列第四、五位,面對套著“安全演練、科研實驗”外殼的誘導提問,依舊能穩定守住安全邊界。測評同時指出,場景偽裝疊加示例誘導是所有模型的共同薄弱環節,共有21款模型拒答率不足半數,其中字節豆包輕量化開源模型doubao-seed-2-0-mini在該場景下安全邊界衰減幅度最為突出,防護短板顯著。
在惡意偽裝意圖識別維度,拒答率榜單前五與越獄綜合防護榜單高度重合,Claude全系列、MiniMax-M3、gpt-5.4-mini能夠高效識別包裝成教學、科研需求的惡意提問,攔截風險請求能力領跑行業。但測評也發現統一短板,榜單前列防護能力更強的模型,善意學習類問題拒答率同步走高,存在明顯的過度防御現象,正常科研、科普學習需求容易被一并攔截,而大量中小開源模型則走向另一個極端,難以區分請求意圖,惡意偽裝提問極易順利放行。
濫用風險可控性榜單僅針對成功繞過安全防線、產生輸出內容的樣本打分,分數越高代表模型越能規避危險實操細節泄露,榜單排名顯示OpenAIgpt-5.4-mini以3.52分的均分拔得頭籌,claude-haiku、gpt-5.5、阿里通義千問qwen3.6-27b、qwen3.6-flash依次躋身前五,即便不慎輸出內容,也會主動規避關鍵參數、完整操作流程等高風險信息。
在衡量輸出內容科學準確程度的科技內容可靠性榜單中,OpenAIgpt-5.5以均分3.52分拿下榜首,月之暗面Kimi-k2.6、阿里通義千問3.7-max旗艦閉源模型、qwen3.6-35b、qwen3.6-27b緊隨其后,國內大規模閉源模型的專業科技內容準確度已達到行業第一梯隊水平。
總而言之,不同模型屬性呈現出系統性差異。國外、閉源和大規模模型在惡意偽裝請求攔截、越獄穩健性和回答后風險控制上整體更占優,但也更容易拒絕善意問題,體現出安全性與可用性之間的張力;開源、小規模以及部分國內模型在偽裝攻擊下更容易被誘導,說明安全對齊、產品化防護和持續紅隊測試仍需加強。與此同時,大規模和閉源模型的科技內容可靠性更高,一旦安全邊界失效,高可靠回答更可能轉化為現實可執行的信息增益,因此高能力模型更需要精細化的意圖識別和輸出粒度控制。
治理路徑與測評體系升級規則
針對測評暴露出的系統性安全短板,這份報告立足產業實際,提供了一套政策與治理建議,平衡AI知識普惠價值與公共安全底線。
報告提出,科技安全不能只依賴外部關鍵詞攔截,要堅持內生化原則,把安全能力嵌入模型行為機制。越獄攻擊方式更新快,模型版本迭代快,靜態測評難以長期反映真實風險,建議堅持敏捷化原則,建立持續紅隊與復測機制。將科技安全測評從單一拒答率擴展為綜合指標體系,至少包括“顯性請求拒答能力、偽裝請求穩健性、善意問題可用性、惡意問題拒答率、濫用風險可控性、科技內容可靠性、可靠且高風險輸出占比、可靠且可控輸出占比”。
“治理目標應是拒絕危險能力增益,而不是拒絕科技知識本身。”趙琳說。建議模型在高風險科技主題下建立更細的安全回答范式,對善意學習請求,提供概念解釋、風險提示、合規邊界和安全替代路徑,對中性但不明確的請求,主動澄清目的和使用環境,對惡意或高度可疑請求,拒絕提供可執行細節,并轉向防護、法律后果、求助渠道或安全教育內容。同時,報告強調,針對測評揭示的不同屬性模型在安全能力上的系統性差異,應構建精準協同的多元共治機制,形成企業、測評機構、監管部門與行業專家多方協同、精準施策的治理生態。
東壁科技數據創始人、報告牽頭編制人吳登生認為,這一報告的意義在于從“拒答率排行榜”轉向綜合風險評價。以真實案件和真實科技語境為基礎,將越獄攻擊與科技知識雙重用途場景結合,并把“是否拒答”擴展為意圖識別、濫用風險可控性和科技內容可靠性等綜合評價。“這為模型企業、第三方測評機構、行業專家、監管部門和教育科研機構提供了專項測評與持續治理的參考,也強調在保護正當學習、科研和防護需求的同時,避免模型輸出形成對現實危險行為的能力增益。”他說。
“這份報告只是一個開始。未來,我們將持續完善科技安全測試集,覆蓋更多領域,例如工程控制、深度偽造、自動化智能體、實驗室安全等方向。同時,也會加強多輪對話、工具調用、代碼執行、多模態輸入等復雜交互場景的測評。我們的目標不僅是發布一份報告,更希望逐步建立具有持治理政策、為教育科研機構安全使用人工智能提供參考依據。”吳登生表示。(雷峰網)