0
| 本文作者: nebula | 2026-05-11 11:44 |
5月11日,記者獲悉,在加拿大蒙特利爾舉行的第42屆IEEE國際數據工程大會(ICDE 2026)公布了本屆錄用論文,中國技術團隊表現亮眼,其中騰訊共有6篇論文入選,攻破了數據庫多項核心技術的性能瓶頸。
據了解,ICDE與SIGMOD、VLDB并列數據庫領域三大頂級學術會議,被中國計算機學會評為A類會議,近年論文錄用率約為20%,代表了全球數據庫技術的風向標。
本屆入選論文的選題來自生產環境中的實際難題,由騰訊與多所頂尖高校聯合完成。工程團隊從業務運行中提煉出明確的技術瓶頸,高校研究者提供算法層面的突破思路,雙方通過產學研協作推進解決方案。
例如,傳統數據庫在按關鍵字查找數據時效率很高,但一旦用戶需要按屬性做范圍篩選——比如查詢“價格在100到500之間的商品”——響應速度就會大幅下降。騰訊與中國人民大學合作完成的《Doux: Decoupling Values from Keys for Real-Time Analytics》,為此設計了一種雙路并行的存儲方案,實測將范圍篩選速度提升了5倍,同時數據寫入速度提升近3倍。
查詢效率優化是另一個長期難題。數據庫執行查詢前會將語句改寫為更高效的等價形式,但改寫能力受限于系統預置的規則數量。騰訊與深圳大學合作的《Efficient Query Rewrite Rule Discovery via Standardized Enumeration and Learning-to-Rank》,提出用算法自動挖掘這類規則,累計超100萬條,這也是目前公開驗證的最大規模規則庫。
當數據庫需要同時處理交易和分析兩類任務時,還面臨一個調度難題:哪些數據應該提前加載到高速緩存中?判斷失誤會浪費資源或拖慢查詢。騰訊與中國人民大學合作的論文《Telescope: A Learned What-If Call for Column Store Selection in HTAP Databases》,通過機器學習模型預判加載收益,不必真正加載就能做出決策,預測誤差比此前方法降低了68%。
此外,在Data+AI前沿領域,騰訊云與復旦大學合作的《CYANSQL: Unlock the Power of NL2SQL via Clustering-based Test-Time Scaling》,聚焦“用自然語言查數據”的準確性。用戶用自然語言描述需求、系統自動生成查詢語句的能力已較成熟,但遇到多表關聯等復雜場景時錯誤率仍偏高——根本原因在于提示中的示例難以覆蓋所有復雜 SQL 邏輯組合。CYANSQL將歷史查詢按邏輯結構歸類,在推理階段從不同結構簇中并行生成多條候選方案,并以執行結果驗證篩選,讓模型在推理時"看到"更全面的邏輯結構。在標準評測集 BIRD 上,CYANSQL 召回率較行業最佳水平提升近 5 個百分點,執行準確率達到 73.47%。相關技術已在騰訊云數據分析智能體(TCDataAgent)中落地。
產學研協作已成為關鍵基礎設施創新的重要路徑。目前,騰訊云數據庫TDSQL已服務超100家金融機構核心系統,穩定支撐四大國有銀行;CYANSQL相關技術也已落地騰訊云數據智能產品的自然語言查詢功能。
雷峰網(公眾號:雷峰網)