1
深度學習的類型按照數據是否有標記來區別可以分為三種:監督學習、半監督學習和無監督學習。事實上人類不可能把每件事都手把手的教給AI。無監督學習應該才是未來的趨勢。
ICML給無監督學習單獨開了一個專區,包括無監督學習的研究和應用。我們今天主要來關注一下無監督學習應用方面的論文。
深度嵌入的無監督聚類分析(Unsupervised Deep Embedding for Clustering Analysis)
聚類分析對許多數據驅動的應用領域來說非常重要,并且已經以距離函數和分組算法的表現形式被廣泛徹底的研究過了。而聚焦于聚類分析的學習表現的研究相對來說則比較少。這篇論文,我們提出了一個深度嵌入式聚類方法(Deep Embedded Clustering,DEC),它可以使用深度神經網絡實現同時學習特征表示和聚類任務。
這種方法在圖像和文本語言識別領域的實驗中的表現比現今最好的方法都有顯著的提升。
用于檢查數據的馬爾可夫調制標記的泊松過程(Markov-modulated Marked Poisson Processes for Check-in Data)
論文建立了一個時間連續的概率模型來研究由時間和位置組成的“通過檢查點(check-in)”的軌跡數據。我們將數據組織成一種標記點變化進程的實現,并且是一種由馬卡洛夫跳躍進程(Markov jump process,MJP)條結果的強烈的標記分布式排列。
論文也將通過給每個用戶分配一個“優先地點”的方式將用戶異質性考慮到了模型之中。還通過放棄“Bag of words”(忽略掉文本的語法和語序,用一組無序的單詞來表達一段文字或者一個文檔的方法)假設和在連續時間中執行的方式擴展了潛在狄利克雷分布的考慮。
分層復合泊松分解(Hierarchical Compound Poisson Factorization)
分層泊松分解(HPF)已經被證明在極端稀疏的推薦系統中具有很好的擴展性。但是由于稀疏系統和響應模型的緊密耦合特性限制了后者的表達豐富性。本文介紹了一種分層復合泊松分解函數(Hierarchical Compound Poisson Factorization,HCPF),既有良好的泊松伽馬架構,與高維極端稀疏矩陣相比又同時具有HPF良好的擴展性。這個新的算法經過了九個離散型和三個連續型數據集的測試,都表明HCPF在捕捉稀疏度和響應之間的關系的性能優于HPF。
在單細胞的基因表達數據校正技術變化的狄利克雷過程混合模型(Dirichlet Process Mixture Model for Correcting Technical Variation in Single-Cell Gene Expression Data)
論文介紹了一種單細胞基因數據表達的迭代標準和聚類方法。新興的細胞RNA編碼技術可以允許人們發現和描述關于細胞的很多信息。但是現在的數據很容易被實驗的錯誤結果或者細胞特性的描述偏差影響。目前的解決方法:研究生物信號前先執行總體的誤差糾正,并不能從根本上解決問題。
論文提出的模型由分層貝葉斯混合模型和細胞特異性規模的因素組成,用來幫助數據的重復迭代和聚類,梳理清楚由生物信號產生的技術誤差。并且證明了這種方法要比現行的方法更有優勢。
多時間序列的非參數關系回歸模型的自動構建(Automatic Construction of Nonparametric Relational Regression Models for Multiple Time Series)
論文建立了兩個相關的、可以通過找到導致變化的共同因素同時處理三組時間序列數據的核心學習方法。這種學習方法對現實中一些數據集做出了更加精確的模型建立。解決了之前系統精確度、特異性和描述準確度不夠的問題。
人類的學習應該屬于半監督學習和無監督學習的結合。因此這兩種領域的研究都很有關注的價值。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。