最近的對比表示學習方法依賴于估計一個上下文的多個視圖之間的互信息。例如,我們可以通過應用數據增強獲得給定圖像的多個視圖,或者我們可以將序列分割成包含序列中某個步驟的過去和未來的視圖。MI的下界比較容易優化,但當評估大量的MI有強烈的低估偏見。我們提出將完整的MI估計問題分解為一個較小的估計問題。這個表達式包含一個無條件和條件MI項的和,每個測量總的MI的適度塊,這有助于通過對比界近似。為了使和最大化,我們給出了條件MI的一個比較下界,它可以有效地逼近。我們將我們的一般方法稱為互信息分解估計(DEMI)。我們證明了DEMI可以捕獲比標準的非分解對比界在綜合設置更大數量的MI,并在視覺域的對話生成學習更好的表示。
最近最優傳輸(OT)理論在機器學習中的幾個應用都依賴于正則化,尤其是熵和Sinkhorn算法。由于矩陣向量乘積在Sinkhorn算法中是普遍存在的,一些工作已經提出使用低秩因子來近似其迭代中出現的核矩陣。另一種方法是在OT問題中考慮的可行耦合集上施加低非負秩約束,不需要對代價或核矩陣進行逼近。這條路線首先由forrow2018探索,他提出了一種為平方歐氏地面成本量身定制的算法,使用了一個代理目標,可以通過正則化的Wasserstein重心機制來解決。在此基礎上,我們引入了一種通用方法,旨在完全通用性地解決具有任意代價的低非負秩約束下的OT問題。我們的算法依賴于低秩耦合的顯式分解,將其作為由公共邊際連接的子耦合因子的乘積; 與NMF方法類似,我們交替更新這些因素。證明了該算法的非漸近平穩收斂性,并通過基準實驗證明了該算法的有效性。
在領域泛化工作中,一個常見的目標是在類標簽條件下學習獨立于領域的表示。我們證明這個目標是不充分的: 存在反例,在滿足類條件域不變性后,模型不能泛化到不可見域。我們通過一個結構性因果模型將這個觀察形式化,并展示了類內變量建模對泛化的重要性。具體來說,類包含描述特定因果特征的對象,而域可以被解釋為對這些對象的干預,這些對象改變了非因果特征。我們強調了一個可選條件:如果來自相同對象,那么跨域的輸入應該具有相同的表示。在此基礎上,我們提出了觀測基礎目標時的匹配算法(如通過數據增強)和未觀測目標時的近似算法(MatchDG)。我們簡單的基于匹配的算法在旋轉MNIST、Fashion-MNIST、PACS和胸部x射線數據集的域外精度方面具有很好性能。我們的方法MatchDG也恢復了真實對象匹配:在MNIST和Fashion-MNIST上,MatchDG的前10個匹配與真實匹配有超過50%的重疊。
回歸作為分類的對應,是一個具有廣泛應用的主要范式。域自適應回歸將回歸器從有標記的源域推廣到無標記的目標域。現有的區域適應回歸方法僅在淺層區取得了積極的結果。一個問題出現了:為什么在深層機制中學習不變表征不那么明顯?本文的一個重要發現是,分類對特征尺度具有魯棒性,而回歸則不具有魯棒性,對齊深度表示的分布會改變特征尺度,阻礙領域自適應回歸。基于這一發現,我們提出了通過表示空間的正交基來關閉域間隙,這是自由的特征縮放。受格拉斯曼流形的黎曼幾何啟發,我們定義了表示子空間上的幾何距離,并通過最小化它來學習深度可遷移表示。為了避免破壞深度表示的幾何性質,我們進一步引入了基不匹配懲罰來匹配正交基的排序跨表示子空間。我們的方法在三個領域自適應回歸基準上進行了評價,本文構建了其中兩個基準。我們的方法明顯優于最先進的方法。
Density Constrained Reinforcement Learning
Authors: Zengyi Qin, Yuxiao Chen, Chuchu Fan
//www.zhuanzhi.ai/paper/4fa1ffa9d790da75a55a7f6e0aef8821
我們從一個新的角度研究約束強化學習(CRL),通過直接設置狀態密度函數的約束,而不是以往研究中考慮的值函數。狀態密度具有清晰的物理和數學解釋,并能夠表達各種各樣的約束,如資源限制和安全要求。密度約束還可以避免設計和調優成本功能的耗時過程,這些成本功能是基于價值功能的約束來編碼系統規范所需要的。利用密度函數與Q函數之間的對偶性,提出了一種求解密度約束的RL問題的有效算法,保證了約束條件的滿足。我們證明了當策略更新不完美時,所提出的算法收斂到一個有界誤差的接近最優解。我們使用一組全面的實驗來證明我們的方法相對于最先進的CRL方法的優勢,包括廣泛的密度約束任務和標準的CRL基準測試,如Safety-Gym。
最近利用圖神經網絡來處理圖匹配任務的研究已經顯示出了良好的結果。離散分布學習的最新進展為學習圖匹配模型提供了新的機會。在此工作中,我們提出了一個新的模型,隨機迭代圖匹配(SIGMA),以解決圖匹配問題。我們的模型定義了一個圖對匹配的分布,因此模型可以探索更廣泛的可能的匹配。我們進一步介紹了一種新的多步匹配方法,該方法學習如何逐步地改進圖對的匹配結果。該模型還包括虛擬節點,因此模型不必為沒有對應關系的節點尋找匹配。我們通過可擴展的隨機優化方法將該模型與數據擬合。我們在合成圖形數據集以及生物化學和計算機視覺應用中進行了廣泛的實驗。在所有任務中,我們的結果表明,與最先進的模型相比,SIGMA可以產生顯著改善的圖匹配結果。消融實驗研究證實,我們的每個組件(隨機訓練、迭代匹配和虛擬節點)提供了顯著的改進。
在不依賴下游任務的情況下評估學習表征的質量仍然是表示學習的挑戰之一。在這項工作中,我們提出幾何成分分析(GeomCA)算法,評估表示空間的幾何和拓撲性質。GeomCA可以應用于任何維度的表示,獨立于生成它們的模型。我們通過分析從各種場景中獲得的表征來證明其適用性,如對比學習模型、生成模型和監督學習模型。
我們研究計算化學中的一個基本問題,即分子構象生成,試圖從二維分子圖中預測穩定的三維結構。現有的機器學習方法通常首先預測原子之間的距離,然后生成滿足這些距離的3D結構,而在3D坐標生成過程中,預測距離中的噪聲可能會導致額外的誤差。本文受傳統分子動力學力場模擬方法的啟發,提出了一種直接估算原子坐標對數密度梯度場的新方法ConfGF。估計的梯度場允許通過朗之萬動力學直接生成穩定的構象。然而,由于梯度場是旋轉平移等變的,因此該問題非常具有挑戰性。我們注意到估計原子坐標的梯度場可以轉化為估計原子間距離的梯度場,因此開發了一種基于最近的基于分數的生成模型的新算法來有效地估計這些梯度。跨多個任務的實驗結果表明,ConfGF顯著優于以前的最先進基線。
當演示專家的潛在獎勵功能在任何時候都不能被觀察到時,我們解決了在連續控制的背景下模仿學習算法的超參數(HPs)調優的問題。關于模仿學習的大量文獻大多認為這種獎勵功能適用于HP選擇,但這并不是一個現實的設置。事實上,如果有這種獎勵功能,就可以直接用于策略訓練,而不需要模仿。為了解決這個幾乎被忽略的問題,我們提出了一些外部獎勵的可能代理。我們對其進行了廣泛的實證研究(跨越9個環境的超過10000個代理商),并對選擇HP提出了實用的建議。我們的結果表明,雖然模仿學習算法對HP選擇很敏感,但通常可以通過獎勵功能的代理來選擇足夠好的HP。
由于線性空間和時間的復雜性,Transformer模型的最新進展允許前所未有的序列長度。同時,相對位置編碼(relative position encoding, RPE)被認為是一種利用滯后而不是絕對位置進行推理的方法。盡管如此,RPE還不能用于Transformer最近的線性變體,因為它需要顯式計算注意力矩陣,而這正是這些方法所避免的。在本文中,我們填補了這一缺口,并提出了隨機位置編碼作為生成PE的一種方法,該方法可以用來替代經典的加性(正弦)PE,并且可以證明其行為類似于RPE。其主要理論貢獻是將位置編碼與相關高斯過程的交叉協方差結構聯系起來。我們在Long-Range Arena基準測試和音樂生成上證明了我們的方法的性能。
//www.zhuanzhi.ai/paper/e42297b68bb088dc94c114e44992cea1
圖神經網絡(GNN)中缺乏各向異性核極大地限制了其表達能力,導致了一些眾所周知的問題,如過度平滑。為了克服這個限制,我們提出了第一個全局一致的各向異性核GNN,允許根據拓撲導出的方向流定義圖卷積。首先,通過在圖中定義矢量場,我們提出了一種方法應用方向導數和平滑投影節點特定的信息到場。然后,我們提出用拉普拉斯特征向量作為這種向量場。在Weisfeiler-Lehman 1-WL檢驗方面,我們證明了該方法可以在n維網格上泛化CNN,并證明比標準的GNN更有分辨力。我們在不同的標準基準上評估了我們的方法,發現在CIFAR10圖數據集上相對誤差減少了8%,在分子鋅數據集上相對誤差減少了11%到32%,在MolPCBA數據集上相對精度提高了1.6%。這項工作的重要成果是,它使圖網能夠以一種無監督的方式嵌入方向,從而能夠更好地表示不同物理或生物問題中的各向異性特征。