亚洲男人的天堂2018av,欧美草比,久久久久久免费视频精选,国色天香在线看免费,久久久久亚洲av成人片仓井空

本論文研究了多模態基礎模型在開發和訓練中的關鍵挑戰,重點關注當前監督微調(SFT)方法的局限性,并探索強化學習(RL)在實現魯棒泛化方面的潛力。研究工作分為兩個主要部分:第一部分:理解監督微調下多模態基礎模型的局限性盡管多模態大語言模型(MLLMs)在基準任務上表現出色,但在需要更深層次理解或適應新情境的看似簡單任務中,它們常常表現出令人驚訝的弱點。本論文首先研究了 MLLMs 中的災難性遺忘現象,即在新任務上進行微調可能導致模型在先前學習任務上的性能顯著下降。我們引入了多模態評估框架(EMT),這是一種新穎的評估方法,旨在系統性地評估這種遺忘現象。研究結果表明,即使是利用強大預訓練視覺編碼器的 MLLMs,在經過 SFT 后,在基本圖像分類任務上的性能也會顯著下降。此外,我們深入探討了 MLLMs 在視覺方面的具體缺陷。我們提出了多模態視覺模式基準(MMVP),這是一組精心設計的視覺問答任務,旨在探測這些模型的視覺基礎能力。結果顯示,當前最先進的 MLLMs 存在系統性缺陷,突顯了底層視覺編碼器(如 CLIP)的弱點與整體模型性能之間的強相關性。這些發現表明,當前的 SFT 方法雖然在任務特定適應方面有效,但可能不足以賦予 MLLMs 強大的視覺理解能力和保留先前習得知識的能力。第二部分:利用強化學習實現魯棒泛化認識到 SFT 的局限性后,本論文進一步探索了強化學習(RL)在實現更魯棒和可泛化的多模態智能方面的潛力。我們提出了一種新穎的框架,用于通過 RL 微調大型視覺-語言模型(VLMs),使其能夠在需要視覺理解和語言推理的任務上進行端到端訓練。該框架的一個關鍵組成部分是引入了思維鏈(CoT)提示,利用 VLMs 固有的推理能力來促進更高效的探索和學習。我們對 RL 和 SFT 進行了對比分析,重點關注對未見規則變化和新視覺情境的泛化能力。結果表明,與 SFT 相比,RL 微調始終能帶來更優越的泛化性能。通過 RL 訓練的模型在規則修改的任務上表現更好,能夠更有效地適應視覺輸入的變化,甚至展現出增強的底層視覺識別能力。此外,我們研究了推理時計算的作用,證明在 RL 訓練期間增加驗證迭代次數可以進一步提高泛化能力。這突顯了 SFT 雖然為指令遵循提供了必要的基礎,但 RL 對于在復雜、動態環境中實現魯棒、適應性強的性能至關重要。總結本論文提供了有力的證據,表明當前基于 SFT 的多模態基礎模型訓練存在局限性,并展示了 RL 在克服這些局限性方面的巨大潛力,為開發更具泛化能力和智能的 AI 系統鋪平了道路。

付費5元查看完整內容

相關內容

大型語言模型時代的協作式人工智能智能體

構建能夠可靠代表人類執行任務的智能體,是人工智能(AI)領域的核心目標之一。為了實現這一目標,智能體不僅需要能夠靈活地與工具(如搜索引擎和數據庫)交互,還必須具備協作能力。 本論文系統地研究了在大型語言模型(LLM)時代支持智能體開發所需的抽象機制、方法論和基礎設施。全文分為四個部分,分別闡述如下: 第一部分探討了以目標為導向的協作場景,其中至少一個組成部分基于LLM。為了使LLM組件能夠有效與其他組件協同工作,尤其是在通過API暴露的傳統軟件系統中,它必須遵循預定義的接口規范,并引導協作朝著高效目標推進。我們表明,LLM的解碼算法可作為一種無需更改底層模型的高效策略,既能遵循接口,又能實現智能協作。 第二部分面向LLM能力不足、又缺乏有效訓練信號的協作場景。為解決此類問題,我們提出了一個新的原則:利用結構不對稱性進行合成數據生成,并展示了即使在LLM本身無法直接解決任務的前提下,該方法也能生成有用的數據。我們還將該方法與LLM自我改進機制的代表性研究建立了聯系,凸顯了該策略的通用性。 第三部分探討了多個AI系統、工具與人類之間的協作。我們提出了一種新的抽象框架,并配套開發了一個支持并發和模塊化的庫,構建起理論與實踐相結合的基礎設施,能夠系統地建模、實現和研究任意復雜的結構化交互。為驗證該框架的潛力,我們應用其系統地研究了復雜協作在解決編程競賽問題中的優勢。 第四部分提出了一個名為**語義解碼(semantic decoding)**的新視角,用以系統分析結構化交互的設計空間。該部分以對未來研究方向的討論收尾,特別聚焦于在前三部分工作基礎上,語義解碼視角所引發的研究機遇與關鍵問題。


關鍵詞:人工智能智能體、大型語言模型、合成數據生成、解碼算法、Transformer、自然語言處理、人工智能

付費5元查看完整內容

隨著神經網絡語言模型的廣泛應用,深入理解其內部運行機制的需求日益迫切。本論文旨在揭示大型語言模型(LLMs)內部潛在計算規律,為未來強大AI系統的監測、控制和對齊奠定理論基礎。基于開源語言模型,我們重點探索了四個關鍵領域:神經元層面的概念編碼、模型初始化間學習特征的普適性、時空表征的存在性,以及基礎動力系統建模。第二章改進了最優稀疏分類方法在神經網絡探測中的應用,通過這種稀疏探測技術,我們在全尺寸LLMs中同時發現了單語義神經元(專一編碼單一概念)和多語義神經元(疊加表征多個概念),驗證了簡化模型的預測。第三章通過計算大數據集上神經元激活的成對相關性,系統識別并分類了不同模型初始化間的普適性神經元。研究發現1-5%的神經元具有普適性特征,這些神經元往往具有明確的可解釋性,我們將其劃分為不同的神經元家族。為探究時空表征特性,第四章通過精心構建的現實世界實體數據集分析LLMs激活模式。研究發現模型能夠學習多尺度的線性時空表征,這些表征對提示變化具有魯棒性,且在不同實體類型間保持統一。我們識別出專門編碼空間坐標的"空間神經元"和時間坐標的"時間神經元"。第五章采用最優稀疏回歸技術改進了非線性動力系統稀疏識別(SINDy)框架,在典型微分系統中實現了樣本效率和支持恢復率的提升。基于此改進,我們進一步研究了LLMs在上下文學習中表征動力系統的能力,發現了跟蹤底層系統狀態的內部表征。

付費5元查看完整內容

深度神經網絡,尤其是大語言模型(LLMs),在廣泛的任務中展現了顯著的成功;然而,其訓練過程計算密集,需要大量的數據和計算資源。即使是對預訓練的LLMs進行特定任務的微調,也常常帶來顯著的計算成本。本論文從凸優化的視角出發,推進了對神經網絡的理論理解和實際優化。我們首先提出了一個基礎性結果:兩層ReLU網絡的正則化訓練問題可以重新表述為凸優化問題。這種凸優化公式化闡明了優化景觀,刻畫了所有全局最優解和Clarke穩定點,并將模型性能與超參數選擇解耦。借鑒壓縮感知中最稀疏線性模型的恢復,我們證明了過參數化神經網絡本質上學習能夠有效解釋數據的簡單模型,并通過在隨機生成數據集中觀察到的相變現象支持了這一結論,從而確立了其卓越的泛化能力。將強對偶性概念擴展到深層網絡,我們提出了一種并行架構,能夠在修改正則化的情況下實現全局最優訓練,同時也為標準架構中非零對偶間隙的存在提供了見解。通過將正則化ReLU網絡的訓練與NP難問題Max-Cut聯系起來,我們嚴格分析了訓練到全局最優的計算復雜度,得出了NP難證明,并為特定類型的數據集開發了高效的多項式時間近似算法。即使在缺乏顯式正則化的情況下,梯度流的隱式正則化也會驅動收斂到非凸最大間隔問題的全局最優解。我們通過利用隨機幾何代數對大語言模型(LLMs)進行微調,展示了凸優化的實際應用。我們進一步通過凸幾何和對偶視角分析了用于訓練兩層ReLU網絡的非凸次梯度流,表明其隱式偏差與凸正則化一致,并在對偶變量滿足特定條件時證明了其收斂到全局最優解。最后,我們提出了一種半定規劃(SDP)松弛方法,用于近似具有平方ReLU激活的兩層網絡中的Wasserstein梯度,確保在特定條件下的緊密松弛,并展示了其在貝葉斯推斷和COVID-19參數估計中的有效性。這些發現填補了關鍵的理論空白,并引入了具有深遠意義的創新方法,推動了我們對神經網絡訓練過程的理解。

付費5元查看完整內容

對比學習最近已成為一種強大的無監督表示學習方法,在多個領域取得了令人印象深刻的實證成功。盡管這些方法在實踐中表現有效,但要全面理解它們的理論基礎仍然是一個重大挑戰。本論文旨在通過提供一個基于接近現實場景假設的原則性調查,彌合對比學習的實證成功與理論理解之間的鴻溝。我們引入了一個受譜圖理論啟發的新分析框架,證明了對比學習在隱式地對由數據分布定義的概念圖上執行譜聚類。我們表明,對比學習所學習的表示與圖的鄰接矩陣的特征函數一致,從而為下游線性分類任務的性能提供了可證明的保證。我們擴展了這一框架,正式刻畫了一個現象,即在對比學習表示上訓練的線性分類器可以成功地跨領域遷移。此外,我們還正式刻畫了模型架構的歸納偏置如何導致表示在不同下游任務中的性能差異。

高質量的數據表示可以作為各種實際機器學習應用的基礎,涵蓋從搜索到面向新任務和新領域的數據高效適應等多個方面。許多成功的表示學習算法在很大程度上依賴于監督學習,而監督學習需要對數據進行昂貴且耗時的標注 [Salakhutdinov 和 Hinton,2007]。

與昂貴且有限的標注數據相比,互聯網上存在大量豐富且廉價的未標注數據。無監督表示學習旨在從沒有預先存在標簽的數據中發現模式,并生成能夠捕捉原始數據本質特征的表示。這種方法為訓練可遷移的數據表示提供了有希望的路徑,這些表示可以有效地適應各種下游任務。

特別是,對比學習最近作為一種強大的從未標注數據中學習表示的方法出現。對比學習的核心思想是“正對”(positive pairs)的概念,即語義上相近的成對數據點,可以直接從未標注數據中構造,而無需人工標注。相應地,還有“負對”(negative pairs)的概念,即通常語義上無關的成對數據點。在計算機視覺領域,正對通常由兩個通過數據增強從同一原始圖像生成的圖像組成,而負對則由兩個獨立隨機采樣的圖像組成。給定正對和負對,對比學習通過鼓勵正對的表示更加接近,同時使負對的表示遠離來學習數據點的表示。 許多對比學習方法使用孿生網絡(Siamese Networks)[Bromley 等,1993] 來學習特征,其中兩個具有共享權重的神經網絡應用于正對中的兩個數據點,表示是神經網絡對原始輸入的輸出。SimCLR 的開創性工作 [Chen 等,2020b] 表明,利用孿生網絡結構的對比學習表示可以在下游分類任務中取得與監督學習競爭的線性探測準確率。一些后續工作 [Chen 和 He,2020,Grill 等,2020,Bardes 等,2021] 探索了不同的損失目標和正則化技術,旨在減少算法中一些看似隨意且不自然的方面,例如停止梯度操作(即在訓練過程中通過孿生網絡的一條分支停止梯度反向傳播)或大批量大小的必要性。然而,它們大多仍圍繞孿生網絡結構這一核心思想展開。

這些方法取得了令人印象深刻的實證成功,通常超過了完全監督模型的性能,而無需標注數據。此外,學習到的表示通常具有良好的結構,例如線性可分性,在這些表示上訓練的線性分類器能夠在下游分類問題上表現良好。這些方法的驚人簡單性和對比學習表示中編碼的結構似乎表明該方法利用了數據分布通過正對構造定義的一些內在屬性。然而,開發對這些自監督表示為何如此有效的全面理論理解仍然是一個重大挑戰。需要超越經典統計學習理論的新數學框架來全面解釋它們的表現,而對比學習中廣泛使用的深度神經網絡進一步增加了分析的復雜性。

先前的工作嘗試通過信息理論的視角解釋對比學習的成功 [Tsai 等,2020,Tosh 等,2021]。這一理論框架關注于通過學習的表示捕獲的信息。從直觀上講,在初始化時,神經網絡的輸出捕獲了數據點的隨機子集信息。在訓練過程中,表示將捕獲正對之間更多共享的信息,并丟棄那些特定于正對中某一數據點的信息。如果共享信息包含了大部分與下游任務相關的信息,那么最終學習到的表示也將捕獲這些信息,從而具備解決下游任務所需的足夠信息。然而,由于多個表示可以包含相同的信息,但具有非常不同的幾何結構,因此該框架缺乏保證,無法確保使用簡單(例如線性)模型高效地解決下游任務。

如果對數據做出更多假設,便能解決這一限制。一個相對較強的假設是條件獨立性設置,其中給定類別標簽,正對是條件獨立的。例如,Arora 等 [2019] 表明,在給定類別標簽的條件獨立性下,對比學習算法可以在下游線性分類任務中實現較小的誤差。一些后續工作(例如,Lee 等 [2020])將這一思想擴展到正對在某些潛在變量上條件獨立的設置,這些潛在變量可能具有比類別標簽更細粒度的含義。然而,在計算機視覺應用中的實際算法中,正對通常由同一圖像的兩個增強組成,因此它們是高度相關的。它們可能只有在條件化于非常復雜的隱藏變量(如原始自然圖像)時才獨立,這可能使得之前的結果無法有意義地應用。

本論文旨在在反映現實世界的較少限制假設下,對對比學習進行原則性的理論研究。本論文的一個關鍵貢獻是提出了一種新的對比損失——我們稱之為譜對比損失——它作為更廣泛使用的 InfoNCE 損失的代理,后者在理論上較難分析。我們的實驗證明,譜對比損失捕獲了標準對比損失的大部分性能,同時使我們能夠建立一個受譜圖理論啟發的分析框架。 第三章介紹了我們基于譜圖理論理解對比學習成功的一般理論框架。為了建立我們的理論框架,我們引入了一個群體層級的“正對圖”,該圖捕捉了對比學習管道中的正對結構。在這個圖中,節點對應于所有出現在正對中的數據點,邊表示哪些節點對實際上形成正對。通過將數據置于這個圖的上下文中,我們能夠利用一些圖論(特別是譜圖理論)中的思想和工具來分析對比學習。 我們的關鍵洞察是,認為對比學習可以被視為隱式地在正對圖上執行譜聚類。譜聚類 [Ng 等,2001] 是一種流行的聚類算法,具有悠久的歷史。其核心思想是,給定任何圖,可以對圖的拉普拉斯矩陣進行譜分解,并使用特征向量在圖中找到近似最優的聚類。運行譜聚類需要對整個拉普拉斯矩陣進行操作,當圖非常大時,這可能計算上非常昂貴。 在正對圖的背景下,圖中的節點數基本上是數據分布中所有數據點的數量,因此可能非常龐大。然而,幸運的是,我們的結果表明,存在一個損失函數,使得最小化該損失函數等同于隱式執行圖拉普拉斯矩陣的譜分解。這個損失函數在精神上與許多對比損失相似,并且可以通過正對和負對進行有效采樣,因此我們稱其為譜對比損失。 我們證明,通過最小化譜對比損失學習到的表示與圖的鄰接矩陣的特征向量對齊,從而繼承其聚類結構。在對正對圖中的聚類與下游任務類別對齊的溫和假設下,來自不同下游類別的數據的對比表示將是線性可分的。值得注意的是,我們的框架不需要依賴先前對比學習理論工作中所依賴的嚴格條件獨立性假設 [Arora 等,2019,Tosh 等,2021]。 我們分析了使用譜對比損失學習到的表示進行線性分類的性能。在對正對圖進行溫和擴展假設的情況下,我們證明,當表示維度超過圖中聚類的數量時,在線性分類器上訓練的表示可以以高精度恢復真實標簽。我們進一步表明,譜對比損失可以通過經驗數據成功最小化,只需多項式數量的未標注樣本。我們的有限樣本分析利用標準泛化界限,證明所需的未標注樣本數量與所選函數類的 Rademacher 復雜度成比例。 第四章基于這一框架,研究了對比學習在分布變化下的表現。特別是,我們研究了對比學習如何幫助解決無監督領域自適應問題,在該問題中,給定有標簽的源領域和未標注的目標領域(具有相同類別標簽),我們希望在目標領域實現高分類準確率。我們正式分析了“線性遷移性”這一經驗現象,即在源領域對比表示上訓練的線性分類器在目標領域上表現良好,其中該表示通過在源領域和目標領域的聯合數據集上進行對比學習訓練。事實上,這種簡單的方法已經被證明能夠實現與多個最先進的領域自適應算法 [Shen 等,2022b] 競爭的性能。 我們證明,線性遷移性是在跨領域關系的弱假設下產生的:即,同類別的跨領域點之間比不同類別的跨領域點之間更相關。直觀地說,這意味著,盡管源領域和目標領域可能存在顯著的分布差異,但類別之間的相對相似性在跨領域中得到了保留。在這個假設下,我們證明了在源領域表示上學到的線性分類器(使用一種新的預處理平均方法)可以在目標領域的分類任務中成功地表現。

我們的結果表明,對比表示不僅捕捉了類內結構,還捕捉了不同類別之間的相對幾何結構。這與先前關于無監督領域自適應的理論工作有所不同,后者通常要求更強的假設,例如有界密度比或顯式的源目標重疊 [Sugiyama 等,2007,Ben-David 等,2010,Zhang 等,2019,Zhao 等,2019a]。

為了支持我們的理論發現,我們提出了一種改進的線性評估方法,用于無監督領域自適應與對比表示。我們的方法通過直接對類內表示進行平均并應用預處理矩陣來學習線性分類器。我們在多個標準領域自適應基準數據集上驗證了該方法的有效性,證明其優于先前的最先進方法。

第五章研究了神經網絡模型架構在對比學習中的作用。我們不再將神經網絡視為黑箱函數逼近器,而是明確描述了架構的歸納偏置如何塑造學習到的表示。

我們引入了“最小可實現聚類”的概念,以捕捉架構所施加的約束。盡管正對圖可能展示了大量的自然聚類,但架構可能只能實現其中的一部分聚類。我們證明,對比學習只恢復那些與架構兼容的聚類。因此,低維的對比表示即使在整個正對圖中的聚類數量很大時,仍然可以在下游任務中取得成功。 我們在多個合成數據分布上實例化了我們的理論,證明了架構的歸納偏置可以顯著減少所需的表示維度。例如,在具有少量不變特征和大量虛假特征的超立方體數據分布上,我們證明,當下游標簽依賴于單一的不變維度時,線性對比表示就足夠了,而 ReLU 網絡則能夠處理更復雜的標簽函數。我們為其他架構提供了更多示例,包括 Lipschitz 連續函數和卷積網絡。在每種情況下,我們展示了對比學習的樣本復雜度與可實現聚類的數量成比例,而不是與自然聚類的總數成比例。

為了支持我們的理論,我們提出了一種實證方法來估計可實現聚類的數量,并將其應用于具有 ResNet-18 架構的 CIFAR-10 數據集。我們的實驗驗證了架構施加的約束導致可實現聚類的數量相對較小,這與我們的理論預測一致。

本論文的其余部分組織如下:第三章展示了我們的對比學習譜框架,包括群體層級損失的分析、有限樣本泛化界限和實驗證明。第四章將該框架擴展到領域自適應設置,正式刻畫了對比表示的線性遷移性,引入了改進的線性評估方法,并展示了其實證有效性。第五章分析了歸納偏置在對比學習中的作用,引入了最小可實現聚類的概念,并在合成數據分布上實例化了理論,為架構約束提供了實證支持。最后,第六章總結了論文內容并討論了未來的研究方向。

付費5元查看完整內容

近年來,深度學習取得了顯著進展。然而,其理論基礎,尤其在大模型領域,仍然相對滯后。本文的研究重點在于將堅實的理論基礎與大模型高效擴展的實際應用相結合。 在論文的第一部分中,我們聚焦于神經網絡的訓練動態,討論了過參數化神經網絡的理論。我們將簡要介紹神經切線核(Neural Tangent Kernel,NTK)的理論,并深入探討超參數遷移,這是一種重要的張量程序框架應用。我們將回顧一些奠定 NTK 作為研究領域的早期論文,并討論 NTK 的局限性。超參數遷移是一種新穎且高效的超參數調整范式,它提供了擴展模型的最優策略。我們將介紹深度神經網絡訓練動態的特征化,并提出一種高效的超參數選擇方案,其中通過在淺層網絡上調優選定的最優超參數同樣適用于深層網絡。 論文的第二部分集中于大模型擴展中的數據方面。我們首先介紹 Skill-Mix,這是一種新穎且獨特的評估方法,避免了傳統大型語言模型(LLM)評估中的數據污染和為排行榜“臨時抱佛腳”的問題。Skill-Mix 隨機選擇 k 種語言技能,然后提示 LLM 生成展示所選技能的簡潔文本。技能組合數量的指數級增長有效防止了數據污染,并進一步揭示了強大的 LLM 成功作答的創新性。接著,我們介紹了 ConceptMix,這是 Skill-Mix 的擴展,用于評估文本生成圖像模型結合 k 個隨機選定視覺概念的能力。最后,我們探討了 LLM 在給出優質 Skill-Mix 回答的情況下,學習和泛化技能組合的能力。結果表明,幾千條這樣的數據足以顯著提高模型在未見過的技能組合上的表現,甚至超越了尺寸更大的模型。這表明,將富含技能的合成文本融入訓練數據,是一種高效擴展數據規模的途徑。

引言

在過去的十年里,深度學習在多個領域取得了顯著進展,尤其是在計算機視覺和自然語言處理方面。這些成就通常歸因于模型規模和數據的擴展。ImageNet [Deng et al., 2009] 通過提供一個大規模且標注豐富的數據集,極大推動了計算機視覺的發展,促成了更優模型的產生。ResNet [He et al., 2016a] 通過引入殘差連接,革新了深度學習,使得超深網絡的有效訓練成為可能,從而利用增加的模型規模提升性能。最近,隨著大規模語言模型(LLM)規模的不斷擴展,并在更大規模的語料庫上進行訓練,LLM 展現出了新的能力,例如少樣本上下文學習、推理和解決數學問題 [Brown et al., 2020, OpenAI, 2023]。

總的來說,擴展過程——即模型規模和數據集的擴大——對于開發能夠執行具有人類或超人準確性與適應性的強大 AI 模型至關重要。然而,這個過程的代價高昂,訓練大型 AI 模型,如 LLaMA-2 [Touvron et al., 2023] 和 GPT-4 [OpenAI, 2023],需要耗費數千萬甚至數億美元的計算資源。 本論文旨在深入理解擴展背后的原理,并使擴展過程更為高效,以較少的計算資源實現更高的性能。我們的工作分為兩個部分,分別探討擴展的兩個關鍵方面:模型規模和數據。

  1. 首先,我們研究了高效擴展模型規模的優化策略,重點是選擇隨著模型規模增長的理論最優超參數。 實際上,計算資源的限制使得對巨大模型進行廣泛的超參數搜索變得困難。為了解決這個問題,通常會對不同規模的小模型進行最優超參數的搜索,并外推得出大模型的近似最優超參數。然而,隨著模型規模的增長,超參數的最佳變化方式——即超參數的擴展策略——往往無法通過少量數據點準確測量。因此,我們旨在建立擴展策略的理論理解,從而能夠通過一個小模型的最優超參數來預測大模型的最優超參數。正式地說,我們回答以下問題:**在數據集和模型架構固定的情況下,隨著模型規模的增長,超參數的最優擴展策略是什么?**為了解決這一問題,我們研究了模型在優化過程中規模趨于無窮大時的漸近行為。我們發現這些行為受超參數擴展策略(即超參數如何隨模型規模變化)的控制。我們根據其導致的漸近行為對這些擴展策略進行了分類,并確定了最優擴展策略。通過這種最優擴展策略,可以廣泛搜索一個小模型的最優超參數,并將其直接轉換為大模型的近似最優超參數。這樣的超參數調整方案被稱為“超參數遷移”,它大大降低了大型模型開發的計算成本。
  2. 接下來,我們探討了當訓練數據擴展時,大型 AI 模型的技能組合能力。 對于模型如何從更多數據中學習到新的能力,有兩種不同的解釋:一種是“隨機鸚鵡”觀點 [Bender et al., 2021],另一種是技能組合觀點 [Arora 和 Goyal, 2023]。前者認為模型學習的是訓練數據中已有的能力,因此更多的數據意味著更多的能力。后者則使用隨機圖論構建了一個統計框架,證明技能組合能力可以通過擴展模型規模而涌現。隨著組合更多技能的能力,模型能夠解決訓練中未曾見過的新任務。在論文的第二部分中,我們首先構建了評估方法,來測量 AI 模型組合 k 個隨機選擇的技能的能力。評估結果驗證了技能組合觀點,并表明像 GPT-4 這樣的頂級模型已經超越了“隨機鸚鵡”的行為。此外,我們的評估具有靈活性、可控的難度等級,并且通過選擇足夠大的 k 避免了數據污染問題。我們觀察到,較小的模型在組合 3 個技能時遇到了困難。一個自然的問題是,這些較小的模型是否可以通過從技能豐富的數據中學習來獲得技能組合能力。我們基于評估生成技能豐富的訓練數據,并觀察到其在提升模型技能組合能力方面的有效性。這為通過生成高質量訓練數據來高效擴展數據規模,提供了一個有前景的方向。

付費5元查看完整內容

物理啟發的生成模型(如擴散模型)構成了一類強大的生成模型家族。該模型家族的優勢在于相對穩定的訓練過程和強大的容量。然而,仍有許多可能的改進空間。在本論文中,我們首先將深入探討擴散模型在訓練和采樣方面的改進技術。擴散模型的訓練目標在數據分布為多模態時呈現出較高的方差。為了解決這一問題,我們提出了一種訓練目標,它推廣了傳統的去噪得分匹配方法,顯著減少了訓練目標的方差。除此之外,我們還引入了一種將可學習的離散潛變量整合到連續擴散模型中的訓練框架。這些潛變量簡化了擴散模型復雜的噪聲到數據映射的學習過程。

另一方面,擴散模型的采樣過程通常涉及求解微分方程。為加速采樣過程,我們提出了一種新穎的采樣算法,結合了之前常見的ODE和SDE采樣器的優點,大幅提升了預訓練擴散模型的性能。此外,我們的研究探索了在有限樣本中引入互斥力以促進生成過程中的多樣性。 在物理啟發的生成模型領域,許多物理過程都可以用于開發生成模型。我們將介紹一類基于靜電理論的新生成模型家族,稱為泊松流生成模型(PFGM)。PFGM在采樣穩健性上表現出色,并與領先的擴散模型相媲美。其擴展版本PFGM++將擴散模型和PFGM置于同一框架下,并引入了新的、更優的模型。我們還將提出一種系統化的方法,將物理過程轉化為生成模型。

生成模型在近年來顯著改變了人們工作的、創作的和學習的方式。其突出應用包括ChatGPT [1]、文本到圖像模型 [2]-[4]、文本到3D模型 [5]、[6] 和文本到視頻模型 [7]、[8]。這些能力可以極大地激發創造力,并提高眾多領域的工作效率,包括教育、游戲產業、社交媒體和專業編輯軟件。生成模型的訓練基于這樣一個假設,即訓練數據是從未知的數據分布中采樣的 [9]。現代生成模型通常使用深度神經網絡來基于有限的訓練數據逼近復雜的數據分布,并通過從這些建模的分布中采樣來生成新的數據點。

在生成建模中使用的各種數據類型中,高維數據由于維度詛咒而面臨著顯著的挑戰。隨著維度的增加,數據空間的體積呈指數級擴展。這一現象使得在高維空間中用有限的訓練數據有效捕獲和建模數據分布變得困難。此外,感興趣的數據分布通常高度復雜且呈多模態,進一步增加了生成建模的難度。近年來,擴散模型 [10]–[12] 以及更廣泛的物理啟發生成模型 [13],在處理高維數據的生成任務中,展現了強大的框架并取得了令人印象深刻的結果。在擴散模型之前,主要的方法包括:(i)利用對抗訓練目標的生成對抗網絡(GANs [14]);(ii)使用最大似然目標訓練的模型,如PixelCNN [15] 和正規化流模型 [16]、[17];(iii)變分自編碼器(VAEs)[18]、[19] 以及(iv)基于能量的模型 [20]、[21]。然而,每種方法都有其自身的缺點:(i)可能導致訓練不穩定和生成樣本的多樣性低;(ii)需要特定的架構設計,可能限制模型的容量;(iii)需要多個神經網絡的仔細協調;(iv)訓練和采樣速度較慢。利用自然的物理過程作為編碼器將數據轉化為噪聲,擴散模型通過逆轉這些物理過程來執行生成任務。這種方法使它們繞過了早期生成模型的許多限制。

1.1 通過逆轉物理過程進行生成建模

基于熱力學的原理 [10],擴散模型涉及兩個對立的過程:一個前向過程將數據分布逐漸轉化為一個更簡單的先驗分布,另一個反向過程通過逐步去噪從該噪聲先驗分布中生成樣本。擴散模型中的前向過程是一個簡單的布朗運動,通過逐步增加高斯噪聲來降解數據。為了逆轉這一過程,只需學習一個時間依賴的向量場,即得分函數,并迭代求解一個微分方程 [22]。與GANs和VAEs不同,擴散模型的訓練不需要多個神經網絡之間的同步,從而使訓練過程更加穩定。此外,它們在架構設計上不受限,采用類似于神經網絡串聯的迭代過程,從而增強了整體容量。這種穩定性和增強的容量使擴散模型能夠有效擴展到大規模數據集。

盡管擴散模型具有諸多優勢,但它們仍面臨一些挑戰,包括在處理多模態數據時高方差的訓練過程,以及緩慢的迭代采樣過程。此外,獨立同分布(i.i.d.)的采樣過程往往會導致重復的樣本。這些問題強調了在復雜數據集上穩定和改進擴散模型訓練方法的必要性,并且需要新技術來加速采樣過程并提高小批量樣本的多樣性。此外,擴散模型只是眾多物理啟發生成模型之一。除布朗運動外,仍有許多物理過程尚未開發,可以用來構建生成模型。這引出了一個重要問題:我們能否發現其他物理啟發的生成模型,它們展示出更好的性能?在接下來的部分中,我們將簡要總結擴散模型的改進訓練和采樣技術,并討論我們開發其他物理啟發生成模型的研究,這些將在后續章節中詳細闡述。

1.1.1 擴散模型的改進訓練技術

擴散模型的訓練利用了一種擾動-去噪方法來估計向量場。其過程是先通過高斯噪聲擾動干凈的數據,然后網絡從這些擾動樣本中重構原始數據 [12]。然而,對于復雜的多模態數據,許多干凈的數據點可能被擾動為相似的噪聲樣本,導致訓練目標不明確并引發不穩定性。

在文獻 [23] 中,我們通過多個干凈數據點的加權求和來估計真實目標,精確地指示從擾動樣本到真實向量場的方向。該新穎的訓練目標推廣了傳統的單點估計方法,顯著減少了訓練目標中的方差。因此,在各種擴散模型變體中,樣本質量得到了提高,訓練過程更加穩定,訓練速度也得到了加快。

擴散模型面臨的另一個挑戰是,需要學習一個從單峰高斯分布到多峰數據分布的非線性且高度復雜的映射。這種復雜性增加了訓練的難度,并導致生成常微分方程(ODE)[24] 軌跡呈現強烈的曲率。為解決這一問題,我們在擴散模型中引入了離散潛變量。這些離散潛變量有助于捕獲數據分布中的不同模式,而擴散模型的任務則轉變為基于給定的離散潛變量捕獲每個模式內的連續變化。離散與連續變化的分離建模顯著簡化了模型復雜的噪聲到數據映射的學習過程。這一方法有效降低了擴散模型生成ODE的曲率,尤其是在較大的擴散時間下,整體訓練損失得到了減少。

1.1.2 擴散模型的改進采樣技術

在擴散模型的采樣過程中,求解微分方程通常涉及速度和質量之間的權衡。確定性采樣器(基于ODE的)[25]–[27] 速度快,但性能達到平臺期,而隨機采樣器(基于SDE的)[27]、[28] 樣本質量更好,但速度較慢。我們的分析將這種差異歸因于采樣誤差:ODE采樣器的離散化誤差較小,而SDE中的隨機性會收縮采樣過程中的累積誤差 [29]。

基于這些見解,在文獻 [29] 中,我們提出了一種名為Restart的新采樣算法,該算法結合了ODE和SDE的優點。該方法在附加的前向步驟中加入大量噪聲,并嚴格遵循逆ODE過程。前向噪聲的引入增強了隨機性的收縮效應,而逆ODE過程的遵循則加快了采樣速度。這種將隨機性和確定性采樣過程分離的方法極為有效,Restart在標準基準(CIFAR-10和ImageNet-64)上超過了SDE和ODE采樣器的速度和質量,并在大規模文本到圖像的Stable Diffusion模型中展示了文本-圖像對齊、視覺質量和多樣性的卓越平衡。

傳統上,擴散模型從模型分布中生成獨立同分布的樣本。然而,在實際操作中,模型通常需要多次采樣以獲得一組多樣化的小批量樣本,這會帶來與采樣時間無關的成本。我們提出超越獨立樣本假設,以提高樣本的多樣性和效率。我們的方法引入了一種擴展的基于擴散的生成采樣方法,稱為粒子引導。在這種方法中,聯合粒子的時間演化勢通過在樣本(粒子)之間加入互斥力來強制多樣性。根據實驗結果,我們的框架在文本到圖像生成和分子構象生成等應用中提高了樣本的多樣性并減輕了記憶效應。

1.1.3 基于其他物理過程的生成模型

以擴散模型為顯著例子,物理啟發的生成模型包含一個前向過程,該過程將復雜的數據分布簡化為逐步的先驗分布,隨后通過一個反向過程(即采樣過程)逐步將這些先驗分布還原為原始數據分布。因此,為了定義新的物理啟發生成模型,必須確定一個合適的前向過程。該過程應自然地隨著時間簡化數據分布,并且是可逆的,同時其相關的向量場應該易于被神經網絡學習。 借助靜電學原理,我們為物理啟發的生成模型開辟了一條新路徑,并介紹了泊松流生成模型(Poisson Flow Generative Models, PFGM)[30] 及其擴展版本PFGM++ [31]。PFGM將數據解釋為增廣空間中的電荷。如圖1.1所示,當我們從數據支撐遠離足夠遠時,電荷分布坍縮為一個點電荷,電場在各個方向上呈現輻射狀。因此,可以證明這些電荷發出的電場線定義了數據分布和大半球上均勻分布之間的雙射。實驗結果表明,這一新模型家族在樣本質量、采樣速度和穩健性方面超越了擴散模型。此外,我們還探索了物理過程和生成模型之間的對偶性,旨在概念化和設計更多新的物理啟發生成模型 [13]。

1.2 論文摘要

本論文分為三個主題部分。下面簡要概述每個部分的內容。 第一部分 重點開發新技術,旨在穩定擴散模型的訓練,并在處理復雜的多模態數據集時,優化生成軌跡。

第三章 我們通過引入參考批次來解決擴散模型目標中的高方差問題,并使用參考批次計算加權條件得分,作為更穩定的訓練目標。我們展示了這一過程在具有挑戰性的中間階段中,通過減少訓練目標協方差(的跡)確實起到了幫助作用。本章基于文獻 [23]。

第四章 我們通過一個編碼器推斷可學習的離散潛變量,并對擴散模型和編碼器進行端到端訓練。離散潛變量通過降低擴散模型生成ODE的曲率,顯著簡化了其復雜的噪聲到數據映射的學習過程,并通過ODE采樣器提高了在各種數據集上的樣本質量。本章基于文獻 [32]。

第二部分 討論了加速擴散模型采樣過程的技術,以及通過施加樣本之間的互斥力來促進多樣性。所有討論的技術都不需要重新訓練,且可以直接應用于任何預訓練的擴散模型。

第五章 我們提出了一種名為Restart的新采樣算法,結合了先前ODE和SDE采樣器的優勢。Restart算法在附加的前向步驟中加入大量噪聲,并嚴格遵循逆ODE過程。實驗結果表明,Restart采樣器在速度和精度上均超過了先前的SDE和ODE采樣器。本章基于文獻 [29]。

第六章 我們提出了粒子引導,一種擴展的基于擴散的生成采樣方法,其中通過一個聯合粒子的時間演化勢來強制樣本多樣性。在條件圖像生成中,我們測試了該框架,并證明其在不影響質量的情況下增加了多樣性;在分子構象生成中,我們改進了相較于先前方法的中位誤差。本章基于文獻 [33]。

第三部分 探討了一類新型的生成模型,這些模型基于靜電理論,并與擴散模型在擴展視角下進行了統一。本部分還展望了通過物理過程構建生成模型的方法論。

第七章 我們介紹了一種新型生成模型——泊松流生成模型(PFGM),基于靜電理論。我們將數據點解釋為增廣空間中 z=0 超平面上的電荷,生成一個高維電場(泊松方程解的梯度)。我們證明了,如果這些電荷沿電場線向上流動,它們在 z=0 平面的初始分布會轉化為半徑為 r 的半球上的分布,并且在 r → ∞ 時變得均勻。我們展示了PFGM在圖像生成速度上提供了比先前最先進擴散模型更好的性能。本章基于文獻 [30]。

第八章 我們擴展了PFGM中使用的靜電理論,將擴散模型與PFGM統一起來。更有趣的是,在兩者之間的插值揭示了一個性能最優的新平衡點,達到了圖像生成的新標桿性能。我們為為什么PFGM和擴散模型都是次優解提供了理論解釋。本章基于文獻 [31]。

第九章 我們提出了一個統一的框架和算法,將物理過程轉化為平滑的密度流生成模型。此外,我們基于底層物理偏微分方程(PDE)的色散關系,提出了一種分類標準。這種理論方法可應用于各種物理PDE,從而發現新的生成模型家族。本章基于文獻 [13]。

第十章 我們總結了論文內容并討論了當前的局限性。

付費5元查看完整內容

現代機器學習模型的脆弱性引起了學術界和公眾的廣泛關注。在本論文中,我們將系統研究幾種機器學習模型的理解與改進,包括平滑模型和通用表征網絡。我們特別關注表征魯棒性的研究,將其定義為給定網絡在隱含空間中的“魯棒性”(或廣義上的可信屬性)。對于通用表征網絡,這對應于表征空間本身,而對于平滑模型,我們將網絡的logits視為目標空間。表征魯棒性是許多可信賴AI領域的基礎,例如公平性和魯棒性。

在本論文中,我們發現隨機平滑的可證魯棒性是以類別不公平性為代價的。我們進一步分析了改進基礎模型訓練過程的方法及其局限性。對于通用的非平滑表征模型,我們發現自監督對比學習與監督的鄰域成分分析之間存在聯系,這自然地使我們提出了一個可以實現更高準確性和魯棒性的通用框架。此外,我們意識到當前基礎表征模型的評估實踐涉及在各種現實任務上進行大量實驗,這既耗費計算資源又容易導致測試集泄漏。為此,我們提出了一種更輕量級、保護隱私且健全的評估框架,通過利用合成數據來評估視覺和語言模型。

**1.1 研究動機

深度神經網絡對人眼難以察覺的對抗性擾動的脆弱性,自從開創性工作[170, 7]發表以來,已經引起了機器學習領域廣泛的關注。這一問題在多個機器學習領域中都是一個重要的關注點,從計算機視覺[170]到語音識別[17],無不如此。特別是在安全關鍵的應用中,如自動駕駛汽車和監控系統,幾乎無法容忍任何錯誤決策。因此,深度神經網絡中對抗樣本的存在,促使了對魯棒性量化的研究,以及旨在增強這種魯棒性的訓練算法的設計[42, 47, 95]。在本論文中,我們旨在理解和改進現代機器學習模型的表征魯棒性。

**1.1.1 機器學習模型的表征魯棒性

表征魯棒性指的是神經網絡模型中隱含空間的可靠性。這一概念在機器學習中尤為重要,因為網絡的隱藏層應該從輸入數據中捕捉到復雜的模式。在本論文中,我們將表征魯棒性定義為這些隱藏表示在面對不同輸入或擾動時,能夠維持理想的可信屬性的能力。理想的可信屬性可能包括準確性、公平性、對抗性魯棒性等。對于一個通用的表征網絡 Φ(?)\Phi(\cdot)Φ(?),隱含空間的自然選擇是表征網絡的輸出空間。這些構建的空間通過表征學習被專門訓練用于編碼關于輸入數據的關鍵信息,使網絡能夠通過一個簡單的任務特定下游網絡執行分類、回歸或生成等各種任務。另一方面,在平滑模型的背景下,平滑濾波器應用于整個基礎網絡

。因此,我們將直接將網絡的

視為評估表征魯棒性的目標空間。在這種情況下,我們特別感興趣的是基礎網絡和平滑網絡之間的不同表現。 研究表征魯棒性對于推動機器學習領域的發展至關重要,原因有以下幾點。首先,正如將在論文的后續章節中討論的那樣,對每個組件(如表征網絡、平滑操作符等)的深入理解有助于我們更加謹慎和意識到這些操作可能產生的副作用。這種理解也將為改進這些網絡設計奠定基礎。其次,隨著機器學習社區逐漸將重點轉向任務無關的預訓練和任務特定的微調,魯棒的表征變得越來越重要。在安全關鍵的應用中,由于脆弱表征導致的錯誤預測可能會產生嚴重后果。從這個角度來看,表征魯棒性是許多可信賴AI領域的基礎,因為預訓練的表征網絡將對任何基于它的機器學習系統的整體可信賴性產生貢獻。通過研究和增強表征魯棒性,可以構建更具彈性的AI系統,并防止錯誤的傳播。

付費5元查看完整內容

構建能與世界互動的自主代理是人工智能(AI)的核心。本論文引入了“語言代理”,這是一類新的代理,它們利用大型語言模型(LLMs)進行推理以采取行動,標志著與傳統通過廣泛規則設計或學習的代理的一種轉變。它分為三個部分開發:

第一部分通過介紹基于與大規模、真實世界計算環境(如互聯網或代碼接口)的互動的一組新的AI問題和基準,激發了對語言代理的需求。這些“數字自動化”任務為減輕繁瑣的勞動和改善我們的生活提供了巨大的價值,但對于以前的代理或LLM方法在開放式自然語言和長期決策方面提出了重大挑戰,這需要新的方法論。 第二部分為語言代理奠定了方法論基礎,其核心思想是應用LLM推理來實現多功能和可泛化的代理行動和計劃,這也通過外部反饋和內部控制增強了LLM的推理,使其更加扎根和深思熟慮。我們展示了語言代理能解決多種語言和代理任務(特別是在第一部分提出的數字自動化任務),并在先前基于LLM的方法和傳統代理上取得了顯著的改進。 第三部分綜合了第一部分和第二部分的洞察,并概述了一個有原則的語言代理框架。該框架提供了模塊化抽象,以組織各種基于LLM的方法作為代理,理解它們與人類認知的差距,并激發并開發新方法,朝向通用目的的自主代理。從基礎的經驗任務和方法到統一的概念框架,本論文建立了語言代理作為AI研究前沿的一個獨特且嚴謹定義的領域的研究。

構建能與各種環境互動的自主代理是人工智能(AI)的核心問題[266]。從高層次上來說,這篇論文提出了一種全新的代理類型和一種全新的環境類型(圖1.1): ? 現有的代理要么主要遵循特定領域的規則來行動(基于規則的代理,如DeepBlue [38]、Eliza [272]或Shaky the robot [229]),要么主要在特定領域數據上進行訓練以行動(基于學習的代理,如AlphaGo [281]、Atari DQN [206]或用于手部操控的ADR [8])。本論文介紹了語言代理,這些代理利用語言模型進行推理以行動,這減輕了構建傳統代理所需的密集型特定領域努力,并且在各種領域中實現了少量樣本的泛化。這代表了構建通用自主代理目標的一個重大步驟。 ? 現有代理要么與人類或物理世界互動(實用但不可擴展),要么與游戲或模擬互動(可擴展但不實用)。這篇論文引入了數字自動化,一種新型任務,其中代理與大規模真實世界數字環境(如互聯網)互動。這為代理在開放式行動和長期視野上做出決策提供了新的挑戰,同時也提供了巨大的機會來減輕我們的數字勞動并發現新知識。 傳統代理和環境有什么問題?在傳統基于規則或基于學習的代理可能也能感知和用語言行動的情況下,“語言代理”的定義是什么?為什么我們必須轉向大規模真實世界數字環境來進一步發展,而不是使用傳統的代理測試床如游戲?我將簡要使用文本冒險游戲領域來闡述這些點并激發論文的其余部分。

付費5元查看完整內容

本論文的核心目標是通過提高深度學習模型的標簽和訓練效率來增強深度學習的實用性。為此,我們研究了基于信息論原理的數據子集選擇技術,特別是主動學習和主動采樣。主動學習提高了標簽效率,而主動采樣提高了訓練效率。監督式深度學習模型通常需要大量的帶標簽數據進行訓練。標簽獲取可能既昂貴又耗時,且訓練大型模型資源密集型,這限制了其在學術研究和“大科技”公司之外的應用。深度學習中現有的數據子集選擇方法通常依賴于啟發式方法或缺乏一個原理化的信息論基礎。相比之下,本論文檢查了數據子集選擇的幾種目標及其在深度學習中的應用,力求采用一種由信息論啟發的更原理化的方法。

我們首先在單次前向傳播的深度神經網絡中區分了認知不確定性和隨機不確定性,這提供了有用的直覺和洞見,關于不同形式的不確定性及其對數據子集選擇的相關性。然后,我們提出并研究了在(貝葉斯)深度學習中進行主動學習和數據子集選擇的各種方法。最后,我們將各種現有和提出的方法與在權重或預測空間中信息量的近似聯系起來。

支撐這項工作的是一個原理化且實用的信息論量符號,包括隨機變量和觀察到的結果。這篇論文展示了從統一視角出發工作的好處,并強調了我們的貢獻對深度學習實際應用潛在影響的可能性。

付費5元查看完整內容

本博士論文包含了對統計因果模型領域的幾個貢獻。統計因果模型是嵌入因果假設的統計模型,允許對受外部操縱(干預)影響的隨機系統的行為進行推斷和推理。本文在因果效應估計、因果結構學習和分布魯棒(非分布廣義)預測方法等方面進行了深入的研究。我們提出了新的和一致的線性和非線性因果效應估計工具變量設置,采用數據依賴的均方預測誤差正則化。我們提出的估計量顯示,在某些情況下,均方誤差比標準和最先進的估計量都有所改善。我們表明,最近對分布穩健預測方法的研究與計量經濟學中經過充分研究的估計量有關。由此證明了一般k類估計具有分布魯棒性。此外,我們提出了一個關于干預誘發分布的分布穩健性的一般框架。在這個框架中,我們推導了分布魯棒預測方法可識別的充分條件,并給出了一些不可能的結果,證明了這些條件的必要性。提出了一種新的結構學習方法,適用于以有向樹為因果圖的加性噪聲模型。我們證明了消失可辨識性設置中的一致性,并提供了一種方法來檢驗具有漸近家族誤差控制的子結構假設,該方法在選擇后仍然有效。最后,我們提出了學習非線性時間序列模型總結圖的啟發式思想。

付費5元查看完整內容
北京阿比特科技有限公司