現如今,很多數據處理與分析的任務僅僅依靠機器算法難以達到理想的效果。因此,眾包技術應 運而生,其利用群體的智慧來解決對計算機比較難的問題。其中,眾包平臺(例如 Amazon Mechanical Turk)為眾包技術的應用提供了有力的支撐。平臺上有成千上萬的網絡大眾來為任務發布者解決問題。然 而,對于任務發布者來說與眾包平臺交互是不方便的,因為平臺會要求任務發布者設置很多參數甚至書 寫代碼。所以研究者們借鑒傳統數據庫的思想,提出了眾包數據庫的概念,其封裝了任務發布者、眾包 平臺以及眾包工人之間的復雜交互過程,為發布者提供友好的API。使發布者可以通過簡單的類SQL語言 與平臺交互。在這篇綜述中,我們首先介紹眾包的概念;然后介紹設計眾包數據庫時需考慮的一些基本 技術例如真值推理、任務分配,代價優化等;接著我們介紹幾種主流的眾包數據庫系統。此外,我們會 介紹對于不同的數據庫算子包括選擇、連接、排序等的優化技術。最后我們會介紹該領域未來的研究方 向與挑戰。
隨著圖像處理,語音識別等人工智能技術的發展,很多學習方法尤其是采用深度學習框架的方法取得了優異的性能,在精度和速度方面有了很大的提升,但隨之帶來的問題也很明顯,這些學習方法如果要獲得穩定的學習效果,往往需要使用數量龐大的標注數據進行充分訓練,否則就會出現欠擬合的情況而導致學習性能的下降。因此,隨著任務復雜程度和數據規模的增加,對人工標注數據的數量和質量也提出了更高的要求,造成了標注成本和難度的增大。同時,單一任務的獨立學習往往忽略了來自其他任務的經驗信息,致使訓練冗余重復因而導致了學習資源的浪費,也限制了其性能的提升。為了緩解這些問題,屬于遷移學習范疇的多任務學習方法逐漸引起了研究者的重視。與單任務學習只使用單個任務的樣本信息不同,多任務學習假設不同任務數據分布之間存在一定的相似性,在此基礎上通過共同訓練和優化建立任務之間的聯系。這種訓練模式充分促進任務之間的信息交換并達到了相互學習的目的,尤其是在各自任務樣本容量有限的條件下,各個任務可以從其它任務獲得一定的啟發,借助于學習過程中的信息遷移能間接利用其它任務的數據,從而緩解了對大量標注數據的依賴,也達到了提升各自任務學習性能的目的。在此背景之下,本文首先介紹了相關任務的概念,并按照功能的不同對相關任務的類型進行劃分后再對它們的特點進行逐一描述。然后,本文按照數據處理模式和任務關系建模過程的不同將當前的主流算法劃分為兩大類:結構化多任務學習算法和深度多任務學習算法。其中,結構化多任務學習算法采用線性模型,可以直接針對數據進行結構假設并且使用原有標注特征表述任務關系,同時,又可根據學習對象的不同將其細分為基于任務層面和基于特征層面兩種不同結構,每種結構有判別式方法和生成式方法兩種實現手段。與結構化多任務學習算法的建模過程不同,深度多任務學習算法利用經過多層特征抽象后的深層次信息進行任務關系描述,通過處理特定網絡層中的參數達到信息共享的目的。緊接著,以兩大類算法作為主線,本文詳細分析了不同建模方法中對任務關系的結構假設、實現途徑、各自的優缺點以及方法之間的聯系。最后,本文總結了任務之間相似性及其緊密程度的判別依據,并且分析了多任務作用機制的有效性和內在成因,從歸納偏置和動態求解等角度闡述了多任務信息遷移的特點。 //gb.oversea.cnki.net/KCMS/detail/detail.aspx?filename=JSJX20190417000&dbcode=CJFD&dbname=CAPJ2019
現實網絡由多種相互作用、不斷進化的實體組成,而現有的研究大多將其簡單地描述為特定的靜態網絡,而沒有考慮動態網絡的演化趨勢。近年來,動態網絡的特性跟蹤研究取得了重大進展,利用網絡中實體和鏈接的變化來設計網絡嵌入技術。與被廣泛提出的靜態網絡嵌入方法相比,動態網絡嵌入努力將節點編碼為低維密集表示,有效地保持了網絡結構和時間動態,有利于處理各種下游機器學習任務。本文對動態網絡嵌入問題進行了系統的研究,重點介紹了動態網絡嵌入的基本概念,首次對現有的動態網絡嵌入技術進行了分類,包括基于矩陣分解的、基于躍格的、基于自動編碼器的、基于神經網絡的等嵌入方法。此外,我們仔細總結了常用的數據集和各種各樣的后續任務,動態網絡嵌入可以受益。在此基礎上,提出了動態嵌入模型、大規模動態網絡、異構動態網絡、動態屬性網絡、面向任務的動態網絡嵌入以及更多的嵌入空間等現有算法面臨的挑戰,并提出了未來可能的研究方向。
【簡介】在智能交通系統中交通預測扮演著重要的角色。精準的交通預測有助于優化通行路線,指導車輛調度,緩解交通擁堵。由于道路網絡中不同區域之間復雜且動態的時空依賴關系,這一問題具有很大挑戰性。最近幾年,有大量的研究工作推進了這一領域的發展,提高了交通系統預測交通的能力。這篇論文對于近些年的交通預測發展提供了一個全面的綜述。具體來說,我們對目前的交通預測方法進行了總結,并且對它們進行了分類。然后,我們列舉了應用交通預測的常見領域,以及這些應用任務的最新進展。同時,我們也收集和整理了幾個相關的公共數據集,并分別在兩個數據集上通過對相關的交通預測方法的表現進行了評估。最后,我們對這一領域未來的發展方向進行了探討。
【導讀】近年來,隨著網絡數據量的不斷增加,挖掘圖形數據已成為計算機科學領域的熱門研究課題,在學術界和工業界都得到了廣泛的研究。但是,大量的網絡數據為有效分析帶來了巨大的挑戰。因此激發了圖表示的出現,該圖表示將圖映射到低維向量空間中,同時保持原始圖結構并支持圖推理。圖的有效表示的研究具有深遠的理論意義和重要的現實意義,本教程將介紹圖表示/網絡嵌入的一些基本思想以及一些代表性模型。
關于圖或網絡的文獻有兩個名稱:圖表示和網絡嵌入。我們注意到圖和網絡都指的是同一種結構,盡管它們每個都有自己的術語,例如,圖和網絡的頂點和邊。挖掘圖/網絡的核心依賴于正確表示的圖/網絡,這使得圖/網絡上的表示學習成為學術界和工業界的基本研究問題。傳統表示法直接基于拓撲圖來表示圖,通常會導致許多問題,包括稀疏性,高計算復雜性等,從而激發了基于機器學習的方法的出現,這種方法探索了除矢量空間中的拓撲結構外還能夠捕獲額外信息的潛在表示。因此,對于圖來說,“良好”的潛在表示可以更加精確的表示圖形。但是,學習網絡表示面臨以下挑戰:高度非線性,結構保持,屬性保持,稀疏性。
深度學習在處理非線性方面的成功為我們提供了研究新方向,我們可以利用深度學習來提高圖形表示學習的性能,作者在教程中討論了將深度學習技術與圖表示學習相結合的一些最新進展,主要分為兩類方法:面向結構的深層方法和面向屬性的深層方法。
對于面向結構的方法:
結構性深層網絡嵌入(SDNE),專注于保持高階鄰近度。
深度遞歸網絡嵌入(DRNE),其重點是維護全局結構。
深度超網絡嵌入(DHNE),其重點是保留超結構。
對于面向屬性的方法:
專注于不確定性屬性的深度變異網絡嵌入(DVNE)。
深度轉換的基于高階Laplacian高斯過程(DepthLGP)的網絡嵌入,重點是動態屬性。
本教程的第二部分就以上5種方法,通過對各個方法的模型介紹、算法介紹、對比分析等不同方面進行詳細介紹。
1、Structural Deep Network Embedding
network embedding,是為網絡中的節點學習出一個低維表示的方法。目的在于在低維中保持高度非線性的網絡結構特征,但現有方法多采用淺層網絡不足以挖掘高度非線性,或同時保留局部和全局結構特征。本文提出一種結構化深度網絡嵌入方法,叫SDNE該方法用半監督的深度模型來捕捉高度非線性結構,通過結合一階相似性(監督)和二階相似性(非監督)來保留局部和全局特征。
2、 Deep recursive network embedding with regular equivalence
網絡嵌入旨在保留嵌入空間中的頂點相似性。現有方法通常通過節點之間的連接或公共鄰域來定義相似性,即結構等效性。但是,位于網絡不同部分的頂點可能具有相似的角色或位置,即規則的等價關系,在網絡嵌入的文獻中基本上忽略了這一點。以遞歸的方式定義規則對等,即兩個規則對等的頂點具有也規則對等的網絡鄰居。因此,文章中提出了一種名為深度遞歸網絡嵌入(DRNE)的新方法來學習具有規則等價關系的網絡嵌入。更具體地說,我們提出了一種層歸一化LSTM,以遞歸的方式通過聚合鄰居的表示方法來表示每個節點。
3、Structural Deep Embedding for Hyper-Networks
是在hyperedge(超邊是不可分解的)的基礎上保留object的一階和二階相似性,學習異質網絡表示。于與HEBE的區別在于,本文考慮了網絡high-oeder網絡結構和高度稀疏性。
傳統的基于clique expansion 和star expansion的方法,顯式或者隱式地分解網絡。也就說,分解后hyper edge節點地子集,依然可以構成一個新的超邊。對于同質網絡這個假設是合理地,因為同質網絡地超邊,大多數情況下都是根據潛在地相似性(共同地標簽等)構建的。
4、** Deep variational network embedding in wasserstein space**
大多數現有的嵌入方法將節點作為點向量嵌入到低維連續空間中。這樣,邊緣的形成是確定性的,并且僅由節點的位置確定。但是,現實世界網絡的形成和發展充滿不確定性,這使得這些方法不是最優的。為了解決該問題,在本文中提出了一種新穎的在Wasserstein空間中嵌入深度變分網絡(DVNE)。所提出的方法學習在Wasserstein空間中的高斯分布作為每個節點的潛在表示,它可以同時保留網絡結構并為節點的不確定性建模。具體來說,我們使用2-Wasserstein距離作為分布之間的相似性度量,它可以用線性計算成本很好地保留網絡中的傳遞性。此外,我們的方法通過深度變分模型隱含了均值和方差的數學相關性,可以通過均值矢量很好地捕獲節點的位置,而由方差可以很好地捕獲節點的不確定性。此外,本文方法通過保留網絡中的一階和二階鄰近性來捕獲局部和全局網絡結構。
5、Learning embeddings of out-of-sample nodes in dynamic networks
迄今為止的網絡嵌入算法主要是為靜態網絡設計的,在學習之前,所有節點都是已知的。如何為樣本外節點(即學習后到達的節點)推斷嵌入仍然是一個懸而未決的問題。該問題對現有方法提出了很大的挑戰,因為推斷的嵌入應保留復雜的網絡屬性,例如高階鄰近度,與樣本內節點嵌入具有相似的特征(即具有同質空間),并且計算成本較低。為了克服這些挑戰,本文提出了一種深度轉換的高階拉普拉斯高斯過程(DepthLGP)方法來推斷樣本外節點的嵌入。DepthLGP結合了非參數概率建模和深度學習的優勢。特別是,本文設計了一個高階Laplacian高斯過程(hLGP)來對網絡屬性進行編碼,從而可以進行快速和可擴展的推理。為了進一步確保同質性,使用深度神經網絡來學習從hLGP的潛在狀態到節點嵌入的非線性轉換。DepthLGP是通用的,因為它適用于任何網絡嵌入算法學習到的嵌入。
題目: A Survey on Network Embedding
摘要: 網絡嵌入將網絡中的節點分配給低維表示,有效地保持了網絡結構。近年來,這一新興的網絡分析范式取得了很大的進展。本文首先對網絡嵌入方法進行了分類,然后回顧了網絡嵌入方法的發展現狀,并指出了其未來的研究方向。我們首先總結了網絡嵌入的動機。討論了經典的圖嵌入算法及其與網絡嵌入的關系。隨后,我們對大量的網絡嵌入方法進行了系統的綜述,包括結構和屬性保持的網絡嵌入方法、帶邊信息的網絡嵌入方法和先進的信息保持的網絡嵌入方法。此外,還綜述了幾種網絡嵌入的評價方法和一些有用的在線資源,包括網絡數據集和軟件。最后,我們討論了利用這些網絡嵌入方法構建有效系統的框架,并指出了一些潛在的未來方向。
作者簡介: Peng Cui,清華大學計算機科學與技術系媒體與網絡實驗室副教授。
Jian Pei,現任加拿大大數據科學研究主席(Tier 1)和西蒙弗雷澤大學(Simon Fraser University)計算科學學院教授。他還是統計與精算科學系、科學院和健康科學院的副院士。他是數據科學、大數據、數據挖掘和數據庫系統等領域的知名首席研究員。他的專長是為新的數據密集型應用開發高效的數據分析技術。他被公認為計算機械協會(ACM)的研究員,他為數據挖掘的基礎、方法和應用做出貢獻,并作為電氣與電子工程師協會(IEEE)的研究員,為他的數據挖掘和知識發現做出貢獻。
異常檢測是一個在各個研究領域和應用領域內得到廣泛研究的重要問題。本研究的目的有兩個方面:首先,我們對基于深度學習的異常檢測的研究方法進行了系統全面的綜述。此外,我們還回顧了這些方法對不同應用領域異常的應用,并評估了它們的有效性。我們根據所采用的基本假設和方法,將最先進的研究技術分為不同的類別。在每一類中,我們概述了基本的異常檢測技術,以及它的變體,并給出了關鍵的假設,以區分正常行為和異常行為。對于我們介紹的每一類技術,我們還介紹了它們的優點和局限性,并討論了這些技術在實際應用領域中的計算復雜性。最后,我們概述了研究中的未決問題和采用這些技術時所面臨的挑戰。
在過去的幾年里,自然語言處理領域由于深度學習模型的大量使用而得到了發展。這份綜述提供了一個NLP領域的簡要介紹和一個快速的深度學習架構和方法的概述。然后,篩選了大量最近的研究論文,并總結了大量相關的貢獻。NLP研究領域除了計算語言學的一些應用外,還包括幾個核心的語言處理問題。然后討論了目前的技術水平,并對該領域今后的研究提出了建議。
題目: A Survey and Critique of Multiagent Deep Reinforcement Learning
簡介: 近年來,深度強化學習(RL)取得了出色的成績。這使得應用程序和方法的數量急劇增加。最近的工作探索了單智能體深度強化之外的學習,并考慮了多智能體深度強化學習的場景。初步結果顯示在復雜的多智能體領域中的成功,盡管有許多挑戰需要解決。本文的主要目的是提供有關當前多智能體深度強化學習(MDRL)文獻的概述。此外,我們通過更廣泛的分析對概述進行補充:(i)我們回顧了以前RL中介紹的基礎內容,并強調了它們如何適應多智能深度強化學習設置。 (ii)我們為該領域的新開業者提供一般指導:描述從MDRL工作中汲取的經驗教訓,指出最新的基準并概述研究途徑。 (iii)我們提出了MDRL的實際挑戰(例如,實施和計算需求)。
作者介紹: Pablo Hernandez-Leal,Borealis AI的研究員,在此之前,曾與Michael Kaisers一起參與過阿姆斯特丹CWI的智能和自治系統。研究方向:單智能體環境開發的算法以及多智能體。計劃開發一種算法,該算法使用博弈論,貝葉斯推理和強化學習中的模型和概念在戰略交互中得到使用。