復旦年夜學與baidu互助發布了名為 Hallo 的人臉視頻天生模子,并于公然的學術論文 Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation 中對于該模子舉行了具體論述。這一模子是首個基在擴散技能實現端到端天生高度傳神人臉視頻的開源項目。用戶只需提供一段音頻及所選人像,便可輕松建造出具備極高真實感的人臉視頻。這一技能的推出代表著數字人相干的視頻天生范疇的主要進展。 項目主頁:https://fudan-generative-vision.github.io/hallo/ 論文鏈接:https://arxiv.org/abs/2406.08801 GitHub鏈接:https://github.com/fudan-generative-vision/hall 端到端人臉視頻天生方案 于已往的技能成長歷程中,因為缺少有用的聲音到視頻天生方案,人臉視頻合成凡是需要依靠參數化模子作為中間前言。騰訊、螞蟻金服、微軟等公司推出的Sadtalker、AniPortrait、GAIA等技能要領即是這一起徑的典型代表。然而,這些要領經常受制在參數化模子于心情及動作表達能力上的限定,以和聲音與動作之間的弱相干性,致使天生的視頻于真實感及聯貫性方面存于不足。近來,一些端到真個人臉視頻天生方案逐漸呈現,防止了中間暗示情勢的局限性。這些方案使用擴散模子強盛的天生能力,可以直接天生高度傳神、高度聯貫的視頻。然而,這種方案中的音頻及視覺特性凡是經由過程全局交織留意力模塊舉行直接交互,缺少對于唇部及動作的邃密約束,致使天生視頻的口型精度不如依靠參數化模子的解決方案,且動作天生能力較差,需要分外輸入動作舉行驅動。這次,復旦與baidu推出的直接從聲音驅動天生視頻的端到端模子,無需繁雜的參數化中間暗示及分外的動作輸入,便可天生口型、心情、動作極為天然富厚的人臉視頻。這一立異依靠在如下幾個要害方面: 1.分層音畫特性交融 于音畫交織留意力歷程中,因為人臉的嘴唇、臉部心情、人頭姿式對于語音的運動相應方式其實不不異,Hallo的研究職員采用了分層交織留意力操作,針對于差別區域別離提取掩碼特性。經由過程他們提出的輔助交織留意力模塊與音頻特性交融,從而進修到差別區域的運動特性。詳細來講,研究職員利用了嘴唇、臉部及頭部的掩碼(以下圖左圖所示),讓音頻別離對于口型、心情及姿式舉行指導天生。隨后,經由過程一個自順應機制將這三個部門交融于一路,無需分外參數化暗示及動作驅動,便可直接天生心情及動作天然活潑的人臉動畫視頻。顛末對于留意力求的闡發,研究職員發明,音頻特性與差別區域視覺特性別離交互,顯著提高了留意力模塊對于臉部信息的捕獲能力。模子的留意力可視化效果也出現出越發聚焦在臉部區域的特色,從而可以或許顯著晉升口型、心情及動作的真實度。這一要領的總體精度逾越了其他現有要領。 2.差別人臉特性的節制能力 于Hallo體系中的分層音頻-視覺留意力機制具備將音頻特性與圖象的差別區域舉行交融對于齊的能力,從而晉升口型、心情及姿式的精準度及天然度,并提供了全局運動的可控性。經由過程調解各區域的權重,可以實現對于差別區域視頻運動的切確節制。此外,Hallo采用專門的人臉編碼模子來替換傳統的圖象-語義預練習模子(如CLIP)。人臉編碼模子的重要目的是天生高度保真的肖像身份特性。與以往經由過程于年夜型圖象及文本描寫數據集長進行結合練習CLIP以得到通用視覺特性編碼的要領差別,Hallo利用預先練習的人臉編碼器來提取身份特性。這些特性與擴散收集的交織留意力模塊舉行交互,天生與輸入腳色特性忠厚一致的肖像動畫。這一要領不僅確保了人臉特性提取的泛化能力,還有正確地保留及揭示了小我私家身份特性,例如臉部心情、春秋及性別。 3.年夜范圍數字人視頻數據集 于練習中,Hallo體系使用了年夜量高質量的數字人視頻數據。只管互聯網上存于年夜量的數字人視頻數據,但這些數據質量亂七八糟,存于諸如音畫不匹配、配景雜音、視頻抖動等各類問題的數據噪聲。為相識決這一問題,研發團隊構建了一套主動化數字人視頻洗濯引擎。截至今朝,這一引擎已經樂成洗濯了數千小時的高質量數字人視頻,涵蓋了上萬個信息脫敏的數字人肖像。這項事情使患上年夜范圍數據練習數字人視頻天生模子成為可能。 Hallo實踐效果 高質量人臉動畫天生:于真人數據集上,Hallo展示出了高度一致的口型,并可以或許表現出音頻的富厚細節,如情緒及發言節拍。 多類型人像氣勢派頭撐持:只管Hallo僅于真人視頻數據集長進行練習,但體現出了極強的泛化性,包括卡通、素描、雕塑等各種氣勢派頭,這患上益在原始擴散模子于超年夜范圍圖象數據集上的練習。 全局運動可控性:Hallo的另外一個主要特色是全局可控性。相較在以往要領中需要借助參數化模子節制人臉運動強度,Hallo使用分層臉部特性留意力機制,經由過程調解三個區域的權重系數,能針對于性地節制口型、心情及動作的運動強度,從而年夜幅晉升人臉動畫天生的可控性。 影視建造的潛于運用:除了此以外,Hallo展示了于影視建造范疇的巨年夜潛力。經由過程僅有一段影戲對于白及一個虛擬腳色,可讓虛擬腳色活潑演繹經典影戲場景。 運用遠景 Hallo的發布為多個行業帶來了廣泛的運用遠景。于文娛財產方面,AI驅動的腳色動畫技能具備廣泛的運用潛力,可于影戲、電視劇及短視頻建造中闡揚主要作用。經由過程應用這項技能,建造團隊可以提高建造效率,實現更高質量的動畫效果,并終極實現成本的降低。這類技能的應用將為文娛財產帶來更多的創意空間及貿易時機。此外,于游戲及虛擬實際范疇,AI天生的腳色動畫為用戶提供越發沉浸式的體驗。經由過程引入AI腳色,游戲及虛擬實際運用可以出現重生動、真正的虛擬世界,加強用戶的沉浸感及介入感。這將為游戲財產及虛擬實際技能帶來新的成長機緣,鞭策這些范疇的立異及前進。 于教誨范疇,AI數字人對于在弱勢人群的講授具備極為主要的意義。經由過程整合AI腳色到講授視頻及勾當中,可以為這一群體設計更具包涵性及可拜候性的講授要領。AI數字人能經由過程多感官交互—如視覺、聽覺及觸覺—增長進修的直不雅性及互動性。這不僅可以或許吸引學生的留意力,還有可以或許幫忙他們更好地輿解抽象觀點及繁雜信息,從而提高進修的有用性。此外,AI數字人可以模仿悉心的西席腳色,提供連續的鼓動勉勵及撐持,幫忙學生于碰到挑戰時連結踴躍及自傲。經由過程這類方式,高質量AI數字人的運用不僅可以或許提供更切合弱勢人群需求的教誨內容,還有可以或許幫忙他們提高社交技術及糊口自理能力,從而更好地融入社會,提高糊口質量。這類教誨方式的推廣及運用,有望為弱勢群體打開新的進修年夜門,為他們帶來更多的進修時機及社會介入可能。 將來瞻望 跟著人工智能圖形計較(AIGC)技能的飛速前進,AI驅動的腳色動畫將揭示越發傳神天然的體現。將來,復旦及baidu的研究團隊將連續優化模子機能,晉升動畫天生質量,并擴大更廣泛的運用范疇。經由過程與社區合作無懈及開源同享,Hallo有望于多個財產范疇闡揚作用,為國度人工智能技能的成長及推廣孝敬氣力。





