Egyetlen képből is valós időben beszélő és mozgó avatárt készíthet a Meta új mesterséges intelligenciája. A Muse Realtime Avatar a beszédhez igazítja az arc, a kéz és akár az egész test mozgását, miközben 25 képkockás másodpercenkénti sebességgel képes videót streamelni.
Egyetlen állóképből vagy akár egy illusztrációból is valós időben mozgó, beszélő karaktert készíthet a Meta új mesterséges intelligenciája. A Muse Realtime Avatar nemcsak az arc mozgását képes a beszédhez igazítani, hanem a kezek és az egész test mozdulatait is megjelenítheti.
Egy képből beszélő avatárt készít
A Meta bemutatta a Muse Realtime Avatar technológiát, amely a Muse Realtime Voice mesterséges intelligenciáját kapcsolja össze egy valós időben generált vizuális megjelenéssel.
A rendszerhez elegendő lehet egy referenciafotó vagy illusztráció. A mesterséges intelligencia ezután életre keltheti a karaktert, amely a beszélgetés közben mozgatja az arcát, a kezét, illetve akár a teljes testét is.
Ráadásul, nemcsak emberek, állatok vagy hétköznapi tárgyak is kaphatnak kifejező, beszélő megjelenést.
A beszédhez igazítja a mozgást
A technológia egyik fontos újdonsága, hogy a hang és a videó összehangoltan készül. A Muse Realtime Voice előállítja a beszédet, az Avatar pedig ugyanezekből az információkból generálja hozzá a megfelelő vizuális mozgást.

Ennek köszönhetően az ajakmozgás, az arckifejezések és a gesztusok összhangban lehetnek azzal, amit a mesterséges intelligencia éppen mond.
A rendszer a beszélgetés előrehaladtával megőrzi a karakter megjelenését és mozgásának jellegzetességeit is.
Másodpercenként 25 képkockát képes létrehozni
A Meta szerint a Muse Realtime Avatar 448×768 pixeles portrévideót 25 képkocka/másodperces sebességgel képes streamelni.
A késleltetés körülbelül 870 milliszekundum, vagyis a felhasználó a beszéd után kevesebb mint egy másodpercen belül megkaphatja a szinkronizált hang- és videoválaszt.
A Meta fejlesztéseit úgy optimalizálták, hogy a rendszer egyszerre több valós idejű beszélgetést is képes legyen kiszolgálni.
Nemcsak egy arcot tud megmozgatni
A Muse Realtime Avatar egyik érdekessége, hogy nem kizárólag beszélő fejek létrehozására használható.
Egy teljes alakos rajzolt karakter például beszéd közben megváltoztathatja a testtartását és gesztikulálhat, miközben a rendszer igyekszik megőrizni a karakter eredeti megjelenését.
A Meta ezzel a mesterséges intelligencia egy olyan irányát fejleszti tovább, amelyben az MI nem pusztán szöveges vagy hangalapú válaszokat ad, hanem valós időben látható, kifejező karakterként jelenik meg.
A Meta a biztonságra is figyel
A technológia által generált videók követhetősége érdekében a Meta Video Seal segítségével láthatatlan vízjelet helyezhet el a létrehozott tartalmakban.
A vállalat szerint erre azért van szükség, hogy a generatív videók eredete később is azonosítható legyen, miközben a vízjel nem növeli a valós idejű működés késleltetését.
A Muse Realtime Avatar így a generatív mesterséges intelligencia újabb területét mutatja meg: a jövőben nem feltétlenül egy statikus képernyőn megjelenő avatárral kommunikálhatunk, hanem olyan MI-karakterekkel, amelyek beszéd közben természetes mozdulatokkal reagálnak ránk.
Forrás: research.meta.ai
B.A.


