Már élő videóban is beszélgethet az új mesterséges intelligencia – a Meta mozgó avatárja

Egyetlen képből is valós időben beszélő és mozgó avatárt készíthet a Meta új mesterséges intelligenciája. A Muse Realtime Avatar a beszédhez igazítja az arc, a kéz és akár az egész test mozgását, miközben 25 képkockás másodpercenkénti sebességgel képes videót streamelni.

Egyetlen állóképből vagy akár egy illusztrációból is valós időben mozgó, beszélő karaktert készíthet a Meta új mesterséges intelligenciája. A Muse Realtime Avatar nemcsak az arc mozgását képes a beszédhez igazítani, hanem a kezek és az egész test mozdulatait is megjelenítheti.

Egy képből beszélő avatárt készít

A Meta bemutatta a Muse Realtime Avatar technológiát, amely a Muse Realtime Voice mesterséges intelligenciáját kapcsolja össze egy valós időben generált vizuális megjelenéssel.

A rendszerhez elegendő lehet egy referenciafotó vagy illusztráció. A mesterséges intelligencia ezután életre keltheti a karaktert, amely a beszélgetés közben mozgatja az arcát, a kezét, illetve akár a teljes testét is.

Ráadásul, nemcsak emberek, állatok vagy hétköznapi tárgyak is kaphatnak kifejező, beszélő megjelenést.

A beszédhez igazítja a mozgást

A technológia egyik fontos újdonsága, hogy a hang és a videó összehangoltan készül. A Muse Realtime Voice előállítja a beszédet, az Avatar pedig ugyanezekből az információkból generálja hozzá a megfelelő vizuális mozgást.

Olvasd el: Hosszabb és összetettebb feladatokra készült a Meta új generatív mesterséges intelligencia modellje

Már élő videóban is beszélgethet az új mesterséges intelligencia – Fotó: research.meta.ai

Ennek köszönhetően az ajakmozgás, az arckifejezések és a gesztusok összhangban lehetnek azzal, amit a mesterséges intelligencia éppen mond.

A rendszer a beszélgetés előrehaladtával megőrzi a karakter megjelenését és mozgásának jellegzetességeit is.

Másodpercenként 25 képkockát képes létrehozni

A Meta szerint a Muse Realtime Avatar 448×768 pixeles portrévideót 25 képkocka/másodperces sebességgel képes streamelni.

A késleltetés körülbelül 870 milliszekundum, vagyis a felhasználó a beszéd után kevesebb mint egy másodpercen belül megkaphatja a szinkronizált hang- és videoválaszt.

A Meta fejlesztéseit úgy optimalizálták, hogy a rendszer egyszerre több valós idejű beszélgetést is képes legyen kiszolgálni.

Nemcsak egy arcot tud megmozgatni

A Muse Realtime Avatar egyik érdekessége, hogy nem kizárólag beszélő fejek létrehozására használható.

Egy teljes alakos rajzolt karakter például beszéd közben megváltoztathatja a testtartását és gesztikulálhat, miközben a rendszer igyekszik megőrizni a karakter eredeti megjelenését.

A Meta ezzel a mesterséges intelligencia egy olyan irányát fejleszti tovább, amelyben az MI nem pusztán szöveges vagy hangalapú válaszokat ad, hanem valós időben látható, kifejező karakterként jelenik meg.

A Meta a biztonságra is figyel

A technológia által generált videók követhetősége érdekében a Meta Video Seal segítségével láthatatlan vízjelet helyezhet el a létrehozott tartalmakban.

A vállalat szerint erre azért van szükség, hogy a generatív videók eredete később is azonosítható legyen, miközben a vízjel nem növeli a valós idejű működés késleltetését.

A Muse Realtime Avatar így a generatív mesterséges intelligencia újabb területét mutatja meg: a jövőben nem feltétlenül egy statikus képernyőn megjelenő avatárral kommunikálhatunk, hanem olyan MI-karakterekkel, amelyek beszéd közben természetes mozdulatokkal reagálnak ránk.

Olvasd el ezt is: Már a vásárlást is végigviheti a Meta mesterséges intelligenciája a Shopify üzleteiben

Forrás: research.meta.ai

B.A.

MI - KKV

Már nem feltétlenül kell minden feladat előtt külön utasítást adni a ChatGPT-nek. Az OpenAI szeptember 29-én bemutatott Dots rendszere olyan folyamatosan működő …

Egyetlen képből is valós időben beszélő és mozgó avatárt készíthet a Meta új mesterséges intelligenciája. A Muse Realtime Avatar a beszédhez igazítja …

Kisvállalkozásoknak és tartalomkészítőknek kínál mesterséges intelligenciára épülő közösségimédia-menedzsert a Keze.ai. A platform trendeket keres, tartalomötleteket készít, majd publikálásra kész videókat, képes összeállításokat …

Mostanra alkalmas saját alkalmazások készítésére és hosszabb feladatokat is önállóan végezhet a Microsoft új Copilotja. A mesterséges intelligencia természetes nyelvű utasításokból építkezik, …

Már 20 másodpercnyi beszéd is elegendő lehet ahhoz, hogy a mesterséges intelligencia felismerje a 2-es típusú cukorbetegségre utaló jeleket. Az új technológia …