Két új élő párbeszédre tervezett generatív mesterséges intelligencia modellt mutatott be a Google. A Gemini 3.8 Live valós időben dolgozhat hanggal és vizuális információkkal, miközben a beszélgetés megszakítása nélkül eszközöket és külső szolgáltatásokat is használhat, az Extended Thinking változat pedig összetettebb, több lépésből álló feladatokra készült.
A Google két eltérő felhasználási területre optimalizálta az új modelleket. A Gemini 3.8 Live célja a gyors, természetes és nagy léptékben is gazdaságosan működtethető hangalapú kommunikáció, míg a Gemini 3.8 Live Extended Thinking nagyobb számítási igényű, összetettebb problémák megoldására és több lépésből álló feladatok végrehajtására készült. Mindkét modell a Gemini 3 Pro technológiai alapjaira épül, és hangot, képet, videót, valamint szöveget is képes bemenetként kezelni.
Az egyik legérdekesebb változás, hogy a beszélgetésnek már nem feltétlenül kell megállnia, miközben a mesterséges intelligencia egy feladat végrehajtására vár. A Gemini 3.8 Live a háttérben eszközöket használhat és API-hívásokat indíthat, miközben tovább folytatja a párbeszédet. Közel valós időben értelmezheti a kameraképet is, valamint automatikusan felismerheti és válthatja a beszélgetés nyelvét a 97 támogatott nyelv között.
A Google által közölt mérések szerint az Extended Thinking változat 82,6 pontos eredménnyel az első helyre került az Artificial Analysis Speech-to-Speech Quality Indexén, az ügynöki hangfeladatokat vizsgáló τ-Voice teszten pedig 68,6 százalékot ért el. A Sierra banki hangügynök-benchmarkján 35,1, a Big Bench Audio következtetési teszten 97,7 százalékos eredményt közölt a vállalat. Ezek különböző benchmarkok eredményei, ezért nem jelentik azt, hogy a modell minden valós feladatban automatikusan jobb valamennyi versenytársánál.
Olvasd el: Gyorsabb és olcsóbb generatív mesterséges intelligenciát indított a DeepSeek

Lehet, hogy a hangalapú mesterséges intelligencia valódi áttörése nem az lesz, amikor természetesebben beszél, hanem amikor a beszélgetés közben már tényleges munkát is képes elvégezni?
Az Extended Thinking működése ezt az irányt viszi tovább. A modell a Google szerint a gondolkodást és a beszédet részben párhuzamosan képes kezelni: jelezheti a felhasználónak, hogy dolgozik a feladaton, majd szóban ismertetheti a több lépésből álló folyamat előrehaladását. A bemutatott példák között szerepel kézzel rajzolt vázlatból működő React-komponens létrehozása, összetett foglalási folyamat végrehajtása és teljes üzleti terv vagy marketingeszköztár összeállítása természetes hangutasítások alapján.
A modellek fejlesztők számára a Gemini API-n és a Google AI Studión keresztül érhetők el, miközben a Google saját szolgáltatásaiba is fokozatosan bekerülnek. A Gemini 3.8 Live a Search Live rendszerében, az Extended Thinking pedig többek között a Gemini Live-ban és egyes Workspace-szolgáltatásokban jelenik meg. A Google minden generált hangba SynthID vízjelet épít, a hivatalos modellkártya pedig azt is egyértelműen rögzíti, hogy a rendszer továbbra is hallucinálhat, illetve esetenként lassulás vagy időtúllépés is előfordulhat.
A Gemini 3.8 Live jelentősége ezért túlmutat azon, hogy a mesterséges intelligencia emberibb hangon tud beszélni. Az új irányban a hang kezd teljes értékű kezelőfelületté válni: a felhasználó beszélhet, mutathat valamit a kamerának, megszakíthatja a rendszert, új információt adhat hozzá, miközben a háttérben különböző digitális műveletek futnak. Ha ez megfelelő megbízhatósággal működik, a következő generációs mesterséges intelligencia asszisztenseket egyre kevésbé kell majd külön alkalmazásként kezelni, és egyre inkább folyamatosan elérhető digitális munkatársként működhetnek.
Olvasd el ezt is: Szövegből, képből és videóból is zenét készít a Suno új generatív mesterséges intelligenciája
Források: Google, Google DeepMind, ITmedia NEWS
CS.SZ.


