Nano Banana 2.1 néven új képgeneráló és képszerkesztő modellt adott ki a Google. A generatív mesterséges intelligencia akár 14 referenciafotót is egyetlen munkába kapcsolhat, pontosabban tarthatja meg a szereplők és tárgyak megjelenését, valamint 4K felbontásban és rendkívül széles panorámaformátumokban is képes képeket létrehozni.
A Google október 6-án tette hivatalosan elérhetővé a Nano Banana 2.1-et, amely a Gemini 3.6 Flash rendszerére épül, és a korábbi Nano Banana 2 továbbfejlesztett változata. A modell már stabil verzióként szerepel a Gemini API-ban, miközben a Google több saját felületére, köztük a Gemini alkalmazásba, az AI Mode-ba, az AI Studióba, a Flow-ba, a Stitch-be, a Google Adsbe és vállalati környezetbe is megkezdte a bevezetését.
Az egyik legfontosabb változás a több referencia együttes kezelése. A modell akár 14 képet is felhasználhat ugyanahhoz a generáláshoz: a Google dokumentációja szerint legfeljebb négy szereplő megjelenését és tíz különböző tárgy vizuális jellemzőit képes következetesen megtartani. Ez olyan munkáknál lehet fontos, ahol ugyanazokat az embereket, termékeket vagy márkaelemeket több eltérő jelenetben kell újra megjeleníteni.
A képminőség mellett a feliratok és az infografikák kezelése is javult. A Google saját modellkártyáján a gondolkodási módot használó Nano Banana 2.1 összesített képpreferencia-pontszáma 1050 lett, szemben a Nano Banana 2 990 és a Nano Banana Pro 935 pontos eredményével. Az infografikák tényszerűségét mérő tesztben 0,521-es eredményt közöltek, míg az előd 0,179-et ért el. Ezek a Google saját értékelései, ezért nem jelentik azt, hogy minden független összehasonlításban ugyanez lesz a modellek sorrendje.
Olvasd el: Saját fotónkra adja rá a kiválasztott ruhát a generatív mesterséges intelligencia a ChatGPT-ben

Mennyire változik meg a képgenerálás, ha már nem kell minden új jelenetnél újra elmagyarázni a szereplők, termékek és márkaelemek pontos megjelenését?
A Nano Banana 2.1 az eddigieknél szélesebb képarányokkal is dolgozik. Az 1K, 2K és 4K felbontás mellett 1:4, 4:1, 1:8 és 8:1 arányú széles vagy magas képek készíthetők, miközben a Google szerint kijavították a korábban bizonyos panorámaképeknél jelentkező ismétlődő mintázatokat. A modell Google Web- és képkereséssel is összekapcsolható, így bizonyos feladatoknál aktuális vizuális információkat is felhasználhat a generáláshoz.
A javulás ugyanakkor nem jelenti azt, hogy minden generált kép tényszerű vagy hibátlan lesz. A Google saját infografika-tesztjének 0,521-es eredménye is azt mutatja, hogy még jelentős hibalehetőség marad, különösen olyan képeknél, amelyek pontos adatokat, feliratokat vagy összetett vizuális információt tartalmaznak. Marketinganyag, termékábrázolás vagy tájékoztató grafika publikálása előtt ezért továbbra is szükség van emberi ellenőrzésre.
A Nano Banana 2.1 legfontosabb előrelépése így nem pusztán a szebb képekben keresendő. A generatív mesterséges intelligencia egyre jobban képes hosszabb kreatív munkafolyamatokon keresztül megtartani ugyanazokat a vizuális elemeket, több referenciából dolgozni és pontos szerkesztési utasításokat végrehajtani. Ez közelebb viszi a képgenerálást ahhoz, hogy egyszeri látványos képek helyett teljes, következetes kampányok és vizuális sorozatok készítésének eszközévé váljon.
Olvasd el ezt is: A telefonra költöztette generatív videós eszközeit az Adobe
Források: Google DeepMind, Google AI for Developers, Android Authority
CS.SZ.


