Pontosabban követheti az utasításokat a generatív mesterséges intelligencia a Google új módszerével

Új módszert mutatott be szeptember végén a Google Research a képgeneráló mesterséges intelligencia pontosabb vezérlésére. A Diffusion Controller különösen azért érdekes, mert egy viszonylag kis kiegészítő hálózat segítségével úgy terelheti a képgenerálást a felhasználó utasítása felé, hogy közben nem szükséges teljesen újratanítani az alapmodellt.

A mai képgenerátorok egyik visszatérő problémája, hogy egy modell képes lehet rendkívül élethű képet készíteni, mégsem követi pontosan a prompt minden részletét. Ha viszont túl erősen próbálják rákényszeríteni egy adott tulajdonság megjelenítésére, romolhat a kép természetessége vagy más részletek torzulhatnak. A Google példája szerint egy modell létrehozhat valósághű gyíkot, de kihagyhatja az utasításban szereplő napszemüveget, míg erősebb vezérlésnél akár az állat arca is természetellenesen megváltozhat.

A Diffusion Controller ezt a problémát úgy kezeli, hogy a generálás során folyamatosan apró korrekciókat ad a modellhez. A kutatók ezt egyfajta kormányzásként írják le: az alapmodell megtartja a már megtanult vizuális tudását, egy kisebb vezérlőhálózat pedig a kép kialakulása közben módosítja a generálási útvonalat annak érdekében, hogy az eredmény jobban megfeleljen a kívánt célnak.

A kutatók Stable Diffusion v1.4 alapon, három különböző tanítási módszerrel vizsgálták az eljárást. Az eredményeket a HPS-v2 emberi preferenciákat modellező teszten mérték. A teljes hozzáférésű, úgynevezett white-box konfiguráció egyik tesztjében a Diffusion Controller 90 százalékos győzelmi arányt ért el a kiinduló modellhez képest. Ez nem azt jelenti, hogy a rendszer általánosságban 90 százalékkal jobb képeket készít: egy meghatározott tesztben mért preferenciaarányról van szó.

Olvasd el: A telefonra költöztette generatív videós eszközeit az Adobe

Lehet, hogy a következő nagy ugrást a generatív mesterséges intelligencia képkészítésében már nem a még nagyobb modellek, hanem azok pontosabb irányíthatósága hozza el?

A módszer másik érdekes tulajdonsága, hogy a kutatók korlátozott hozzáférésű, úgynevezett gray-box környezetre is kidolgoztak változatot. Ebben nem szükséges az alapmodell valamennyi belső paraméterét átírni. A Google tesztjeiben ez a változat kevesebb belső réteg módosítása mellett is felülmúlta a LoRA-hoz használt összehasonlító megoldást a vizsgált HPS-v2 mérésekben. Ez elvileg olyan helyzetekben is értékes lehet, amikor egy fejlesztő nem rendelkezik teljes hozzáféréssel az alapmodellhez.

Az eredményeknél ugyanakkor fontosak a korlátok. A kísérleteket Stable Diffusion v1.4-re építve végezték, ezért a kutatás nem bizonyítja, hogy ugyanilyen eredményeket kapnának minden jelenlegi képgenerátornál. A Google olyan újabb rendszereket is említ a technológiai környezet bemutatásakor, mint a Nano Banana vagy a Flux, de a közölt 90 százalékos eredmény nem ezek teljesítményére vonatkozik. A Diffusion Controller egy kutatási keretrendszer, nem egy már minden felhasználó számára elérhető Google-termék.

A fejlesztés azért lehet mégis fontos, mert a generatív mesterséges intelligencia fejlődésében egyre nagyobb érték lehet a kiszámíthatóság. Egy látványos kép önmagában kevés egy grafikusnak, reklámkészítőnek vagy vállalati felhasználónak, ha a rendszer rendszeresen figyelmen kívül hagyja a pontos utasításokat. Ha a generálás finomabban vezérelhető anélkül, hogy minden feladathoz teljes modellt kellene újratanítani, a képgenerátorok a látványos kísérletekből megbízhatóbb professzionális eszközökké válhatnak.

Olvasd el ezt is: A Xiaomi új modellje az élre ugrott a nyílt súlyú mesterséges intelligenciák között

Források: Google Research, ICML 2026

CS.SZ.

MI - KKV

Új módszert mutatott be szeptember végén a Google Research a képgeneráló mesterséges intelligencia pontosabb vezérlésére. A Diffusion Controller különösen azért érdekes, mert …

Olyan rejtett jelölési módszert fejlesztett a Google DeepMind, amely a mesterséges intelligencia által tervezett fehérjék aminosav-szekvenciájába építhető be úgy, hogy közben megmaradjon …

Körülbelül négymillió, 500 főnél kevesebbet foglalkoztató vállalkozásnál dolgozó ember használta az OpenAI eszközeit világszerte egyetlen szeptemberi hét alatt a vállalat új elemzése …

Akár három évvel a diagnózis előtt felismerheti a hasnyálmirigyrák fokozott kockázatát egy új mesterséges intelligencia. A Mayo Klinika kutatói több mint 39 …

8,2 milliárd dolláros megállapodással vásárolná fel az AMD a Fei-Fei Li által vezetett World Labs mesterséges intelligencia kutatólabort. A szeptember végén bejelentett …