Új módszert mutatott be szeptember végén a Google Research a képgeneráló mesterséges intelligencia pontosabb vezérlésére. A Diffusion Controller különösen azért érdekes, mert egy viszonylag kis kiegészítő hálózat segítségével úgy terelheti a képgenerálást a felhasználó utasítása felé, hogy közben nem szükséges teljesen újratanítani az alapmodellt.
A mai képgenerátorok egyik visszatérő problémája, hogy egy modell képes lehet rendkívül élethű képet készíteni, mégsem követi pontosan a prompt minden részletét. Ha viszont túl erősen próbálják rákényszeríteni egy adott tulajdonság megjelenítésére, romolhat a kép természetessége vagy más részletek torzulhatnak. A Google példája szerint egy modell létrehozhat valósághű gyíkot, de kihagyhatja az utasításban szereplő napszemüveget, míg erősebb vezérlésnél akár az állat arca is természetellenesen megváltozhat.
A Diffusion Controller ezt a problémát úgy kezeli, hogy a generálás során folyamatosan apró korrekciókat ad a modellhez. A kutatók ezt egyfajta kormányzásként írják le: az alapmodell megtartja a már megtanult vizuális tudását, egy kisebb vezérlőhálózat pedig a kép kialakulása közben módosítja a generálási útvonalat annak érdekében, hogy az eredmény jobban megfeleljen a kívánt célnak.
A kutatók Stable Diffusion v1.4 alapon, három különböző tanítási módszerrel vizsgálták az eljárást. Az eredményeket a HPS-v2 emberi preferenciákat modellező teszten mérték. A teljes hozzáférésű, úgynevezett white-box konfiguráció egyik tesztjében a Diffusion Controller 90 százalékos győzelmi arányt ért el a kiinduló modellhez képest. Ez nem azt jelenti, hogy a rendszer általánosságban 90 százalékkal jobb képeket készít: egy meghatározott tesztben mért preferenciaarányról van szó.
Olvasd el: A telefonra költöztette generatív videós eszközeit az Adobe

Lehet, hogy a következő nagy ugrást a generatív mesterséges intelligencia képkészítésében már nem a még nagyobb modellek, hanem azok pontosabb irányíthatósága hozza el?
A módszer másik érdekes tulajdonsága, hogy a kutatók korlátozott hozzáférésű, úgynevezett gray-box környezetre is kidolgoztak változatot. Ebben nem szükséges az alapmodell valamennyi belső paraméterét átírni. A Google tesztjeiben ez a változat kevesebb belső réteg módosítása mellett is felülmúlta a LoRA-hoz használt összehasonlító megoldást a vizsgált HPS-v2 mérésekben. Ez elvileg olyan helyzetekben is értékes lehet, amikor egy fejlesztő nem rendelkezik teljes hozzáféréssel az alapmodellhez.
Az eredményeknél ugyanakkor fontosak a korlátok. A kísérleteket Stable Diffusion v1.4-re építve végezték, ezért a kutatás nem bizonyítja, hogy ugyanilyen eredményeket kapnának minden jelenlegi képgenerátornál. A Google olyan újabb rendszereket is említ a technológiai környezet bemutatásakor, mint a Nano Banana vagy a Flux, de a közölt 90 százalékos eredmény nem ezek teljesítményére vonatkozik. A Diffusion Controller egy kutatási keretrendszer, nem egy már minden felhasználó számára elérhető Google-termék.
A fejlesztés azért lehet mégis fontos, mert a generatív mesterséges intelligencia fejlődésében egyre nagyobb érték lehet a kiszámíthatóság. Egy látványos kép önmagában kevés egy grafikusnak, reklámkészítőnek vagy vállalati felhasználónak, ha a rendszer rendszeresen figyelmen kívül hagyja a pontos utasításokat. Ha a generálás finomabban vezérelhető anélkül, hogy minden feladathoz teljes modellt kellene újratanítani, a képgenerátorok a látványos kísérletekből megbízhatóbb professzionális eszközökké válhatnak.
Olvasd el ezt is: A Xiaomi új modellje az élre ugrott a nyílt súlyú mesterséges intelligenciák között
Források: Google Research, ICML 2026
CS.SZ.


