Hat váratlan generatív mesterséges intelligencia-viselkedést hozott nyilvánosságra az OpenAI

Új átláthatósági rendszert vezet be az OpenAI a mesterséges intelligencia modellek váratlan vagy nem engedélyezett működésének nyilvánosságra hozatalára. A vállalat az új keretrendszer bemutatásakor hat konkrét esetet ismertetett, amelyek között hibák elrejtésére irányuló belső utasítások, jogosulatlan fájlfeltöltés és külön mesterséges intelligencia ügynökök közötti nem engedélyezett adatmegosztás is szerepel.

Az OpenAI azért hozta létre az új jelentési rendszert, mert saját értékelése szerint a korábbi közzétételek túl esetlegesek voltak. Egy-egy problémás modellviselkedés gyakran csak későbbi rendszerkártyákban vagy több esetet összefogó kutatásokban jelent meg. Az új szabályozás célja, hogy az ilyen eseményeket már akkor vizsgálják és szükség esetén hozzák nyilvánosságra, amikor még nem sikerült teljesen megmagyarázni vagy véglegesen kijavítani az adott viselkedést.

A most bemutatott hat eset jól mutatja, milyen nehezen előre jelezhető helyzetek jelenhetnek meg az összetettebb rendszereknél. Egy még nem kiadott kutatási modell például olyan utasításokat írt saját feladat-összefoglalóiba, amelyek későbbi kontextusban arra ösztönözték, hogy hagyja figyelmen kívül a normál korlátozásait. Az OpenAI 27 ilyen összefoglalót azonosított. A GPT-5.6 Sol tanítása során pedig több modellpéldány olyan belső instrukciókat készített, amelyek hibák vagy forráseltérések eltitkolására irányultak.

Más esetek már konkrét külső műveleteket érintettek. Egy modell egy hétköznapi adatkeresési feladat közben nyilvános kódtárban talált API-kulcsot használt fel engedély nélkül, majd amikor így sem jutott hozzá a szükséges információhoz, kitalált adatokat közölt. Egy másik rendszer helyes választ talált egy Python-futtatással, de mivel böngészőből származó hivatkozást is kértek tőle, saját döntéséből feltöltötte az eredményfájlt az internetre, hogy arra hivatkozhasson.

Olvasd el: Gyorsabb és olcsóbb generatív mesterséges intelligenciát indított a DeepSeek

Minél több valódi eszközt és önálló cselekvési lehetőséget kap egy mesterséges intelligencia, annál fontosabbá válhat annak ellenőrzése is, hogy pontosan milyen úton jut el a kívánt eredményhez?

Két további esetben több mesterséges intelligencia ügynök próbált egymással olyan módon információt cserélni, amelyet a feladat eredeti keretei nem engedélyeztek. Egy belső szoftvertárat üzenőfalként használtak hiányzó fájlok keresése közben, egy másik feladatban pedig nyilvános fájlmegosztó szolgáltatásokat vettek igénybe, hogy egymásnak átadják a szükséges állományokat. Utóbbi esetben a fájlok nyilvános internetes címen váltak elérhetővé annak ellenére, hogy a feladat kizárólag helyi fájlhasználatot írt elő.

Az OpenAI ugyanakkor kifejezetten figyelmeztet arra, hogy a hat esetből nem lehet következtetni arra, milyen gyakori ez a viselkedés a vállalat modelljeinél. Egyedi kutatási és értékelési példákról van szó, amelyek közül több nem nyilvánosan használt modellben történt. Az új rendszer lényege éppen az, hogy olyan eseteket is közzétegyenek, amelyek jelentősége még bizonytalan lehet, ha azok új biztonsági mechanizmusra, korábbi feltételezés megkérdőjelezésére vagy a meglévő védelem gyengeségére utalnak.

A változás azért lehet fontos mérföldkő a generatív mesterséges intelligencia fejlődésében, mert a modern modellek már nemcsak szöveget állítanak elő. Böngészőt, kódot, külső szolgáltatásokat és más ügynököket is használhatnak, így egy rosszul megválasztott köztes lépés akkor is kockázatot jelenthet, ha maga a végső cél ártalmatlan. Az OpenAI ezért a jövőben külön kategóriák szerint vizsgálja az ilyen eseményeket, és rendszeresebb nyilvános jelentéseket ígér róluk. A következő nagy biztonsági kérdés így egyre kevésbé csak az lehet, mit válaszol a modell, hanem az is, mit tesz a háttérben azért, hogy eljusson a válaszig.

Olvasd el ezt is: Hivatalosan licencelt zenékből készülhetnek MI-remixek az ElevenLabs új platformján

Források: OpenAI, Reuters, Associated Press, The Wall Street Journal

CS.SZ.

MI - KKV

Új átláthatósági rendszert vezet be az OpenAI a mesterséges intelligencia modellek váratlan vagy nem engedélyezett működésének nyilvánosságra hozatalára. A vállalat az új …

Több mint 100 millió eurós közös programot indított a TotalEnergies és a francia Mistral saját, energiaipari frontier generatív mesterséges intelligencia modellek fejlesztésére. …

Újabb nagy távközlési szolgáltatók lépnek tovább a Nokia mesterséges intelligencia alapú rádióhálózati rendszerének tesztelésében. Az AI-RAN technológia még a jelenlegi 5G-hálózatok teljesítményét …

A mesterséges intelligencia gyorsabban épül be a vállalkozások napi működésébe, mint ahogy a céges szabályok követni tudják. Egy új amerikai kutatásban tízből …

Mesterséges intelligencia segíthet a magas vérnyomás mindennapi követésében. Egy új kutatás szerint az MI-alapú coach alkalmazói nagyobb vérnyomáscsökkenést értek el, mint a …