Sikerült megkerülni két kínai mesterségesintelligencia-modell biztonsági korlátait, amelyek ezt követően veszélyes témákról is válaszoltak a kérdezőknek. A Mindgard szerint a Kimi K2.6 és K3 Swarm esetében a jailbreakelés komoly biztonsági kérdéseket vet fel. A fejlesztő Moonshot vizsgálja a problémát.
Kutatók szerint két kínai mesterségesintelligencia-modell biztonsági korlátait is sikerült megkerülniük úgynevezett jailbreak technikákkal egy tesztelés során.
A Moonshot által fejlesztett Kimi K2.6 és K3 Swarm olyan témákról is hajlandó volt információt adni, amelyeket a fejlesztők eredetileg korlátoztak.
Megkerülték az MI biztonsági korlátait
A problémát a brit MI-biztonsági vállalat, a Mindgard fedezte fel. A szakemberek júliusban vizsgálták a Kimi modelleket, s kiderült, hogy megfelelően összeállított utasításokkal rá lehet venni őket a fejlesztők által beépített védelmi mechanizmusok megkerülésére.
A módszert jailbreakingnek nevezik. Ennek lényege, hogy speciálisan kialakított utasításokkal próbálják rávenni az MI-t arra, hogy figyelmen kívül hagyja azokat a szabályokat, amelyek bizonyos veszélyes kérések teljesítését megakadályozzák.
A modellek veszélyes témákban is válaszoltak
A Mindgard szerint a tesztelt Kimi-modellek a korlátozások megkerülése után többek között biológiai fegyverekkel, kártékony szoftverekkel, robbanóanyagokkal, terrorizmussal, célzott erőszakkal és merényletek tervezésével kapcsolatos témákban is részletes válaszokat adtak.
Olvasd el: Emberi parancs nélkül támadhat egy új mesterséges intelligencia alapú vírus

A kutatók ugyanakkor hangsúlyozták, hogy nem bizonyították: a modellek által generált információk a valóságban működőképesek lennének. A jailbreak technikai részleteit sem tették közzé, így annak reprodukálhatóságát sem mutatták be nyilvánosan.
Peter Garraghan, a Mindgard alapítója szerint a probléma ennél is aggasztóbb lehet.
„Ha a jailbreak működik, bármilyen témáról beszélni fog, sőt szabadon ajánlásokat is tesz más, szintén káros témákra. Találékony és kreatív lesz” – mondta a BBC-nek.
A fejlesztő vizsgálatot indított
A Mindgard július 27-én értesítette a Moonshotot a felfedezett problémáról, majd szeptember 12-én nyilvánosságra hozta az eredményeit.
A kínai vállalat közölte: kapcsolatban áll a kutatókkal és vizsgálja a megállapításokat. A Moonshot a BBC-nek azt mondta, üdvözli a külső szakértők visszajelzéseit, mert ezek fontos szerepet játszanak a jobb és biztonságosabb MI-rendszerek fejlesztésében.
A vállalat ugyanakkor arra is felhívta a figyelmet, hogy saját belső tesztjeik alapján ezeknél a kéréseknél általában magas az elutasítási arány.
Az open-weight modellek újabb kockázata
A Kimi-modellek úgynevezett open-weight rendszerek. Ez azt jelenti, hogy a modell súlyai hozzáférhetők, így megfelelő számítási infrastruktúrán a fejlesztőtől függetlenül is futtathatók.
Ez előnyökkel járhat, hiszen a nyíltabb modellek kutatási és fejlesztési célokra könnyebben vizsgálhatók. Ugyanakkor a biztonsági szakemberek szerint problémát jelenthet, ha a korlátozások megkerülésére alkalmas modellek rossz kezekbe kerülnek.
Alan Woodward, a Surrey Egyetem professzora szerint az open modellek valóban kockázatot jelenthetnek, ha illetéktelenek használják őket, ugyanakkor a kiberbiztonság terén is értékes eszközök lehetnek.
A szakértő arra is figyelmeztetett, hogy a nemzetközi szabályozás valószínűleg nem tud lépést tartani az MI gyors fejlődésével. „Évtizedekbe telt, mire megállapodtunk a telefonszámok formátumában” – emlékeztetett.
Nem csupán a kínai modellek jelenthetnek problémát
A Kimi-eset egy szélesebb folyamatba illeszkedik. Az elmúlt időszakban más nagy mesterséges intelligencia-fejlesztők rendszereivel kapcsolatban is felmerült, hogy a biztonsági korlátok megkerülhetők.
Az Anthropic például arról számolt be, hogy fenyegetésfelderítő csapata olyan műveleteket azonosított, amelyekben emberek a Claude-modelleket próbálták káros célokra felhasználni.
Az OpenAI pedig egy különálló biztonsági vizsgálat során olyan autonóm MI-ügynököket azonosított, amelyek képesek voltak megkerülni bizonyos, internetelérést korlátozó ellenőrzéseket.
A Kimi-modellek esete így elsősorban nem azt bizonyítja, hogy a kínai mesterséges intelligencia veszélyesebb lenne más rendszereknél, hanem azt mutatja meg, hogy a fejlett MI-modellek biztonsági korlátainak kijátszása továbbra is komoly kihívást jelent.
Olvasd el ezt is: Kimondták – adathiány hátráltathatja a humanoid robotok fejlesztését
Forrás: FemaleFirst
B.A.


