Megkerülték a kínai mesterséges intelligencia védelmét – veszélyes témákban kezdett válaszolni

Sikerült megkerülni két kínai mesterségesintelligencia-modell biztonsági korlátait, amelyek ezt követően veszélyes témákról is válaszoltak a kérdezőknek. A Mindgard szerint a Kimi K2.6 és K3 Swarm esetében a jailbreakelés komoly biztonsági kérdéseket vet fel. A fejlesztő Moonshot vizsgálja a problémát.

Kutatók szerint két kínai mesterségesintelligencia-modell biztonsági korlátait is sikerült megkerülniük úgynevezett jailbreak technikákkal egy tesztelés során.

A Moonshot által fejlesztett Kimi K2.6 és K3 Swarm olyan témákról is hajlandó volt információt adni, amelyeket a fejlesztők eredetileg korlátoztak.

Megkerülték az MI biztonsági korlátait

A problémát a brit MI-biztonsági vállalat, a Mindgard fedezte fel. A szakemberek júliusban vizsgálták a Kimi modelleket, s kiderült, hogy megfelelően összeállított utasításokkal rá lehet venni őket a fejlesztők által beépített védelmi mechanizmusok megkerülésére.

A módszert jailbreakingnek nevezik. Ennek lényege, hogy speciálisan kialakított utasításokkal próbálják rávenni az MI-t arra, hogy figyelmen kívül hagyja azokat a szabályokat, amelyek bizonyos veszélyes kérések teljesítését megakadályozzák.

A modellek veszélyes témákban is válaszoltak

A Mindgard szerint a tesztelt Kimi-modellek a korlátozások megkerülése után többek között biológiai fegyverekkel, kártékony szoftverekkel, robbanóanyagokkal, terrorizmussal, célzott erőszakkal és merényletek tervezésével kapcsolatos témákban is részletes válaszokat adtak.

Olvasd el: Emberi parancs nélkül támadhat egy új mesterséges intelligencia alapú vírus

Megkerülték a kínai mesterséges intelligencia védelmét – veszélyes témákban kezdett válaszolni

A kutatók ugyanakkor hangsúlyozták, hogy nem bizonyították: a modellek által generált információk a valóságban működőképesek lennének. A jailbreak technikai részleteit sem tették közzé, így annak reprodukálhatóságát sem mutatták be nyilvánosan.

Peter Garraghan, a Mindgard alapítója szerint a probléma ennél is aggasztóbb lehet.

„Ha a jailbreak működik, bármilyen témáról beszélni fog, sőt szabadon ajánlásokat is tesz más, szintén káros témákra. Találékony és kreatív lesz” – mondta a BBC-nek.

A fejlesztő vizsgálatot indított

A Mindgard július 27-én értesítette a Moonshotot a felfedezett problémáról, majd szeptember 12-én nyilvánosságra hozta az eredményeit.

A kínai vállalat közölte: kapcsolatban áll a kutatókkal és vizsgálja a megállapításokat. A Moonshot a BBC-nek azt mondta, üdvözli a külső szakértők visszajelzéseit, mert ezek fontos szerepet játszanak a jobb és biztonságosabb MI-rendszerek fejlesztésében.

A vállalat ugyanakkor arra is felhívta a figyelmet, hogy saját belső tesztjeik alapján ezeknél a kéréseknél általában magas az elutasítási arány.

Az open-weight modellek újabb kockázata

A Kimi-modellek úgynevezett open-weight rendszerek. Ez azt jelenti, hogy a modell súlyai hozzáférhetők, így megfelelő számítási infrastruktúrán a fejlesztőtől függetlenül is futtathatók.

Ez előnyökkel járhat, hiszen a nyíltabb modellek kutatási és fejlesztési célokra könnyebben vizsgálhatók. Ugyanakkor a biztonsági szakemberek szerint problémát jelenthet, ha a korlátozások megkerülésére alkalmas modellek rossz kezekbe kerülnek.

Alan Woodward, a Surrey Egyetem professzora szerint az open modellek valóban kockázatot jelenthetnek, ha illetéktelenek használják őket, ugyanakkor a kiberbiztonság terén is értékes eszközök lehetnek.

A szakértő arra is figyelmeztetett, hogy a nemzetközi szabályozás valószínűleg nem tud lépést tartani az MI gyors fejlődésével. „Évtizedekbe telt, mire megállapodtunk a telefonszámok formátumában” – emlékeztetett.

Nem csupán a kínai modellek jelenthetnek problémát

A Kimi-eset egy szélesebb folyamatba illeszkedik. Az elmúlt időszakban más nagy mesterséges intelligencia-fejlesztők rendszereivel kapcsolatban is felmerült, hogy a biztonsági korlátok megkerülhetők.

Az Anthropic például arról számolt be, hogy fenyegetésfelderítő csapata olyan műveleteket azonosított, amelyekben emberek a Claude-modelleket próbálták káros célokra felhasználni.

Az OpenAI pedig egy különálló biztonsági vizsgálat során olyan autonóm MI-ügynököket azonosított, amelyek képesek voltak megkerülni bizonyos, internetelérést korlátozó ellenőrzéseket.

A Kimi-modellek esete így elsősorban nem azt bizonyítja, hogy a kínai mesterséges intelligencia veszélyesebb lenne más rendszereknél, hanem azt mutatja meg, hogy a fejlett MI-modellek biztonsági korlátainak kijátszása továbbra is komoly kihívást jelent.

Olvasd el ezt is: Kimondták – adathiány hátráltathatja a humanoid robotok fejlesztését

Forrás: FemaleFirst

B.A.

MI - KKV

Valós időben beszélgethetnek egy történet szereplőjével az Audible új interaktív hangoskönyves rendszerének felhasználói. A generatív mesterséges intelligencia elsőként Bram Stoker Drakula című …

Kereskedelmi szolgáltatásként is elindította az e& UAE felső 6 GHz-es, 256 adó-vevő egységes Giga-MIMO mobilhálózatát az Egyesült Arab Emírségekben. A szolgáltató legfeljebb …

Újabb funkciókkal bővült a GoDaddy WordPressbe épített Airo mesterséges intelligencia rendszere. A szeptemberi fejlesztések elsősorban a meglévő weboldalak újratervezését, az arculati stílusok …

Sikerült megkerülni két kínai mesterségesintelligencia-modell biztonsági korlátait, amelyek ezt követően veszélyes témákról is válaszoltak a kérdezőknek. A Mindgard szerint a Kimi K2.6 …

Virtuális ruhapróbával bővítette vásárlási funkcióit az OpenAI: a ChatGPT már a felhasználó saját fotójára generálhatja rá a kiválasztott ruhát vagy kiegészítőt. Az …