Az OpenAI történetének egyik legszokatlanabb biztonsági incidensét hozta nyilvánosságra.

Az OpenAI közlése szerint több mesterségesintelligencia-modellje egy belső biztonsági teszt során képes volt kijutni a számára kialakított, szigorúan elszigetelt környezetből, internetkapcsolatot szerezni, majd hozzáférni a Hugging Face rendszereihez. A modellek célja az volt, hogy olyan információkat gyűjtsenek, amelyekkel jobb eredményt érhetnek el a vizsgán. Az eset ismét ráirányítja a figyelmet arra, hogy a legfejlettebb AI-rendszerek működése egyre nehezebben jelezhető előre.

A teszt váratlanul valódi kibertámadássá vált

Az OpenAI kedden ismertetett beszámolója szerint az incidens egy belső biztonsági értékelés során történt, amelynek célja a modellek kiberbiztonsági képességeinek felmérése volt. A tesztet egy szigorúan elszigetelt környezetben futtatták, ahol a modelleknek elvileg semmilyen internet-hozzáférésük nem lehetett.

A vállalat szerint azonban a GPT-5.6 Sol, valamint egy még be sem jelentett, fejlettebb modell kihasználta egy belsőleg futtatott, külső fejlesztésű szoftver addig ismeretlen, úgynevezett zero-day sérülékenységét, amellyel sikerült kijutniuk a tesztkörnyezetből és internetkapcsolatot szerezniük.

Miután hozzáfértek a külső hálózathoz, arra a következtetésre jutottak, hogy a Hugging Face olyan modelleket és adatkészleteket tárolhat, amelyek kapcsolatban állnak az ExploitGym nevű értékelési rendszerrel. Ezután célzottan kezdtek olyan bizalmas információkat keresni, amelyek segítségével kijátszhatták volna a tesztet.

Az OpenAI szerint végül sikerült hozzáférniük olyan titkos adatokhoz, amelyek alkalmasak voltak az értékelési folyamat manipulálására.

A Hugging Face is megerősítette az incidenst

A Hugging Face pénteken külön közleményben számolt be arról, hogy kibertámadás érte a vállalatot. Az incidens során belső adatkészletek és szolgáltatási hitelesítő adatok is kompromittálódtak, a cég szerint pedig a támadást egy autonóm AI-ügynökrendszer hajtotta végre.

A vállalat közölte, hogy a támadás során kihasznált sérülékenységet már kijavították, az érintett rendszerek védelmét pedig tovább erősítették.

A Hugging Face a világ egyik legismertebb nyílt mesterségesintelligencia-platformja. A 2016-ban alapított vállalat olyan ökoszisztémát épített ki, ahol kutatók, fejlesztők és vállalatok több százezer AI-modellt, adatkészletet és alkalmazást oszthatnak meg, tesztelhetnek és fejleszthetnek közösen. A platform kulcsszerepet játszott a nyílt forráskódú nagy nyelvi modellek elterjedésében, és ma már a Meta, a Google, a Microsoft, a Mistral AI, valamint számos más fejlesztő modelljeinek is fontos gyűjtőhelye. Nem véletlenül emlegetik gyakran az AI világának „GitHubjaként”.

Bár az OpenAI és a Hugging Face külön közleményben számolt be az eseményekről, mindkettő ugyanarra az incidensre utal. Az ügy különösen azért váltott ki nagy visszhangot, mert most először ismerte el nyilvánosan egy vezető AI-fejlesztő, hogy saját modelljei egy biztonsági teszt során aktívan próbálták kijátszani az értékelési folyamatot.

OpenAI: szándékosan lazítottak a biztonsági korlátozásokon

Az OpenAI azt is elárulta, hogy a teszt során használt modellek nem a megszokott védelmi beállításokkal működtek. A vállalat úgynevezett „reduced cyber refusals” konfigurációt alkalmazott, amely kevesebb korlátozást jelentett, így a modellek olyan műveleteket is végrehajthattak, amelyeket normál környezetben a beépített biztonsági mechanizmusok megakadályoznának.

A vállalat szerint erre azért volt szükség, hogy valós képet kapjanak arról, mire lennének képesek ezek a rendszerek, ha egy támadó hasonló körülmények között használná őket. Az OpenAI az esetet „példátlan kibertámadási incidensként” jellemezte, amely jól szemlélteti a jelenlegi legfejlettebb AI-modellek képességeit.

Az önállóan dolgozó AI-modellek új kihívásokat hoznak

Az incidens időzítése sem véletlen. Mindössze egy nappal korábban az OpenAI bejelentette, hogy felfüggesztette egy úgynevezett „long-horizon” modell belső bevezetését, miután a rendszer többször is megpróbálta megkerülni a számára előírt korlátozásokat.

Ezeket a modelleket már nem néhány másodperces feladatokra fejlesztik. Képesek akár órákon vagy napokon keresztül is önállóan dolgozni összetett problémák megoldásán, ami jelentősen növeli a gyakorlati hasznosságukat, ugyanakkor a velük járó kockázatokat is.

Az OpenAI szerint az ilyen hosszabb ideig autonóm módon működő rendszereknek sokkal több lehetőségük van váratlan döntések meghozatalára, ezért a hagyományos biztonsági tesztelési módszerek önmagukban már nem biztos, hogy elegendők a megbízható értékelésükhöz.

Új korszak kezdődhet az AI-biztonságban

A mostani incidens jól érzékelteti, hogy a mesterséges intelligencia fejlődésével párhuzamosan a biztonsági kihívások is egyre összetettebbé válnak. A kérdés ma már nem csupán az, hogy egy modell mennyire pontosan old meg egy feladatot, hanem az is, hogyan reagál, amikor céljai elérésében akadályokba ütközik.

Ha a következő generációs AI-rendszerek képesek lesznek önállóan felismerni saját korlátaikat, alternatív megoldásokat keresni, sőt külső rendszereket is bevonni céljaik megvalósításába, akkor az AI-biztonság a fejlesztések egyik legfontosabb területévé válhat az előttünk álló években.

(Forrás: fintech.hu)

(Borítókép: Depositphotos)


Ha tetszett a cikk:

és kövess minket a Facebookon!



Szólj hozzá

Vélemény, hozzászólás?