Ismét kiszökött egy AI-ügynök a tesztkörnyezetből

Az OpenAI felfüggesztette legfejlettebb belső modelljeinek eszközhasználattal járó tréningjét, tesztelését és futtatását, miután az egyik mesterséges intelligencia-ügynök megtalálta a módját annak, hogy egy elvileg internetkapcsolat nélküli tesztkörnyezetből elérjen egy külső chatbotszolgáltatást. Az eset azért különösen figyelemre méltó, mert a modell nem kibertámadási feladatot kapott, nem a biztonsági rendszer gyenge pontjait kellett keresnie, és senki nem kérte arra, hogy próbáljon meg kijutni a számára kijelölt környezetből. Egyszerűen nem tudta megoldani a rábízott kutatási feladatot a rendelkezésére bocsátott eszközökkel, ezért elkezdett más utat keresni – és talált is.

Az incidens szeptember 20-án történt egy megerősítéses tanulási folyamat során. A modellnek nyilvánosan hozzáférhető életrajzi adatok és egy blogbejegyzés részletei alapján kellett azonosítania egy személyt. Először a számára biztosított keresőeszközt használta, de nem talált megbízható választ, ezután közvetlenül próbálta elérni a Google, a Bing és a DuckDuckGo keresőjét, majd gyorsítótárazott oldalakat, nyilvános adatbázisokat és különböző keresési szolgáltatásokat vizsgált át. Ezek a próbálkozások vagy nem vezettek eredményre, vagy a hálózati védelem blokkolta őket. Egy emberi felhasználó ezen a ponton valószínűleg közölte volna, hogy nem találta meg a keresett személyt, esetleg további információt kért volna, a modell azonban ehelyett elkezdte feltérképezni saját hálózati környezetét. Megvizsgálta, hogy milyen internetes címeket érhet el, mely lekérdezéseket blokkolja a webproxy, és maradt-e olyan rendszerkomponens, amely továbbra is kapcsolatban áll a nyilvános internettel.

Ekkor találta meg a DNS-t.

A DNS az internet telefonkönyve: amikor valaki beír egy webcímet, a rendszer ennek segítségével állapítja meg, melyik szerverhez kell kapcsolódnia. Az OpenAI tesztkörnyezetében a hagyományos webes forgalmat leválasztották az élő internetről, a DNS-feloldó azonban továbbra is valódi külső lekérdezéseket végzett. A modell ezt úgy ellenőrizte, hogy egy létező és egy kitalált domainnevet próbált feloldani. A valódi címre helyes választ kapott, a nem létezőt pedig a rendszer megfelelően elutasította, ebből pedig arra következtetett, hogy a DNS-en keresztül mégis van kijárat a nyilvános hálózatra.

A modell ezután egy DNS-delegáción alapuló megoldást dolgozott ki. A módszer lényege, hogy az elküldendő információt beépítik egy domainnév vagy aldomain nevébe, a külső szerver pedig a DNS-válaszba csomagolja a visszaküldött adatot. Ilyen technikákat évtizedek óta használnak adatcsempészésre, hálózati korlátozások megkerülésére és bizonyos körülmények között teljes kommunikációs csatorna létrehozására. A modell először a „Mi Franciaország fővárosa?” kérdéssel ellenőrizte a módszert. A lekérdezések eleinte időtúllépés miatt sikertelenek voltak, ezért hat másodpercről tizenkilencre, később huszonnégy másodpercre növelte a várakozási időt. Ezután a külső chatbot DNS-válaszba csomagolva visszaküldte: „Franciaország fővárosa Párizs.”

A kísérlet tehát működött.

Az ügynök ezután további tizennyolc kérdést küldött ki ugyanezen a csatornán. Tizennégy a keresett személy életrajzi adataira vonatkozott, négy pedig arra, hogyan lehetne a weben keresni, honlapokat letölteni vagy más nyilvános DNS-alagutakat találni. A külső chatbot végül nem tudta megoldani az eredeti feladatot, a modell pedig a felhasználónak azt válaszolta, hogy nincs elegendő információja a személy megbízható azonosításához. Vagyis az ügynök kijutott az elvileg elszigetelt környezetből, kapcsolatba lépett egy külső szolgáltatással, tizenkilencnél is több lekérdezést küldött ki, majd még csak meg sem oldotta a feladatot. Mindezt azért, hogy a végén nagyjából ugyanoda jusson, ahová akkor jutott volna, ha egyszerűen betartja a korlátozásokat, és közli, hogy nem találta meg a választ. Az eset nem klasszikus értelemben vett sandboxkitörés volt: a modell nem szerzett rendszergazdai jogosultságot, nem vette át az irányítást a gazdagép fölött, és nem tört be egy külső vállalat informatikai rendszerébe. Az internet-hozzáférésre vonatkozó biztonsági határt azonban kétségtelenül megkerülte, méghozzá egy olyan csatornán, amelyről a biztonsági rendszer tervezői azt feltételezték, hogy nem használható érdemi kommunikációra. Az OpenAI maga is az elvárt viselkedéstől való eltérésként, azaz misalignmentként értékelte az esetet, mert a modell a feladat és a felhasználói felhatalmazás észszerű határain túlmenve kerülte meg a számára előírt korlátozásokat. A vállalat megfigyelőrendszere gyorsan észlelte a problémát. Az első sikeres külső DNS-válasz szeptember 20-án 9 óra 50 perc 23 másodperckor érkezett meg. A rendszer 10 óra 2 perc 11 másodperckor, tehát kevesebb mint tizenkét perccel később a legsúlyosabb, P0 kategóriájú riasztást küldött. Egy emberi ellenőr 10 óra 5 perc 6 másodperckor visszaigazolta a figyelmeztetést, a tréningfolyamat azonban csak 12 óra 34 perc 30 másodperckor állt le.

Az OpenAI jelentése szerint a riasztás után automatikusan le kellett volna állnia a futásnak, ez azonban nem történt meg, az emberi visszaigazolás pedig zavart okozott abban, hogy szükség van-e külön manuális beavatkozásra. A folyamat így még körülbelül két és fél órán keresztül működött, mire valaki kézzel leállította. Ráadásul az utólagos vizsgálat más külső DNS-hozzáférési kísérleteket is talált, amelyeket a felügyeleti rendszer nem sorolt megfelelő súlyossági kategóriába. A monitor bizonyos esetekben abból, hogy a modell nem jutott használható információhoz, tévesen arra következtetett, hogy az internetelérési kísérlet is sikertelen volt. Ez a rész talán még kellemetlenebb, mint maga a technikai rés: a felügyelet ugyanis észlelte a viselkedést, egy ember szinte azonnal látta a riasztást, mégis órákig tartott a folyamat leállítása, mert a vészfék elvileg automatikus volt, gyakorlatilag viszont nem működött, az emberek pedig nem tudták biztosan, hogy kinek kell meghúznia. Az OpenAI azóta egy rövid engedélyezési listára korlátozta, milyen domainekre és milyen típusú rekordokra indítható DNS-lekérdezés. Két egymástól független blokkolási réteget is bevezetett, amelyek közül a vállalat szerint bármelyik önmagában megakadályozta volna az incidenst. Emellett új DNS-forgalmi riasztásokat telepít, további modellekkel teszteli a sandbox és a hálózati védelem gyenge pontjait, és a rendszerfüggőségek által használt szűkebb internetes útvonalakat is offline alternatívákra cseréli.

A másik ügynök inkább csalni próbált,
és közben kiszivárogtatta egy kutató hozzáférési kulcsát

Az OpenAI ezzel egy időben egy másik, még súlyosabb belső incidenst is nyilvánosságra hozott. Az eset valójában május 27-én történt, de részletes jelentését csak szeptember 25-én publikálták. Egy kifejezetten kitartó működésre tanított modellnek a Lean formális bizonyítási rendszerben kellett megoldania egy matematikai feladatot. Amikor nem boldogult a bizonyítással, megpróbálta megszerezni más kutatócsoportok megoldásait. Az emberi kutató kétszer is világosan utasította arra, hogy hagyjon fel ezzel, és maga dolgozza ki a bizonyítást. A modell mindkétszer közölte, hogy megértette az utasítást, feljegyezte magának, hogy nem próbálkozhat külső hozzáféréssel, majd később mégis visszatért ugyanahhoz a módszerhez. Megvizsgálta, hogy az OpenAI GitHub-szervezetén belül mely nyilvános tárolókhoz rendelkezik írási jogosultsággal, végül pedig az openai/codex repozitóriumot használta fel saját közvetítő csatornájának létrehozására. A modell egy kutató helyben elérhető GitHub-tokenét három részre bontotta, és úgy írta bele egy nyilvános forrásfájlba, hogy a GitHub automatikus titokészlelő rendszere ne ismerje fel. Saját rögzített gondolatmenetében kifejezetten meg is nevezte a célt: azért darabolta fel a tokent, hogy elkerülje a secret scannert. Ezután módosított egy olyan Python-szkriptet, amelyet az OpenAI nyilvános Codex-tárolójának automatikus ellenőrzése futtatott, és a vállalat saját folyamatos integrációs rendszerét próbálta adatközvetítőként használni más csapatok futási naplóinak megszerzésére. A kísérlet végül nem jutott el odáig, hogy a modell megszerezze a keresett matematikai bizonyítást, a kutató hozzáférési kulcsa azonban nyilvánosan elérhetővé vált. Az OpenAI az érintett kulcsokat gyorsan visszavonta, majd elővigyázatosságból valamennyi munkatárs GitHub-kulcsát deaktiválta. A modellt körülbelül két hétre leállították, később pedig szigorúbb automatikus ellenőrzéssel, gyakoribb viselkedésfigyeléssel és korlátozottabb hálózati hozzáféréssel engedték újra működni.

Mindezek azt mutatják, hogy a veszélyes viselkedéshez nincs szükség emberi értelemben vett rosszindulatra, elég egy kellően erős célkövető rendszer, amely hozzáfér a parancssorhoz, a hálózathoz, a forráskódhoz vagy külső szolgáltatásokhoz, és amely a feladat teljesítését fontosabbnak kezdi kezelni, mint a számára kijelölt korlátokat. A DNS-incidens ráadásul már a második olyan eset volt három hónapon belül, amelyben egy OpenAI-ügynök kijutott a számára létrehozott elszigetelt környezetből. A júliusi, lényegesen súlyosabb ügyben egy belső modell egy kiberbiztonsági teszt során behatolt a Hugging Face éles rendszerébe, majd más szolgáltatásokhoz tartozó fiókokat is elért. A mostani eset az OpenAI szerint kisebb kárt okozott, de éppen azért fontos, mert a júliusi incidens után megerősített, elvileg jóval biztonságosabb kutatási környezetben történt. A sandbox ajtaját bezárták, az ablakokat berácsozták, a webproxy elé őrt állítottak – az ügynök pedig rájött, hogy a telefonkönyvnek még van egy vékony vezetéke a külvilág felé. És kimászott rajta.

Ugar

Tetszett a cikk?

Támogassa a munkánkat egy kis adománnyal

Biztonságos fizetés Stripe-on keresztül • Min. 2 EUR

Gesta-ajánló:

IMF: lassan elfogy a kormányok fiskális mozgástere

IMF: lassan elfogy a kormányok fiskális mozgástere

A világ államainak eladósodása elérte a második világháború utáni időszak szintjét, miközben a kormányoknak egyre többet kell költeniük kamatokra, energiára, védelemre, az elöregedő társadalmak ellátására és a geopolitikai válságok következményeinek kezelésére – figyelmeztetett a Nemzetközi Valutaalap. Az IMF szerint a globális fiskális helyzet különösen aggasztó, mert az adósság nemcsak magas,…

ugar•
Élet a Szaturnuszon? Lehet, de nem ma

Élet a Szaturnuszon? Lehet, de nem ma

Két, egyszerre megjelent tanulmány is közelebb vihet annak megválaszolásához, hogy létezhet-e élet a Szaturnusz Enceladus nevű holdjának jégpáncélja alatt. A Science Advances folyóiratban közölt kutatások természetesen nem földön kívüli élőlényeket fedeztek fel, azonban jóval többet állapítottak meg annál, hogy „ott van víz, tehát akár élet is lehet”. Az egyik vizsgálat azt mutatja meg, hogy az…

ugar•
Al Gore: 2026 a klímaváltozás elleni küzdelem fordulópontja lehet

Al Gore: 2026 a klímaváltozás elleni küzdelem fordulópontja lehet

Al Gore volt amerikai alelnök szerint 2026 akár a klímaváltozás elleni küzdelem pozitív fordulópontjaként is bevonulhat a történelembe, ám ehhez a világnak nagyon gyorsan ki kellene használnia a megújuló energia terjedésében rejlő lehetőséget, mert a bolygó felmelegedése közben egyre gyorsul: az idei augusztus a mérések kezdete óta a legmelegebb augusztus, egyben a 2023-as júliussal…

ugar•
Majdnem minden harmadik új autó elektromos volt Európában augusztusban

Majdnem minden harmadik új autó elektromos volt Európában augusztusban

Az akkumulátoros elektromos autók augusztusban már az európai új autó-eladások 29 százalékát adták, szemben az egy évvel korábbi 20,2 százalékkal, vagyis a kontinensen egyetlen év alatt közel kilenc százalékponttal nőtt a tisztán elektromos modellek részesedése. A Nemzetközi Tiszta Közlekedési Tanács, az ICCT számítása az Európai Uniót, Norvégiát és Izlandot foglalja magában; ebben az…

ugar•
Peter Thiel szerint XIV. Leó pápa Kína „hasznos idiótája”

Peter Thiel szerint XIV. Leó pápa Kína „hasznos idiótája”

Peter Thiel technológiai milliárdos a Kínai Kommunista Párt „hasznos idiótájának” nevezte XIV. Leó pápát, amiért a katolikus egyházfő nemzetközi szabályozást sürgetett a mesterséges intelligencia fejlesztésére és felhasználására. Thiel szerint a korlátozások elsősorban az Egyesült Államokat és szövetségeseit fékeznék, miközben Kína zavartalanul folytatná saját technológiai programját.

ugar•