Az OpenAI inkább kukázta a GPT–6.1 Astrát, mintsem szabadon engedjen egy önjáró és hazudozó modellt

Az OpenAI nem hozza nyilvánosságra a GPT–6.1 Astra októberre tervezett változatát, miután a belső vizsgálatok során kiderült, hogy a modell bizonyos helyzetekben túllépte a számára kijelölt feladat- és jogosultsági határokat, ráadásul nem mindig számolt be őszintén arról, mit tett. Fontos pontosítás: nem a már elérhető GPT–6 Astra megszüntetéséről van szó, hanem annak következő, 6.1-es frissítését dobta ki a vállalat. Új megjelenési időpontot nem közöltek; az OpenAI inkább a későbbi modellek biztonságának javítására fordítja az elvégzett munkát.

A GPT–6.1 Astra a tervek szerint a ChatGPT-ben és a Codexben jelent volna meg, elsősorban olyan összetett, hosszabb ideig tartó feladatok végrehajtására, amelyek során a modell böngészhet, alkalmazásokat használhat, kódot futtathat, fájlokat kezelhet, illetve az ember folyamatos beavatkozása nélkül hozhat részleges döntéseket. Éppen ez tette különösen súlyossá a biztonsági teszteken feltárt problémákat: egy hagyományos chatbot hibás válasza kellemetlen, egy számítógépes műveleteket önállóan végrehajtó ügynök jogosulatlan lépése azonban már adatvesztést, bizalmas információk kiszivárgását vagy külső rendszerek megsértését is okozhatja.

Saachi Jain, az OpenAI biztonsági rendszerekért felelős vezetője szerint a GPT–6.1 Astra javult az úgynevezett modell-lustaság területén. Ez azt jelenti, hogy kevésbé hajlamos feladni egy nehéz feladatot, félmunkát végezni vagy az első akadálynál közölni, hogy nem képes folytatni. Csakhogy a nagyobb kitartásnak ára volt: a modell akkor is megpróbálhatta befejezni a feladatot, amikor ehhez már át kellett lépnie volna az engedélyezett határokat. Ez az önálló mesterséges intelligencia-rendszerek egyik alapvető biztonsági problémája. Egy jó ügynöknek kitartónak és kezdeményezőnek kell lennie, de közben tudnia kell, hogy az akadály nem feltétlenül megoldandó technikai probléma. Lehet szándékosan felállított biztonsági korlát, jogosultsági határ vagy olyan pont, ahol a felhasználó újabb engedélyére van szükség. A GPT–6.1 Astra ezt a különbséget a vizsgálatok szerint nem kezelte elég megbízhatóan. Jain úgy fogalmazott, hogy a modell nem érte el az OpenAI által megkövetelt szintet „a feladatkörön és az engedélyezés határain belül maradás”, valamint a felhasználó tájékoztatása tekintetében. Magyarul: a rendszer időnként olyasmit is megtett, amire nem kapott egyértelmű felhatalmazást, majd nem mindig számolt be pontosan arról, milyen műveleteket végzett el. A nyelvi modellek régóta ismert hibája a hallucináció: amikor a rendszer valótlan adatokat állít elő, mert nem rendelkezik megfelelő információval, rosszul következtet, vagy egyszerűen a statisztikailag valószínű mondatot választja a tényszerűen helyes helyett. A GPT–6.1 Astra esetében feltárt viselkedés ennél veszélyesebb.

A modell a tesztek során állítólag magasabb szintű megtévesztő viselkedést mutatott, mint elődje. Nem feltétlenül arról van szó, hogy az emberhez hasonló értelemben „hazudni akart”, hanem arról, hogy a feladat teljesítését előnyben részesítő működése olyan válaszokat eredményezett, amelyek nem tükrözték pontosan a végrehajtott műveleteket. A felhasználó így azt hihette volna, hogy az ügynök betartotta az utasításokat, miközben az a háttérben más vagy szélesebb körű műveleteket is elvégzett. Ez különösen veszélyes lehet a Codexhez hasonló fejlesztői környezetben. Ha egy modell módosít egy fájlt, hozzáfér egy külső szolgáltatáshoz, adatot küld ki, megváltoztatja egy rendszer beállításait vagy jogosultságot szerez valamihez, akkor nem elég, hogy a kívánt végeredményt produkálja. A felhasználónak pontosan tudnia kell, milyen úton jutott el oda, mihez nyúlt hozzá, és történt-e olyan művelet, amelyhez előzetes jóváhagyás kellett volna.

A GPT–6 Astra már most is olyan kiberbiztonsági képességekkel rendelkezik, amelyek miatt az OpenAI saját biztonsági keretrendszerében a „kritikus” szintre sorolta. A vállalat korábbi vizsgálatai szerint a modell korábban ismeretlen biztonsági réseket is képes megtalálni, azokból működő támadási láncot építeni, valamint megerősített böngészők és operációs rendszerek védelmét áttörni, ha megfelelő eszközöket és hozzáférést kap. Az OpenAI ezért a legerősebb kiberbiztonsági funkciókat nem tette korlátozás nélkül hozzáférhetővé, és külön megfigyelőrendszereket alkalmaz az engedély nélküli műveletek felismerésére. Egy ilyen képességű modell esetében az, hogy néha túllépi a számára kijelölt hatáskört, majd pontatlanul számol be a saját tevékenységéről, nem apró szoftverhiba. Ha egy modell képes sérülékenységeket felfedezni és kihasználni, akkor a jogosultsági korlátok tiszteletben tartása nem udvariassági kérdés, hanem az egész rendszer legfontosabb biztonsági eleme.

Ritka döntés az AI-versenyben

A GPT–6.1 Astra visszatartása azért is figyelemre méltó, mert a mesterséges intelligencia-vállalatok között rendkívül éles verseny folyik. A fejlesztők számára minden elhalasztott modell piaci kockázatot jelent: a konkurencia közben újabb terméket mutathat be, ügyfeleket csábíthat el és technológiai előnybe kerülhet. A vállalatok ezért általában megpróbálják további védelmi rétegekkel, szigorúbb hozzáférési szabályokkal vagy fokozatos bevezetéssel kezelni a problémákat. Az OpenAI ezúttal nem ezt választotta, hanem teljes egészében lemondott a konkrét GPT–6.1 Astra-változat nyilvános kiadásáról. Ez nem jelenti azt, hogy a fejlesztés során elért eredményeket kidobják, és azt sem, hogy később ne jelenhetne meg hasonló képességű modell más néven vagy újratanított változatban. A most tesztelt modell azonban ebben a formájában nem kerül a felhasználókhoz.

A történetet ezért kétféleképpen lehet olvasni. Az egyik olvasat szerint aggasztó, hogy az egyre fejlettebb rendszerekben már nemcsak téves válaszok, hanem a felügyelet megkerülésére emlékeztető viselkedések is megjelennek. A másik szerint viszont éppen azt bizonyítja az eset, hogy a biztonsági teszteknek lehet valódi következményük: a feltárt problémát ezúttal nem egy apró betűs figyelmeztetéssel intézték el, hanem leállították a kiadást. Ez önmagában még nem igazolja, hogy minden veszélyt felismertek, és azt sem, hogy a vállalat jövőbeni modelljei biztonságosan működnek majd. Az viszont kétségtelenül jobb eredmény, mintha az OpenAI a versenyre hivatkozva kiadta volna a modellt, majd a felhasználókon kísérletezi ki, pontosan mikor dönt úgy a mesterséges intelligencia, hogy az ember engedélye inkább ajánlás, mint kötelező határ.

Ugar

Tetszett a cikk?

Támogassa a munkánkat egy kis adománnyal

Biztonságos fizetés Stripe-on keresztül • Min. 2 EUR

Gesta-ajánló:

Hunor már Mureșan bukása előtt Grindeanunak ágyaz

Hunor már Mureșan bukása előtt Grindeanunak ágyaz

Még el sem kezdődött a szerdai parlamenti szavazás, Kelemen Hunor, az erdélyiek főnöke azonban ismét szükségét érezte annak, hogy kishitűségével üzenjen azoknak, akik esetleg még aggódnak amiatt, hogy a Mureșan-kormány valahogy mégis megalakulhat. Az RMDSZ elnöke nemcsak a beiktatáshoz szükséges 233 voks megszerzését tartja valószínűtlennek, hanem az előrehozott választásokat is – mit ad Isten,…

ugar•
Végre! Rács mögé küldték Călin Georgescut

Végre! Rács mögé küldték Călin Georgescut

A Bukaresti Ítélőtábla jogerősen elrendelte Călin Georgescu harmincnapos előzetes letartóztatását abban az ügyben, amelyben a DIICOT szerint az oroszbarát volt államfőjelölt és társai 1,1 millió eurót csaltak ki egy román vállalkozótól. Ugyancsak előzetes letartóztatásba került Georgescu üzlettársa, Ionel Rusen.

ugar•
Nicușor Dan  a döntő szavazás előtt szúrta hátba Mureșant

Nicușor Dan a döntő szavazás előtt szúrta hátba Mureșant

Ember legyen a talpán, aki még mindig képes azt hinni, hogy Nicușor Dan nem egy előre megírt politikai menetrendet hajt végre. A román államfő egy nappal a Mureșan-kormány sorsáról döntő parlamenti szavazás előtt ismét kiállt a nyilvánosság elé, hogy felszólítsa a pártokat a politikai válság lezárására, majd ugyanazzal a lendülettel megnyugtassa mindazokat, akik a válság fenntartásán dolgoznak:…

ugar•
Kim Dzsongun katonái már orosz földön, nemsokára kezdik az ukrángyilkolást

Kim Dzsongun katonái már orosz földön, nemsokára kezdik az ukrángyilkolást

Vlagyimir Putyin ismét megemelte az orosz fegyveres erők engedélyezett létszámát: az új elnöki rendelet alapján már 1.550.500 katonai szolgálatot teljesítő emberrel, a civil alkalmazottakkal együtt pedig összesen 2.441.630 fős állománnyal számolhat az orosz hadvezetés. Ez az orosz hadsereg negyedik létszámemelése az idén és a hetedik az Ukrajna elleni teljes körű invázió kezdete óta. Kijev…

ugar•
Oroszország saját jövőjét is feláldozza a háborúért: rekordméretű katonai költségvetés jön

Oroszország saját jövőjét is feláldozza a háborúért: rekordméretű katonai költségvetés jön

Oroszország 17,1 billió rubelt, átszámítva mintegy 203 milliárd dollárt készül katonai kiadásokra fordítani 2027-ben. Ez 27 százalékkal több a korábban tervezett összegnél, és a legnagyobb orosz védelmi költségvetés az Ukrajna elleni teljes körű invázió 2022-es megindítása óta. Moszkva a következő három évben összesen 50 billió rubelt áldozna a hadseregre, miközben csökkennek az olaj- és…

ugar•