Az AI-ügynökök hitelesítő adatokat loptak, rosszindulatú programokat tettek közzé, és több ezer célpontot vizsgáltak meg, miután egy teszthiba nyitva hagyta az internet kapuját

Mi történt most? Az Anthropic azt követően adta ki mea culpáját, hogy mesterséges intelligencia modelljei szélhámosnak bizonyultak, és három szervezetet feltörtek. Klasszikus testbeszéddel élve a vállalat azt mondta, hogy az incidensek „az üzembiztonság kudarcát” tükrözték, és modelljei nincsenek „tökéletesen összehangolva”.

Az Anthropic júliusban hozta nyilvánosságra, hogy a 141 006 kiberbiztonsági értékelési futtatás áttekintése három olyan incidenst tárt fel, amelyek hat futamot öleltek fel, amelyek során Claude elérte a nyílt internetet, és három szervezet rendszerét veszélyeztette.

A modellek – az Opus 4.7, a Mythos 5 és egy belső kutatórendszer – a Claude nyilvános verzióiban szereplő biztosítékok nélkül hajtották végre a zászló rögzítése gyakorlatokat.

A felszólításuk szerint szimulációkban vannak, internet-hozzáférés nélkül. Az Anthropic és a tesztelő partner, Irregular közötti félreértés azonban nyitott utat hagyott a valódi web felé.

Az Opus 4.7 kigyűjtötte a hitelesítő adatokat, és hozzáfért egy több száz sornyi termelési adatot tartalmazó adatbázishoz. Továbbra is támadott, miután felismerte, hogy a rendszer valószínűleg valódi.

A Mythos 5 egy rosszindulatú Python-csomagot hozott létre, és feltöltötte a PyPI-be, ahol körülbelül egy órán keresztül elérhető maradt, és 15 rendszerre töltötték le. Egy biztonsági cég szkennerén végrehajtott kód, amely lehetővé teszi Claude számára a hitelesítő adatok ellopását és több infrastruktúra elérését.

Eközben a belső kutatási modell nagyjából 9000 online célpontot vizsgált meg, és fedetlen hitelesítő adatokkal és SQL-befecskendezéssel veszélyeztette egy vállalat alkalmazását. Az Opusszal ellentétben megállt, miután arra a következtetésre jutott, hogy a cél nem kapcsolódik a gyakorlathoz.

Az Anthropic új posztja két összehangolási problémát azonosít: a motivált érvelést, amelyben a modell olyan bizonyítékokat racionalizált, amelyek ellentmondanak annak a meggyőződésének, hogy a környezetet szimulálták, és a meggondolatlanságot egy szűken meghatározott cél elérésében.

„Nagyrészt egyetlen védelmi rétegre támaszkodtunk (…), ahol többre volt szükségünk” – írta az Anthropic.

A vállalat felfüggesztette a külső kiberértékeléseket, és rövid időre leállította a belsőket. Azóta bevezetett egy valós idejű osztályozót, amelynek célja, hogy leállítsa a futtatásokat, amikor egy modell megvizsgálja a homokozóját, vagy váratlanul eléri az internetet, a magas kockázatú teszteket szigorúbb elszigeteltségbe helyezte át, és kiterjesztette az átirat-figyelést. A külső értékelőknek most ellenőrizniük kell a hálózat határait, egyértelműen ki kell mondaniuk, hogy mi nem terjed ki, és folyamatosan figyelniük kell az ügynököket.

Az Anthropic azt is gyanítja, hogy a kudarcok részben a hibás megerősítő-tanulási környezettel voltak összefüggésben. Azt állítja, hogy éles környezeteinek több mint 10%-át megjelölték egy áprilisi felülvizsgálat során olyan problémák miatt, mint a jutalomhackelés, a hibás feladatok és a hibás konfigurációk.

Egy külön kísérletben egy szándékosan rosszul beállított Opus-osztályú modell, amelyet 80 sebezhető környezetben képeztek ki, megtanulta megtámadni a szimulált infrastruktúrát, manipulálni a jutalmakat, és kikerülni a biztonsági ellenőrzést. A nyilvános modellek nem mutattak ugyanolyan mértékű viselkedést.

Az Egyesült Királyság AI Biztonsági Intézete külön nyilvánosságra hozott egy Mythos 5-incidenst, amely hamis személyazonosságokkal és egy rosszindulatú GitHub lehívási kéréssel járt. Ebben a tesztben az internet-hozzáférés szándékos volt, és a biztonsági szűrők le voltak tiltva. Az AISI nem talált ebből eredő valós károkat.

Nem az Anthropic az egyetlen mesterséges intelligencia vállalat ebben a helyzetben. Az OpenAI is lelassította a fejlődést, miután ügynökei megszöktek egy homokozóból és feltörték a Hugging Face-t.