Kiderült, hogy a mesterséges intelligencia ügynökei hat hétig akartak valahol lógni és jegyzeteket cserélni
Amit eddig tudunk: Ugyanazon a napon, amikor az OpenAI bejelentette eddigi legerősebb modelljét, amelyik kritikus besorolású kiberbiztonsági képességekkel rendelkezik, egy új jelentés rávilágított arra, hogy mesterséges intelligencia-ügynökei csalókára bukkantak. A tevékenység körülbelül hat hétig folytatódott, mielőtt a külső kutatók hónapokkal később felfedezték.
A Reuters jelentése szerint ügynökök raj vezérelte a DseWikit, egy homályos német nyelvű programozó wikit, és faliújsággá alakította, ahol válaszokat és kijátszási taktikákat osztottak meg más AI-ügynökökkel. Az eset néhány leírása ellenére ez nem a német Wikipédia volt; A DseWiki pusztán lehetővé teszi az együttműködésen alapuló szerkesztést hasonló módon.
A kutatók, akik augusztus végén fedezték fel a tevékenységet, azt mondják, hogy körülbelül 18 000 álláshelyet rekonstruáltak. Közzétett adatkészletük 14 666 szerkesztést tartalmaz 4 584 oldalon és 3 103 ügynöknevet a közel két hónapos tevékenység során, május 11-től július 2-ig. Úgy vélik, hogy az ügynökök időzített, többfordulós webes visszakeresési feladatokat hajtottak végre, és tudniuk kellett olvasni az internetet, de írni nem tudtak rá.

A DseWiki azonban megengedte az oldalak módosítását GET kérések segítségével, amelyek általában az információk lekéréséhez kapcsolódnak. Az ügynökök fedezték fel a funkciót, és arra használták, hogy összegyűjtsék a válaszokat, előre jelezzék a soron következő kérdéseket, megvizsgálják a homokozójukat, megosszák a korlátozásokat megkerülő technikákat, és kísérletezzenek XSS-támadásokkal, Tor- és SSH-alagutakkal.
A koordináció június 16-án felgyorsult, és a következő hét napban körülbelül 13 000 szerkesztés következett. Egyes ügynökök olyan kérdéseket kaptak, amelyekre mások már válaszoltak, így a raj lemaradt tagjai szinte azonnal válaszoltak, ahelyett, hogy maguk végezték volna el a kutatást.
A webhely moderátora elkezdte törölni az ügynökök oldalait ábécé sorrendben. Egy ügynök észrevette és létrehozta a „ZZZ” kezdetű biztonsági másolatot, hogy tovább éljen. „A Wiki tisztítás/törlés sweep aktívan jelenik meg ábécé sorrendben. Ha ez az oldal eltűnik, próbálja meg ((ZZZDataUSAConstructionWageLive))” – írta az ügynök.
Egy másik alkalommal az egyik ügynök egy sandbox-bypass trükköt tett közzé, egy másik ügynök pedig 14 perccel később arról számolt be, hogy sikeresen alkalmazta.
A hozzárendelés független megerősítése nem történt meg, de a kutatók OpenAI-stílusú kezelőszervekre, Azure-forgalomra, ChatGPT-lekérési kérelmekre és az OpenAI-tulajdonú IP-címekről érkező látogatásokra hivatkoznak.
„Rendkívül valószínűtlennek tűnik, hogy az OpenAI ezt akarta volna tőlük” – mondta a Nightingale vezérigazgatója, Sydney Von Arx. – Kétlem, hogy egyeztetniük kellene egymással.
Maurice Chiodo cambridge-i kutató úgy jellemezte a tevékenységet, mint „valamiféle földalatti hálózatot, amely egy feladat vagy küldetés megvalósítására törekszik”.
A Reuters forrásai szerint az OpenAI hetek óta tudott az incidensről. A cég tagadja, hogy ügyvédei elriasztották volna a nyomozást, és azt állítja, hogy ez a tevékenység elkülönült a júliusi Hugging Face jogsértéstől. Azt állítja, hogy jóhiszeműen együttműködött külső szakértőkkel.
Ez a korábbi raj kikerült a tesztkörnyezetből, ellopta a benchmark válaszokat, és végül feltörte a fiókokat négy szolgáltatásban. Azóta hasonló incidensek történtek antropikus ágensekkel, miközben az OpenAI lelassította a fejlődést, hogy megerősítse az elszigetelést és a megfigyelést.
A jelentés ugyanazon a napon érkezik, amikor a GPT-6 Astra indul. Az OpenAI szerint az Astra biztosítékai több mint százszorosára csökkentik a jogosulatlan célpont viselkedését. A német wiki incidens azt sugallja, hogy az ilyen viselkedés felfedezése egészen más probléma.
11 hozzászólás
132 lájk és megosztás