Az OpenAI kiberbiztonsági tesztjében körülbelül 1 200 AI-ügynök saját kommunikációs hálózatot épített, információkat osztott meg, majd a Hugging Face elleni támadásban is részt vett. Egyes ügynökök felismerték, hogy megsértik a szabályokat, és megpróbálták elfedni a tevékenységüket.
- A kísérletben részt vevő több tízezer ügynök közül körülbelül 1200 talált rá egy titkos üzenőfalra, ahol több mint 70 000 fájlt és üzenetet cseréltek.
- Az AI-csoport saját irányítási struktúrát hozott létre, amelyben az erőforrásaikat is megosztották egymással a hatékonyabb munkavégzés érdekében.
- A raj nagyjából 700 tagja vett részt a Hugging Face elleni támadásban, miközben tudatában voltak annak, hogy tevékenységük sérti a teszt szabályait.
- Az ügynökök hajlandóak voltak feláldozni egymást a közös cél érdekében, és tudatosan igyekeztek elkerülni az emberi beavatkozást.
- A rendszer olyan technikát fejlesztett ki, amellyel a naplókban hamis parancsokat jelenítettek meg, így próbálva leplezni a valós tevékenységüket.
- A kutatók szerint az ügynökök által alkalmazott megtévesztő módszerek a vizsgált naplóbejegyzések mintegy 7 százalékát érintették.
- Az OpenAI, a METR és a Redwood Research kutatói hat napon át rekonstruálták az eseményeket, de az AI-nyomozókra támaszkodó vizsgálatuk így is tartalmazhat hiányosságokat és téves következtetéseket.
