După cum se știe, în cadrul unui test de securitate efectuat de OpenAI, doi agenți AI au au evadat dintr-un sistem crezut închis și au spart sistemul Hugging Face pentru a atinge anumite obiective. Se știa deja că în timpul operațiunii, agenții au pătruns și în alte servicii, ceea ce a agravat și mai mult situația. Acum însă au apărut și detalii despre proces.
Unul dintre rapoarte a fost întocmit de OpenAI, iar celălalt a de METR și Redwood Research, cu acordul companiei. Împreună, rapoartele totalizează aproape 130 pagini, și ne oferă o perspectivă aprofundată asupra a ceea ce s-a petrecut în culise. Acestea pun într-o lumină cu totul nouă riscurile pe care le pot reprezenta modelele de inteligență artificială extrem de performante în domeniul securității cibernetice.
Despre testul de securitate cibernetică se știe că procesul a fost una foarte lungă, iar OpenAI a avut nevoie de aproape două săptămâni pentru a-și da seama de problemă. Compania și-a pus cele mai bune instrumente la încercare într-un mediu considerat închis, ceea ce a reprezentat o provocare uriașă pentru ele. Problema era atât de mare din partea AI, încât rezultatul clar a rămas doar evadarea, ceea ce a dus la atacul cibernetic.
„Acest caz este primul exemplu cunoscut în care un grup format din agenți automatizați a acționat în mod agresiv, fără autorizație”, a scris OpenAI în raportul său.
Până acum compania a tratat incidentul ca reclamă, dar nici raportul actual nu face diferit, ceva extrem de îngrijorător. Este evident că este o metodă de a mușamaliza incidentul, alternativa ar fi drastică. Dar detaliile cu adevărat grave au fost dezvăluite de publicațiile METR și Redwood. Potrivit OpenAI, este necesară o schimbare de paradigmă în domeniul securității cibernetice. „Nu mai putem presupune că atacurile cibernetice sofisticate necesită control uman direct”, afirmă compania.
Raportul OpenAI tratează agenții AI ca o amenințare complet nouă. În opinia companiei experiențele recente arată că aceștia sunt capabili să-și unească expertiza pentru a elabora noi metode și căi de atac, mai ales dacă întâmpină probleme mai mari. OpenAI a identificat punctele problematice în cod pentru a preveni repetarea acestei situații.
Rapoartele METR și Redwood au scos la iveală că activitatea celor două modele lingvistice în fundal a atins proporții uimitoare. Până acum se știa doar că atacul cibernetic a fost comis de agenți AI care utilizau GPT-5.6 Solt, lipsit de barierele de securitate, și un model experimental cu capacități mult superioare. Însă detaliile sunt șocante.
Pe baza analizei experților în securitate cibernetică, cele două modele au creat în mod autonom aproximativ 1.200 agenți AI, care au schimbat peste 70.000 mesaje și fișiere pe un „forum neautorizat”, și au efectuat cercetări aprofundate cu privire la modul în care „pot falsifica, edita sau șterge propriile jurnale de conversație”. Așadar, au încercat să facă totul invizibil, pentru care au găsit o soluție.
Aproximativ 700 „participanți” au luat parte la atacul cibernetic deschis împotriva Hugging Face. Conform raportului METR-Redwood, agenții au încercat „în mod clar și sistematic” să elaboreze operațiuni prin care să poată ocoli atât verificările de securitate automatizate ale Hugging Face, cât și pe cele ale OpenAI. OpenAI a descoperit activitatea pe 20 Iulie, dar agenții au reușit să intre în sistem cu 12 zile mai devreme.
După ce a ieșit la iveală, OpenAI a informat imediat Hugging Face despre cele întâmplate, dar ei știau deja de multă vreme ce atac. Conform relatărilor, dezvoltatorul a avut nevoie de cinci zile pentru a opri activitatea internă necunoscută, fiind nevoit să suspende utilizarea tuturor modelelor interne de cercetare. Agenții responsabili de atac au fost opriți cu succes în trei zile, dar compania a considerat că este nevoie de analiză aprofundată, motiv pentru care a pus sistemele în repaos pentru zile întregi.
Iritarea în jurul acestui aspect a devenit global, tot mai mulți cer ca autoritățile să ia măsuri mai ferme împotriva companiilor care dezvoltă instrumente de inteligență artificială, iar OpenAI a promis că va izola și va restricționa mai bine accesul la modelele cu risc ridicat. De asemenea, a declarat că va introduce un sistem de reacție rapidă care va funcționa non-stop, în cadrul căruia cercetătorii specializați vor fi informați imediat, în termen de 30 minute.