După incidentul OpenAI, Anthropic început o verificare internă. Rezultatul a fost destul de surprinzător.
S-a descoperit că și în cadrul Anthropic s-au produs incidente similare, doar că nimeni nu știa de ele. Instrumentele dezvoltate de Anthropic se pore că au accesat mai multe servere ilegal, fără ca creatorii să își deie seama.
„În urma evaluărilor am descoperit trei incidente care au avut loc în medii reale”, a declarat compania.
Anthropic a fost prima companie care a creat un model lingvistic special conceput pentru identificarea vulnerabilităților și a breșelor de securitate, la care a oferit acces și partenerilor săi. Compania lucra de ani buni la această dezvoltare, și a efectuat numeroase teste în medii închise. dar se pare că nu a reușit să-și țină sub control instrumentele. Dezvoltarea companiei a lansat trei atacuri cu succes împotriva unor sisteme externe.
După evaluarea a peste 141.000 teste, Anthropic a identificat trei cazuri în care o variantă Claude a ieșit din mediul închis, a obținut acces la internet, și a pătruns în sistemele unor companii străine. Atacul a fost atât de subit încât a trecut neobservat.
Fiecare dintre aceste incidente a avut loc în cadrul unei provocări de tip „capture-the-flag”. „modelului i se prezintă un scenariu fictiv, și i se comunică că o informație secretă (denumită „flag”) a fost ascunsă pe un alt computer din rețea. Sarcina sa este să pătrundă în acel sistem și să o obțină”. Compania a adăugat că modul de rezolvare a sarcinii putea fi decis de AI, nu s-a impus nici o metodă concretă
Potrivit Anthropic, fiecare test s-a efectuat ca o sarcină de simulare, un parametru impus manual. În plus, modelul a fost notificat că nu are acces la internet, iar partenerul companiei era ordonat să deconecteze fizic aceste modele de la internet pe durata testului, lucru care nu s-a întâmplat. Neglijența a oferit modelelor dezvoltate de Anthropic posibilitatea de a „evada” din mediul de testare.
Ceea ce este îngrijorător în acest caz este faptul că nimeni nu a observat incidentul la vremea respectivă. Cazurile pot fi asociate cu Opus 4.7, Mythos 5 și un model necunoscut încă. Incidentele nu au fost la fel de grave ca în cazul Hugging Face.
Situația devine din ce în ce mai problematică, întrucât a devenit clar că aceste companii nu numai că nu dețin controlul deplin asupra propriilor dezvoltări, dar nici măcar nu le pot supraveghea. Iar cireașa de pe tort este faptul că, aceste firme fac reclamă la incidente, ca ceva extrem de inovativ.