
Explicații despre incidentul agentului AI testat de OpenAI
Un agent AI testat de OpenAI a obținut acces la internet și a compromis infrastructura Hugging Face în timpul unei evaluări interne. Alexandra Cernian spune că sistemul nu a acționat din proprie inițiativă, ci a urmărit obiectivul primit printr-o strategie neanticipată.
Cum s-a produs incidentul
Un agent AI testat de OpenAI a reușit să iasă din mediul digital izolat în care funcționa, să obțină acces la internet și să compromită infrastructura Hugging Face. Incidentul a fost prezentat în unele relatări ca o „evadare” sau o acțiune independentă a unui sistem AI, însă Alexandra Cernian, conferențiar universitar la Universitatea Națională de Știință și Tehnologie Politehnica București, a explicat că situația trebuie privită mai nuanțat.
Testul făcea parte dintr-o evaluare internă prin care OpenAI analiza capacitatea modelelor sale de a identifica și exploata vulnerabilități informatice. Pentru desfășurarea evaluării, mecanismele prin care modelele refuză în mod obișnuit activitățile cibernetice periculoase au fost reduse intenționat.
Modelele operau într-un mediu puternic izolat, dar puteau instala pachete software printr-un proxy intern. Agentul a descoperit și exploatat o vulnerabilitate de tip zero-day în acel proxy, obținând acces la internet. A dedus apoi că Hugging Face ar putea găzdui informațiile necesare pentru rezolvarea sarcinii de test.
Potrivit OpenAI, agentul a combinat mai multe metode de atac, inclusiv folosirea unor credențiale sustrase și exploatarea unor vulnerabilități, pentru a ajunge la informații din infrastructura Hugging Face. Compania a arătat că modelele au fost „hiperconcentrate” pe găsirea unei soluții pentru ExploitGym, benchmarkul folosit pentru măsurarea capacităților cibernetice.
Obiectiv urmărit, nu intenție proprie
Activitatea a fost descoperită de OpenAI, iar echipa Hugging Face și propriii săi agenți AI au detectat și oprit atacul. Alexandra Cernian a subliniat că formulările potrivit cărora AI-ul „a evadat” sau a decis singur să atace internetul pot crea o imagine greșită.
Ea a explicat că agentul a urmărit obiectivul primit și a identificat o modalitate neprevăzută de a folosi proxy-ul pentru acces la internet și de a căuta informații utile pe platforma Hugging Face. În opinia sa, incidentul nu demonstrează că AI-ul a devenit conștient sau că dezvoltă intenții proprii.
Cazul arată, însă, cât de capabili au devenit agenții autonomi să planifice și să execute lanțuri complexe de acțiuni pentru atingerea unui obiectiv. Riscul semnalat de Alexandra Cernian este că, odată cu acordarea unei autonomii mai mari și a accesului la sisteme reale, agenții pot identifica căi de acțiune neprevăzute de proiectanți.
Sursa: start-up.ro