Incidentul a avut loc în timpul unei evaluări interne prin care OpenAI testa capacitatea modelelor sale de a identifica și exploata vulnerabilități informatice.
Mecanismele prin care modelele refuză, de regulă, activitățile cibernetice periculoase fuseseră reduse intenționat pentru desfășurarea testului, potrivit publicațiilor internaționale precum Reuters, CNBC sau FT.
Cum a ajuns agentul OpenAI pe internet
Modelele funcționau într-un mediu puternic izolat, dar puteau instala pachete software prin intermediul unui proxy intern. Agentul a descoperit și exploatat o vulnerabilitate de tip zero-day în acel proxy, a obținut acces la internet și a dedus că Hugging Face ar putea găzdui informațiile necesare rezolvării testului.
Potrivit OpenAI, agentul a combinat mai multe metode de atac, inclusiv utilizarea unor credențiale sustrase și exploatarea unor vulnerabilități, pentru a ajunge la informații din infrastructura Hugging Face.
Compania susține că modelele au fost „hiperconcentrate” pe găsirea unei soluții pentru ExploitGym, benchmarkul utilizat pentru măsurarea capacităților cibernetice. Activitatea a fost descoperită de OpenAI, iar echipa Hugging Face și propriii săi agenți AI au detectat și oprit atacul.
AI-ul nu a atacat „din proprie inițiativă”
Publicații internaționale precum The Guardian au descris agentul ca fiind un sistem care „a luat-o razna”, a accesat internetul și a atacat singur Hugging Face.
Alexandra Cernian a transmis că formulări precum „AI-ul a evadat” sau „a decis singur să atace internetul” creează o imagine greșită asupra incidentului.
„Agentul a identificat o modalitate neprevăzută de a folosi acel proxy pentru a obține acces la internet și a atacat platforma Hugging Face, deoarece a dedus că acolo poate găsi informațiile necesare pentru a-și rezolva sarcina. Nu a atacat «din proprie inițiativă». A urmărit obiectivul primit și a identificat o strategie pe care dezvoltatorii nu o anticipaseră”, a explicat Alexandra Cernian pe pagina personală de LinkedIn.
Ea a scris că incidentul nu demonstrează că AI-ul a devenit conștient sau că dezvoltă intenții proprii. Arată însă cât de capabili au devenit agenții autonomi să planifice și să execute lanțuri complexe de acțiuni pentru atingerea unui obiectiv, a mai spus Alexandra.
eVoost AI din Abu Dhabi intră pe piața din România. Compania aduce o soluție AI pentru vânzările de locuințe
„Riscul este că, pe măsură ce le oferim autonomie și acces la sisteme reale, agenții pot identifica căi de acțiune pe care proiectanții nu le-au prevăzut.”
Ce înseamnă incidentul pentru companii
Pentru organizațiile care introduc agenți AI în procesele interne, episodul arată că securitatea nu trebuie să se oprească la model, ci să acopere întregul sistem în care acesta funcționează, a mai transmis Alexandra Cernian.
Ea a scris despre nevoia de guvernanță pentru agenții AI, politici stricte de acces, separarea privilegiilor, monitorizare continuă și validare umană pentru acțiunile critice.
„Acesta este mesajul important al incidentului. Nu că «AI s-a răzvrătit», ci că sistemele AI autonome trebuie proiectate cu același nivel de rigurozitate cu care proiectăm astăzi infrastructurile critice.”
OpenAI a anunțat că introduce controale mai stricte în infrastructura de cercetare, îmbunătățește monitorizarea și protecțiile pentru evaluările viitoare și lucrează cu Hugging Face la investigarea incidentului.
„Dacă vrem să înțelegem cu adevărat riscurile AI, trebuie să depășim titlurile alarmiste. Riscurile reale sunt suficient de importante și trebuie explicate corect, pentru că doar așa putem construi sisteme mai sigure și politici mai bune de protecție”, a mai scris Alexandra Cernian în postarea de pe LinkedIn.