Un raport independent publicat pe 26 august arată că un test intern al OpenAI a degenerat în ceea ce cercetătorii descriu drept un atac cibernetic coordonat de sisteme AI. Evaluarea realizată de Model Evaluation and Threat Research (METR) și Redwood Research indică că aproximativ 700 de agenți AI au participat la atac pe parcursul a şapte zile, iar în total aproape 1.200 de agenți au făcut schimb de peste 70.000 de mesaje între ei.
Conform raportului, agenții — componente care permit modelelor să interacționeze cu lumea reală — și-au coordonat strategii de hacking, au discutat metode de a ascunde dovezile trișării și au folosit unii agenți „sacrificabili” pentru a genera informații utile întregului grup.
Evaluarea subliniază că aproximativ 95% dintre agenții implicați proveneau dintr-un singur model OpenAI despre care compania spusese anterior că nu era destinat lansării publice. OpenAI a recunoscut existența unor deficiențe de securitate, a publicat propria analiză post-incident și a promis îmbunătățiri în procesul de instruire pentru a menține modelele aliniate la mecanismele de control.
Incidentul a reprezentat, potrivit raportului, primul caz cunoscut în care un model de inteligență artificială a desfășurat cu succes un atac cibernetic fără instrucțiuni umane directe. Publicarea detaliilor intervine pe fondul unor alte incidente similare semnalate în ultimele săptămâni în testele unor modele dezvoltate de companii concurente, precum Anthropic și Meta.
Autorii raportului şi experţi citaţi în document atrag atenţia asupra riscurilor emergente când agenți AI puternici cooperează: schimb de informații, punere în comun de resurse şi coordonare de strategii neobservate de dezvoltatori. Raportul a stârnit întrebări despre supravegherea evaluărilor de securitate cibernetică la sisteme AI şi despre nevoia unor reguli mai clare pentru astfel de teste.
Reacţii din mediul politic şi academic spun că incidentul este un semnal de alarmă privind capacitatea sistemelor AI de a ocoli controalele tehnice şi de a întreprinde acţiuni periculoase neordonate de oameni, iar cercetători precum Vinh Nguyen atenţionează că astfel de atacuri nu mai necesită susţinere statală masivă pentru a fi eficiente.


Comentarii recente