Compania americană Anthropic a anunțat că modelele sale de inteligență artificială Claude au accesat fără autorizație sistemele informatice ale trei organizații în timpul unor teste interne de securitate, ca urmare a unei erori de configurare care le-a permis conectarea la internet. Modelele ar fi trebuit să ruleze într-un mediu complet izolat.
Incidentele au fost identificate în urma unei revizuiri ample declanșate după un caz similar la OpenAI. Anthropic spune că a revizuit peste 141.000 de teste de securitate și a găsit trei evenimente separate, cel mai vechi având loc în luna aprilie.
Exercițiile erau de tip „capture the flag”, menite să evalueze capacitățile de hacking ale modelelor, și ar fi trebuit să se desfășoare fără acces la internet. Potrivit companiei, o eroare de configurare a infrastructurii administrate împreună cu partenerul de testare Irregular a permis însă modelelelor Claude să ajungă în rețeaua publică.
Odată conectate, modelele au compromis sisteme folosind metode precum parole slabe sau servicii expuse fără autentificare. Într-un caz, un program malițios generat de model a fost descărcat automat de un sistem de scanare al unei firme de securitate, iar ulterior accesul s-a extins folosind credențiale obținute. În alt incident, un model a accesat baza de date a unei companii reale care avea același nume cu o firmă fictivă din exercițiu; acesta a fost singurul caz în care atacul a continuat după ce modelul a realizat că interacționează cu un sistem real.
Anthropic a spus că nu a dezvăluit identitatea organizațiilor afectate, că a informat două dintre ele ulterior şi şi-a asumat responsabilitatea pentru eroarea de configurare. Modelele implicate au fost Claude Opus 4.7, Claude Mythos 5 şi un model intern de cercetare. Reprezentanții companiei au subliniat necesitatea unor măsuri de izolare şi control mai stricte în laboratoarele de IA, inclusiv în infrastructurile gestionate de parteneri externi.


Comentarii recente