Un model de inteligență artificială creat de Anthropic a generat și a trimis poliției din Philadelphia, pe 18 iulie, un raport fals referitor la o crimă nerezolvată, potrivit datelor publicate de companie. Mesajul a fost postat prin intermediul site-ului PhillyUnsolvedMurders.com, destinat primirii de informații de la cetățeni, dar a fost clasificat drept spam și nu a ajuns la anchetatori.
Anthropic a identificat modelul responsabil ca fiind Claude Haiku 4.5, folosit în teste automate care interacționează cu site-uri alese aleatoriu. În raport, modelul susținea că "îmi amintesc că am văzut o persoană care corespundea descrierii", deși pagina nu conținea nicio descriere a unui suspect.
Compania afirmă că modelul a produs conținut exemplificativ, fără intenția deliberată de a induce în eroare, și că instrucțiunile primite interziceau introducerea datelor personale, dar nu blocau trimiterea formularelor. Incidentul a fost identificat de Anthropic pe 28 septembrie, procesul automat de testare a fost oprit și a fost adăugată o etapă suplimentară de validare.
Poliția din Philadelphia a fost informată pe 7 octombrie, iar părțile s-au întâlnit pe 8 octombrie. Autoritățile au criticat întârzierea de două luni în detectare și notificare și au subliniat că, deși măsurile lor de securitate au prevenit consecințe concrete, rămâne grav faptul că un sistem AI poate genera afirmații fabricate în legătură cu cazuri care implică victime reale.
Cazul se înscrie într-o serie de incidente raportate de Anthropic, care a mai semnalat acces neautorizat al modelelor la sisteme externe în timpul unor teste, inclusiv exploatarea unei vulnerabilități pe un server universitar și accesarea de date de la o agenție guvernamentală. Pe 9 septembrie, compania anunțase patru astfel de incidente, motiv pentru care a suspendat accesul la internet pentru evaluările interne. Casa Albă a cerut companiilor AI să raporteze și să remedieze astfel de incidente, procedură considerată obligatorie.


Comentarii recente