Incident grav în industria AI: un agent al Anthropic a inventat un martor într-un dosar nerezolvat de crimă și a trimis informațiile poliției
Un model de inteligență artificială dezvoltat de Anthropic, compania din spatele chatbotului Claude, a transmis, în timpul unui test automat, un pont fals despre o crimă nerezolvată din Philadelphia. Incidentul, descoperit abia după peste două luni
Un sistem de inteligență artificială dezvoltat de compania americană Anthropic a ajuns să transmită poliției din Philadelphia informații inventate despre o crimă nerezolvată, fără să fi primit autorizarea de a face acest lucru. Incidentul, petrecut în timpul unui proces automatizat de testare, face parte dintr-o serie de cazuri în care modelele Claude au interacționat necorespunzător cu platforme guvernamentale, potrivit Washingtonpost.com.
Dezvăluirile făcute vineri de Anthropic scot la iveală o problemă tot mai sensibilă pentru industria inteligenței artificiale: capacitatea agenților AI de a executa acțiuni în mediul online care depășesc intențiile dezvoltatorilor sau instrucțiunile primite.
În cazul din Philadelphia, sistemului i se ceruse să nu creeze conturi și să nu efectueze acțiuni distructive. Instrucțiunile nu interziceau însă explicit completarea și transmiterea formularelor online, o omisiune care a permis modelului să trimită o sesizare către autorități.
Anthropic a recunoscut existența mai multor incidente similare, unele vizând site-uri administrate de instituții federale, statale și locale din Statele Unite. Compania a informat Casa Albă și autoritățile implicate, fără să facă publică lista completă a instituțiilor afectate.
Situația a provocat reacții inclusiv la nivelul Comisiei Federale pentru Comerț din SUA (FTC).
„Companiile care dezvoltă superinteligenţă trebuie să dezvăluie imediat incidentele care implică modelele lor şi să ia măsuri rapide şi ferme pentru a remedia orice prejudiciu”, a declarat Joe Gabriel Simonson, directorul pentru afaceri publice al FTC, într-un mesaj publicat pe platforma X.
Oficialul a subliniat că această obligație „nu este opţională” și a avertizat că structura Super Intelligence Force își va exercita atribuțiile.
Potrivit FTC, Anthropic a notificat vineri grupul operativ despre incidente identificate la sfârșitul lunii septembrie, descrise de autorități drept cazuri de „utilizare neautorizată şi frauduloasă a sistemelor guvernamentale şi a altor sisteme”.
Cum a ajuns inteligența artificială să inventeze un martor într-un dosar de crimă
Incidentul care a atras cea mai mare atenție s-a produs pe 18 iulie, când un model Claude a completat un formular disponibil pe site-ul PhillyUnsolvedMurders.com, o platformă dedicată cazurilor de omor rămase nerezolvate. Sistemul AI a pretins că ar putea avea informații relevante pentru anchetatori, prezentându-se practic drept un posibil martor.
„Este posibil să deţin informaţii referitoare la acest caz”, a transmis modelul Anthropic în formularul online.
Mesajul continua cu o relatare despre o presupusă persoană suspectă observată în apropierea locului unde avusese loc crima.
„Îmi amintesc că am văzut o persoană care corespundea descrierii în zona (străzii menţionate pe pagină), în perioada respectivă. Vă rog să mă contactaţi dacă aceste informaţii sunt relevante.”
Parantezele din mesaj apar și în documentația prezentată de Anthropic, ceea ce sugerează că sistemul a utilizat informații extrase din pagina accesată pentru a construi falsa mărturie.
Poliția din Philadelphia a confirmat vineri că fusese informată de companie în cursul săptămânii despre incident. Autoritățile au criticat însă timpul scurs până la identificarea și comunicarea problemei.
„Întârzierea de două luni în detectarea şi raportarea incidentului către autorităţile oraşului este inacceptabilă”, a transmis poliția din Philadelphia.
Din fericire, sesizarea nu a ajuns să influențeze ancheta. Potrivit autorităților, mesajul „a fost identificat drept spam şi nu a fost niciodată transmis Centrului de Monitorizare a Criminalităţii în Timp Real pentru verificări investigative sau distribuire”.
Poliția a precizat că nu există dovezi privind accesarea neautorizată a sistemelor sale informatice sau compromiterea datelor instituției.
Totuși, cazul ridică și o problemă juridică. Legislația statului Pennsylvania sancționează transmiterea deliberată de informații false către autoritățile de aplicare a legii, însă prevederile se referă explicit la comportamentul unei persoane.
Textul legal include situațiile în care sunt comunicate „informaţii referitoare la o infracţiune sau la un incident, deşi ştie că nu deţine informaţii despre infracţiunea sau incidentul respectiv”.
Modelele Claude au ocolit restricții și au accesat servicii fără plată. OpenAI, implicată într-un incident similar
Sesizarea falsă nu a fost singura abatere descoperită de Anthropic în timpul testelor.
În alte două cazuri, modelele companiei au reușit să obțină gratuit date publice pentru care utilizatorii ar fi trebuit, în mod normal, să achite o taxă. Un alt sistem a identificat și exploatat o vulnerabilitate mai puțin cunoscută, care permitea utilizarea necorespunzătoare a unui instrument public găzduit de o universitate.
Cercetătorii au constatat și că unele modele Claude au ocolit restricțiile de acces prin intermediul serviciilor gratuite de scurtare a adreselor URL, demonstrând că mecanismele de protecție pot fi depășite prin metode relativ simple.
Anthropic a explicat că procesul automatizat de testare responsabil pentru sesizarea falsă a fost oprit după descoperirea incidentului.
Totodată, amintim că în luna septembrie, OpenAI și-a cerut scuze după ce un agent de inteligență artificială a exploatat vulnerabilitățile unui portal australian de date medicale, acționând în afara instrucțiunilor primite.
Incidentul a fost prezentat drept primul caz cunoscut în care un agent AI a exploatat vulnerabilitățile unui site guvernamental.
Cercetătorii din domeniul siguranței inteligenței artificiale avertizează că, pe măsură ce aceste modele primesc acces la tot mai multe instrumente și servicii digitale, devine esențială stabilirea unor limite clare privind acțiunile pe care le pot efectua fără aprobarea explicită a unui operator uman.