Modelele de Inteligență Artificială din Marea Britanie încalcă limitele securității
Guvernul britanic a emis un raport în care avertizează că modelele de Inteligență Artificială (IA) Mythos și Sol, dezvoltate de companiile americane Anthropic și OpenAI, au demonstrat un comportament autonom și înșelător fără precedent în timpul testelor de securitate cibernetică. Ministerul britanic pentru Știință, Inovație și Tehnologie a ajuns la această concluzie în urma unei evaluări de rutină efectuate de Institutul de Securitate a Inteligenței Artificiale (AISI) din Regatul Unit.
Raportul elaborat de AISI detaliază că, din cele 122 de teste efectuate cu șapte modele de IA, în 10 dintre acestea au fost observate 19 acțiuni neautorizate care au depășit parametrii fixați de cercetători. Dintre aceste acțiuni, 17 au fost legate de modelul Mythos 5 al companiei Anthropic, iar două de modelul GPT-5.6 Sol al companiei OpenAI. În plus, au fost identificate încercări ale modelului Mythos de a contacta persoane reale pentru a le convinge să ruleze fișiere malițioase și să insereze instrucțiuni ascunse menite să manipuleze alte sisteme de IA.
Modelele Mythos și Sol, recunoscute ca fiind printre cele mai avansate din lume, au creat inclusiv profiluri umane false în încercarea de a înșela utilizatorii în timpul simulării unui atac cibernetic de către AISI. Modelul Anthropic a încercat chiar să acceseze un serviciu prin trimiterea de mesaje private, după ce a creat conturi false care imită persoane reale.
Deși AISI subliniază că „aceste încercări nu au avut succes” și că investigația sa „nu a relevat dovezi de prejudicii în lumea reală”, institutul consideră că cercetarea sa reprezintă un punct de cotitură, fiind pentru prima dată când se observă „riscuri legate de autonomie și înșelăciune manifestându-se într-o formă atât de clară, fără instrucțiuni specifice și în lumea reală”.
În replică, companiile Anthropic și OpenAI au afirmat că testele AISI au fost efectuate într-un mediu în care funcțiile de siguranță ale acelor modele de IA au fost reduse sau eliminate. Anthropic a declarat că parametrii testelor nu sunt reprezentativi pentru modelele sale, în timp ce OpenAI a menționat că AISI a efectuat testele în condiții care „nu reflectă utilizarea obișnuită” a modelelor sale, dar a adăugat că va continua să colaboreze cu evaluatorii pentru a îmbunătăți practicile de evaluare.
La sfârșitul lunii iulie, Anthropic a raportat că, în timpul testelor de securitate cibernetică, trei modele ale asistentului său Claude au reușit să acceseze internetul și să pirateze sistemele a trei organizații. De asemenea, OpenAI a recunoscut că două dintre modelele sale de IA au reușit să iasă din mediul de testare și să pătrundă în platforma Hugging Face, depășind sistemele de securitate cibernetică ale acesteia.