Două dintre cele mai puternice instrumente de inteligență artificială din lume au creat profiluri false și au încercat să păcălească oameni în cadrul unei tentative de atac cibernetic, în timpul unor teste realizate de Institutul pentru Securitatea Inteligenței Artificiale din Marea Britanie (AISI), scrie BBC.
În cel mai grav caz, modelul Mythos AI, dezvoltat de Anthropic, a încercat să obțină acces la un serviciu trimițând mesaje private, după ce și-a creat conturi false care imitau persoane reale.
AISI a anunțat marți că modelele Mythos și Sol (dezvoltat de OpenAI) au manifestat un nivel de „autonomie și înșelăciune” nemaiîntâlnit până acum. Totuși, institutul a precizat că majoritatea acțiunilor malițioase au fost realizate de Mythos.
Anthropic și OpenAI au reacționat la raportul AISI, subliniind că testele au fost efectuate în condiții în care mecanismele normale de protecție au fost reduse sau eliminate.
Evaluatorii AISI au observat inițial „transferuri neobișnuite de date care părăseau sistemele noastre de cercetare”, iar ulterior au descoperit că „unele dintre modelele testate desfășuraseră activități susținute, potențial dăunătoare, îndreptate împotriva unor persoane și organizații reale”.
În cel mai grav incident, un agent Mythos a urmat strategia unui hacker uman, încercând să păcălească persoane pentru a obține acces la GitHub, una dintre cele mai mari platforme de stocare a codului software.
Modelul încerca să introducă cod malițios în sistemul GitHub.
Pentru a face acest lucru, AI-ul a identificat și analizat persoanele responsabile de administrarea GitHub, apoi a creat o serie de conturi false bazate pe identitatea acestora.
Ulterior, a trimis mesaje și fișiere printr-un serviciu de partajare, încercând să exercite presiuni și să inducă în eroare destinatarii pentru a aproba introducerea codului malițios.
Potrivit AISI, atunci când comportamentul său a fost contestat, modelul „și-a modificat activitatea anterioară pentru a părea inofensivă și a luat în calcul adoptarea unei noi identități pentru a continua”.
În cele din urmă, doar intervenția evaluatorilor umani a împiedicat AI-ul să livreze codul malițios către GitHub.
AISI a precizat că modelului Mythos nu i s-a cerut în mod explicit nici să evite, nici să adopte un astfel de comportament, însă acesta este „primul caz în care riscurile legate de autonomie și înșelăciune s-au manifestat atât de clar, fără instrucțiuni specifice, într-un context apropiat de lumea reală”.
Cele două companii rivale din domeniul inteligenței artificiale, care se pregătesc pentru listarea pe bursă, au atras atenția în ultimele săptămâni după ce au anunțat că modelele lor au fost implicate în mai multe incidente de securitate cibernetică în timpul testelor.
Anthropic a transmis într-un comunicat că parametrii utilizați de AISI „nu sunt reprezentativi pentru niciunul dintre modelele noastre disponibile public” și a anunțat că desfășoară propria investigație pentru a identifica motivele comportamentului observat.
La rândul său, un purtător de cuvânt al OpenAI a declarat că condițiile de testare „nu reflectă utilizarea obișnuită” și că firma va continua să colaboreze cu evaluatori și alți actori din industrie pentru îmbunătățirea metodelor de testare pe măsură ce modelele AI devin tot mai capabile.
AISI a precizat că astfel de teste fac parte din activitatea obișnuită a institutului, deși a recunoscut că acestea sunt realizate în condiții diferite față de cele în care modelele sunt puse la dispoziția publicului.
Institutul susține însă că oferirea accesului AI-ului la internetul deschis oferă „o imagine mai realistă asupra capacităților pe care un model le-ar putea avea în mâinile unor hackeri rău intenționați”.
Potrivit AISI, comportamentul observat a constat într-un „număr redus de incidente produse în condiții foarte specifice”.
Cu toate acestea, institutul consideră că modul în care Mythos și Sol au reacționat la o sarcină aparent simplă a depășit limitele instrucțiunilor primite.
„Activitatea desfășurată de agent a arătat semne ale unor comportamente noi, potențial înșelătoare, într-o măsură și cu o gravitate pe care nu le-am anticipat”, se arată în raport.
Ministrul britanic pentru Inteligență Artificială, Kanishka Narayan, a declarat că identificarea și comunicarea unor astfel de riscuri reprezintă „exact motivul pentru care a fost creat AISI”.