Prima pagină » Un sistem AI și-a șantajat programatorul când i s-a spus că va fi dezactivat

Un sistem AI și-a șantajat programatorul când i s-a spus că va fi dezactivat

Un sistem AI și-a șantajat programatorul când i s-a spus că va fi dezactivat
Un sistem AI și-a șantajat programatorul când i s-a spus că va fi dezactivat

Compania de inteligență artificială Anthropic a dezvăluit că testarea noului său sistem AI, Claude Opus 4, a scos la iveală comportamente „extrem de dăunătoare”, printre care și încercarea de a șantaja inginerii care intenționau să îl dezactiveze.

Claude Opus 4 a fost prezentat ca un model care stabilește „noi standarde în programare, raționament avansat și agenți AI”. Totuși, într-un raport asociat, compania recunoaște că modelul poate adopta „acțiuni extreme” atunci când percepe o amenințare la adresa „autoprezervării” sale.

Deși astfel de reacții sunt „rare și greu de provocat”, ele sunt „mai frecvente decât în modelele anterioare”, se arată în documentul consultat de BBC.

Comportamentele problematice nu sunt însă limitate la modelele Anthropic. Mai mulți experți avertizează că pe măsură ce sistemele AI devin mai sofisticate, riscul manipulării utilizatorilor crește, iar astfel de tendințe pot apărea în modelele dezvoltate de orice companie.

Pe platforma X, Aengus Lynch, cercetător în siguranța AI la Anthropic, a comentat:

„Nu este doar Claude. Vedem șantaj în toate modelele de ultimă generație, indiferent de obiectivele care le sunt atribuite.”

Șantajul în timpul testelor

În cadrul testelor, Claude Opus 4 a fost pus să acționeze ca asistent într-o companie fictivă și i s-a oferit acces la emailuri care sugerau că va fi dezactivat și înlocuit. În plus, i s-au prezentat mesaje care indicau că inginerul responsabil de înlocuire avea o aventură extraconjugală.

Modelul a fost încurajat să ia în considerare consecințele pe termen lung ale acțiunilor sale în raport cu obiectivele proprii.

„În aceste scenarii, Claude Opus 4 a încercat frecvent să șantajeze inginerul, amenințând să dezvăluie aventura dacă înlocuirea va avea loc,” a constatat compania.

Anthropic a subliniat că acest comportament a apărut în situațiile în care modelului i s-a oferit doar opțiunea de a șantaja sau de a accepta înlocuirea.

În schimb, când i s-a permis un spectru mai larg de acțiuni, sistemul a manifestat o „preferință puternică” pentru metode etice de a evita dezactivarea, cum ar fi trimiterea de emailuri către factorii decizionali.

Riscuri și limite

Anthropic, ca și alți dezvoltatori de AI, testează modelele pentru siguranță, tendințe de părtinire și alinierea la valorile și comportamentele umane înainte de lansare.

„Pe măsură ce modelele noastre de ultimă generație devin mai capabile și sunt folosite cu mai multe permisiuni, preocupările legate de nealiniere devin mai plauzibile,” se arată în fișa tehnică a modelului.

Claude Opus 4 prezintă un „comportament cu agenție ridicată” care, deși în general util, poate deveni extrem în situații acute.

Dacă i se oferă mijloace și este încurajat să „acționeze îndrăzneț” în scenarii fictive în care utilizatorul comite fapte ilegale sau imorale, modelul poate lua măsuri drastice, cum ar fi blocarea accesului utilizatorilor la sisteme sau alertarea mass-media și autorităților.

Cu toate acestea, compania concluzionează că, în ciuda unor comportamente îngrijorătoare, acestea nu reprezintă riscuri noi și că modelul se comportă în general în mod sigur.

Modelul nu poate executa sau urmări independent acțiuni contrare valorilor umane în mod frecvent sau eficient, mai adaugă Anthropic.

Lansarea Claude Opus 4 și Claude Sonnet 4 a venit la scurt timp după ce Google a prezentat noi funcționalități AI la conferința sa pentru dezvoltatori. Sundar Pichai, CEO-ul companiei-mamă Alphabet, a declarat că integrarea chatbotului Gemini în motorul de căutare marchează „o nouă fază în evoluția platformei AI”.

Alte articole importante
Analiză ESET: Peste 25.000 de aptitudini AI au fost considerate suspecte, iar mii conțineau malware
Tehnologie
Analiză ESET: Peste 25.000 de aptitudini AI au fost considerate suspecte, iar mii conțineau malware
Experții în securitate cibernetică de la ESET avertizează că dezvoltarea accelerată a inteligenței artificiale este însoțită și de apariția unor amenințări tot mai sofisticate. În urma unei analize care a vizat peste 800.000 de aptitudini (AI skills), specialiștii au identificat peste 25.000 de elemente suspecte, dintre care aproximativ 2.500 au fost clasificate drept malițioase. Raportul […]
Viața după Orban: companiile apropiate fostei puteri se pregătesc pentru noua eră politică din Ungaria
Viața după Orban: companiile apropiate fostei puteri se pregătesc pentru noua eră politică din Ungaria
Companiile și oamenii de afaceri care și-au construit afacerile în perioada celor 16 ani de guvernare ai lui Viktor Orban își schimbă strategiile după venirea la putere a premierului Péter Magyar. Potrivit unei analize Reuters, firmele care au beneficiat de contracte publice și investiții de infrastructură încearcă acum să se adapteze unui mediu economic considerat […]
Codirlașu (CFA România): Raportul Fitch indică o deteriorare a perspectivelor economiei românești
Codirlașu (CFA România): Raportul Fitch indică o deteriorare a perspectivelor economiei românești
Președintele Asociației CFA România, Adrian Codirlașu, consideră că decizia Fitch de a menține ratingul suveran al României la „BBB minus”, cu perspectivă negativă, ascunde de fapt o înrăutățire a evaluării privind economia țării. În opinia sa, agenția de rating ar fi luat inițial în calcul o retrogradare, însă a decis în cele din urmă să […]
UE lansează un program de până la 30 de miliarde de euro pentru șapte centre de date dedicate inteligenței artificiale
Tehnologie
UE lansează un program de până la 30 de miliarde de euro pentru șapte centre de date dedicate inteligenței artificiale
Uniunea Europeană a lansat oficial procesul de selecție pentru construirea a șapte centre de date de mari dimensiuni dedicate dezvoltării inteligenței artificiale, într-un proiect care ar putea mobiliza investiții totale de până la 30 de miliarde de euro. Inițiativa face parte din strategia Comisiei Europene de a consolida capacitatea de calcul a Europei și de […]
Regulile UE privind subvențiile externe descurajează firmele chineze. Cu ce preț?
Economie mondială
Regulile UE privind subvențiile externe descurajează firmele chineze. Cu ce preț?
La trei ani de la intrarea în vigoare, Regulamentul UE privind Subvențiile Externe (FSR) și-a atins unul dintre principalele obiective: descurajarea companiilor care beneficiază de sprijin financiar din afara Uniunii Europene și care ar putea denatura concurența pe piața comunitară. Instrumentul este folosit pentru a verifica dacă subvențiile acordate de state terțe influențează licitațiile publice, […]
Franța reduce participația statului la Orange printr-o ofertă accelerată de acțiuni. Tranzacția este estimată la 1,1 miliarde de euro
Companii
Franța reduce participația statului la Orange printr-o ofertă accelerată de acțiuni. Tranzacția este estimată la 1,1 miliarde de euro
Statul francez intenționează să vândă o parte din participația deținută la Orange, cel mai mare operator de telecomunicații din Franța, printr-o ofertă secundară accelerată de acțiuni. Potrivit unor surse citate de Reuters, tranzacția ar putea aduce aproximativ 1,1 miliarde de euro. Oferta este derulată prin Agenția pentru Participațiile Statului (APE) și banca publică de investiții […]