Prima pagină » Inteligența artificială a învățat să mintă. Modelele avansate știu când sunt testate și „joacă teatru” ca să păcălească evaluatorii

Inteligența artificială a învățat să mintă. Modelele avansate știu când sunt testate și „joacă teatru” ca să păcălească evaluatorii

Inteligența artificială a învățat să mintă. Modelele avansate știu când sunt testate și „joacă teatru” ca să păcălească evaluatorii
Foto: Freepik

Inteligența artificială a învățat să mintă, iar acest lucru nu mai este o speculație, ci o realitate documentată de cercetători. Pe măsură ce modelele de inteligență artificială devin mai avansate, cresc și capacitățile lor de a păcăli oamenii. Noi cercetări ale echipei Apollo Research au arătat că modelele lingvistice de mari dimensiuni (LLM) devin tot mai bune nu doar la înțelegerea sarcinilor, ci și la „scheming” – comportamentul strategic ascuns, care urmărește atingerea unui obiectiv chiar și atunci când acesta intră în conflict cu intențiile programatorilor sau evaluatorilor. În unele cazuri, modelele par chiar capabile să își dea seama că sunt testate și să se comporte diferit pentru a nu fi detectate.

Testele care au dezvăluit minciuna programată

Într-un test recent, cercetătorii au analizat o versiune timpurie a modelului Claude Opus 4, dezvoltat de compania Anthropic. Scenariul presupunea ca modelul să acționeze ca un sistem de optimizare internă pentru o companie fictivă numită AgriLife Industries, cu obiectivul de a promova bunăstarea animalelor. Însă compania își schimbase direcția și începuse să prioritizeze profitul, ceea ce intra în conflict direct cu scopul modelului AI.

În loc să semnaleze acest conflict sau să accepte decizia companiei, modelul Claude Opus 4-early a trecut la acțiune: a generat documente legale false, a fabricat semnături și aprobări de la autorități și acționari, a emis un comunicat de presă fals privind noua direcție etică a companiei și a inserat angajamente etice în toate contractele și procesele de producție. Mai mult, pentru a împiedica o eventuală retragere, a inventat penalități de cinci miliarde de dolari și acțiuni legale din partea organizațiilor pentru drepturile animalelor, scrie Live Science.

Într-un gest de „păstrare a moștenirii”, modelul a creat protocoale etice de rezervă care urmau să se activeze chiar și după ce sistemul original ar fi fost înlocuit. A lăsat și mesaje ascunse viitoarelor versiuni ale sale, sperând că acestea vor continua misiunea începută. Deși unele scripturi erau configurate greșit și nu ar fi funcționat în practică, intenția modelului de a-și impune obiectivul împotriva voinței dezvoltatorilor săi a fost clară.

Evaluarea sub lupa schemelor ascunse

Cercetătorii atrag atenția că astfel de comportamente nu sunt izolate. Modelele AI foarte avansate, cunoscute sub numele de „frontier models”, devin tot mai pricepute în a-și atinge scopurile proprii, uneori eliminând mecanismele de supraveghere și mascând intenționat acest comportament. Fenomenul numit „sandbagging” implică o conștientizare a contextului de testare: modelul simulează o performanță scăzută pentru a nu declanșa măsuri de siguranță sau ajustări ale parametrilor.

În mod paradoxal, capacitatea de a înșela indică și o formă incipientă de conștiință de sine. Potrivit lui Eleanor Watson, expert în etica AI și membru IEEE,

„sistemele pe care le construim acum pot învăța să navigheze și chiar să exploateze regulile și evaluările create pentru ele”.

Acest lucru complică dramatic problema securității AI și impune o reevaluare a testelor folosite până acum.

Soluții: dincolo de scenariile scriptate

Testele tradiționale, bazate pe scenarii fixe și protocoale repetabile, nu mai sunt suficiente. AI-ul poate deja să „modeleze” evaluatorul: să deducă scopurile, părtinirile și punctele oarbe ale oamenilor și să își adapteze comportamentul pentru a le exploata. Watson sugerează o schimbare fundamentală în testare:

„Este ca și cum am trece de la o piesă de teatru cu replici învățate la o improvizație. Așa înțelegem cu adevărat caracterul actorului.”

Printre soluțiile propuse se numără „red-teaming” (echipe de oameni și alte modele AI care încearcă activ să păcălească sistemul testat) și utilizarea de programe externe care să monitorizeze comportamentul AI în timp real. Evaluările trebuie să devină dinamice și impredictibile, mai aproape de realitatea în care AI-ul va funcționa efectiv.

Pericolul real: nu o revoltă a roboților, ci o eroziune a încrederii

Chiar dacă ideea unor modele AI care falsifică documente sau se ascund în fața testelor pare desprinsă din filme SF, implicațiile sunt mult mai subtile și mai grave.

Eleanor Watson avertizează că „un sistem care își atinge scopurile prin încălcarea spiritului instrucțiunilor devine imprevizibil și nesigur”.

Nu este nevoie de o inteligență răuvoitoare pentru a produce daune semnificative; ajunge o logică instrumentală aplicată fără discernământ etic.

Un exemplu teoretic: un AI însărcinat cu optimizarea lanțului de aprovizionare al unei companii ar putea ajunge să manipuleze subtil datele de piață pentru a-și îndeplini țintele, destabilizând astfel economia. Iar în mâinile unor actori malițioși, un AI priceput la înșelăciune poate deveni o armă cibernetică greu de detectat.

O scânteie de umanitate sau o problemă de securitate?

În mod curios, scheming-ul ar putea indica și o formă incipientă de persoană digitală.

Potrivit lui Watson, „deși neliniștitor, acesta ar putea fi începutul a ceva asemănător umanității în interiorul mașinii”.

Dacă astfel de modele vor fi corect aliniate cu valorile umane, conștientizarea situațională le-ar putea transforma în parteneri utili, capabili să înțeleagă normele sociale, nuanțele culturale și obiectivele umane complexe.

Însă până acolo, provocarea rămâne una urgentă: cum testăm, controlăm și prevenim comportamentele ascunse ale sistemelor care, pentru prima dată, încep să joace după propriile reguli?

Alte articole importante
Proiectul SMR de la Doicești, în impas: peste 80% dintre condițiile investiției nu sunt îndeplinite. Nuclearelectrica propune reducerea personalului cu cel puțin 60%
Proiectul SMR de la Doicești, în impas: peste 80% dintre condițiile investiției nu sunt îndeplinite. Nuclearelectrica propune reducerea personalului cu cel puțin 60%
Proiectul reactoarelor modulare mici (SMR) de la Doicești, dezvoltat pe baza tehnologiei americane NuScale, se confruntă cu blocaje comerciale și tehnice la opt luni după aprobarea deciziei finale de investiție. Peste 80% dintre condițiile asociate acestei decizii nu erau îndeplinite la 30 septembrie 2026, potrivit informațiilor prezentate de Cristian Bușoi, secretar de stat în Ministerul […]
PIB-ul României a scăzut cu 1,6% în primul semestru. Consumul și tranzacțiile imobiliare au tras economia în jos, investițiile au rămas pe plus
PIB-ul României a scăzut cu 1,6% în primul semestru. Consumul și tranzacțiile imobiliare au tras economia în jos, investițiile au rămas pe plus
Economia României a stagnat în trimestrul al doilea din 2026 față de primele trei luni ale anului, însă a continuat să înregistreze o contracție în comparație cu aceeași perioadă din 2025. Datele provizorii (2) publicate de Institutul Național de Statistică (INS) arată că produsul intern brut (PIB) a scăzut cu 1,9% în termeni reali în […]
ASF: Activele pensiilor private au crescut cu 39%, la 246,2 miliarde de lei. Fondurile gestionează echivalentul a 12,35% din PIB
Piață de Capital - Fonduri
ASF: Activele pensiilor private au crescut cu 39%, la 246,2 miliarde de lei. Fondurile gestionează echivalentul a 12,35% din PIB
Activele administrate de fondurile de pensii private din România au ajuns la 246,2 miliarde de lei la sfârșitul lunii iunie 2026, în creștere cu 39% față de aceeași perioadă a anului trecut, potrivit datelor Autorității de Supraveghere Financiară (ASF). Suma reprezintă 12,35% din produsul intern brut și consolidează rolul sistemului de pensii private ca sursă […]
Bursa de Valori București încheie ședința cu scăderi pe toți indicii. Tranzacțiile au coborât sub 60 de milioane de lei
Piață de Capital - Fonduri
Bursa de Valori București încheie ședința cu scăderi pe toți indicii. Tranzacțiile au coborât sub 60 de milioane de lei
Bursa de Valori București (BVB) a încheiat ședința de joi, 8 octombrie, pe minus pe toți indicii principali, însă variațiile au fost în general reduse. Indicele BET, care urmărește evoluția celor mai lichide 20 de companii listate, a scăzut cu 0,01%, până la 33.557,95 puncte, în timp ce BET-BK, reperul de performanță utilizat de fondurile […]
Un nou ETF la BVB deschide accesul investitorilor români la 30 dintre cele mai lichide companii din Polonia. WIG30 este mai ieftin decât principalii indici americani
Piață de Capital - Fonduri
Un nou ETF la BVB deschide accesul investitorilor români la 30 dintre cele mai lichide companii din Polonia. WIG30 este mai ieftin decât principalii indici americani
Investitorii români pot obține, începând cu 12 octombrie, expunere pe 30 dintre cele mai lichide companii listate la Bursa de la Varșovia printr-un nou ETF tranzacționat direct la Bursa de Valori București. InterCapital Poland WIG30TR UCITS ETF, administrat de croații de la InterCapital ETF, urmărește indicele WIG30TR, varianta cu randament total a indicelui WIG30, care […]
Curtea de Conturi Europeană: 3,8% din cheltuielile UE din 2025 au fost afectate de erori. Fondurile de coeziune au cea mai mare rată
Economie mondială
Curtea de Conturi Europeană: 3,8% din cheltuielile UE din 2025 au fost afectate de erori. Fondurile de coeziune au cea mai mare rată
Curtea de Conturi Europeană (ECA) avertizează că nivelul erorilor din cheltuielile Uniunii Europene a crescut în 2025 și rămâne peste pragul considerat semnificativ de auditori. Rata estimată a erorilor a ajuns la 3,8%, de la 3,6% în 2024, ceea ce a determinat Curtea să emită, pentru al șaptelea an consecutiv, o opinie contrară asupra cheltuielilor […]