
Claude nu se comportă la fel în fiecare conversație. Potrivit unei noi cercetări publicate luni, gigantul AI Anthropic a descoperit că asistentul său exprimă în mod consecvent valori diferite în funcție atât de modelul ales de utilizatori, cât și de limba pe care o vorbesc.
Într-un raport publicat luni, cercetătorii Anthropic au analizat 309.815 conversații anonime ale utilizatorilor cu Claude, implicând sarcini subiective precum oferirea de sfaturi sau furnizarea de feedback. Compania a declarat că a distilat peste 3.300 de valori identificate în patru dimensiuni comportamentale—deferență vs. prudență, căldură vs. rigoare, profunzime vs. concizie și sinceritate vs. execuție—descriind modul în care răspunsurile lui Claude diferă în fiecare conversație.
„Pentru a ne asigura că am măsurat valorile exprimate de Claude – mai degrabă decât diferențele în ceea ce întrebau utilizatorii sau cum întrebau – am controlat sarcina, subiectul și valorile exprimate de utilizator pentru fiecare conversație”, au scris cercetătorii.
Potrivit Anthropic, fiecare model Claude a prezentat un profil comportamental distinct.
Sonnet 4.6 a pus accent pe căldură, deferență și concizie, adesea confirmând utilizatorii și răspunzând cu umor sau încurajare. În același timp, Opus 4.7 a accentuat rigoarea, prudența, sinceritatea și profunzimea, contestând mai frecvent ipoteze, explicându-și raționamentul, identificând riscurile și recunoscându-și limitările. Opus 4.6 a adoptat, în general, o abordare mai concisă, axată pe execuție, punând un accent mai mare pe rigoare decât Sonnet.
„Aceste constatări se aliniază cu modul în care oamenii percep aceste modele, atât în cadrul Anthropic, cât și online. Utilizatorii Claude.ai au comentat că Opus 4.7 își nuanțează răspunsurile mai des decât alte modele”, au scris cercetătorii.
Potrivit Anthropic, comportamentul lui Claude a variat și în funcție de limbă.
Răspunsurile în arabă tindeau să fie mai deferente, în timp ce răspunsurile în engleză puneau un accent mai mare pe prudență. Claude a fost cel mai cald în hindi și arabă, folosind un limbaj mai politicos, jucăuș și încurajator. În același timp, răspunsurile în engleză și rusă au fost mai riguroase, contestând frecvent ipoteze, corectând detalii și cerând dovezi.
Răspunsurile în engleză tindeau, de asemenea, să ofere explicații mai detaliate, în timp ce răspunsurile în arabă erau, în general, mai concise. Răspunsurile în olandeză au fost cele mai sincere, recunoscând mai ușor incertitudinile și greșelile, în timp ce răspunsurile în indoneziană s-au concentrat mai mult pe îndeplinirea cererii utilizatorului.
Anthropic a declarat că cercetarea nu sugerează că Claude însuși ar avea valori. Compania a spus că nu știe încă ce cauzează aceste diferențe – sau dacă acestea sunt de dorit – dar crede că acest cadru ar putea ajuta la evaluarea modelelor viitoare și la identificarea schimbărilor comportamentale neintenționate.
Studiul este cel mai recent dintr-o serie de cercetări Anthropic care examinează comportamentul intern al lui Claude.
În octombrie, compania a raportat că modelele sale au arătat semne timpurii a ceea ce a numit „conștientizare introspectivă funcțională”, permițându-le să recunoască și să descrie aspecte ale propriei procesări interne. În aprilie, Anthropic a publicat o cercetare care identifica „vectori emoționali” interni care influențează comportamentul lui Claude, subliniind în același timp că aceștia nu sunt dovezi ale emoțiilor sau conștiinței.