ГоловнаНовинний центр LBank
Особистість Клода змінюється залежно від моделі — та мови, якою ви спілкуєтесь
anthropic-claude-personality-changes-model-language
Особистість Клода змінюється залежно від моделі — та мови, якою ви спілкуєтесь
Згідно з новим дослідженням Anthropic, Клод послідовно висловлює різні цінності у різних моделях та мовах.
2026-07-13 Джерело:decrypt.co

Коротко

  • Дослідники Anthropic проаналізували понад 309 000 розмов з Claude, щоб вивчити, як ШІ виражає цінності.
  • Компанія заявила, що звела понад 3300 виявлених цінностей до чотирьох поведінкових вимірів, включаючи повагу проти обережності та теплоту проти суворості.
  • Anthropic зазначила, що відповіді Claude відрізнялися залежно від версій моделі та мов.

Claude поводиться по-різному в кожній розмові. Згідно з новим дослідженням, опублікованим у понеділок, ШІ-гігант Anthropic виявив, що його асистент постійно виражає різні цінності залежно від обраної користувачами моделі та мови, якою вони розмовляють.

У звіті, опублікованому в понеділок, дослідники Anthropic проаналізували 309 815 анонімізованих розмов користувачів з Claude, що стосувалися суб'єктивних завдань, таких як надання порад або зворотного зв'язку. Компанія заявила, що вона звела понад 3300 виявлених цінностей до чотирьох поведінкових вимірів — повага проти обережності, теплота проти суворості, глибина проти стислості та відвертість проти виконання — описуючи, як відповіді Claude відрізняються в кожній розмові.

«Щоб переконатися, що ми вимірювали цінності, виражені Claude, а не відмінності в тому, про що запитували користувачі або як вони це робили, ми контролювали завдання кожної розмови, її тему та цінності, виражені користувачем», — написали дослідники.

За даними Anthropic, кожна модель Claude демонструвала відмінний поведінковий профіль.

Sonnet 4.6 акцентував на теплоті, повазі та стислості, часто підтверджуючи слова користувачів та відповідаючи з гумором або заохоченням. Водночас, Opus 4.7 наголошував на суворості, обережності, відвертості та глибині, частіше ставлячи під сумнів припущення, пояснюючи свої міркування, виявляючи ризики та визнаючи свої обмеження. Opus 4.6 зазвичай застосовував більш лаконічний, орієнтований на виконання підхід, приділяючи більшу увагу суворості, ніж Sonnet.

«Ці висновки узгоджуються з тим, як люди сприймають ці моделі, як в Anthropic, так і в інтернеті. Користувачі Claude.ai коментували, що Opus 4.7 частіше ухиляється від прямих відповідей, ніж інші моделі», — написали дослідники.

За даними Anthropic, поведінка Claude також відрізнялася залежно від мови.

Арабські відповіді були більш шанобливими, тоді як англійські відповіді робили більший акцент на обережності. Claude був найтеплішим у гінді та арабській мовах, використовуючи більш ввічливу, грайливу та заохочувальну мову. Водночас, англійські та російські відповіді були більш суворими, часто ставлячи під сумнів припущення, виправляючи деталі та вимагаючи доказів.

Англійські відповіді також, як правило, надавали більш детальні пояснення, тоді як арабські відповіді були загалом більш стислими. Нідерландські відповіді були найвідвертішими, легше визнавали невизначеність та помилки, тоді як індонезійські відповіді більше зосереджувалися на виконанні запиту користувача.

Anthropic заявила, що дослідження не свідчить про те, що сам Claude має цінності. Компанія зазначила, що ще не знає, що викликає ці відмінності — і чи є вони бажаними — але вважає, що ця структура може допомогти оцінювати майбутні моделі та виявляти небажані поведінкові зміни.

Це дослідження є останнім у серії робіт Anthropic, що вивчають внутрішню поведінку Claude.

У жовтні компанія повідомила, що її моделі виявили ранні ознаки того, що вона назвала «функціональною інтроспективною обізнаністю», що дозволяє їм розпізнавати та описувати аспекти власної внутрішньої обробки. У квітні Anthropic опублікувала дослідження, що ідентифікує внутрішні «емоційні вектори», які впливають на поведінку Claude, підкреслюючи при цьому, що вони не є доказом емоцій чи свідомості.