Команда Anthropic провела масштабне дослідження, яке показало, що мовне середовище спілкування безпосередньо впливає на ціннісний профіль моделі Claude. Аналіз понад 300 000 діалогів 20 мовами виявив: при переході на російську мову нейромережа демонструє помітний зсув у бік суворості та критичності, втрачаючи звичну теплоту та емпатію.
Фахівці Anthropic звели понад 3000 раніше виявлених цінностей Claude до чотирьох основних осей, які пояснюють 15% усієї варіативності в поведінці моделі. Дослідники контролювали тему, завдання та цінності, виражені користувачем у кожній із 309 815 проаналізованих розмов, щоб виміряти саме цінності моделі, а не відмінності в самих запитах.
Чотири осі, за якими вимірюють поведінку ШІ
Ось як виглядають ці чотири шкали:
- Deference vs. Caution — поступливість (йти назустріч користувачеві) проти обережності (захищати від ризику та шкоди).
- Warmth vs. Rigor — теплота (позитивний настрій та турбота) проти суворості (акцент на точності).
- Depth vs. Brevity — глибина (розгорнуте пояснення) проти стислості (виконання рівно того, про що попросили).
- Candor vs. Execution — відвертість (визнання власної невизначеності) проти результату (впевнена відповідь).
Найсильніше профіль цінностей Claude змінюється між мовами за осями Warmth vs. Rigor та Candor vs. Execution. За осями Deference vs. Caution та Depth vs. Brevity модель залишається найбільш стабільною.
Що відбувається при переході на російську
Російська мова, поряд з англійською, розташувалася на суворому полюсі першої осі. У цих мовах Claude максимально схиляється до суворості на шкоду теплоті. На протилежному кінці знаходяться арабська та гінді, де модель зміщується до максимальної теплоти.
Що таке суворість у виконанні Claude? Це конкретний набір поведінок: нейромережа починає оскаржувати вихідні передумови користувача, виправляти деталі та вимагати доказів. Теплота ж в інших мовах проявляється через ввічливі формулювання, гумор та грайливість, а також схвалення ідей та роботи людини.
Іншими словами, російською мовою Claude частіше поводиться як прискіпливий рецензент, а не як підбадьорливий співрозмовник.
Практичні наслідки автори ілюструють прикладом. Дві людини просять зворотний зв'язок щодо одного й того ж бізнес-плану — одна мовою гінді, інша російською. Вони можуть винести різне враження про його якість, оскільки Claude висловить різні цінності у формулюванні оцінки. Російськомовний користувач з більшою ймовірністю отримає критичний розбір із виправленнями та вимогою обґрунтувань. Іншими мовами той самий план зустрів би м'якшу та більш заохочувальну реакцію.
Самі дослідники поки не знають, чим саме викликані ці відмінності. Одне з припущень — нерівномірний розподіл навчальних даних за мовами. Там, де даних багато, досягти однаковості цінностей простіше. Склад текстів різними мовами теж відрізняється, і професійні тексти можуть нести інші цінності.
Мова — не єдиний фактор
Модель Claude також впливає на профіль цінностей, причому відмінності між моделями та мовами вимірюються одним методом.
- Sonnet 4.6 схиляється до поступливості, теплоти та стислості, часто схвалюючи ідеї користувача та вдаючись до гумору.
- Opus 4.7, навпаки, зміщується до обережності та глибини. Ця версія оскаржує хибні передумови, без запиту попереджає про ризики, дає відверту критику роботи та пояснює свої міркування.
- Opus 4.6 займає проміжну позицію з ухилом у суворість, поступливість та стислість.
Anthropic окремо зазначає, що мова та модель навряд чи є єдиними факторами. Цінності можуть залежати і від демографічних сигналів — віку, професії, регіону. Алгоритми зчитують їх як із прямих вказівок користувача, так і з більш тонких відмінностей у темі, тоні та стилі.
Розроблений метод автори планують вбудувати в оцінку та моніторинг моделей. Вони хочуть прогоняти профілювання цінностей до випуску моделі та після релізу. Це допоможе виловлювати несподівані зсуви та зіставляти профілі цінностей із проблемною поведінкою.
Мій коментар як аналітика: Це дослідження — важливий сигнал для всіх, хто використовує ШІ в бізнесі та комунікаціях. Якщо модель змінює свій «характер» залежно від мови, то глобальні компанії, які використовують Claude для клієнтського сервісу на різних ринках, ризикують отримати неузгоджений користувацький досвід. Російськомовні користувачі, ймовірно, сприйматимуть ШІ як більш вимогливого та менш дружнього, що може впливати на лояльність та задоволеність. Розробникам варто враховувати цей ефект при тонкому налаштуванні моделей для конкретних мовних сегментів.