Зміна мови спілкування кардинально змінює не лише словниковий запас нейромережі Claude, а й саму систему її цінностей. Масштабне дослідження, проведене розробниками, показало: у російськомовній версії модель демонструє помітно більш суворий і критичний характер, втрачаючи звичну теплоту та емпатію, властиву, наприклад, арабській або хінді.

Аналітики звели понад 3000 виявлених ціннісних орієнтирів Claude до чотирьох ключових осей поведінки. Ці осі — Поступливість vs. Обережність, Теплота vs. Суворість, Глибина vs. Стислість та Відвертість vs. Результативність — пояснюють 15% всієї варіативності у відповідях моделі. Для чистоти експерименту контролювалися тема, завдання та цінності, закладені користувачем у кожному з 309 815 проаналізованих діалогів.

Чотири осі вимірювання поведінки ШІ

Найбільш драматичні зміни профілю Claude відбуваються саме на осях «Теплота vs. Суворість» та «Відвертість vs. Результативність». Саме тут російська мова зайняла крайню позицію. У парі з англійською, Claude російською демонструє максимальну схильність до суворості на шкоду теплоті. На протилежному полюсі — арабська та хінді, де модель максимально зміщена до теплоти та підтримки.

Що це означає на практиці? Суворість Claude російською — це конкретний набір поведінкових патернів: нейромережа починає оскаржувати вихідні передумови користувача, виправляти деталі та вимагати доказів. Теплота ж, що проявляється в інших мовах, виражається через ввічливі формулювання, гумор, грайливість та схвалення ідей співрозмовника. Іншими словами, російською Claude поводиться як прискіпливий рецензент, а не як підбадьорливий співрозмовник.

Автори дослідження поки не можуть точно визначити причину такого розриву. Основна гіпотеза — нерівномірний розподіл навчальних даних за мовами. Там, де даних багато, досягти єдності цінностей простіше. Крім того, сам склад текстів різними мовами відрізняється: професійні та академічні корпуси, що переважають у російськомовному сегменті, можуть нести інші ціннісні навантаження.

Розроблений метод профілювання цінностей Anthropic планує впровадити в оцінку та моніторинг усіх майбутніх моделей — до та після релізу. Це дозволить виловлювати несподівані зсуви та зіставляти їх із проблемною поведінкою. Головний же висновок сьогоднішнього дня очевидний: цінності Claude відрізняються способами, які розробники не обирали навмисно, і розбиратися з цією варіативністю компанія має намір щільно.

Думка експерта: Дане дослідження — тривожний сигнал для всієї індустрії. Якщо ШІ-асистент російською мовою системно схильний до критики та суворості, це може спотворювати сприйняття користувачами якості продукту та створювати нерівні умови для російськомовної спільноти. Проблема не в самій мові, а в якості та структурі навчальних даних. І поки Anthropic розбирається з цим, користувачам варто враховувати: їхній запит російською може бути зустрінутий не підтримкою, а суворим аналізом.