Китайський стартап Moonshot AI офіційно анонсував Kimi K3 — найбільшу на сьогодні відкриту мовну модель. Із заявленими 2,8 трильйонами параметрів, нативним зором і контекстним вікном в 1 мільйон токенів, K3 претендує на звання найпотужнішого рішення з відкритим вихідним кодом. За внутрішніми оцінками команди, у загальному рейтингу новинка поступається лише закритим системам — Claude Fable 5 від Anthropic та GPT-5.6 Sol від OpenAI.
Архітектурні інновації та ефективність
В основі Kimi K3 лежить нова архітектура Kimi Delta Attention (KDA) та механізм Attention Residuals (AttnRes). KDA оптимізує обробку довгих послідовностей даних, а AttnRes дозволяє моделі вибірково вилучати критично важливу інформацію з різних шарів мережі, а не обробляти все однаково. Це забезпечує глибше розуміння контексту та збереження сенсу навіть під час роботи зі складними та заплутаними текстами.
Ключовим елементом масштабування стала розріджена архітектура Stable LatentMoE. Із 896 доступних експертів для кожного виведення активується лише 16. Така селективність у поєднанні з новими даними та оптимізованими методами навчання дозволила підвищити ефективність моделі в 2,5 рази порівняно з попередньою версією K2. Примітно, що протягом дев'яти з останніх дванадцяти місяців моделі сімейства Kimi утримували рекорд за розміром серед усіх відкритих аналогів.
Порівняння з конкурентами: де K3 сильніша, а де слабша
На ряді бенчмарків K3 демонструє перевагу, обходячи навіть іменитих конкурентів. У тесті на вирішення довгих інженерних завдань SWE Marathon модель набрала 42 бали проти 35 у Fable 5 та 39 у Sol. У завданні веб-досліджень BrowseComp результат склав 91,2 проти 88 та 90,4 відповідно. Також K3 лідирує в тесті Program Bench (77,8 проти 76,8 та 77,6) і показує майже максимальний результат у Terminal Bench 2.1 (88,3 бала), поступаючись Sol лише 0,5 бала.
Однак на тестах FrontierSWE та HLE-Full (складний мультидисциплінарний іспит) K3 відстає від Fable 5. Важливо зазначити, що методологія тестування відрізнялася: деякі моделі запускалися через Claude Code, інші — через Codex або власний інструментарій KimiCode. Це робить пряме порівняння не завжди коректним, але загальна картина вже зрозуміла: K3 — надзвичайно потужний інструмент для агентних завдань.
Кодинг, інженерія та автономність
K3 здатна вести тривалі інженерні сесії з мінімальною участю людини. У тесті з оптимізації GPU-ядер модель працювала автономно до 24 годин, показуючи результати на рівні Fable 5 та значно випереджаючи Opus 4.8, GPT-5.6 Sol та GPT-5.5. Окремої згадки заслуговує здатність K3 з нуля написати MiniTriton — компактний компілятор для GPU-ядер із власним IR-шаром поверх MLIR.
Вражає і демонстрація проєктування чипів: K3 самостійно спроєктувала нейромережевий чип на власній архітектурі. За 48 годин автономної роботи, використовуючи open-source інструменти, модель створила дизайн чипа площею 4 мм² з частотою 100 МГц та продуктивністю понад 8700 токенів на секунду в симуляції.
Робота зі знаннями та мультимодальність
K3 демонструє глибоке розуміння наукових даних. В одному з кейсів модель відтворила складні формули з обчислювальної астрофізики за дві години, тоді як досвідченому досліднику на це знадобилося б кілька тижнів. В іншому прикладі K3 підготувала інтерактивний звіт за 42-річною історією ASIC-індустрії, обробивши понад 11 000 сторінок документів.
Завдяки нативній роботі з відео, модель здатна монтувати ролики, синхронізувати їх із музикою та обробляти звук. Це відкриває нові горизонти для автоматизації творчих процесів.
Обмеження та доступність
Команда Moonshot AI чесно визнає, що K3 чутлива до втрати історії роздумів при зміні агентного середовища і може проявляти надмірну ініціативу в неоднозначних ситуаціях. За зручністю використання вона поки поступається флагманам Fable 5 та GPT-5.6 Sol.
Модель вже доступна на сайті Kimi, у сервісах Kimi Work та Code, а також через API. За замовчуванням активовано максимальний режим роздуму. Повні ваги та технічний звіт будуть опубліковані 27 липня.
Думка експерта: Випуск Kimi K3 — це не просто черговий рекорд за кількістю параметрів. Це демонстрація того, що відкриті моделі здатні конкурувати із закритими гігантами на найвищому рівні, особливо в агентних та інженерних завданнях. Однак розрив у зручності використання та чутливість до зміни контексту нагадують, що «сира» потужність — це лише частина рівняння. Забіг за лідерство в ШІ тільки починається, і ми бачимо, як відкритий сектор нарощує темпи.