В індустрії штучного інтелекту назріває тихий, але значущий зсув. Ми звикли до того, що колаборація між нейромережами відбувається через генерацію проміжного тексту — своєрідний «переклад» думок людською мовою для передачі іншому алгоритму. Однак команда розробників під брендом Mostik пропонує радикально інший шлях: прямий обмін внутрішніми станами, оминаючи вербальну стадію.

Суть методу полягає у використанні спеціального адаптованого модуля, який я називаю «містком». Він трансформує приховані вектори однієї моделі у формат, зрозумілий іншій, при цьому параметри самих нейромереж залишаються недоторканими. Це принципово важливо: ми не донавчаємо моделі, а лише створюємо прошарок для їхньої безшовної взаємодії.

Цифри та експерименти: перевірка на гігантах

Розробники стверджують, що під час генерації одного токена велика мовна модель формує понад сотню прихованих векторів — це близько мільйона числових значень або приблизно 2 МБ даних. У текстовий відповідь потрапляє лише мала частка цього багатства. Їхній канал передачі націлений саме на ці багаті внутрішні уявлення.

Емпірична перевірка виглядає вражаюче. У зв’язці гігантської GLM-5.2 від Z.ai (753 млрд параметрів) і компактної Qwen-3.5 від Alibaba (4 млрд параметрів) велика модель обробляла запит, але не генерувала відповідь. Натомість її внутрішній стан через «міст» передавався малій моделі, яка й формувала підсумковий текст. Такий тандем, за запевненнями авторів, закрив близько половини розриву в якості між моделями. При порівнянні з класичною передачею тексту новий метод показав перевагу до 10 відсоткових пунктів за рівних обчислювальних витрат. Більше того, гібридна система потребувала приблизно в 2,5 раза менше обчислень, ніж модель середнього розміру з порівнянним результатом.

Головна проблема: пошук спільної «мови»

Ключова складність, яку визнають самі дослідники, — відсутність єдиного математичного простору для різних архітектур. Головний науковий співробітник Mostik Станіслав Смірнов слушно зазначає: «Схоже, відповідної математичної мови поки що не існує». Внутрішні кодування інформації в різних мережах можуть кардинально відрізнятися навіть під час вирішення ідентичних завдань. Саме тому «міст» має бути адаптованим — він вчиться перекладати з одного «діалекту» прихованих станів на інший.

Практична цінність підходу очевидна: ми можемо використовувати важку модель лише для складної розумової роботи, а генерацію відповіді делегувати легковаговій. Це відкриває шлях до створення гібридних систем, що об’єднують універсальні та вузькоспеціалізовані моделі без необхідності навчати монстра на всіх даних одразу.

Оцінка та скепсис

Незважаючи на інтригуючі результати в тестах ARC-AGI-3, де система показала один із найкращих результатів, слід зберігати здоровий скепсис. Усі заявлені показники базуються на внутрішніх експериментах команди та поки що не отримали зовнішнього підтвердження. Тим не менш, якщо метод підтвердиться, ми стоїмо на порозі нової парадигми в масштабуванні ШІ, де ефективність досягається не нарощуванням параметрів, а розумною комунікацією між спеціалізованими агентами.

Мій вердикт: це сміливий і потенційно проривний крок, але до продакшену йому далеко. Ключове питання — наскільки стабільно «міст» працюватиме на різнорідних архітектурах і завданнях поза лабораторними умовами. Стежимо за розвитком.