В індустрії штучного інтелекту назріває тиха революція: ми звикли, що комунікація між моделями завжди опосередкована текстом. Однак команда розробників під брендом Mostik пропонує радикально інший підхід — пряму передачу «думок» нейромережі, минаючи стадію вербалізації. Замість генерації проміжного тексту використовується спеціальний адаптивний модуль, який я називаю «мостом». Він конвертує внутрішні векторні представлення однієї моделі у формат, зрозумілий іншій, при цьому параметри самих систем залишаються недоторканими.
Це принциповий зсув. При генерації навіть одного токена велика мовна модель продукує понад сотню прихованих векторів — близько мільйона числових значень, що еквівалентно приблизно 2 МБ даних. У текстову відповідь потрапляє лише мізерна частка цієї інформації. Новий канал націлений на передачу саме цих багатих проміжних станів.
Експеримент: гігант мислить, карлик говорить
Для перевірки гіпотези дослідники зібрали зв'язку з GLM-5.2 від Z.ai (753 млрд параметрів) та Qwen-3.5 від Alibaba (4 млрди параметрів). Ключовий момент: велика модель обробляла запит, але не генерувала відповідь. Її внутрішній стан через «міст» передавався малій моделі, яка й формувала підсумковий текст.
Результати вражають. Така зв'язка закрила близько половини розриву в якості між малою та гігантською моделями. При порівнянні з класичною текстовою передачею новий метод показав перевагу до 10 відсоткових пунктів за ідентичних обчислювальних витрат. Більше того, гібридна система, порівнянна за якістю із середньою моделлю, потребувала приблизно в 2,5 раза менше обчислень.
Пошуки спільної математичної мови
Головний науковий співробітник Mostik Станіслав Смірнов слушно зазначає фундаментальну проблему: внутрішні представлення різних нейромереж незіставні напряму. Навіть вирішуючи одне завдання, моделі кодують інформацію у своїх прихованих станах по-різному. «Схоже, відповідної математичної мови поки не існує», — констатує він. Це відкриває нову галузь досліджень: вивчення відповідностей між латентними просторами може пролити світло на те, як ШІ представляє знання та ухвалює рішення.
Практична цінність підходу очевидна. Колишній дослідник Google DeepMind Карл Туйлс бачить сценарій, де ресурсомістка модель використовується лише для «роздумів», а генерація тексту делегується компактній системі. Інший шлях — симбіоз універсальної моделі зі спеціалізованими (біологія, фізика), що позбавляє необхідності навчати монолітні системи на всіх даних одразу.
Заявка на лідерство в ARC-AGI-3
Розробники застосували метод у найскладнішому бенчмарку ARC-AGI-3, де ШІ має адаптуватися до нових правил у реальному часі. Система з «мостом» показала один із найкращих результатів у поточному рейтингу, хоча деталі поки не розкриваються — змагання триває. Втім, до цих даних варто ставитися з обережністю: статус «прев'ю» означає неповний набір тестів, а решта показників ґрунтується на внутрішніх експериментах команди.
Мій аналіз: Це елегантне рішення давно назрілої проблеми. Економіка ШІ впирається у вартість інференсу, і можливість «розділяти працю» між моделями — не просто оптимізація, а крок до модульної архітектури інтелекту. Однак шлях від демонстрації до промислового впровадження довгий: нам ще належить навчитися будувати універсальні «мости» між будь-якими архітектурами, а не лише між конкретними парами.