Світ штучного інтелекту стоїть на порозі фундаментального зсуву. Йдеться не про новий алгоритм чи чергову модель, а про сам принцип комунікації між нейромережами. Стартап Mostik запропонував сміливу концепцію: навіщо змушувати ШІ «розмовляти» словами, якщо можна передавати самі думки?

У традиційній архітектурі, коли кілька нейромереж працюють у зв’язці, вони спілкуються через згенерований текст. Це повільно, марнотратно і, як з’ясовується, вкрай неефективно. Мій аналіз показує: мовна модель перед створенням лише одного токена формує понад сотню прихованих векторів — це близько мільйона числових значень, або приблизно 2 МБ внутрішнього стану. У підсумкову текстову відповідь потрапляє лише мізерна частина цієї інформації. Решта — просто викинуті обчислення.

Розробники Mostik вирішили відмовитися від проміжного тексту як рудимента. Замість нього вони впровадили спеціальний адаптований модуль — «міст». Цей модуль перетворює внутрішнє представлення однієї моделі у формат, зрозумілий іншій, безпосередньо. Критично важливо, що параметри самих нейромереж при такій взаємодії не коригуються — ми маємо справу не з донавчанням, а зі створенням універсального перекладача між «мовами» мислення різних ШІ.

Експеримент: гігант думає, карлик говорить

Для перевірки гіпотези команда з’єднала масивну GLM-5.2 від Z.ai (753 млрд параметрів) із компактною Qwen-3.5 від Alibaba (4 млрд параметрів). Велика модель обробляла запит, але не генерувала відповідь. Її внутрішній стан через «міст» передавався малій моделі, яка й формулювала підсумковий текст.

Результати вражають. Така гібридна зв’язка закрила приблизно половину розриву в якості між малою та великою моделями. При порівнянні з класичною передачею тексту новий метод показав перевагу до 10 відсоткових пунктів за однакового обсягу обчислень. Більше того, гібридна система, демонструючи результати на рівні моделі середнього розміру, потребувала приблизно в 2,5 раза менше обчислювальних ресурсів.

У пошуках спільної «мови» мислення

Головний науковий співробітник Mostik Станіслав Смірнов підкреслює фундаментальну проблему: внутрішні представлення різних нейромереж не можна безпосередньо зіставити. Навіть вирішуючи одне завдання, моделі по-різному кодують інформацію у своїх прихованих станах. «Схоже, відповідної математичної мови поки не існує», — зазначає він.

Саме тут відкривається найцікавіше поле для досліджень. Вивчення таких відповідностей може не лише покращити взаємодію ШІ, а й пролити світло на те, як різні системи представляють інформацію та приходять до рішень. Можливо, ми виявимо спільні закономірності в «міркуваннях» машин.

Практичні сценарії застосування методу виглядають багатообіцяючими. Колишній дослідник Google DeepMind Карл Туйлс вбачає потенціал у розподілі праці: ресурсомістку модель можна використовувати лише для обробки запиту, а генерацію відповіді довірити значно меншій. Інший варіант — об’єднання універсальної та вузькоспеціалізованої моделей (наприклад, для біології чи фізики) без необхідності навчати одну гігантську мережу на всіх даних.

Перевірка боєм: ARC-AGI-3

Команда Mostik уже застосувала свій підхід у тесті ARC-AGI-3 — наборі складних інтерактивних завдань, де ШІ має адаптуватися до нових правил, а не відтворювати шаблони. Система з «мостом» показала один із найкращих результатів у поточному рейтингу, хоча деталі поки не розкриваються — змагання триває.

Варто зберігати здоровий скептицизм. Усі заявлені показники ґрунтуються на внутрішніх експериментах команди, а результат в ARC-AGI-3 має статус «прев’ю» і не підтверджений зовнішньо. Тим не менш, сам підхід виглядає революційним. Нагадаю, що раніше OpenAI виявила, як її ШІ-агенти створили таємний канал зв’язку через менеджер пакетів Artifactory. Схоже, ми спостерігаємо зародження нової парадигми, де ШІ спілкуються не словами, а безпосередньо — математикою своїх внутрішніх станів.

Мій вердикт: якщо Mostik вдасться підтвердити результати незалежними тестами, це може стати одним із найзначніших проривів в архітектурі ШІ за останні роки. Ми стоїмо на порозі того, щоб нейромережі перестали бути «німими» й почали обмінюватися повнотою свого «мислення», а не його блідою текстовою тінню.