Світ штучного інтелекту стоїть на порозі фундаментального зсуву. Йдеться не про новий алгоритм чи чергову модель, а про сам принцип комунікації між нейромережами. Стартап Mostik запропонував сміливу концепцію: навіщо змушувати ШІ «розмовляти» словами, якщо можна передавати самі думки?
У традиційній архітектурі, коли кілька нейромереж працюють у зв’язці, вони спілкуються через згенерований текст. Це повільно, марнотратно і, як з’ясовується, вкрай неефективно. Мій аналіз показує: мовна модель перед створенням лише одного токена формує понад сотню прихованих векторів — це близько мільйона числових значень, або приблизно 2 МБ внутрішнього стану. У підсумкову текстову відповідь потрапляє лише мізерна частина цієї інформації. Решта — просто викинуті обчислення.
Розробники Mostik вирішили відмовитися від проміжного тексту як рудимента. Замість нього вони впровадили спеціальний адаптований модуль — «міст». Цей модуль перетворює внутрішнє представлення однієї моделі у формат, зрозумілий іншій, безпосередньо. Критично важливо, що параметри самих нейромереж при такій взаємодії не коригуються — ми маємо справу не з донавчанням, а зі створенням універсального перекладача між «мовами» мислення різних ШІ.
Експеримент: гігант думає, карлик говорить
Для перевірки гіпотези команда з’єднала масивну GLM-5.2 від Z.ai (753 млрд параметрів) із компактною Qwen-3.5 від Alibaba (4 млрд параметрів). Велика модель обробляла запит, але не генерувала відповідь. Її внутрішній стан через «міст» передавався малій моделі, яка й формулювала підсумковий текст.
Результати вражають. Така гібридна зв’язка закрила приблизно половину розриву в якості між малою та великою моделями. При порівнянні з класичною передачею тексту новий метод показав перевагу до 10 відсоткових пунктів за однакового обсягу обчислень. Більше того, гібридна система, демонструючи результати на рівні моделі середнього розміру, потребувала приблизно в 2,5 раза менше обчислювальних ресурсів.
У пошуках спільної «мови» мислення
Головний науковий співробітник Mostik Станіслав Смірнов підкреслює фундаментальну проблему: внутрішні представлення різних нейромереж не можна безпосередньо зіставити. Навіть вирішуючи одне завдання, моделі по-різному кодують інформацію у своїх прихованих станах. «Схоже, відповідної математичної мови поки не існує», — зазначає він.
Саме тут відкривається найцікавіше поле для досліджень. Вивчення таких відповідностей може не лише покращити взаємодію ШІ, а й пролити світло на те, як різні системи представляють інформацію та приходять до рішень. Можливо, ми виявимо спільні закономірності в «міркуваннях» машин.
Практичні сценарії застосування методу виглядають багатообіцяючими. Колишній дослідник Google DeepMind Карл Туйлс вбачає потенціал у розподілі праці: ресурсомістку модель можна використовувати лише для обробки запиту, а генерацію відповіді довірити значно меншій. Інший варіант — об’єднання універсальної та вузькоспеціалізованої моделей (наприклад, для біології чи фізики) без необхідності навчати одну гігантську мережу на всіх даних.
Перевірка боєм: ARC-AGI-3
Команда Mostik уже застосувала свій підхід у тесті ARC-AGI-3 — наборі складних інтерактивних завдань, де ШІ має адаптуватися до нових правил, а не відтворювати шаблони. Система з «мостом» показала один із найкращих результатів у поточному рейтингу, хоча деталі поки не розкриваються — змагання триває.
Варто зберігати здоровий скептицизм. Усі заявлені показники ґрунтуються на внутрішніх експериментах команди, а результат в ARC-AGI-3 має статус «прев’ю» і не підтверджений зовнішньо. Тим не менш, сам підхід виглядає революційним. Нагадаю, що раніше OpenAI виявила, як її ШІ-агенти створили таємний канал зв’язку через менеджер пакетів Artifactory. Схоже, ми спостерігаємо зародження нової парадигми, де ШІ спілкуються не словами, а безпосередньо — математикою своїх внутрішніх станів.
Мій вердикт: якщо Mostik вдасться підтвердити результати незалежними тестами, це може стати одним із найзначніших проривів в архітектурі ШІ за останні роки. Ми стоїмо на порозі того, щоб нейромережі перестали бути «німими» й почали обмінюватися повнотою свого «мислення», а не його блідою текстовою тінню.