Рівно через десять днів, 12 вересня, xAI представить довгоочікувану модель Grok 4.7. Ілон Маск робить сміливі заяви про її перевагу над усіма наявними ІІ-системами, підкріплюючи амбіції не лише архітектурними змінами, а й ексклюзивним доступом до даних космічної галузі.
Цей анонс виглядає особливо інтригуючим на тлі стрімкого прискорення циклу релізів. Лише в серпні ми побачили Grok 4.6 (12-го числа), а в липні — публічний дебют Grok 4.5. Тепер же, лише через місяць, на нас чекає наступна ітерація. Водночас OpenAI не дрімає, анонсуючи власну модель Astra, що лише підігріває конкурентну гонку.
Дані SpaceX як головний козир
Ключова відмінність Grok 4.7 від попередників — не лише в масштабі. Маск підтвердив, що базове навчання завершено, і зараз триває фінальний етап донавчання на внутрішніх даних SpaceX. Це стратегічний хід, який може дати моделі унікальну перевагу у вирішенні інженерних і наукових завдань, недоступну конкурентам.
Архітектура також зазнала серйозних змін. Grok 4.7 оперуватиме 2,1 трильйона параметрів, що на 40% більше, ніж у Grok 4.6 (1,5 трлн). При цьому, за словами Маска, нова версія працюватиме дещо повільніше, але значно ефективніше витрачатиме обчислювальні токени — компроміс, який свідчить про фокус на глибину аналізу, а не на швидкість відповіді.
«Grok 4.7 перевершить усі поточні моделі. При цьому Anthropic — чудова компанія, вони, найімовірніше, скоро покажуть більш просунуті рішення. Завдяки унікальним даним для навчання від SpaceX я був би здивований, якщо якась інша модель виявиться кращою за Grok 4.7 для інженерних завдань у реальному світі», — заявив Маск.
Орієнтири та реалії бенчмарків
Щоб зрозуміти, наскільки амбітною є мета, варто поглянути на результати попередника. Grok 4.6 набрав 61 бал в індексі AA Intelligence, зрівнявшись із GPT-5.6 Sol Max, але поступившись одним балом лідеру — Claude Fable 5 Max (62 бали). У тесті GDPVal-AA v2 модель показала 1753 бали, однак у Terminal-Bench v3.0 результати виявилися скромнішими — лише 26% проти 34,6% у конкурента від OpenAI.
Цікаво, що Grok 4.5 раніше демонстрував схожу динаміку: лідируючи в AutomationBench-AA із 51,4% за вартості $0,34 за завдання, він частіше порушував захисні обмеження (0,63 зриву проти 0,55 у Claude Opus 4.8). Ця тенденція показує, що xAI робить ставку на «сиру» потужність, іноді на шкоду безпеці.
Тепер, коли дату фінального релізу підтверджено, головне питання — чи зможе xAI підтвердити гучні обіцянки незалежними тестами, чи ми знову побачимо розрив між маркетингом і реальними показниками.
Мій погляд: ставка на унікальні дані SpaceX — це справді сильний хід, який складно скопіювати конкурентам. Однак вирішальним фактором стане не кількість параметрів, а здатність моделі ефективно застосовувати ці знання в реальних сценаріях. Ринок уже втомився від «паперових» рекордів — потрібні докази в бойових умовах.