SpaceXAI офіційно представила Grok 4.5 — нову мовну модель, орієнтовану на програмування, агентні завдання та інтелектуальну роботу. Компанія позиціонує її як свою найпотужнішу систему на сьогодні. Модель уже доступна через API, у Grok Build та в середовищі розробки Cursor на всіх тарифних планах. Користувачі з Європейського Союзу поки що не можуть отримати до неї доступ — запуск там заплановано на середину липня.
Ключова перевага Grok 4.5, за заявою розробників, — поєднання продуктивності з агресивною ціновою політикою. Вартість моделі становить $2 за 1 млн вхідних токенів і $6 за 1 млн вихідних. Для порівняння: Claude Opus 4.8 від Anthropic коштує $5 і $25 відповідно, Claude Fable 5 — $10 і $50, а флагман OpenAI GPT-5.6 Sol — $5 і $30. У межах тієї ж лінійки GPT-5.6 Luna пропонує ще нижчу ціну — $1 за вхід і $6 за вихід, але перебуває в режимі обмеженого попереднього перегляду. Це робить Grok 4.5 одним із найдоступніших рішень у своєму класі.
Ілон Маск охарактеризував новинку як модель «класу Opus, але значно швидшу, дешевшу та ефективнішу за токенами». Внутрішні тести SpaceXAI, за його словами, показують, що Grok 4.5 «приблизно порівнянна з Opus 4.7, але набагато швидша».
Результати бенчмарків: неоднозначно, але конкурентоспроможно
Опубліковані SpaceXAI дані щодо бенчмарків малюють змішану картину. На DeepSWE 1.0 модель набрала 62%, поступившись Fable (66,1%) та GPT-5.5 (64,31%), але обійшовши Claude Opus 4.8 (55,75%) та Opus 4.7 (40,12%). На складнішому DeepSWE 1.1 результат виявився нижчим — 53% проти 59% у Opus 4.8 та 70% у Fable. На SWE Bench Pro Grok 4.5 показала 64,7%, що вище за GPT-5.5 (58,6%) і на рівні Opus 4.7 (64,3%), але нижче за Opus 4.8 (69,2%) та Fable (80,4%).
Однак на деяких тестах модель проявила себе сильніше. На Terminal Bench 2.1 вона набрала 83,3%, майже зрівнявшись із GPT-5.5 (83,4%) і лише трохи відставши від Fable (84,3%). На SWE Marathon Grok 4.5 посіла перше місце з 29%, випередивши Opus 4.8 (26%) та Fable (24%). Компанія також заявила про лідерство на Harvey's Legal Agent Benchmark, тесті для юридичних агентних завдань.
Економіка — головний козир
Найсильніший аргумент на користь Grok 4.5 лежить не в області пікової продуктивності, а в економіці. SpaceXAI наводить дані, що на завданнях SWE Bench Pro модель використовує в середньому 15 954 вихідних токени на завдання, тоді як Claude Opus 4.8 — 67 020 токенів, що в 4,2 раза більше. За значно нижчої ціни за токен це робить Grok 4.5 надзвичайно вигідною для сценаріїв із великою кількістю ітерацій: виправлення багів, генерація правок, перевірка коду та агентні цикли.
Додатково заявлено швидкість генерації близько 80 токенів на секунду та контекстне вікно на 500 000 токенів. SpaceXAI позиціонує модель як оптимальний компроміс між якістю, швидкістю та вартістю.
Зв'язок із Cursor та стратегічний контекст
Важливо зазначити, що Grok 4.5 навчалася спільно з ІІ-сервісом Cursor, який SpaceX нещодавно погодилася придбати за $60 млрд. Угода буде проведена акціями класу A і очікує на закриття в III кварталі 2026 року. Для навчання моделі використовувалися дані реальних сесій розробників Cursor, включаючи трасування налагодження та правки коду, що дає їй унікальну перевагу в розумінні практичних завдань програмування. Для тренування були задіяні десятки тисяч GPU Nvidia GB300.
Цей реліз — одна з перших великих ініціатив після об'єднання ІІ-напрямку Ілона Маска зі SpaceX. Grok 4.5 не намагається бути беззаперечним лідером у всіх тестах, але пропонує прагматичний підхід: досить високу якість за ціною, яка може перевернути економіку enterprise-додатків. У світі, де витрати на інференс стають головним бар'єром для масштабування ІІ, такий підхід виглядає не просто розумним, а потенційно домінуючим.