Компанія SpaceXAI офіційно запустила Grok 4.5 — нову флагманську модель, орієнтовану на програмування, роботу з агентами та вирішення складних інтелектуальних завдань. У пресрелізі модель названо «найсильнішою системою» в портфелі компанії. Однак ключовий акцент зроблено не на абсолютній перевазі в бенчмарках, а на балансі ціни, швидкості та ефективності.

Grok 4.5 вже доступна через API, а також вбудована в платформи Grok Build та Cursor на всіх тарифних планах. Користувачі з Європейського Союзу поки залишаються осторонь — запуск у регіоні очікується в середині липня.

Ціноутворення як головний козир

SpaceXAI пропонує Grok 4.5 за ціною $2 за 1 млн вхідних токенів та $6 за 1 млн вихідних. Це значно дешевше за прямих конкурентів. Для порівняння: Claude Opus 4.8 від Anthropic коштує $5 та $25 відповідно, Claude Fable 5 — $10 та $50, а GPT-5.6 Sol від OpenAI — $5 та $30. Навіть у межах власної лінійки OpenAI модель Luna пропонується за $1 за вхідні токени, але за $6 за вихідні, що можна порівняти з Grok 4.5.

Ілон Маск охарактеризував новинку як «модель класу Opus, але швидшу, дешевшу та ефективнішу за токенами». За його словами, внутрішні тести SpaceXAI показують, що Grok 4.5 «приблизно порівнянна з Opus 4.7, але набагато швидша».

Результати бенчмарків: неоднозначно, але перспективно

Опубліковані SpaceXAI дані демонструють змішану картину. На тесті DeepSWE 1.0 Grok 4.5 набрала 62%, поступившись Fable (66,1%) та GPT-5.5 (64,31%), але обійшовши Claude Opus 4.8 (55,75%) та Opus 4.7 (40,12%). Більш свіжий бенчмарк DeepSWE 1.1 показав результат 53% — нижче, ніж у Opus 4.8 (59%), GPT-5.5 (67%) та Fable (70%).

На SWE Bench Pro модель показала 64,7%, що вище за GPT-5.5 (58,6%) і майже на рівні Opus 4.7 (64,3%), але нижче за Opus 4.8 (69,2%) та Fable (80,4%). У Terminal Bench 2.1 Grok 4.5 продемонструвала 83,3% — майже ідентично GPT-5.5 (83,4%) і трохи поступаючись Fable (84,3%). Натомість на SWE Marathon модель посіла перше місце з 29%, випередивши Opus 4.8 (26%) та Fable (24%). Також заявлено лідерство на Harvey's Legal Agent Benchmark.

Економіка токенів: де SpaceXAI дійсно виграє

Найсильніший аргумент на користь Grok 4.5 — не сирі бали, а ефективність використання токенів. На завданнях SWE Bench Pro модель витрачала в середньому 15 954 вихідних токени на завдання. У Claude Opus 4.8 цей показник становив 67 020 токенів — у 4,2 раза більше. За нижчої ціни за токен це означає радикальне зниження підсумкової вартості для сценаріїв з великою кількістю ітерацій: виправлення багів, генерація правок, перевірка коду та агентні цикли.

SpaceXAI також заявляє швидкість генерації близько 80 токенів за секунду та контекстне вікно на 500 000 токенів. Модель позиціонується як компроміс між якістю, швидкістю та вартістю — саме те, що потрібно для масштабних промислових впроваджень.

Зв'язок з Cursor та стратегічний контекст

Примітно, що Grok 4.5 навчалася в тісній співпраці з ІІ-сервісом Cursor, який SpaceX нещодавно домовилася придбати за $60 млрд. У навчанні використовувалися дані сесій розробників Cursor, включаючи трасування налагодження та реальні правки коду, а не лише статичні репозиторії. Це пояснює сильну орієнтацію моделі на практичні завдання програмування.

Для навчання Grok 4.5 компанія задіяла десятки тисяч GPU Nvidia GB300. Модель стала однією з перших великих після об'єднання ІІ-напрямку Ілона Маска з SpaceX.

Мій експертний погляд: SpaceXAI робить ставку не на те, щоб бути найкращою у всіх тестах, а на те, щоб бути найбільш економічно ефективною в реальних сценаріях використання. В епоху, коли витрати на інференс стають критичним фактором для масштабування ІІ, такий підхід може виявитися більш виграшним, ніж гонитва за абстрактними рекордами в бенчмарках. Якщо Grok 4.5 дійсно забезпечить порівнянну якість при в 4 рази менших витратах токенів, це може серйозно перекроїти ринок ІІ-моделей для enterprise-сектора.