Ринок ІІ-агентів отримав нового беззаперечного лідера. Модель Grok 4.5 від SpaceXAI не просто підтвердила заяви Ілона Маска про свою продуктивність, а й розгромила прямих конкурентів у незалежному бенчмарку AutomationBench-AA від Artificial Analysis.
Результати вражають: Grok 4.5 набрав 51,4% успішних виконань завдань, залишивши позаду таких важковаговиків, як Claude Fable 5 (48,6%) та Claude Opus 4.8 (48,5%). Однак ключовий момент — це не просто перемога за сирими балами, а колоссальний розрив у вартості операцій.
Економіка нового покоління: швидкість і ціна
Головний козир Grok 4.5 — це його економічна ефективність. Вартість виконання одного завдання становить лише $0,34. Для порівняння: у Fable 5 цей показник дорівнює $1,35, а у Opus 4.8 — $1,46. Це більш ніж чотириразова перевага. Найближчий переслідувач за ціною — Gemini 3.5 Flash ($0,49) — все одно значно поступається.
Секрет такого домінування криється в архітектурі V9 з 1,5 трлн параметрів. Grok 4.5 використовує лише близько 8000 вихідних токенів на завдання — це лише 25% ресурсів, які витрачає Opus 4.8. Сумарне споживання в 0,44 млн токенів на завдання — один із найнижчих показників на ринку. Це не просто перемога, це зміна парадигми: висока продуктивність більше не вимагає пропорційно високих витрат.
Глибокий аналіз: фінанси та надійність
Особливої уваги заслуговує робота моделі у фінансовому секторі — найскладнішій категорії тесту. Тут Grok 4.5 показав результат у 71%, впевнено обійшовши Fable 5 (64%) та Opus 4.8 (62%). Для компаній, що впроваджують ІІ-агентів у реальні бізнес-процеси, цей розрив має критичне значення.
При цьому варто зазначити, що модель порушує правила дещо частіше за конкурентів: у середньому 0,63 порушення на завдання проти 0,55 у Opus 4.8 та 0,46 у Gemini 3.5 Flash. У фінансових системах, де одна помилка може призвести до значних збитків, це потребує додаткової уваги та налаштування guardrails.
Експертна думка Cryptalist: Ринок ІІ-агентів вступає у фазу зрілості, де ключовим фактором стає не лише якість, а й економіка. Grok 4.5 задає новий стандарт, демонструючи, що ефективність не повинна бути дорогою. Однак для критично важливих фінансових застосунків питання надійності та мінімізації помилок залишається пріоритетом №1. Я очікую, що в найближчі квартали ми побачимо запеклу цінову війну, і саме Grok 4.5 став її першим серйозним пострілом.