Ринок ІІ-агентів отримав нового беззаперечного лідера. Аналітичне агентство Artificial Analysis провело незалежний бенчмарк AutomationBench-AA, і результати виявилися вельми показовими. Модель Grok 4.5 від SpaceXAI не просто обійшла визнаних гігантів — Claude Fable 5 та Claude Opus 4.8, — але й зробила це з колосальним відривом за економічною ефективністю.
Перемога за всіма фронтами: продуктивність та вартість
У тесті, який включав 657 завдань у 40 симульованих додатках (Gmail, Slack, Salesforce, HubSpot та інші), Grok 4.5 набрав 51,4% успішних завершень. Для порівняння: у Claude Fable 5 — 48,6%, а у Claude Opus 4.8 — 48,5%. Однак головний сюрприз криється в ціні. Виконання одного завдання Grok 4.5 коштує лише $0,34, тоді як Fable 5 обходиться в $1,35, а Opus 4.8 — в $1,46. Найближчий конкурент за ціною, Gemini 3.5 Flash, коштує $0,49 за завдання, але показує значно скромніші результати.
Ефективність як ключова перевага
Секрет успіху Grok 4.5 криється в його архітектурі V9 з 1,5 трильйонами параметрів. Для виконання одного завдання модель використовує близько 8000 вихідних токенів — це приблизно 25% від ресурсів, які витрачає Opus 4.8. Сумарне споживання токенів на завдання становить лише 0,44 млн — один із найнижчих показників серед усіх моделей. Саме ця ефективність, помножена на низьку ціну токена, і формує ту саму конкурентну перевагу, про яку говорили представники SpaceXAI при запуску.
Фінансовий сегмент: беззаперечне домінування
Особливої уваги заслуговує продуктивність Grok 4.5 у фінансовому секторі — найскладнішій категорії тесту. Модель показала 71% успішних рішень, залишивши позаду Fable 5 (64%) та Opus 4.8 (62%). Це критично важливий показник для компаній, що впроваджують ІІ-агентів у реальні фінансові системи. Однак варто зазначити, що Grok 4.5 допускає порушення правил частіше за конкурентів: у середньому 0,63 порушення на завдання проти 0,55 у Opus 4.8 та 0,46 у Gemini 3.5 Flash. У високоризикових сценаріях це може стати серйозним недоліком.
Мій аналіз: Grok 4.5 демонструє, що майбутнє ІІ-агентів — це не просто "розумні" моделі, а економічно ефективні рішення. Розрив у ціні в 4 рази при порівнянній якості виконання завдань робить цю модель надзвичайно привабливою для масового впровадження в бізнес-процеси. Однак підвищений рівень порушень правил потребує додаткової уваги та налаштування, особливо в регульованих секторах, таких як фінанси. Ринок ІІ-агентів явно вступає у фазу прайс-війни, і це чудова новина для кінцевих користувачів.