Ринок ІІ-агентів отримав нового лідера. Модель Grok 4.5 від SpaceXAI не просто обійшла флагманів Anthropic — Claude Fable 5 та Claude Opus 4.8 — у незалежному бенчмарку AutomationBench-AA, але й зробила це з колосальним відривом за економічною ефективністю. Це не просто перемога в тесті, це зміна парадигми.

Grok 4.5, побудована на архітектурі V9 з 1,5 трильйона параметрів, продемонструвала результат 51,4% у бенчмарку AutomationBench-AA від Artificial Analysis. Для порівняння, у Claude Fable 5 — 48,6%, а у Claude Opus 4.8 — 48,5%. Однак ключовий показник — не лише точність, але й вартість.

Grok 4.5 виконує завдання за $0,34, тоді як Fable 5 обходиться в $1,35, а Opus 4.8 — в $1,46. Найближчий конкурент за ціною, Gemini 3.5 Flash, коштує $0,49 за завдання. Така низька вартість досягається завдяки радикальній ефективності: Grok 4.5 використовує близько 8000 вихідних токенів на завдання — це лише 25% від ресурсів, які споживає Opus 4.8. Сумарне споживання токенів — 0,44 млн на завдання — один із найнижчих показників на ринку.

Фінансовий сектор: де Grok 4.5 справді блиснув

Найпоказовішим є результат моделі у фінансовій категорії — найскладнішій у тесті. Grok 4.5 набрала 71%, залишивши позаду Fable 5 (64%) та Opus 4.8 (62%). Для компаній, які автоматизують фінансові процеси, цей розрив є критичним. Помилка у фінансовому агенті може обернутися прямими збитками, і тут Grok демонструє явну перевагу.

Однак є й нюанс: Grok 4.5 порушує правила в середньому 0,63 рази на завдання, що вище, ніж у Opus 4.8 (0,55) та Gemini 3.5 Flash (0,46). Це плата за агресивну оптимізацію швидкості та вартості. Для бізнесу, який запускає агентів у production-середовищах, цей фактор потребує особливої уваги та додаткових рівнів валідації.

Тест включає 657 завдань у 40 симульованих додатках, включаючи Gmail, Slack, Salesforce та HubSpot. Підсумковий бал відображає частку завдань, виконаних агентом без порушення закладених правил. Artificial Analysis тримає список завдань у секреті, що гарантує об'єктивність результатів та виключає «натаскування» моделей.

Мій професійний погляд: Grok 4.5 задає нову планку для ринку ІІ-агентів. Поєднання високої точності та радикально низької вартості — це саме те, що потрібно для масового впровадження агентів у бізнес-процеси. Перемога у фінансовому секторі — сигнал для всього FinTech. Якщо Anthropic та Google не відповідять адекватним зниженням цін, частка Grok на корпоративному ринку зростатиме експоненційно.