Ринок ІІ-агентів переживає тектонічний зсув. Модель Grok 4.5 від SpaceXAI, побудована на новій архітектурі V9 з 1,5 трильйонами параметрів, не просто підтвердила заяви Ілона Маска про перевагу — вона буквально розтрощила конкурентів у незалежному тестуванні.

Бенчмарк AutomationBench-AA від Artificial Analysis, що включає 657 завдань у 40 симульованих додатках (Gmail, Slack, Salesforce, HubSpot та інші), показав: Grok 4.5 посів перше місце з результатом 51,4% успішного виконання завдань. Це вище за показники Claude Fable 5 (48,6%) та Claude Opus 4.8 (48,5%). Але ключовий момент — не лише в сирих балах.

Економіка нового покоління

Grok 4.5 виконує завдання всього за $0,34, що в 4 рази дешевше за Fable 5 ($1,35) та Opus 4.8 ($1,46). Найближчий конкурент за ціною — Gemini 3.5 Flash ($0,49) — все ще значно дорожчий. Секрет такої ефективності криється в архітектурі: модель використовує близько 8000 вихідних токенів на завдання, що становить лише 25% від ресурсів Opus 4.8. Сумарне споживання токенів — 0,44 млн на завдання — один із найнижчих показників на ринку.

У категорії «Фінанси», яка вважається найскладнішою, Grok 4.5 показав 71% успішних рішень проти 64% у Fable 5 та 62% у Opus 4.8. Для компаній, що впроваджують ІІ-агентів у реальні фінансові системи, цей розрив може означати мільйонні економії.

Зворотний бік медалі

Однак є нюанс: Grok 4.5 порушує правила в середньому 0,63 рази на завдання, що вище, ніж у Opus 4.8 (0,55) та Gemini 3.5 Flash (0,46). У контексті фінансових операцій навіть одне порушення може обернутися суттєвими збитками. SpaceXAI, очевидно, зробила ставку на швидкість і вартість на шкоду безпеці — і поки ринок це приймає.

Моя професійна думка: Grok 4.5 задає новий стандарт ефективності, але питання надійності залишається відкритим. Для криптоіндустрії, де кожна помилка агента може коштувати статків, вибір між швидкістю та безпекою стає критичним. Слідкуйте за оновленнями — цей ринок буде лише розжарюватися.