Перегони за швидкість: Google та OpenAI представили AI-рішення нового покоління

Ринок штучного інтелекту продовжує лихоманити: 13 серпня одразу два технологічні гіганти випустили свої оновлення, націлені на одну й ту саму нішу — надшвидку обробку завдань для розробників та ІІ-агентів. Google представила Gemini 3.7 Flash, а OpenAI анонсувала режим Ultrafast для своєї флагманської моделі GPT-5.6 Sol. Це не просто еволюція, а чіткий сигнал про те, куди рухається індустрія: у бік швидкості та ефективності, а не лише сирої потужності.
Що нового в Gemini 3.7 Flash
Google позиціонує Gemini 3.7 Flash як робочу конячку для програмування та автоматизації бізнес-процесів. Ключові покращення стосуються багатоетапного планування, точного дотримання інструкцій та генерації коду. Однак найцікавіше — це ціна: компанія заявила про зниження вартості використання вдвічі порівняно зі стартовою ціною попередньої версії. Це агресивний крок, враховуючи, що лінійка Flash і так була орієнтована на сценарії, де критична швидкість відповіді: кодинг, робота агентів та завдання з великою кількістю послідовних звернень до моделі.
Нагадаю, що в липні вийшла Gemini 3.6 Flash із ціною $1,5 за 1 млн вхідних токенів та $7,5 за 1 млн вихідних. Тоді ж компанія відзвітувала, що нова модель споживає на 17% менше вихідних токенів, ніж 3.5 Flash. При цьому флагманська Gemini 3.5 Pro, яку багато хто чекав, так і не вийшла у відкритий доступ — розробники досі тестують її з партнерами, і терміни релізу залишаються туманними.
Як OpenAI прискорила GPT-5.6 Sol
OpenAI відповіла симетрично, але з іншим акцентом. Режим Ultrafast для GPT-5.6 Sol, за заявою компанії, розганяє генерацію до 750 вихідних токенів на секунду — це до 14 разів швидше за стандартний режим. Секрет у використанні інфраструктури Cerebras, яка спеціалізується на надшвидкісних обчисленнях. Однак на старті доступ до Ultrafast отримають лише обмежена кількість клієнтів через API, і OpenAI обіцяє розширювати доступ у міру нарощування обчислювальних потужностей.
Показник у 750 токенів на секунду не новий — про нього говорили ще в червні під час анонсу GPT-5.6. Тоді ж було зрозуміло, що Sol запустять на Cerebras, але із застереженням про поетапне підключення користувачів. Зараз цей план починає матеріалізуватися. На цьому тлі варто згадати й серпневий реліз Grok 4.6 від SpaceXAI — модель, сфокусовану на довгострокових агентських завданнях і програмуванні. Конкуренція розпалюється до межі.
Мій аналіз: Обидва анонси підтверджують тренд на «малі та швидкі» моделі, які можуть працювати в реальному часі. Зниження ціни у Google та екстремальна швидкість в OpenAI — це два різні підходи до однієї проблеми: зробити ІІ доступним для масової автоматизації. У короткостроковій перспективі виграє той, хто зможе запропонувати найкращий баланс ціни та затримки відповіді, особливо в сегменті агентних рішень, де кожен зайвий мілісекунд — це втрачені гроші.