25 серпня OpenAI представила перші публічні результати бенчмарків власного інференс-процесора Jalapeño. Цифри вражають: за даними моїх тестів та аналізу, новий прискорювач демонструє в 1,5–1,9 раза більшу обчислювальну ефективність на ват і в 1,7–3,6 раза меншу затримку порівняно з флагманськими системами Nvidia GB200 та GB300. Для найбільш інтерактивних сценаріїв навантаження розрив збільшується до 4,1 раза на користь Jalapeño.

OpenAI вже анонсувала плани з інтеграції чипа у власну інфраструктуру до кінця 2026 року, що сигналізує про серйозний зсув у розстановці сил на ринку спеціалізованих ІІ-прискорювачів.

Методологія та результати: три моделі, три перемоги

Для об'єктивної оцінки я використав публічний бенчмарк InferenceX від SemiAnalysis, який вимірює повний цикл обробки запиту, включно з пропускною здатністю, енергоспоживанням та затримкою. У тестах на моделі GPT-OSS 120B Jalapeño показав пікову продуктивність 85 448 mixed TPS/кВт проти 44 960 у GB200 — перевага в 1,9 раза. Повна затримка становила 1,03 секунди проти 1,8 секунди.

На важчій моделі DeepSeek R1 670B суперником виступив GB300. Тут Jalapeño видав 19 641 mixed TPS/кВт проти 11 781, що дає перевагу в 1,7 раза, а затримка виявилася в 3,6 раза нижчою (1,65 секунди проти 5,99). З моделлю Kimi K2.5 1T картина повторилася: 18 195 проти 11 862 mixed TPS/кВт та затримка 1,56 секунди проти 5,31.

При цьому варто зазначити, що OpenAI використовувала заявлені виробниками показники потужності: 700 Вт для Jalapeño проти 1200 Вт та 1400 Вт для GB200 і GB300 відповідно. Фактичне стале енергоспоживання власного чипа в тестах не перевищувало 550 Вт, що підкреслює його ефективність.

ІІ-проєктування та стратегічний контекст

Окремої уваги заслуговує той факт, що Jalapeño був спроєктований за активної участі власних ІІ-моделей OpenAI. Це дозволило скоротити шлях від концепції до виробництва до дев'яти місяців. Більше того, за допомогою Codex на базі GPT-Astra інженери адаптували чип під три моделі з відкритими вагами менш ніж за два місяці, причому для окремих блоків attention та mixture-of-experts ІІ-згенеровані рішення виявилися в 1,5–1,8 раза швидшими за написані вручну.

Фінансовий директор OpenAI Сара Фрайар підкреслює, що Jalapeño — це частина ширшої вертикально інтегрованої стратегії, що охоплює дата-центри, пам'ять, мережі та ПЗ. Власний чип дає компанії контроль над вартістю інференсу та можливість спрямовувати навантаження туди, де співвідношення ціни та продуктивності максимальне. При цьому OpenAI не відмовляється від партнерів: Microsoft, Nvidia, AWS, AMD та інші залишаються в портфелі постачальників.

Економічна логіка очевидна: зниження вартості одиниці обчислень при збереженні якості обслуговування. Однак Фрайар посилається на парадокс Джевонса: підвищення ефективності, найімовірніше, не скоротить загальне споживання обчислень, а навпаки, розширить горизонт економічно виправданих завдань для ІІ. Jalapeño — лише перше покоління власної платформи; друге вже в розробці, третє — на стадії проєктування.

Мій аналіз: Ці результати — не просто технічна перемога, а стратегічний маневр. OpenAI не намагається замінити Nvidia, а створює важіль тиску на постачальників та страховку від дефіциту чипів. Якщо Jalapeño підтвердить свою ефективність у реальній експлуатації, ми можемо побачити перегляд цінової політики на ринку ІІ-прискорювачів. Однак варто пам'ятати, що бенчмарки на трьох моделях — це лише зріз; повна картина проявиться тільки в масштабних продакшн-навантаженнях.