25 серпня OpenAI представила перші офіційні результати тестування свого спеціалізованого чипа для інференсу Jalapeño, і вони виглядають як серйозний виклик гегемонії Nvidia у сегменті ШІ-прискорювачів. Згідно з моїми даними, у бенчмарках компанії новий процесор демонструє від 1,5 до 1,9 раза більшу обчислювальну ефективність на ват і зниження затримки в 1,7–3,6 раза порівняно з флагманськими системами на базі Nvidia GB200 і GB300.

Для найбільш вимогливих інтерактивних сценаріїв розрив стає ще вражаючішим: продуктивність Jalapeño перевершує конкурентів у 2,1–4,1 раза. OpenAI уже анонсувала плани з розгортання чипа у власній інфраструктурі до кінця 2026 року, що може кардинально змінити економіку їхніх хмарних сервісів.

Детальний розбір тестів: три моделі, три перемоги

Для об'єктивності OpenAI використала публічний бенчмарк InferenceX від SemiAnalysis, який оцінює повний цикл обробки запиту, включно з пропускною здатністю, енергоспоживанням і латентністю. Результати вражають:

GPT-OSS 120B проти GB200: пікова продуктивність Jalapeño становила 85 448 mixed TPS/кВт проти 44 960 у Nvidia (перевага в 1,9 раза). Повна затримка — 1,03 секунди проти 1,8 секунди.

DeepSeek R1 670B проти GB300: тут розрив в ефективності досяг 19 641 mixed TPS/кВт проти 11 781 (у 1,7 раза), а затримка виявилася в 3,6 раза нижчою — 1,65 секунди проти 5,99 секунди.

Kimi K2.5 1T проти GB300: власний чип OpenAI показав 18 195 mixed TPS/кВт проти 11 862, забезпечивши затримку 1,56 секунди проти 5,31 секунди. Перевага — у 1,5 і 3,4 раза відповідно.

Важливий нюанс: під час підрахунків використовувалися заявлені виробниками показники TDP. Для Jalapeño це 700 Вт, тоді як у GB200 — 1200 Вт, а у GB300 — 1400 Вт. При цьому OpenAI зазначає, що фактичне стале енергоспоживання їхнього чипа в тестах не перевищувало 550 Вт, що робить результати ще переконливішими.

ШІ як інженер: дев'ятимісячний цикл розробки

Окремої уваги заслуговує методологія створення Jalapeño. OpenAI активно використовувала власні ШІ-моделі на всіх етапах: від пошуку архітектурних рішень до перевірки та оптимізації арифметичних блоків. Це дозволило скоротити шлях від концепції до готового до виробництва дизайну до дев'яти місяців — безпрецедентно короткий термін для напівпровідникової галузі.

Більше того, за допомогою інструмента Codex на базі GPT-Astra інженерам вдалося менш ніж за два місяці досягти високої продуктивності чипа на трьох моделях з відкритими вагами, які спочатку не входили у виробничий план. Для окремих компонентів — attention і mixture-of-experts у GPT-OSS — згенеровані ШІ реалізації виявилися в 1,5–1,8 раза швидшими за написані вручну.

Стратегічний контекст: більше, ніж просто чип

Фінансовий директор OpenAI Сара Фрайар позиціонує Jalapeño як ключовий елемент вертикально інтегрованої інфраструктури, що охоплює дата-центри, пам'ять, мережі та ПЗ. Власний прискорювач дає компанії безпрецедентний контроль над вартістю інференсу та дозволяє гнучко розподіляти навантаження залежно від співвідношення ціни та продуктивності.

Примітно, що OpenAI не відмовляється від партнерів — у портфелі є Microsoft, Nvidia, AWS, AMD, Broadcom та інші. Економічна логіка тут проста: зниження вартості одиниці обчислень безпосередньо покращує співвідношення виручки до інфраструктурних витрат. Фрайар також посилається на парадокс Джевонса, припускаючи, що зростання ефективності призведе не до скорочення споживання обчислень, а до вибухового зростання кількості економічно виправданих ШІ-завдань.

Jalapeño — лише перше покоління. Друге вже перебуває на просунутій стадії розробки, а третє — у проєктуванні. Перші чипи з'являться в інфраструктурі OpenAI до кінця року.

Мій аналітичний висновок: Успіх Jalapeño — це не просто технологічна перемога, а сигнал про зміну парадигми в індустрії. Якщо OpenAI вдасться масштабувати виробництво та підтвердити ці показники в реальній експлуатації, ми станемо свідками першого серйозного виклику домінуванню Nvidia у сегменті ШІ-інференсу за останні роки. Питання лише в тому, чи зможе OpenAI зберегти цю перевагу в умовах масового виробництва та зростаючого попиту.