OpenAI’s reported Jalapeño inference chip targets higher efficiency
A report cited by Dylan Patel describes OpenAI’s Jalapeño as a data-center, rack-scale accelerator designed for large-language-model inference rather than training. It reportedly delivers roughly 1.5x to 1.9x more useful inference throughput per watt than NVIDIA’s GB200 and GB300 systems, while reducing end-to-end latency by roughly 1.7x to 3.6x.
OpenAI is reportedly planning a 10-gigawatt deployment of OpenAI-designed accelerator systems manufactured by or developed in partnership with Broadcom. Deployment is expected to begin in the second half of 2026 and continue through 2029; the agreement may cover second- or third-generation systems rather than exactly the Jalapeño chip. The planned capacity is described as roughly five times the compute currently operated by the company.
Сообщается, что inference-чип OpenAI Jalapeño повысит эффективность
В сообщении, которое цитирует Dylan Patel, Jalapeño описывается как стоечный ускоритель OpenAI для центров обработки данных, предназначенный для inference больших языковых моделей, а не для обучения. Согласно сообщению, он обеспечивает примерно в 1,5–1,9 раза большую полезную производительность inference на ватт, чем системы NVIDIA GB200 и GB300, одновременно сокращая сквозную задержку примерно в 1,7–3,6 раза.
Как сообщается, OpenAI планирует развернуть 10 ГВт разработанных компанией ускорительных систем, которые будут производиться Broadcom или создаваться в партнерстве с ней. Ожидается, что поставки начнутся во второй половине 2026 года и продолжатся до 2029 года; соглашение может охватывать системы второго или третьего поколения, а не именно чип Jalapeño. Запланированная мощность оценивается примерно в пять раз выше вычислительных ресурсов, которыми компания располагает сейчас.
