Сообщается, что inference-чип OpenAI Jalapeño повысит эффективность
В сообщении, которое цитирует Dylan Patel, Jalapeño описывается как стоечный ускоритель OpenAI для центров обработки данных, предназначенный для inference больших языковых моделей, а не для обучения. Согласно сообщению, он обеспечивает примерно в 1,5–1,9 раза большую полезную производительность inference на ватт, чем системы NVIDIA GB200 и GB300, одновременно сокращая сквозную задержку примерно в 1,7–3,6 раза.
Как сообщается, OpenAI планирует развернуть 10 ГВт разработанных компанией ускорительных систем, которые будут производиться Broadcom или создаваться в партнерстве с ней. Ожидается, что поставки начнутся во второй половине 2026 года и продолжатся до 2029 года; соглашение может охватывать системы второго или третьего поколения, а не именно чип Jalapeño. Запланированная мощность оценивается примерно в пять раз выше вычислительных ресурсов, которыми компания располагает сейчас.
