Разнообразный парк ускорителей рассчитан на разные AI-нагрузки в rack-scale системах
Компания, работающая в сфере ускоренных вычислений, заявляет, что разным AI-моделям и этапам вычислений — включая prefill, inference и decode — требуются разные возможности. Ее стратегия предполагает предоставление производительных архитектур для таких нагрузок и нескольких конфигураций rack-scale серверов; также вводится в работу сделка с Groq, хотя ее точная будущая роль не уточняется.
Компания описывает rack-scale инфраструктуру на базе семи процессоров, стремясь обеспечить передовые характеристики каждого из них и максимальную эффективность токенов на ватт для крупных AI-фабрик. Партнерскую экосистему она рассматривает как способ распространить эту эффективность на новые области и сценарии применения.
Будущий состав специализированных ускорителей и конфигураций остается неопределенным, однако описанный подход предполагает, что парк может расширяться по мере появления новых моделей и вариантов использования.
