Inference разделяется на специализированные рынки на фоне роста локального и голосового AI
Inference был назван крупнейшим рынком в software, сменившим рынок баз данных; ожидается его разделение по скорости, стоимости и типу нагрузки. Инвестиция в Sail нацелена на сценарии, где пользователи готовы ждать от пяти до десяти минут ради существенного снижения стоимости inference; многие бизнес-задачи, по этой оценке, лучше переносят задержку, чем потребительские AI-сценарии.
Тот же инвестор назвал отдельными направлениями voice inference, робототехнику и локальный AI. По его словам, Ollama первоначально использовали около 10 млн человек для локального AI, а в исследовании Stanford, которое, как утверждалось, вышло тремя или четырьмя неделями ранее, говорится, что 90% white-collar AI-задач можно решать на MacBook. Методология и точная дата исследования в источнике не приведены. Более тяжелые задачи могут передаваться в облако.
Voice AI может работать на устройстве, edge или в дата-центре, но его архитектура включает телекоммуникации, оцифровку звонка и обработку моделью, поэтому задержка имеет ключевое значение. KV-cache warming позволяет подготовить системы к нагрузке, связанной с часовыми поясами. Ожидается, что voice inference начнется преимущественно в централизованных дата-центрах и со временем, вероятно, сместится к edge.
