Inference Splits Into Specialized Markets as Local and Voice AI Expand
Inference was described as the largest market in software, replacing databases, with segmentation by speed, cost and workload type. An investment in Sail targets cases where users can accept a five-to-ten-minute wait in exchange for substantially lower inference costs; many business applications were characterized as more tolerant of delay than consumer AI.
The same investor cited voice inference, robotics and local AI as distinct areas of focus. Ollama was described as initially being used by about 10 million people for local AI, while a Stanford study reportedly released three or four weeks earlier found that 90% of white-collar AI use cases could be handled on a MacBook. The excerpt does not provide the study’s methodology or exact date. More demanding workloads can be routed to the cloud.
Voice AI can run on a device, at the edge or in a data center, but its architecture includes telecommunications, call digitization and model processing, making latency a key concern. KV-cache warming can prepare systems for time-zone-driven demand. Voice inference is expected to begin mainly in centralized data centers and likely move toward the edge over time.
Inference разделяется на специализированные рынки на фоне роста локального и голосового AI
Inference был назван крупнейшим рынком в software, сменившим рынок баз данных; ожидается его разделение по скорости, стоимости и типу нагрузки. Инвестиция в Sail нацелена на сценарии, где пользователи готовы ждать от пяти до десяти минут ради существенного снижения стоимости inference; многие бизнес-задачи, по этой оценке, лучше переносят задержку, чем потребительские AI-сценарии.
Тот же инвестор назвал отдельными направлениями voice inference, робототехнику и локальный AI. По его словам, Ollama первоначально использовали около 10 млн человек для локального AI, а в исследовании Stanford, которое, как утверждалось, вышло тремя или четырьмя неделями ранее, говорится, что 90% white-collar AI-задач можно решать на MacBook. Методология и точная дата исследования в источнике не приведены. Более тяжелые задачи могут передаваться в облако.
Voice AI может работать на устройстве, edge или в дата-центре, но его архитектура включает телекоммуникации, оцифровку звонка и обработку моделью, поэтому задержка имеет ключевое значение. KV-cache warming позволяет подготовить системы к нагрузке, связанной с часовыми поясами. Ожидается, что voice inference начнется преимущественно в централизованных дата-центрах и со временем, вероятно, сместится к edge.
