Decagon routes agent tasks to smaller models to cut cost and voice latency
Decagon says that after an AI-agent product is working, many model calls do not require a full frontier model. It uses smaller—and specifically open-source—models for internal tasks such as choosing a topic and detecting hallucinations, while retaining frontier models for new products and capabilities.
The company says smaller models have performed at the same level for these use cases after fine-tuning or post-training. For voice agents, Decagon considers latency at least as important as cost and says most current gains come from reducing model size, rather than from chipset changes or edge deployment. It suggests that edge computing could become more relevant once models are further optimized.
Decagon направляет задачи агентов на меньшие модели, снижая стоимость и задержку голосовых агентов
Decagon заявляет, что после запуска работающего продукта на базе ИИ-агента многие обращения к моделям не требуют полной frontier-модели. Компания использует меньшие, в частности открытые, модели для внутренних задач — например, выбора темы и обнаружения галлюцинаций, — сохраняя frontier-модели для новых продуктов и возможностей.
По словам компании, после дообучения или постобучения меньшие модели в этих сценариях показывают тот же уровень качества. Для голосовых агентов Decagon считает задержку как минимум столь же важной, как стоимость, и говорит, что большая часть текущего выигрыша достигается за счёт уменьшения моделей, а не изменений чипов или размещения на периферии. Компания допускает, что после дальнейшей оптимизации моделей периферийные вычисления могут стать более значимыми.