AI models may be better judged by task-specific utility thresholds
An analysis proposes evaluating large language models by whether they clear the intelligence threshold required for a particular task, rather than by a single absolute ranking. Below that threshold, the task cannot be completed; above it, additional intelligence brings sharply diminishing returns.
Closed-source models are said to reach these thresholds first, while open-source models may catch up roughly six to nine months later, though the delay varies by task. Once the threshold is reached, many economically valuable applications may favor open models for control and task-specific improvement, while frontier science and mathematics retain highly inelastic demand for maximum intelligence.
AI product companies are expected to use user feedback to improve models for the tasks they prioritize, rather than remain wrappers around other models. The ecosystem is still described as too immature for most companies to train such models independently, but this could become more common over time.
Модели ИИ могут эффективнее оцениваться по порогам полезности для конкретных задач
В рамках анализа предлагается оценивать большие языковые модели по тому, достигают ли они порога интеллекта, необходимого для конкретной задачи, а не по единому абсолютному рейтингу. Ниже этого порога задачу выполнить нельзя, а выше него дополнительный интеллект дает резко убывающую отдачу.
По этой оценке, закрытые модели обычно достигают нужных порогов первыми, тогда как открытые могут догонять их примерно через шесть—девять месяцев, хотя задержка зависит от задачи. После достижения порога многие экономически ценные приложения могут предпочесть открытые модели ради контроля и специализированного улучшения; при этом для передовой науки и математики спрос на максимальный интеллект остается крайне неэластичным.
Ожидается, что компании, создающие ИИ-продукты, будут использовать отзывы пользователей, чтобы улучшать модели под приоритетные задачи, а не оставаться оболочками над чужими моделями. Экосистема пока считается недостаточно зрелой, чтобы большинство компаний самостоятельно обучали такие модели, но со временем это может стать более распространенным.
