TBPN

← Все новости выпуска

3 сентября 2026

BaseLabs предлагает оценивать ИИ-модели по реальному экономическому использованию

BaseLabs считает, что традиционные бенчмарки ИИ часто проверяют узкие типы ошибок. ArcAGI приводится как пример специализированной области, в которой модели исторически показывали слабые результаты; после публикации бенчмарк также может стать целью обучения с подкреплением и частично утратить независимость.

Компания утверждает, что набора из 10 бенчмарков недостаточно для полного описания сильных сторон и неровного профиля возможностей модели. По ее мнению, наиболее надежный сигнал дает объединение оценок, созданных компаниями для реальных оплачиваемых задач. BaseLabs заявляет, что ее тысячи пользователей и масштабируемые RL-среды могут предоставить такой сигнал, признавая при этом отсутствие универсального способа измерить полезность модели.

Конфиденциальность ·