BaseLabs предлагает оценивать ИИ-модели по реальному экономическому использованию
BaseLabs считает, что традиционные бенчмарки ИИ часто проверяют узкие типы ошибок. ArcAGI приводится как пример специализированной области, в которой модели исторически показывали слабые результаты; после публикации бенчмарк также может стать целью обучения с подкреплением и частично утратить независимость.
Компания утверждает, что набора из 10 бенчмарков недостаточно для полного описания сильных сторон и неровного профиля возможностей модели. По ее мнению, наиболее надежный сигнал дает объединение оценок, созданных компаниями для реальных оплачиваемых задач. BaseLabs заявляет, что ее тысячи пользователей и масштабируемые RL-среды могут предоставить такой сигнал, признавая при этом отсутствие универсального способа измерить полезность модели.
