BaseLabs considers open RL environments to help close the gap with major labs
BaseLabs says its mandate is to make open-source models—and eventually possibly closed-source models—as useful as possible. Alongside aggregating compute, it is considering aggregating data and creating complex reinforcement-learning environments for the open community.
The project estimates that closed-source labs spend billions of dollars a year on RL environments. BaseLabs says it has spent the past few years making environments for individual users and is considering releasing them for everyone, so open- and closed-source providers can train on them. It remains unclear whether BaseLabs can create environments comparable to those of major labs, or whether distillation and accessible data alone can close the gap.
BaseLabs рассматривает открытые RL-среды как способ сократить отставание от крупных лабораторий
BaseLabs заявляет, что его задача — сделать открытые модели, а в перспективе, возможно, и закрытые модели максимально полезными. Помимо агрегации вычислений, проект рассматривает агрегацию данных и создание сложных сред для обучения с подкреплением для открытого сообщества.
По оценке проекта, закрытые лаборатории тратят на RL-среды миллиарды долларов в год. BaseLabs сообщает, что последние несколько лет создавала среды для отдельных пользователей и рассматривает возможность выпустить их для всех, чтобы на них могли обучаться открытые и закрытые поставщики. Пока неясно, сможет ли BaseLabs создать среды, сопоставимые со средами крупных лабораторий, и достаточно ли дистилляции и доступных данных, чтобы сократить разрыв.
