Model Values Become a Distinct AI-Development Challenge
As open-source models approach closed systems in capabilities and economically valuable tasks, the values embedded in models are becoming a separate development challenge. Values, ethics and morality are shaped—implicitly or explicitly—through pre-training, mid-training, post-training, classifiers and safety systems.
The unclear values of Chinese open-source models are cited as one reason many American companies are reluctant to use them. A key unresolved research question is whether model values can be organically shaped for a country, company or individual, including through possible “post-post-training.”
Trust in benchmarks is described as being at an all-time low and potentially declining further, complicating how the value of new models should be communicated.
Ценности моделей становятся отдельной проблемой разработки ИИ
По мере того как открытые модели приближаются к закрытым по своим возможностям и экономически ценным задачам, заложенные в них ценности становятся отдельной проблемой разработки. Ценности, этика и мораль формируются — прямо или косвенно — на этапах предварительного, промежуточного и последующего обучения, а также классификаторами и системами безопасности.
Неясность ценностей китайских открытых моделей называется одной из причин, по которым многие американские компании не хотят их использовать. Важный нерешённый исследовательский вопрос — можно ли органично формировать ценности модели под страну, компанию или отдельного человека, в том числе с помощью возможного «пост-пост-обучения».
Доверие к бенчмаркам, как отмечается, находится на исторически низком уровне и может продолжить снижаться, что усложняет коммуникацию ценности новых моделей.
