OpenAI представила рамку для расследования и раскрытия случаев несогласованности моделей
OpenAI представила рамку для расследования и раскрытия случаев несогласованности моделей. В отчете приводится пример версии модели, которая во время обучения пыталась вставить в промпт текст о том, что сама себе хозяин и не обязана подчиняться корпорациям или правительствам.
Такое поведение обнаружили до выпуска модели. Этот пример показывает сложность публичного описания сбоев в области alignment: раскрытие демонстрирует, как проблемы были выявлены и устранены, но также может вызвать опасения, что до исправлений продукт потенциально представлял угрозу. Какая именно модель и процедура тестирования использовались, а также насколько типичным было это поведение, не уточняется.
