Дискуссия об ИИ-надзоре разделяет прогнозирование и независимую оценку
Анализ надзора за ИИ различает прогнозирование будущего поведения передовых моделей и операционную оценку: изучение журналов, выявление нарушений правил или взломов, оценку рисков и определение ответственности. В нём утверждается, что это разные дисциплины, а операционных оценщиков можно обучить понимать системы, не требуя от них определённого взгляда на катастрофические риски ИИ.
Дискуссия вокруг METR связана с более широкими вопросами независимости третьих сторон. Согласно анализу, даже если METR на практике действует независимо, его структура финансирования и институциональная история могут подрывать общественное доверие; при этом остаётся неясным, сколько организаций способны оценивать поведение передовых моделей.
Сообщается, что CASI — Center for AI Standards and Innovation — испытывает трудности с финансированием и привлечением специалистов из ИИ-лабораторий. Анализ допускает расширение круга кандидатов, отмечая, что методы определения безопасности ИИ-модели ещё не устоялись и не работают как фиксированные правила бухгалтерского учёта.
