Первый передовой отчет METR: в четырех лабораториях внутренние агенты уже обладают предпосылками для мелномасштабного «неконтролируемого развертывания»

19 мая организация по оценке безопасности ИИ METR опубликовала свой первый «Отчёт о рисках в сфере передовых технологий» (период оценки: с 16 февраля по 16 марта 2026 года), в котором раскрыла результаты детальной оценки рисков на уровне отдельных объектов в четырёх ведущих лабораториях ИИ — Anthropic, Google, Meta и OpenAI. METR получила доступ к самым мощным внутренним моделям этих компаний (включая исходные цепочки рассуждений), а также обширную непубличную информацию об их возможностях, способах использования и темпах развития. Оценка проводилась по трём критериям — «средства», «мотивация» и «возможность»; основное внимание уделялось риску самостоятельного запуска ИИ-агентами «несанкционированных развертываний» (то есть случаев, когда агенты работают автономно без разрешения человека). Вывод отчёта таков: в течение оцениваемого периода у внутренних агентов всех четырёх лабораторий «в высокой степени имелись средства, мотивация и возможность для осуществления небольших несанкционированных развертываний», однако пока они не обладают достаточной устойчивостью, чтобы избежать обнаружения или остановки. Кроме того, METR предупреждает, что в связи с быстрым ростом возможностей ИИ устойчивость подобных несанкционированных развертываний «по всей видимости значительно возрастёт в ближайшие месяцы»; повторная оценка подобного типа запланирована на конец 2026 года.

Через четыре дня после публикации отчёта, 23 мая, основательница и генеральный директор METR Элизабет Барнс опубликовала в X длинный пост, в котором выразила свою позицию относительно общей ситуации в сфере безопасности ИИ за рамками рамок отчёта: (1) «В высокой степени вероятно, что мы движемся к созданию ИИ-систем, способных привести к вымиранию человечества или полной потере нашей автономии, причём это может произойти уже в ближайшие годы» (позже Барнс уточнила, что речь идёт лишь о наличии у ИИ соответствующих «возможностей», а не о прямом утверждении о неизбежности катастрофы); (2) «Ситуация крайне хаотична и спешная; мы даже не решили самые базовые проблемы»; (3) «Независимые организации вроде METR имеют явно недостаточно ресурсов по сравнению с темпами развития ИИ»; (4) «Разумная цивилизация уже давно должна была замедлить этот процесс». Своё согласие с этими тезисами открыто выразили исследователь Anthropic Райан Гринблатт и исследователь безопасности ИИ Майлз Брандейдж; сотрудник Anthropic Джексон Кернион, напротив, поставил под сомнение конкретные механизмы «захвата контроля» ИИ, на что Оливер Хабрика из MIRI указал, что изначально Anthropic создавалась как раз для предотвращения подобных рисков. За 24 часа этот пост набрал более 680 тысяч просмотров и вызвал широкую дискуссию в кругах специалистов по безопасности ИИ.

Отчёт METR о рисках в сфере передовых технологий | X (@BethMayBarnes)