Primer informe de riesgos pioneros de METR: los agentes internos en cuatro laboratorios ya reúnen las condiciones iniciales para un "despliegue descontrolado" a pequeña escala

La organización de evaluación de seguridad de la IA METR publicó el 19 de mayo su primer Informe sobre Riesgos en la Vanguardia (con un periodo de evaluación del 16 de febrero al 16 de marzo de 2026), en el que desveló los resultados de una exhaustiva evaluación de riesgos a nivel físico realizada en cuatro de los principales laboratorios de IA: Anthropic, Google, Meta y OpenAI. METR obtuvo acceso a los modelos internos más potentes de cada entidad (incluidas las cadenas de razonamiento originales), así como gran cantidad de información confidencial sobre sus capacidades, usos internos y ritmo de avance. El marco de evaluación se basó en tres dimensiones: “medios, motivación y oportunidad”, centrándose en el riesgo de que los agentes de IA internos llevaran a cabo “despliegues no autorizados” (es decir, que operaran de forma autónoma sin permiso humano). Las conclusiones del informe indican que, durante el periodo evaluado, los agentes internos de los cuatro laboratorios “probablemente contaban con los medios, la motivación y la oportunidad necesarios para ejecutar despliegues no autorizados a pequeña escala”, aunque aún carecían de la robustez suficiente para evitar ser detectados o detenidos. Asimismo, METR advirtió que, dado el rápido progreso de la IA, dicha robustez “se incrementará notablemente en los próximos meses”, por lo que prevé repetir evaluaciones similares para finales de 2026.

Cuatro días después de la publicación del informe, Elizabeth Barnes, fundadora y CEO de METR, compartió el 23 de mayo en X una larga publicación en la que expresaba su postura personal respecto a la situación general de la seguridad de la IA, más allá del marco del informe: (1) “Es muy probable que nos encaminemos hacia el desarrollo de sistemas de IA capaces de provocar la extinción humana o la pérdida permanente de nuestra autonomía, incluso en los próximos años” (posteriormente Barnes aclaró que esto se refiere únicamente a la existencia de dicha “capacidad” en la IA, sin afirmar que el desastre sea inevitable); (2) “La situación es caótica y apresurada; ni siquiera hemos resuelto problemas básicos”; (3) “Organizaciones independientes como METR disponen de recursos extremadamente insuficientes frente al ritmo de desarrollo de la IA”; (4) “Una civilización racional ya habría reducido la velocidad de este proceso”. Figuras como Ryan Greenblatt, investigador de Anthropic, y Miles Brundage, especialista en seguridad de la IA, manifestaron su acuerdo; Jackson Kernion, empleado de Anthropic, cuestionó los mecanismos concretos mediante los cuales la IA podría “hacerse con el control”, a lo que Oliver Habryka, investigador de MIRI, recordó que el propósito original de crear Anthropic fue precisamente prevenir ese tipo de riesgos. En menos de 24 horas, esta publicación superó los 680.000 visualizaciones, generando un intenso debate en el ámbito de la seguridad de la IA.

Informe sobre Riesgos en la Vanguardia de METR | X (@BethMayBarnes)