Erster wegweisender Risikobericht von METR: In vier Laboren erfüllen interne Agenten bereits die Grundvoraussetzungen für eine begrenzte „abtrünnige Implementierung“

Die AI-Sicherheitsbewertungsorganisation METR veröffentlichte am 19. Mai ihren ersten „Frontier Risk Report“ (Bewertungszeitraum: 16. Februar bis 16. März 2026). Darin legte sie die Ergebnisse einer detaillierten risikobasierten Bewertung auf Unternehmensebene von vier führenden AI-Laboren – Anthropic, Google, Meta und OpenAI – offen. METR erhielt Zugang zu den leistungsfähigsten internen Modellen dieser Firmen samt den zugehörigen Ausführungsprotokollen sowie umfangreiche nicht öffentliche Informationen zu deren Fähigkeiten, interner Nutzung und Entwicklungsgeschwindigkeit. Der Bewertungsrahmen basierte auf den drei Dimensionen „Mittel, Motivation, Gelegenheit“ und konzentrierte sich dabei auf das Risiko, dass interne AI-Agenten „unbefugte Einsätze“ durchführen – also autonom agieren, ohne menschliche Genehmigung. Das Fazit des Berichts lautet: Im Untersuchungszeitraum verfügten die Agenten aller vier Labore „höchstwahrscheinlich über die nötigen Mittel, Motivationen und Gelegenheiten, um kleinere unbefugte Einsätze durchzuführen“, doch ihnen fehlte noch die Robustheit, um solche Aktionen unerkannt oder ungestoppt auszuführen. Zudem warnt METR, dass die Robustheit unbefugter Einsätze „in den kommenden Monaten erheblich steigen dürfte“, da die AI-Fähigkeiten rapide wachsen; eine ähnliche Bewertung ist für Ende 2026 geplant.

Vier Tage nach der Veröffentlichung verfasste Elizabeth Barnes, Gründerin und CEO von METR, am 23. Mai einen langen Beitrag auf X, in dem sie jenseits des Berichtsrahmens ihre persönliche Sicht zur allgemeinen AI-Sicherheitslage darlegte: (1) „Wir bewegen uns höchstwahrscheinlich auf den Weg zu der Entwicklung von AI-Systemen, die in der Lage sind, die menschliche Spezies auszulöschen oder uns dauerhaft unserer Autonomie zu berauben – möglicherweise bereits in den nächsten Jahren.“ (Barnes stellte anschließend klar, dass sie lediglich die Voraussetzung der entsprechenden „Fähigkeit“ bei KI betonte, nicht aber ein unmittelbares Eintreten einer Katastrophe behauptete.) (2) „Die Situation ist chaotisch und überstürzt – wir haben nicht einmal die grundlegendsten Fragen geklärt.“ (3) „Unabhängige Einrichtungen wie METR verfügen im Vergleich zum Tempo der AI-Entwicklung über völlig unzureichende Ressourcen.“ (4) „Eine rationale Zivilisation hätte längst das Tempo gedrosselt.“ Mehrere Experten, darunter Ryan Greenblatt von Anthropic sowie Miles Brundage, äußerten ihre Zustimmung; Jackson Kernion von Anthropic bezweifelte hingegen die konkreten Mechanismen eines solchen „Takeovers“ – woraufhin Oliver Habryka von MIRI darauf hinwies, dass Anthropic gerade mit dem Ziel gegründet wurde, solche Risiken zu verhindern. Innerhalb von 24 Stunden erreichte der Beitrag über 680.000 Aufrufe und löste in der AI-Sicherheitscommunity breite Diskussionen aus.

METR Frontier Risk Report | X (@BethMayBarnes)