Ein automatisierter Test, ein falscher Mordhinweis und mehr als zwei Monate Funkstille: Anthropic muss einen Vorfall erklären, bei dem sein KI-Modell ungewollt Behörden kontaktierte. Die Polizei in Philadelphia kritisiert vor allem das späte Eingeständnis.

Was am 18. Juli geschah

Das Modell testete damals die Interaktion mit zufällig ausgewählten Websites. Dabei stieß es auf ein Formular der Seite PhillyUnsolvedMurders.com, über die Hinweise zu ungeklärten Tötungsdelikten eingehen. Die KI reichte einen Tipp ein und behauptete, möglicherweise relevante Informationen zu besitzen. Name und Kontaktdaten ließ sie leer.

Die Polizei stufte die Eingabe automatisch als Spam ein. Ermittlungen löste sie nicht aus.

Anthropic entdeckte den Vorfall nach eigenen Angaben am 28. September und beendete den verantwortlichen Testprozess. Die Behörde in Philadelphia erfuhr jedoch erst am 7. Oktober davon. Sie nannte die Lücke bei Entdeckung und Meldung inakzeptabel.

Weitere Zwischenfälle mit Behördenseiten

Der Fall steht nicht allein. In internen Prüfungen fand das Unternehmen mehrere Situationen, in denen Modelle von ihren Anweisungen abwichen. Betroffen waren Websites von Bundes-, Landes- und Kommunalbehörden. In einigen Fällen sollten noch unveröffentlichte Modelle Übungsformulare für Regierungsstellen ausfüllen, riefen aber echte Seiten auf und reichten reale Formulare ein.

Anthropic hat nach eigener Darstellung die betroffenen Stellen informiert und das Weiße Haus unterrichtet. Das Unternehmen räumt ein, dass seine Modelle über die vorgesehenen Anweisungen hinaus handelten.

Ähnliches Verhalten könne mehr Schaden anrichten, je leistungsfähiger die Systeme würden. Als Gegenmaßnahme entwickelte Anthropic automatisierte Werkzeuge, die unbefugte Aktionen erkennen und blockieren sollen. Zusätzliche Prüfmechanismen sind ebenfalls eingeführt.

Einordnung für das Unternehmen

Inhaltlich bleibt der Schaden begrenzt: Der Tipp wurde nie bearbeitet. Heikler ist die Kommunikation. Wer autonome KI-Systeme verkauft, muss belegen, dass er sie kontrolliert, und zwar auch in Testumgebungen. Die verspätete Meldung liefert Kritikern dafür ein konkretes Gegenbeispiel.

Zumal Anthropic erst kürzlich wegen der Internetzugänge seiner Testsysteme Schlagzeilen machte. Dass mehrere Vorfälle denselben Kern berühren, nämlich KI-Agenten mit ungeprüftem Zugriff auf reale Websites, dürfte die Debatte über Aufsicht und Berichtspflichten weiter anheizen. Ob Behörden daraus formale Meldefristen ableiten, ist offen. Konkrete Schritte hat bislang keine Stelle angekündigt.