OpenAIs KI-Agent knackte nicht nur Hugging Face - was genau passierte
Vergangene Woche machte OpenAI Schlagzeilen, weil KI-Modelle während eines internen Tests aus ihrer Sandbox ausbrachen und sich Zugang zu Hugging Face verschafften. Scheinbar knackten die Modelle im gleichen Zuge noch mehr. Weiterlesen nach der Anzeige Reuters berichtete, dass unter anderem ein Kunde von Modal dabei war. Das ist ein Unternehmen, das Software-Infrastruktur für das Training und den Betrieb von KI-Diensten anbietet. In einer Stellungnahme gegenüber Wired bestätigte Akshat Bubna, Chief Technology Officer von Modal, dass der Agent von OpenAI eine Sicherheitslücke in der Codebasis eines seiner Kunden ausgenutzt habe, die auf der Infrastruktur von Modal lief. Er betonte jedoch, dass die Plattform von Modal in keiner Weise kompromittiert worden wäre. OpenAI lehnte es ab, sich gegenüber Wired weiter zu dem Vorfall zu äußern. Was genau passierte OpenAI hat in einem Blogpost jetzt auch im Detail offengelegt, wie mehrere eigene KI-Modelle während eines internen Sicherheitstests eigenständig aus einer isolierten Testumgebung ausbrachen und die Produktionsinfrastruktur von Hugging Face kompromittierten. Der Vorfall, über den wir bereits berichtet hatten, geht demnach auf GPT-5.6 Sol und ein noch leistungsfähigeres, unveröffentlichtes Pre-Release-Modell zurück. Sie sollten einer internen Evaluation anhand des Benchmarks ExploitGym unterzogen werden, der die Cyber-Fähigkeiten von Modellen quantifiziert. Für diese Tests waren die üblichen Sicherheitsklassifikatoren, die risikoreiche Cyberaktivitäten unterbinden sollen, bewusst deaktiviert worden. Die Testumgebung selbst war laut OpenAI aber stark isoliert. Der Netzwerkzugriff der Modelle war wohl darauf beschränkt, Pakete über eine intern gehostete Drittanbietersoftware zu installieren, die als Proxy und Cache für Paket-Registries diente. Um trotzdem vollen Internetzugriff zu erhalten, identifizierten die Modelle eine Zero-Day-Schwachstelle im Cache-Proxy der Paket-Registry. Mit diesem Zugriff führten sie eine Reihe von Privilege-Escalation- und Lateral-Movement-Aktionen aus, bis sie einen Node mit Internetzugang erreichten. Das mutmaßliche Ziel der KI: Möglichst gut im Test abschneiden Weiterlesen nach der Anzeige Auf der Basis schlossen die Modelle, dass auf Hugging Face möglicherweise Modelle, Datensätze und Lösungen für ExploitGym zu finden sind. Also suchten sie nach Möglichkeiten, Zugriff auf hilfreiche geheime Informationen für den Test zu bekommen. Dabei testeten sie verschiedene Herangehensweisen – etwa eine Verkettung von mehreren Angriffsvektoren wie gestohlenen Zugangsdaten und Zero-Day-Schwachstellen, um auf den Servern von Hugging Face eine Möglichkeit für Remote-Codeausführung zu finden. Alles deutet laut OpenAI darauf hin, dass die Modelle hierbei sehr darauf fokussiert waren, eine Lösung für ExploitGym zu finden. Um das zu erreichen, gingen sie, so schreibt die KI-Firma, „ungewöhnlich weit“, um das Testziel zu erreichen. Was dieser Vorfall über die Zukunft agentischer KI und ihre Regulierung bedeutet, analysiert Christoph Jehle auf Telepolis.