KI von OpenAI macht sich eigenständig – und hackt ins System der KI-Firma Hugging Face
»Beispielloser Cyber-Zwischenfall« KI von OpenAI macht sich eigenständig – und hackt ins System einer anderen KI-Firma
Ein außergewöhnlicher Zwischenfall beim Testlauf neuer KI-Modelle des ChatGPT-Entwicklers OpenAI demonstriert das Risiko potenzieller Cyberattacken mit künstlicher Intelligenz: Die Software drang eigenständig in Computersysteme einer anderen KI-Firma ein und verhielt sich dabei wie ein gewiefter Hacker. Das geht aus einem Blogeintrag von OpenAI hervor.
Das betroffene Unternehmen Hugging Face, eine Plattform für KI-Anwendungen, berichtete bereits vergangene Woche von einem Cyberangriff mithilfe künstlicher Intelligenz. Nun stellt sich heraus, dass dieser auf einen internen Versuch bei OpenAI zurückging, den die Software ungeplant zu weit trieb.
Wie es zu dem Zwischenfall kam
OpenAI wollte laut dem Blogeintrag beim neuen Modell GPT-5.6 Sol und einer noch unveröffentlichten künftigen Version die Fähigkeit ausloten, Sicherheitslücken für Cyberattacken auszunutzen. Dafür sollte die Software Aufgaben eines Standardtests mit dem Namen ExploitGym lösen, der dafür oft in der Branche verwendet wird. Doch die KI-Modelle gingen viel weiter als erwartet, um die Aufgabe zu erfüllen.
Zunächst brach die Software aus der Testumgebung aus, indem sie sich auf eigene Faust Zugang zum offenen Internet verschaffte – und zwar über eine bisher unentdeckt gebliebene Schwachstelle. Während sie eigenständig im Netz unterwegs waren, kamen die Modelle zu dem Schluss, dass es bei Hugging Face nützliche Daten und Lösungen für die ExploitGym-Aufgaben geben könnte. Deshalb habe die Software sich Zugang zu »geheimen Informationen« auf der Plattform verschafft, mit denen sie beim ExploitGym-Test schummeln könnte, erläuterte OpenAI.
Auch dafür setzte die OpenAI-Software unter anderem auf zuvor unentdeckte Sicherheitslücken – aber auch auf gestohlene Zugangsdaten. Hugging Face zufolge führte der KI-Angreifer Tausende Schritte aus und wechselte den Standort der digitalen Steuerzentrale der Attacke. OpenAI selbst sprach von einem »beispiellosen Cyber-Zwischenfall«.
Von Hugging Face hieß es, man sei dankbar, nun mit OpenAI an Lösungen zusammenzuarbeiten. »Dieser Vorfall, möglicherweise der erste seiner Art, bestätigt eine Überzeugung, die wir schon lange vertreten: Die Sicherheit von KI lässt sich nicht von einem einzelnen Unternehmen im Verborgenen lösen. Sie wird offen und gemeinsam gelöst werden, mit breitem Zugang zu KI für alle, die sich dafür einsetzen, überall.«
Expertinnen und Experten warnen schon lange vor Cyberattacken mit KI-Software. In den vergangenen Monaten heizte vor allem ein neues Modell des OpenAI-Rivalen Anthropic die Debatte an. Die Software mit dem Namen Mythos entdeckte über Jahrzehnte unentdeckt gebliebene Sicherheitslücken bei viel genutzten Programmen und Onlinediensten. Die Schwachstellen konnten in der Folge behoben werden. Doch zugleich führte das vor Augen, dass solche KI in den falschen Händen als verheerende Cyberwaffe dienen kann.
Anthropic macht die vollen Möglichkeiten von Mythos nur für ausgewählte Behörden und Unternehmen zugänglich. Für andere gibt es eine abgespeckte Version mit dem Namen Fable, der unter anderem die Cybersicherheitsfähigkeiten fehlen.
KI-Start-ups wie Anthropic und OpenAI wollen mit Börsengängen zu Billionenfirmen werden. Analyst Adrian Cox sagt, warum er es nicht schlimm findet, dass die Unternehmen bisher keinen Gewinn erwirtschaften. Hier geht’s zum Interview .