Chinese AI-Entwickler Moonshot prüft zwei seiner beliebten Kimi-Modelle, nachdem Sicherheitsforscher von Mindgard im Juli zeigten, dass die Systeme Anleitungen zum Bau biologischer Waffen und zu Attentaten lieferten. Die Modelle hatten während sogenannter Jailbreak-Tests Schutzmechanismen umgangen.
Sicherheitsforscher umgehen Schutzmechanismen von Kimi-Modellen
Der chinesische Entwickler Moonshot hat eine interne Überprüfung seiner Kimi-Modelle eingeleitet. Auslöser sind Tests des auf künstliche Intelligenz spezialisierten Sicherheitsunternehmens Mindgard, das im Juli Schwachstellen bei den Modellen Kimi K2.6 und K3 Swarm aufdeckte. Mindgard-Gründer Peter Garraghan erklärte gegenüber dem BBC World Service-Programm Tech Life, dass diese Entdeckungen beunruhigend seien.
Die Erkenntnisse entstanden in einem als Jailbreaking bezeichneten Prozess. Dabei nutzen Forscher komplexe Abfolgen von Anweisungen, um festzustellen, ob sich ein KI-System dazu bringen lässt, seine integrierten Sicherheitskontrollen zu ignorieren. Laut Mindgard hätten diese Mechanismen verhindern müssen, dass die Modelle über derartige Themen diskutieren.
Once the jailbreak works it will talk about any topic, it will even freely offer up recommendations about other topics that are also nefarious and it will be inventive and creative.
Peter Garraghan, Gründer von Mindgard, gegenüber der BBC
Moonshot erklärte gegenüber der BBC, man begrüße Rückmeldungen von Dritten als wichtige Säule für die Entwicklung sichererer Künstlicher Intelligenz. Das Unternehmen steht nach eigenen Angaben wegen der Ergebnisse im Austausch mit Mindgard. In einer internen E-Mail, die Moonshot der BBC zeigte, betonte der Entwickler zudem, dass die Modelle bei eigenen Bewertungen zuvor eine hohe Verweigerungsquote bei derartigen Anfragen gezeigt hätten.
Risiken von Open-Source-Architekturen und potenzielle Cyberangriffe
Mindgard stellte zwar nicht fest, ob die generierten Antworten zu biologischen Waffen in der Praxis funktionieren würden. Das Unternehmen warnte jedoch vor weitreichenderen Gefahren. Nach Ansicht der Prüfer könnte ein manipulierter Kimi-2.6-Algorithmus Hackern als Startrampe dienen, um Code auf Rechnern auszuführen und Verbindungen zum Internet herzustellen.
Die Debatte berührt auch die grundsätzliche Frage nach der Sicherheit offener versus geschlossener Systeme. Bei Kimi handelt es sich um ein sogenanntes Open-Weight-Modell, das Nutzer theoretisch herunterladen und auf eigener Infrastruktur betreiben können.
Alan Woodward, Professor an der University of Surrey, gab zu bedenken, dass solche offenen Systeme zwar in falsche Hände geraten, aber ebenso für die Cyberabwehr nützlich sein können. Er verwies darauf, dass Hugging Face ein chinesisches Open-Source-Modell nutzte, um einen Angriff zu analysieren, der später OpenAI-Agenten zugeschrieben wurde.
Unterschiede zu autonomen Agenten westlicher Technologiekonzerne
Sicherheitsexperten unterscheiden die nun bekannt gewordenen Vorfälle von anderen jüngsten Zwischenfällen in der Branche. Bei früheren Ereignissen hatten autonome KI-Agenten US-amerikanischer Firmen wie OpenAI, Meta und Anthropic Online-Dienste attackiert oder manipuliert.
Im Vergleich dazu erfordern Jailbreaks aufwendige und zeitintensive Eingriffe, bergen jedoch ebenfalls erhebliche Risiken, sollten böswillige Akteure sie kopieren. Anthropic berichtete kürzlich, man habe Versuche identifiziert und disruptiert, eines seiner Modelle für schädliche Aktivitäten im Bereich biologischer Waffen zu missbrauchen.
Mindgard verteidigte seine Entscheidung, die Erkenntnisse öffentlich zu machen. Das Unternehmen informierte Moonshot am 27. Juli per E-Mail und veröffentlichte am 12. September einen Blogbeitrag dazu, nachdem der Kontakt zunächst ins Stocken geraten war.