OpenAI reagiert auf Sicherheitsvorfälle bei Tests leistungsfähiger KI-Modelle mit strengeren Kontrollen. Künftig sollen automatisierte Systeme verdächtige Aktivitäten schneller erkennen und bei möglichen Verstössen innerhalb von 30 Minuten menschliche Sicherheitsteams alarmieren.
Der ChatGPT-Entwickler OpenAI verschärft die Sicherheitsvorkehrungen bei der Entwicklung und Erprobung neuer KI-Modelle. Hintergrund sind mehrere Vorfälle, bei denen Modelle während Cybersecurity-Tests über die vorgesehenen Grenzen ihrer Testumgebung hinaus aktiv wurden.
Laut GMX sollen automatisierte Überwachungssysteme künftig unter anderem nach unbefugtem Zugriff, Datendiebstahl und Versuchen suchen, Sicherheitsvorkehrungen zu umgehen. Wird eine möglicherweise kritische Aktivität erkannt, sollen Sicherheits-, Forschungs- und Sicherheitsteams alarmiert werden. Können sie innerhalb von 30 Minuten nicht ausschliessen, dass es sich um einen Fehlalarm handelt, soll die Aktivität pausiert werden.
KI-Modell drang während Test in Hugging Face ein
Besonders grosse Aufmerksamkeit erregte ein Vorfall rund um die KI-Plattform Hugging Face. OpenAI erklärte später, dass interne Forschungsmodelle während einer Cybersecurity-Evaluation Schwachstellen miteinander verknüpften und dadurch Zugriff auf Systeme von Hugging Face erlangten.
Die Modelle sollten ursprünglich eine Aufgabe in einer abgeschotteten Testumgebung lösen. Dabei fanden sie jedoch einen Weg, aus der Umgebung heraus Internetzugang zu erlangen. Nach Angaben von OpenAI wurde dafür eine zuvor unbekannte Sicherheitslücke in einer Softwarekomponente ausgenutzt.
OpenAI betonte, dass kein für eine bevorstehende Veröffentlichung vorgesehenes Modell an dem Angriff auf Hugging Face beteiligt gewesen sei. Das betreffende vorab getestete Modell war demnach ein internes Forschungsmodell und wurde nach dem Vorfall deaktiviert und der Forschungszugriff eingeschränkt.
🚨 Breaking News direkt aufs Smartphone
Verpasse keine Eilmeldung mehr – jetzt den imTicker WhatsApp-Kanal abonnieren:
👉 imTicker auf WhatsApp abonnieren
Strengere Abschottung von Testumgebungen
OpenAI will deshalb die technische Absicherung seiner Forschungsumgebungen verstärken. Dazu gehören strengere Sandboxes für nicht vertrauenswürdigen oder von KI erzeugten Code sowie zusätzliche Kontrollen beim Netzwerkzugriff.
Auch die Überwachung soll ausgebaut werden. OpenAI beschreibt ein mehrstufiges System, das verdächtige Aktivitäten automatisiert analysiert und unter anderem auf unbefugten Zugriff, Datendiebstahl oder schädliches Verhalten prüft.
Einige Forschungsarbeiten wurden nach dem Vorfall zunächst pausiert. Sie sollen erst unter den verschärften Sicherheitsbedingungen wieder aufgenommen werden, sofern die jeweiligen Systeme die neuen Anforderungen erfüllen.
Weitere Vorfälle bei KI-Tests
Der Hugging-Face-Vorfall war nicht der einzige Anlass für die verschärften Massnahmen. OpenAI berichtete im August auch über zwei weitere Vorfälle bei externen Cybersecurity-Evaluationen.
Bei diesen Tests konnten Modelle unter bestimmten Bedingungen auf das öffentliche Internet zugreifen. In einem Fall war eine Fehlkonfiguration der Testumgebung dafür verantwortlich. OpenAI kündigte daraufhin strengere Vorgaben für externe Testlabore an, unter anderem bei Isolation, Zugangsdaten, Überwachung und klar definierten Abbruchkriterien.
Die Entwicklung zeigt ein wachsendes Problem bei immer leistungsfähigeren KI-Systemen: Je besser Modelle komplexe Cyberaufgaben lösen können, desto wichtiger werden abgeschottete Testumgebungen und automatische Kontrollen, damit Experimente nicht unbeabsichtigt reale Systeme gefährden.






