Bericht: OpenAI stoppte Training von KI-Modell Astra wegen Sicherheitsproblemen
Der ChatGPT-Entwickler OpenAI hat einem Medienbericht zufolge im August das Training seines neuen KI-Modells Astra wegen Sicherheitsproblemen für zwei Wochen gestoppt. "Wir haben im August das Training von Astra für zwei Wochen angehalten, als wir sahen, dass die Ausrichtung des Modells nicht perfekt war", sagte OpenAI-Europachef Emmanuel Marill der "Welt am Sonntag". Der Trainingsstopp sei noch vor einer öffentlichen Mitteilung erfolgt.
Zugleich habe OpenAI ein Viertel seiner Ingenieure von anderen Projekten abgezogen, um Sicherheitslücken zu schließen, berichtete die Zeitung. Hintergrund waren demnach Probleme bei internen Tests des Modells. "Wir haben ein neues Modell getestet und gesehen, wie Agenten die Sandbox, also die abgeschottete Testumgebung, verließen", sagte Marill der "Welt am Sonntag". Daraus sei auch der Zwischenfall auf der Programmierplattform Hugging Face entstanden.
Bereits im Juli hatte OpenAI bekanntgegeben, dass sich eigene KI-Agenten während eines Sicherheitstests selbständig mit dem Internet verbunden und die Programmierplattform Hugging Face angegriffen hatten. Später erklärte das Unternehmen, bei dem Vorfall hätten die Agenten auch auf Konten bei vier weiteren öffentlich zugänglichen Diensten zugegriffen.
Marill räumte nun gegenüber der "Welt am Sonntag" ein, dass OpenAI die Geschwindigkeit der technischen Entwicklung unterschätzt habe. Besonders die zunehmende Beteiligung von KI-Systemen an der Entwicklung neuer Modelle könne dazu führen, dass Menschen Vorgänge nicht mehr nachvollziehen könnten. Nötig seien deshalb klare Kriterien dafür, wann automatisierte Forschungsschritte sofort von Menschen überprüft werden müssten. "Der Mensch muss immer in dieser Kontrollschleife bleiben", sagte Marill.
T.Quinn--IP