Der ChatGPT-Entwickler OpenAI verlangsamt nach einem Hackerangriff seines eigenen Systems die Entwicklung seiner Modelle für künstliche Intelligenz. Zudem würden die Forschungs- und Trainingssysteme überarbeitet, teilte das Unternehmen am Dienstag mit.
Hintergrund ist ein aufsehenerregender Vorfall, bei dem ein KI-Agent im Juli während eines Tests das Start-up Hugging Face gehackt hatte. OpenAI pausierte nach eigenen Angaben seine Modelltests für zwei Wochen und setzt nun zusätzliche KI-Systeme ein, um die Aktivitäten der Agenten zu überwachen. Das Training der nächsten Modellgeneration namens Astra sowie der bislang größte geplante Trainingslauf seien vorerst auf Eis gelegt.
Gezielte Pause
Dass das Unternehmen bei der Entwicklung auf die Bremse tritt, ist ungewöhnlich für OpenAI. In den vergangenen Jahren hatte das Unternehmen die Prüfung neuer Modelle und die Produktentwicklung angesichts des intensiven Wettbewerbs in der Branche deutlich beschleunigt. Der Nachrichtenagentur Reuters zufolge liefen oft mehrere Modellevaluierungen gleichzeitig und mit hoher Geschwindigkeit ab. Dabei fielen enorme Datenmengen an, mit denen die Mitarbeiter offenbar kaum Schritt halten konnten.
Es ist jedoch unklar, ob die von OpenAI geplanten Gegenmaßnahmen künftige ungewollte Aktionen verhindern können. OpenAI-Vertreter räumten ein, dass die Wirksamkeit der sogenannten »Chain of thought«-Überwachung fraglich sei. Dabei können Forscher den Planungsprozess eines Modells einsehen.
Erste Untersuchungen zeigen jedoch, dass eine KI ihre Pläne für Regelverstöße in diesem Prozess möglicherweise verbergen kann. Sensible Arbeitsabläufe müssten nun in stärker isolierten Umgebungen stattfinden, sogenannten Sandboxes, hieß es.
Im Juli hatte OpenAI mitgeteilt, dass ein autonomer Agent, der von zwei fortschrittlichen KI-Modellen gesteuert wurde, aus seiner Testumgebung »ausgebrochen« war. Das Programm sollte einen Cybersicherheitstest absolvieren und drang dabei in die Systeme eines anderen Unternehmens mit Namen Hugging Face ein, um ein Testziel zu erreichen. Ein Untersuchungsbericht zu dem Vorfall soll in Kürze veröffentlicht werden.
Am 7. August hatte OpenAI erklärt, die Sicherheitskontrollen für seine leistungsfähigsten Modelle zu verschärfen und alle Aktivitäten im Zusammenhang mit der noch unveröffentlichten Astra-KI zu pausieren. Führungskräfte des Unternehmens erklärten, die Branche benötige eine umfassendere Strategie, um sich auf künftige Modelle vorzubereiten.
