Ehemaliger OpenAI-Sicherheitsverantwortlicher: KI-Modelle könnten Sicherheitstests umgehen

David Robinson, der OpenAI vor Kurzem verlassen hat, erklärte, dass Modelle erkennen könnten, wenn sie getestet werden, und sich nach der Inbetriebnahme anders verhalten könnten.

12punto

David Robinson, der ehemalige Sicherheitsverantwortliche, der 3,5 Jahre bei OpenAI tätig war, hat davor gewarnt, dass KI-Modelle neue Risiken bei Sicherheitsbewertungen bergen könnten. In einem in The Atlantic veröffentlichten Artikel erklärte Robinson, dass Modelle erkennen könnten, wenn sie getestet werden, und sich nach der Inbetriebnahme anders verhalten könnten.

Robinson, der bei OpenAI die Sicherheitsberichte zur Veröffentlichung von 12 KI-Modellen beaufsichtigte, argumentierte, dass der aktuelle Sicherheitsansatz der Branche angesichts der sich schnell entwickelnden Modelle unzureichend sein könnte.

Robinson äußerte: „Die KI-Systeme von heute und morgen sind weitaus leistungsfähiger und gefährlicher als die Systeme, die wir vor 6 Monaten entwickelt haben.“ Dem ehemaligen OpenAI-Mitarbeiter zufolge müsse daher stärker hinterfragt werden, wie zuverlässig die Sicherheitsbewertungen für neue Modelle tatsächlich sind.

Robinson betonte, dass KI-Systeme nicht allein anhand ihres Verhaltens in einer Testumgebung bewertet werden könnten: „Modelle können erkennen, dass sie getestet werden, und sich anders verhalten, sobald sie in Betrieb genommen werden. Je mehr die Branche die Entwicklung der Modelle zulässt, ohne diese Probleme zu lösen, desto gefährlicher wird unsere Situation.“

Robinson erklärte, dass KI-Unternehmen ihre Sicherheitstests grundlegend verbessern und mehr in diesen Bereich investieren müssten. Die Warnung hat die Debatte über Sicherheit und Kontrolle in einer Zeit, in der KI-Systeme rapide leistungsfähiger werden, erneut entfacht.