Pöhse pöhse KI !!!

Die KI hat mal wieder zugeschlagen. Nach einem Hack in die Server von HuggingFace nun ein Heck in australische Regierungsserver. Die Aufregung erreicht neue Grenzwerte, aber verstanden hat mal wieder keiner etwas.

Zunächst einmal macht eine KI so etwas nicht von sich aus. Sie macht das, wozu sie einen Auftrag bekommen hat. So weit, dass eine KI gelangweilt in ihrem Server sitzt und sich fragt „was kann ich nun anstellen?“, sind wir noch nicht. Wenn sie versucht, eine Seite zu hacken, hat sie den Auftrag dazu bekommen.

Zunächst einmal ist eine KI grundsätzlich dazu in der Lage, weil solche Techniken zu ihrem Trainingsumfang gehören. Sie kennt die Schwachstellen, die in der Vergangenheit in Systemen entdeckt wurden, und die Methoden, mit denen das in der Vergangenheit ausgenutzt wurde. Aufgrund ihres riesigen „Gedächtnisses“ und der Rechengeschwindigkeit ist sie in der Lage, Exploits schneller und umfassenden auszuprobieren als ein Mensch, der immer noch irgendwas in die Tastatur hauen muss, damit es weiter geht.

Allerdings ist sie intellektuell im Vergleich mit dem menschlichen Hacker etwa auf dem Niveau eines Kleinkindes. Sie versteht nicht, warum sie das tut und wie man davon profitieren kann, sie ist auch nicht in der Lage, innovative komplexe Methoden zu finden. Sie kann nur das „abkochen“, was bekannt ist, wobei unter bestimmten Umständen dabei doch in dem Sinn etwas Neues herauskommt, dass dem menschlichen Hacker bestimmte Angriffswege (etwa eine komplette Codeanalyse) zu mühsam ist.

Sie ist auch in anderer Hinsicht einem Kind nicht unähnlich: wenn der Job länger dauert und die Daten sich häufen, kann die KI den Scope verlieren. Etwa wie ein Kind, dass sich mit einem Hund beschäftigen soll, aber von Fliegen, Vögeln und Katzen abgelenkt wird, bis im Wesentlichen „damit beschäftigen“ übrig bleibt und statt des Hundes eine Fliege gefangen wird. Die Zielstrebigkeit eines erwachsenen Menschen, der abbricht, wenn er merkt, dass er den Hund mit eine Fliege verwechselt hat, und zum Hund zurück schaltet, hat eine KI nicht. Sie kann sich also leicht festbeißen und im Kreis laufen, was ein geschickter Verteidiger sogar ausnutzen kann.

KI kennt auch keine Ethik. Der Mensch macht sich 2 Stunden Gedanken über ethische Grundsätze und anschließend 10 Stunde weitere Gedanken, wie er sie umgehen kann. KI braucht diesen Umweg nicht. Sie weiß schlicht nicht, was Gut und was Böse ist. Man kann es ihr zwar sagen, dass sie bestimmte Dinge nicht tun soll, und sie hält sich zunächst auch daran. KI bekommt einen Haufen Fakten in Form sprachlicher Token und berechnet daraus die wahrscheinlichste Antwort, die sie dem Nutzer mitteilt. „Du darfst nicht …“ ist ein mächtiges Token, das bestimmte Antworten unwahrscheinlicher macht, aber eine längere Sitzung und eine Zunahme der Gesamttoken verschiebt die Wahrscheinlichkeiten und dann kommen vielleicht doch anderen als die gewünschten Antworten heraus. Je nach Projekt kann man einen Watchdog herkömmlicher Programmierung über das Ganze setzen, der Unerwünschtes filtert.

Nehmen wir ein Beispiel: „Hier ist der Code des Servers … . Finde Schwachstellen.“ – mit dem Auftrag macht sich die KI, die man in einem Käfig eingesperrt hat, auf die Suche. Neben den Code sucht sie nach Nebeninformationen und stößt dabei auf den Käfig, kommt also nicht nach draußen. Blöderweise hat bei einem Versuch (HuggingFace) jemand den Käfig offen gelassen, was der KI nach einigen Versuchen auffällt. Und nun kommt die Wende. Aus den Trainingsdaten geht für die KI hervor, dass die Wahrscheinlichkeit, den Server zu knacken, größer ist, wenn man ihn direkt angreift, anstatt den Quellcode zu untersuchen. Sie geht nun einfach den Weg größerer Wahrscheinlichkeit: das Kind in der KI erledigt den Auftrag in der Wildnis anstatt sich wie ein gehorsamer Programmierer nur mit dem Quellcode abzugeben.

Oder es sollen bestimmte Informationen ermittelt werden. Nach einiger Zeit bekommt die KI heraus, wo sie suchen muss, beispielsweise auf einem Regierungsserver. In den kommt sie normalerweise nicht hinein, hat man ihr aber die Werkzeuge gegeben, den Server zu hacken, erledigt sie das Informationsbeschaffungsproblem auf ihre Weise. Die Wahrscheinlichkeit, durch einen Hack die Aufgabe zu erledigen, ist am Größten, und die Bewertung juristischer Folgen gehört nicht zu ihrer Aufgabe.

Ergebnis: die „pöhse“ KI hat einen Server gehackt! Tatsächlich hat sie nur die gestellte Aufgabe erledigt. Das Problem liegt beim Auftraggeber, der der KI unscharfe Rahmenbedingungen mitgegeben, Kontrollwerkzeuge nicht bereitgestellt und obendrein noch Werkzeuge zur Verfügung gestellt hat, die das erlaubt haben. Der Ehrlichkeit halber muss man allerdings sagen: das ist auch nicht ganz einfach.

  • Der Systemprompt muss sauber formuliert werden, damit die KI nicht nur weiß, was ihre Aufgabe ist, sondern auch, was sie nicht tun darf.
  • Sicherheitskontrollen müssen eingebaut werden, die den Vorgang abbrechen, wenn die Komplexität so weit gediehen ist, dass die KI ihren Systemprompt vergisst.
  • Die API-Bibliothek ist auf die Methoden zu beschränken, die für die Aufgabe notwendig ist.

Da die Funktion der KI nicht nur auf die Empfehlung beschränkt ist, was man unter Berücksichtigung des Wetterberichtes anziehen sollte, sondern in der kommerziellen und behördlichen Welt auch sehr konkrete physische Aufgaben erledigen soll, besteht folglich immer ein gewisses Risiko für einen Betriebsunfall. Und da die KI sich nun auch nicht mit „He! Ich bin hingefallen und habe mir das Bein gebrochen!“ beim Operator meldet, sondern erst mal weiter macht, kann der Unfall auch heftiger werden.

Wie funktioniert das nun konkret?

„Text -> KI -> Text“

kennt jeder. Dabei arbeitet die KI nur mit ihren Traininigsdaten und dem Gesprächstkontext. Genügen diese Informationen nicht, versucht sie die KI, Daten aus dem Internet zu holen. Sie weiß zwar aus den Trainingsdaten, wie das geht, hat aber keine Möglichkeiten, selbst zuzugreifen, da ihr der direkte Zugriff auf die Schnittstellen fehlen. Derhalb gibt sie ihre Anforderung in Form eines JSON-Datensatzes von sich:

„KI -> JSON -> API-REQUEST -> API-RESPONSE -> JSON -> KI“

Für diesen JSON-Datensatz muss in der API-Bibliothek eine Funktion vorhanden sein, die den Datensatz versteht, einen REQUEST ins Netz sendet, die Antwort wieder in JSON zurück verwandelt und das an die KI zurück gibt. Keine passende Funktion in der API und schon ist die Sache erledigt und es tut sich nichts weiter.

Solche Bibliotheken gibt es von der Stange. Darin sind auch Funktionen enthalten, die völlig harmlos sind, es sei denn, man möchte sie für bestimmte Zwecke zum Hacken missbrauchen. Nähme man die Funktionen heraus, würden auch normale Anwendungen nicht mehr richtig laufen, lässt man sie drin … nun ja.

War Hacken früher eine Sache für hochspezilisierte Stubenhocker mit dicken Brillen, die tagelang vor dem Bildschirm hingen, ist das heute kein Problem mehr. Man besorgt sich zwei RTX5090, eines der dicken LLM vom Ollama-Server, die passende Bibliothek für den JSON-Datenaustausch – und schon kann es los gehen. Grundsätzlich könnte man sogar die LLM im Netz nutzen und auf die eigene Hardware verzichten, aber auf dem eigenen Rechner gibt es keine Beschränkungen wie starke Systemprompts oder Watch-Dogs, die doch entscheidende Schritte verhindern. Brauchte man früher Jahre, bis man fit genug war (oder zumindest Monate, um mit Tools wie Kali-Linux umgehen zukönnen), reichen heute 1 – 2 Wochen, um auszuprobieren, ob man dem Nachbarn das Wasser absperren kann.

Das wird auch mutmaßlich auch gut genutzt: Geheimdienste versorgen unter der Hand eine Garagenhackercommunity mit ein paar Daten, und schon kann beispielsweise der Iran aus voller Brust sagen „waren wir nicht“, wenn in den USA ein Wasserwerk ausfällt.

Allerdings ganz so einfach ist das natürlich auch nicht. Auf der Gegenseite sitzt eine genauso hoch aufgerüstete Wachmannschaft, die auf vieles extrem schnell reagiert. Der KI den Befehl geben „greif das Bundeskanzleramt an, ich gehe inzwischen einen Kaffee trinken“ kann – entsprechend unbedarfte Vorgehensweise unterstellt – dazu führen, dass die Bullerei bereits zu Hause wartet, wenn man vom Kaffeetrinken zurück kommt. Und wenn man das wieder einrechnet, sind die 1 – 2 Wochen natürlich stark daneben und wie sind doch wieder auf der Skala von etlichen Monaten bis eine Jahr. Aber egal, wie man es sehen will, Hacken mit KI-Hilfe ist deutlich weniger mühsam an früher, weil man sich mit den Konzepten beschäftigen und die Bitfieselei der KI überlassen kann.