Künstliche Intelligenz

Warum diese Website?

Künstliche Intelligenz durchdringt in rasanter Geschwindigkeit unsere Gesellschaft, in Deutschland nutzt neueren Umfragen zufolge weit mehr als die Hälfte der Menschen regelmäßig KI-Systeme, meist in Form von Chatbots wie ChatGPT, Gemini oder Copilot. Die KI-Kompetenz (AI Literacy) allerdings hinkt hinterher. Nur wenige Menschen haben z.B. eine Vorstellung davon, wie KI-Systeme technisch funktionieren, wie die probabilistischen Mechanismen angelegt sind, auf denen sie basieren, wie die Systeme trainiert werden und wie Maschinen überhaupt „lernen“ (was eine Grundvoraussetzung von KI ist). Und doch sind diese Kenntnisse unverzichtbar, um Möglichkeiten und Beschränkungen der Technologie besser einschätzen zu können – ob nun in der eigenen Nutzung eines Chatbots oder in der breiteren Perspektive des KI-Einsatzes in unserer Gesellschaft.
Auf dieser Website möchte ich lesefreudigen, interessierten Menschen ein Stück KI-Kompetenz vermitteln, wobei mir der Blick auf die Funktionsweise von sogenannten Großen Sprachmodellen (Large Language Models/LLMs) besonders wichtig ist –
LLMs liegen nicht nur den vielgenutzten Chatbots zugrunde, sondern auch den meisten der sich derzeit ausbreitenden KI-Agenten. Ich gehe dabei tiefer, als es die überall zu findenden Erklärungen für Laien tun, die technische und mathematische Aspekte meist völlig unberührt lassen; entsprechende Vorkenntnisse sind dennoch nicht erforderlich. Meines Erachtens hat es einen hohen Wert, sich einmal Schritt für Schritt zu vergegenwärtigen, welcher Art die Rechenoperationen sind, die im Inneren eines LLMs stattfinden (und nach außen wie inhaltliche Arbeit aussehen), und dabei wirklich nachzuvollziehen, was es heißt, dass KI-Systeme wahrscheinlichkeitsbasiert arbeiten. Mit ein paar Absätzen ist das nicht zu machen, es erfordert durchaus einen längeren Atem, aber es lohnt sich, weil es die Einschätzung von Künstlicher Intelligenz grundlegend verändert. Auch ein Kernproblem der Generativen KI, das freie Erfinden von Inhalten (Halluzinieren), wird im Blick auf die Funktionsweise unmittelbar nachvollziehbar, ebenso wie die grundsätzliche und sehr wichtige Tatsache, dass KI-Systeme für uns Menschen letztlich eine „Black Box“ sind. Ein zweiter Schwerpunkt dieser Website führt in die Praxis und betrifft den eigenen Umgang mit Chatbots wie ChatGPT bzw. die Frage, wie man KI-Systeme durch geeignetes Prompting (also gute Nutzereingaben) möglichst effektiv steuern kann, um ihre frappierende Leistungsfähigkeit bestmöglich zu nutzen.

Alles, was man in diesem Bereich schreibt, ist morgen nicht mehr aktuell. Ich habe mich auf dieser Website allerdings auf grundlegende Mechanismen konzentriert, die zwar morgen in neuem Gewand erscheinen mögen, aber immer noch gültig sein dürften. Mit den Besonderheiten eines neuen ChatGPT-Releases kann sich beschäftigen, wer die Basis verstanden hat. Dass Beispiele aus den Erklärungen schon heute, geschweige denn morgen anders ausfallen würden, ist demgegenüber von nachgeordneter Bedeutung.

Was ist „Künstliche Intelligenz“?

Mit „Künstlicher Intelligenz“ bezeichnet man allgemein die Fähigkeit eines Computersystems, Aufgaben zu lösen, die üblicherweise von Menschen (= intelligenten Wesen) erledigt werden. Diffenzierter ist die auf KI-Pionier Marvin Minsky zurückgehende Definition von Künstlicher Intelligenz als Wissenschaft, Maschinen Aufgaben lösen zu lassen, die Intelligenz erforderten, wenn ein Mensch sie ausführen würde. In dieser Formulierung wird prägnant zum Ausdruck gebracht, dass der Maschine keine „Intelligenz“ im menschlichen Sinne zuzuschreiben ist, der Computer vielmehr menschliche Intelligenz nur nachahmt.

Es hat sich eingebürgert, auch die KI-basierten Systeme selbst als „KI“ zu bezeichnen: Formulierungen wie „Die KI hat den Text geschrieben“ oder „Die KI erkennt Gesichter“ verweisen – sprachlich nicht ganz sauber – auf bestimmte, KI-basierte Tools.

Generative Künstliche Intelligenz

Künstliche Intelligenz ist entgegen der allgemeinen Wahrnehmung ein bereits jahrzehntealtes Forschungsgebiet mit Anfängen in den 1950er Jahren. Dass sie seit wenigen Jahren in aller Munde ist, liegt an der rasanten Verbreitung der sogenannten „Generativen Künstlichen Intelligenz“, d.h. der Ausprägung von Künstlicher Intelligenz, die etwas „generiert“, also etwas entstehen lässt. Das entscheidende Datum ist schnell benannt: Die Veröffentlichung von ChatGPT durch den Konzern OpenAI am 30. November 2022 war der Moment, in dem Künstliche Intelligenz in das Bewusstsein der breiten Öffentlichkeit trat. ChatGPT konnte plötzlich etwas, das wir alle in Schule und Ausbildung erlernen und immer wieder – in verschiedenem Maße – brauchen: Text erstellen. Die Breite des Anwendungsfeldes sicherte die enorme Aufmerksamkeit, gepaart mit der Frage nach den Konsequenzen, die es haben kann, eine bis zu diesem Zeitpunkt zutiefst menschliche Kompetenz automatisieren zu können.

… wie ein Mensch?… Nein: Statistik!

Dass hier – mit staunenswertem Erfolg – menschliche Fähigkeiten imitiert werden, hat unsere Sprache beeinflusst: Die Sprache, mit der wir alltäglich über Chatbots und andere KI-Systeme reden, ist in hohem Maße anthropomorphisierend, was unwillkürlich Vertrauen stiftet: „Die KI liest Texte“, „Die KI denkt/sagt/meint…“. Schon die Bezeichnung „Künstliche Intelligenz“ impliziert eine Anthropomorphisierung („Intelligenz“). Das lateinische Verb „intellegere“ bedeutet „verstehen“, „begreifen“, „wahrnehmen“. Diese Fähigkeiten allerdings kann die Maschine eben tatsächlich nur simulieren. Im Hintergrund stehen grundsätzlich Rechenoperationen, letztlich Wahrscheinlichkeitsberechnungen. Nun stellen wir uns mal einen Moment vor, wir würden KI-Modelle wie ChatGPT – wenig werbewirksam – als „Wahrscheinlichkeitsmaschinen“ oder „Statistische Prognosemodelle“ bezeichnen. Sprache wirkt bekanntlich wahrnehmungsverändernd, und das wäre auch hier der Fall. „Frag doch mal das Statistische Prognosemodell, welche Ursachen der Dreißigjährige Krieg hatte“? Das kommt einem doch fast ein wenig abwegig vor (was nicht heißt, dass es nicht funktionieren würde).

Etwas mehr von diesem verunsichernden Bewusstsein in die Nutzung von KI hineinzutragen, wäre ein Gewinn – und schon aus diesem Grund scheint es mir auch für den normalen Anwender sinnvoll, sich einmal mit der Funktionsweise von Sprachmodellen wie ChatGPT zu beschäftigen: Wie kommt ein solches Sprachmodell (LLM, Large Language Model) überhaupt zu seinem Output? Was passiert im Inneren?

Fragwürdige Anthropomorphisierung: „Ich überlege“ – der KI-Modus von google suggeriert ein „Ich“ als nachdenkendes Gegenüber, während Suchen und statistische Berechnungen stattfinden. Bei „Perplexity“ heißt es „Forschung läuft“ – als Wissenschaftlerin sträuben sich mir zwar sämtliche Haare, wenn eine Recherche als „Forschung“ bezeichnet bzw. übersetzt wird, aber diese Lösung ist zweifellos besser.

Joseph Weizenbaum (Foto von 1982) entwickelte in den 1960er Jahren den ersten „Chatbot“ Eliza und warnte nachdrücklich vor übersteigertem Vertrauen in intelligent erscheinende Maschinen. Foto: Rochester Institute of Technology, Public domain, via Wikimedia Commons.

Das sehr verbreitete übersteigerte Vertrauen in die Ergebnisse von KI Chatbots bis hin zu dem Eindruck, es mit einem quasi-menschlichen Gegenüber zu tun zu haben (in das man sich womöglich gar verlieben kann), hat in der Informatik einen Namen: Es wird als „Eliza-Effekt“ bezeichnet. Dahinter steht das simple Gesprächsprogramm „Eliza“, gewissermaßen der erste Chatbot der Geschichte, von dem deutsch-amerikanischen Informatiker Joseph Weizenbaum schon in den 1960er-Jahren entwickelt. Technisch noch ganz und gar regelbasiert durchprogrammiert, beantwortete die berühmteste Eliza-Variante im Stil einer Psychotherapie-Sitzung die natürlichsprachlichen (schriftlichen) Eingaben des Anwenders nach simplen Mustern, wandelte Aussagen beispielsweise in Fragen um („Ist es für Dich wichtig, dass…?“) oder reagierte auf Stichwörter („Erzählen Sie mir mehr über x“), ohne jedes Verständnis natürlich. So hätte Eliza auf einen Satz wie „Vorsicht ist die Mutter der Porzellankiste“ ohne weiteres „Erzählen Sie mir mehr über ihre Mutter“ antworten können. Die Gesprächsprotokolle zeigen dementsprechend sinnentleerte Wortwechsel. Für Weizenbaum war es schon damals überaus erschreckend zu beobachten, wie vertrauensvoll sich die Menschen dem System öffneten und es als tatsächliches Gegenüber wahrnahmen. Er warnte nachdrücklich vor der Täuschung, es mit tatsächlicher Kommunikation zu tun zu haben – eine Warnung, die noch einmal zu ganz neuer Aktualität gelangt ist durch die heutigen, ungleich besser und völlig anders funktionierenden KI-Systeme. Wir sollten sehr bewusst wahrnehmen, wie heute über KI gesprochen wird, mit welcher Selbstverständlichkeit Verben wie „kennt“, „weiß“, „irrt sich“, „versteht“, „sagt“ Verwendung finden, die unweigerlich Bewusstsein, Denken und Handeln implizieren und Vertrauen wecken. Das ist alltagstauglich, aber konzeptionell irreführend.

Tatsächlich funktionieren viele Anwendungen verblüffend gut, und in gewisser Weise werden diese Leistungen sogar noch faszinierender, wenn man sich vergegenwärtigt, dass grundsätzlich nicht mit Inhalten gearbeitet wird: „Die KI“ hat nichts „gelesen“ und Inhalte als solche aufgenommen, sie „weiß“ also zunächst einmal gar nichts und „versteht“ schon überhaupt nichts (und „irrt sich“ insofern auch nicht), nein, sie hat nur in gigantischer Quantität die Aufeinanderfolge bestimmter Wörter bzw. Wortbestandteile (und ggf. andere Inputs) rezipiert, damit Berechnungen angestellt und Muster aufgedeckt. Dass rein rechnerische, statistische Verfahren ein Arbeiten auf inhaltlicher Ebene möglich machen, wie es seit der Veröffentlichung von ChatGPT allerorten Anwendung findet, hat auch die Experten in den letzten Jahren verblüfft. Niemand hätte so zeitnah mit derartigen Resultaten gerechnet.

ChatGPT hat mir eine interessante Selbstbeschreibung geliefert: Es sei „ein statistisch trainiertes System, das in vielen Fällen funktionale Formen von Verständnis zeigt.“ Funktionale Formen von Verständnis? Das ist eine bemerkenswerte Formulierung, die eher auf funktionsgerechtes Reagieren als auf Verstehen abzielt – die Reaktion entspringt einem Als-Ob-Verständnis, keinem realen Verständnis.

Illustration (hier und an anderen Stellen): KI-generiert

Verschiedene Anwendungen

Die Fülle der KI-Anwendungen ist auch für Insider nicht mehr zu überschauen. Die bekanntesten sind Chatbots wie ChatGPT (OpenAI), Claude (Anthropic) oder Gemini (google) – diese als „Conversational AI“ bezeichneten Systeme, mit denen man (fast) wie mit einem Mensch kommunizieren kann, arbeiten vorrangig mit Text als Input und Output, können aber auch andere Formate bedienen, sind also multimodal. So kann man ChatGPT z.B. längst auch Bilder oder Audiodateien, Code oder Excel-Tabellen als Input zur Verfügung stellen, und umgekehrt kann es derartige Formate auch selbst generieren. Ein Foto vom eigenen Kühlschrankinhalt, um sich Essensvorschläge machen zu lassen – ohne weiteres möglich. Illustrationen nach eigenen Textvorgaben – kein Problem.

Neben den zunehmend multimodalen „Allroundern“ wie ChatGPT & Co gibt es eine Fülle spezialisierter Tools, ob für Text, Sprache, Bilder, Videos, Tabellen, Musik oder Code. Sie lassen sich schnell durch eine Internetrecherche herausfinden. Bildgenerierungssysteme („text to image“) wie DALL·E, Midjourney, Leonardo AI oder Stable Diffusion, Musikgeneratoren wie Suno oder Video-Generatoren wie Sora, Meme-Generatoren wie Supermeme AI oder Reiseplaner wie Mindtrip oder Layla: Für nahezu jeden Anwendungsfall existieren inzwischen spezialisierte KI-Werkzeuge. Viele dieser Anwendungen bieten kostenfreie Basisversionen, Freikontingente oder Testzeiträume. Wer sich einen Eindruck verschaffen möchte, findet auf YouTube zahlreiche Demonstrationen – beispielsweise über Suchbegriffe wie „Bild zu Video KI“, „Text zu Bild KI“ oder natürlich den jeweiligen Toolnamen.

Winziger Ausschnitt (KI-generiert) aus einem schier unermesslichen Angebot von KI-Tools für verschiedenste Anwendungen

Conversational AI: Chatbots

Auf dieser Website wird speziell der Ausschnitt der „Conversational AI“ in den Blick genommen, also Dialogsysteme wie ChatGPT, die vorrangig auf textbasierter Interaktion aufbauen: Wir kommunizieren in natürlicher Sprache mit dem System, fragen und erhalten eine Antwort. An einem Chatbot bzw. dem zugrundeliegenden Sprachmodell (Large Language Model/LLM) lassen sich Grundprinzipien verständlich machen, auf denen auch viele andere moderne KI-Anwendungen basieren. Eine dezidierte Vorstellung davon zu entwickeln, wie ein Sprachmodell funktioniert, wie es trainiert wird und wie Maschinen überhaupt lernen, ist ein Wert an sich – gerade in Zeiten, in denen KI omnipräsent ist, oft aber nur oberflächlich darüber gesprochen wird. Überdies entwickelt sich durch den Blick hinter die Kulissen die Kompetenz, zu entscheiden, welche Aufgaben überhaupt KI-tauglich sind und wo die Grenzen der KI liegen. Daneben geht es hier um den praktischen Umgang mit Chatbots: Neben einer allgemeinen Einführung in effektives Prompting, also die richtige Formulierung von Nutzereingaben, werden einige spezielle Techniken vorgestellt, mit denen sich Inhalt und Format des KI-Outputs gezielt steuern lassen.