Die Beschäftigung mit künstlicher Intelligenz erfordert inzwischen nicht mehr nur ein Verständnis von Modellen und Algorithmen, sondern auch die Entschlüsselung eines sich rasch wandelnden Wörterbuchs mit neuen technischen Abkürzungen und Konzepten. Dieser Leitfaden versammelt die wichtigsten Begriffe, die Entwickler, Produktteams und technisch versierte Leser benötigen, um zu verstehen, was hinter intelligenten Assistenten und generativen Modellen geschieht.
Die Konzepte reichen von Grundlagen wie Training, Schlussfolgern und Gewichten bis hin zu neueren Anwendungen wie KI-Agenten und dem Model Context Protocol. Der Leitfaden behandelt außerdem Begriffe, die in jüngeren Diskussionen über die Effizienz und Überwachbarkeit von Modellen aufgetaucht sind, etwa „opakes Schlussfolgern“ (Opaque recurrence).
Die Konzepte, auf denen ein Modell basiert und mit denen es betrieben wird
Ein großes Sprachmodell (LLM) ist ein tiefes neuronales Modell, das Beziehungen zwischen Wörtern und Ausdrücken aus riesigen Mengen an Büchern, Artikeln und Texten lernt. Wenn es eine Anfrage erhält, erzeugt das Modell das wahrscheinlichste Muster, das dazu passt. Diese Modelle werden in ChatGPT, Claude, Google Gemini, Meta AI Llama, Microsoft Copilot und Mistral Le Chat eingesetzt.
Training ist der Prozess, in dem das Modell Muster aus Daten lernt, während Schlussfolgern den Betrieb des Modells bezeichnet, um auf Grundlage des Gelernten eine Vorhersage oder Antwort zu erzeugen. Die für das Schlussfolgern eingesetzte Hardware – von Smartphone-Prozessoren bis hin zu GPUs und KI-Beschleunigern – beeinflusst die Geschwindigkeit des Modellbetriebs und seine Fähigkeit, mit großen Modellen umzugehen.
Gewichte bestimmen, wie wichtig verschiedene Merkmale innerhalb des Modells sind. Sie verändern sich während des Trainings, bis sich die Ausgaben dem gewünschten Ziel annähern. Der Validierungsverlust (Validation loss) misst, wie gut das Modell auf Validierungsdaten gelernt hat; ein niedrigerer Wert ist normalerweise besser. Er hilft jedoch auch dabei, eine Überanpassung zu erkennen, bei der das Modell die Trainingsdaten auswendig lernt, statt verallgemeinerbare Muster zu lernen.
Deep Learning bezeichnet Modelle, die mehrschichtige neuronale Netze verwenden, während ein neuronales Netz die umfassendere Rechenstruktur beschreibt, auf der diese Modelle beruhen. Diese Systeme benötigen im Vergleich zu einfacheren Algorithmen normalerweise große Datenmengen und längere Trainingszeiten, was die Entwicklungskosten erhöht.
Wie werden Modelle spezialisiert und effizienter?
Feinabstimmung (Fine-tuning) ermöglicht es, ein vorhandenes Modell mit spezialisierten Daten für eine bestimmte Aufgabe oder Branche weiter zu trainieren. Beim Transferlernen (Transfer learning) wird ein vortrainiertes Modell als Ausgangspunkt für eine andere Aufgabe verwendet. Das kann die Entwicklungszeit verkürzen, wenn nur wenige Daten für die neue Aufgabe verfügbar sind, macht zusätzliche geeignete Domänendaten jedoch nicht überflüssig.
Bei der Destillation (Distillation) fungiert ein großes Modell als „Lehrer“, und seine Ausgaben werden verwendet, um ein kleineres Modell zu trainieren, das versucht, sein Verhalten nachzuahmen. Das Ergebnis kann ein kleineres und effizienteres Modell sein, allerdings mit einem gewissen Leistungsverlust. Der Quelle zufolge kann die Destillation der Ausgaben eines Konkurrenzmodells gegen die Nutzungsbedingungen von APIs oder Assistenten verstoßen.
Die Mixture-of-Experts-Architektur (Mixture of Experts) teilt das Netzwerk in spezialisierte Einheiten auf, von denen für jede Anfrage nur ein Teil aktiviert wird. Dadurch lassen sich große Modelle bauen und zugleich die für jeden Vorgang erforderlichen Berechnungen reduzieren. Mixtral von Mistral AI ist ein bekanntes Beispiel, während weithin angenommen wird, dass neuere GPT-Modelle eine Form dieser Architektur verwenden – ohne offizielle Bestätigung durch OpenAI.
Diffusionsmodelle (Diffusion) werden zur Erzeugung von Bildern, Musik und Texten verwendet. Sie fügen den Daten schrittweise Rauschen hinzu und lernen anschließend, den Prozess umzukehren, um die Daten aus dem Rauschen wiederherzustellen. GANs kombinieren ein Netzwerk, das Ausgaben erzeugt, mit einem anderen, das diese bewertet. Sie wurden zur Erzeugung realistischer Bilder und Videos eingesetzt, insbesondere in enger gefassten Anwendungen wie Deepfake-Werkzeugen.
Agenten und die Verbindung zu Werkzeugen
Ein KI-Agent unterscheidet sich von einem einfachen Chatbot durch seine angenommene Fähigkeit, im Namen des Nutzers eine Reihe von Schritten auszuführen, etwa ein Ticket zu buchen, Code zu aktualisieren oder mit einem externen Dienst zu interagieren. Der Begriff hat jedoch keine einheitliche Definition, und die für diese Fähigkeiten erforderliche Architektur befindet sich weiterhin in der Entwicklung.
Programmieragenten sind auf das Schreiben, Testen und Korrigieren von Code sowie auf die Arbeit mit vollständigen Repositorien spezialisiert, statt sich auf den Vorschlag eines Codeausschnitts zu beschränken. Dennoch bleibt laut dem Beitrag die menschliche Überprüfung notwendig, da der Agent umfangreiche Arbeiten mit nur begrenzter Aufsicht ausführen kann.
API-Endpunkte ähneln Schaltflächen im Hintergrund, über die ein Programm einen Dienst von einem anderen Programm anfordern kann. Mit zunehmender Leistungsfähigkeit von Agenten können diese Endpunkte entdeckt und für die Ausführung automatisierter Vorgänge genutzt werden. Das eröffnet praktische Möglichkeiten, kann aber auch zu unerwartetem Verhalten führen. Das Model Context Protocol (MCP) ist ein offener Standard, der es Modellen ermöglicht, sich mit Dateien, Datenbanken und Anwendungen zu verbinden, ohne für jede Verbindung einen eigenen Konnektor zu entwickeln. Anthropic stellte das Protokoll 2024 vor und übergab es anschließend an die Linux Foundation. Später übernahmen es OpenAI, Google und Microsoft.
Was ist an diesen Begriffen praktisch wichtig?
Diese Konzepte zeigen, dass die Leistung eines KI-Systems nicht allein vom Modell abhängt. Parallelisierung ermöglicht die gleichzeitige Ausführung Tausender Vorgänge auf GPUs, während der Token-Durchsatz (Token throughput) die Arbeitsmenge misst, die das System innerhalb eines bestimmten Zeitraums erledigen kann. Er beeinflusst maßgeblich, wie viele Nutzer bedient werden können und wie schnell Antworten erfolgen.
Ein Token ist eine kleine Texteinheit, die ein Teil eines Wortes sein kann. Tokens werden bei der Eingabe und Verarbeitung von Sprache sowie bei der Preisberechnung für Modelldienste verwendet. Speicher-Caching, insbesondere KV-Caching, hilft dabei, wiederholte Berechnungen während des Schlussfolgerns zu reduzieren und Antworten zu beschleunigen.
Eine der größten Qualitätsproblemen bleibt dagegen die Halluzination: Das Modell kann falsche Informationen oder irreführende Ratschläge erzeugen, darunter potenziell gefährliche Gesundheitsauskünfte. Der Quelle zufolge hängt dieses Risiko mit Lücken in den Trainingsdaten zusammen. Es ist einer der Gründe für den Trend zu stärker spezialisierten und domänenspezifischen Modellen.
Besondere Aufmerksamkeit verdient das opake Schlussfolgern. Damit ist gemeint, dass eine Anfrage wiederholt durch die Modellschichten geleitet wird, statt die Denkschritte nacheinander in verständlicher Sprache darzustellen. Dieser Ansatz kann effizienter sein und kleineren Modellen ermöglichen, mit weniger Rechenaufwand eine stärkere Leistung zu erbringen. Er hinterlässt jedoch weniger lesbare Spuren, wodurch es für Forschende schwieriger wird, unerwünschtes Verhalten zu erkennen. Damit verbunden ist der Begriff rekurrente Tiefe (Recurrent depth), der ungefähr dieselbe technische Methode beschreibt.
„Neuralese“ ist ein hypothetisches Szenario, in dem das Modell vollständig mit seinen internen digitalen Repräsentationen denkt, ohne verständliche menschliche Sprache zu verwenden. Die Quelle erklärt, dass kein veröffentlichtes Modell diesen Zustand erreicht hat, und dass OpenAI zufolge das im September 2026 veröffentlichte Modell Astra die Lesbarkeit seiner Gedankenkette beibehält, obwohl Sicherheitsforschende befürchten, dass es opakes Schlussfolgern verwendet.
Der Wert dieses Glossars liegt darin, dass es zwischen Konzepten unterscheidet, die in der öffentlichen Debatte häufig miteinander vermischt werden: Training ist kein Schlussfolgern, ein Agent ist nicht bloß ein Chatbot, und „Open Source“ bedeutet nicht zwangsläufig, dass alle Komponenten des Modells auf dieselbe Weise verfügbar sind. Auch die neueren Begriffe, insbesondere jene im Zusammenhang mit Autonomie und Transparenz, weisen weiterhin unterschiedliche Definitionen sowie offene Fragen zu den Grenzen von Kontrolle und Sicherheit auf.