KI verstehen

KI-Glossar

Neu im Thema KI? Kein Problem. Hier sind die wichtigsten Begriffe aus der KI-Welt, in einfacher Sprache erklärt.


Nutzung

API

Application Programming Interface (Programmierschnittstelle)

Eine API ist ein Weg, über den Softwareanwendungen miteinander sprechen. Wenn ein Unternehmen wie Anthropic oder OpenAI eine API anbietet, können Entwickler Text an das KI-Modell senden und Antworten zurückerhalten — komplett per Code, ohne Chat-Oberfläche. So gelangt KI in Apps, Websites und Produkte.

Stellen Sie es sich so vor: Der Drive-in-Schalter eines Restaurants. Sie gehen nicht in die Küche — Sie geben Ihre Bestellung am Schalter auf (senden eine Anfrage), und das Essen (die Antwort) wird Ihnen gereicht. Die API ist dieser Schalter.
Nutzung

Agent

KI, die eigenständig handeln kann

Ein KI-Agent ist ein System, das eigenständig planen, entscheiden und handeln kann, um ein Ziel zu erreichen — statt nur eine einzelne Frage zu beantworten. Anstatt bei jedem Schritt auf Ihre Anweisung zu warten, zerlegt ein Agent eine komplexe Aufgabe, nutzt Werkzeuge (Websuche, Code schreiben, Dateien lesen) und arbeitet weiter, bis die Aufgabe erledigt ist. Agenten setzen auf großen Sprachmodellen auf und ergänzen sie um Autonomie und Werkzeugnutzung.

Stellen Sie es sich so vor: Der Unterschied zwischen jemandem nach dem Weg fragen (Chatbot) und einen persönlichen Assistenten engagieren, der die ganze Reise plant, die Flüge bucht und Ihnen den Reiseplan schickt (Agent). Sie geben das Ziel vor, die Schritte findet der Agent.
Architektur

Attention

Wie KI entscheidet, was wichtig ist

Attention ist der Mechanismus, mit dem ein Transformer-Modell bestimmt, welche Wörter eines Satzes füreinander am wichtigsten sind. Im Satz „Die Katze saß auf der Matte, weil sie müde war“ hilft Attention dem Modell zu verstehen, dass sich „sie“ auf die Katze bezieht und nicht auf die Matte. Diese Fähigkeit, weit entfernte Wörter zu verknüpfen, macht Transformer so leistungsfähig.

Stellen Sie es sich so vor: In einem vollen Raum können Sie einem Gespräch folgen, obwohl viele durcheinanderreden. Ihr Gehirn richtet die Aufmerksamkeit auf das Relevante und blendet den Rest aus. Genau das tut der Attention-Mechanismus mit Wörtern.
Sprache

Kontextfenster

Wie viel die KI auf einmal „sehen“ kann

Das Kontextfenster ist die Gesamtmenge an Text, die ein KI-Modell während eines Gesprächs berücksichtigen kann. Dazu zählt alles — Ihre Frage, geteilte Dokumente und die Antwort der KI selbst. Wird das Gespräch zu lang, beginnt das Modell, den Anfang zu „vergessen“.

Stellen Sie es sich so vor: Eine Tafel im Klassenzimmer. Sie können nur begrenzt viel schreiben, bevor der Platz ausgeht und Sie das Älteste löschen müssen, um weiterzuschreiben.
Hardware

CPU

Central Processing Unit (Hauptprozessor)

Die CPU ist das Hauptgehirn jedes Computers. Sie erledigt allgemeine Aufgaben: Programme ausführen, im Web surfen, das Betriebssystem verwalten. Sie ist hervorragend darin, viele verschiedene Dinge nacheinander sehr schnell zu erledigen.

Stellen Sie es sich so vor: Ein hochbegabter Student, der jede Art von Aufgabe lösen kann — Mathe, Naturwissenschaften, Texte — aber immer nur eine nach der anderen.
Sprache

Embedding

Wörter in Zahlen verwandeln

Ein Embedding stellt ein Wort, einen Satz oder ein Dokument als Zahlenliste (einen „Vektor“) dar, die dessen Bedeutung erfasst. Wörter mit ähnlicher Bedeutung erhalten ähnliche Zahlen. So versteht eine KI, dass „Hund“ und „Welpe“ zusammengehören oder dass sich „Paris“ zu „Frankreich“ verhält wie „Tokio“ zu „Japan“.

Stellen Sie es sich so vor: GPS-Koordinaten für Bedeutung. So wie nahe beieinanderliegende Städte ähnliche Koordinaten haben, haben ähnliche Wörter ähnliche Zahlenmuster. „Glücklich“ und „fröhlich“ liegen dicht beieinander, „glücklich“ und „Kühlschrank“ weit auseinander.
Training

Fine-Tuning

Ein vortrainiertes Modell spezialisieren

Beim Fine-Tuning erhält ein bereits auf allgemeinen Daten trainiertes KI-Modell zusätzliches Training zu einem bestimmten Thema oder einer Aufgabe. So lässt sich etwa ein allgemeines Sprachmodell auf medizinische Texte nachtrainieren, damit es Gesundheitsfragen deutlich besser beantwortet. Das ist schneller und günstiger als ein Training von Grund auf.

Stellen Sie es sich so vor: Eine Ärztin, die bereits Medizin studiert hat (allgemeines Training) und dann eine Facharztweiterbildung in Kardiologie macht (Fine-Tuning). Sie kennt die Medizin bereits — jetzt wird sie Spezialistin.
Architektur

Frontier-Modell

Das größte, leistungsfähigste Modell einer Familie

Ein Frontier-Modell ist die größte und leistungsfähigste Variante einer KI-Modellfamilie — die mit den meisten Parametern. Qwen3.5-397B etwa ist das Frontier-Modell der Familie Qwen 3.5, mit 397 Milliarden Parametern. Anders als kleinere Varianten (7B, 32B, 72B), die für einfache Aufgaben oft ausreichen, glänzt das Frontier-Modell bei komplexer Arbeit: mehrstufiges Reasoning, Analyse langer Dokumente, Codegenerierung über mehrere Dateien. Die meisten API-Anbieter führen das Frontier-Modell nicht, weil es weit mehr GPUs erfordert — IG1 AI bündelt diese Infrastruktur und macht es für Sie zugänglich.

Stellen Sie es sich so vor: Der Unterschied zwischen einem Kammerensemble und einem vollen Sinfonieorchester. Das Streichquartett spielt einfache Stücke problemlos — für eine Mahler-Sinfonie mit all ihrer Komplexität brauchen Sie alle 100 Musiker.
Hardware

GPU

Graphics Processing Unit (Grafikprozessor)

Eine GPU wurde ursprünglich für die Grafikberechnung in Videospielen gebaut — sie eignet sich aber auch hervorragend für KI. Anders als eine CPU, die Aufgaben nacheinander abarbeitet, kann eine GPU Tausende kleiner Berechnungen gleichzeitig ausführen. Genau das brauchen KI-Modelle.

Stellen Sie es sich so vor: Statt eines einzelnen Hochbegabten: ein Klassenzimmer mit 1.000 Schülern, die jeweils gleichzeitig eine einfache Rechenaufgabe lösen. Gemeinsam sind sie viel schneller fertig.
Sicherheit

Leitplanken

Sicherheitsgrenzen für das Verhalten der KI

Leitplanken sind die Regeln und Beschränkungen in KI-Systemen, die verhindern sollen, dass schädliche, gefährliche oder unangemessene Inhalte entstehen. Sie werden während und nach dem Training gesetzt, damit die KI bei illegalen Aktivitäten nicht hilft, keine Hassrede erzeugt und hilfreich und ehrlich bleibt.

Stellen Sie es sich so vor: Die Bandenpolster auf der Bowlingbahn. Sie halten die Kugel in der Bahn, damit sie nicht in die Rinne fällt. Leitplanken halten die KI davon ab, in gefährliches Gebiet abzudriften.
Sicherheit

Halluzination

Wenn KI sich etwas ausdenkt

Eine Halluzination liegt vor, wenn ein KI-Modell überzeugt Informationen erzeugt, die richtig klingen, tatsächlich aber falsch oder erfunden sind. Der Grund: Das Modell sagt anhand von Mustern voraus, was „richtig klingt“ — es „weiß“ keine Fakten. So entstehen erfundene Studien, ausgedachte Statistiken oder nicht existierende Personen.

Stellen Sie es sich so vor: Ein Student, der nicht gelernt hat, aber sehr gut schreiben kann. Er verfasst einen überzeugenden Aufsatz, der fundiert klingt — die Fakten sind jedoch komplett erfunden.
Nutzung

Inferenz

Wenn die KI Ihnen tatsächlich antwortet

Inferenz ist das, was jedes Mal passiert, wenn Sie einer KI eine Frage stellen und sie antwortet. Das Modell nutzt alles, was es im Training gelernt hat, um die beste Antwort vorherzusagen — Token für Token. Deshalb erscheinen KI-Antworten oft Wort für Wort: Das Modell erzeugt jedes Stück wirklich nacheinander.

Stellen Sie es sich so vor: Die Prüfung nach monatelangem Lernen. Sie lernen nicht mehr — Sie wenden an, was Sie bereits wissen, um neue Fragen zu beantworten.
Hardware

Latenz

Wie schnell die KI antwortet

Latenz ist die Verzögerung zwischen dem Absenden Ihrer Anfrage und dem Eintreffen der ersten Antwort. Weniger Latenz = schnellere Antwort. Sie hängt von der Modellgröße ab, von der Hardware, von der Entfernung zum Server und davon, wie viele Menschen gleichzeitig zugreifen.

Stellen Sie es sich so vor: Die Wartezeit im Café. Mal bekommen Sie Ihr Getränk in 30 Sekunden, mal ist die Schlange lang und es dauert 5 Minuten. Das Getränk ist dasselbe — die Wartezeit ist die Latenz.
Architektur

LLM

Large Language Model (großes Sprachmodell)

Ein LLM ist ein sehr großes KI-Modell (meist auf Transformer-Basis), das mit enormen Textmengen trainiert wurde, um menschliche Sprache zu verstehen und zu erzeugen. „Groß“ bezieht sich sowohl auf die Menge der Trainingsdaten als auch auf die Zahl der Parameter. Modelle wie Claude, GPT-4 und Llama sind allesamt LLMs.

Stellen Sie es sich so vor: Ein Student, der das gesamte Internet gelesen hat und nun Aufsätze schreibt, Fragen beantwortet, Artikel zusammenfasst, Code schreibt und sogar Witze reißt — alles auf Basis von Mustern, die er beim Lesen aufgeschnappt hat.
Architektur

MCP

Model Context Protocol

MCP ist ein offener Standard (von Anthropic entwickelt), über den KI-Modelle einheitlich mit externen Werkzeugen und Datenquellen verbunden werden. Statt für jedes Werkzeug (Google Drive, Slack, eine Datenbank usw.) eine eigene Integration zu bauen, bietet MCP einen einheitlichen „Stecker“, der überall passt. Jede KI mit MCP-Unterstützung kann mit jedem Werkzeug mit MCP-Unterstützung sprechen — ohne jedes Mal eigenen Code.

Stellen Sie es sich so vor: USB-C für KI. Vor USB-C hatte jedes Handy ein eigenes Ladegerät. MCP ist der Universalanschluss — sobald ein Werkzeug MCP spricht, kann jede KI es nutzen, so wie jedes Gerät ein USB-C-Kabel nutzen kann.
Training

Modellgewichte

Das gelernte Wissen der KI als Datei

Gewichte sind die konkreten Zahlen, aus denen ein trainiertes KI-Modell besteht — das Ergebnis des gesamten Trainings. Wenn Sie „ein Modell herunterladen“, laden Sie dessen Gewichte herunter. Diese Dateien können riesig sein (Dutzende oder Hunderte Gigabyte) und enthalten alles, was das Modell gelernt hat.

Stellen Sie es sich so vor: Wenn das Training der KI jahrelange Schulzeit war, sind die Gewichte das Zeugnis plus alles im Kopf des Schülers — als Datei gespeichert. Sie können diese Datei kopieren und einem anderen Computer dasselbe „Wissen“ geben.
Architektur

Neuronales Netz

Die Struktur, die KI „denken“ lässt

Ein neuronales Netz ist ein mathematisches System nach dem Vorbild des menschlichen Gehirns. Es besteht aus Schichten verbundener „Neuronen“ (kleiner mathematischer Funktionen), die Informationen weiterreichen. Daten gehen auf der einen Seite hinein, werden durch viele Schichten verarbeitet, und auf der anderen Seite kommt ein Ergebnis heraus. Jede moderne KI — Bilderkennung, Sprachmodelle, selbstfahrende Autos — beruht auf neuronalen Netzen.

Stellen Sie es sich so vor: Eine Kette von Telefonaten. Person A erzählt etwas an 3 Personen, die es je 3 weiteren erzählen, und so fort. Am Ende ist die Nachricht durch viele Runden „Stille Post“ zu einer endgültigen Antwort geworden.
Nutzung

OpenClaw

Ein KI-Agent, der Ihren Computer steuert

OpenClaw (auch Claw genannt) ist ein kostenloser Open-Source-KI-Assistent, der auf Ihrem Computer läuft, Ihren Bildschirm tatsächlich sieht, Ihre Programme bedient und echte Arbeit für Sie erledigt. Anders als ein Chatbot, der nur Fragen beantwortet, ist OpenClaw ein autonomer Agent — er klickt Schaltflächen, füllt Formulare aus, surft im Web, schreibt Code, verschickt Nachrichten und automatisiert ganze Arbeitsabläufe über mehrere Anwendungen hinweg. Es ist eines der am schnellsten wachsenden Open-Source-Projekte überhaupt, mit über 80.000 GitHub-Sternen.

Stellen Sie es sich so vor: Ein hochbegabter Praktikant, der rund um die Uhr an Ihrem Rechner sitzt. Sie sagen „Buch mir einen Flug nach Paris“ oder „Räum diese Tabelle auf“, und er tut es tatsächlich — bewegt die Maus, tippt, wechselt zwischen Programmen — ganz von selbst.
Nutzung

Open Source vs. Closed Source

Wer den Code sehen darf

Ein Open-Source-KI-Modell (wie Llama von Meta oder Mistral) stellt Code und Gewichte öffentlich bereit — jeder kann es herunterladen, verändern und betreiben. Ein Closed-Source-Modell (wie GPT-4 oder Claude) bleibt geschlossen — nutzbar nur über die API oder App des Anbieters. Open Source gibt Ihnen mehr Kontrolle und Datenschutz; Closed Source bedeutet oft mehr Leistung und einfachere Einrichtung.

Stellen Sie es sich so vor: Ein offenes Rezept gegenüber der Geheimsoße eines Restaurants. Mit dem Rezept kochen Sie selbst, ändern die Zutaten und geben es an Freunde weiter. Bei der Geheimsoße bestellen Sie und genießen — nachkochen können Sie sie nicht.
Training

Offene Gewichte

Wenn ein Modell sein Gehirn teilt, aber nicht sein Rezept

Offene Gewichte bedeutet: Ein Unternehmen veröffentlicht die trainierten Modellgewichte (das Endergebnis des Trainings), sodass jeder das Modell herunterladen und betreiben kann — gibt aber weder den Trainingscode noch die Trainingsdaten oder den vollständigen Entstehungsprozess frei. Das unterscheidet sich von echtem Open Source, bei dem alles geteilt wird. Modelle wie Llama von Meta und Mistral haben offene Gewichte: frei nutzbar, aber nicht vollständig reproduzierbar.

Stellen Sie es sich so vor: Ein Konditor, der Ihnen den fertigen Kuchen gibt — Sie dürfen ihn essen, weitergeben und nach Belieben verzieren — aber weder Rezept noch Backtemperatur noch Zutatenliste herausrückt. Sie haben das Ergebnis, nicht den Weg dorthin.
Training

Parameter

Die internen Wissensregler der KI

Parameter sind die Zahlen im Inneren eines KI-Modells, die während des Trainings justiert werden. Ein Modell wie GPT-4 hat Hunderte Milliarden davon. Mehr Parameter bedeuten in der Regel, dass das Modell komplexere Muster lernen und bessere Antworten geben kann — es braucht dafür aber auch mehr Rechenleistung. Ein Frontier-Modell wie Qwen3.5-397B (397 Milliarden Parameter) übertrifft seine kleineren Varianten (7B, 32B) bei komplexem Reasoning und der Analyse langer Dokumente deutlich.

Stellen Sie es sich so vor: Die Regler an einem riesigen Mischpult im Tonstudio. Jeder Regler steuert einen winzigen Teil des Klangs, und alle müssen perfekt eingestellt sein, damit die Musik stimmt. Mehr Regler = mehr Nuancen.
Nutzung

Prompt

Was Sie der KI sagen

Ein Prompt ist der Text, mit dem Sie der KI sagen, was Sie wollen. Das kann eine Frage sein, eine Anweisung oder auch ein ganzes Dokument, mit dem die KI arbeiten soll. Je besser und klarer Ihr Prompt, desto besser die Antwort — deshalb ist „Prompt Engineering“ zu einer wichtigen Fähigkeit geworden.

Stellen Sie es sich so vor: Eine Bestellung im Restaurant. „Bringen Sie mir was Gutes“ kann klappen — aber „Ich hätte gern ein medium-rare gebratenes Steak mit Pommes und ohne Zwiebeln“ bringt Ihnen genau das, was Sie wollen.
Training

Quantisierung

KI-Modelle kleiner und schneller machen

Quantisierung verkleinert ein KI-Modell, indem die Genauigkeit seiner Zahlen reduziert wird. Statt jeden Parameter als sehr präzise 32- oder 16-Bit-Zahl zu speichern, rundet man auf 8 Bit oder sogar 4 Bit. Das Modell wird deutlich kleiner (2- bis 8-fach) und läuft schneller, bei nur geringem Qualitätsverlust. Erst dadurch lassen sich leistungsfähige KI-Modelle auf einem Laptop oder Smartphone betreiben statt auf einem großen Server.

Stellen Sie es sich so vor: Ein Foto von RAW nach JPEG komprimieren. Die Datei wird viel kleiner, lädt deutlich schneller und sieht für die meisten praktisch gleich aus — den minimalen Qualitätsverlust bemerkt man erst beim starken Hineinzoomen.
Architektur

RAG

Retrieval-Augmented Generation

RAG ist ein Verfahren, bei dem die KI zunächst eine Dokumentendatenbank nach relevanten Informationen durchsucht und diese dann für eine präzisere Antwort nutzt. Statt sich nur auf im Training Gelerntes zu stützen, kann die KI auf echte, aktuelle Quellen verweisen. Das reduziert Halluzinationen drastisch.

Stellen Sie es sich so vor: Statt die Prüfung nur aus dem Gedächtnis zu schreiben, dürfen Sie Ihre Notizen mitbringen. Sie können die richtige Antwort nachschlagen, bevor Sie sie aufschreiben — und sind dadurch viel genauer.
Sicherheit

Souveräne KI

KI, die Ihnen gehört und die Sie kontrollieren

Souveräne KI bedeutet, KI-Infrastruktur auf eigenen Servern oder im eigenen Rechenzentrum zu betreiben, statt sich auf die Cloud eines großen Tech-Konzerns zu verlassen. So verlassen Ihre Daten nie Ihre Kontrolle, Sie sind von keiner fremden Plattform abhängig und erfüllen lokale Vorschriften. Besonders wichtig ist das für Behörden, Banken und das Gesundheitswesen.

Stellen Sie es sich so vor: Der Unterschied zwischen einer Mietwohnung und dem eigenen Haus. Als Eigentümer kann niemand die Regeln ändern, die Miete erhöhen oder Ihre Sachen durchsehen. Ihr Haus, Ihre Regeln.
Nutzung

Temperature

Wie kreativ oder wie vorhersehbar die KI ist

Temperature ist ein Regler (meist zwischen 0 und 1), der steuert, wie „zufällig“ die Antworten der KI ausfallen. Ein niedriger Wert (etwa 0,1) macht das Modell sehr vorhersehbar und sachlich — es wählt jedes Mal das wahrscheinlichste nächste Wort. Ein hoher Wert (etwa 0,9) macht es kreativer und überraschender, aber auch fehleranfälliger.

Stellen Sie es sich so vor: Eine Musik-Playlist. Temperature 0 spielt immer Ihren meistgehörten Titel. Temperature 1 schaltet auf Zufallswiedergabe — Sie entdecken vielleicht etwas Großartiges oder hören etwas Seltsames.
Sprache

Token

Der Baustein von KI-Text

Ein Token ist ein kleiner Textbaustein, den ein KI-Modell liest und erzeugt. Das kann ein ganzes Wort sein wie „hallo“, ein Wortteil wie „un“ + „glaub“ + „lich“ oder auch ein einzelnes Zeichen. Wenn es heißt, ein Modell verarbeite „128K Tokens“, bedeutet das: Es kann rund 100.000 Wörter Text auf einmal lesen und behalten. Tokens sind auch die Abrechnungseinheit: Sie zahlen pro gesendetem Token (Input) und pro erzeugtem Token (Output). Je länger Ihre Frage und je länger die Antwort, desto höher die Kosten.

Stellen Sie es sich so vor: LEGO-Steine für Sprache — und an jedem Stein hängt ein kleines Preisschild. Wörter werden in Stücke zerlegt, und die KI baut daraus Sätze. Je mehr Steine Sie verwenden (längere Gespräche), desto höher die Rechnung — wie früher beim Preis pro SMS.
Hardware

TPU

Tensor Processing Unit

Eine TPU ist ein von Google speziell für KI-Workloads entwickelter Chip. Während GPUs universelle Parallelprozessoren sind, die für KI umgewidmet wurden, sind TPUs von Grund auf für eine Sache gebaut: die Tensor-Mathematik hinter neuronalen Netzen. Sie stecken in Googles Rechenzentren und trainieren und betreiben Modelle wie Gemini. Kaufen kann man eine TPU nicht — man mietet den Zugang über Google Cloud.

Stellen Sie es sich so vor: Wenn eine GPU ein Schweizer Taschenmesser ist (in vielem gut), dann ist eine TPU ein lasergeschliffenes Skalpell — für genau eine Aufgabe gebaut und darin unglaublich effizient. Nutzen können Sie es allerdings nur in Googles Klinik.
Training

Training

Wie eine KI lernt

Training ist der Prozess, bei dem ein KI-Modell riesige Datenmengen zu sehen bekommt — Milliarden Seiten Text, Code und mehr. Dabei justiert das Modell Millionen (oder Milliarden) interner Stellgrößen, die „Parameter“, bis es gut darin ist vorherzusagen, was in einem Satz als Nächstes kommt. Das erfordert enorme Rechenleistung und kann Wochen oder Monate dauern.

Stellen Sie es sich so vor: Lernen für die größte Prüfung aller Zeiten. Die KI liest Milliarden Seiten und übt, bis sie Sprache wirklich gut versteht und erzeugt. Ist sie einmal trainiert, muss sie nicht mehr lernen — sie nutzt einfach das Gelernte.
Architektur

Transformer

Die Architektur hinter moderner KI

Der Transformer ist die Architektur neuronaler Netze, auf der fast alle modernen KI-Sprachmodelle beruhen (ChatGPT, Claude, Gemini usw.). 2017 von Google entwickelt, liegt seine zentrale Neuerung in der „Attention“ — der Fähigkeit, alle Wörter eines Satzes gleichzeitig zu betrachten und zu bestimmen, welche füreinander am wichtigsten sind, statt sie eins nach dem anderen zu lesen.

Stellen Sie es sich so vor: Statt ein Buch von Seite 1 bis 500 der Reihe nach zu lesen, sehen Sie alle Seiten auf einmal und markieren die Verbindungen zwischen den Gedanken im ganzen Buch. Genau das leistet Attention.
Hardware

VRAM

Video Random Access Memory (Grafikspeicher)

VRAM ist der Speicher, der direkt auf der GPU sitzt. Ein laufendes KI-Modell muss enorme Datenmengen gleichzeitig im Speicher halten. Je mehr VRAM Ihre GPU hat, desto größer das Modell, das sie ausführen kann. Deshalb sind High-End-GPUs mit 80 GB VRAM oder mehr für KI so wertvoll.

Stellen Sie es sich so vor: Die Größe Ihres Schreibtischs. Auf einem größeren Tisch können Sie mehr Bücher und Notizen gleichzeitig ausbreiten, ohne ständig etwas weglegen und wieder hervorholen zu müssen.

Bereit für mehr Tiefe?

Wollen Sie KI in Aktion erleben?

Entdecken Sie, wie IG1 souveräne KI-Infrastruktur und maßgeschneiderte KI-Lösungen für Unternehmen weltweit baut.

Souveräne KI entdecken Demo buchen