Application Programming Interface (Programmierschnittstelle)
Eine API ist ein Weg, über den Softwareanwendungen miteinander sprechen. Wenn ein Unternehmen wie Anthropic oder OpenAI eine API anbietet, können Entwickler Text an das KI-Modell senden und Antworten zurückerhalten — komplett per Code, ohne Chat-Oberfläche. So gelangt KI in Apps, Websites und Produkte.
KI, die eigenständig handeln kann
Ein KI-Agent ist ein System, das eigenständig planen, entscheiden und handeln kann, um ein Ziel zu erreichen — statt nur eine einzelne Frage zu beantworten. Anstatt bei jedem Schritt auf Ihre Anweisung zu warten, zerlegt ein Agent eine komplexe Aufgabe, nutzt Werkzeuge (Websuche, Code schreiben, Dateien lesen) und arbeitet weiter, bis die Aufgabe erledigt ist. Agenten setzen auf großen Sprachmodellen auf und ergänzen sie um Autonomie und Werkzeugnutzung.
Wie KI entscheidet, was wichtig ist
Attention ist der Mechanismus, mit dem ein Transformer-Modell bestimmt, welche Wörter eines Satzes füreinander am wichtigsten sind. Im Satz „Die Katze saß auf der Matte, weil sie müde war“ hilft Attention dem Modell zu verstehen, dass sich „sie“ auf die Katze bezieht und nicht auf die Matte. Diese Fähigkeit, weit entfernte Wörter zu verknüpfen, macht Transformer so leistungsfähig.
Wie viel die KI auf einmal „sehen“ kann
Das Kontextfenster ist die Gesamtmenge an Text, die ein KI-Modell während eines Gesprächs berücksichtigen kann. Dazu zählt alles — Ihre Frage, geteilte Dokumente und die Antwort der KI selbst. Wird das Gespräch zu lang, beginnt das Modell, den Anfang zu „vergessen“.
Central Processing Unit (Hauptprozessor)
Die CPU ist das Hauptgehirn jedes Computers. Sie erledigt allgemeine Aufgaben: Programme ausführen, im Web surfen, das Betriebssystem verwalten. Sie ist hervorragend darin, viele verschiedene Dinge nacheinander sehr schnell zu erledigen.
Wörter in Zahlen verwandeln
Ein Embedding stellt ein Wort, einen Satz oder ein Dokument als Zahlenliste (einen „Vektor“) dar, die dessen Bedeutung erfasst. Wörter mit ähnlicher Bedeutung erhalten ähnliche Zahlen. So versteht eine KI, dass „Hund“ und „Welpe“ zusammengehören oder dass sich „Paris“ zu „Frankreich“ verhält wie „Tokio“ zu „Japan“.
Ein vortrainiertes Modell spezialisieren
Beim Fine-Tuning erhält ein bereits auf allgemeinen Daten trainiertes KI-Modell zusätzliches Training zu einem bestimmten Thema oder einer Aufgabe. So lässt sich etwa ein allgemeines Sprachmodell auf medizinische Texte nachtrainieren, damit es Gesundheitsfragen deutlich besser beantwortet. Das ist schneller und günstiger als ein Training von Grund auf.
Das größte, leistungsfähigste Modell einer Familie
Ein Frontier-Modell ist die größte und leistungsfähigste Variante einer KI-Modellfamilie — die mit den meisten Parametern. Qwen3.5-397B etwa ist das Frontier-Modell der Familie Qwen 3.5, mit 397 Milliarden Parametern. Anders als kleinere Varianten (7B, 32B, 72B), die für einfache Aufgaben oft ausreichen, glänzt das Frontier-Modell bei komplexer Arbeit: mehrstufiges Reasoning, Analyse langer Dokumente, Codegenerierung über mehrere Dateien. Die meisten API-Anbieter führen das Frontier-Modell nicht, weil es weit mehr GPUs erfordert — IG1 AI bündelt diese Infrastruktur und macht es für Sie zugänglich.
Graphics Processing Unit (Grafikprozessor)
Eine GPU wurde ursprünglich für die Grafikberechnung in Videospielen gebaut — sie eignet sich aber auch hervorragend für KI. Anders als eine CPU, die Aufgaben nacheinander abarbeitet, kann eine GPU Tausende kleiner Berechnungen gleichzeitig ausführen. Genau das brauchen KI-Modelle.
Sicherheitsgrenzen für das Verhalten der KI
Leitplanken sind die Regeln und Beschränkungen in KI-Systemen, die verhindern sollen, dass schädliche, gefährliche oder unangemessene Inhalte entstehen. Sie werden während und nach dem Training gesetzt, damit die KI bei illegalen Aktivitäten nicht hilft, keine Hassrede erzeugt und hilfreich und ehrlich bleibt.
Wenn KI sich etwas ausdenkt
Eine Halluzination liegt vor, wenn ein KI-Modell überzeugt Informationen erzeugt, die richtig klingen, tatsächlich aber falsch oder erfunden sind. Der Grund: Das Modell sagt anhand von Mustern voraus, was „richtig klingt“ — es „weiß“ keine Fakten. So entstehen erfundene Studien, ausgedachte Statistiken oder nicht existierende Personen.
Wenn die KI Ihnen tatsächlich antwortet
Inferenz ist das, was jedes Mal passiert, wenn Sie einer KI eine Frage stellen und sie antwortet. Das Modell nutzt alles, was es im Training gelernt hat, um die beste Antwort vorherzusagen — Token für Token. Deshalb erscheinen KI-Antworten oft Wort für Wort: Das Modell erzeugt jedes Stück wirklich nacheinander.
Wie schnell die KI antwortet
Latenz ist die Verzögerung zwischen dem Absenden Ihrer Anfrage und dem Eintreffen der ersten Antwort. Weniger Latenz = schnellere Antwort. Sie hängt von der Modellgröße ab, von der Hardware, von der Entfernung zum Server und davon, wie viele Menschen gleichzeitig zugreifen.
Large Language Model (großes Sprachmodell)
Ein LLM ist ein sehr großes KI-Modell (meist auf Transformer-Basis), das mit enormen Textmengen trainiert wurde, um menschliche Sprache zu verstehen und zu erzeugen. „Groß“ bezieht sich sowohl auf die Menge der Trainingsdaten als auch auf die Zahl der Parameter. Modelle wie Claude, GPT-4 und Llama sind allesamt LLMs.
Model Context Protocol
MCP ist ein offener Standard (von Anthropic entwickelt), über den KI-Modelle einheitlich mit externen Werkzeugen und Datenquellen verbunden werden. Statt für jedes Werkzeug (Google Drive, Slack, eine Datenbank usw.) eine eigene Integration zu bauen, bietet MCP einen einheitlichen „Stecker“, der überall passt. Jede KI mit MCP-Unterstützung kann mit jedem Werkzeug mit MCP-Unterstützung sprechen — ohne jedes Mal eigenen Code.
Das gelernte Wissen der KI als Datei
Gewichte sind die konkreten Zahlen, aus denen ein trainiertes KI-Modell besteht — das Ergebnis des gesamten Trainings. Wenn Sie „ein Modell herunterladen“, laden Sie dessen Gewichte herunter. Diese Dateien können riesig sein (Dutzende oder Hunderte Gigabyte) und enthalten alles, was das Modell gelernt hat.
Die Struktur, die KI „denken“ lässt
Ein neuronales Netz ist ein mathematisches System nach dem Vorbild des menschlichen Gehirns. Es besteht aus Schichten verbundener „Neuronen“ (kleiner mathematischer Funktionen), die Informationen weiterreichen. Daten gehen auf der einen Seite hinein, werden durch viele Schichten verarbeitet, und auf der anderen Seite kommt ein Ergebnis heraus. Jede moderne KI — Bilderkennung, Sprachmodelle, selbstfahrende Autos — beruht auf neuronalen Netzen.
Ein KI-Agent, der Ihren Computer steuert
OpenClaw (auch Claw genannt) ist ein kostenloser Open-Source-KI-Assistent, der auf Ihrem Computer läuft, Ihren Bildschirm tatsächlich sieht, Ihre Programme bedient und echte Arbeit für Sie erledigt. Anders als ein Chatbot, der nur Fragen beantwortet, ist OpenClaw ein autonomer Agent — er klickt Schaltflächen, füllt Formulare aus, surft im Web, schreibt Code, verschickt Nachrichten und automatisiert ganze Arbeitsabläufe über mehrere Anwendungen hinweg. Es ist eines der am schnellsten wachsenden Open-Source-Projekte überhaupt, mit über 80.000 GitHub-Sternen.
Wer den Code sehen darf
Ein Open-Source-KI-Modell (wie Llama von Meta oder Mistral) stellt Code und Gewichte öffentlich bereit — jeder kann es herunterladen, verändern und betreiben. Ein Closed-Source-Modell (wie GPT-4 oder Claude) bleibt geschlossen — nutzbar nur über die API oder App des Anbieters. Open Source gibt Ihnen mehr Kontrolle und Datenschutz; Closed Source bedeutet oft mehr Leistung und einfachere Einrichtung.
Wenn ein Modell sein Gehirn teilt, aber nicht sein Rezept
Offene Gewichte bedeutet: Ein Unternehmen veröffentlicht die trainierten Modellgewichte (das Endergebnis des Trainings), sodass jeder das Modell herunterladen und betreiben kann — gibt aber weder den Trainingscode noch die Trainingsdaten oder den vollständigen Entstehungsprozess frei. Das unterscheidet sich von echtem Open Source, bei dem alles geteilt wird. Modelle wie Llama von Meta und Mistral haben offene Gewichte: frei nutzbar, aber nicht vollständig reproduzierbar.
Die internen Wissensregler der KI
Parameter sind die Zahlen im Inneren eines KI-Modells, die während des Trainings justiert werden. Ein Modell wie GPT-4 hat Hunderte Milliarden davon. Mehr Parameter bedeuten in der Regel, dass das Modell komplexere Muster lernen und bessere Antworten geben kann — es braucht dafür aber auch mehr Rechenleistung. Ein Frontier-Modell wie Qwen3.5-397B (397 Milliarden Parameter) übertrifft seine kleineren Varianten (7B, 32B) bei komplexem Reasoning und der Analyse langer Dokumente deutlich.
Was Sie der KI sagen
Ein Prompt ist der Text, mit dem Sie der KI sagen, was Sie wollen. Das kann eine Frage sein, eine Anweisung oder auch ein ganzes Dokument, mit dem die KI arbeiten soll. Je besser und klarer Ihr Prompt, desto besser die Antwort — deshalb ist „Prompt Engineering“ zu einer wichtigen Fähigkeit geworden.
KI-Modelle kleiner und schneller machen
Quantisierung verkleinert ein KI-Modell, indem die Genauigkeit seiner Zahlen reduziert wird. Statt jeden Parameter als sehr präzise 32- oder 16-Bit-Zahl zu speichern, rundet man auf 8 Bit oder sogar 4 Bit. Das Modell wird deutlich kleiner (2- bis 8-fach) und läuft schneller, bei nur geringem Qualitätsverlust. Erst dadurch lassen sich leistungsfähige KI-Modelle auf einem Laptop oder Smartphone betreiben statt auf einem großen Server.
Retrieval-Augmented Generation
RAG ist ein Verfahren, bei dem die KI zunächst eine Dokumentendatenbank nach relevanten Informationen durchsucht und diese dann für eine präzisere Antwort nutzt. Statt sich nur auf im Training Gelerntes zu stützen, kann die KI auf echte, aktuelle Quellen verweisen. Das reduziert Halluzinationen drastisch.
KI, die Ihnen gehört und die Sie kontrollieren
Souveräne KI bedeutet, KI-Infrastruktur auf eigenen Servern oder im eigenen Rechenzentrum zu betreiben, statt sich auf die Cloud eines großen Tech-Konzerns zu verlassen. So verlassen Ihre Daten nie Ihre Kontrolle, Sie sind von keiner fremden Plattform abhängig und erfüllen lokale Vorschriften. Besonders wichtig ist das für Behörden, Banken und das Gesundheitswesen.
Wie kreativ oder wie vorhersehbar die KI ist
Temperature ist ein Regler (meist zwischen 0 und 1), der steuert, wie „zufällig“ die Antworten der KI ausfallen. Ein niedriger Wert (etwa 0,1) macht das Modell sehr vorhersehbar und sachlich — es wählt jedes Mal das wahrscheinlichste nächste Wort. Ein hoher Wert (etwa 0,9) macht es kreativer und überraschender, aber auch fehleranfälliger.
Der Baustein von KI-Text
Ein Token ist ein kleiner Textbaustein, den ein KI-Modell liest und erzeugt. Das kann ein ganzes Wort sein wie „hallo“, ein Wortteil wie „un“ + „glaub“ + „lich“ oder auch ein einzelnes Zeichen. Wenn es heißt, ein Modell verarbeite „128K Tokens“, bedeutet das: Es kann rund 100.000 Wörter Text auf einmal lesen und behalten. Tokens sind auch die Abrechnungseinheit: Sie zahlen pro gesendetem Token (Input) und pro erzeugtem Token (Output). Je länger Ihre Frage und je länger die Antwort, desto höher die Kosten.
Tensor Processing Unit
Eine TPU ist ein von Google speziell für KI-Workloads entwickelter Chip. Während GPUs universelle Parallelprozessoren sind, die für KI umgewidmet wurden, sind TPUs von Grund auf für eine Sache gebaut: die Tensor-Mathematik hinter neuronalen Netzen. Sie stecken in Googles Rechenzentren und trainieren und betreiben Modelle wie Gemini. Kaufen kann man eine TPU nicht — man mietet den Zugang über Google Cloud.
Wie eine KI lernt
Training ist der Prozess, bei dem ein KI-Modell riesige Datenmengen zu sehen bekommt — Milliarden Seiten Text, Code und mehr. Dabei justiert das Modell Millionen (oder Milliarden) interner Stellgrößen, die „Parameter“, bis es gut darin ist vorherzusagen, was in einem Satz als Nächstes kommt. Das erfordert enorme Rechenleistung und kann Wochen oder Monate dauern.
Die Architektur hinter moderner KI
Der Transformer ist die Architektur neuronaler Netze, auf der fast alle modernen KI-Sprachmodelle beruhen (ChatGPT, Claude, Gemini usw.). 2017 von Google entwickelt, liegt seine zentrale Neuerung in der „Attention“ — der Fähigkeit, alle Wörter eines Satzes gleichzeitig zu betrachten und zu bestimmen, welche füreinander am wichtigsten sind, statt sie eins nach dem anderen zu lesen.
Video Random Access Memory (Grafikspeicher)
VRAM ist der Speicher, der direkt auf der GPU sitzt. Ein laufendes KI-Modell muss enorme Datenmengen gleichzeitig im Speicher halten. Je mehr VRAM Ihre GPU hat, desto größer das Modell, das sie ausführen kann. Deshalb sind High-End-GPUs mit 80 GB VRAM oder mehr für KI so wertvoll.
Entdecken Sie, wie IG1 souveräne KI-Infrastruktur und maßgeschneiderte KI-Lösungen für Unternehmen weltweit baut.