Training und Inferenz: zwei getrennte Phasen
Jedes KI-Modell durchläuft zwei Phasen, die sich in fast allem unterscheiden:
| Training | Inferenz | |
|---|---|---|
| Zweck | Modell lernt Muster aus Daten | Modell wendet Gelerntes auf neue Eingaben an |
| Wie oft | einmalig oder in größeren Abständen | bei jeder einzelnen Anfrage |
| Aufwand | sehr hoch, über Tage bis Monate | pro Anfrage gering, in Summe erheblich |
| Ändert sich das Modell? | ja, die Gewichte werden angepasst | nein, die Gewichte bleiben gleich |
Wenn du einem Chat-Assistenten eine Frage stellst, eine Sprachnachricht in Text umwandeln lässt oder dein Handy ein Gesicht auf einem Foto erkennt, ist das immer Inferenz. Das Modell lernt dabei nichts dazu – deine Eingabe verändert es nicht.
Was bei einer Inferenz passiert
Die Eingabe wird zuerst in Zahlen übersetzt – bei Text in Tokens, bei Audio in kurze Klangabschnitte. Diese Zahlen durchlaufen die Schichten des Modells, und am Ende steht ein Ergebnis: eine Kategorie, ein Wort, ein Stück Transkript.
Bei Sprachmodellen passiert das nicht einmal, sondern für jedes erzeugte Token aufs Neue: Das Modell berechnet das nächste Token, hängt es an und rechnet erneut. Deshalb erscheinen Antworten im Chat Wort für Wort, und eine lange Antwort dauert spürbar länger als eine kurze. Wie viel Zufall bei der Auswahl mitspielt, regelt die Temperatur.
Wo die Inferenz läuft
Für große Modelle braucht die Inferenz spezialisierte Grafikprozessoren in Rechenzentren. Die meisten KI-Dienste laufen deshalb in der Cloud: Deine Eingabe wird an den Anbieter geschickt, dort verarbeitet, und das Ergebnis kommt zurück. Kleinere Modelle lassen sich auch auf dem eigenen Rechner oder Server betreiben – das nennt man lokale KI.
Für den Datenschutz ist das eine zentrale Frage. Bei Cloud-Inferenz verlassen die Daten dein Gerät, und es kommt darauf an, in welchem Land das Rechenzentrum steht, wie lange Eingaben gespeichert werden und ob der Anbieter sie für späteres Training nutzt. Bei lokaler Inferenz bleiben die Daten bei dir, dafür sind die Modelle meist kleiner und die Hardware muss mitspielen.
Kosten und Geschwindigkeit
Weil Inferenz bei jeder Anfrage anfällt, macht sie bei viel genutzten Diensten den Großteil der laufenden Kosten aus. Anbieter von Programmierschnittstellen rechnen deshalb nach verarbeiteten Tokens ab. Kleinere Modelle sind schneller und günstiger, größere meist besser bei schwierigen Aufgaben – die Wahl ist ein Abwägen.
Bei der Geschwindigkeit zählen zwei Werte: wie lange es bis zum ersten Wort dauert und wie schnell danach der Rest kommt. Für Echtzeitanwendungen wie Live-Untertitel ist vor allem die Latenz entscheidend.
Inferenz im anderen Sinn
Außerhalb der KI-Technik hat das Wort eine ältere Bedeutung: In Logik und Statistik meint Inferenz das Schlussfolgern aus Prämissen oder aus Stichproben auf eine Gesamtheit – etwa in der „statistischen Inferenz“. Mit der Ausführung eines KI-Modells hat das nur entfernt zu tun.
Nach einem Call mit Mandantin Gruber laufen zwei Modelle nacheinander: Zuerst wandelt ein Spracherkennungsmodell das Audio in ein Transkript um. Dann fasst ein Sprachmodell dieses Transkript zusammen und listet die Aufgaben.
Beide Male ist es Inferenz: Die Modelle wenden an, was sie gelernt haben. Keines der beiden lernt aus dem Gespräch mit Frau Gruber etwas dazu. Ob der Anbieter die Daten später für Training verwenden darf, ist eine eigene Frage, die in seinen Bedingungen geregelt ist.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.