Lexikon · KI & Technik

Was ist Inferenz bei KI?

Kurz erklärt

Inferenz bezeichnet in der KI die Anwendung eines fertig trainierten Modells auf neue Eingaben – also den Moment, in dem das Modell tatsächlich eine Antwort, Vorhersage oder ein Transkript erzeugt. Das Gegenstück ist das Training, in dem das Modell lernt.

Auch genannt: Inference · Modellausführung

Training und Inferenz: zwei getrennte Phasen

Jedes KI-Modell durchläuft zwei Phasen, die sich in fast allem unterscheiden:

TrainingInferenz
ZweckModell lernt Muster aus DatenModell wendet Gelerntes auf neue Eingaben an
Wie ofteinmalig oder in größeren Abständenbei jeder einzelnen Anfrage
Aufwandsehr hoch, über Tage bis Monatepro Anfrage gering, in Summe erheblich
Ändert sich das Modell?ja, die Gewichte werden angepasstnein, die Gewichte bleiben gleich

Wenn du einem Chat-Assistenten eine Frage stellst, eine Sprachnachricht in Text umwandeln lässt oder dein Handy ein Gesicht auf einem Foto erkennt, ist das immer Inferenz. Das Modell lernt dabei nichts dazu – deine Eingabe verändert es nicht.

Was bei einer Inferenz passiert

Die Eingabe wird zuerst in Zahlen übersetzt – bei Text in Tokens, bei Audio in kurze Klangabschnitte. Diese Zahlen durchlaufen die Schichten des Modells, und am Ende steht ein Ergebnis: eine Kategorie, ein Wort, ein Stück Transkript.

Bei Sprachmodellen passiert das nicht einmal, sondern für jedes erzeugte Token aufs Neue: Das Modell berechnet das nächste Token, hängt es an und rechnet erneut. Deshalb erscheinen Antworten im Chat Wort für Wort, und eine lange Antwort dauert spürbar länger als eine kurze. Wie viel Zufall bei der Auswahl mitspielt, regelt die Temperatur.

Wo die Inferenz läuft

Für große Modelle braucht die Inferenz spezialisierte Grafikprozessoren in Rechenzentren. Die meisten KI-Dienste laufen deshalb in der Cloud: Deine Eingabe wird an den Anbieter geschickt, dort verarbeitet, und das Ergebnis kommt zurück. Kleinere Modelle lassen sich auch auf dem eigenen Rechner oder Server betreiben – das nennt man lokale KI.

Für den Datenschutz ist das eine zentrale Frage. Bei Cloud-Inferenz verlassen die Daten dein Gerät, und es kommt darauf an, in welchem Land das Rechenzentrum steht, wie lange Eingaben gespeichert werden und ob der Anbieter sie für späteres Training nutzt. Bei lokaler Inferenz bleiben die Daten bei dir, dafür sind die Modelle meist kleiner und die Hardware muss mitspielen.

Kosten und Geschwindigkeit

Weil Inferenz bei jeder Anfrage anfällt, macht sie bei viel genutzten Diensten den Großteil der laufenden Kosten aus. Anbieter von Programmierschnittstellen rechnen deshalb nach verarbeiteten Tokens ab. Kleinere Modelle sind schneller und günstiger, größere meist besser bei schwierigen Aufgaben – die Wahl ist ein Abwägen.

Bei der Geschwindigkeit zählen zwei Werte: wie lange es bis zum ersten Wort dauert und wie schnell danach der Rest kommt. Für Echtzeitanwendungen wie Live-Untertitel ist vor allem die Latenz entscheidend.

Inferenz im anderen Sinn

Außerhalb der KI-Technik hat das Wort eine ältere Bedeutung: In Logik und Statistik meint Inferenz das Schlussfolgern aus Prämissen oder aus Stichproben auf eine Gesamtheit – etwa in der „statistischen Inferenz“. Mit der Ausführung eines KI-Modells hat das nur entfernt zu tun.

Beispiel
Zwei Inferenzen nach einem Kundencall

Nach einem Call mit Mandantin Gruber laufen zwei Modelle nacheinander: Zuerst wandelt ein Spracherkennungsmodell das Audio in ein Transkript um. Dann fasst ein Sprachmodell dieses Transkript zusammen und listet die Aufgaben.

Beide Male ist es Inferenz: Die Modelle wenden an, was sie gelernt haben. Keines der beiden lernt aus dem Gespräch mit Frau Gruber etwas dazu. Ob der Anbieter die Daten später für Training verwenden darf, ist eine eigene Frage, die in seinen Bedingungen geregelt ist.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was ist der Unterschied zwischen Training und Inferenz?

Im Training lernt ein Modell aus Daten und verändert sich dabei. Bei der Inferenz wird das fertige Modell nur angewendet, ohne sich zu verändern.

Lernt eine KI aus meinen Anfragen?

Nicht während der Inferenz. Ob Anfragen später für ein neues Training gespeichert und genutzt werden, entscheidet der Anbieter – das steht in seinen Bedingungen.

Kann Inferenz auch auf meinem eigenen Computer laufen?

Ja, mit kleineren Modellen, die für lokalen Betrieb gedacht sind. Große Modelle brauchen dafür meist zu viel Rechenleistung und Speicher.

Warum ist Inferenz teuer?

Weil sie bei jeder Anfrage spezialisierte Hardware beansprucht. Bei Millionen von Anfragen summiert sich das zu erheblichen Rechenkosten.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen