Lexikon · KI & Technik

Was sind Trainingsdaten?

Kurz erklärt

Trainingsdaten sind die Beispiele, aus denen ein KI-Modell lernt – Texte, Bilder, Audioaufnahmen oder Tabellen, oft zusammen mit den richtigen Antworten. Ihre Menge, Qualität und Auswahl bestimmen maßgeblich, was ein Modell kann und welche Fehler es macht.

Auch genannt: Training Data · Trainingsdatensatz

Welche Daten in welchem Training stecken

Was als Trainingsdaten dient, hängt von der Aufgabe ab. Ein Modell zur Spracherkennung lernt aus Audioaufnahmen samt passendem Transkript. Ein Spamfilter lernt aus Mails, die als Spam oder Nicht-Spam markiert sind. Solche Paare aus Eingabe und richtiger Antwort heißen gelabelte Daten.

Große Sprachmodelle werden in mehreren Stufen trainiert. Im Vortraining kommen riesige Textsammlungen zum Einsatz: öffentlich zugängliche Webseiten, Bücher, wissenschaftliche Texte, Programmcode, teils lizenzierte Inhalte. Beim anschließenden Fine-Tuning folgen kleinere, sorgfältig zusammengestellte Datensätze – etwa Beispielgespräche und Bewertungen von Menschen, welche von zwei Antworten besser ist.

Qualität schlägt Menge

Ein Modell kann nur lernen, was in seinen Daten vorkommt. Wurde eine Spracherkennung überwiegend mit Hochdeutsch aus Nachrichtensendungen trainiert, tut sie sich mit Mühlviertler Dialekt oder einem verrauschten Telefonat schwerer. Fehler, Vorurteile und Lücken in den Daten übernimmt ein Modell ungefiltert – im Fachjargon spricht man von Bias.

Deshalb werden Trainingsdaten bereinigt, auf Dubletten geprüft und ausgewogen zusammengestellt. Ein Teil wird außerdem zurückgehalten: Mit Validierungs- und Testdaten, die das Modell beim Lernen nie gesehen hat, prüft man, ob es wirklich verallgemeinern kann oder nur auswendig gelernt hat.

Für die Praxis heißt das: Wenn ein KI-Werkzeug mit bestimmten Inhalten schwächelt – einem Dialekt, einer Fachsprache, sehr leisen Aufnahmen –, liegt das oft daran, dass solche Beispiele im Training selten waren. Helfen können dann ein Wörterbuch für Fachbegriffe, bessere Aufnahmebedingungen oder ein Werkzeug, das für genau diese Sprache optimiert wurde.

Werden meine Eingaben zu Trainingsdaten?

Für Unternehmen ist das die wichtigste Frage rund um Trainingsdaten. Wenn du in ein KI-Tool ein Kundengespräch, einen Vertrag oder interne Zahlen eingibst, nutzt das Modell diese Daten zunächst nur für die eine Antwort. Ob der Anbieter sie zusätzlich speichert und für das Training künftiger Modelle verwendet, ist eine eigene Entscheidung – und sie fällt je nach Anbieter, Produkt und Tarif unterschiedlich aus.

Vor dem Einsatz eines Tools lohnen sich deshalb ein paar konkrete Fragen:

  • Werden Eingaben für das Training genutzt – standardmäßig oder nur nach Zustimmung?
  • Gibt es eine Möglichkeit, das abzuschalten, und gilt sie für das ganze Team?
  • Wie lange werden Eingaben gespeichert, und wo?
  • Gibt es einen Auftragsverarbeitungsvertrag, der die Nutzung regelt?

Rechtliche Fragen rund um Trainingsdaten

Enthalten Trainingsdaten personenbezogene Daten, gilt die DSGVO – für das Training braucht es eine Rechtsgrundlage, und Betroffene haben Rechte, die sich bei einem fertig trainierten Modell nur schwer umsetzen lassen. Daneben gibt es offene Fragen zum Urheberrecht, wenn geschützte Werke zum Training verwendet werden; dazu laufen in mehreren Ländern Gerichtsverfahren.

Die europäische KI-Verordnung verpflichtet Anbieter von KI-Modellen mit allgemeinem Verwendungszweck unter anderem, eine Zusammenfassung der für das Training verwendeten Inhalte zu veröffentlichen. Für Anwender:innen im Unternehmen bleibt die praktische Frage meist dieselbe: Was passiert mit den Daten, die wir eingeben?

Beispiel
Die Tool-Prüfung einer Kanzlei

Rechtsanwältin Leitner möchte ein KI-Tool für Gesprächsnotizen einsetzen. Bevor Mandantengespräche hineinkommen, prüft sie die Datenschutzerklärung und die Vertragsbedingungen des Anbieters.

Ihre Notizen: „Eingaben werden nicht zum Training verwendet – steht so in den Bedingungen. Speicherort EU. Auftragsverarbeitungsvertrag verfügbar. Audio wird nach der Verarbeitung gelöscht.“ Erst danach holt sie das Einverständnis der Mandant:innen ein und startet.

Dieser Eintrag gibt einen allgemeinen Überblick und ersetzt keine Rechtsberatung.

Häufige Fragen
Was sind Trainingsdaten bei KI?

Die Beispiele, aus denen ein Modell lernt – zum Beispiel Texte, Bilder oder Audio, oft mit der jeweils richtigen Antwort dazu.

Werden meine Chats mit KI zum Training verwendet?

Das hängt vom Anbieter und Tarif ab. Manche nutzen Eingaben standardmäßig, andere nur nach Zustimmung oder gar nicht. Die Antwort steht in den Nutzungs- und Datenschutzbedingungen.

Kann eine KI Trainingsdaten wörtlich wiedergeben?

In Einzelfällen ja, besonders bei Texten, die im Training häufig vorkamen. Deshalb ist es heikel, wenn vertrauliche oder personenbezogene Daten im Training landen.

Was ist Bias in Trainingsdaten?

Eine Verzerrung, etwa wenn bestimmte Gruppen, Sprachen oder Dialekte unter- oder überrepräsentiert sind. Das Modell übernimmt diese Schieflage in seine Ergebnisse.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen