Welche Daten in welchem Training stecken
Was als Trainingsdaten dient, hängt von der Aufgabe ab. Ein Modell zur Spracherkennung lernt aus Audioaufnahmen samt passendem Transkript. Ein Spamfilter lernt aus Mails, die als Spam oder Nicht-Spam markiert sind. Solche Paare aus Eingabe und richtiger Antwort heißen gelabelte Daten.
Große Sprachmodelle werden in mehreren Stufen trainiert. Im Vortraining kommen riesige Textsammlungen zum Einsatz: öffentlich zugängliche Webseiten, Bücher, wissenschaftliche Texte, Programmcode, teils lizenzierte Inhalte. Beim anschließenden Fine-Tuning folgen kleinere, sorgfältig zusammengestellte Datensätze – etwa Beispielgespräche und Bewertungen von Menschen, welche von zwei Antworten besser ist.
Qualität schlägt Menge
Ein Modell kann nur lernen, was in seinen Daten vorkommt. Wurde eine Spracherkennung überwiegend mit Hochdeutsch aus Nachrichtensendungen trainiert, tut sie sich mit Mühlviertler Dialekt oder einem verrauschten Telefonat schwerer. Fehler, Vorurteile und Lücken in den Daten übernimmt ein Modell ungefiltert – im Fachjargon spricht man von Bias.
Deshalb werden Trainingsdaten bereinigt, auf Dubletten geprüft und ausgewogen zusammengestellt. Ein Teil wird außerdem zurückgehalten: Mit Validierungs- und Testdaten, die das Modell beim Lernen nie gesehen hat, prüft man, ob es wirklich verallgemeinern kann oder nur auswendig gelernt hat.
Für die Praxis heißt das: Wenn ein KI-Werkzeug mit bestimmten Inhalten schwächelt – einem Dialekt, einer Fachsprache, sehr leisen Aufnahmen –, liegt das oft daran, dass solche Beispiele im Training selten waren. Helfen können dann ein Wörterbuch für Fachbegriffe, bessere Aufnahmebedingungen oder ein Werkzeug, das für genau diese Sprache optimiert wurde.
Werden meine Eingaben zu Trainingsdaten?
Für Unternehmen ist das die wichtigste Frage rund um Trainingsdaten. Wenn du in ein KI-Tool ein Kundengespräch, einen Vertrag oder interne Zahlen eingibst, nutzt das Modell diese Daten zunächst nur für die eine Antwort. Ob der Anbieter sie zusätzlich speichert und für das Training künftiger Modelle verwendet, ist eine eigene Entscheidung – und sie fällt je nach Anbieter, Produkt und Tarif unterschiedlich aus.
Vor dem Einsatz eines Tools lohnen sich deshalb ein paar konkrete Fragen:
- Werden Eingaben für das Training genutzt – standardmäßig oder nur nach Zustimmung?
- Gibt es eine Möglichkeit, das abzuschalten, und gilt sie für das ganze Team?
- Wie lange werden Eingaben gespeichert, und wo?
- Gibt es einen Auftragsverarbeitungsvertrag, der die Nutzung regelt?
Rechtliche Fragen rund um Trainingsdaten
Enthalten Trainingsdaten personenbezogene Daten, gilt die DSGVO – für das Training braucht es eine Rechtsgrundlage, und Betroffene haben Rechte, die sich bei einem fertig trainierten Modell nur schwer umsetzen lassen. Daneben gibt es offene Fragen zum Urheberrecht, wenn geschützte Werke zum Training verwendet werden; dazu laufen in mehreren Ländern Gerichtsverfahren.
Die europäische KI-Verordnung verpflichtet Anbieter von KI-Modellen mit allgemeinem Verwendungszweck unter anderem, eine Zusammenfassung der für das Training verwendeten Inhalte zu veröffentlichen. Für Anwender:innen im Unternehmen bleibt die praktische Frage meist dieselbe: Was passiert mit den Daten, die wir eingeben?
Rechtsanwältin Leitner möchte ein KI-Tool für Gesprächsnotizen einsetzen. Bevor Mandantengespräche hineinkommen, prüft sie die Datenschutzerklärung und die Vertragsbedingungen des Anbieters.
Ihre Notizen: „Eingaben werden nicht zum Training verwendet – steht so in den Bedingungen. Speicherort EU. Auftragsverarbeitungsvertrag verfügbar. Audio wird nach der Verarbeitung gelöscht.“ Erst danach holt sie das Einverständnis der Mandant:innen ein und startet.
Dieser Eintrag gibt einen allgemeinen Überblick und ersetzt keine Rechtsberatung.