Drei Schritte: Aufnahme, Transkript, Zusammenfassung
Jeder KI-Notetaker erledigt im Kern dieselbe Kette. Zuerst wird der Ton erfasst – das eigene Mikrofon und die Stimmen der anderen. Dann macht eine Spracherkennung daraus ein Transkript, im besten Fall mit Sprechererkennung und Zeitstempeln. Zuletzt liest ein Large Language Model das Transkript und schreibt eine Zusammenfassung: Kernpunkte, Entscheidungen, offene Fragen, Action Items.
Die Qualität des Ergebnisses hängt an jedem Glied dieser Kette. Ein verrauschter Ton führt zu Erkennungsfehlern, ein fehlerhaftes Transkript zu einer schiefen Zusammenfassung. Deshalb lohnt sich bei der Auswahl der Blick auf alle drei Schritte, nicht nur auf die hübsche Zusammenfassung am Ende.
Manche Werkzeuge liefern das Transkript schon während des Gesprächs (Echtzeit-Transkription), andere erst einige Minuten danach. Für das Protokoll macht das selten einen Unterschied; wer aber während des Calls nachlesen will, was gerade gesagt wurde, braucht die Live-Variante.
Die gängigen Bauarten
Wie der Ton zum Notetaker kommt, unterscheidet die Werkzeuge am deutlichsten:
| Bauart | So funktioniert es | Gut zu wissen |
|---|---|---|
| Meeting-Bot | ein virtueller Teilnehmer tritt dem Call bei | für alle sichtbar, braucht keinen eigenen Rechner |
| Desktop-App | nimmt Mikrofon und Systemton am eigenen Rechner auf | kein zusätzlicher Teilnehmer, braucht Installation |
| Browser-Lösung | Aufnahme über einen geteilten Tab oder eine Erweiterung | ohne Installation, abhängig vom Browser |
| In die Plattform eingebaut | Funktion von Teams, Zoom oder Meet selbst | nur innerhalb dieser Plattform, oft lizenzabhängig |
| Hardware | eigenes Aufnahmegerät, oft für Gespräche vor Ort | unabhängig vom Computer, ein Gerät mehr |
Mehr zur ersten Bauart steht unter Meeting-Bot, zur zweiten unter Desktop-App.
Was ein KI-Notetaker nicht kann
Ein Notetaker hört nur, was gesagt wird. Was auf dem geteilten Bildschirm stand, was jemand im Chat geschrieben hat oder was zwischen den Zeilen mitschwang, fehlt in der Regel. Auch Zusagen, die nur durch Nicken entstehen, kennt er nicht.
Die Zusammenfassung ist außerdem eine Interpretation. Das Sprachmodell entscheidet, was wichtig war – und kann dabei danebenliegen, Namen vertauschen oder eine vage Idee als Beschluss lesen. Wer das Ergebnis weiterschickt, sollte es vorher kurz gegenlesen, besonders Zahlen, Fristen und Zuständigkeiten.
Auch Zusammenhänge über mehrere Gespräche hinweg erkennt ein Notetaker nur, wenn er frühere Meetings überhaupt einbeziehen kann – viele Werkzeuge betrachten jedes Gespräch für sich.
Worauf es bei der Auswahl ankommt
Neben dem Preis sind vor allem diese Fragen entscheidend:
- Sprache: Wie gut wird Deutsch erkannt, auch mit Dialekt und Fachbegriffen? Viele Werkzeuge sind auf Englisch optimiert.
- Datenverarbeitung: Wo werden Ton, Transkript und Zusammenfassung verarbeitet und gespeichert, und wie lange? Gibt es einen Auftragsverarbeitungsvertrag?
- Aufnahmeweg: Passt ein sichtbarer Bot zu deinen Gesprächen, oder brauchst du eine Lösung ohne zusätzlichen Teilnehmer?
- Weiterverwendung: Lassen sich Ergebnisse durchsuchen, nach Kunden ordnen und in deine Arbeitswerkzeuge übernehmen?
Unabhängig vom Werkzeug gilt: Wer aufnimmt, informiert alle Beteiligten vorher und holt ihr Einverständnis ein.
Maria Gruber führt ein 40-minütiges Abstimmungsgespräch mit einem Lieferanten. Der Notetaker liefert danach:
Kernpunkte: Lieferung der Ersatzteile verschiebt sich um eine Woche; Preis bleibt wie angeboten.
Entscheidung: Teillieferung der dringendsten Positionen bis Freitag.
Aufgaben: Liste der dringenden Positionen schicken – Gruber – morgen · Teillieferung bestätigen – Lieferant – Mittwoch.
Beim Gegenlesen fällt Maria auf, dass ein Artikelname falsch erkannt wurde; sie korrigiert ihn, bevor sie die Zusammenfassung weiterleitet.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.