Sprechermarkierungen und Diarisierung

Wie die Sprechererkennung funktioniert und was die Genauigkeit beeinflusst.

Local Transcriber nutzt gerätebasierte Sprecherdiarisierung, um in deinen Transkripten zu markieren, wer was gesagt hat. Keine Cloud-Verarbeitung — das Modell läuft vollständig auf deinem Mac.

So funktioniert es

Während einer Aufnahme erfasst die App Audio und führt zwei Modelle aus:

  1. Spracherkennung — wandelt Audio in Echtzeit in Text um, mit Apples gerätebasierter Sprach-Engine.
  2. Sprecherdiarisierung — analysiert Stimmmerkmale, um Sprechermarkierungen zuzuweisen (Sprecher 1, Sprecher 2 usw.).

Die Live-Transkription zeigt den Text, während gesprochen wird. Nach dem Stoppen der Aufnahme re-analysiert die Nachbearbeitung das gesamte Audio für genauere Sprecherzuordnung und verbesserten Text.

Was die Genauigkeit beeinflusst

Die Sprecherdiarisierung funktioniert am besten, wenn:

  • Sprecher sich abwechseln. Das Modell hat Schwierigkeiten mit überlappenden Gesprächen oder gleichzeitigem Sprechen.
  • Die Audioqualität gut ist. Ein ruhiger Raum mit einem ordentlichen Mikrofon hilft. Eingebaute Laptop-Mikrofone funktionieren, aber externe Mikrofone oder Headsets sind besser.
  • Sprecher unterschiedliche Stimmen haben. Das Modell nutzt Stimmmerkmale (Tonhöhe, Kadenz, Klangfarbe), um Sprecher zu unterscheiden. Sehr ähnliche Stimmen können zusammengruppiert werden.
  • Sitzungen nicht extrem lang sind. Die Genauigkeit ist für die meisten Meeting-Längen konsistent, aber sehr lange Aufnahmen (über 3 Stunden) können eine gewisse Drift aufweisen.

Tipps für bessere Ergebnisse

  • Nutze Kopfhörer oder ein Headset. Das verhindert, dass Lautsprecher-Audio in dein Mikrofon gelangt, was dem Diarisierungsmodell hilft, die Stimmen sauberer zu trennen.
  • Stumm schalten, wenn du nicht sprichst. In lauten Umgebungen reduziert das Stummschalten deines Mikrofons zwischen den Sprecherwechseln die Hintergrundgeräusche in der Aufnahme.
  • Lass Leute ausreden. Überlappende Sprache ist der schwierigste Fall für die Diarisierung. Natürliche Sprecherwechsel liefern die besten Ergebnisse.

Nachbearbeitung

Wenn du eine Aufnahme stoppst, führt die App automatisch die Nachbearbeitung durch. Diese dauert einige Sekunden (ca. 15 Sekunden für ein 30-Minuten-Meeting) und:

  • Führt das gesamte Audio erneut durch ein Transkriptionsmodell mit höherer Genauigkeit.
  • Re-analysiert die Sprecherzuordnungen über die gesamte Aufnahme für Konsistenz.
  • Generiert einen Titel und eine Zusammenfassung mit KI (falls Apple Intelligence verfügbar ist).

Du siehst einen „Verarbeitung”-Indikator in der Seitenleiste, während der Vorgang läuft. Die Transkription wird an Ort und Stelle aktualisiert, wenn er abgeschlossen ist.

Erneute Verarbeitung

Wenn die Sprechermarkierungen nicht stimmen, kannst du eine Aufnahme erneut verarbeiten:

  • Aus der App — klicke mit der rechten Maustaste auf eine Aufnahme und wähle Erneut verarbeiten, oder nutze das URL-Schema:
    open "transcriber://reprocess?file=2026-04-03-1400"
  • Über das CLI — dein KI-Agent kann die erneute Verarbeitung ebenfalls auslösen.

Die erneute Verarbeitung führt die gesamte Nachbearbeitungs-Pipeline erneut auf der Original-Audiodatei aus.

Try it yourself.

Download Local Transcriber, join a call, and see the transcript appear in real time. No account needed.

Download Now

14-day free trial · $20 one-time · macOS Sonoma 14.2+ · Apple Silicon native