Etiquetas de hablante y diarización

Cómo funciona la detección de hablantes y qué afecta la precisión.

Local Transcriber usa diarización de hablantes en el dispositivo para etiquetar quién dijo qué en tus transcripciones. No hay procesamiento en la nube — el modelo se ejecuta completamente en tu Mac.

Cómo funciona

Durante una grabación, la app captura audio y ejecuta dos modelos:

  1. Reconocimiento de voz — convierte audio a texto en tiempo real usando el motor de voz en el dispositivo de Apple.
  2. Diarización de hablantes — analiza las características de la voz para asignar etiquetas de hablante (Hablante 1, Hablante 2, etc.).

La transcripción en vivo muestra el texto mientras se habla. Después de detener la grabación, el post-procesamiento re-analiza el audio completo para una asignación de hablantes más precisa y texto mejorado.

Qué afecta la precisión

La diarización de hablantes funciona mejor cuando:

  • Los hablantes se turnan. El modelo tiene dificultades con conversaciones superpuestas o personas hablando al mismo tiempo.
  • La calidad del audio es buena. Una habitación silenciosa con un micrófono decente ayuda. Los micrófonos integrados del portátil funcionan, pero los micrófonos externos o auriculares con micrófono son mejores.
  • Los hablantes tienen voces distintas. El modelo usa características de la voz (tono, cadencia, timbre) para distinguir hablantes. Voces muy similares pueden agruparse juntas.
  • Las sesiones no son extremadamente largas. La precisión es consistente para la mayoría de las duraciones de reuniones, pero grabaciones muy largas (más de 3 horas) pueden experimentar cierta desviación.

Consejos para mejores resultados

  • Usa auriculares o un auricular con micrófono. Esto evita que el audio del hablante se filtre en tu micrófono, lo que ayuda al modelo de diarización a separar las voces de forma más limpia.
  • Silencia cuando no estés hablando. Si estás en un entorno ruidoso, silenciar tu micrófono entre turnos reduce el ruido de fondo en la grabación.
  • Deja que la gente termine. El habla superpuesta es el caso más difícil para la diarización. Los turnos naturales producen los mejores resultados.

Post-procesamiento

Cuando detienes una grabación, la app ejecuta el post-procesamiento automáticamente. Esto toma unos segundos (aproximadamente 15 segundos para una reunión de 30 minutos) y:

  • Re-ejecuta el audio completo a través de un modelo de transcripción de mayor precisión.
  • Re-analiza las asignaciones de hablantes en toda la grabación para consistencia.
  • Genera un título y resumen con IA (si Apple Intelligence está disponible).

Verás un indicador de “Procesando” en la barra lateral mientras se ejecuta. La transcripción se actualiza en el mismo lugar cuando termina.

Reprocesamiento

Si las etiquetas de hablante no se ven bien, puedes reprocesar una grabación:

  • Desde la app — haz clic derecho en una grabación y selecciona Reprocesar, o usa el esquema de URL:
    open "transcriber://reprocess?file=2026-04-03-1400"
  • Desde el CLI — tu agente de IA también puede activar el reprocesamiento.

El reprocesamiento vuelve a ejecutar todo el pipeline de post-procesamiento sobre el archivo de audio original.

Try it yourself.

Download Local Transcriber, join a call, and see the transcript appear in real time. No account needed.

Download Now

14-day free trial · $20 one-time · macOS Sonoma 14.2+ · Apple Silicon native