Voz a texto

Convierte voz a texto gratis, tantas veces como quieras. Elige un archivo de audio o graba con el micrófono y genera una transcripción y subtítulos localmente.

Soltar aquí un archivo de audio o pulsar para seleccionar

Tu audio se procesa en este navegador y no se sube a un servidor.

El modo Estándar es más rápido y usa menos memoria. El modo Mejorado puede mejorar el reconocimiento, pero requiere una descarga mayor, más memoria y más tiempo.

La detección automática está activada de forma predeterminada. Selecciona un idioma si la detección es incorrecta.

Los números de hablantes son estimaciones; revísalos.

Usa esta herramienta de audio a texto para transcribir notas de voz, entrevistas, clases y reuniones grabadas. La primera ejecución descarga los modelos necesarios; las siguientes pueden reutilizar la caché del navegador cuando esté disponible. La velocidad de procesamiento depende de tu dispositivo. Revisa el texto, los tiempos y las posibles etiquetas de hablantes antes de compartir el resultado.

Preguntas frecuentes sobre voz a texto

¿Se sube mi audio a un servidor?

No. La decodificación y la transcripción se ejecutan en tu navegador y la grabación no se sube a un servidor. Se necesita conexión para descargar los modelos y recursos que aún no estén en caché.

¿Qué idioma debo seleccionar?

La detección automática identifica el idioma a partir de la voz al principio de la grabación. También puedes seleccionarlo manualmente. Hay muchos idiomas disponibles, pero la precisión varía según el idioma, el acento, el ruido y la calidad de la grabación. Las grabaciones con varios idiomas o voces simultáneas requieren una revisión cuidadosa.

¿En qué se diferencian Estándar y Mejorado, y cuál debería elegir?

El modo Mejorado está seleccionado por defecto. Puede mejorar el reconocimiento, pero requiere una primera descarga mayor, más memoria y normalmente más tiempo de procesamiento. Elige Mejorado si priorizas la calidad del reconocimiento. El modo Estándar es más rápido y usa menos memoria, por lo que conviene para grabaciones largas o dispositivos con recursos limitados.

¿Puedo etiquetar a los distintos hablantes?

Las etiquetas de hablantes son opcionales y están desactivadas por defecto. Estiman quién habló y pueden ser incorrectas, sobre todo en intervenciones breves o voces simultáneas.

Herramientas relacionadas: Reductor de ruido de audio con IA · Divisor de audio · Editor de subtítulos · Ajustar tiempos SRT · Ajustar tiempos VTT