¿Se sube mi audio a un servidor?
No. La decodificación y la transcripción se ejecutan en tu navegador y la grabación no se sube a un servidor. Se necesita conexión para descargar los modelos y recursos que aún no estén en caché.
Convierte voz a texto gratis, tantas veces como quieras. Elige un archivo de audio o graba con el micrófono y genera una transcripción y subtítulos localmente.
Soltar aquí un archivo de audio o pulsar para seleccionar
Tu audio se procesa en este navegador y no se sube a un servidor.
El modo Estándar es más rápido y usa menos memoria. El modo Mejorado puede mejorar el reconocimiento, pero requiere una descarga mayor, más memoria y más tiempo.
La detección automática está activada de forma predeterminada. Selecciona un idioma si la detección es incorrecta.
Los números de hablantes son estimaciones; revísalos.
Revisa el texto, los tiempos y las etiquetas de hablantes antes de usar el resultado.
Usa esta herramienta de audio a texto para transcribir notas de voz, entrevistas, clases y reuniones grabadas. La primera ejecución descarga los modelos necesarios; las siguientes pueden reutilizar la caché del navegador cuando esté disponible. La velocidad de procesamiento depende de tu dispositivo. Revisa el texto, los tiempos y las posibles etiquetas de hablantes antes de compartir el resultado.
No. La decodificación y la transcripción se ejecutan en tu navegador y la grabación no se sube a un servidor. Se necesita conexión para descargar los modelos y recursos que aún no estén en caché.
La detección automática identifica el idioma a partir de la voz al principio de la grabación. También puedes seleccionarlo manualmente. Hay muchos idiomas disponibles, pero la precisión varía según el idioma, el acento, el ruido y la calidad de la grabación. Las grabaciones con varios idiomas o voces simultáneas requieren una revisión cuidadosa.
El modo Mejorado está seleccionado por defecto. Puede mejorar el reconocimiento, pero requiere una primera descarga mayor, más memoria y normalmente más tiempo de procesamiento. Elige Mejorado si priorizas la calidad del reconocimiento. El modo Estándar es más rápido y usa menos memoria, por lo que conviene para grabaciones largas o dispositivos con recursos limitados.
Las etiquetas de hablantes son opcionales y están desactivadas por defecto. Estiman quién habló y pueden ser incorrectas, sobre todo en intervenciones breves o voces simultáneas.
Herramientas relacionadas: Reductor de ruido de audio con IA · Divisor de audio · Editor de subtítulos · Ajustar tiempos SRT · Ajustar tiempos VTT