Meu áudio é enviado a um servidor?
Não. A decodificação e a transcrição são executadas no navegador, e a gravação não é enviada a um servidor. É preciso conexão para baixar modelos e recursos que ainda não estejam em cache.
Converta voz em texto gratuitamente, quantas vezes quiser. Escolha um arquivo de áudio ou grave pelo microfone e gere uma transcrição e legendas localmente.
Solte um arquivo de áudio aqui ou clique para selecionar
Seu áudio é processado neste navegador e não é enviado a um servidor.
O modo Padrão é mais rápido e usa menos memória. O modo Aprimorado pode melhorar o reconhecimento, mas exige um download maior, mais memória e mais tempo.
A detecção automática é usada por padrão. Selecione um idioma se a detecção estiver incorreta.
Os números dos falantes são estimativas; revise-os.
Revise o texto, os tempos e as identificações de falantes antes de usar o resultado.
Use esta ferramenta de áudio para texto para transcrever notas de voz, entrevistas, aulas e reuniões gravadas. A primeira execução baixa os modelos necessários; as seguintes podem reutilizar o cache do navegador quando estiver disponível. A velocidade de processamento depende do dispositivo. Revise o texto, os tempos e as possíveis identificações de falantes antes de compartilhar o resultado.
Não. A decodificação e a transcrição são executadas no navegador, e a gravação não é enviada a um servidor. É preciso conexão para baixar modelos e recursos que ainda não estejam em cache.
A detecção automática identifica o idioma a partir da fala no início da gravação. Você também pode selecioná-lo manualmente. Há muitos idiomas disponíveis, mas a precisão varia conforme o idioma, o sotaque, o ruído e a qualidade da gravação. Idiomas misturados e vozes simultâneas exigem uma revisão mais cuidadosa.
O modo Aprimorado vem selecionado por padrão. Ele pode melhorar o reconhecimento, mas exige uma primeira transferência maior, mais memória e geralmente mais tempo de processamento. Escolha Aprimorado se a qualidade do reconhecimento for sua prioridade. O modo Padrão é mais rápido e usa menos memória, sendo uma boa escolha para gravações longas ou dispositivos com recursos limitados.
A identificação de falantes é opcional e vem desativada. Ela estima quem falou e pode errar, especialmente em falas breves ou simultâneas.
Ferramentas relacionadas: Redutor de ruído de áudio com IA · Divisor de áudio · Editor de legendas · Ajustar tempos SRT · Ajustar tempos VTT