Transcrição de áudio
Transforma uma gravação de áudio em texto com marcação de tempo.
Esta ferramenta funciona com JavaScript. Para usá-la, ative o JavaScript no navegador e recarregue a página.
TRANSFORME A GRAVAÇÃO EM TEXTO.
A Transcrição de áudio transforma em texto a fala de uma gravação de áudio ou vídeo. São três saídas: o texto simples junta a fala em parágrafos no fim das frases e serve para virar um texto direto; o texto com marcação de tempo põe no início de cada linha a hora no formato [00:01:23], útil para atas de reunião e transcrições de entrevista; o JSON dá o início e o fim de cada palavra, para usar no seu próprio aplicativo ou na edição. Para o reconhecimento de fala, o modelo aberto Whisper da OpenAI roda no servidor; dá para escolher 16 idiomas, incluindo o turco, ou deixar que seja detectado sozinho.
Você envia a gravação só do seu próprio aparelho; não há campo para link. O áudio é separado do arquivo, reduzido a 16 kHz mono e entregue ao modelo Whisper do servidor; nunca vai para um serviço externo e é apagado ao fim do trabalho. Trechos sem fala (silêncios de mais de meio segundo, esperas) são filtrados antes da transcrição. Há três modelos: “Rápido” dá um rascunho aproximado; “Equilibrado” basta para a maioria das gravações; “Melhor” capta nomes com mais precisão, mas é 3–4 vezes mais lento e funciona em gravações de até 10 minutos. Uma gravação pode ter no máximo 30 minutos; divida uma aula ou reunião mais longa em partes com “Cortador de áudio” e envie uma de cada vez. Escolha o idioma se souber; se a detecção automática não tiver certeza, a tela de resultado avisa.
Do início ao fim
- Envie o arquivo de áudio ou vídeo. MP3, WAV, M4A, FLAC, MP4, MOV, MKV… A duração é lida.
- Escolha o idioma e a saída. Texto simples, texto com marcações de tempo ou JSON. Modelo: Equilibrado; Melhor se os nomes importarem.
- Baixe o texto. O texto aparece na tela e pode ser copiado; o arquivo baixa. Leia e corrija.
Perguntas frequentes
Para que serve o texto com marcações de tempo?
A hora no início de cada linha mostra em que ponto da gravação aquela frase ocorre; serve para atas de reunião, transcrições de entrevista e para achar um trecho dentro de um vídeo. A saída JSON dá a mesma informação palavra por palavra.
Ele separa os falantes?
Não. O texto vem em um fluxo único; não é marcado quem está falando. Numa entrevista com duas pessoas, o jeito mais rápido é escolher “Texto com marcações de tempo” e acrescentar os nomes no início das linhas enquanto ouve a gravação.
Como os parágrafos são formados no texto simples?
O modelo transcreve a fala em trechos; a saída em texto simples junta esses trechos e começa um parágrafo novo no primeiro fim de frase depois de uns 400 caracteres. A pontuação e as maiúsculas também vêm do modelo e podem faltar em fala rápida ou com ruído. Leia o texto uma vez antes de publicar e confira principalmente os nomes próprios.
O meu arquivo fica no servidor?
Não. O arquivo chega ao servidor apenas para ser processado e é excluído quando o trabalho termina; o resultado também é excluído depois de baixado, ao sair da ferramenta. Não é preciso conta, nome nem e-mail, e os seus arquivos nunca são enviados a serviços de terceiros. O uso é gratuito: não há cota por hora nem por dia para o número de operações, não é preciso assistir a anúncios antes do processamento e não adicionamos marca d’água ao resultado.
Mais ferramentas de Áudio
RUPO Studio