Transcrição de áudio
Transforma uma gravação de áudio em texto com marcação de tempo.
Esta ferramenta funciona com JavaScript. Para a usar, ative o JavaScript no navegador e recarregue a página.
TRANSFORME A GRAVAÇÃO EM TEXTO.
A Transcrição de áudio transforma em texto a fala de uma gravação de áudio ou vídeo. São três saídas: o texto simples junta a fala em parágrafos no fim das frases e serve para virar um texto direto; o texto com marcação de tempo põe no início de cada linha a hora no formato [00:01:23], útil para atas de reunião e transcrições de entrevista; o JSON dá o início e o fim de cada palavra, para usar no seu próprio aplicação ou na edição. Para o reconhecimento de fala, o modelo aberto Whisper da OpenAI roda no servidor; dá para escolher 16 idiomas, incluindo o turco, ou deixar que seja detetado sozinho.
A gravação é enviada só a partir do seu próprio aparelho; não há campo para link. O áudio é separado do ficheiro, reduzido a 16 kHz mono e entregue ao modelo Whisper do servidor; nunca vai para um serviço externo e é apagado no fim do trabalho. Os trechos sem fala (silêncios de mais de meio segundo, esperas) são filtrados antes da transcrição. Há três modelos: “Rápido” dá um rascunho aproximado; “Equilibrado” basta para a maioria das gravações; “Melhor” capta nomes com mais precisão, mas é 3–4 vezes mais lento e funciona em gravações de até 10 minutos. Uma gravação pode ter no máximo 30 minutos; divida uma aula ou reunião mais longa em partes com “Cortador de áudio” e envie uma de cada vez. Escolha o idioma se o souber; se a deteção automática não tiver certeza, o ecrã de resultado indica-o.
Do início ao fim
- Envie o ficheiro de áudio ou vídeo. MP3, WAV, M4A, FLAC, MP4, MOV, MKV… A duração é lida.
- Escolha o idioma e a saída. Texto simples, texto com marcações de tempo ou JSON. Modelo: Equilibrado; Melhor se os nomes importarem.
- Transfira o texto. O texto aparece no ecrã e pode ser copiado; o ficheiro é transferido. Leia e corrija.
Perguntas frequentes
Para que serve o texto com marcações de tempo?
A hora no início de cada linha mostra em que ponto da gravação aquela frase ocorre; serve para atas de reunião, transcrições de entrevista e para achar um trecho dentro de um vídeo. A saída JSON dá a mesma informação palavra por palavra.
Separa os oradores?
Não. O texto vem num fluxo único; não é assinalado quem está a falar. Numa entrevista a duas pessoas, o mais rápido é escolher “Texto com marcações de tempo” e acrescentar os nomes no início das linhas enquanto ouves a gravação.
Como se formam os parágrafos no texto simples?
O modelo transcreve a fala por trechos; a saída em texto simples junta esses trechos e começa um parágrafo novo no primeiro fim de frase depois de cerca de 400 caracteres. A pontuação e as maiúsculas também vêm do modelo e podem faltar em fala rápida ou com ruído. Leia o texto uma vez antes de publicar e confirme sobretudo os nomes próprios.
O meu ficheiro fica no servidor?
Não. O ficheiro chega ao servidor apenas para ser processado e é eliminado quando o trabalho termina; o resultado também é eliminado depois de transferido, ao sair da ferramenta. Não é preciso conta, nome nem e-mail, e os seus ficheiros nunca são enviados a serviços de terceiros. A utilização é gratuita: não há quota por hora nem por dia para o número de operações, não é preciso ver anúncios antes do processamento e não adicionamos marca de água ao resultado.
Mais ferramentas de Áudio
RUPO Studio