Transcripción de audio
Convierte una grabación de audio en texto con marcas de tiempo.
Esta herramienta funciona con JavaScript. Para usarla, activa JavaScript en tu navegador y recarga la página.
CONVIERTE LA GRABACIÓN EN TEXTO.
La Transcripción de audio convierte en texto el habla de una grabación de audio o vídeo. Hay tres salidas: el texto plano agrupa el habla en párrafos al final de cada frase y sirve para pasarlo directamente a escrito; el texto con marcas de tiempo pone al principio de cada línea la hora en formato [00:01:23], útil para actas de reunión y transcripciones de entrevistas; el JSON da el inicio y el final de cada palabra, para usarlo en tu propia aplicación o en la edición. Para el reconocimiento de voz, el modelo abierto Whisper de OpenAI se ejecuta en el servidor; puedes elegir entre 16 idiomas, incluido el turco, o dejar que se detecte solo.
La grabación la subes solo desde tu propio dispositivo; no hay campo para enlaces. El audio se separa del archivo, se reduce a 16 kHz mono y se entrega al modelo Whisper del servidor; nunca va a un servicio externo y se borra al terminar la tarea. Las partes sin voz (silencios de más de medio segundo, esperas) se filtran antes de transcribir. Hay tres modelos: “Rápido” da un borrador aproximado; “Equilibrado” basta para la mayoría de las grabaciones; “Mejor” capta los nombres con más precisión, pero es 3–4 veces más lento y funciona con grabaciones de hasta 10 minutos. Una grabación puede durar como máximo 30 minutos; divide una clase o reunión más larga en partes con “Cortar audio” y súbelas una a una. Elige el idioma si lo conoces; si la detección automática no está segura, la pantalla de resultado lo indica.
De principio a fin
- Sube tu archivo de audio o vídeo. MP3, WAV, M4A, FLAC, MP4, MOV, MKV… Se lee la duración.
- Elige el idioma y la salida. Texto plano, texto con marcas de tiempo o JSON. Modelo: Equilibrado; Mejor si importan los nombres.
- Descarga el texto. El texto aparece en pantalla y se puede copiar; el archivo se descarga. Lee y corrige.
Preguntas frecuentes
¿Para qué sirve el texto con marcas de tiempo?
La hora al inicio de cada línea muestra en qué punto de la grabación está esa frase; sirve para actas de reunión, transcripciones de entrevistas y para localizar un pasaje dentro de un vídeo. La salida JSON da la misma información palabra por palabra.
¿Distingue a los hablantes?
No. El texto llega como un solo flujo; no se marca quién habla. En una entrevista de dos personas, lo más rápido es elegir “Texto con marcas de tiempo” y añadir los nombres al inicio de cada línea mientras escuchas la grabación.
¿Cómo se forman los párrafos en el texto plano?
El modelo transcribe el habla por fragmentos; la salida en texto plano los une y empieza un párrafo nuevo en el primer final de frase tras unos 400 caracteres. La puntuación y las mayúsculas también vienen del modelo y pueden faltar en un habla rápida o con ruido. Lee el texto una vez antes de publicarlo y revisa sobre todo los nombres propios.
¿Mi archivo se queda en el servidor?
No. Tu archivo solo llega al servidor para procesarse y se elimina al terminar el trabajo; el resultado también se elimina cuando lo descargas y sales de la herramienta. No necesitas cuenta, nombre ni correo electrónico, y tus archivos nunca se envían a un servicio de terceros. El uso es gratuito: no ponemos ninguna cuota por hora ni por día al número de procesos, no te hacemos ver anuncios antes de procesar y no añadimos marca de agua al resultado.
Otras herramientas de Audio
RUPO Studio