Trascrizione audio
Trasforma una registrazione audio in testo con timestamp.
Questo strumento funziona con JavaScript. Per usarlo, attiva JavaScript nel browser e ricarica la pagina.
TRASFORMA LA REGISTRAZIONE IN TESTO.
La Trascrizione audio trasforma in testo il parlato di una registrazione audio o video. Ci sono tre uscite: il testo semplice raccoglie il parlato in paragrafi a fine frase e si presta a diventare subito uno scritto; il testo con marcature temporali mette all’inizio di ogni riga l’ora nella forma [00:01:23], comodo per verbali di riunione e trascrizioni di interviste; il JSON dà l’inizio e la fine di ogni parola, per usarlo nella tua applicazione o in montaggio. Per il riconoscimento vocale, il modello aperto Whisper di OpenAI gira sul server; si possono scegliere 16 lingue, turco compreso, oppure viene rilevata da sola.
La registrazione la carichi solo dal tuo dispositivo; non c'è un campo per i link. L'audio viene separato dal file, ridotto a 16 kHz mono e passato al modello Whisper sul server; non va mai a un servizio esterno ed è eliminato a fine lavoro. Le parti senza parlato (silenzi più lunghi di mezzo secondo, attese) vengono scartate prima della trascrizione. Ci sono tre modelli: “Veloce” dà una bozza approssimativa; “Bilanciato” basta per la maggior parte delle registrazioni; “Migliore” coglie meglio i nomi ma è 3–4 volte più lento e funziona con registrazioni fino a 10 minuti. Una registrazione può durare al massimo 30 minuti; dividi una lezione o una riunione più lunga in parti con “Taglia audio” e caricale una alla volta. Scegli la lingua se la conosci; se il rilevamento automatico non è sicuro, la schermata del risultato lo dice.
Dall’inizio alla fine
- Carica il tuo file audio o video. MP3, WAV, M4A, FLAC, MP4, MOV, MKV… Viene letta la durata.
- Scegli lingua e output. Testo semplice, testo con marcatori temporali o JSON. Modello: Bilanciato; Migliore se contano i nomi.
- Scarica il testo. Il testo compare sullo schermo e si può copiare; il file si scarica. Leggi e correggi.
Domande frequenti
A cosa serve il testo con marcatori temporali?
L'ora all'inizio di ogni riga mostra in quale punto della registrazione ricorre quella frase; serve per verbali di riunione, trascrizioni di interviste e per trovare un passaggio dentro un video. L'output JSON dà la stessa informazione parola per parola.
Distingue chi parla?
No. Il testo arriva come un unico flusso; chi parla non viene indicato. In un'intervista a due voci, la via più rapida è scegliere “Testo con marcatori temporali” e aggiungere i nomi a inizio riga mentre ascolti la registrazione.
Come si formano i paragrafi nel testo semplice?
Il modello trascrive il parlato a segmenti; l'uscita in testo semplice li unisce e inizia un nuovo paragrafo alla prima fine di frase dopo circa 400 caratteri. Anche punteggiatura e maiuscole vengono dal modello e possono mancare nel parlato veloce o rumoroso. Leggi il testo una volta prima di pubblicarlo e controlla soprattutto i nomi propri.
Il mio file resta sul server?
No. Il tuo file arriva sul server solo per essere elaborato e viene eliminato a lavoro finito; anche il risultato viene eliminato quando lo scarichi ed esci dallo strumento. Non servono account, nome o indirizzo email, e i tuoi file non vengono mai inviati a servizi di terze parti. L’uso è gratuito: nessuna quota oraria o giornaliera sul numero di operazioni, nessuna pubblicità da guardare prima dell’elaborazione e nessuna filigrana aggiunta al risultato.
Altri strumenti Audio
RUPO Studio