음성 받아쓰기
녹음을 타임스탬프가 붙은 텍스트로 바꿉니다.
이 도구는 JavaScript로 작동합니다. 사용하려면 브라우저에서 JavaScript를 켜고 페이지를 새로 고치세요.
녹음을 텍스트로.
음성 받아쓰기는 오디오나 동영상 녹음의 음성을 글로 바꿉니다. 출력은 세 가지입니다. 일반 텍스트는 문장이 끝나는 곳에서 문단으로 모아 바로 글로 옮기기에 알맞습니다. 시간 표시 텍스트는 각 줄 앞에 [00:01:23] 형식으로 시각을 넣어 회의록과 인터뷰 녹취에 쓸모가 있습니다. JSON은 각 낱말의 시작과 끝 시각을 주어 직접 만든 앱이나 편집에서 쓰기 위한 것입니다. 음성 인식에는 OpenAI의 공개 모델 Whisper가 서버에서 돌아갑니다. 터키어를 포함한 16개 언어를 고르거나 자동으로 감지하게 할 수 있습니다.
녹음은 자신의 기기에서만 올립니다. 링크를 넣는 칸은 없습니다. 파일에서 소리를 분리해 16 kHz 모노로 바꾼 뒤 서버의 Whisper 모델에 넘깁니다. 외부 서비스로 가지 않으며 작업이 끝나면 삭제됩니다. 말소리가 없는 부분(0.5초보다 긴 침묵, 대기 시간)은 받아쓰기 전에 걸러집니다. 모델은 세 가지입니다. “빠름”은 대략적인 초안을, “균형”은 대부분의 녹음에 충분한 결과를 내고, “최고”는 이름을 더 정확히 잡지만 3–4배 느리며 10분까지의 녹음에서 작동합니다. 녹음은 최대 30분이며, 더 긴 강의나 회의는 “오디오 잘라내기”로 나눈 뒤 차례로 올리세요. 언어를 알면 고르세요. 자동 감지가 확실하지 않으면 결과 화면에 알려 줍니다.
처음부터 끝까지
- 오디오나 동영상 파일을 올리세요. MP3, WAV, M4A, FLAC, MP4, MOV, MKV… 길이를 읽습니다.
- 언어와 출력을 고르세요. 일반 텍스트, 타임스탬프 텍스트 또는 JSON. 모델: 균형. 이름이 중요하면 최고.
- 텍스트를 내려받으세요. 텍스트가 화면에 나타나며 복사할 수 있습니다. 파일이 내려받아집니다. 읽고 고치세요.
자주 묻는 질문
타임스탬프 텍스트는 어디에 쓰나요?
각 줄 앞의 시간은 그 문장이 녹음의 어디에 있는지 보여 줍니다. 회의록, 인터뷰 녹취, 동영상 안의 구간 찾기에 씁니다. JSON 출력은 같은 정보를 단어별로 줍니다.
화자를 구분하나요?
아니요. 텍스트는 하나의 흐름으로 나오며 누가 말했는지는 표시되지 않습니다. 두 사람의 인터뷰라면 “타임스탬프 텍스트”를 고르고 녹음을 들으며 줄 앞에 이름을 붙이는 것이 가장 빠릅니다.
일반 텍스트에서 문단은 어떻게 나뉘나요?
모델은 말을 구간별로 받아씁니다. 일반 텍스트 출력은 이 구간들을 이어 붙이고, 약 400자를 넘긴 뒤 처음 나오는 문장 끝에서 새 문단을 시작합니다. 문장 부호와 대문자도 모델이 붙이므로 빠르거나 잡음이 많은 말에서는 빠질 수 있습니다. 게시하기 전에 한 번 읽고 특히 고유명사를 확인하세요.
파일이 서버에 남나요?
아니요. 파일은 처리를 위해서만 서버로 전송되고 작업이 끝나면 삭제됩니다. 결과 파일도 다운로드한 뒤 도구를 나가면 삭제됩니다. 계정, 이름, 이메일 주소는 필요 없으며 파일이 제3자 서비스로 전송되는 일은 없습니다. 이용은 무료입니다. 처리 횟수에 시간당·일일 한도가 없고, 처리 전에 광고를 볼 필요가 없으며, 결과물에 워터마크를 넣지 않습니다.
다른 오디오 도구
RUPO Studio