오디오를 텍스트로
말로 된 녹음을 글로 바꿔보세요 - AI 음성 인식(Whisper)을 이용해 브라우저에서 로컬로 처리되며, 업로드는 전혀 없습니다.
기기에서 로컬로 처리 중 ...
기기에서 로컬로 처리 중 ...
0%
파일이 기기를 떠난 적이 없습니다
제 파일이 업로드되나요?
아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법
말로 된 녹음을 글로 바꿔보세요 - AI 음성 인식(Whisper)을 이용해 브라우저에서 로컬로 처리되며, 업로드는 전혀 없습니다.
기기에서 로컬로 처리 중 ...
기기에서 로컬로 처리 중 ...
0%
파일이 기기를 떠난 적이 없습니다
아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법
인터뷰, 강의 녹음, 이동 중에 떠오른 아이디어를 담은 음성 메모 - 이 도구는 녹음을 듣고 검색과 복사가 가능한 텍스트로 옮겨 적습니다. 인식 모델은 OpenAI의 Whisper이며, 여기서는 별도로 컴파일된 단일 스레드 WebAssembly로 동작합니다 - 잘 알려진 여러 전사 서비스가 쓰는 것과 동일한 기반 기술이지만, 여기서는 외부 서버가 아니라 사용자의 기기에서 전부 처리됩니다.
기본적으로 Whisper는 말하는 언어를 스스로 인식합니다(자동 감지) - 짧거나 여러 언어가 섞인 녹음에서는 언어를 직접 지정할 수도 있으며, 이렇게 하면 인식률과 처리 속도가 조금 나아질 수 있습니다. 결과는 발화 구간마다 문단으로 나뉜 연속된 텍스트로 표시됩니다. 자막용 타임스탬프가 필요한 영상이라면 동일한 인식 엔진을 사용하되 정확한 시간 정보를 담은 SRT/VTT 파일로 출력하는 자매 도구 영상을 자막으로를 이용하세요.
공유 메모리 없이(크로스 오리진 격리 없이) 동작하기 때문에 인식은 다중 스레드가 아닌 단일 스레드로 진행됩니다 - 정확하지만 서버 기반 서비스보다 눈에 띄게 느립니다. 그래서 이 사이트의 다른 오디오 도구보다 훨씬 엄격한 길이 상한이 적용됩니다 - 잘못된 속도를 약속하기보다는 정직하게 느린 편을 택했습니다.
| 입력 형식 | MP3, WAV, M4A, AAC, OGG, OPUS, FLAC |
|---|---|
| 자동 변환 | MP4 |
| 출력 형식 | TXT |
| 일괄 처리 | 미지원 |
| 처리 방식 | 브라우저에서 로컬 처리 (WebAssembly) |
| 파일 업로드 | 없음 |
제한: 단일 스레드로 동작하며(이 사이트에는 크로스 오리진 격리 모드가 없습니다) 서버 기반 서비스보다 눈에 띄게 느립니다 - 그래서 이 사이트의 다른 오디오 도구보다 기기별 길이 상한이 훨씬 엄격합니다. 가벼운 tiny 모델 단계를 사용하므로 또렷한 발화에는 좋지만, 배경 소음이 심하거나 방언, 전문 용어가 많은 경우에는 더 큰 모델보다 정확도가 떨어집니다. 인식 결과가 완벽하지는 않으니, 특히 고유명사와 숫자는 결과를 꼭 확인하세요.
아니요, 인식은 WebAssembly를 통해 브라우저에서 완전히 로컬로 처리됩니다.
거의 100개 언어를 지원하며, 자동으로 감지하거나 직접 선택할 수 있습니다.
음성 인식은 연산량이 많은 작업인데, 여기서는 멀티스레딩 없이 처리됩니다 - 정확하되, 잘못된 속도를 약속하는 대신 의도적으로 느리게 동작합니다.
네, 자매 도구 영상을 자막으로가 정확한 시간 정보가 담긴 SRT/VTT 파일을 출력합니다.
영상을 자막으로 · 노이즈 제거 · 이미지 텍스트 추출 (OCR) · 파형 이미지 · 오디오 녹음 · 채널 교환