ko

오디오를 텍스트로

말로 된 녹음을 글로 바꿔보세요 - AI 음성 인식(Whisper)을 이용해 브라우저에서 로컬로 처리되며, 업로드는 전혀 없습니다.

기기에서 로컬로 처리 중 ...

녹음 언어
  • 자동 감지
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

기기에서 로컬로 처리 중 ...

0%

제 파일이 업로드되나요?

아니요. 모든 처리가 브라우저에서 이루어지며, 파일이 기기를 떠나지 않습니다. 이것을 검증하는 방법

업로드 없음100% 로컬 처리
내용은 내 손안에제3자 접근 불가
Hosted in GermanyGlobal Content Delivery
외부 검증 완료TLS A+ · 헤더 A+

인터뷰, 강의 녹음, 이동 중에 떠오른 아이디어를 담은 음성 메모 - 이 도구는 녹음을 듣고 검색과 복사가 가능한 텍스트로 옮겨 적습니다. 인식 모델은 OpenAI의 Whisper이며, 여기서는 별도로 컴파일된 단일 스레드 WebAssembly로 동작합니다 - 잘 알려진 여러 전사 서비스가 쓰는 것과 동일한 기반 기술이지만, 여기서는 외부 서버가 아니라 사용자의 기기에서 전부 처리됩니다.

기본적으로 Whisper는 말하는 언어를 스스로 인식합니다(자동 감지) - 짧거나 여러 언어가 섞인 녹음에서는 언어를 직접 지정할 수도 있으며, 이렇게 하면 인식률과 처리 속도가 조금 나아질 수 있습니다. 결과는 발화 구간마다 문단으로 나뉜 연속된 텍스트로 표시됩니다. 자막용 타임스탬프가 필요한 영상이라면 동일한 인식 엔진을 사용하되 정확한 시간 정보를 담은 SRT/VTT 파일로 출력하는 자매 도구 영상을 자막으로를 이용하세요.

공유 메모리 없이(크로스 오리진 격리 없이) 동작하기 때문에 인식은 다중 스레드가 아닌 단일 스레드로 진행됩니다 - 정확하지만 서버 기반 서비스보다 눈에 띄게 느립니다. 그래서 이 사이트의 다른 오디오 도구보다 훨씬 엄격한 길이 상한이 적용됩니다 - 잘못된 속도를 약속하기보다는 정직하게 느린 편을 택했습니다.

기술 사양

기술 사양
입력 형식MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
자동 변환MP4
출력 형식TXT
일괄 처리미지원
처리 방식브라우저에서 로컬 처리 (WebAssembly)
파일 업로드없음

3단계로

  1. 오디오 파일을 놓으세요.
  2. 언어를 선택하거나 자동 감지로 두세요.
  3. 인식된 텍스트를 복사하거나 TXT로 다운로드하세요.

제한: 단일 스레드로 동작하며(이 사이트에는 크로스 오리진 격리 모드가 없습니다) 서버 기반 서비스보다 눈에 띄게 느립니다 - 그래서 이 사이트의 다른 오디오 도구보다 기기별 길이 상한이 훨씬 엄격합니다. 가벼운 tiny 모델 단계를 사용하므로 또렷한 발화에는 좋지만, 배경 소음이 심하거나 방언, 전문 용어가 많은 경우에는 더 큰 모델보다 정확도가 떨어집니다. 인식 결과가 완벽하지는 않으니, 특히 고유명사와 숫자는 결과를 꼭 확인하세요.

자주 묻는 질문

제 녹음이 업로드되나요?

아니요, 인식은 WebAssembly를 통해 브라우저에서 완전히 로컬로 처리됩니다.

어떤 언어를 인식할 수 있나요?

거의 100개 언어를 지원하며, 자동으로 감지하거나 직접 선택할 수 있습니다.

왜 다른 오디오 도구보다 오래 걸리나요?

음성 인식은 연산량이 많은 작업인데, 여기서는 멀티스레딩 없이 처리됩니다 - 정확하되, 잘못된 속도를 약속하는 대신 의도적으로 느리게 동작합니다.

자막용 타임스탬프가 있는 버전도 있나요?

네, 자매 도구 영상을 자막으로가 정확한 시간 정보가 담긴 SRT/VTT 파일을 출력합니다.

관련 도구

영상을 자막으로 · 노이즈 제거 · 이미지 텍스트 추출 (OCR) · 파형 이미지 · 오디오 녹음 · 채널 교환