pl

Audio na tekst

Zamień nagranie mówione na tekst pisany - lokalnie w przeglądarce dzięki rozpoznawaniu mowy AI (Whisper), całkowicie bez przesyłania na serwer.

Przetwarzanie lokalnie na Twoim urządzeniu ...

Język nagrania
  • Wykryj automatycznie
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Przetwarzanie lokalnie na Twoim urządzeniu ...

0%

Czy mój plik jest przesyłany?

Nie. Wszystko działa w Twojej przeglądarce - Twój plik nigdy nie opuszcza urządzenia. Jak to sprawdzić

Bez wysyłania100% lokalnie
Treści zostają u Ciebiebrak dostępu osób trzecich
Hosted in GermanyGlobal Content Delivery
Zbadane niezależnieTLS A+ · Nagłówki A+

Wywiad, nagranie wykładu, notatka głosowa z pomysłem w drodze: to narzędzie słucha nagrania i zapisuje je jako przeszukiwalny, gotowy do skopiowania tekst. Modelem rozpoznającym jest Whisper od OpenAI, tutaj jako specjalnie skompilowany, jednowątkowy build WebAssembly - ta sama technologia, z której korzystają znane usługi transkrypcji, tylko że tutaj działa ona w całości na Twoim urządzeniu, a nie na obcym serwerze.

Domyślnie Whisper sam rozpoznaje mówiony język ("Wykryj automatycznie") - przy krótkich lub wielojęzycznych nagraniach można też ustawić język na sztywno, co może nieco poprawić skuteczność rozpoznawania i szybkość. Wynik pojawia się jako ciągły tekst z akapitem na każdy fragment wypowiedzi; do filmów wymagających osadzonych znaczników czasu służy narzędzie siostrzane "Wideo na napisy", które wykorzystuje to samo rozpoznawanie, ale zwraca plik SRT/VTT z dokładnymi znacznikami czasu.

Ponieważ praca odbywa się bez pamięci współdzielonej (bez izolacji cross-origin), rozpoznawanie działa jednowątkowo, a nie wielowątkowo - poprawnie, ale zauważalnie wolniej niż usługa serwerowa. Dlatego obowiązuje tu znacznie bardziej rygorystyczny górny limit długości niż w przypadku pozostałych narzędzi audio na tej stronie - lepiej uczciwie wolno niż obiecywać fałszywą szybkość.

Dane techniczne

Dane techniczne
Formaty wejścioweMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Automatyczna konwersjaMP4
Format wyjściowyTXT
Przetwarzanie wsadoweNie
PrzetwarzanieLokalnie w przeglądarce (WebAssembly)
Przesyłanie plikówBrak

W 3 krokach

  1. Upuść plik audio.
  2. Wybierz język lub pozostaw "Wykryj automatycznie".
  3. Skopiuj rozpoznany tekst lub pobierz go jako TXT.

Ograniczenia: Działa jednowątkowo (brak trybu izolacji cross-origin na tej stronie), przez co jest zauważalnie wolniejsze niż usługi serwerowe - obowiązuje tu znacznie bardziej rygorystyczny górny limit długości na urządzenie (krótszy niż w pozostałych narzędziach audio). Używany jest kompaktowy poziom modelu "tiny": dobry przy wyraźnej mowie, słabszy przy silnym hałasie w tle, dialektach lub żargonie branżowym niż większy model. Rozpoznawanie nie jest bezbłędne - sprawdź wynik, zwłaszcza nazwy własne i liczby.

Częste pytania

Czy moje nagranie jest przesyłane na serwer?

Nie, rozpoznawanie działa w całości lokalnie w przeglądarce dzięki WebAssembly.

Jakie języki są rozpoznawane?

Prawie 100 języków; wykrywane automatycznie lub wybierane na sztywno.

Dlaczego trwa to dłużej niż w przypadku innych narzędzi audio?

Rozpoznawanie mowy jest bardzo obciążające obliczeniowo i działa tu bez wielowątkowości - poprawnie, ale świadomie wolniej, zamiast obiecywać fałszywą szybkość.

Czy jest wersja ze znacznikami czasu do napisów?

Tak, narzędzie siostrzane "Wideo na napisy" zwraca SRT/VTT z dokładnymi znacznikami czasu.

Powiązane narzędzia

Wideo na napisy · Usuń szum · Obraz do tekstu (OCR) · Obraz przebiegu fali · Nagraj audio · Zamień kanały