Zawartość Twoich plików nie jest nigdzie przetwarzana w ramach powierzenia. Nie potrzebujesz umowy powierzenia z gottrix, aby obrabiać dokumenty poufne lub firmowe.
Hosted in GermanyGlobal Content Delivery
Serwery źródłowe u Hetznera w Niemczech, globalne dostarczanie przez sieć dostarczania treści (CDN). Zawartość Twoich plików nigdy nie jest przy tym przesyłana - nie opuszcza Twojego urządzenia.
Wywiad, nagranie wykładu, notatka głosowa z pomysłem w drodze: to narzędzie słucha nagrania i zapisuje je jako przeszukiwalny, gotowy do skopiowania tekst. Modelem rozpoznającym jest Whisper od OpenAI, tutaj jako specjalnie skompilowany, jednowątkowy build WebAssembly - ta sama technologia, z której korzystają znane usługi transkrypcji, tylko że tutaj działa ona w całości na Twoim urządzeniu, a nie na obcym serwerze.
Domyślnie Whisper sam rozpoznaje mówiony język ("Wykryj automatycznie") - przy krótkich lub wielojęzycznych nagraniach można też ustawić język na sztywno, co może nieco poprawić skuteczność rozpoznawania i szybkość. Wynik pojawia się jako ciągły tekst z akapitem na każdy fragment wypowiedzi; do filmów wymagających osadzonych znaczników czasu służy narzędzie siostrzane "Wideo na napisy", które wykorzystuje to samo rozpoznawanie, ale zwraca plik SRT/VTT z dokładnymi znacznikami czasu.
Ponieważ praca odbywa się bez pamięci współdzielonej (bez izolacji cross-origin), rozpoznawanie działa jednowątkowo, a nie wielowątkowo - poprawnie, ale zauważalnie wolniej niż usługa serwerowa. Dlatego obowiązuje tu znacznie bardziej rygorystyczny górny limit długości niż w przypadku pozostałych narzędzi audio na tej stronie - lepiej uczciwie wolno niż obiecywać fałszywą szybkość.
Dane techniczne
Dane techniczne
Formaty wejściowe
MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Automatyczna konwersja
MP4
Format wyjściowy
TXT
Przetwarzanie wsadowe
Nie
Przetwarzanie
Lokalnie w przeglądarce (WebAssembly)
Przesyłanie plików
Brak
W 3 krokach
Upuść plik audio.
Wybierz język lub pozostaw "Wykryj automatycznie".
Skopiuj rozpoznany tekst lub pobierz go jako TXT.
Ograniczenia: Działa jednowątkowo (brak trybu izolacji cross-origin na tej stronie), przez co jest zauważalnie wolniejsze niż usługi serwerowe - obowiązuje tu znacznie bardziej rygorystyczny górny limit długości na urządzenie (krótszy niż w pozostałych narzędziach audio). Używany jest kompaktowy poziom modelu "tiny": dobry przy wyraźnej mowie, słabszy przy silnym hałasie w tle, dialektach lub żargonie branżowym niż większy model. Rozpoznawanie nie jest bezbłędne - sprawdź wynik, zwłaszcza nazwy własne i liczby.
Częste pytania
Czy moje nagranie jest przesyłane na serwer?
Nie, rozpoznawanie działa w całości lokalnie w przeglądarce dzięki WebAssembly.
Jakie języki są rozpoznawane?
Prawie 100 języków; wykrywane automatycznie lub wybierane na sztywno.
Dlaczego trwa to dłużej niż w przypadku innych narzędzi audio?
Rozpoznawanie mowy jest bardzo obciążające obliczeniowo i działa tu bez wielowątkowości - poprawnie, ale świadomie wolniej, zamiast obiecywać fałszywą szybkość.
Czy jest wersja ze znacznikami czasu do napisów?
Tak, narzędzie siostrzane "Wideo na napisy" zwraca SRT/VTT z dokładnymi znacznikami czasu.
Tylko za Twoją zgodą mierzymy korzystanie w sposób zanonimizowany za pomocą plików cookie, aby ulepszać gottrix. Twoje pliki zawsze pozostają lokalnie, na Twoim urządzeniu. Prywatność