Audio/wideo → tekst i napisy za darmo: transkrypcja w
Możesz teraz bezpłatnie transkrybować dźwięk lub wideo na tekst bezpośrednio w przeglądarce: w sekcji "Wideo" pojawiło się narzędzie „Audio/wideo → tekst + napisy (bezpłatne)”. Rozpoznaje mowę, wyświetla ją w tekście ze znacznikami czasu i udostępnia gotowe napisy – i nie odpisuje tokenów.

Dlaczego to jest darmowe
Zwykle odszyfrowywanie odbywa się na serwerze płatnej usługi: plik jest pobierany, minuty są liczone i płacą za każdą minutę. Tutaj model rozpoznawania mowy jest ładowany do przeglądarki i uruchamiany na Twoim komputerze. Serwer podaje jedynie kod narzędzia i wagę modelu: nie ma z czego zliczać, więc tokeny nie są odpisywane, a ilość deszyfracji nie jest limitowana.
Stąd prywatność: nagranie nie opuszcza Twojego komputera. Jest to ważne w przypadku transkrypcji wywiadów, rozmów służbowych, wykładów lub notatek osobistych.
Jak dokonać transkrypcji audio lub wideo: krok po kroku
- Otwarte Sekcja „Wideo”. i wybierz z listy modeli „Audio/wideo → tekst + napisy (bezpłatne)” — narzędzie znajduje się na dole, obok innych bezpłatnych narzędzi.
- Prześlij plik: kliknij pole wyboru lub przeciągnij i upuść plik audio lub wideo bezpośrednio do niego.
- Wybierz język mowy lub pozostaw opcję „Wykryj automatycznie”. Domyślnie ustawiony jest język interfejsu witryny, ale zawsze możesz go zmienić ręcznie.
- Kliknij „Rozpoznaj mowę” i poczekaj, aż będzie gotowe. Pierwsze uruchomienie trwa dłużej: przeglądarka pobiera model raz i zapisuje go w pamięci podręcznej.
- Sprawdź tekst, w razie potrzeby wyłącz znaczniki czasu i skopiuj wynik.
- Pobierz napisy w wybranym formacie - TXT, SRT, VTT lub JSON. W przypadku filmu możesz od razu złożyć film z wypalonymi napisami.
Jakie pliki są odpowiednie?
Dźwięk: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC i inne popularne formaty. Filmy: MP4, MOV, M4V, MKV, AVI, OGV, WebM. Dźwięk z wideo jest wyodrębniany bezpośrednio w przeglądarce; nie ma potrzeby osobnej konwersji pliku.
Co otrzymasz
- Tekst mowy — transkrypcja ze znacznikami czasu, którą można wyłączyć i uzyskać czysty tekst.
- Kopia — cały rozpoznany tekst za pomocą jednego przycisku do schowka.
- TXT — prosty tekst notatek i dokumentów.
- SRT — napisy dla większości odtwarzaczy i edytorów wideo.
- VTT — napisy do odtwarzaczy internetowych i HTML.
- JSON — zaznaczone utwory z czasami ich scenariuszy.
Film z wypalonymi napisami
Jeśli prześlesz film, narzędzie może nagrać napisy bezpośrednio w klatkach: taki film odtwarza się w dowolnym miejscu, nawet tam, gdzie napisy nie są obsługiwane. Dźwięk źródła zostaje zachowany. Nagrywanie odbywa się na Twoim urządzeniu, plik nie jest nigdzie wysyłany.
Wszystko liczy się na Twoim urządzeniu
Mowa rozpoznaje model Whisper do Transformers.js: najpierw próbuje WebGPU (karta graficzna), a jeśli nie ma adaptera, szczerze przełącza się na WASM i liczy na procesor. Nie ma tu płatnego API, tokeny nie są odpisywane, a nagranie nie trafia na serwer. Długie rekordy są przetwarzane dłużej – wszystko jest obliczane na Twoim komputerze.
Czego to narzędzie nie robi
Szczerze mówiąc o granicach: to jest rozpoznawanie mowy, a nie tłumaczenie. Narzędzie nie tłumaczy tekstu na inny język ani nie wykonuje dubbingu. Jakość zależy od nagrania: przy wyraźnej mowie, bez większego hałasu i muzyki, wynik jest zauważalnie lepszy. Filmy z wypalonymi napisami wymagają nowoczesnej przeglądarki - ten krok wymaga Chrome lub Edge.
Kto uzna to za przydatne?
Narzędzie przydatne jest każdemu, kto pracuje z nagraniami: dziennikarzom i podcasterom – transkrypcjom wywiadów, studentom – notatom z wykładów, redaktorom – napisom do filmów, a także osobom prowadzącym protokoły spotkań. Jeśli potrzebujesz czegoś jeszcze po wcześniejszym umówieniu się, w dziale "Wideo" Jest usuwanie tła, ekskluzywny I mapa głębi — obliczają także bezpośrednio w przeglądarce.
Często zadawane pytania
Czy to naprawdę jest darmowe? Tak. Tokeny dla tego narzędzia nie są pobierane, nie ma ono płatnego API - Twój komputer je przelicza.
Czy plik trafia na serwer? Nie. Nagranie i wynik pozostają na Twoim urządzeniu; Z serwera pochodzą jedynie kody narzędzi i wagi modeli.
Ile języków jest obsługiwanych? Whisper rozpoznaje 99 języków. Możesz wybrać język ręcznie lub zaufać automatycznemu wykrywaniu.
Czy można pobrać napisy w pliku? Tak. TXT, SRT, VTT i JSON pobiera się za pomocą osobnych przycisków.
Czy narzędzie tłumaczy mowę? Nie. Rozpoznaje mowę w wybranym języku, ale nie tłumaczy jej na inny.
Dlaczego pierwsze uruchomienie trwa dłużej? Przeglądarka raz pobiera model rozpoznawania i zapisuje go w pamięci podręcznej – kolejne uruchomienia rozpoczynają się natychmiast.