Transkrypcja z YouTube: tłumacz wideo na tekst z czasem
Transkrypcja z YouTube: najpierw generujemy wypowiedziane linie, a potem je tłumaczymy. Każda linia zachowuje znacznik czasu oryginału.

Aby przełożyć film z YouTube na tekst, najpierw zapisz to, co zostało powiedziane, a następnie przetłumacz te linie. Tłumaczeniu nie podlega obraz, lecz wypowiedziane słowa. YouTube potrafi wyświetlać napisy w trakcie odtwarzania filmu, a w niektórych filmach odtwarzacz nakłada przetłumaczony napis na obraz przez cały czas oglądania. Ta nakładka znika, gdy opuszczasz stronę. Tłumaczenie, które możesz zacytować, przeszukać lub przekazać komuś dalej, to transkrypcja poddana tłumaczeniu, w której każda linia nadal wskazuje pierwotny moment.
Strona pomocy YouTube o wyświetlaniu transkrypcji opisuje widok do czytania: otwórz Pokaż transkrypcję w opisie, śledź bieżącą linię, kliknij linię, aby do niej przejść. Nie opisuje jednak przetłumaczonego dokumentu ani sposobu jego zapisania. Reszta tej strony to kolejność, która prowadzi do powstania dokumentu. Wygeneruj transkrypcję. Przetłumacz linie. Zachowaj czasy tam, gdzie były.
Dlaczego tłumaczyć transkrypcję
Powód, dla którego tłumaczy się transkrypcję, a nie plik wideo, jest taki, że właśnie słowa będziesz później wykorzystywać. Wykład, który lepiej rozumiesz w formie pisanej niż ze słuchu, cytat, który musisz przytoczyć w języku swoich notatek, i fragment, który opiszesz napisami dla innej publiczności — wszystkie zaczynają się od tego samego obiektu: wypowiedzianych linii w postaci tekstu. Tłumaczenie pliku MP4 nie daje takiego tekstu. Podłożenie nowej ścieżki głosowej też go nie daje. To osobne zadania i ta strona nie jest o nich.
Niektórzy widzowie potrzebują tylko nakładki. Jeśli odtwarzacz już pokazuje tłumaczenie, a oglądasz tylko raz, zostań przy nim. Zostaw ją, gdy po zamknięciu karty potrzebujesz dokładnego sformułowania, gdy chcesz wyszukać jakieś wyrażenie albo gdy tłumaczenie ma trafić do dokumentu lub edytora. Nakładka to wyświetlanie. Transkrypcja to tekst.
Transkrypcja wyznacza też wyraźną granicę tego, co można przetłumaczyć. Mowa jest w zakresie. Wtopione w obraz plansze tytułowe, dolne belki i inny tekst namalowany w kadrze nie są odczytywane, więc nie są tłumaczone. Teledysk z niewielką ilością mowy lub bez niej wychodzi ubogi, bo nie ma zbyt wiele mowy do zapisania. Dwie osoby mówiące jednocześnie, hałaśliwe pomieszczenie i przytłumiony mikrofon osłabiają linie źródłowe, a tłumaczenie nie naprawi linii, która już była błędna. Porównaj źródło ze znacznikiem czasu, zanim potraktujesz tłumaczenie jako cytat.
Link musi być publiczny. Film prywatny, usunięty, dostępny tylko dla członków albo link, który odtwarza się tylko na cudzym koncie, nie otworzy się z wklejonego publicznego adresu URL. Limity wieku i ograniczenia regionalne mogą zablokować to samo żądanie. Nie ma przełącznika, który wymusi udostępnienie filmu, którego YouTube nie chce serwować.
Najpierw wygeneruj, potem tłumacz
Tłumaczenie to drugi krok. Pierwszym krokiem jest transkrypcja w języku napisów lub mowy. Pomiń ten krok, a nie będzie niczego w formie linii do tłumaczenia. Streszczenie, wątek komentarzy ani opis filmu nie zastąpią transkrypcji. Nie są sekwencją wypowiedzi i nie mają czasu przypisanego do każdej linii.

W transcript.im zrób to w tej kolejności:
- Skopiuj adres URL publicznego filmu, który chcesz mieć w innym języku.
- Wklej go i wygeneruj linie, zanim wybierzesz język docelowy. Źródłem są napisy już obecne w filmie. Mowa jest transkrybowana tylko wtedy, gdy tych napisów brakuje.
- Uruchom Translate na tych liniach i wybierz jeden z obsługiwanych języków. Sformułowanie się zmienia. Sam film na YouTube pozostaje bez zmian.
- Sprawdź przetłumaczoną linię względem jej pierwotnego czasu. Wyeksportuj, gdy tłumaczenie ma funkcjonować poza przeglądarką.
Aby przetłumaczyć transkrypcję z YouTube, potrzebujesz już tylko linku. Nie wgrywasz filmu ponownie i nie wpisujesz tłumaczenia ręcznie, chyba że później poprawiasz jakąś linię. Poprawka zostaje w twojej kopii. Nie jest zapisywana z powrotem w oryginalnym filmie.
Język docelowy to jeden z obsługiwanych języków: arabski, chiński (uproszczony), angielski, francuski, niemiecki, hindi, włoski, japoński, koreański, portugalski, rosyjski i hiszpański. Chiński oznacza tu wersję uproszczoną, a nie osobny cel tradycyjny. Portugalski to jeden język docelowy, niepodzielony według kraju. Jeśli potrzebnego języka nie ma na tej liście, ten krok go nie wymyśli. Wybierz język docelowy, który narzędzie faktycznie oferuje, albo przetłumacz wyeksportowany tekst tam, gdzie dany język jest dostępny — i pogódź się z tym, że drugie narzędzie może nie zachować czasów napisów, jeśli sam ich nie przeniesiesz.
Język źródłowy to ten, w którym były napisy lub wypowiedź. Film mówiony po japońsku najpierw zwróci japońskie linie, nawet jeśli zamierzasz czytać po hiszpańsku. Tłumaczenie to późniejszy wybór języka docelowego, a inny cel to osobne tłumaczenie tych samych linii źródłowych. Przełączenie z hiszpańskiego na niemiecki nie zmienia hiszpańskiego wyniku w niemiecki. To ponowne tłumaczenie źródła.
Napisy generowane automatycznie, jeśli w ogóle istnieją, wciąż pozostają źródłem. Ich jakość jest tak dobra, jak sama ścieżka napisów. Imiona, akcenty i szybkie dygresje to miejsca, w których zawodzą. Transkrypcja z dźwięku, w filmie, który nigdy nie miał napisów, ma ten sam rodzaj ograniczenia: tekst podąża za nagraniem. Tłumacz dopiero po przyjrzeniu się wersowi źródłowemu, który cię interesuje — nie wcześniej.
Utrzymaj zgodność znaczników czasu
Czas pozostaje na miejscu, bo tłumaczenie nie odbudowuje osi czasu. Każdy wers zachowuje początek i długość, jakie miał, zanim zmieniło się sformułowanie. Wymieniany jest tylko tekst. Zdanie, które zaczynało się o 1:02, nadal zaczyna się o 1:02 w tłumaczeniu — nawet gdy nowe brzmienie jest dłuższe lub krótsze od oryginału.

Dzięki temu tłumaczenie pozostaje przypisane do konkretnego momentu w filmie. Przetłumaczony wers to etykieta na oryginalnej chwili, a nie nowe wykonanie z własnym rytmem. Czas obok wersu to nadal ta sama chwila w filmie źródłowym. Słyszysz oryginalną mowę, a czytasz tłumaczenie. Nie słyszysz dubbingu, bo nie powstało żadne nowe nagranie audio.
Eksport korzysta z tych samych czasów. TXT tłumaczenia to wyłącznie przetłumaczone słowa, jedna linia na wers, bez czasów. SRT i VTT zachowują początek i koniec, aby edytor lub odtwarzacz internetowy mógł pokazać przetłumaczony wers. Koniec to koniec oryginalnego wersu, przycięty tak, by nie nachodził na następny. Odtwarzacz pokazuje wtedy jedną linię naraz, zamiast nakładać dwie.
Dłuższe tłumaczenie to część, którą ludzie najczęściej rozumieją błędnie. Wers nie rozciąga się, by zmieścić nowe zdanie. Słowa muszą zmieścić się w oryginalnym oknie. Krótka angielska linia, która staje się długą linią niemiecką, wciąż kończy się wtedy, gdy kończył się oryginalny wers. Na ekranie odtwarzacz może zawinąć więcej tekstu w ten sam przedział. Plik nie przesunął czasów filmu pod głos czytający tłumaczenie. Jeśli później nagrasz dubbing, sam dopasujesz jego czasy. Ten eksport nie zrobi tego za ciebie.
Czytnik może pokazywać czas rozpoczęcia obok każdej przetłumaczonej linii, gdy ją sprawdzasz. Kopiowanie fragmentu, podobnie jak eksport TXT, zabiera słowa i pomija czasy. Jeśli czas ma wędrować razem ze zdaniem, użyj SRT lub VTT albo zapisz czas obok zdania, które wklejasz do notatek. Zgodność jest przydatna tylko wtedy, gdy trzymasz ją przy linii, którą zamierzasz zacytować.
Clean, jeśli go uruchomisz, to osobny przebieg. Poprawia gramatykę, interpunkcję i błędy rozpoznawania w tekście, zachowując czasy. To nie jest tłumaczenie. Język zmienia funkcja Translate. Uruchom Clean na źródle, gdy wers jest zniekształcony, a następnie przetłumacz — żeby nie zamienić błędu rozpoznawania w pewne siebie, błędne zdanie w innym języku.
Częste pułapki
Najczęstszy błąd to tłumaczenie niewłaściwego obiektu. Tytuły na ekranie, slajdy sfilmowane kamerą i napisy wypalone w obrazie nie trafiają do transkryptu, więc nie pojawią się w innym języku. Jeśli sens filmu tkwi w tych grafikach, a głos nigdy go nie wypowiada, tłumaczenie go nie odzyska. Czytałbyś wyłącznie mowę.

Kolejny błąd to oczekiwanie nowej ścieżki dźwiękowej. Przy tłumaczeniu transkrypcji z YouTube na tekst jedyne, co możesz zachować, to brzmienie słów. Nie dostajesz zastępczego głosu, dubbingu dopasowanego do ruchu warg ani osi czasu przebudowanej wokół długości przetłumaczonego zdania. Oryginalne audio pozostaje zegarem. Dubbing to osobna edycja.
Inny błąd to tłumaczenie krótkiego streszczenia i oczekiwanie czasów na poziomie linii. Podsumowanie, Kluczowe punkty i Podsumowanie rozdziałów to krótsze widoki tego samego transkryptu. Są przydatne, zanim przeczytasz każdą linię. To nie jest przetłumaczony transkrypt i nie dają jednego wersu z czasem na każdą wypowiedzianą linię. Tłumaczenie, które zachowuje zgodność, działa na samych liniach transkryptu. Study Notes, Meeting Summary, Creator Repurpose, Moments i Mapa myśli to inne widoki tego tekstu. Żaden z nich nie jest zmianą języka. Mapa myśli potrafi wskazać węzłem konkretny moment, co pomaga nawigować. Wciąż nie jest to przetłumaczone brzmienie każdej linii.
Nazwy własne, liczebniki i idiomy wymagają ludzkiego oka. Nazwa może zostać przetransliterowana, częściowo przetłumaczona albo pozostawiona tak, jak ją usłyszano. Żart, który opiera się na języku oryginału, nie przetrwa dosłownego tłumaczenia linia po linii. Zanim zacytujesz tłumaczenie jako to, co powiedział mówca, otwórz znacznik czasu i posłuchaj. Tłumaczenie to interpretacja wersu. Nagranie jest źródłem.
Szybka mowa w krótkim wersie ma to samo praktyczne ograniczenie co długie tłumaczenie. Okno zostało wyznaczone przez oryginalną linię. Jeśli wrzucisz SRT do edytora i przetłumaczony wers wyda się ciasny, rozdziel go lub przepisz w edytorze. Nie oczekuj, że eksport wydłużył ten moment.
Film z niemal zerową ilością mowy przetłumaczy się na niemal nic. Cisza, muzyka i brawa nie są zdaniami. Jeśli transkrypt to kilka linijek, tłumaczenie też będzie kilkoma linijkami. To właściwość źródła, a nie porażka języka docelowego.
Jeśli transkrypcja nigdy się nie zaczyna, tłumaczenie również nie. Najczęstszą przyczyną jest film, do którego nie ma publicznego dostępu.
Jeżeli celem jest ścieżka napisów ze znacznikami czasu dla odtwarzacza, wyeksportuj przetłumaczone linie jako SRT lub VTT. Strona o tworzeniu takiej ścieżki na podstawie linku do YouTube — jako napisów, a nie tekstu do czytania — to generator napisów YouTube. Z tego artykułu korzystaj, gdy chodzi o samo przetłumaczone sformułowanie, łącznie z plikiem ze znacznikami czasu. Z generatora napisów korzystaj, gdy chodzi o samą ścieżkę napisów.
Gdy nakładka wystarcza, oglądaj z nią. Gdy potrzebujesz słów w innym języku wraz z zachowanym oryginalnym momentem, wygeneruj transkrypcję, przetłumacz linie i zachowaj znaczniki czasu. Generator transkrypcji z YouTube to miejsce, w którym ten publiczny link staje się tekstem, który następnie tłumaczysz.
Transkrypcja
Zamień dowolne wideo w tekst
Wklej link do YouTube, TikTok lub Instagram i czytaj transkrypcję ze znacznikami czasu w każdym wierszu.
Eksport w formatach TXT, SRT lub VTT.