Dịch chép lời video YouTube, giữ nguyên mốc thời gian
Dịch chép lời video YouTube sang văn bản: tạo lời thoại trước rồi mới dịch. Mỗi dòng giữ nguyên mốc thời gian của thời điểm gốc.

Để chuyển một video YouTube thành văn bản, hãy ghi lại những gì đã được nói, rồi dịch những dòng đó. Hình ảnh không phải là thứ được dịch. Lời nói mới là. YouTube có thể hiển thị phụ đề cho bạn trong khi video phát, và ở một số video, trình phát có thể vẽ phụ đề đã dịch đè lên hình trong suốt thời gian bạn xem. Lớp phủ đó biến mất khi bạn rời đi. Một bản dịch mà bạn có thể trích dẫn, tìm kiếm hay đưa cho người khác chính là một bản chép lời đã được dịch, với mỗi dòng vẫn trỏ đúng về thời điểm gốc.
Trang trợ giúp về cách xem bản chép lời của YouTube mô tả chế độ đọc: mở Show transcript trong phần mô tả, theo dõi dòng hiện tại, bấm vào một dòng để nhảy tới. Trang đó không mô tả một tài liệu đã dịch, cũng không nói cách lưu lại một tài liệu như vậy. Phần còn lại của trang này là trình tự để tạo ra tài liệu đó. Tạo bản chép lời. Dịch các dòng. Giữ nguyên mốc thời gian.
Vì sao nên dịch bản chép lời
Lý do nên dịch bản chép lời thay vì dịch tệp video nằm ở chỗ phần chữ mới là thứ bạn sẽ tái sử dụng. Một bài giảng bạn theo dõi bằng chữ tốt hơn bằng tai, một nhận định bạn cần trích dẫn bằng ngôn ngữ ghi chú của mình, và một đoạn cắt bạn sẽ gắn phụ đề cho một nhóm khán giả khác — tất cả đều bắt đầu từ cùng một thứ: những lời đã nói, ở dạng văn bản. Dịch tệp MP4 không tạo ra phần văn bản đó. Lồng một track thoại mới cũng không tạo ra nó. Đó là những công việc khác, và trang này không bàn về chúng.
Một số người xem chỉ cần lớp phủ. Nếu trình phát đã hiển thị bản dịch và bạn chỉ xem một lần, cứ ở lại đó. Hãy rời khỏi đó khi bạn cần nguyên văn sau khi đóng thẻ, khi bạn cần tìm một cụm từ, hoặc khi bản dịch phải được đưa vào một tài liệu hay trình soạn thảo. Lớp phủ là để hiển thị. Bản chép lời mới là văn bản.
Bản chép lời cũng vạch ra ranh giới rõ ràng cho những gì có thể dịch. Lời nói nằm trong phạm vi đó. Thẻ tiêu đề gắn cứng vào hình, chữ chèn ở góc dưới màn hình và những văn bản khác được vẽ vào hình thì không được đọc, nên cũng không được dịch. Một video ca nhạc có ít hoặc không có lời nói sẽ cho ra kết quả mỏng, vì chẳng có mấy lời để ghi lại. Hai người cùng nói một lúc, một căn phòng ồn ào và micro bị bóp nghẹt tiếng đều làm suy yếu các dòng gốc, và bản dịch không thể sửa được một dòng vốn đã sai. Hãy đối chiếu bản gốc với mốc thời gian trước khi bạn coi bản dịch là một trích dẫn.
Đường dẫn phải là công khai. Một video riêng tư, video đã bị xóa, video chỉ dành cho thành viên, hoặc một đường dẫn chỉ phát được trong tài khoản của người khác sẽ không mở được từ một URL công khai được dán vào. Giới hạn độ tuổi và giới hạn khu vực cũng có thể chặn cùng một yêu cầu đó. Không có công tắc nào có thể ép YouTube phục vụ một video mà nó không chịu phục vụ.
Tạo trước, dịch sau
Dịch là bước thứ hai. Bước thứ nhất là bản chép lời, bằng ngôn ngữ của phụ đề hoặc của lời nói. Bỏ qua bước đó thì không còn gì dạng dòng để dịch. Một bản tóm tắt, một chuỗi bình luận hay phần mô tả video đều không thay thế được. Chúng không phải là chuỗi lời đã nói, và chúng không kèm mốc thời gian cho từng dòng.

Trên transcript.im, hãy làm theo trình tự sau:
- Sao chép URL của video công khai mà bạn muốn chuyển sang ngôn ngữ khác.
- Dán URL và tạo các dòng trước khi bạn chọn ngôn ngữ đích. Phụ đề đã có sẵn trên video chính là nguồn. Lời nói chỉ được chép lại khi video không có phụ đề đó.
- Chạy tính năng Dịch trên những dòng đó và chọn một ngôn ngữ được hỗ trợ. Phần chữ thay đổi. Còn bản tải lên trên YouTube thì không.
- Đối chiếu dòng đã dịch với mốc thời gian gốc của nó. Xuất ra khi bản dịch cần được dùng ngoài trình duyệt.
Để chép lời video YouTube, bạn đã có sẵn đường dẫn. Bạn không cần tải lại video lên, và bạn không phải gõ bản dịch bằng tay, trừ khi bạn muốn sửa lại một dòng sau đó. Bản sửa chỉ nằm trong bản sao của bạn. Nó không được ghi ngược trở lại bản tải lên gốc.
Ngôn ngữ đích là một trong các ngôn ngữ được hỗ trợ: tiếng Ả Rập, tiếng Trung (Giản thể), tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Hindi, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha. Tiếng Trung ở đây là Giản thể, không phải một ngôn ngữ đích Phồn thể riêng. Tiếng Bồ Đào Nha là một ngôn ngữ đích, không chia theo quốc gia. Nếu ngôn ngữ bạn cần không có trong danh sách đó, bước này sẽ không tự tạo ra nó. Hãy chọn một ngôn ngữ đích mà công cụ thực sự cung cấp, hoặc dịch phần văn bản đã xuất ở một nơi có hỗ trợ ngôn ngữ đó, và chấp nhận rằng công cụ thứ hai có thể không giữ mốc thời gian, trừ khi bạn tự mang chúng theo.
Ngôn ngữ nguồn chính là ngôn ngữ mà phụ đề hoặc lời nói vốn có. Một video nói bằng tiếng Nhật sẽ trả về các dòng tiếng Nhật trước, kể cả khi bạn định đọc bản tiếng Tây Ban Nha. Bản dịch là một lựa chọn ngôn ngữ đích về sau, và một ngôn ngữ đích khác là một bản dịch riêng của cùng những dòng nguồn. Chuyển từ tiếng Tây Ban Nha sang tiếng Đức không phải là sửa kết quả tiếng Tây Ban Nha thành tiếng Đức. Nó dịch lại từ nguồn.
Phụ đề tự động, khi tồn tại, vẫn chính là nguồn. Chúng chỉ đáng tin đúng bằng bản phụ đề đó. Tên riêng, giọng địa phương và những lời bình phụ nhanh là chỗ chúng hay sai. Chép lời trực tiếp từ âm thanh, với một video chưa từng được gắn phụ đề, cũng có kiểu giới hạn tương tự: văn bản bám theo bản ghi âm. Hãy dịch sau khi đã xem dòng gốc mà bạn quan tâm, chứ không phải trước đó.
Giữ mốc thời gian khớp
Mốc thời gian giữ nguyên vì bản dịch không dựng lại dòng thời gian. Mỗi dòng giữ nguyên điểm bắt đầu và độ dài như trước khi câu chữ thay đổi. Chỉ phần văn bản được thay. Một câu bắt đầu ở 1:02 vẫn bắt đầu ở 1:02 trong bản dịch, kể cả khi câu chữ mới dài hơn hay ngắn hơn bản gốc.

Đó là cách bản dịch bám chặt vào khoảnh khắc trong video. Dòng đã dịch là một cái nhãn gắn lên đúng khoảnh khắc gốc, không phải một màn trình diễn mới có nhịp điệu riêng. Mốc thời gian bên cạnh dòng vẫn là khoảnh khắc đó trong video nguồn. Bạn nghe lời nói gốc và đọc bản dịch. Bạn không nghe thấy giọng lồng tiếng, vì không có âm thanh mới nào được tạo ra.
Phần xuất file cũng dùng đúng những mốc thời gian đó. TXT của bản dịch chỉ gồm phần chữ đã dịch, mỗi dòng một cue, không kèm mốc thời gian. SRT và VTT giữ cả điểm bắt đầu lẫn điểm kết thúc để trình biên tập hoặc trình phát trên web hiển thị được cue đã dịch. Điểm kết thúc chính là điểm kết thúc của dòng gốc, được cắt ngắn để không chồng lên cue kế tiếp. Nhờ vậy trình phát hiện từng dòng một thay vì xếp chồng hai dòng.
Bản dịch dài hơn là chỗ người ta hay hiểu nhầm. Cue không tự dài ra cho vừa câu mới. Các từ phải nằm gọn trong khung thời gian gốc. Một dòng tiếng Anh ngắn trở thành một dòng tiếng Đức dài vẫn kết thúc đúng lúc cue gốc kết thúc. Trên màn hình, trình phát có thể xuống dòng để nhồi thêm chữ vào cùng khoảng thời gian đó. File không chỉnh lại thời gian của video cho khớp với một giọng đọc bản dịch. Nếu sau này bạn thu âm phần lồng tiếng, bạn sẽ tự canh thời gian cho bản lồng tiếng đó. Phần xuất này sẽ không làm thay bạn.
Trình đọc có thể hiển thị mốc thời gian bắt đầu bên cạnh mỗi dòng đã dịch để bạn kiểm tra. Khi sao chép đoạn văn, giống như xuất TXT, bạn chỉ lấy phần chữ và bỏ mốc thời gian. Nếu muốn mốc thời gian đi kèm câu, hãy dùng SRT hoặc VTT, hoặc ghi mốc thời gian bên cạnh câu bạn dán vào ghi chú. Việc khớp thời gian chỉ hữu ích khi bạn giữ nó gắn với đúng dòng mình sắp trích dẫn.
Clean, nếu bạn chạy, là một lượt xử lý khác. Nó sửa lỗi ngữ pháp, dấu câu và lỗi nhận dạng trong văn bản, đồng thời giữ nguyên mốc thời gian. Đây không phải là bản dịch. Translate mới là lượt thay đổi ngôn ngữ. Hãy chạy Clean trên bản gốc khi một dòng bị rối, rồi mới dịch, để bạn không dịch một lỗi nhận dạng thành một câu sai đầy tự tin ở ngôn ngữ kia.
Những lỗi thường gặp
Lỗi thường gặp nhất là dịch nhầm đối tượng. Tiêu đề trên màn hình, slide được quay bằng camera và phụ đề cháy cứng vào hình đều không nằm trong bản chép lời, nên chúng không xuất hiện ở ngôn ngữ kia. Nếu ý nghĩa của video nằm ở những hình ảnh đó mà giọng nói không hề nói ra, bản dịch sẽ không thể khôi phục lại. Bạn chỉ đang đọc phần lời nói mà thôi.

Lỗi tiếp theo là mong đợi một bản âm thanh mới. Khi bạn dịch bản chép lời video YouTube, thứ bạn giữ được là câu chữ. Bạn không nhận được giọng đọc thay thế, bản lồng tiếng khớp khẩu hình, hay dòng thời gian được dựng lại theo độ dài của câu đã dịch. Âm thanh gốc vẫn là chiếc đồng hồ. Lồng tiếng là một bản dựng riêng.
Một lỗi khác là dịch một bản tóm tắt ngắn rồi mong có mốc thời gian theo từng dòng. Summary, Core Points và Chapter Summary là những góc nhìn ngắn gọn hơn của cùng một bản chép lời. Chúng hữu ích trước khi bạn đọc từng dòng. Chúng không phải là bản chép lời đã dịch, và không cho bạn một cue kèm mốc thời gian cho mỗi dòng nói. Bản dịch giữ được sự khớp thời gian chạy trên chính các dòng của bản chép lời. Study Notes, Meeting Summary, Creator Repurpose, Moments và MindMap là những góc nhìn khác của văn bản đó. Không cái nào trong số đó là phần thay đổi ngôn ngữ. MindMap có thể trỏ một nút vào một thời điểm, giúp bạn điều hướng. Nhưng nó vẫn không phải là câu chữ đã dịch của từng dòng.
Danh từ riêng, chữ số và thành ngữ cần có con người xem lại. Một cái tên có thể bị phiên âm, dịch nửa vời, hoặc để nguyên như khi nghe được. Một câu đùa phụ thuộc vào ngôn ngữ gốc sẽ không thể sống sót qua lối dịch thẳng từng dòng. Trước khi bạn trích dẫn bản dịch như thể đó là lời người nói, hãy mở mốc thời gian và nghe lại. Bản dịch là một cách diễn đạt lại của dòng đó. Bản ghi âm mới là nguồn.
Lời nói nhanh trong một cue ngắn cũng có cùng giới hạn thực tế như một bản dịch dài. Khung thời gian do dòng gốc đặt ra. Nếu bạn đưa file SRT vào trình biên tập mà thấy cue đã dịch bị chật, hãy tách hoặc viết lại cue đó trong trình biên tập. Đừng mong phần xuất đã kéo dài khoảnh khắc đó.
Một video gần như không có lời nói sẽ dịch ra gần như không có gì. Im lặng, nhạc và tiếng vỗ tay không phải là câu. Nếu bản chép lời chỉ có vài dòng, bản dịch cũng chỉ có vài dòng. Đó là đặc tính của nguồn, không phải ngôn ngữ đích thất bại.
Nếu transcript không bao giờ bắt đầu thì bản dịch cũng không bao giờ bắt đầu. Nguyên nhân thường gặp là video không thể truy cập công khai.
Nếu đích đến là tệp phụ đề có mốc thời gian dành cho trình phát, hãy xuất SRT hoặc VTT của các dòng đã dịch. Trang hướng dẫn tạo loại tệp đó từ một liên kết YouTube, dưới dạng phụ đề chứ không phải văn bản để đọc, là trình tạo phụ đề YouTube. Hãy dùng bài viết này khi công việc là dịch nội dung chữ, kể cả tệp gắn mốc thời gian của nội dung đó. Hãy dùng trình tạo phụ đề khi công việc chính là bản thân tệp phụ đề.
Khi lớp phụ đề hiển thị đã đủ, hãy xem luôn cùng nó. Khi bạn cần nội dung bằng ngôn ngữ khác và gắn với thời điểm gốc, hãy tạo transcript, dịch từng dòng và giữ nguyên mốc thời gian. Công cụ chép lời video YouTube là nơi liên kết công khai đó trở thành văn bản để bạn dịch.
Trình tạo bản ghi
Biến mọi video thành văn bản
Dán liên kết YouTube, TikTok hoặc Instagram và đọc bản ghi, kèm mốc thời gian trên mỗi dòng.
Xuất dưới dạng TXT, SRT hoặc VTT.