유튜브 자막 추출로 영상 텍스트 번역, 타임스탬프 유지
유튜브 자막 추출 후 대사를 먼저 생성하고 번역합니다. 각 줄은 원본 타임스탬프를 유지합니다.

유튜브 영상을 텍스트로 번역하려면 먼저 한 말을 받아 적고, 그다음 그 줄들을 번역합니다. 번역 대상이 되는 것은 영상 화면이 아니라 말로 한 내용입니다. YouTube는 영상이 재생되는 동안 자막을 보여줄 수 있고, 일부 영상에서는 시청하는 내내 플레이어가 번역된 자막을 화면 위에 겹쳐 그려 줍니다. 하지만 그 오버레이는 시청을 그만두면 함께 사라집니다. 인용하거나 검색하거나 다른 사람에게 건넬 수 있는 번역은, 각 줄이 여전히 원래 시점을 가리키는 번역된 스크립트입니다.
YouTube의 스크립트 보기 도움말은 읽기 화면을 설명합니다. 설명란에서 스크립트 표시를 열고, 현재 줄을 따라가고, 줄을 클릭해 해당 위치로 이동하는 방식입니다. 하지만 번역된 문서에 대해서는, 그리고 그것을 저장하는 방법에 대해서는 설명하지 않습니다. 이 페이지의 나머지 부분은 그 문서를 만들어 내는 순서를 다룹니다. 스크립트를 생성하세요. 줄을 번역하세요. 시간은 원래 있던 자리에 그대로 둡니다.
스크립트를 번역하는 이유
영상 파일이 아니라 스크립트를 번역하는 이유는, 결국 다시 쓰게 되는 것이 바로 그 말이기 때문입니다. 귀로 듣는 것보다 글로 읽을 때 더 잘 따라가는 강의, 노트에 쓰는 언어로 인용해야 하는 주장, 다른 시청자층을 위해 자막을 달게 될 클립은 모두 같은 대상에서 출발합니다. 바로 텍스트로 옮긴 말의 줄들입니다. MP4를 번역한다고 해서 그 텍스트가 나오지는 않습니다. 새로운 음성 트랙을 더빙해도 마찬가지입니다. 그것들은 서로 다른 작업이며, 이 페이지에서 다루는 내용이 아닙니다.
일부 시청자에게는 오버레이만으로 충분합니다. 플레이어가 이미 번역을 보여 주고 있고 한 번만 볼 예정이라면 그대로 두세요. 하지만 탭을 닫은 뒤에도 그 표현이 필요할 때, 특정 구절을 검색해야 할 때, 번역을 문서나 편집기로 옮겨야 할 때는 오버레이만으로는 부족합니다. 오버레이는 화면 표시일 뿐이고, 스크립트가 바로 텍스트입니다.
스크립트는 번역할 수 있는 범위에도 분명한 선을 긋습니다. 대상이 되는 것은 말입니다. 화면에 박혀 있는 타이틀 카드, 하단 자막 띠, 그 밖에 영상에 그려 넣은 문자는 읽지 않으므로 번역되지 않습니다. 말이 거의 또는 전혀 없는 뮤직비디오는 받아 적을 말이 적어 결과도 빈약합니다. 두 사람이 동시에 말하거나, 주변이 시끄럽거나, 마이크 소리가 먹먹하면 원본 줄의 품질이 떨어지고, 이미 틀린 줄은 번역으로 고칠 수 없습니다. 번역문을 인용으로 쓰기 전에 원본을 타임스탬프와 대조해 확인하세요.
링크는 공개 상태여야 합니다. 비공개 영상, 삭제된 영상, 멤버십 전용 영상, 또는 다른 사람의 계정 안에서만 재생되는 링크는 공개 URL을 붙여 넣어도 열리지 않습니다. 연령 제한과 지역 제한도 같은 요청을 막을 수 있습니다. YouTube가 제공하지 않는 영상을 억지로 재생하게 만드는 스위치는 없습니다.
먼저 생성하고 그다음 번역
번역은 두 번째 단계입니다. 첫 번째 단계는 자막이나 음성의 언어로 된 스크립트입니다. 그 단계를 건너뛰면 줄 단위로 번역할 대상이 없습니다. 요약이나 댓글 스레드, 영상 설명은 대신할 수 없습니다. 그것들은 말의 순서가 아니고, 줄마다 시간도 담고 있지 않습니다.

transcript.im에서는 다음 순서로 진행합니다.
- 다른 언어로 보고 싶은 공개 영상의 URL을 복사합니다.
- 대상 언어를 고르기 전에 URL을 붙여 넣고 줄을 생성합니다. 영상에 이미 있는 자막이 원본입니다. 그 자막이 없을 때만 음성을 텍스트로 옮깁니다.
- 그 줄에 번역을 실행하고 지원되는 언어 하나를 고릅니다. 문구는 바뀌지만 YouTube에 업로드된 영상은 바뀌지 않습니다.
- 번역된 줄을 원래 시간과 대조해 확인합니다. 번역을 브라우저 밖에서 써야 할 때는 내보냅니다.
유튜브 자막 추출을 번역하려면 링크만 있으면 됩니다. 영상을 다시 업로드하지 않고, 나중에 줄을 고치는 경우가 아니라면 번역문을 손으로 입력하지도 않습니다. 수정 사항은 내 복사본에만 남습니다. 원본 업로드에 다시 기록되지는 않습니다.
대상 언어는 지원되는 언어 중 하나입니다. 아랍어, 중국어(간체), 영어, 프랑스어, 독일어, 힌디어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어입니다. 여기서 중국어는 간체이며, 번체는 별도의 대상이 아닙니다. 포르투갈어는 국가별로 나뉘지 않은 하나의 대상입니다. 필요한 언어가 이 목록에 없다면 이 단계에서 만들어 내지는 않습니다. 도구가 실제로 제공하는 대상 언어를 고르거나, 그 언어를 제공하는 다른 곳에서 내보낸 텍스트를 번역하고, 큐 시간을 직접 옮겨 담지 않는 한 두 번째 도구가 시간을 유지하지 못할 수 있다는 점을 감수하세요.
원본 언어는 자막이나 음성이 원래 사용하던 언어입니다. 일본어로 말한 영상은 스페인어로 읽을 생각이더라도 우선 일본어 줄로 나옵니다. 번역은 나중에 고르는 대상 언어이며, 다른 대상 언어는 같은 원본 줄에 대한 별도의 번역입니다. 스페인어에서 독일어로 바꾸는 것은 스페인어 결과를 독일어로 고쳐 주는 것이 아니라, 원본을 다시 번역하는 것입니다.
자동 자막이 있다면, 그것이 여전히 소스입니다. 자막 트랙의 품질만큼만 정확합니다. 이름, 억양, 빠르게 지나가는 부가 설명에서 틀어지기 마련입니다. 자막이 한 번도 없던 영상의 오디오를 받아쓰는 것도 같은 한계를 가집니다. 텍스트는 녹음된 내용을 따라갑니다. 번역은 관심 있는 소스 줄을 먼저 확인한 뒤에 하십시오. 그 전에 하지 마시고요.
타임스탬프 정렬 유지하기
시간은 그대로 유지됩니다. 번역이 타임라인을 다시 만들지 않기 때문입니다. 각 줄은 문구가 바뀌기 전의 시작 시각과 길이를 그대로 유지합니다. 바뀌는 것은 텍스트뿐입니다. 1:02에 시작한 문장은 번역에서도 여전히 1:02에 시작합니다. 새 문구가 원문보다 길든 짧든 마찬가지입니다.

그래서 번역이 영상 속 특정 순간에 붙어 있게 됩니다. 번역된 줄은 원래 순간에 붙은 이름표이지, 나름의 속도를 가진 새로운 연기가 아닙니다. 줄 옆의 시간은 여전히 원본 영상의 그 순간입니다. 원래 음성은 듣고, 번역은 읽습니다. 더빙된 목소리는 들리지 않습니다. 새 오디오를 만들지 않았기 때문입니다.
내보내기도 같은 시간을 사용합니다. 번역의 TXT는 번역된 단어만 담고, 큐당 한 줄이며, 시간은 빠집니다. SRT와 VTT는 시작과 끝을 유지해 편집기나 웹 플레이어가 번역된 큐를 표시할 수 있습니다. 끝은 원래 줄의 끝이며, 다음 큐와 겹치지 않도록 다듬어집니다. 그러면 플레이어가 두 줄을 겹쳐 보여주는 대신 한 번에 한 줄씩 표시합니다.
번역이 길어지는 부분을 사람들이 잘못 이해합니다. 큐는 새 문장에 맞춰 늘어나지 않습니다. 단어들은 원래 창 안에 들어가야 합니다. 짧은 영어 줄이 긴 독일어 줄이 되어도 원래 큐가 끝나는 시점에 그대로 끝납니다. 화면에서는 플레이어가 같은 구간에 더 많은 텍스트를 줄바꿈해 넣을 수 있습니다. 이 파일은 번역을 말하는 목소리에 맞춰 영상의 시간을 다시 맞추지 않았습니다. 나중에 더빙을 녹음한다면 그 더빙의 시간은 직접 맞추셔야 합니다. 이 내보내기가 대신 해주지 않습니다.
뷰어는 확인하는 동안 각 번역 줄 옆에 시작 시간을 표시할 수 있습니다. TXT 내보내기처럼 구절을 복사하면 단어만 가져가고 시간은 빠집니다. 시간이 문장과 함께 다녀야 한다면 SRT나 VTT를 사용하거나, 메모에 붙여넣을 문장 옆에 시간을 적어 두십시오. 정렬은 인용하려는 줄에 붙어 있을 때만 쓸모가 있습니다.
Clean은 실행한다면 별개의 작업입니다. 텍스트의 문법, 구두점, 인식 오류를 고치고 시간은 유지합니다. 번역이 아닙니다. 언어를 바꾸는 작업은 Translate입니다. 줄이 엉망일 때 소스에 Clean을 실행한 뒤 번역하십시오. 그래야 인식 오류를 다른 언어의 자신감 넘치는 잘못된 문장으로 번역하는 일이 없습니다.
흔한 실수
가장 흔한 실수는 잘못된 대상을 번역하는 것입니다. 화면에 나오는 제목, 카메라로 찍은 슬라이드, 영상에 새겨진 자막은 대본에 없으므로 다른 언어로 나오지 않습니다. 영상의 의미가 그 그래픽에 있고 음성이 그것을 말하지 않는다면, 번역이 그것을 되살리지 못합니다. 음성만 읽게 되는 것입니다.

다음으로 흔한 실수는 새 사운드트랙을 기대하는 것입니다. 유튜브 자막 추출을 해도 남길 수 있는 것은 바로 문구입니다. 대체 목소리도, 입모양에 맞춘 더빙도, 번역된 문장 길이에 맞춰 다시 짜인 타임라인도 얻지 못합니다. 원본 오디오가 계속 기준 시계 역할을 합니다. 더빙은 별도의 편집입니다.
또 다른 실수는 짧게 요약한 내용을 번역하면서 줄 단위 시간을 기대하는 것입니다. 요약, 핵심 포인트, 챕터 요약은 같은 대본을 더 짧게 본 것입니다. 모든 줄을 읽기 전에 유용합니다. 번역된 대본이 아니며, 말한 줄마다 시간이 붙은 큐를 주지도 않습니다. 정렬을 유지하는 번역은 대본 줄 자체에서 이루어집니다. Study Notes, Meeting Summary, Creator Repurpose, Moments, 마인드맵은 그 텍스트의 다른 보기입니다. 그중 어느 것도 언어 변경은 아닙니다. 마인드맵은 노드를 특정 순간에 가리킬 수 있어 탐색에 도움이 됩니다. 그래도 각 줄의 번역된 문구는 아닙니다.
고유명사, 숫자, 관용구는 사람이 직접 살펴야 합니다. 이름은 음차될 수도, 반쯤 번역될 수도, 들린 그대로 남을 수도 있습니다. 원래 언어에 기대는 농담은 그대로 줄줄이 옮기는 방식으로는 살아남지 못합니다. 번역을 화자가 한 말이라고 인용하기 전에, 타임스탬프를 열어 들어 보십시오. 번역은 그 줄을 옮긴 것입니다. 녹음이 소스입니다.
짧은 큐에 담긴 빠른 말도 긴 번역과 같은 현실적 한계를 가집니다. 창은 원래 줄에 의해 정해졌습니다. SRT를 편집기에 넣었는데 번역된 큐가 답답하게 느껴지면, 편집기에서 그 큐를 나누거나 다시 쓰십시오. 내보내기가 그 순간을 늘려 주리라 기대하지 마십시오.
말이 거의 없는 영상은 번역해도 거의 아무것도 나오지 않습니다. 침묵, 음악, 박수는 문장이 아닙니다. 대본이 몇 줄뿐이라면 번역도 몇 줄뿐입니다. 그것은 소스의 성질이지, 대상 언어의 실패가 아닙니다.
자막이 아예 시작되지 않으면 번역도 시작되지 않습니다. 흔한 원인은 영상이 공개 상태가 아니어서 접근할 수 없기 때문입니다.
플레이어에서 쓸, 시간 정보가 붙은 자막 트랙이 목적이라면 번역한 문장을 SRT 또는 VTT로 내보내십시오. YouTube 링크에서 그런 트랙을, 읽기용 텍스트가 아니라 자막으로 만드는 방법은 유튜브 자막 생성기에서 다룹니다. 번역된 문구 자체가 목적이라면 그 문구의 시간 정보 파일까지 포함해 이 글을 보십시오. 자막 트랙 자체가 목적이라면 자막 생성기를 사용하십시오.
오버레이로 충분하다면 그대로 켜 두고 시청하십시오. 다른 언어의 문장과 원래 장면을 함께 확인해야 한다면, 자막을 추출하고 문장을 번역한 뒤 시간 정보를 유지하십시오. 유튜브 스크립트 추출에서 그 공개 링크가 곧 번역할 텍스트가 됩니다.
전사 생성기
어떤 영상이든 텍스트로
YouTube, TikTok, Instagram 링크를 붙여넣으면 각 줄에 타임스탬프가 붙은 전사 텍스트를 읽을 수 있습니다.
TXT, SRT, VTT로 내보낼 수 있습니다.