BillionVerify 소개: 수십억 개의 이메일을 1% 비용으로 검증하세요. BillionVerify 사용해 보기

transcript.im
← 블로그

유튜브 자막 추출: TXT, SRT, VTT 다운로드

작성자 LeoYouTube

유튜브 자막 추출로 영상 속 말을 TXT, SRT, VTT로 저장하고, 영상 저장 없이 유튜브에서 자막을 내려받는 방법입니다.

유튜브 자막 추출: TXT, SRT, VTT 다운로드

유튜브 자막 추출은 YouTube 영상에서 말한 내용을 파일로 저장해, 시청 페이지가 사라진 뒤에도 열어 볼 수 있게 한 것입니다. YouTube가 자체 제공하는 대본 보기는 자막 보기 도움말에 설명되어 있으며, 스크롤되는 자막 줄 목록입니다. 따라 읽다가 줄을 클릭하면 플레이어에서 그 위치로 이동합니다. 그 도움말에는 보관할 수 있는 문서는 나오지 않습니다. 이 페이지는 파일에 관한 이야기입니다.

이 파일은 영상도 아닙니다. MP4는 화면을 담고, MP3는 소리를 담습니다. 둘 다 말한 내용 자체는 아닙니다. 이 파일은 플레이어가 화면 위에 표시하는 자막 트랙을 저장하는 것과도 다른 작업입니다. 그 자막 파일 저장이 바로 유튜브 자막 다운로더가 하는 일입니다. 여기서 다루는 대상은 말한 내용을 글로 옮긴 대본이며, 다음에 무엇을 할지에 따라 형식을 고릅니다.

'대본 내려받기'의 의미

이 글에서 '내려받기'는 말한 내용을 이름이 있는 파일로 저장하는 것을 뜻합니다. 영상에 제작자의 자막 트랙이 있으면 그 줄들을 가져옵니다. 없으면 음성 자체를 전사한 결과를 사용합니다. 어느 쪽이든 결과물은 말한 내용의 나열이며, 시청 페이지의 복사본이 아닙니다.

다운로드한 스크립트는 동영상 파일이 아니라 타임스탬프가 있는 발화 텍스트 파일입니다

그 페이지에서 관련 있어 보이지만 파일이 아닌 것들이 몇 가지 있습니다. 설명은 제작자가 적은 소개글입니다. 챕터는 영상에 있는 경우 이동 지점일 뿐입니다. 화면에 뜨는 타이틀 카드와 영상에 새겨진 자막은 화면 속 픽셀일 뿐, 텍스트로 읽히지 않습니다. 댓글은 다른 사람이 쓴 글입니다. 파일은 그것들을 건너뛰고 말한 내용만 담습니다.

그 도움말은 읽기와 이동만 다루며, 이미 자막이 있는 영상에서만 해당합니다. 이 페이지는 그 화면을 여는 동작을 반복하지 않습니다. 자막이 한 번도 달리지 않은 영상이라면 패널에 줄이 없지만, 음성을 전사해 파일을 만들 수는 있습니다. 플레이어 옆에서 읽는 일은 탭을 닫으면 끝납니다. 유튜브 자막 추출은 다음 날에도 남아 있는 사본입니다.

파일의 품질은 원본 발화만큼만 선명합니다. 조용한 토킹헤드 영상은 목소리 밑으로 차량 소리가 깔리는 거리 인터뷰보다 읽기 쉽습니다. 여러 사람이 겹쳐 말하면 한 줄로 뭉칩니다. 자막 트랙이 한 번도 제대로 적지 않은 이름은 내보냈다고 해서 맞게 바뀌지 않습니다. 인용할 자막 구간은 반드시 확인하십시오.

붙여 넣는 URL은 누구나 열 수 있는 공개 상태여야 합니다. 비공개 업로드, 삭제된 영상, 멤버십 전용 업로드는 붙여 넣어도 파일이 만들어지지 않습니다. YouTube가 시청자의 나이를 확인할 때까지 막아 둔 영상이나 특정 지역에서 재생되지 않는 영상도 같은 지점에서 멈춥니다. YouTube 스튜디오에서 내 업로드를 관리하는 것은 별개의 작업이며, 내가 관리하는 채널의 영상만 다룹니다. 이 글은 다른 사람이 이미 볼 수 있는 공개 영상을 대상으로 합니다.

말한 내용이 브라우저 탭을 벗어나야 내려받기가 끝난 것입니다. 그전까지는 여전히 YouTube에서 읽는 중입니다. 그 후에는 옮기고 이름을 바꾸고 다른 프로그램에서 열 수 있는 파일이 생깁니다.

복사와 내보내기의 차이

복사는 화면에 떠 있는 문장 하나면 충분할 때 하는 일입니다. 컴퓨터에서 패널을 드래그하면 브라우저가 허용하는 만큼만 선택됩니다. 긴 강의에서는 이 선택이 믿을 만하지 않습니다. 중간에 끊기고, 한 줄이 건너뛰어지고, 딸려 온 시간은 페이지가 쓰던 순서대로 도착합니다. 휴대폰에서 패널 전체를 선택하는 것은 더 번거롭습니다. 두 번째 문장을 복사하면 첫 번째는 사라집니다. 이름을 붙여 저장된 것은 아무것도 없습니다.

내보내기는 줄들이 이미 대본으로 존재한 뒤에 시작됩니다. 유튜브 자막 추출 도구가 그 줄들로 파일을 만듭니다. 형식은 브라우저의 선택이 아니라, 파일을 열 프로그램에 맞춰 고릅니다. 완성된 대본의 복사 기능과 TXT 내보내기는 둘 다 말한 내용만 가져가고 시간은 남겨 둡니다. 시간은 읽는 동안 화면에 남아 있고, 시작과 끝이 있는 구간이 필요할 때는 SRT와 VTT에 남아 있습니다.

남기고 싶은 것이 말한 내용이라면, YouTube에서 대본을 내려받는 방법은 다음과 같습니다.

  1. 공개 시청 페이지에서 영상의 URL을 복사합니다.
  2. transcript.im에 붙여 넣습니다. URL 하나에 대본 하나입니다.
  3. 영상에 이미 있는 자막 트랙을 원본으로 읽습니다. 자막 트랙이 없으면 음성을 대신 전사합니다. 말한 구간마다 한 줄이 됩니다.
  4. 파일을 저장합니다. TXT는 말한 내용 자체입니다. 다음 프로그램이 시작과 끝을 필요로 할 때 저장하는 것이 SRT나 VTT입니다. Markdown과 JSON은 노트 앱이나 프로그램 스크립트용으로 저장하는 나머지 두 형식입니다. TXT, SRT, VTT의 형태는 아래에서 설명합니다.

이 순서는 중요합니다. 파일이 만들어지려면 줄들이 먼저 존재해야 합니다. 그 도움말은 읽기와 이동에서 끝나므로, 내보내기는 그 화면을 벗어난 뒤에 이루어집니다.

짧은 영상과 두 시간짜리 강의는 같은 경로를 거칩니다. 손으로 복사하는 방식이 무너지는 곳은 긴 강의입니다. 선택할 분량이 길고, 건너뛴 줄은 그 줄이 필요해질 때까지 눈에 띄지 않기 때문입니다. 내려받기는 강조해서 선택한 부분이 아니라 전체 순서입니다.

수동으로 복사하는 것은 시청 페이지에 머무는 동안 문장 하나를 건지는 방법으로 생각하세요. 내보내기는 영상의 표현을 그대로 보관하는 방법입니다. 다음 단계가 문서에 넣을 인용, 직접 편집한 영상에 달 자막, 또는 다음 주에 검색할 텍스트라면 파일이 필요합니다.

TXT, SRT, VTT로 내보내기

습관이 아니라 용도에 맞춰 형식을 고르세요. 읽기와 시간 표시 자막을 모두 아우르는 세 가지가 TXT, SRT, VTT입니다. 아래 예시는 형태가 보이도록 지어낸 문장 하나를 사용했습니다. 실제 파일은 영상의 시간을 사용하며, 한 줄이 아니라 모든 줄에 큐가 있습니다.

스크립트 형식 선택하기: 텍스트만 원하면 TXT, 영상 편집에는 SRT, 웹 플레이어에는 VTT

파일포함 내용언제 여는가
TXT글자만, 줄마다 큐 하나, 시간 없음내용을 읽거나 인용하거나 붙여넣을 때
SRT번호가 붙은 큐, 밀리초 앞에 쉼표편집기가 SubRip 파일을 요구할 때
VTTWEBVTT 헤더, 밀리초 앞에 마침표웹 플레이어가 WebVTT를 요구할 때

TXT는 순수한 텍스트입니다. 1분쯤에 말한 줄은 그 문장 그대로이고 뒤에 줄 바꿈이 붙습니다. 리더에서 옆에 보였던 시작 시간은 TXT에 기록되지 않습니다. 메모, 인용, 문서나 채팅에 붙여넣기에는 이게 맞습니다. 플레이어나 편집기가 특정 시점에 줄을 표시해야 한다면 잘못된 파일입니다.

SRT는 대부분의 편집기가 이미 가져오는 시간 표시 형식입니다. 같은 지어낸 문장은 이렇게 생겼습니다.

1
00:01:02,000 --> 00:01:05,200
1분 지점의 예시 문장.

숫자는 큐 인덱스입니다. 화살표는 시작과 끝을 구분합니다. 쉼표는 SubRip 타임스탬프의 일부이며, 문장의 쉼이 아닙니다. 뒤따르는 각 큐는 빈 줄로 구분됩니다.

VTT는 웹 플레이어를 위해 같은 큐를 담습니다. 헤더가 필요하며, 밀리초에는 마침표를 씁니다.

WEBVTT

00:01:02.000 --> 00:01:05.200
1분 지점의 예시 문장.

쉼표와 마침표를 바꾸면 일부 플레이어는 파일을 거부합니다. 단어는 바뀌지 않았습니다. 그릇이 바뀐 것입니다. 편집기가 SRT를 원한다고 하면, VTT를 건네고 가져오기가 봐주기를 바라지 마세요.

종료 시간은 해당 줄 자체의 끝이며, 다음 줄로 넘어가지 않도록 잘라냅니다. 자막 트랙, 특히 자동 생성된 것은 한 줄에 다음 줄과 겹치는 길이를 줄 때가 있습니다. 두 범위를 모두 반영하는 플레이어는 두 큐를 동시에 보여줍니다. 내보내기는 앞선 큐를 잘라 다음 큐가 시작될 때 끝나게 하며, 자기 시작보다 먼저 끝나는 일은 없습니다. 모든 줄은 그대로 나옵니다. 같은 순간을 두고 다투는 두 줄은 나오지 않습니다.

Markdown과 JSON은 같은 줄들을 담는 선택적 형태입니다. Markdown은 각 문장 앞에 분과 초 표시를 붙여 메모 앱에서 편리합니다. JSON은 원시 세그먼트를 유지해 스크립트에서 편리합니다. 목적지가 플레이어나 편집기라면 둘 다 SRT나 VTT를 대체하지 않습니다.

유튜브 스크립트 추출로 대본을 TXT, SRT, VTT로 내보내려면, 먼저 공개 링크에서 줄을 생성한 다음 형식을 고르세요. 파일을 나중에 편집해도 YouTube 영상에 무엇도 다시 기록되지 않습니다. 수정은 내 사본에만 남습니다. 정말로 필요했던 것이 문서용 텍스트가 아니라 플레이어용 자막 파일로서의 캡션 트랙이라면, 그건 자막 다운로더의 일이지 이 도구의 두 번째 사본이 아닙니다.

내려받은 대본 재활용하기

한 번도 열지 않은 파일은 저장할 가치가 없었던 것입니다. 재활용은 일상적이며, 형식은 이미 그에 맞아야 합니다.

노트북 옆에 노트를 두고 타임스탬프가 있는 다운로드한 YouTube 스크립트를 검토하는 사람

특정 분을 다시 가리켜야 하는 강의 노트는 TXT만으로 만들면 안 됩니다. TXT는 문장입니다. 큐 시간은 SRT나 VTT에 있고, 리더를 닫을 때까지 화면에 있습니다. 노트에서 그 문장 옆에 시간을 적어 두세요. 다시 찾아야 하는 주장은 텍스트 검색으로 찾는 편이, 긴 업로드에서 재생 헤드를 끌고 다니는 것보다 낫습니다. 영상 자체는 검색할 수 있는 문서가 아닙니다.

자신이 편집한 영상에 자막을 넣는 편집자는 SRT나 VTT를 원한 뒤 그 파일을 편집기로 가져옵니다. 큐는 시작 트랙이지 완성된 결과물이 아닙니다. 고유명사, 억양, 겹치는 발언은 여전히 훑어 읽어야 합니다. 그 읽기를 건너뛰면 대본의 틀린 단어가 화면의 틀린 자막이 됩니다. 내보내기 단계에서 대신 문구를 검사해 주는 것은 없습니다.

NotebookLM, ChatGPT, Claude, Gemini, Kimi, Manus는 시청 페이지가 아니라 텍스트를 받습니다. 이미 쓰고 있는 도구에 TXT를 붙여넣으세요. transcript.im에서는 같은 줄들을 Clean으로 보내 잡음이 많은 큐를 믿기 전에 다듬거나, 노트에 다른 언어가 필요할 때 Translate로, 긴 강연을 더 짧게 봐야 할 때 Summary, Core Points, Chapter Summary, Study Notes, MindMap으로 보낼 수도 있습니다. 그 결과는 파일 옆에 놓입니다. 또 다른 TXT가 아니며, 목적지가 편집기일 때 SRT나 VTT를 대체하지 않습니다.

인용하는 모든 문장에 시간을 함께 남기세요. 그러지 않으면 그 순간을 다시 열 수 없습니다. 잡음이 많은 녹음은 SRT나 VTT를 편집기에 넣기 전에 읽어 보세요. 파일은 틀린 단어를 표시해 주지 않습니다. 그저 화면에 띄울 뿐입니다.

따라 읽는 것이 목적이라면 시청 페이지에 그대로 머무르면 됩니다. 탭이 닫힌 뒤에도 글이 남아 있어야 한다면 유튜브 대본 추출로 내려받아 다음 프로그램이 열 수 있는 형식으로 저장하세요.

전사 생성기

어떤 영상이든 텍스트로

YouTube, TikTok, Instagram 링크를 붙여넣으면 각 줄에 타임스탬프가 붙은 전사 텍스트를 읽을 수 있습니다.

TXT, SRT, VTT로 내보낼 수 있습니다.