---
title: "YouTube 逐字稿下載：TXT、SRT 或 VTT"
description: "YouTube 逐字稿下載可將內容存成 TXT、SRT 或 VTT，並教你如何不儲存影片也能下載 YouTube 的逐字稿。"
canonical: "https://transcript.im/zh-hant/blog/download-youtube-transcript"
markdown: "https://transcript.im/zh-hant/blog/download-youtube-transcript.md"
author: "Leo"
category: "YouTube"
datePublished: "2026-10-03T03:14:51.000Z"
dateModified: "2026-10-03T06:00:36.865Z"
---
YouTube 逐字稿下載是一份把 YouTube 影片裡說出的話存下來的檔案，讓你在觀看頁面消失後還能打開。YouTube 自家的逐字稿檢視畫面（記錄在它的[檢視逐字稿說明頁](https://support.google.com/youtube/answer/15930243)）是一串可捲動的字幕行。你一邊讀，一邊點某一行來跳轉播放器。那篇說明文章並沒有描述一份你能保存的文件。本頁談的是檔案。

這份檔案也不是影片本身。MP4 保存畫面，MP3 保存聲音，但兩者都不是文字本身。而且這份檔案做的事，和保存播放器疊在畫面上的字幕軌也不是同一件事。那種字幕檔案的工作，是 [YouTube 字幕下載](/zh-hant/youtube-subtitle-downloader) 在做的事。這裡的對象是逐字稿：把說出的話寫出來，格式由你依接下來要做什麼來選擇。

## 「下載逐字稿」是什麼意思

本文所說的「下載」，指的是把講話內容存成一份有檔名的檔案。影片有創作者字幕軌時，那些行就來自那條字幕軌；沒有的話，則來自對語音的轉錄。無論哪一種，結果都是說過的內容依序排列，而不是觀看頁面的複製品。

![下載的逐字稿是含有時間戳記的口說文字檔，不是影片檔](/images/blog/download-youtube-transcript/zh-hant/c9fe0709.jpg)

那個頁面上有幾樣東西看起來相關，卻不是這份檔案。說明欄是創作者寫的簡介。影片有章節時，章節是導覽標記。畫面中的標題卡與內嵌字幕是畫面裡的像素，不會被當成文字讀取。留言是別人寫的內容。這份檔案跳過那些，只留下講話內容。

那篇說明文章談的是閱讀與跳轉，而且只適用於已經有字幕的影片。本頁不重複打開那個檢視畫面所需的操作。影片從來沒有字幕時，面板裡不會有任何一行，但仍可透過轉錄語音做出一份檔案。在播放器旁邊閱讀，分頁一關就結束。YouTube 逐字稿下載則是隔天還在的那份副本。

這份檔案有多清楚，取決於它所依據的講話內容。安靜的談話影片，讀起來比車聲蓋在人聲底下的街頭訪問容易。重疊的說話者會併成同一行。字幕軌從沒拼對的名字，不會因為你把它匯出就自動拼對。你要引用的那句，請先確認一下。

貼上的 URL 必須是公開可開啟的。私人上傳、已移除的影片，或會員專屬的上傳，都無法用那個貼上的網址做出檔案。YouTube 要等到確認觀眾年齡才放行的影片，或是在特定地區不播放的影片，也會卡在同一個地方。在 YouTube 工作室管理自己的上傳內容是另一回事，而且只涵蓋你所掌控頻道上的影片。本文只討論別人已經能觀看的公開影片。

當文字離開瀏覽器分頁，下載才算完成。在那之前，你只是在 YouTube 上閱讀。在那之後，你手上有一份可以搬移、重新命名，並用其他程式打開的檔案。

## 複製與匯出

當畫面上的一句話就足夠時，你會做的就是複製。在電腦上反白選取整個面板，能選到多少全看瀏覽器允許多少。面對一場講座，這種選取並不可靠：你選到一半就停了、某一行被跳過，順帶一起被選到的時間碼也會照頁面當下的排列順序出現。在手機上選取整個面板更不順手。複製第二句，第一句就沒了。什麼都沒有以檔名存下來。

匯出則是在那些行已經成為逐字稿之後才開始。[YouTube 逐字稿](/zh-hant/youtube-transcript) 會把那些行寫成一份檔案。你依要用來打開它的程式來選格式，而不是依瀏覽器的選取。對完成後的逐字稿使用複製，以及匯出 TXT，都只取文字、把時間留在原處。時間在你閱讀時留在畫面上，而當你需要一段有開始與結束時間的字幕時，它們會留在 SRT 和 VTT 裡。

當你想留下的是文字本身時，如何從 YouTube 下載逐字稿：

1. 在公開的觀看頁面上，複製影片的 URL。
2. 貼到 transcript.im。一個 URL，一份逐字稿。
3. 影片上已有的字幕軌會作為來源被讀取。沒有字幕軌時，則改為轉錄說出的語音。每一段話都會成為一行。
4. 儲存檔案。TXT 是文字本身。當下一個程式需要開始與結束時間時，就存成 SRT 或 VTT。Markdown 和 JSON 是另外兩種存法，供筆記程式或腳本使用。TXT、SRT 和 VTT 的樣貌如下。

這個順序很重要。必須先有那些行，才可能有檔案。那篇說明文章只講到閱讀與跳轉，所以匯出是在你離開那個檢視畫面之後才發生。

短影片和兩小時的講座走的是同一條路。講座正是手動複製會崩掉的地方，因為選取範圍很長，而漏掉的那一行要等到你需要它時才會發現。下載拿到的是完整順序，而不是你勉強反白選到的那部分。

手動複製適合在你還停留在觀看頁面時，隨手抓下一句話。匯出則適合用來保留影片的完整用字。如果下一步是文件裡的引文、你自己剪輯的字幕，或是下週還會搜尋的文字，那你需要的就是檔案。

## 匯出 TXT、SRT 或 VTT

依用途挑格式，別憑習慣。涵蓋閱讀與時間軸字幕的格式有三種：TXT、SRT 和 VTT。下方的範例只用了一行虛構的句子，好讓你看見格式的樣貌。實際的檔案會使用影片裡的時間，而且每一行都有對應的字幕，不是只有一條。

![選擇逐字稿格式：只要文字就選 TXT，剪輯影片選 SRT，網頁播放器選 VTT](/images/blog/download-youtube-transcript/zh-hant/e0b96b37.jpg)

| 檔案 | 內容 | 什麼時候打開 |
| --- | --- | --- |
| TXT | 只有文字，每行一句，沒有時間 | 你要閱讀、引用或貼上用字時 |
| SRT | 編號字幕，毫秒前用逗號 | 剪輯軟體要求 SubRip 檔案時 |
| VTT | 標頭為 `WEBVTT`，毫秒前用句點 | 網頁播放器要求 WebVTT 時 |

TXT 就是純文字。大約在影片第 1 分鐘講到的那一行，就只是那句話，後面接一個換行。你在閱讀器旁看到的開始時間，不會被寫進 TXT。做筆記、引用，或貼進文件或聊天室時，你要的就是這個。但如果播放器或剪輯軟體必須在某個時間點顯示那一行，那 TXT 就是錯的檔案。

SRT 是大多數剪輯軟體已經能匯入的計時格式。同一行虛構的句子看起來像這樣：

```
1
00:01:02,000 --> 00:01:05,200
The sample line at one minute.
```

數字是字幕的編號。箭頭分隔開始與結束。逗號是 SubRip 時間戳的一部分，不是句子裡的停頓。之後的每條字幕都用一個空行分隔。

VTT 為網頁播放器承載同樣的字幕。標頭是必要的，而毫秒用的是句點：

```
WEBVTT

00:01:02.000 --> 00:01:05.200
The sample line at one minute.
```

把逗號和句點對調，有些播放器就會拒收這個檔案。文字並沒有改變，改變的是容器格式。如果剪輯軟體說它要 SRT，就不要給它 VTT，然後指望匯入時會通融。

結束時間是那一行自己的結尾，會經過修剪，讓它不會延伸到下一行。字幕軌，尤其是自動產生的，有時會給某一行一個與下一行重疊的長度。同時採用兩段時間範圍的播放器，會一次顯示兩條字幕。匯出時會裁掉較早的那條字幕，讓它在下一行開始時結束，而且它絕不會在自己的開始時間之前結束。你依然會拿到每一行，但不會有兩行在同一個時間點上互相搶位。

Markdown 和 JSON 是同樣這些句子可選的另一種樣貌。Markdown 會在每句話前面加上分：秒的標記，這在筆記應用程式裡很方便。JSON 保留原始的分段，這在腳本裡很方便。當目的地是播放器或剪輯軟體時，這兩者都無法取代 SRT 或 VTT。

若要[將 YouTube 逐字稿匯出成 TXT、SRT 或 VTT](/zh-hant/youtube-transcript)，請先從公開連結產生這些句子，再選擇格式。事後編輯檔案並不會把任何內容寫回 YouTube 影片。你的修正只會留在自己的副本裡。如果你真正需要的，是把字幕軌當成播放器用的字幕檔，而不是把用字當成文件，那就是字幕下載工具的任務，不是這份逐字稿的另一份副本。

## 重複使用已下載的逐字稿

從沒打開過的檔案，不值得儲存。重複使用是稀鬆平常的事，而格式本來就該配合它。

![一個人在筆電上檢視已下載、含時間戳記的 YouTube 逐字稿，旁邊放著筆記本](/images/blog/download-youtube-transcript/zh-hant/0b9d6d59.jpg)

一份必須指回某一分鐘的課堂筆記，不該只靠 TXT 建立。TXT 是句子，時間軸的時間存在 SRT 或 VTT 裡，而且在你關掉閱讀器之前都顯示在畫面上。把那個時間寫在筆記中句子旁邊。你得再次找出的論點，是在文字裡搜尋，這比拖著播放頭橫越一段很長的影片輕鬆多了。影片本身不是你搜尋得了的文件。

要為自己的剪輯上字幕的剪輯者，需要的是 SRT 或 VTT，然後把檔案匯入剪輯軟體。這些字幕只是起點，不是完成的成品。人名、口音和重疊的說話，仍需要從頭讀過一遍。如果你跳過這道閱讀，逐字稿裡的錯字就會變成畫面上的錯誤字幕。匯出步驟不會替你檢查用字。

NotebookLM、ChatGPT、Claude、Gemini、Kimi 和 Manus 接受的是文字，不是觀看頁面。把 TXT 貼進你已經在用的那一個。在 transcript.im 上，同樣這些句子也可以先經過 Clean，好在信任吵雜的字幕之前檢查一遍；筆記需要另一種語言時經過 Translate；或是一場冗長的演講需要更精簡的概觀時，經過 Summary、Core Points、Chapter Summary、Study Notes 和 MindMap。這些結果會放在檔案旁邊。它們不是另一份 TXT，當目的地是剪輯軟體時，也無法取代 SRT 或 VTT。

引用任何句子時，都要保留對應的時間，否則你就無法重新打開正確的時間點。在把 SRT 或 VTT 送進剪輯軟體之前，先讀過吵雜的錄音。檔案不會標示出錯的字，它只會把錯字顯示出來。

如果只是要邊看邊讀，留在觀看頁面就好。當這些文字必須留到關掉分頁之後，就[下載 YouTube 逐字稿](/zh-hant/youtube-transcript)，並存成下一個程式能直接開啟的格式。
