隆重推出 BillionVerify:以 1% 的成本驗證數十億個電子郵件。 試用 BillionVerify

transcript.im
← 部落格

TikTok 轉錄生成器:把說的話存下來

作者 Leo轉錄

TikTok 轉錄生成器把口說內容存成 TXT、SRT 或 VTT。畫面字幕不是檔案,TikTok 也不會提供逐字稿匯出。

TikTok 轉錄生成器:把說的話存下來

TikTok 轉錄生成器能把 TikTok 影片裡說出來的話存成一個你可以保存的檔案。TikTok 本身不會給你這個檔案。當創作者有產生字幕時,App 可以在影片上顯示字幕,某些版本在你觀看時也提供 Captions 或 CC 控制項,但那些字幕只是螢幕上的覆蓋圖層。它們不是你能匯出的逐字稿,而且這個控制項在不同 App 版本、手機和地區之間也沒有固定位置。如果創作者從未加上字幕,往往根本沒有東西可以讀。

所以本頁所說的「下載」指的是文字,不是影片。要保存 MP4 是另一回事,請用 TikTok 影片下載。大家說要下載 TikTok 逐字稿,其實要的是那些字句:一句可以查證的引言、一份用來剪輯的字幕檔,或是一份能交給別人的乾淨副本。複製你在螢幕上看到的內容,和匯出一個檔案,並不是同一個步驟。

複製與匯出

複製是指在 TikTok 裡面能做的任何事。匯出則是一個在你離開 App 之後依然存在的檔案。

比較在 TikTok App 內複製字幕與將逐字稿匯出成檔案

複製通常長這樣:

  1. 在 TikTok 中開啟該影片。
  2. 如果有字幕可用,請在影片上,或是在分享與更多選項區域裡,尋找 Captions 或 CC 控制項。有些帳號在「輔助使用」底下也有字幕偏好設定。標籤和選單會隨版本不同而移動,所以請把它當成在播放控制項裡搜尋,而不是保證存在的按鈕。
  3. 在影片播放時讀取螢幕上的字幕。需要某一行的時候就暫停。
  4. 在那個流程裡,並沒有官方記載的「複製整份逐字稿」或「下載逐字稿」動作。想仔細複製,就只能重新打字,或是只有當那個畫面真的允許選取文字時才能選取。許多字幕是直接畫在影片上的,無法選取。

這條路會以幾種可預期的方式失敗。創作者把字幕關掉了,或從來沒產生過。畫面上的字是文字貼圖或標題卡,不是講話內容。兩個人在同一段音軌上同時說話,覆蓋字幕只抓到片段。音樂就是這段影片的重點,幾乎沒有什麼講話內容可以複製。影片看十遍,你依然不會有一份文件。

匯出則是從公開連結開始,而不是從螢幕字幕。

  1. 複製公開的 TikTok 網址。私人帳號、只限朋友檢視的貼文,或是只有你以擁有者身分登入時才能播放的連結,都不算公開網址。
  2. 把它貼到 transcript.im。你可以用 TikTok 轉錄生成器 直接從那個連結匯出逐字稿,不必先把影片檔存到手機相簿。
  3. 如果影片本身已經有字幕軌,工具會直接讀取。大多數 TikTok 影片都沒有,所以會改為轉錄講話的音訊。回傳的文字會附上對齊講話內容的時間戳。
  4. 在瀏覽器裡閱讀並搜尋文字。然後匯出。

TikTok 轉錄生成器就是把最後這個步驟變得可以重複:文字以 TXT、SRT 或 VTT 的形式離開 App。螢幕上的覆蓋字幕做不到這件事,就算影片的字幕看起來再完美也一樣,因為覆蓋字幕是給觀看用的,檔案才是拿來重複使用的。

創作者字幕和觀眾字幕是兩扇不同的門。TikTok 那篇推出自動字幕的文章說,創作者從編輯頁面開啟字幕,並且可以編輯產生的文字,而那些字幕是影片的一部分。同一篇 2021 年的文章告訴想關掉字幕的觀眾,打開分享面板並使用字幕按鈕。那個按鈕並不是匯出。後來一篇更新也讓觀眾能為某些影片開啟字幕,但依然是覆蓋字幕。App 版本會移動這個控制項,而且觀眾永遠不會拿到創作者的編輯器。觀眾想拿到檔案,唯一能提供的就是公開連結。如果創作者附加了真正的字幕軌,transcript.im 會讀取它。如果他們只是把文字畫在畫面上,字幕軌就是空的,會轉錄的是講話音訊。

內嵌字幕需要另外提醒。如果創作者把字幕打進畫面裡,那些像素並不是字幕軌。只抓取現有字幕軌的下載工具會什麼都看不到。轉錄是聽音訊,這正是你處理講話內容想要的方式,而且它不會對標題卡做 OCR。如果你在意的那句台詞從來沒有被念出來,它就不會出現在逐字稿裡。

TXT、SRT 或 VTT

逐字稿產生之後,格式的選擇取決於下一個要用的工具,而不是 TikTok。

TXT、SRT 與 VTT 比較:適合筆記的純文字、編號且附時間的提示,以及供網頁播放器使用的 WebVTT 提示

格式你會得到什麼什麼時候用
TXT純文字形式的字句筆記、引言、草稿、貼到另一個 App
SRT有編號的字幕,附開始時間和結束時間預期使用 SubRip 的影片剪輯軟體或字幕工具
VTT附時間戳的 WebVTT 字幕預期使用 VTT 的網頁播放器或字幕工作流程

TXT 是閱讀用的版本。當你的重點是文字本身時,它就是你要貼進文件裡的內容。SRT 和 VTT 會保留時間範圍,所以一行字幕能落在時間軸上,而不是像段落一樣飄著。transcript.im 能從同一份逐字稿匯出這三種格式。它也能把這些行句翻譯成另一種支援的語言,並保留時間戳;當翻譯後的文字必須變成字幕、而不是鬆散的段落時,這點就很重要。

這個 App 從不要求你挑選 TXT、SRT 或 VTT,因為它根本不會把文字以檔案形式交給你。在文字離開覆蓋層之前,根本沒東西可選。TikTok 轉錄生成器正是這三種格式真正變成選項的地方。

有些限制是音訊本身的特性,而不是副檔名造成的。一段 20 秒的口白壓在吵雜的歌曲上,轉錄效果會比安靜的旁白更差。重疊的說話聲會塌縮成同一串行句,除非錄音本身有把他們分開。俚語、品牌名稱和使用者名稱是常見的錯誤來源。把 TXT 改成 SRT 並不會修好一個錯字。讀那一行,用時間戳再聽一次那一秒,在發布字幕前把它改對。

別指望一段沒有說話內容的影片能有逐字稿。搭配商業歌曲的舞蹈、照片幻燈秀,或是只有螢幕文字的玩笑,轉出來的結果可能幾乎是空的。這是正確的結果。下載器並沒有漏掉什麼隱藏的字幕檔。根本就沒有說話內容可以寫下來。

公開存取是另一道硬性限制。如果 TikTok 無法從公開連結播放該影片,貼上那個連結也不會產生逐字稿。地區限制和已移除的貼文也會以同樣方式失敗。截圖 OCR 和重新打字是僅剩的選項,而且一旦影片長度超過一句話,它們就會比看起來更慢。

重複使用 TikTok 逐字稿

一個檔案只有在你知道自己準備相信哪個版本時才有用。把三種版本分清楚。覆蓋層是觀眾看到的內容。逐字稿是音訊(或字幕軌)實際包含的內容。你的編輯則是你讀過之後改動的內容。當用字必須精確時,引用逐字稿並核對時間戳。不要把標題貼紙當成那個人說過的話來引用。

重複利用 TikTok 逐字稿的方式:附時間的引言、字幕檔、下一份腳本、AI 助理,以及附時間的翻譯

常見的重複使用方式,照大家實際做的順序排列:

  1. 附上時間的引文。 在逐字稿裡搜尋那句話,複製那一行,把時間戳留在旁邊。檢查你成果的人就能在那一秒打開影片。
  2. 給新剪輯用的字幕檔。 匯出 SRT 或 VTT,再匯入剪輯軟體。時間只是起點。如果你修剪了影片,字幕提示必須跟著畫面移動。
  3. 下一篇貼文用的腳本。 逐字稿是原始的口說內容。把它改寫成更短的腳本、置頂留言或螢幕文字。原始的行句則保留為實際說過內容的紀錄。
  4. 給 AI 助理用的素材。 把文字貼進 Google NotebookLM、ChatGPT、Claude、Gemini、Kimi 或 Manus。這些工具是根據你提供的文字運作。它們不會自己去抓 TikTok 的字幕軌。
  5. 仍保有時間軸的翻譯。 從逐字稿翻譯並保留時間戳,如果翻譯必須跟著影片播放,就匯出 SRT 或 VTT。

把檔案交出去之前,檢查三個時間戳。播放第一行,確認它和聲音相符。播放中間附近的一行,特別是有名字或數字的那一行。播放最後一行,這樣中斷的內容才不會被當成一份簡短腳本蒙混過去。如果這三個都對得上,這份檔案就適合引用或匯入。錯誤的名字要在那一行修正。把 TXT 換成 SRT 並不能更正它。

在 transcript.im 裡,你也可以在匯出前對同一段文字執行摘要、重點或心智圖。這是針對長篇拼接影片或人物講解系列的一種閱讀輔助。它並不能取代逐字稿。你引用的仍然是完整的行句。

當檔案被當成影片的中繼資料時,重複使用就行不通了。TikTok 逐字稿下載並不包含觀看次數、留言、合拍或音訊名稱。它也不會告訴你哪些文字是螢幕文字。如果你的筆記需要標註音訊出處或螢幕上的玩笑,請直接從影片本身記下來,並放在逐字稿旁邊,而不是塞進逐字稿裡。

團隊常被第二種混淆絆住:他們下載了影片、抽出了音訊,卻還是沒有一份任何人都能搜尋的文件。影片檔是畫面。逐字稿檔是文字。當任務是引用、上字幕或改寫時,你要的是後者。當有人需要閱讀時,就匯出 TikTok 逐字稿成 TXT;當剪輯師需要字幕提示時,就匯出成 SRT 或 VTT。從公開連結開始,並把螢幕字幕只當成影片開著時用來跟讀的工具。

逐字稿產生器

把任何影片變成文字

貼上 YouTube、TikTok 或 Instagram 連結,即可閱讀逐行帶時間戳的轉錄文字。

可匯出為 TXT、SRT 或 VTT。