---
title: "YouTube 文字起こし 翻訳｜タイムスタンプも保持"
description: "YouTube 文字起こし 翻訳は、まず発話を文字にしてから翻訳。各行に元のタイムスタンプを残します。"
canonical: "https://transcript.im/ja/blog/translate-youtube-transcript"
markdown: "https://transcript.im/ja/blog/translate-youtube-transcript.md"
author: "Leo"
category: "YouTube"
datePublished: "2026-10-03T03:14:51.000Z"
dateModified: "2026-10-03T06:00:37.721Z"
---
YouTube 動画の文字起こしを翻訳するには、話された内容を書き起こしてから、その行を翻訳します。翻訳されるのは映像ではありません。話された言葉です。YouTube は動画の再生中に字幕を表示でき、一部の動画では、視聴している間だけプレーヤーが翻訳された字幕を映像に重ねて表示できます。そのオーバーレイは視聴をやめれば消えます。引用したり検索したり、他の人に渡したりできる翻訳とは、翻訳された文字起こしのことで、各行は元の瞬間を指したままです。

YouTube の[文字起こしを表示する方法のヘルプページ](https://support.google.com/youtube/answer/15930243)では、閲覧ビューについて説明されています。説明欄で **文字起こしを表示** を開き、現在の行を追い、行をクリックするとその位置にジャンプします。そこには翻訳されたドキュメントについては書かれておらず、保存する方法も書かれていません。このページの残りでは、そのドキュメントを作る手順を説明します。文字起こしを生成し、行を翻訳し、時間をそのままの位置に保ちます。

## 文字起こしを翻訳する理由

動画ファイルではなく文字起こしを翻訳する理由は、実際に再利用するのが言葉だからです。耳で聞くより文字で読むほうが理解しやすい講義、自分のノートの言語で引用したい主張、別の視聴者向けに字幕を付ける切り抜きは、どれも同じものから始まります。テキストになった話し言葉です。MP4 を翻訳してもそのテキストは得られません。新しい音声トラックを吹き替えても得られません。それらは別の作業であり、このページで扱う内容ではありません。

視聴者によっては、オーバーレイだけで十分なこともあります。プレーヤーがすでに翻訳を表示していて、一度だけ視聴するのであれば、そのままでよいでしょう。タブを閉じたあとに文言が必要なとき、フレーズを検索したいとき、翻訳をドキュメントやエディタに移す必要があるときは、オーバーレイを離れましょう。オーバーレイは表示です。文字起こしはテキストです。

文字起こしは、翻訳できる範囲に明確な線も引きます。対象になるのは音声です。映像に焼き付けられたタイトルカードやローワーサード、その他映像に描かれたテキストは読み取られないため、翻訳されません。話し声がほとんどない、またはまったくないミュージックビデオは、書き起こす言葉が少ないため、内容も薄くなります。二人が同時に話している、部屋が騒がしい、マイクの音がこもっているといった状況は元の行を弱め、翻訳はすでに間違っている行を修復できません。翻訳を引用として扱う前に、元の行をタイムスタンプと照らし合わせて確認してください。

リンクは公開されている必要があります。非公開動画、削除された動画、メンバー限定動画、または他の人のアカウント内でしか再生できないリンクは、公開 URL を貼り付けても開けません。年齢制限や地域制限でも同じリクエストが止まることがあります。YouTube が配信しない動画を強制的に開かせるスイッチはありません。

## 生成してから翻訳する

翻訳は 2 番目のステップです。最初のステップは、字幕または音声の言語による文字起こしです。このステップを飛ばすと、翻訳できる行が存在しません。要約、コメントスレッド、動画の説明欄は代わりになりません。それらは話し言葉の並びではなく、各行に時間も持っていません。

![YouTube 動画をテキストに翻訳する 4 つの手順：URL をコピーし、行を生成し、翻訳し、確認して書き出す](/images/blog/translate-youtube-transcript/ja/7363c8d8.jpg)

transcript.im では、YouTube 文字起こし 翻訳を次の順序で行います。

1. 別の言語で見たい公開動画の URL をコピーします。
2. 貼り付けて、翻訳先を選ぶ前にまず行を生成します。動画にすでにある字幕がソースになります。音声は、その字幕が存在しない場合にのみ文字起こしされます。
3. その行に対して翻訳を実行し、対応している言語を 1 つ選びます。文言は変わりますが、YouTube 上のアップロードは変わりません。
4. 翻訳された行を元の時間と照らし合わせて確認します。翻訳をブラウザの外に持ち出す必要があるときはエクスポートします。

[YouTube 文字起こし](/ja/youtube-transcript)を翻訳するには、リンクはすでに手元にあります。動画を再アップロードする必要はなく、後で行を修正する場合を除いて、翻訳を手入力することもありません。修正は自分のコピーに残ります。元のアップロードには書き戻されません。

翻訳先は、対応している言語の中から選びます。アラビア語、中国語（簡体字）、英語、フランス語、ドイツ語、ヒンディー語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語です。ここでの中国語は簡体字で、繁体字は別の翻訳先ではありません。ポルトガル語は 1 つの翻訳先で、国ごとに分かれていません。必要な言語がこのリストにない場合、このステップがその言語を勝手に作ることはありません。ツールが実際に提供している翻訳先を選ぶか、その言語に対応している別の場所でエクスポートしたテキストを翻訳し、キューの時間を自分で引き継がない限り、2 つ目のツールでは時間が保たれない可能性があることを受け入れてください。

ソース言語は、字幕または音声がもともと何であったかによります。日本語で話された動画は、たとえスペイン語で読みたいと思っていても、まず日本語の行として出力されます。翻訳は後から選ぶ翻訳先であり、別の翻訳先は同じソース行に対する別個の翻訳です。スペイン語からドイツ語に切り替えても、スペイン語の結果がドイツ語に編集されるわけではありません。ソースを再び翻訳するのです。

自動字幕が存在する場合でも、それが依然として元の情報源です。その精度は、その字幕トラックの出来次第です。人名、なまり、素早い余談などで取りこぼしが生じます。もともと字幕が付いていない動画を音声から文字起こしする場合も、同じような限界があります。テキストは録音に従うのです。翻訳するのは、気になる元の行を確認した後です。確認する前ではありません。

## タイムスタンプを揃える

翻訳がタイムラインを作り直さないので、時間はそのまま維持されます。各行は、文言が変わる前の開始時刻と長さを保ちます。置き換わるのはテキストだけです。1:02 に始まった文は、翻訳でも 1:02 に始まります。新しい文言が元より長くても短くても変わりません。

![同じタイムスタンプを持つ原文と翻訳の文字起こし行が並んでいる様子](/images/blog/translate-youtube-transcript/ja/cc1f1bd5.jpg)

こうして翻訳は、動画のその瞬間に結び付いたままになります。翻訳された行は、元の瞬間に付いたラベルであり、独自のテンポを持つ新たな演目ではありません。行の隣の時間は、依然として元動画のその瞬間です。聞こえるのは元の音声で、読むのが翻訳です。新しい音声は作られていないので、吹き替えの声は聞こえません。

エクスポートも同じ時間を使います。翻訳の TXT は翻訳された語句だけで、1 キューにつき 1 行、時間は省かれます。SRT と VTT は開始と終了を保持するので、編集ソフトや Web プレイヤーが翻訳されたキューを表示できます。終了時刻は元の行の終了時刻で、次のキューと重ならないように調整されます。こうしてプレイヤーは 2 行を重ねず、1 行ずつ表示します。

長くなった翻訳は、誤解されやすい部分です。キューは新しい文に合わせて伸びるわけではありません。語句は元の枠内に収まらなければなりません。短い英語の行が長いドイツ語の行になっても、元のキューの終了時に終わります。画面上では、プレイヤーが同じ範囲により多くのテキストを折り返して表示することがあります。このファイルは、翻訳を話す声に合わせて動画のタイミングを変えたわけではありません。後で吹き替えを録音するなら、その吹き替えのタイミングは自分で合わせることになります。このエクスポートはそれを代行しません。

リーダーは、確認中に各翻訳行の横に開始時刻を表示できます。TXT エクスポートと同様、文章をコピーすると語句だけが取られ、時間は失われます。時間を文と一緒に持っていく必要があるなら、SRT か VTT を使うか、ノートに貼り付ける文の隣に時間を書き留めてください。揃えた情報は、これから引用する行に結び付けておいてこそ役に立ちます。

Clean は、実行するなら別の処理です。テキストの文法、句読点、認識エラーを修正し、時間はそのまま保ちます。翻訳ではありません。言語を変える処理は Translate です。行がうまく認識されていないときは元のテキストに Clean を実行してから翻訳してください。そうすれば、認識エラーを、もう一方の言語で自信満々の誤った文に翻訳してしまうことがありません。

## よくある落とし穴

よくある失敗は、間違った対象を翻訳してしまうことです。画面に映るタイトル、カメラで撮影されたスライド、映像に焼き込まれた字幕は文字起こしには含まれないため、別の言語には出てきません。動画の意味がそうした図像にあり、音声で語られていない場合、翻訳でそれを補うことはできません。読めるのは音声だけなのです。

![翻訳した文字起こしを書き出す前の確認：画面内のテキスト、新たな声が入っていないか、名前と数字、同じキュー内の長い行](/images/blog/translate-youtube-transcript/ja/d0fa06c8.jpg)

次によくある失敗は、新しい音声トラックを期待してしまうことです。YouTube 動画を文字起こしして翻訳しても、保てるのは言葉づかいだけです。差し替えの声、口の動きに合わせた吹き替え、翻訳文の長さに合わせて再構築されたタイムラインは得られません。元の音声が基準の時計であり続けます。吹き替えは別の編集です。

もう一つの失敗は、短い要約を翻訳して、行単位の時間を期待してしまうことです。要約、要点、チャプター要約は、同じ文字起こしを短く見たものです。すべての行を読む前には役立ちます。しかし翻訳された文字起こしではなく、発話された 1 行ごとに時間付きのキューが付くわけでもありません。揃ったままの翻訳は、文字起こしの行そのものに対して成り立ちます。Study Notes、Meeting Summary、Creator Repurpose、Moments、マインドマップも、そのテキストの別の見方です。どれも言語を変えるものではありません。マインドマップはノードをある瞬間に指し示せて、移動の助けになります。それでも各行の翻訳された文言ではありません。

固有名詞、数字、慣用句は人の目で確認する必要があります。名前は音訳されたり、半分だけ翻訳されたり、聞こえたままにされたりします。元の言語に依存するジョークは、そのまま行単位で訳しても残りません。話者が言ったこととして翻訳を引用する前に、タイムスタンプを開いて聞いてください。翻訳はその行を表現したものです。録音こそが情報源です。

短いキューでの速い発話には、長い翻訳と同じ実践上の限界があります。枠は元の行によって決まっています。SRT を編集ソフトに読み込んで、翻訳されたキューが窮屈に感じるなら、そのキューを編集ソフトで分割するか書き直してください。エクスポートがその瞬間を長くしてくれるとは期待しないでください。

ほとんど発話のない動画は、ほとんど何も翻訳されません。無音、音楽、拍手は文ではありません。文字起こしがわずか数行なら、翻訳もわずか数行になります。それは元の動画の性質であり、翻訳先の言語が失敗したわけではありません。

文字起こしが始まらなければ、翻訳も始まりません。よくある原因は、動画が一般公開されていないことです。

出力先がプレーヤー用のタイム付き字幕トラックなら、翻訳した行の SRT または VTT をエクスポートします。YouTube のリンクから、読み物としてではなく字幕として、そうしたトラックを作る方法を扱ったページは [YouTube 字幕 ダウンロード](/ja/youtube-subtitle-generator) です。求めているのが翻訳された文言そのもの（その文言のタイム付きファイルも含む）なら、この記事を使ってください。字幕トラックそのものが目的なら、字幕ジェネレーターを使ってください。

オーバーレイで足りるなら、それを使って視聴しましょう。別の言語の言葉に、元の場面のタイムも添えて欲しいときは、文字起こしを生成し、行を翻訳し、タイムを保持します。その公開リンクが、あとで翻訳するテキストになる。そんな YouTube 文字起こし 翻訳の入り口が [翻訳もできる YouTube 文字起こし](/ja/youtube-transcript) です。
