---
title: "ถอดข้อความจาก YouTube แล้วแปลเป็นข้อความ คงเวลาเดิมไว้"
description: "ถอดข้อความจาก YouTube เป็นข้อความ แล้วแปล โดยถอดเสียงเป็นบรรทัดก่อน จากนั้นจึงแปล แต่ละบรรทัดยังคง timestamp ของช่วงเวลาต้นฉบับ"
canonical: "https://transcript.im/th/blog/translate-youtube-transcript"
markdown: "https://transcript.im/th/blog/translate-youtube-transcript.md"
author: "Leo"
category: "YouTube"
datePublished: "2026-10-03T03:14:51.000Z"
dateModified: "2026-10-03T06:00:37.962Z"
---
การแปลวิดีโอ YouTube ให้เป็นข้อความ ต้องเริ่มจากเขียนสิ่งที่พูดออกมาก่อน แล้วจึงแปลทีละบรรทัดนั้น สิ่งที่ถูกแปลไม่ใช่ภาพ แต่เป็นคำพูดต่างหาก YouTube แสดงคำบรรยายให้ดูได้ขณะวิดีโอเล่น และในบางวิดีโอ เครื่องเล่นสามารถวาดคำบรรยายแปลทับลงบนภาพได้ตลอดเวลาที่คุณดู คำบรรยายซ้อนนั้นจะหายไปเมื่อคุณออกไป การแปลที่คุณจะอ้างอิง ค้นหา หรือส่งต่อให้คนอื่นได้ คือทรานสคริปต์ที่แปลแล้ว โดยแต่ละบรรทัดยังชี้ไปยังช่วงเวลาต้นฉบับ

[หน้าช่วยเหลือเกี่ยวกับการดูทรานสคริปต์ของ YouTube](https://support.google.com/youtube/answer/15930243) อธิบายมุมมองการอ่านไว้ว่า ให้เปิด **แสดงทรานสคริปต์** ในคำอธิบาย เลื่อนตามบรรทัดปัจจุบัน แล้วคลิกบรรทัดเพื่อกระโดดไป แต่ไม่ได้อธิบายเอกสารที่แปลแล้ว และไม่ได้อธิบายวิธีบันทึกเอกสารนั้น ส่วนที่เหลือของหน้านี้คือลำดับขั้นตอนที่ทำให้ได้เอกสารออกมา สร้างทรานสคริปต์ขึ้นมา แปลทีละบรรทัด แล้วเก็บเวลาไว้ให้อยู่ที่เดิม

## ทำไมต้องแปลทรานสคริปต์

เหตุผลที่ควรแปลทรานสคริปต์แทนการแปลไฟล์วิดีโอ คือคำพูดต่างหากที่เป็นสิ่งที่คุณจะนำกลับมาใช้ซ้ำ ไม่ว่าจะเป็นบทบรรยายที่คุณอ่านตามได้ดีกว่าฟัง ข้อความที่คุณต้องยกมาอ้างในภาษาของบันทึกย่อของคุณ หรือคลิปที่คุณจะใส่คำบรรยายให้ผู้ชมอีกกลุ่ม ล้วนเริ่มจากวัตถุเดียวกัน คือบทพูดในรูปแบบข้อความ การแปลไฟล์ MP4 ไม่ได้ให้ข้อความนั้น การพากย์เสียงทับใหม่ก็ไม่ได้ให้เช่นกัน นั่นเป็นงานคนละแบบ และหน้านี้ไม่ได้พูดถึงงานเหล่านั้น

ผู้ชมบางคนต้องการแค่คำบรรยายซ้อนทับ ถ้าเครื่องเล่นแสดงคำแปลให้อยู่แล้วและคุณดูแค่ครั้งเดียว ก็ดูตรงนั้นได้เลย แต่ให้ออกจากตรงนั้นเมื่อคุณต้องใช้ถ้อยคำหลังจากปิดแท็บ เมื่อต้องค้นหาวลีใดวลีหนึ่ง หรือเมื่อต้องย้ายคำแปลไปไว้ในเอกสารหรือโปรแกรมแก้ไข คำบรรยายซ้อนทับเป็นเพียงการแสดงผล ส่วนทรานสคริปต์คือตัวข้อความ

ทรานสคริปต์ยังกำหนดเส้นแบ่งชัดเจนว่าอะไรแปลได้บ้าง คำพูดอยู่ในขอบเขต ส่วนการ์ดชื่อเรื่องที่ฝังในภาพ แถบข้อความด้านล่าง และข้อความอื่น ๆ ที่วาดลงไปในภาพจะไม่ถูกอ่าน จึงไม่ถูกแปล มิวสิกวิดีโอที่มีบทพูดน้อยหรือไม่มีเลยจะได้ผลลัพธ์ออกมาเบาบาง เพราะมีบทพูดให้จดน้อย การที่คนสองคนพูดพร้อมกัน ห้องที่มีเสียงรบกวน และไมโครโฟนที่เก็บเสียงไม่ชัด ล้วนทำให้บรรทัดต้นฉบับอ่อนแอลง และการแปลก็ซ่อมบรรทัดที่ผิดอยู่แล้วไม่ได้ ควรอ่านต้นฉบับเทียบกับเวลากำกับก่อนจะถือว่าคำแปลนั้นใช้อ้างอิงได้

ลิงก์ต้องเป็นแบบสาธารณะ วิดีโอส่วนตัว วิดีโอที่ถูกลบ วิดีโอสำหรับสมาชิกเท่านั้น หรือลิงก์ที่เล่นได้เฉพาะในบัญชีของคนอื่น จะเปิดจาก URL สาธารณะที่วางลงไปไม่ได้ ข้อจำกัดด้านอายุและข้อจำกัดด้านภูมิภาคก็หยุดคำขอเดียวกันนี้ได้เช่นกัน ไม่มีสวิตช์ใดบังคับให้ YouTube ให้บริการวิดีโอที่มันไม่ยอมให้ได้

## สร้างก่อน แล้วค่อยแปล

การแปลเป็นขั้นตอนที่สอง ขั้นตอนแรกคือทรานสคริปต์ในภาษาของคำบรรยายหรือของบทพูด ถ้าข้ามขั้นตอนนี้ไป ก็จะไม่มีอะไรที่เป็นรูปบรรทัดให้แปล บทสรุป กระทู้คอมเมนต์ หรือคำอธิบายวิดีโอ ไม่ใช่ตัวแทนของบทพูด พวกมันไม่ใช่ลำดับคำพูด และไม่ได้มีเวลากำกับในแต่ละบรรทัด

![สี่ขั้นตอนในการแปลวิดีโอ YouTube เป็นข้อความ คัดลอก URL สร้างบรรทัด แปล จากนั้นตรวจสอบและส่งออก](/images/blog/translate-youtube-transcript/th/8f0d7e15.jpg)

บน transcript.im ทำตามลำดับนี้:

1. คัดลอก URL ของวิดีโอสาธารณะที่คุณต้องการในอีกภาษา
2. วางลิงก์และสร้างบรรทัดต่าง ๆ ก่อนจะเลือกภาษาเป้าหมาย คำบรรยายที่มีอยู่บนวิดีโอแล้วคือต้นฉบับ บทพูดจะถูกถอดความก็ต่อเมื่อไม่มีคำบรรยายเหล่านั้น
3. กด Translate กับบรรทัดเหล่านั้น แล้วเลือกหนึ่งภาษาที่รองรับ ข้อความจะเปลี่ยนไป แต่ไฟล์ที่อัปโหลดบน YouTube ไม่เปลี่ยน
4. ตรวจบรรทัดที่แปลเทียบกับเวลาต้นฉบับ แล้วส่งออกเมื่อคำแปลต้องอยู่นอกเบราว์เซอร์

สำหรับการ[ถอดข้อความจาก YouTube](/th/youtube-transcript) คุณมีลิงก์อยู่ในมือแล้ว ไม่ต้องอัปโหลดวิดีโอซ้ำ และไม่ต้องพิมพ์คำแปลด้วยมือเอง เว้นแต่คุณจะแก้ไขบรรทัดในภายหลัง การแก้ไขจะอยู่ในสำเนาของคุณ ไม่ได้เขียนกลับไปที่ไฟล์ต้นฉบับที่อัปโหลด

ภาษาเป้าหมายคือหนึ่งในภาษาที่รองรับ ได้แก่ อาหรับ จีน (ตัวย่อ) อังกฤษ ฝรั่งเศส เยอรมัน ฮินดี อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน จีนในที่นี้คือจีนตัวย่อ ไม่ใช่ภาษาเป้าหมายจีนตัวเต็มแยกต่างหาก โปรตุเกสเป็นเป้าหมายเดียว ไม่ได้แยกตามประเทศ ถ้าภาษาที่คุณต้องการไม่อยู่ในรายการนี้ ขั้นตอนนี้จะไม่สร้างภาษานั้นขึ้นมาเอง ให้เลือกเป้าหมายที่เครื่องมือมีจริง หรือแปลข้อความที่ส่งออกไปยังที่อื่นที่รองรับภาษานั้น และยอมรับว่าเครื่องมือที่สองอาจไม่เก็บเวลากำกับไว้ เว้นแต่คุณจะพกเวลาไปเอง

ภาษาต้นฉบับคือภาษาที่คำบรรยายหรือบทพูดเป็นอยู่เดิม วิดีโอที่พูดภาษาญี่ปุ่นจะได้บรรทัดภาษาญี่ปุ่นออกมาก่อน แม้คุณจะตั้งใจอ่านภาษาสเปน การแปลเป็นการเลือกภาษาเป้าหมายในภายหลัง และเป้าหมายที่ต่างกันก็คือการแปลชุดบรรทัดต้นฉบับเดิมอีกครั้ง การสลับจากสเปนเป็นเยอรมันไม่ได้แก้ผลลัพธ์ภาษาสเปนให้กลายเป็นเยอรมัน แต่มันแปลต้นฉบับใหม่อีกครั้ง

คำบรรยายอัตโนมัติ ถ้ามีอยู่ ก็ยังเป็นต้นทางอยู่ดี คุณภาพของมันขึ้นอยู่กับแทร็กคำบรรยายนั้นเท่านั้น ชื่อเฉพาะ สำเนียง และคำพูดแทรกที่พูดเร็ว ๆ คือจุดที่มันพลาด การถอดความจากเสียงในวิดีโอที่ไม่เคยมีคำบรรยายเลยก็มีข้อจำกัดแบบเดียวกัน นั่นคือ ข้อความจะตามสิ่งที่บันทึกไว้ ให้แปลหลังจากที่คุณดูบรรทัดต้นทางที่คุณสนใจแล้ว ไม่ใช่ก่อนหน้านั้น

## รักษาไทม์สแตมป์ให้ตรงกัน

เวลายังอยู่ที่เดิม เพราะการแปลไม่ได้สร้างไทม์ไลน์ขึ้นใหม่ แต่ละบรรทัดยังคงมีเวลาเริ่มต้นและความยาวเท่าเดิมก่อนที่ถ้อยคำจะเปลี่ยน มีเพียงข้อความเท่านั้นที่ถูกแทนที่ ประโยคที่เริ่มต้นที่ 1:02 ก็ยังเริ่มที่ 1:02 ในการแปล แม้ว่าถ้อยคำใหม่จะยาวหรือสั้นกว่าเดิมก็ตาม

![บรรทัดข้อความถอดความต้นฉบับและคำแปลวางเคียงกันพร้อมเวลากำกับเดียวกัน](/images/blog/translate-youtube-transcript/th/eb07064b.jpg)

นี่คือวิธีที่การแปลยังคงผูกอยู่กับช่วงเวลานั้นในวิดีโอ บรรทัดที่แปลแล้วเป็นเหมือนป้ายกำกับบนช่วงเวลาต้นฉบับ ไม่ใช่การแสดงรอบใหม่ที่มีจังหวะของตัวเอง เวลาข้างบรรทัดก็ยังเป็นช่วงเวลานั้นในวิดีโอต้นทาง คุณได้ยินเสียงพูดต้นฉบับ และอ่านคำแปล คุณไม่ได้ยินเสียงพากย์ เพราะไม่มีการสร้างเสียงใหม่ขึ้นมา

การส่งออกใช้เวลาเดียวกันนั้น ไฟล์ TXT ของคำแปลจะมีความเฉพาะคำที่แปลแล้ว บรรทัดละหนึ่งคิว โดยไม่มีเวลา ส่วน SRT และ VTT จะเก็บเวลาเริ่มต้นและสิ้นสุดไว้ เพื่อให้โปรแกรมตัดต่อหรือเว็บเพลเยอร์แสดงคิวที่แปลแล้วได้ เวลาสิ้นสุดคือเวลาสิ้นสุดของบรรทัดต้นฉบับ ซึ่งถูกตัดให้ไม่ทับกับคิวถัดไป เพลเยอร์จึงแสดงทีละบรรทัดแทนที่จะซ้อนกันสองบรรทัด

คำแปลที่ยาวขึ้นเป็นส่วนที่คนมักเข้าใจผิด คิวไม่ได้ขยายออกเพื่อให้พอดีกับประโยคใหม่ ถ้อยคำต้องอยู่ในกรอบเวลาเดิม บรรทัดภาษาอังกฤษสั้น ๆ ที่กลายเป็นบรรทัดภาษาเยอรมันยาว ๆ ก็ยังสิ้นสุดเมื่อคิวต้นฉบับสิ้นสุด บนหน้าจอ เพลเยอร์อาจตัดข้อความให้ขึ้นบรรทัดใหม่มากขึ้นในช่วงเวลาเดียวกัน ไฟล์ไม่ได้ปรับเวลาวิดีโอให้เข้ากับเสียงที่พูดคำแปล ถ้าภายหลังคุณจะบันทึกเสียงพากย์ คุณต้องจัดเวลาเสียงพากย์นั้นเอง การส่งออกนี้จะไม่ทำให้คุณ

ตัวอ่านสามารถแสดงเวลาเริ่มต้นข้างบรรทัดที่แปลแล้วแต่ละบรรทัดในขณะที่คุณตรวจได้ การคัดลอกข้อความเหมือนกับการส่งออก TXT จะได้แค่ถ้อยคำและตัดเวลาทิ้งไป ถ้าเวลาต้องเดินทางไปพร้อมกับประโยค ให้ใช้ SRT หรือ VTT หรือจดเวลาไว้ข้างประโยคที่คุณวางลงในบันทึก การจัดตำแหน่งนี้จะมีประโยชน์ก็ต่อเมื่อคุณเก็บมันไว้คู่กับบรรทัดที่คุณกำลังจะอ้างอิง

Clean ถ้าคุณเรียกใช้ เป็นขั้นตอนที่แตกต่างออกไป มันแก้ไวยากรณ์ เครื่องหมายวรรคตอน และข้อผิดพลาดจากการรู้จำในข้อความ และเก็บเวลาไว้ มันไม่ใช่การแปล Translate คือขั้นตอนที่เปลี่ยนภาษา ให้เรียก Clean กับต้นฉบับเมื่อบรรทัดนั้นเพี้ยน แล้วจึงแปล เพื่อที่คุณจะได้ไม่แปลข้อผิดพลาดจากการรู้จำให้กลายเป็นประโยคผิด ๆ ที่ดูมั่นใจในอีกภาษา

## จุดพลาดที่พบบ่อย

จุดพลาดที่เจอบ่อยคือการแปลผิดวัตถุ ไทเทิลบนหน้าจอ สไลด์ที่ถ่ายด้วยกล้อง และคำบรรยายที่ฝังอยู่ในภาพ ไม่ได้อยู่ในทรานสคริปต์ จึงไม่ออกมาในอีกภาษา ถ้าความหมายของวิดีโออยู่ในกราฟิกเหล่านั้นและเสียงไม่เคยพูดออกมา การแปลจะกู้มันกลับมาไม่ได้ คุณจะได้อ่านแค่คำพูดเท่านั้น

![การตรวจสอบก่อนส่งออกข้อความถอดความที่แปลแล้ว ข้อความบนหน้าจอ ไม่มีเสียงใหม่ ชื่อและตัวเลข และบรรทัดยาวในคิวเดียวกัน](/images/blog/translate-youtube-transcript/th/9922202b.jpg)

จุดพลาดถัดมาคือการคาดหวังแทร็กเสียงใหม่ ถอดข้อความจาก YouTube แล้วสิ่งที่คุณเก็บไว้ได้คือถ้อยคำ คุณไม่ได้เสียงแทน เสียงพากย์ที่ปากตรง หรือไทม์ไลน์ที่สร้างใหม่ตามความยาวของประโยคที่แปล เสียงต้นฉบับยังคงเป็นตัวกำหนดเวลา การพากย์เป็นการตัดต่อแยกต่างหาก

จุดพลาดอีกอย่างคือการแปลเรื่องย่อสั้น ๆ แล้วคาดหวังเวลาระดับบรรทัด สรุป ประเด็นสำคัญ และสรุปเป็นบท เป็นมุมมองแบบย่อของทรานสคริปต์เดียวกัน มีประโยชน์ก่อนที่คุณจะอ่านทุกบรรทัด พวกมันไม่ใช่ทรานสคริปต์ที่แปลแล้ว และไม่ได้ให้คิวที่มีเวลาหนึ่งคิวต่อหนึ่งบรรทัดที่พูด การแปลที่ยังคงจัดตำแหน่งอยู่จะทำงานบนบรรทัดของทรานสคริปต์เอง Study Notes, Meeting Summary, Creator Repurpose, Moments และ MindMap เป็นมุมมองอื่น ๆ ของข้อความนั้น ไม่มีอันไหนเป็นการเปลี่ยนภาษา MindMap สามารถชี้โหนดไปที่ช่วงเวลาหนึ่ง ซึ่งช่วยให้คุณนำทางได้ แต่มันก็ยังไม่ใช่ถ้อยคำที่แปลแล้วของแต่ละบรรทัด

ชื่อเฉพาะ ตัวเลข และสำนวน ต้องมีคนดูให้ การถอดเสียงชื่ออาจถูกทับศัพท์ แปลครึ่ง ๆ หรือปล่อยไว้อย่างที่ได้ยิน มุกที่อาศัยภาษาต้นฉบับจะไม่รอดจากการแปลตรงตัวทีละบรรทัด ก่อนที่คุณจะอ้างคำแปลว่าเป็นสิ่งที่ผู้พูดพูด ให้เปิดไทม์สแตมป์และฟัง คำแปลเป็นการถ่ายทอดบรรทัดนั้น ส่วนสิ่งที่บันทึกไว้คือต้นทาง

คำพูดเร็วในคิวสั้น ๆ มีข้อจำกัดในทางปฏิบัติเหมือนกับคำแปลยาว ๆ กรอบเวลาถูกกำหนดโดยบรรทัดต้นฉบับ ถ้าคุณวาง SRT ลงในโปรแกรมตัดต่อแล้วคิวที่แปลแล้วรู้สึกอึดอัด ให้แยกหรือเขียนคิวนั้นใหม่ในโปรแกรมตัดต่อ อย่าคาดหวังว่าการส่งออกจะยืดช่วงเวลานั้นออกไป

วิดีโอที่แทบไม่มีคำพูดจะแปลออกมาแทบไม่มีอะไร ความเงียบ ดนตรี และเสียงปรบมือไม่ใช่ประโยค ถ้าทรานสคริปต์มีแค่ไม่กี่บรรทัด คำแปลก็จะมีแค่ไม่กี่บรรทัด นั่นเป็นคุณสมบัติของต้นทาง ไม่ใช่ความล้มเหลวของภาษาเป้าหมาย

ถ้าทรานสคริปต์ไม่เริ่มสักที การแปลก็ไม่มีทางเริ่มต้นได้ สาเหตุที่พบบ่อยคือวิดีโอที่คนทั่วไปเข้าถึงไม่ได้

ถ้าปลายทางคือแทร็กคำบรรยายแบบมีเวลาสำหรับเครื่องเล่น ให้ส่งออก SRT หรือ VTT ของบรรทัดที่แปลแล้ว หน้าที่ว่าด้วยการสร้างแทร็กแบบนั้นจากลิงก์ YouTube ในฐานะคำบรรยาย ไม่ใช่ข้อความสำหรับอ่าน คือ [เครื่องมือสร้างคำบรรยาย YouTube](/th/youtube-subtitle-generator) ใช้บทความนี้เมื่องานคือถ้อยคำที่แปลแล้ว รวมถึงไฟล์แบบมีเวลาของถ้อยคำนั้น ส่วนเครื่องมือสร้างคำบรรยายใช้เมื่องานคือตัวแทร็กคำบรรยายเอง

เมื่อคำบรรยายซ้อนบนจอเพียงพอ ก็ดูไปพร้อมกับมันได้เลย แต่เมื่อคุณต้องการคำในอีกภาษาหนึ่งพร้อมช่วงเวลาต้นฉบับติดมาด้วย ให้สร้างทรานสคริปต์ แปลบรรทัดเหล่านั้น และเก็บเวลาไว้ [เครื่องมือถอดข้อความจาก YouTube](/th/youtube-transcript) คือที่ที่ลิงก์สาธารณะกลายเป็นข้อความที่คุณนำไปแปลต่อ
