---
title: "تحويل فيديو يوتيوب الى نص مع الحفاظ على التوقيتات"
description: "تحويل فيديو يوتيوب الى نص يبدأ بتوليد الجمل المنطوقة ثم ترجمتها، مع إبقاء توقيت كل جملة من اللحظة الأصلية."
canonical: "https://transcript.im/ar/blog/translate-youtube-transcript"
markdown: "https://transcript.im/ar/blog/translate-youtube-transcript.md"
author: "Leo"
category: "YouTube"
datePublished: "2026-10-03T03:14:51.000Z"
dateModified: "2026-10-03T06:00:38.435Z"
---
لتحويل فيديو يوتيوب الى نص، اكتب ما قيل ثم ترجم تلك الأسطر. الصورة ليست ما يُترجم، بل الكلمات المنطوقة. يستطيع يوتيوب أن يعرض لك الترجمة أثناء تشغيل الفيديو، وفي بعض الفيديوهات يمكن للمشغّل أن يرسم ترجمة فوق الصورة طالما بقيت تشاهد. تلك الطبقة تختفي بمجرد أن تغادر. أما الترجمة التي يمكنك الاقتباس منها والبحث فيها وتسليمها لشخص آخر فهي تفريغ نصي مترجم، لا يزال كل سطر فيه يشير إلى اللحظة الأصلية.

تصف [صفحة المساعدة في يوتيوب لعرض النصوص](https://support.google.com/youtube/answer/15930243) وضع القراءة: افتح **Show transcript** من الوصف، وتابع السطر الحالي، وانقر على أي سطر للانتقال إليه. لكنها لا تصف مستندًا مترجمًا، ولا تشرح كيفية حفظه. وما تبقّى من هذه الصفحة هو الترتيب الذي ينتج ذلك المستند. أنشئ التفريغ النصي. ترجم الأسطر. أبقِ الأوقات كما كانت.

## لماذا نترجم التفريغ النصي

سبب ترجمة التفريغ النصي بدلًا من ملف الفيديو هو أن الكلمات هي ما ستعيد استخدامه لاحقًا. فمحاضرة تتابعها كتابةً أفضل من السمع، واقتباس تحتاج إلى نقله بلغة ملاحظاتك، ومقطع ستضيف إليه ترجمة لجمهور آخر، كلها تبدأ من الشيء نفسه: الأسطر المنطوقة مكتوبةً. ترجمة ملف MP4 لا تنتج ذلك النص، ودبلجة مسار صوتي جديد لا تنتجه أيضًا. تلك مهام مختلفة، وليست هذه الصفحة عنها.

بعض المشاهدين لا يحتاجون سوى الطبقة المترجمة. إن كان المشغّل يعرض ترجمة بالفعل وأنت تشاهد لمرة واحدة، فابقَ هناك. لكنك تحتاج إلى تجاوزها عندما تريد الصياغة بعد إغلاق التبويب، أو تريد البحث عن عبارة، أو يجب نقل الترجمة إلى مستند أو محرر. الطبقة المترجمة عرض بصري، أما التفريغ النصي فهو النص.

يرسم التفريغ النصي أيضًا حدًا واضحًا لما يمكن ترجمته. الكلام المنطوق داخل النطاق، أما بطاقات العناوين المدمجة في الصورة والشرائط السفلية وسائر النصوص المرسومة داخل الإطار فلا تُقرأ، وبالتالي لا تُترجم. والفيديو الموسيقي الذي يخلو من الكلام أو يكاد يعود نحيلًا، لأن ما يُكتب قليل. كما يُضعف تحدث شخصين في الوقت نفسه وغرفة صاخبة وميكروفون مكتوم الأسطر المصدر، ولا تستطيع الترجمة إصلاح سطر كان خاطئًا أصلًا. قارن السطر المصدر بالطابع الزمني قبل أن تتعامل مع الترجمة كاقتباس.

يجب أن يكون الرابط عامًا. فالفيديو الخاص، أو المحذوف، أو المخصص للأعضاء فقط، أو الرابط الذي لا يعمل إلا داخل حساب شخص آخر، لن يُفتح من عنوان URL عام ملصوق. وقد توقف حدود العمر والقيود الجغرافية الطلب نفسه. ولا يوجد مفتاح يجبر يوتيوب على تقديم فيديو يرفض تقديمه.

## أنشئ أولًا ثم ترجم

الترجمة هي الخطوة الثانية، أما الخطوة الأولى فهي التفريغ النصي بلغة الترجمة أو بلغة الكلام. تجاوز تلك الخطوة ولن يبقى شيء على شكل أسطر لتترجمه. الملخص أو سلسلة التعليقات أو وصف الفيديو ليس بديلًا عنها؛ فهي ليست التسلسل المنطوق، ولا تحمل وقتًا لكل سطر.

![أربع خطوات لتحويل فيديو YouTube إلى نص: انسخ الـ URL، وولّد الأسطر، ثم ترجم، ثم راجع وصدّر](/images/blog/translate-youtube-transcript/ar/a543c45e.jpg)

على transcript.im، اتبع هذا الترتيب:

1. انسخ عنوان URL للفيديو العام الذي تريده بلغة أخرى.
2. الصقه وأنشئ الأسطر قبل أن تختار اللغة الهدف. الترجمة الموجودة على الفيديو أصلًا هي المصدر، ولا يُفرَّغ الكلام إلا عند غيابها.
3. شغّل Translate على تلك الأسطر واختر لغة مدعومة واحدة. تتغير الصياغة، أما الفيديو المرفوع على يوتيوب فلا.
4. طابق السطر المترجم مع وقته الأصلي. صدّر عندما يجب أن تعيش الترجمة خارج المتصفح.

لـ[تحويل فيديو يوتيوب الى نص](/ar/youtube-transcript) تملك الرابط بالفعل. لا تعيد رفع الفيديو، ولا تكتب الترجمة يدويًا إلا إذا كنت تصحح سطرًا لاحقًا. يبقى التصحيح في نسختك، ولا يُكتب مجددًا في الفيديو الأصلي المرفوع.

اللغة الهدف إحدى اللغات المدعومة: العربية، الصينية (المبسطة)، الإنجليزية، الفرنسية، الألمانية، الهندية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية، والإسبانية. الصينية هنا مبسطة، وليست هدفًا منفصلًا بالصينية التقليدية. والبرتغالية هدف واحد لا يُقسَّم حسب البلد. وإن لم تكن اللغة التي تحتاجها في تلك القائمة، فلن تبتكرها هذه الخطوة. اختر هدفًا تقدمه الأداة فعلًا، أو ترجم النص المصدَّر في مكان يقدم تلك اللغة، وتقبّل أن الأداة الثانية قد لا تحافظ على أزمنة الحوار إلا إذا نقلتها بنفسك.

لغة المصدر هي ما كانت عليه الترجمة أو الكلام أصلًا. فالفيديو المنطوق باليابانية يعود بأسطر يابانية أولًا، حتى لو كنت تنوي القراءة بالإسبانية. الترجمة اختيار لاحق للغة الهدف، وكل هدف مختلف ترجمة منفصلة للأسطر المصدر نفسها. والانتقال من الإسبانية إلى الألمانية لا يحوّل النتيجة الإسبانية إلى ألمانية، بل يترجم المصدر من جديد.

تبقى التسميات التوضيحية التلقائية، عند وجودها، هي المصدر. وجودتها رهينة بجودة مسار التسميات ذاك. فالأسماء واللكنات والاستطرادات السريعة هي مواضع الخلل فيها. أما التفريغ من الصوت، في فيديو لم توضع له تسميات قط، فيحمل الحدّ نفسه: فالنص يتبع التسجيل. ترجم بعد أن تطّلع على سطر المصدر الذي يهمك، لا قبل ذلك.

## حافظ على محاذاة الطوابع الزمنية

يبقى التوقيت في مكانه لأن الترجمة لا تعيد بناء الخط الزمني. يحتفظ كل سطر بوقت البداية والمدة التي كانت له قبل تغيّر الصياغة. لا يُستبدل سوى النص. فالجملة التي بدأت عند 1:02 ما زالت تبدأ عند 1:02 في الترجمة، حتى لو كانت الصياغة الجديدة أطول أو أقصر من الأصلية.

![أسطر النص المكتوب الأصلية والمترجمة جنبًا إلى جنب مع الطوابع الزمنية نفسها](/images/blog/translate-youtube-transcript/ar/95aa8ca8.jpg)

بهذه الطريقة تبقى الترجمة ملتصقة باللحظة في الفيديو. فالسطر المترجم عنوان على اللحظة الأصلية، لا أداء جديد بإيقاعه الخاص. والوقت المذكور إلى جانب السطر ما زال هو تلك اللحظة في الفيديو المصدر. تسمع الكلام الأصلي وتقرأ الترجمة. ولا تسمع صوتًا مدبلجًا، لأنه لم يُنتج صوت جديد.

يستخدم التصدير تلك الأوقات نفسها. فملف TXT للترجمة يحتوي الكلمات المترجمة فقط، سطرًا واحدًا لكل مقطع، مع إغفال الأوقات. أما SRT وVTT فيحتفظان بوقت بداية ووقت نهاية كي يتمكن المحرر أو مشغل الويب من عرض المقطع المترجم. والنهاية هي نهاية السطر الأصلي، مقصوصة بحيث لا تتقاطع مع المقطع التالي. عندئذٍ يعرض المشغل سطرًا واحدًا في كل مرة بدل تكديس سطرين.

الترجمة الأطول هي الجزء الذي يخطئ الناس في فهمه. فالمقطع لا يتمدد ليتسع للجملة الجديدة. بل يجب أن تعيش الكلمات داخل النافذة الأصلية. فالسطر الإنجليزي القصير الذي يصبح سطرًا ألمانيًا طويلًا ينتهي مع ذلك عند نهاية المقطع الأصلي. وعلى الشاشة، قد يلفّ المشغل نصًا أكبر في المدى نفسه. ولم يُعد الملف توقيت الفيديو ليتوافق مع صوت ينطق الترجمة. وإذا سجّلت دبلجة لاحقًا، فأنت من سيضبط توقيت تلك الدبلجة. لن يفعل التصدير ذلك نيابة عنك.

يمكن للقارئ أن يعرض وقت البداية إلى جانب كل سطر مترجم أثناء مراجعتك له. أما نسخ المقطع، مثل تصدير TXT، فيأخذ الكلمات ويسقط الأوقات. وإذا كان لا بد أن ينتقل الوقت مع الجملة، فاستخدم SRT أو VTT، أو دوّن الوقت بجانب الجملة التي تلصقها في ملاحظاتك. ولا تفيد المحاذاة إلا إذا أبقيتها ملتصقة بالسطر الذي أنت على وشك اقتباسه.

أما التنظيف، إن شغّلته، فهو تمريرة مختلفة. يصحّح القواعد والترقيم وأخطاء التعرّف في النص ويحتفظ بالأوقات. لكنه ليس ترجمة. فالترجمة هي التمريرة التي تغيّر اللغة. شغّل التنظيف على المصدر عندما يكون سطر مشوّهًا، ثم ترجم، حتى لا تترجم خطأ تعرّف إلى جملة خاطئة واثقة في اللغة الأخرى.

## مزالق شائعة

الخطأ المعتاد هو ترجمة الشيء الخطأ. فالعناوين الظاهرة على الشاشة، والشرائح المصوّرة بالكاميرا، والتسميات المحروقة في الصورة، ليست في النص المفرّغ، ولذلك لا تظهر باللغة الأخرى. وإذا كان معنى الفيديو كامنًا في تلك الرسوم ولم ينطقه الصوت قط، فلن تستعيده الترجمة. وستكون قراءتك للكلام وحده.

![فحوص قبل تصدير نص مكتوب مترجم: النص الظاهر على الشاشة، وعدم ظهور صوت جديد، والأسماء والأرقام، والأسطر الطويلة في المقطع نفسه](/images/blog/translate-youtube-transcript/ar/3125f3e7.jpg)

الخطأ التالي هو توقّع مسار صوتي جديد. فعند تحويل فيديو يوتيوب الى نص، لا يمكنك الاحتفاظ سوى بالصياغة. لن تحصل على صوت بديل، ولا دبلجة متزامنة مع حركة الشفاه، ولا خط زمني معاد بناؤه وفق طول الجملة المترجمة. فالصوت الأصلي يبقى هو الساعة. والدبلجة تعديل منفصل.

ومن المزالق أيضًا ترجمة إعادة سرد قصيرة وتوقّع أوقات على مستوى السطر. فالملخص والنقاط الأساسية وملخص الفصل عروض أقصر للنص المفرّغ نفسه. وهي مفيدة قبل أن تقرأ كل سطر. لكنها ليست النص المفرّغ المترجم، ولا تمنحك مقطعًا موقوتًا واحدًا لكل سطر منطوق. فالترجمة التي تبقى محاذية تسير على أسطر النص المفرّغ نفسها. أما ملاحظات الدراسة وملخص الاجتماع وإعادة استخدام المحتوى للمبدعين واللحظات والخريطة الذهنية فهي عروض أخرى لذلك النص. وليس أي منها تغيير اللغة. ويمكن للخريطة الذهنية أن تشير بعقدة إلى لحظة، وهو ما يساعدك على التنقل. لكنها تظل ليست الصياغة المترجمة لكل سطر.

تحتاج الأعلام والأرقام والتعابير الاصطلاحية إلى نظرة بشرية. فقد يُنقل الاسم صوتيًا، أو يُترجم جزئيًا، أو يُترك كما سُمع. والنكتة التي تعتمد على اللغة الأصلية لن تنجو من ترجمة حرفية سطرًا بسطر. وقبل أن تقتبس الترجمة على أنها ما قاله المتحدث، افتح الطابع الزمني واستمع. فالترجمة صياغة للسطر، والتسجيل هو المصدر.

الكلام السريع في مقطع قصير يواجه الحد العملي نفسه الذي تواجهه الترجمة الطويلة. فقد حُددت النافذة بالسطر الأصلي. وإذا أدرجت ملف SRT في محرر وشعرت أن المقطع المترجم ضيّق، فقسّم ذلك المقطع أو أعد كتابته في المحرر. ولا تتوقع أن يكون التصدير قد أطال اللحظة.

الفيديو الذي لا يكاد يحتوي كلامًا سيُترجم إلى ما لا يكاد يُذكر. فالصمت والموسيقى والتصفيق ليست جملًا. وإذا كان النص المفرّغ بضعة أسطر، فستكون الترجمة بضعة أسطر. وهذه خاصية في المصدر، لا فشل في اللغة الهدف.

إذا لم يبدأ التفريغ النصي أبدًا، فلن تبدأ الترجمة أبدًا. والسبب المعتاد هو فيديو غير متاح للعموم.

إذا كانت الغاية مسار ترجمة موقوتًا لمشغّل، فصدّر السطور المترجمة بصيغة SRT أو VTT. الصفحة التي تشرح إنشاء هذا النوع من المسار من رابط YouTube، كترجمات لا كنص للقراءة، هي [مولّد ترجمة يوتيوب](/ar/youtube-subtitle-generator). استخدم هذا المقال عندما تكون المهمة هي الصياغة المترجمة، بما في ذلك الملف الموقوت لتلك الصياغة. واستخدم مولّد الترجمة عندما تكون المهمة هي مسار الترجمة نفسه.

عندما تكفي الترجمة المتراكبة، شاهِد الفيديو معها. وعندما تحتاج إلى الكلمات بلغة أخرى مع إرفاق اللحظة الأصلية، فأنشئ التفريغ النصي، وترجم السطور، واحتفظ بالتوقيتات. [أداة تحويل فيديو يوتيوب الى نص](/ar/youtube-transcript) هي المكان الذي يتحول فيه ذلك الرابط العام إلى النص الذي تترجمه بعد ذلك.
