تعليق صوتي بالذكاء الاصطناعي عربي 2026: دليل ElevenLabs وغيره

دليل عملي للتعليق الصوتي بالذكاء الاصطناعي بالعربي في 2026: أدوات مثل ElevenLabs، واختيار اللهجة، والتشكيل، وكتابة النص للأذن، والإخراج، وحقوق الصوت.

التعليق الصوتي بالذكاء الاصطناعي (AI Voice Over) أن تكتب النص، وتختار صوتاً جاهزاً أو تصمم صوتاً جديداً، فتقرأ الأداة النص بصوت قريب جداً من صوت الإنسان. وأشهر أداة يبحث عنها الناس هي ElevenLabs (إليفن لابز أو إلفن لابس)، وهي تقرأ العربية في أكتوبر 2026، ومعها أصوات عربية من Microsoft و Google وغيرهما.

لكن المشكلة في العربية لم تعد في الأداة، بل في اللغة نفسها: هل يتكلم الإعلان بالفصحى أم باللهجة؟ كيف ستُقرأ كلمة بلا تشكيل؟ كيف سيُنطق السعر واسم العلامة؟ وهل كُتب النص ليُسمع أصلاً؟ هذه قرارات المخرج، والمستمع في الرياض أو القاهرة يحكم عليها من الجملة الأولى.

في هذا المقال أشرح ما تفعله أدوات الصوت، وأهم الأدوات في 2026 كما تصفها مواقعها الرسمية، وأين يخطئ الصوت العربي وكيف تتجنب ذلك، ثم كتابة النص للأذن، وإخراج الأداء، والمكساج مع الموسيقى، ومتى يكون المعلّق البشري أفضل، وأخيراً الموافقة والحقوق والإفصاح. والمقال جزء من دليلي الأشمل عن تحويل الصور إلى فيديو بالذكاء الاصطناعي، حيث الصوت خطوة من خطوات الفيلم.

ماذا تفعل أدوات التعليق الصوتي بالذكاء الاصطناعي؟

أغلب الأدوات تقدم أربع وظائف. قد تتداخل، لكن الفصل بينها مفيد، لأن لكل واحدة مخاطرها.

الوظيفةماذا تفعلمناسبة لـانتبه إلى
تحويل النص إلى كلام (Text to Speech)تقرأ النص بصوت تختارهالإعلانات والشروحات والفيديو التعليمي ونسخ التوقيتكلمات تُقرأ خطأ، وأداء رتيب في النصوص الطويلة
تصميم الصوت (Voice Design)تصنع صوتاً جديداً من وصف مكتوبصوت لا يخص شخصاً حقيقياًيحتاج عدة محاولات، فجرّبه بلهجتك
استنساخ صوتك (Voice Cloning)تصنع نموذجاً لصوتك من تسجيلاتكصاحب المشروع أو المدرّب الذي يعلّق كثيراًصوتك يستطيع الآن أن يقول ما لم تقله
الدبلجة (Dubbing)تترجم كلام الفيديو وتحافظ على صوت المتحدثنقل فيديو موجود إلى سوق ثانٍالترجمة تحتاج مراجعة من متحدث أصلي

وأنصح أغلب العلامات التجارية بأن تبدأ بتصميم الصوت. تصف ElevenLabs الميزة ببساطة: تكتب وصفاً يشمل اللكنة والعمر والجنس والنبرة والإيقاع، فتعطيك ثلاث معاينات تختار منها. والنتيجة صوت لا يملكه أحد، فتسقط معظم أسئلة الموافقة قبل أن تبدأ.

أهم أدوات التعليق الصوتي العربي في 2026

راجعت هذه الملاحظات من المواقع الرسمية في أكتوبر 2026. النماذج والحدود تتغير كل بضعة أشهر، فراجعها قبل أن تبني مشروعاً على ميزة بعينها.

ElevenLabs (إليفن لابز)

هي أداة الصوت المدرجة في قائمة برامجي. أطلقت في 28 سبتمبر 2026 نموذجي Eleven v4 و Eleven v4 Turbo، وتقول في إعلانها إنهما يدعمان أكثر من 90 لغة. ووثائقها تذكر العربية في v4 وفي النماذج الأقدم التي ما زالت متاحة، مثل Eleven v3 و Multilingual v2، وتصف الأخير بأنه الأثبت في النصوص الطويلة.

وحول النماذج توجد الوظائف السابقة كلها: تصميم الصوت، والاستنساخ الفوري (Instant Voice Clone) والاحترافي (Professional Voice Clone)، والدبلجة التي تذكر وثائقها العربية مع خيار خاص بالعربية المصرية في نموذج الدبلجة الأحدث.

Microsoft Azure Speech

تعرض Microsoft أصواتها العربية حسب البلد: مصر والسعودية والإمارات والكويت وقطر والبحرين وعُمان والأردن ولبنان وسوريا والعراق واليمن والجزائر والمغرب وتونس وليبيا، بصوت نسائي وآخر رجالي لكل بلد. والخدمة موجهة أساساً للمطورين والتطبيقات عبر واجهة برمجية. واسم البلد يخبرك باللكنة التي بُني عليها الصوت، ولا يخبرك هل يقرأ باللهجة أم بالفصحى بنكهة محلية، فاستمع قبل أن تختار.

Google Cloud Text-to-Speech

تضع Google العربية تحت الرمز ar-XA، وتصفه وثائقها بأنه العربية الفصحى الحديثة، مع أصوات Standard و WaveNet وأصوات Chirp 3: HD الأحدث. هذا يناسب تعليقاً رسمياً عبر واجهة برمجية، ولا يناسب ريلز مقهى في جدة.

كيف أختار بينها

إذا كنت تحتاج إلىابدأ بـ
تعليق سريع لريلز، أو نسخة توقيت يسمعها العميلتحويل النص إلى كلام في ElevenLabs، بصوت من المكتبة أو صوت مصمَّم
صوت واحد ثابت في سلسلة طويلةصوت مصمَّم، أو نسخة من صوتك أنت، تحفظها وتعيد استخدامها
لكنة بلد بعينه داخل تطبيقأصوات Azure العربية المقسمة حسب البلد
فصحى رسمية عبر واجهة برمجيةأصوات ar-XA في Google Cloud
فيديو موجود بلغة ثانيةالدبلجة، ثم مراجعة متحدث أصلي

ثم ثلاثة أسئلة عن الخطة: هل تشمل ترخيصاً تجارياً؟ ما صيغ الصوت التي تصدّرها؟ وهل يكفي رصيدك لعدة محاولات لكل جملة؟

اختر المستوى اللغوي قبل أن تكتب

أول قرار في أي تعليق عربي ليس الأداة، بل اللغة التي يتكلم بها الإعلان:

  • الفصحى المبسطة: للجهات الحكومية والتعليم والأفلام المؤسسية، ولأي محتوى موجّه للعالم العربي كله. فيلم اليوم الوطني لجهة رسمية مثال واضح.
  • المصرية: للجمهور المصري، والمنتجات اليومية، وكل ما يعتمد على خفة الظل.
  • الخليجية: وهي ليست لهجة واحدة. المستمع السعودي يفرّق فوراً بين النجدية والحجازية، والإماراتي يسمع الفرق بين لهجته واللهجة الكويتية.
  • الشامية: لجمهور لبنان وسوريا والأردن وفلسطين، ولمحتوى أسلوب الحياة.

واللهجة تغيّر النص، لا النطق وحده. «بنفتح من الساعة تسعة» بالمصرية غير «نفتح الساعة تسع» بالسعودية، وكلاهما غير «نفتح أبوابنا في التاسعة صباحاً» بالفصحى. فقرر المستوى أولاً، واكتب النص به، واختر صوتاً تتكلم عيناته به أصلاً.

والخطأ الذي يجب تجنبه هو الخلط غير المقصود: جملة فصحى في منتصف إعلان عامّي، أو كلمة مصرية في فيلم سعودي. وتذكّر أن صوتاً مصمَّماً «بلكنة مصرية» يقرأ نصاً فصيحاً سيعطيك فصحى بنكهة مصرية، لا لهجة مصرية.

التشكيل والأسماء والأرقام: أين يخطئ الصوت العربي

شكّل ما يحتمل قراءتين

نكتب العربية عادة بلا حركات، والقارئ، إنساناً كان أو آلة، يخمّنها من السياق. في الغالب يصيب، وحين يخطئ يتغير المعنى: «عَلَم» و«عِلْم»، و«مَلِك» و«مَلَك»، و«قَدَّمَ» و«قَدِمَ».

ومثال من عملي: محمصة بن عابدين في القاهرة. كلمة «بن» هنا هي البُنّ، لكن الحرفين نفسيهما يُقرآن «بِن» بمعنى «ابن»، فيتحول اسم المحمصة إلى اسم رجل. كتابتها «بُنّ» بحركتيها تحسم الأمر.

لا تحتاج إلى تشكيل النص كله. شكّل الكلمات الملتبسة فقط، ثم استمع. وإن أصر الصوت على القراءة الخطأ، فأعد صياغة الجملة أو اختر كلمة لها قراءة واحدة.

اكتب الأسماء كما تُنطق

الاسم الأجنبي داخل نص عربي هو أكثر ما يتعثر فيه الصوت. اكتبه بالحروف العربية كما تريد أن يُسمع: «SkillUp MENA» تصبح «سكيل أب مينا». والاختصارات تحتاج قراراً أيضاً: هل تريد أن تُقرأ حروفاً، أم كلمة واحدة؟

وتتيح ElevenLabs قواميس نطق (Pronunciation Dictionaries) بقواعد استبدال، تضع فيها الكلمة والطريقة التي تُكتب بها لتُنطق صحيحة. اصنع قاموساً لكل علامة، فيبدأ الفيديو التالي والأسماء كلها صحيحة.

الأرقام والتواريخ والأسعار

الأرقام أصعب ما في العربية على أي قارئ. في الفصحى يتغير العدد مع المعدود تذكيراً وتأنيثاً ومع الإعراب، وفي اللهجات يُنطق بطرق أخرى، فالثلاثون في القاهرة «تلاتين». ودليل أفضل الممارسات في ElevenLabs نفسه ينصح بكتابة الأرقام والتواريخ والعملات كلمات قبل التوليد، وهذه النصيحة في العربية أهم مرتين.

  • السعر: اكتبه كلمات بالمستوى الذي اخترته: «تسعة وتسعين ريال» في إعلان سعودي عامّي، و«تسعة وتسعون ريالاً» في نص فصيح.
  • رقم الهاتف: اكتبه رقماً رقماً كما يقرؤه الناس.
  • السنة: كما تُقال، مثل «ألفين وستة وعشرين».
  • التاريخ: حدد هل هو هجري أم ميلادي حين يهم ذلك، كما في إعلانات رمضان والأعياد.

اكتب النص للأذن لا للعين

نص التعليق ليس بروشوراً يُقرأ بصوت عالٍ. المستمع لا يستطيع الرجوع إلى السطر السابق، فكل جملة يجب أن تصل من المرة الأولى.

  • فكرة واحدة لكل جملة. الجمل القصيرة تعطي الصوت أماكن طبيعية للتنفس.
  • لا أقواس ولا شرطات مائلة ولا نقاط تعداد. اكتبها كلمات، أو احذفها.
  • ضع الكلمة المهمة في آخر الجملة، فهناك يستقر الصوت وانتباه المستمع.
  • لا تصف الصورة. المشاهد يرى الفنجان، فأخبره بما لا يراه.
  • اذكر اسم العلامة في البداية، ومرة أخرى في النهاية.
  • وقّت النص بصوتك. اقرأه بإيقاع طبيعي مع ساعة توقيت، فهذا طوله الحقيقي، وهو غالباً أطول مما يبدو على الورق.
  • لكل لغة نصها. العلامة ثنائية اللغة في الخليج تحتاج نصين، لا نصاً وترجمته.

مثال سريع. نص مكتوب للعين: «تقدم الشركة حلولاً متكاملة ومبتكرة (برمجيات/استشارات) للقطاعين العام والخاص منذ 2010.» والفكرة نفسها مكتوبة للأذن: «منذ عام ألفين وعشرة، نعمل مع القطاعين العام والخاص. برمجيات واستشارات، تبدأ كلها من سؤال واحد: ماذا تحتاج؟»

أخرِج الأداء كما تُخرج ممثلاً

توليد الصوت أقرب إلى إخراج ممثل منه إلى ضغط زر التشغيل. تختار، وتسمع، وتعدّل، وتختار مرة أخرى.

  • اختر الصوت كما تختار ممثلاً. العمر والدفء والإيقاع يجب أن تناسب شخصية العلامة. واسمعه يقرأ نصك أنت، لا جملة العرض.
  • الوقفات بعلامات الترقيم. تذكر ElevenLabs أن Eleven v3 و v4 لا تدعمان وسوم الوقفة في SSML، فالنقطة والفاصلة والسطر الجديد هي أدواتك للتوقف. أما النماذج الأقدم فتقبل وسم الوقفة حتى ثلاث ثوانٍ.
  • وجّه الإحساس بالوسوم. تقبل نماذج ElevenLabs الأحدث وسوماً صوتية (Audio Tags) بين قوسين مربعين، مثل [whispers] للهمس أو [excited] للحماس، توجّه الأداء. تعامل معها كتوجيه لا كأمر، وجرّبها مع نصك العربي، واحذف أي سطر سياق يقرؤه الصوت بصوت عالٍ.
  • وازن بين الثبات والحيوية. إعداد Stability في ElevenLabs يوازن بين قراءة ثابتة وقراءة أكثر حيوية. الشرح الطويل يحتاج الثبات، والإعلان القصير يحتمل حيوية أكثر.
  • ولّد على مقاطع قصيرة. الفقرات الطويلة تنحرف، والمقاطع القصيرة تتيح لك اختيار أفضل محاولة لكل جملة ثم وصلها في المونتاج.
  • استعن بأذن من البلد. شخص من الجمهور المستهدف يسمع ما ستفوته أنت، خصوصاً في لهجة غير لهجتك.

المكساج: الصوت أولاً ثم الموسيقى

التعليق يحمل الرسالة، فالمكساج يخدمه:

  • ضع الصوت أولاً ثم الموسيقى، وركّب الصور على إيقاع الصوت لا العكس.
  • اختر موسيقى تترك مكاناً للكلام. الموسيقى الهادئة البسيطة تجلس تحت الصوت أفضل من المزدحمة. وتجنب الأغاني ذات الكلمات تحت التعليق، والعربية منها خصوصاً، فالكلمات تتنافس على أذن المستمع نفسها.
  • اخفض الموسيقى تحت الصوت، وارفعها في المسافات بين الجمل.
  • اسمع على سماعة الهاتف وعلى سماعات الأذن. فيديو السوشيال يُسمع كثيراً من سماعة صغيرة، تختفي فيها الموسيقى الهادئة ويتعب فيها الصوت الحاد الأذن.
  • رخّص الموسيقى. استخدم مكتبة أو أداة شروطها التجارية واضحة.
  • احتفظ بكل شيء. احفظ النص وإعدادات الصوت والمحاولات المختارة مع ملفات المشروع، خارج أي أداة واحدة.

متى يكون المعلّق البشري أفضل؟

الصوت المولّد سريع ومرن، لكنه ليس الاختيار الصحيح دائماً. وأنصح بمعلّق بشري في هذه الحالات:

  • حين يصبح الصوت صوت العلامة لسنوات، في التلفزيون والراديو والرد الآلي وكل إطلاق. صوت المكتبة متاح لأي أحد، أما المعلّق المتعاقد معه فيمكن أن يكون حصرياً لك.
  • حين تحمل العاطفة الفيلم كله. قصة فقد، أو نكتة تعيش على التوقيت، أو شخصية للأطفال.
  • حين يكون النص دينياً. تلاوة القرآن والأدعية لها ضوابطها وحساسيتها، ومكانها قارئ بشري مؤهل.
  • حين تكون اللهجة أو الشعر هو الفكرة. خفة الظل المصرية في الشارع، أو قصيدة فصيحة أو نبطية، تحتاج قارئاً يحسّ الإيقاع والوزن.

وهناك طريق وسط جيد: استخدم الصوت المولّد مسودة للتوقيت ولاعتماد العميل، ثم سجّل الصوت البشري على النص المعتمد. وإن أراد مؤدٍّ أن يقدم صوته عبر الذكاء الاصطناعي، فتصف ElevenLabs طريقاً يبقي الصوت ملكه: ينشئ نسخة احترافية من صوته على حسابه ويتحقق منها، ثم يشاركها معك برابط خاص.

الموافقة والحقوق والإفصاح

أنا مصمم ولست محامياً، والقوانين تختلف بين مصر والسعودية والإمارات وغيرها، فاستشر مختصاً قبل أي حملة كبيرة. وهذه نقاط لا أنصح بتجاوزها أبداً:

  • لا تستنسخ صوتاً دون إذن. سياسة الاستخدام المحظور في ElevenLabs، المحدَّثة في 17 أغسطس 2026، تمنع استخدام مخرجاتها لتقليد صوت شخص آخر دون موافقته أو حق قانوني، أو لخداع الناس بشأن كون الصوت مولّداً. والاستنساخ الاحترافي فيها مسموح لصوتك أنت فقط، حتى مع موافقة صاحب الصوت كما يقول مركز مساعدتها، ويمر بخطوة تحقق تقرأ فيها جملة بصوتك.
  • اجعل الموافقة مكتوبة. قبل أن تبني Microsoft صوتاً مخصصاً احترافياً، تطلب إذناً مكتوباً من صاحب الصوت وتسجيلاً له يقرأ فيه نص الموافقة. وهذا معيار جيد مع أي أداة.
  • لا تقلّد صوت شخصية عامة، ولا حتى على سبيل المزاح في إعلان.
  • اقرأ شروط الخطة. يذكر مركز مساعدة ElevenLabs أن الخطة المجانية بلا ترخيص تجاري وتشترط النسبة عند النشر، وأن الخطط المدفوعة تشمل الترخيص التجاري. والأدوات الأخرى تختلف، والشروط تتغير، فاحفظ نسخة منها مع المشروع.
  • الملكية سؤال مستقل. من يملك مخرجات الذكاء الاصطناعي، وهل تحميها حقوق النشر، أشرحه في مقال هل صور الذكاء الاصطناعي عليها حقوق؟، والحذر نفسه ينطبق على الصوت.
  • أفصح حيث تطلب المنصة. صفحة مساعدة YouTube تطلب الإفصاح عن المحتوى الواقعي المصنوع أو المعدّل بالذكاء الاصطناعي، كأن يبدو شخص حقيقي وكأنه قال ما لم يقله، وتذكر أن استنساخ صوتك أنت للتعليق أو الدبلجة لا يحتاج إفصاحاً. و TikTok يطلب وسم المحتوى المولّد الذي يحتوي صوراً أو صوتاً أو فيديو واقعياً.
  • أخبر العميل. اكتب له أي صوت استُخدم، ومن أين جاء، وأي خطة تغطيه، وأين يمكن عرضه.

مكان الصوت في أعمالي

سلاسل الفيديو التي أُخرجها في SkillUp MENA تمر بالسيناريو، ثم الصور، ثم الحركة، ثم الصوت، ثم المونتاج، والذكاء الاصطناعي أداة في يدي في كل خطوة، وكل قرار إبداعي يبقى قراري. والصوت واحدة من هذه الخطوات، لها نصها ومراجعتها.

وما ينتقل من الصورة والفيديو إلى الصوت هو الانضباط نفسه: اعرف ما تريد قبل أن تفتح الأداة، ووجّهها بوضوح، وراجع كل نتيجة، واحفظ ملفاتك في مجلداتك أنت. وأكتب أكثر عن توظيف هذه الأدوات في التصميم كله في مقال الذكاء الاصطناعي في التصميم الجرافيكي.

الخلاصة

التعليق الصوتي العربي بالذكاء الاصطناعي ينجح حين تصح القرارات التي تسبق الأداة: المستوى اللغوي، ونص مكتوب للأذن، وتشكيل الكلمات الملتبسة، وأسماء وأرقام مكتوبة كما تُنطق. بعدها أخرِج الصوت كما تُخرج ممثلاً، واعتنِ بالمكساج، واستعن بمعلّق بشري حين يحتاجه العمل، ولا تستخدم صوتاً لا تملك حقه.

وإن أردت فيلماً لعلامتك بصوت يشبه جمهورك، حدّثني عن مشروعك.

أسئلة شائعة

ازاي أعمل تعليق صوتي بالذكاء الاصطناعي بالعربي؟

اكتب النص بالمستوى اللغوي الذي يناسب جمهورك، وشكّل الكلمات التي تحتمل قراءتين، واكتب الأرقام والأسماء كما تُنطق. ثم اختر صوتاً من مكتبة أداة مثل ElevenLabs أو صمّم صوتاً جديداً بوصف مكتوب، وولّد النص على مقاطع قصيرة، واختر أفضل محاولة لكل جملة، ثم ركّبها مع الموسيقى في برنامج المونتاج.

هل ElevenLabs بيدعم اللهجة المصرية والخليجية؟

تذكر ElevenLabs العربية ضمن لغات نماذجها في أكتوبر 2026، وتذكر وثائق الدبلجة خياراً خاصاً بالعربية المصرية. أما اللهجة في تحويل النص إلى كلام فتتوقف على الصوت الذي تختاره أو تصممه، وعلى النص نفسه، فاكتب النص باللهجة واستمع قبل الاعتماد.

هل ينفع أستنسخ صوت حد تاني؟

لا دون إذنه الواضح، والأفضل أن يكون مكتوباً. سياسة ElevenLabs تمنع تقليد صوت شخص آخر دون موافقته أو حق قانوني، والاستنساخ الاحترافي فيها مسموح لصوتك أنت فقط. وإن أراد مؤدٍّ أن يشاركك صوته، فيمكنه إنشاء النسخة على حسابه ثم مشاركتها معك.

هل لازم أقول إن الصوت معمول بالذكاء الاصطناعي؟

يتوقف ذلك على المنصة والمحتوى. يطلب YouTube الإفصاح عن المحتوى الواقعي المصنوع أو المعدّل بالذكاء الاصطناعي، كأن يبدو شخص حقيقي وكأنه قال ما لم يقله، ولا يطلبه عند استنساخ صوتك أنت للتعليق أو الدبلجة. ويطلب TikTok وسم المحتوى المولّد الذي يحتوي صوراً أو صوتاً أو فيديو واقعياً. وفي كل الأحوال أخبر العميل.

هل الصوت المجاني من ElevenLabs ينفع لإعلان؟

لا. يذكر مركز مساعدة ElevenLabs أن الخطة المجانية لا تشمل ترخيصاً تجارياً، وتشترط نسبة المحتوى إلى ElevenLabs عند النشر، بينما تشمل الخطط المدفوعة الترخيص التجاري. راجع الشروط الحالية قبل أي عمل لعميل.

بقلم

محمد متولي

مصمم منذ 2010: هوية بصرية، وخط عربي، وتغليف، وواجهات مستخدم، وموشن، وأبني منتجات والذكاء الاصطناعي أداة في يدي.

المزيد عني →

لنبنِ شيئاً لا يُنسى.