Kling AI Avatar: أفاتار متحدث من صورة وتسجيل صوتي

الخلاصة (BLUF): Kling AI Avatar شبكة عصبية تحوّل صورة شخصية إلى شخص يتحدث. تحمّل صورة بورتريه وملف صوتي يحتوي على كلام، فتحصل على فيديو يظهر فيه صاحب الصورة وهو ينطق هذا الكلام: الشفتان تتحركان بتزامن تام مع الصوت، والوجه ينبض بالحياة، والرأس يتمايل بشكل طبيعي. لا حاجة إلى كاميرا ولا إضاءة ولا مذيع محترف، تكفي صورة واحدة وتسجيل صوتي واحد.

صورة بورتريه ثابتة تتحول إلى فيديو بحركة شفاه متزامنة بدقة مع تسجيل صوتي

من أي عناصر يتكوّن الأفاتار المتحدث

تحتاج إلى ملفين فقط. الأول صورة الوجه: بصيغة JPEG أو PNG أو WebP بحجم أقصى 10 ميغابايت. والثاني ملف صوتي يحتوي على كلام: بصيغة MP3 أو WAV أو AAC أو OGG أو M4A، بنفس الحد الأقصى 10 ميغابايت. القيد الصارم الوحيد أن مدة المقطع يجب أن تكون أقل من 15 ثانية. وإذا كان التسجيل أطول من ذلك، توجد أداة قص جاهزة داخل النموذج نفسه، تحدّد المقطع المطلوب دون الحاجة لتعديل الملف في برامج خارجية.

بعد ذلك يتولى النموذج كل شيء: يتعرّف على الوجه، ويصمم حركة النطق المطابقة لكل صوت، ويضيف حركات دقيقة مثل الرمش وميلان الرأس وتعبيرات الوجه الحية. تصل النتيجة إلى سجل التوليدات، ومنه يمكن تحميلها أو إعادة توليدها بصوت مختلف. ويمكن استخدام الصورة نفسها لعدد غير محدود من التسجيلات الصوتية المختلفة.

Standard أم Pro: أي وضع تختار

يتوفر للنموذج وضعان للجودة. Standard ينتج فيديو بدقة 720p، وهي كافية للقصص وتطبيقات المراسلة وأي صيغة عمودية تُشاهد من الهاتف. أما Pro فينتج بدقة 1080p: تفاصيل الوجه أوضح والصورة أنقى، وهذا الأفاتار مناسب لإدراجه في عرض تقديمي أو على شاشة كبيرة في معرض أو فعالية.

الأسلوب العملي: جرّب أولًا مزيج «الصورة مع الصوت» في وضع Standard وتحقّق من دقة الأداء الصوتي ومن خلوّه من أي تشوهات. إذا كانت النتيجة جيدة، أعد توليدها بوضع Pro للنسخة النهائية. تعتمد التكلفة على المدة والجودة المختارة، لذا فإن توليد المسودات بدقة عالية مجرد هدر لرصيدك.

لوحة قص الصوت المدمجة تُستخدم قبل توليد أفاتار متحدث

كيف يجب أن تكون الصورة والتسجيل الصوتي

أفضل مصدر هو صورة بورتريه من الأمام أو شبه الأمام، بوجه ظاهر بالكامل، دون نظارات شمسية أو أي أغراض تحجب الفم. الفم هو منطقة العمل الرئيسية للنموذج: فإذا كان مغطى بيد أو ميكروفون أو كوب، لن تتحقق مزامنة الشفاه بشكل صحيح. الإضاءة يجب أن تكون متساوية، ويشغل الوجه جزءًا واضحًا من الكادر، بينما تبقى الخلفية غير مهمة.

أما متطلبات الصوت فأخف قليلًا لكن المنطق نفسه: كلما كان الكلام أوضح، كانت حركة النطق أدق. تسجيل خالٍ من الموسيقى الخلفية وضجيج الشارع، وبمستوى صوت مناسب، يعطي نتيجة أفضل من رسالة صوتية مسجّلة أثناء التنقل. والحد الأقصى البالغ خمس عشرة ثانية يدفعك لصياغة عبارات مختصرة ومكثفة، وهذا في صالحك، فالجمل القصيرة في الفيديوهات أكثر تأثيرًا من الخطابات الطويلة.

سيناريوهات الاستخدام: من التهنئة الشخصية إلى عرض المنتج

أكثر السيناريوهات دفئًا هو التهنئات الشخصية. صورة صديق مع نص تهنئة مسجّل صوتيًا، فيحصل على فيديو يظهره وهو «يلقي» نخبًا في عيد ميلاده. أما في مجال الأعمال، فالمزيج الفعّال مختلف: وجه المؤسس أو شخصية استشارية افتراضية يقدّم المنتج باختصار في بطاقة العرض، أو يرحّب بزوار الموقع، أو يعلن عن عرض ترويجي في القصص.

كما يستخدمه المدرّبون ومؤلفو الدورات لتسجيل مقاطع شرح قصيرة دون الحاجة للتصوير أمام الكاميرا في كل مرة، فصورة واحدة جيدة تغني عن استوديو كامل. ويعتمد عليه متخصصو التسويق عبر منصات التواصل للحفاظ على «مقدّم رقمي» ثابت، وجه واحد مألوف يعلّق على أخبار العلامة التجارية في كل فيديو جديد.

لماذا قد تخرج نتيجة الأفاتار غير مقنعة

غالبًا ما يكون السبب في الصورة المصدر. الوجه بزاوية جانبية، أو الرأس المائل، أو البورتريه الصغير ضمن صورة كاملة الجسم، كلها حالات لا تمنح النموذج معلومات كافية عن الفم وتعابير الوجه، فتخرج حركة النطق غير دقيقة. الحل بسيط: قصّ الصورة لتكون أقرب إلى الوجه واختر لقطة بنظرة مباشرة.

السبب الثاني هو الصوت المزدحم. فإذا كانت هناك موسيقى تصاحب الكلام أو يتحدث شخصان معًا، لن يعرف النموذج مع أي صوت يزامن الشفاه. وتحقّق من المدة أيضًا: أي مقطع بطول 15 ثانية أو أكثر لن يجتاز التحقق، فاقصّه باستخدام الأداة المدمجة إلى نحو 14 ثانية مع هامش أمان، مبقيًا فقط على جوهر الجملة.

الأسئلة الشائعة

ما نوع الصوت الذي يمكن رفعه، وماذا أفعل إذا كان طويلاً؟

تُقبل صيغ MP3 وWAV وAAC وOGG وM4A بحجم أقصى 10 ميغابايت، على أن تكون المدة أقل من 15 ثانية بشكل صارم. لا حاجة لقص التسجيل الطويل في برامج خارجية: توجد أداة قص داخل نموذج التوليد تتيح لك تحديد المقطع المطلوب مباشرة قبل البدء.

ما الفرق بين وضعي Standard وPro؟

الفرق في دقة الفيديو الناتج: Standard يعطي 720p، بينما Pro يعطي 1080p بتفاصيل وجه أدق. آلية الحركة نفسها في الوضعين، لذا من العملي إجراء التجارب في Standard وتوليد النسخة النهائية للنشر في Pro.

هل يمكن استخدام صورة شخص آخر؟

فقط بموافقته. لا يجوز تحريك وجه شخص آخر ووضع كلام على لسانه دون إذنه، فذلك يمس حقه في صورته الشخصية. الخيارات الآمنة هي صورك الخاصة، أو صور أقارب وأصدقاء وافقوا على ذلك، أو شخصيات مولّدة بالكامل بالذكاء الاصطناعي.

نماذج مشابهة