Gemini Omni: توليد فيديو متعدد الوسائط بشخصيات وصوت

الخلاصة (BLUF): Gemini Omni نموذج ذكاء اصطناعي متعدد الوسائط لتوليد الفيديو: لا يكتفي بالنص بل يقبل أيضًا الصور والفيديو والصوت وحتى الشخصيات المحفوظة كمدخلات. صف المشهد بكلماتك، وادعمه بصور، واختر صوتًا للحوار، وصوّر سلسلة كاملة من المقاطع ببطل واحد ثابت — كل هذا داخل نموذج واحد.

مقدّم افتراضي يتحدث أمام الكاميرا بصوت مولَّد بالذكاء الاصطناعي
مثال على عمل نموذج Gemini Omni 1 في NeuralSpace

ماذا يعني «Omni» عمليًا

معظم نماذج الفيديو تقبل نصًا أو صورة واحدة فقط. أما Gemini Omni فيتعامل مع مدخلات مختلطة: وصف نصي بالإضافة إلى ما يصل إلى سبع صور أو مقاطع فيديو أو ملفات صوتية كسياق إضافي. هل تريد مقطعًا مستوحى من لقطة معينة، يحمل أجواء مقطوعة موسيقية بعينها؟ أحضر كل شيء دفعة واحدة، وسيأخذ النموذج كل مصدر بعين الاعتبار.

هذا يغيّر طريقة صياغة الطلب من الأساس. فبدلًا من فقرة طويلة تصف «بيتًا على هذا الشكل، بإضاءة كذا…»، يكفي أن تعرض صورة للبيت وتستخدم الكلمات فقط لوصف الحركة. النص يقود القصة، والمرفقات تحدد الشكل — لكل نوع من المدخلات دوره الخاص.

الشخصيات: بطل واحد في كل المقاطع

مشكلة مولّدات الفيديو المعتادة أن ملامح البطل تتغير من مقطع لآخر. هنا تم حل هذه المشكلة عبر تبويب مخصص باسم «Character»: تنشئ الشخصية مرة واحدة، فتُحفظ في مكتبتك الخاصة، ثم تستخدمها في أي توليد لاحق. تبقى الملامح ثابتة من فيديو إلى آخر.

بهذه الطريقة تُبنى سلاسل كاملة من المحتوى: مقدّم برنامج افتراضي، شخصية مميزة لعلامة تجارية، بطل ثابت لقصص الأطفال. تختار الشخصيات المحفوظة من المكتبة بنقرة واحدة مباشرة في نموذج التوليد، دون الحاجة لإعادة رفع الصور المرجعية أو الأمل في أن «يتذكر» النموذج الوجه.

نموذج توليد يجمع بين وصف نصي وصور مرجعية وشخصية مختارة من المكتبة
مثال على عمل نموذج Gemini Omni 1 في NeuralSpace

التعليق الصوتي: أصوات جاهزة أو صوتك الخاص

يمكن أن يخرج المقطع مصحوبًا بالصوت من البداية. تتوفر في الإعدادات مجموعة من الأصوات الجاهزة، رجالية ونسائية، بنبرات وشخصيات مختلفة — من الأصوات الناعمة الحادة إلى الأصوات المنخفضة الخشنة. اختر صوتًا، واكتب الحوار ضمن الوصف، ويتحدث الشخصية مباشرة في المشهد.

إذا لم تناسبك الخيارات الجاهزة، يتيح لك تبويب «Audio» إنشاء صوت مخصص انطلاقًا من نمط أساسي. يُضاف هذا الصوت أيضًا إلى مكتبتك الشخصية ويُستخدم في التوليدات تمامًا كالأصوات القياسية. وهذا يمنح العلامة التجارية صوتًا واحدًا مميزًا يُستخدم في كل الفيديوهات.

جودة تصل إلى 4K وصيغ متعددة للإطار

يُعد Gemini Omni من النماذج القليلة في الموقع التي تدعم إخراجًا بدقة 4K: تتوفر دقات 720p و1080p و4K. مدة المقطع 4 أو 6 أو 8 أو 10 ثوانٍ، ونسبة الأبعاد إما أفقية 16:9 أو عمودية 9:16 مناسبة لمنصات التواصل الاجتماعي. يتحدد السعر بحسب المدة والجودة.

طريقة عملية مجربة: نفّذ المسودات بدقة 720p حيث التوليد أرخص وأسرع، ثم أعد تشغيل النسخة الناجحة بدقة 1080p أو 4K. تبقى المقاطع النهائية محفوظة في سجل التوليدات، ومنه يمكنك تنزيلها أو تمديدها أو إعادة توليدها بعد تعديل الوصف.

من أين تبدأ أول توليد

لا تُفعّل كل الإمكانيات دفعة واحدة. اصنع أول مقطع من نص فقط لتتعرف على طريقة فهم النموذج للأوصاف. بعدها أضف صورة مرجعية، ثم صوتًا، وأخيرًا أنشئ شخصية ثابتة. كل خطوة تمنحك تحكمًا أكبر لكنها تتطلب دقة أكبر في الصياغة.

التزم بالترتيب الكلاسيكي في وصف المشهد: من في الإطار، ماذا يفعل، أين يحدث، وكيف تتحرك الكاميرا. إن وُجد حوار، اجعله في جملة منفصلة. هذا الترتيب يمنحك في العادة مقطعًا متماسكًا من أول أو ثاني محاولة.

الأسئلة الشائعة

بم يتميز Gemini Omni عن نماذج الفيديو العادية؟

بالمدخلات المختلطة والمكتبات الخاصة. النماذج العادية تقبل نصًا أو صورة واحدة فقط، بينما هنا يمكنك الجمع بين النص والصور والفيديو والصوت، إضافة إلى استخدام شخصيات محفوظة وأصوات مخصصة. هذا يجعله الخيار الأمثل للمحتوى المتسلسل ببطل واحد.

كيف أصنع عدة مقاطع بنفس الشخصية؟

أنشئ الشخصية في تبويب «Character» لتُحفظ في مكتبتك. ثم اخترها بنقرة واحدة في كل توليد جديد. تبقى ملامح البطل متكررة من مقطع لآخر دون الحاجة لإعادة رفع الصور المرجعية.

هل يمكن أن يتضمن الفيديو صوتًا وحوارًا؟

نعم. اختر أحد الأصوات الجاهزة أو أنشئ صوتك الخاص في تبويب «Audio»، ثم اكتب حوار الشخصية ضمن وصف المشهد. سيولّد النموذج مقطعًا يتحدث فيه البطل بهذا النص بالصوت المختار.

نماذج مشابهة