الخلاصة (BLUF): Gemini Omni نموذج ذكاء اصطناعي متعدد الوسائط لتوليد الفيديو: لا يكتفي بالنص بل يقبل أيضًا الصور والفيديو والصوت وحتى الشخصيات المحفوظة كمدخلات. صف المشهد بكلماتك، وادعمه بصور، واختر صوتًا للحوار، وصوّر سلسلة كاملة من المقاطع ببطل واحد ثابت — كل هذا داخل نموذج واحد.

معظم نماذج الفيديو تقبل نصًا أو صورة واحدة فقط. أما Gemini Omni فيتعامل مع مدخلات مختلطة: وصف نصي بالإضافة إلى ما يصل إلى سبع صور أو مقاطع فيديو أو ملفات صوتية كسياق إضافي. هل تريد مقطعًا مستوحى من لقطة معينة، يحمل أجواء مقطوعة موسيقية بعينها؟ أحضر كل شيء دفعة واحدة، وسيأخذ النموذج كل مصدر بعين الاعتبار.
هذا يغيّر طريقة صياغة الطلب من الأساس. فبدلًا من فقرة طويلة تصف «بيتًا على هذا الشكل، بإضاءة كذا…»، يكفي أن تعرض صورة للبيت وتستخدم الكلمات فقط لوصف الحركة. النص يقود القصة، والمرفقات تحدد الشكل — لكل نوع من المدخلات دوره الخاص.
مشكلة مولّدات الفيديو المعتادة أن ملامح البطل تتغير من مقطع لآخر. هنا تم حل هذه المشكلة عبر تبويب مخصص باسم «Character»: تنشئ الشخصية مرة واحدة، فتُحفظ في مكتبتك الخاصة، ثم تستخدمها في أي توليد لاحق. تبقى الملامح ثابتة من فيديو إلى آخر.
بهذه الطريقة تُبنى سلاسل كاملة من المحتوى: مقدّم برنامج افتراضي، شخصية مميزة لعلامة تجارية، بطل ثابت لقصص الأطفال. تختار الشخصيات المحفوظة من المكتبة بنقرة واحدة مباشرة في نموذج التوليد، دون الحاجة لإعادة رفع الصور المرجعية أو الأمل في أن «يتذكر» النموذج الوجه.

يمكن أن يخرج المقطع مصحوبًا بالصوت من البداية. تتوفر في الإعدادات مجموعة من الأصوات الجاهزة، رجالية ونسائية، بنبرات وشخصيات مختلفة — من الأصوات الناعمة الحادة إلى الأصوات المنخفضة الخشنة. اختر صوتًا، واكتب الحوار ضمن الوصف، ويتحدث الشخصية مباشرة في المشهد.
إذا لم تناسبك الخيارات الجاهزة، يتيح لك تبويب «Audio» إنشاء صوت مخصص انطلاقًا من نمط أساسي. يُضاف هذا الصوت أيضًا إلى مكتبتك الشخصية ويُستخدم في التوليدات تمامًا كالأصوات القياسية. وهذا يمنح العلامة التجارية صوتًا واحدًا مميزًا يُستخدم في كل الفيديوهات.
يُعد Gemini Omni من النماذج القليلة في الموقع التي تدعم إخراجًا بدقة 4K: تتوفر دقات 720p و1080p و4K. مدة المقطع 4 أو 6 أو 8 أو 10 ثوانٍ، ونسبة الأبعاد إما أفقية 16:9 أو عمودية 9:16 مناسبة لمنصات التواصل الاجتماعي. يتحدد السعر بحسب المدة والجودة.
طريقة عملية مجربة: نفّذ المسودات بدقة 720p حيث التوليد أرخص وأسرع، ثم أعد تشغيل النسخة الناجحة بدقة 1080p أو 4K. تبقى المقاطع النهائية محفوظة في سجل التوليدات، ومنه يمكنك تنزيلها أو تمديدها أو إعادة توليدها بعد تعديل الوصف.
لا تُفعّل كل الإمكانيات دفعة واحدة. اصنع أول مقطع من نص فقط لتتعرف على طريقة فهم النموذج للأوصاف. بعدها أضف صورة مرجعية، ثم صوتًا، وأخيرًا أنشئ شخصية ثابتة. كل خطوة تمنحك تحكمًا أكبر لكنها تتطلب دقة أكبر في الصياغة.
التزم بالترتيب الكلاسيكي في وصف المشهد: من في الإطار، ماذا يفعل، أين يحدث، وكيف تتحرك الكاميرا. إن وُجد حوار، اجعله في جملة منفصلة. هذا الترتيب يمنحك في العادة مقطعًا متماسكًا من أول أو ثاني محاولة.
بالمدخلات المختلطة والمكتبات الخاصة. النماذج العادية تقبل نصًا أو صورة واحدة فقط، بينما هنا يمكنك الجمع بين النص والصور والفيديو والصوت، إضافة إلى استخدام شخصيات محفوظة وأصوات مخصصة. هذا يجعله الخيار الأمثل للمحتوى المتسلسل ببطل واحد.
أنشئ الشخصية في تبويب «Character» لتُحفظ في مكتبتك. ثم اخترها بنقرة واحدة في كل توليد جديد. تبقى ملامح البطل متكررة من مقطع لآخر دون الحاجة لإعادة رفع الصور المرجعية.
نعم. اختر أحد الأصوات الجاهزة أو أنشئ صوتك الخاص في تبويب «Audio»، ثم اكتب حوار الشخصية ضمن وصف المشهد. سيولّد النموذج مقطعًا يتحدث فيه البطل بهذا النص بالصوت المختار.