Gemini Omni (المعروف أيضًا باسم Google Omni وVeo Omni): مقاطع فيديو تحتوي على شخصيات وصوت و4K
باختصار عن الشيء الرئيسي (BLUF)
Gemini Omni وGoogle Omni وVeo Omni هي ثلاثة أسماء لعارضة فيديو واحدة: فهي تحتفظ ببطل واحد في جميع مقاطع الفيديو، وتؤدي أصواتهم وتعطي ما يصل إلى 4K. دعونا نتعرف على ما هو وراء كلمة "Omni"، وكم تكلفة التوليد، ومن أين نبدأ.
يحتوي هذا النموذج على ثلاثة أسماء، ومن المحتمل أنك صادفت الثلاثة أسماء: Gemini Omni, Google Omni و Veo Omni. البعض يسميها بالعائلة Gemini، والبعض الآخر بخط الفيديو Veo، والبعض ببساطة "omni" - نحن نتحدث عن نفس الشبكة العصبية لتوليد الفيديو. إنها تعمل لدينا في قسم "الفيديو".، ويمكنك تشغيله بدون اشتراك، مع الدفع لجيل محدد.
ماذا وراء كلمة "أومني"
يقبل نموذج الفيديو العادي نصًا أو صورة واحدة. هنا يكون الإدخال مختلطًا: وصف نصي بالإضافة إلى ما يصل إلى سبع صور أو فيديو أو صوت كسياق إضافي. أنت بحاجة إلى مقطع فيديو بروح إطار معين ومع مزاج لحن معين - قم بإحضار كل شيء مرة واحدة، وسيأخذ النموذج في الاعتبار كل مصدر.
هذا يغير صياغة المشكلة ذاتها. بدلاً من الفقرة "تخيل منزلاً مثل هذا، والضوء مثل هذا"، فإنك تعرض صورة للمنزل، وتصف الحدث فقط بالكلمات. النص هو المسؤول عن الحبكة، والمرفقات هي المسؤولة عن المظهر.
الشخصيات: بطل واحد في كل الفيديوهات
المشكلة الرئيسية في المولدات التقليدية هي أن البطل يتغير من فيديو إلى آخر. يوجد في Gemini Omni علامة تبويب منفصلة للشخصيات لهذا الغرض: يتم إنشاء البطل مرة واحدة، ويتم حفظه في مكتبتك ثم توصيله بأي جيل بنقرة واحدة. يظل المظهر ثابتًا من فيديو إلى آخر.
هذه هي الطريقة التي يتم بها تجميع السلسلة: مقدم افتراضي لعمود، وتميمة للعلامة التجارية، وشخصية في قصص الأطفال. ليست هناك حاجة لإعادة تحميل المراجع في كل مرة ونأمل أن "يتذكر" النموذج الوجه.

الصوت: الإعدادات المسبقة الجاهزة والخاصة بك
يمكن أن يخرج الفيديو بالصوت على الفور. تحتوي الإعدادات على مجموعة من الأصوات الجاهزة -ذكر وأنثى- من الناعم العالي إلى المنخفض مع بحة. تختار صوتًا، وتكتب سطرًا في الوصف - وتتحدث الشخصية مباشرة في الإطار. إذا لم تكن الإعدادات المسبقة مناسبة، فسيتم إنشاء صوتك في علامة تبويب الصوت بناءً على الصوت الأساسي: وينتهي به الأمر أيضًا في مكتبتك الشخصية. هذه هي الطريقة التي تتمتع بها العلامة التجارية بصوت واحد يمكن التعرف عليه وراء جميع مقاطع الفيديو الخاصة بها.
ما يصل إلى 4K، المدة وتنسيق الإطار
هذا هو أحد النماذج القليلة الموجودة على الموقع مع إخراج 4K: تتوفر 720p و1080p و4K. المدة - 4 أو 6 أو 8 أو 10 ثوانٍ، إطار أفقي 16:9 أو عمودي 9:16 للشبكات الاجتماعية. الطريق العملي بسيط: قم بتشغيل المسودات بدقة 720 بكسل، والخيار الجيد هو إعادة التشغيل بدقة 1080 بكسل أو 4K.
كم يكلف
يعتمد السعر على المدة والجودة وما إذا كنت ترسل مقطع فيديو كمدخل، ويتم عرضه دائمًا في النموذج قبل الإطلاق - ترى المبلغ قبل النقر فوق الزر. لا يوجد اشتراك: أنت تدفع مقابل مقطع فيديو معين من الرصيد العام، ويمكنك تعبئته ببطاقة روسية. تكلف مسودة مدتها أربع ثوانٍ بدقة 720 بكسل أقل بكثير من 4K مدتها عشر ثوانٍ، لذا فإن اختبار الفكرة أرخص من تصوير النهاية على الفور.
من أين تبدأ
- يفتح صفحة النموذج وقم بإنشاء أول فيديو من نص واحد - وبهذه الطريقة ستشعر كيف تقرأ الأوصاف.
- أضف صورة مرجعية: دع الكلمات تمثل الحدث، والصورة تمثل مظهر المشهد.
- قم بتضمين صوت وخط إذا كان هناك شخص يتحدث في الإطار.
- احصل على شخصية دائمة عندما تحتاج إلى سلسلة من مقاطع الفيديو مع بطل واحد.
عند وصف مشهد ما، حافظ على النظام: من الموجود في الإطار، وماذا يفعلون، وأين يحدث، وكيف تتصرف الكاميرا. أرسل إجابتك في جملة منفصلة. تنتج هذه البنية دائمًا مقطع فيديو متماسكًا في المحاولة الأولى أو الثانية.
أنت تبحث عن موديل بالاسم Google Omni أو Veo Omni - هذا هو نفسه: Gemini Omni متاح هنا. في مكان قريب، في قسم "الفيديو".، هناك نماذج فيديو أخرى إذا كنت تريد المقارنة.


الأسئلة المتداولة (الأسئلة الشائعة)
سؤال: كيف تحصل على أفضل نتيجة من الشبكة العصبية؟
الإجابة: استخدم المطالبات التفصيلية (الأوصاف) باللغة الإنجليزية، واضبط نمط المشهد وتفاصيله.
سؤال: هل يمكن استخدام هذه المواد لأغراض تجارية؟
الإجابة: نعم، المحتوى الذي تم إنشاؤه ملك لك بالكامل.