VEO 3.1 Reference — فيديو مبني على صورك المرجعية

الخلاصة (BLUF): VEO 3.1 Reference To Video وضع لتوليد الفيديو بالذكاء الاصطناعي، حيث الصور هي الأساس والنص يأتي تابعًا لها. ارفع من صورة واحدة إلى ثلاث صور مرجعية — منتج، شخصية، أسلوب بصري — واكتب ما يجب أن يحدث معها. النموذج ينقل الكائن القابل للتعرف عليه إلى مشهد جديد بدلًا من اختراع كائن عشوائي بديل عنه.

ثلاث صور مرجعية لمنتج والفيديو الناتج به في مشهد جديد

ما هو وضع Reference To Video

التوليد الاعتيادي يبتكر محتوى الكادر من الصفر في كل مرة: اطلب «حذاء رياضي على قدم عدّاء» وستحصل على حذاء عشوائي لا علاقة له بحذائك. وضع الصور المرجعية يحل هذه المشكلة تمامًا. تُظهر للنموذج كائنًا محددًا عبر صورة واحدة إلى ثلاث صور، وهذا الكائن بعينه هو ما يظهر في الفيديو النهائي.

الصور المرجعية ليست الكادر الأول ولا الأخير في الفيديو، بل نماذج مرجعية: يدرس النموذج شكل منتجك أو شخصيتك، ثم يصوّر مشهدًا جديدًا حولها استنادًا إلى وصفك النصي. رفع صورة واحدة على الأقل إلزامي — فبدون صور مرجعية لا يعمل هذا الوضع إطلاقًا.

الفرق عن تحويل الصورة إلى فيديو

في الوضع التقليدي «صورة إلى فيديو» تصبح الصورة هي الكادر الافتتاحي، وينطلق الحدث كله منها: نفس التكوين، نفس زاوية التصوير. أما وضع الصور المرجعية فأكثر حرية — يُبنى المشهد من الصفر وفق نصك، والصور فقط تحدد شكل عناصره.

لذلك يخدم كل وضع غرضًا مختلفًا. إحياء صورة معينة بعينها هو مهمة VEO 3.1 التقليدي. أما عرض منتجك في ديكورات لم يُصوَّر فيها من قبل، أو تتبّع شخصية واحدة عبر سلسلة من المقاطع المختلفة، فهذا هو مجال عمل Reference To Video.

زجاجة من الصور المرجعية صُوِّرت بالذكاء الاصطناعي في ديكور نزهة صيفية

كيف تختار صورًا مرجعية ناجحة

القاعدة بسيطة: يجب أن يتمكن النموذج من رؤية الكائن بوضوح تام. استخدم صورًا واضحة يشغل فيها الكائن جزءًا ملحوظًا من الكادر، دون تشويش بصري زائد حوله. إذا كان الكائن معقد الشكل، تساعد زاويتان أو ثلاث زوايا مختلفة — بذلك يفهم النموذج حجمه لا واجهته الأمامية فقط.

لا داعي لوصف ما تُظهره الصور المرجعية أصلًا في نص الطلب — صف بدلًا من ذلك المشهد والحدث: أين يقع الكائن، وماذا يحدث حوله، وكيف تتحرك الكاميرا، وما طبيعة الإضاءة. تنسيق الكادر يُحدَّد من الإعدادات: أفقي 16:9، أو رأسي 9:16، أو Auto.

لماذا Fast فقط وماذا يعني ذلك

يعمل وضع الصور المرجعية حصريًا بسرعة Fast — لا يمكن اختيار Lite أو Quality هنا، فالنموذج سيعيد الإعداد تلقائيًا إلى Fast. عمليًا هذه ميزة لا عيب: التوليد يتم بسرعة، ويمكنك تجربة عدة مشاهد مختلفة بنفس مجموعة الصور المرجعية خلال وقت قصير.

تعتمد تكلفة الفيديو على معطيات التوليد، والدفع يتم من رصيد التوكن العام للموقع. إذا لم يُنشأ الفيديو — بسبب المرشحات أو خلل تقني — لا تُخصم التوكنات. تسري قواعد VEO العامة: بلا أطفال في الكادر، وبلا قسوة على الحيوانات، وبلا محتوى للبالغين.

أين يتألق هذا الوضع أكثر

السيناريو الأول: التجارة الإلكترونية — لديك صور لمنتجك، وتنتج بها مقاطع لصفحات المنتجات والإعلانات ومواقع التواصل دون استئجار استوديو. زجاجة صلصة في نزهة صيفية، حذاء رياضي في جولة جري بالمدينة، كريم على رف رخامي في الحمام — كلها من نفس الصور المرجعية.

السيناريو الثاني: المحتوى المتسلسل ببطل ثابت — تميمة العلامة التجارية، شخصية من رسوماتك، كائن رمزي مميز. بعد تجهيز الصور المرجعية مرة واحدة، تحصل على سلسلة كاملة من المقاطع تحافظ فيها الشخصية على هويتها من فيديو لآخر. النتائج الجاهزة تُحفظ في السجل، ويمكن تنزيلها أو تمديدها.

الأسئلة الشائعة

كم صورة مرجعية يمكنني رفعها؟

من صورة واحدة إلى ثلاث صور، وصورة واحدة على الأقل إلزامية — فبدون صور مرجعية لا يعمل الوضع. للكائنات معقدة الشكل، من الأفضل تقديم زاويتين أو ثلاث زوايا ليفهم النموذج الشكل بدقة أكبر.

لماذا لا يمكن اختيار جودة Quality؟

وضع Reference To Video يعمل فقط بسرعة Fast — وهذا قيد تقني في تصميمه. إذا اخترت خيارًا آخر، سيعيد النموذج الإعداد تلقائيًا إلى Fast. في المقابل تحصل على توليد سريع وتكرار محاولات بتكلفة أقل.

هل سيكون الكائن في الفيديو مطابقًا تمامًا للصور؟

يحافظ النموذج على قابلية التعرف على الكائن، لكن هذا توليد وليس نسخًا: قد تختلف بعض التفاصيل الدقيقة. الصور المرجعية الواضحة من عدة زوايا تحسّن الدقة، وأي محاولة غير موفقة يمكن ببساطة إعادة توليدها.

نماذج مشابهة