الخلاصة (BLUF): VEO 3.1 Reference To Video وضع لتوليد الفيديو بالذكاء الاصطناعي، حيث الصور هي الأساس والنص يأتي تابعًا لها. ارفع من صورة واحدة إلى ثلاث صور مرجعية — منتج، شخصية، أسلوب بصري — واكتب ما يجب أن يحدث معها. النموذج ينقل الكائن القابل للتعرف عليه إلى مشهد جديد بدلًا من اختراع كائن عشوائي بديل عنه.

التوليد الاعتيادي يبتكر محتوى الكادر من الصفر في كل مرة: اطلب «حذاء رياضي على قدم عدّاء» وستحصل على حذاء عشوائي لا علاقة له بحذائك. وضع الصور المرجعية يحل هذه المشكلة تمامًا. تُظهر للنموذج كائنًا محددًا عبر صورة واحدة إلى ثلاث صور، وهذا الكائن بعينه هو ما يظهر في الفيديو النهائي.
الصور المرجعية ليست الكادر الأول ولا الأخير في الفيديو، بل نماذج مرجعية: يدرس النموذج شكل منتجك أو شخصيتك، ثم يصوّر مشهدًا جديدًا حولها استنادًا إلى وصفك النصي. رفع صورة واحدة على الأقل إلزامي — فبدون صور مرجعية لا يعمل هذا الوضع إطلاقًا.
في الوضع التقليدي «صورة إلى فيديو» تصبح الصورة هي الكادر الافتتاحي، وينطلق الحدث كله منها: نفس التكوين، نفس زاوية التصوير. أما وضع الصور المرجعية فأكثر حرية — يُبنى المشهد من الصفر وفق نصك، والصور فقط تحدد شكل عناصره.
لذلك يخدم كل وضع غرضًا مختلفًا. إحياء صورة معينة بعينها هو مهمة VEO 3.1 التقليدي. أما عرض منتجك في ديكورات لم يُصوَّر فيها من قبل، أو تتبّع شخصية واحدة عبر سلسلة من المقاطع المختلفة، فهذا هو مجال عمل Reference To Video.

القاعدة بسيطة: يجب أن يتمكن النموذج من رؤية الكائن بوضوح تام. استخدم صورًا واضحة يشغل فيها الكائن جزءًا ملحوظًا من الكادر، دون تشويش بصري زائد حوله. إذا كان الكائن معقد الشكل، تساعد زاويتان أو ثلاث زوايا مختلفة — بذلك يفهم النموذج حجمه لا واجهته الأمامية فقط.
لا داعي لوصف ما تُظهره الصور المرجعية أصلًا في نص الطلب — صف بدلًا من ذلك المشهد والحدث: أين يقع الكائن، وماذا يحدث حوله، وكيف تتحرك الكاميرا، وما طبيعة الإضاءة. تنسيق الكادر يُحدَّد من الإعدادات: أفقي 16:9، أو رأسي 9:16، أو Auto.
يعمل وضع الصور المرجعية حصريًا بسرعة Fast — لا يمكن اختيار Lite أو Quality هنا، فالنموذج سيعيد الإعداد تلقائيًا إلى Fast. عمليًا هذه ميزة لا عيب: التوليد يتم بسرعة، ويمكنك تجربة عدة مشاهد مختلفة بنفس مجموعة الصور المرجعية خلال وقت قصير.
تعتمد تكلفة الفيديو على معطيات التوليد، والدفع يتم من رصيد التوكن العام للموقع. إذا لم يُنشأ الفيديو — بسبب المرشحات أو خلل تقني — لا تُخصم التوكنات. تسري قواعد VEO العامة: بلا أطفال في الكادر، وبلا قسوة على الحيوانات، وبلا محتوى للبالغين.
السيناريو الأول: التجارة الإلكترونية — لديك صور لمنتجك، وتنتج بها مقاطع لصفحات المنتجات والإعلانات ومواقع التواصل دون استئجار استوديو. زجاجة صلصة في نزهة صيفية، حذاء رياضي في جولة جري بالمدينة، كريم على رف رخامي في الحمام — كلها من نفس الصور المرجعية.
السيناريو الثاني: المحتوى المتسلسل ببطل ثابت — تميمة العلامة التجارية، شخصية من رسوماتك، كائن رمزي مميز. بعد تجهيز الصور المرجعية مرة واحدة، تحصل على سلسلة كاملة من المقاطع تحافظ فيها الشخصية على هويتها من فيديو لآخر. النتائج الجاهزة تُحفظ في السجل، ويمكن تنزيلها أو تمديدها.
من صورة واحدة إلى ثلاث صور، وصورة واحدة على الأقل إلزامية — فبدون صور مرجعية لا يعمل الوضع. للكائنات معقدة الشكل، من الأفضل تقديم زاويتين أو ثلاث زوايا ليفهم النموذج الشكل بدقة أكبر.
وضع Reference To Video يعمل فقط بسرعة Fast — وهذا قيد تقني في تصميمه. إذا اخترت خيارًا آخر، سيعيد النموذج الإعداد تلقائيًا إلى Fast. في المقابل تحصل على توليد سريع وتكرار محاولات بتكلفة أقل.
يحافظ النموذج على قابلية التعرف على الكائن، لكن هذا توليد وليس نسخًا: قد تختلف بعض التفاصيل الدقيقة. الصور المرجعية الواضحة من عدة زوايا تحسّن الدقة، وأي محاولة غير موفقة يمكن ببساطة إعادة توليدها.