← جميع المقالات

التمثيل الصوتي Gemini TTS: 30 صوتًا وجميع الإعدادات

استوديو تسجيل مشرق بجوار النافذة: ميكروفونان وسماعات رأس وموجات صوتية ملونة وبطاقات عائمة ناعمة مع خطوط حوار والكثير من الضوء

في القسم "صوتي" ظهرت أداة جديدة - التمثيل الصوتي للحوارات Gemini TTS. يقوم بتحويل النص النهائي إلى صوت: يمكنك تحديد المتحدثين وأصواتهم وشخصياتهم، وتقوم الخدمة بنطق السطور واحدًا تلو الآخر وإرجاع MP3 النهائي.

قسم الصوت: أداة التعليق الصوتي Gemini TTS مع تكوين مكبري صوت وخطوط حوار ومنزلق درجة الحرارة والسعر الموضح قبل البدء

أي نوع من الصك هو هذا

هذه ليست قراءة نص واحد بصوت واحد، بل كاملا حوار متعدد المتحدثين. تحصل كل شخصية على صوتها الخاص، ولهجتها، وأسلوب عرضها وإيقاعها - وتبدو الخطوط بالطريقة المقصودة: محادثة بين المقدمين، ومسرحية هزلية، ومقابلة، وسطور من شخصيات الفيديو.

يتوفر نموذجين:

  • Gemini 3.8 Flash TTS - التمثيل الصوتي المعبّر: مشاعر أكثر ثراءً، وإيقاعًا طبيعيًا أكثر، وتحكمًا أفضل في عملية التسليم. مناسب للبودكاست والكتب الصوتية والتعليقات الصوتية.
  • Gemini 3.8 Flash-Lite TTS - نفس الآليات أرخص وأسرع: بالنسبة للكميات الكبيرة والمسودات وقراءة النصوص بصوت عالٍ.

ما هي الإعدادات المتاحة؟

تعرض الواجهة جميع المعلمات التي يوفرها نموذج التمثيل الصوتي:

  • مكبرات الصوت. من واحد إلى عدة أحرف؛ ولكل منها توقيعها الخاص "Speaker 1" و"Speaker 2" وما إلى ذلك، والذي من خلاله ترتبط النسخ المتماثلة بالصوت.
  • 30 صوتا - من السرد الناعم إلى النشط و"الأخبار".
  • 8 لهجات - محايد، أمريكي (عام، "الوادي"، الجنوبي)، بريطاني (RP وبريكستون)، عبر المحيط الأطلسي، أسترالي.
  • 6 أنماط للتقديم - ابتسامة في الصوت، مذيع، همس، ​​تعاطف، ترويج ونبرة "جافة" متساوية.
  • 4 معدلات الكلام - "انجراف" طبيعي وطقطق وسلس ومتشنج.
  • شخصية صوتية - وصف مجاني، مثل "الراوي الدافئ" أو "حارس البوابة الصارم".
  • درجة حرارة - من 0 إلى 2: أقل - أكثر استقرارًا وقابلية للتنبؤ، أعلى - أكثر حيوية وأكثر تنوعًا.
  • المشهد والنبرة العامة - وصف للمكان ("غرفة هادئة مع مدفأة تصدر صوت طقطقة") وأسلوب السرد ("كتاب صوتي، ناعم وجذاب").
  • النسخ المتماثلة — كل سطر من الحوار يصل إلى 10000 حرف؛ يتم الحفاظ على ترتيب النسخ المتماثلة.

كيفية التعبير عن الحوار: خطوة بخطوة

  1. يفتح قسم "الصوت". واختر نموذجًا Gemini 3.8 Flash TTS أو Flash-LiteTTS - هم في أسفل قائمة النماذج.
  2. أضف مكبرات صوت وقم بتخصيص صوت كل شخص ولهجته وأسلوبه وإيقاعه.
  3. كتابة سطور الحوار وتحديد المتحدث لكل منها.
  4. إذا رغبت في ذلك، املأ وصف المشهد والنغمة العامة ودرجة الحرارة.
  5. انظر إلى السعر - فهو يكون مرئيًا قبل الإطلاق ويتم إعادة حسابه عند إدخال النص.
  6. انقر على "الصوت" وعندما تكون جاهزًا، استمع إلى النتيجة وقم بتنزيل MP3.

كم يكلف

يتم حساب السعر بناءً على الحجم الفعلي للنص: كلما طالت النسخ المتماثلة، زادت التكلفة، وكان ذلك مرئيًا قبل الإطلاق - لا توجد مفاجآت بعد الإنشاء. يتم الدفع باستخدام رموز الموقع، كما هو الحال بالنسبة للأجيال المدفوعة الأخرى؛ إذا لم تنجح، يتم إرجاع الرموز تلقائيا. يمكن الاطلاع على دليل الأسعار مباشرة في النموذج: يتم تحديث المبلغ أثناء كتابة البرنامج النصي.

الأسئلة المتداولة

هل يمكنني التعليق الصوتي على الحوار بين شخصيتين أو أكثر؟ نعم، كل متحدث له صوته وإعداداته الخاصة، وتتناوب السطور.

في أي شكل هي النتيجة؟ MP3 - يمكنكم الاستماع إليها على الصفحة وتحميلها بزر واحد.

ما هي اللغات التي يتحدث بها النموذج؟ النموذج متعدد اللغات: فهو يصدر نصوصًا بعشرات اللغات، بما في ذلك الروسية والإنجليزية.

ماذا تختار: فلاش أم Flash-Lite؟ للمشاريع التعبيرية - فلاش، للأحجام الكبيرة والمسودات - Flash-Lite: الآليات هي نفسها، ولكنها أرخص وأسرع.

هل يجب علي أن أدفع للمحاولة؟ يحدث الشطب عند بدء التمثيل الصوتي، وإذا كان هناك خطأ، يتم إرجاع الرموز المميزة تلقائيًا.