SceneMixer
العربية
سجّل مجاناً

شخصيات متحدثة

فيديو ذكاء اصطناعي بشخصيات متحدثة

تم التحديث في 20 سبتمبر 2026

إجابة سريعة: يتم إنشاء الكلام مع الصورة في مرحلة واحدة، ولا تتم مزامنة الشفاه على فيديو صامت. كل لقطة تحمل السطر حرفيًا، مع ربط المتحدث المحدد بصوت ثابت من المكتبة، وتوجيه قصير لأسلوب الإلقاء، وملاحظة صريحة بأن جميع الأشخاص الآخرين في الإطار يبقون شفاههم مغلقة. لقطات الحوار لها حد أدنى للتوقيت — ثلاث كلمات في الثانية في الإنجليزية — لذا لا يتم ضغط السطر أبدًا في لقطة أقصر من اللازم له.
لقطة من “قيادة ستارفول”، مسلسل قصير بالذكاء الاصطناعي أُنتج بالكامل بواسطة SceneMixer (7 شخصية، 1 حلقة)
عينة: “قيادة ستارفول” — واقعي عالي الدقة، 1 حلقة، أُنتج بالكامل بواسطة SceneMixer من السيناريو · مشاهدة الحلقات

يخرج الصوت من نفس عملية إنشاء الصورة

هناك طريقتان لجعل الشخصية تتحدث على الشاشة. إحداهما هي عرض فيديو صامت ثم تحريك الفم باستخدام مسار صوتي — طريقة مزامنة الشفاه، التي تتطلب قصًا للوجه وملف صوتي محرك، وتنتج وجهًا يتحرك بشكل صحيح وجسدًا لا يؤدي الدور. والأخرى هي إنشاء الصورة والصوت معًا، بحيث يكون الأداء والفم قرارًا واحدًا.

هذا المسار يستخدم الطريقة الثانية. فئة الفيديو الافتراضية سمعية بصرية: يتم إعطاء النموذج السطر، ومن يقوله، وكيف يقال، ومرجع صوتي، فيعيد لقطة يتحدث فيها السطر. لا يتم خياطة أي شيء بعد ذلك.

نظرة سريعة

ما يتم إرساله مع لقطة متحدثة
السطرحرفيًا، مرة واحدة. يُنطق تمامًا كما هو مكتوب — لا إعادة صياغة، ولا إعادة توقيت.
من يقولهمحدد بالاسم، ومرتبط بمرجع صوت تلك الشخصية بحيث يبدو نفس الشخص بنفس الصوت عبر الحلقات.
كيف يقالتوجيه قصير بين قوسين — بهمس، مع استمرار الابتسام، بإلقاء مسطح مجبر. إنه توجيه، وليس ترجمة نصية.
من غيره في الإطاريتم تحديدهم بشفاه مغلقة، حتى لا يحرك المستمعون أفواههم مع الكلام.
الكلام خارج الشاشةيُحدد أولاً في القوس — تعليق صوتي، على الهاتف، عبر جهاز الاتصال الداخلي — ثم يُوصف كل من يظهر بفم مغلق.
التوقيتلا تكون اللقطة التي تحمل حوارًا أقصر مما يحتاجه السطر: ثلاث كلمات في الثانية في الإنجليزية، وخمسة أحرف في الثانية في الصينية.

الأصوات تتم مطابقتها، ولا تُصمم لكل شخصية على حدة

يُخصص لكل شخصية صوت من مكتبة أصوات نظام مُنشأة مسبقًا — تستمع إلى عينة من ثلاث إلى ثماني ثوانٍ قبل الاختيار، ويمكنك إعادة المطابقة، أو اختيار صوت مختلف من المحدد، أو رفع تسجيلك الخاص. سبب كونها مطابقة بدلاً من تصميم صوت لكل شخصية هو التكلفة والاستقرار: الأصوات المصممة تنحرف بين عمليات الإنشاء وتكلف لكل شخصية، بينما صوت المكتبة هو نفس الصوت في الحلقة الأولى والحلقة الثانية عشرة.

إذا لم يكن للشخصية صوت مخصص، ترتد اللقطة إلى وصف مكتوب للصوت — العمر، الملمس، الطبقة الصوتية — يفسره النموذج. هذا هو الإعداد الافتراضي للمشاريع الجديدة؛ تخصيص الأصوات هو خطوة مقصودة، وليس شيئًا يحدث بصمت لكل شخصية.

قاعدة التوقيت، ولماذا توجد

لا يمكن للقطة مدتها أربع ثوانٍ أن تحمل ستة عشر كلمة إنجليزية. إما أن يُسرع الإلقاء حتى يصبح غير مفهوم أو يُقطع السطر. لذا فإن لقطات الحوار لها حد أدنى مشتق من السطر: عدد الكلمات مقسومًا على ثلاثة للإنجليزية، وعدد الأحرف مقسومًا على خمسة للصينية، والأسطر القصيرة تُضاف إليها وقفة بدلاً من ضغطها إلى الحد الأدنى النظري. اللقطات التي تعود أقصر من اللازم لسطرها يتم الإبلاغ عنها وتصحيحها قبل عرض أي شيء — وهو أرخص من اكتشاف ذلك في المخرجات.

اللغة

لغة الحوار هي إعداد مشروع، تُختار مرة واحدة، وتُطبق حيث تُكتب الأسطر لأول مرة بدلاً من ترجمتها لاحقًا — لذا يُؤلف الأداء بتلك اللغة بدلاً من أن يكون دبلجة. تتوفر خمس عشرة لغة للواجهة والحوار مدعوم عبرها؛ لغتان أحيانًا تخطئان في نطق كلمات فردية على فئة النموذج الافتراضية، ويذكر المحدد ذلك حيث يكون صحيحًا. تغطي صفحة أصوات الشخصيات هذا بالتفصيل.

ما لن يفعله

ما تكلفته

الكلام مشمول في سعر الفيديو — لا يوجد رسوم صوت منفصلة. يبدأ الفيديو من 10 credits لكل ثانية من المخرجات (≈ $0.06/ثانية على أقل سعر للرصيد) ويصل إلى $0.47/ثانية على الفئة الأعلى دقة؛ التجميع يكلف 1 credit لكل ثانية. مطابقة الصوت من المكتبة مجانية. تحصل الحسابات الجديدة على 50 credits ومعاينة مجانية واحدة تصل إلى 5 ثوانٍ — تكفي لسماع شخصية تتحدث قبل اتخاذ القرار. الأسعار في صفحة التسعير.

اللغات

حوار أصلي بـ 15 لغة

كل مسلسل أدناه أُنتج بنفس سير العمل، ويتحدث طاقم الممثلين تلك اللغة بطلاقة أصلية: الواجهة، ومستندات العمل، والسطور المنطوقة كلها بلغة واحدة، ولا يوجد أي دبلجة. افتح أحدها للاستماع.

عرض جميع اللغات البالغ عددها 15

أسئلة متكررة

هل هذه مزامنة شفاه؟

لا. يتم إنشاء الصورة والكلام معًا في مرحلة واحدة، لذا يكون الفم والأداء نفس القرار. لا يوجد مسار صوتي منفصل تتم مطابقته مع عرض صامت، ولا توجد طريقة لتحريك صورة أو فيديو مرفوع.

هل يمكنني استخدام صوتي؟

يمكنك رفع تسجيل كمرجع صوتي لشخصية. استنساخ صوت شخص آخر غير متوفر.

هل يحرك المستمعون في اللقطة أفواههم؟

لا ينبغي لهم ذلك — كل شخصية غير متحدثة في الإطار يتم تحديدها صراحة بشفاه مغلقة، وهو التعليم الذي يمنع المستمع من تحريك فمه مع السطر.

ماذا يحدث مع التعليق الصوتي والمكالمات الهاتفية؟

يُكتب علامة خارج الشاشة أولاً في ملاحظة الإلقاء، ثم يُوصف كل من يظهر في اللقطة بفم مغلق — لذا يُسمع السطر دون أن يبدو أن أحدًا يقوله.

لماذا لقطة الحوار أطول مما كتبت؟

لأن السطر يحتاج إلى الوقت. اللقطات التي تحمل حوارًا لها حد أدنى يقارب ثلاث كلمات في الثانية في الإنجليزية، وخمسة أحرف في الثانية في الصينية، مع إضافة وقفة للأسطر القصيرة جدًا. اللقطة الأقصر من اللازم لسطرها تُصحح قبل العرض وليس بعده.

استمع إلى الشخصية قبل أن تلتزم بالحلقة

المعاينة المجانية طويلة بما يكفي لسطر واحد من الحوار.

جرّب SceneMixer مجانًا

باقات الكريديت تبدأ من $1.49 · Pro $7.99/شهر · لا حاجة لبطاقة ائتمان للبدء

الأسعار·الأدلة·العينات·الدعم·الخصوصية·الشروط·معلومات قانونية·تواصل معنا·© 2026 SceneMixer