الانتقال إلى المحتوى الرئيسي
نموذج فيديو بالذكاء الاصطناعي
ByteDance
OmniHuman

OmniHuman 1.5

يستخدم المسار الأساسي الحالي في OmniHuman 1.5 صورة واحدة لشخص أو حيوان أليف أو شخصية أنمي مع ملف صوتي لتوليد فيديو متحرك. تُتحقق مدة الصوت عبر توقيع الرفع، وهي تحدد الحجز المسبق قبل الإنشاء مباشرة.

حالة الإتاحة
الإمكانات الأساسية متاحة ضمن نطاق محدود
الإدخال
1 صورة+1 ملف صوتي
الإخراج
720P/1080P
التسعير
27/ثانية صوت
عقد إدخال واضح لصورة واحدة وملف صوتي واحد
720P/1080P مع وضع سريع
يدخل توقيع مدة الصوت مباشرة في الحجز المسبق
مسار القناع غير متاح حاليًا وتُرفض حقوله صراحة
تعرّف عليه في 30 ثانية
OmniHuman
27 نقطة لكل ثانية صوت
ما الذي يتقنه؟
سير عمل أساسي لفيديو يحركه الصوت انطلاقًا من صورة عنصر واحد.
لمن يناسب؟
مناسب لمقدمي الشروحات والشخصيات الافتراضية وحوار الشخصيات والحيوانات الأليفة أو شخصيات الأنمي.
عمليات البحث الشائعة
كيفية استخدام OmniHuman 1.5كم تبلغ تكلفة OmniHuman 1.5ما أطول مدة صوت في OmniHuman 1.5

خلاصة في جملة

كيف يبدو هذا النموذج؟

يمكن أن تكون الصورة بأي نسبة أبعاد، لكنها تظل خاضعة للتحقق من الصيغة الفعلية والأبعاد الموقعة. يجب أن يكون الصوت بصيغة مدعومة، وضمن 10 MB، وأقصر من 60 ثانية. تُطبّق على المطالبة الاختيارية الحدود الأشد البالغة 300 حرف، ولا يُستخدم وصف أوسع متعارض معها.

ما الذي يتقنه؟
سير عمل أساسي لفيديو يحركه الصوت انطلاقًا من صورة عنصر واحد.
لمن يناسب؟
مناسب لمقدمي الشروحات والشخصيات الافتراضية وحوار الشخصيات والحيوانات الأليفة أو شخصيات الأنمي.
لماذا تستخدمه في Kyeo AI؟
تتحقق المنصة من ارتباط الصورة والصوت قبل خصم النقاط، وتحجز وفق ثواني الصوت الموثوقة، وتوضح أن قدرة القناع غير المدمجة مغلقة.

المعلمات الأساسية

يساعدك على تقييم مدى ملاءمة النموذج لسيناريو عملك بسرعة.

صيغ الصور
JPEG/PNG/WebP
مدة الصوت
أقل من 60 ثانية
المطالبة
اختيارية، حتى 300 حرف
غير متاح حاليًا
مسار قناع العنصر

أسماء أخرى

قد يحمل النموذج نفسه أسماء مختلفة في المصادر المختلفة؛ جُمعت هنا بصورة موحدة لتسهيل البحث والمقارنة.

OmniHuman V1.5
صورة ناطقة في OmniHuman 1.5
فيديو تحركه الأصوات في OmniHuman 1.5

أسئلة المستخدمين الشائعة

تركز هذه الأسئلة العملية على المهمة وشروط الإدخال والنتيجة التي ينبغي تأكيدها قبل الاختيار.

كيفية استخدام OmniHuman 1.5
كم تبلغ تكلفة OmniHuman 1.5
ما أطول مدة صوت في OmniHuman 1.5
ما الصور التي يدعمها OmniHuman 1.5
ما الوضع السريع في OmniHuman 1.5

دليل الاختيار

هل ما زلت مترددًا في اختيار النموذج؟ ابدأ بهذه النقاط الأساسية.

1
اختر OmniHuman عندما يكون المصدر صورة

استخدم هذا النموذج عندما تكون المادة المصدر صورة ثابتة لشخص أو شخصية وتحتاج إلى تحريكها بالصوت.

2
قارن مزامنة الشفاه عند توفر فيديو حقيقي

إذا أردت الحفاظ على حركة الفيديو وكاميرته الأصليتين، فقارن Video Lip Sync.

3
اختبر التأثير بصوت قصير

ابدأ بصوت قصير موصى به لاختبار تعرف النموذج إلى العنصر وحركة الشفاه، ثم وسع المحتوى.

المقارنات الشائعة في البحث

قارن البدائل الشائعة في المهمة نفسها لتوضيح الفروق في المدخلات والتحكم والتكلفة.

ما الفرق بين الإدخال والتسعير في OmniHuman 1.5 وKling AI Avatar؟
متى أستخدم OmniHuman 1.5 أو نموذج مزامنة شفاه الفيديو؟

جدول مقارنة النماذج

هل تتردد بين الخيارات؟ يوضح هذا الجدول أهم الفروق بين النموذج الحالي وبدائله بنظرة واحدة.

الإدخال الأساسي
OmniHuman 1.5
1 صورة+1 ملف صوتي
Kling AI Avatar Standard
1 صورة+1 ملف صوتي
Video Lip Sync
1 فيديو+1 ملف صوتي

تجربة الاستخدام الفعلية

إرشادات عملية تستند إلى مصادر عامة وحدود الموقع الحالية ومهام تمثل الاحتياجات الشائعة.

الإتاحة المحدودة لا تعني اكتمال حزمة المساعدة

التوليد الأساسي قابل للاستخدام، لكن اختيار عنصر من عدة عناصر بالاعتماد على اكتشاف القناع لم يدخل عقد تشغيل المنصة بعد.

الحجز وفق ثواني الصوت قابل للتحقق

تكون المدة الموثوقة معروفة قبل إنشاء المهمة، لذلك لا حاجة إلى تخمينها أو استخدام سعر ثابت.

تفاصيل القدرات

تحريك الصورة بالصوت

استخدم صورة واحدة وصوتًا واحدًا لتوليد فيديو ينطق فيه العنصر.

إخراج بدقتين

اختر 720P أو 1080P.

الوضع السريع

يتيح اتجاهًا أسرع للمعالجة مقابل قدر من التنازل عن الجودة.

الاستخدامات المناسبة

مقدم افتراضي

أنشئ فيديو شرح باستخدام صورة أمامية لشخصية وتعليق صوتي واضح.

حوار شخصية أنمي

استخدم صورة شخصية أنمي وصوت حوار لتوليد حديثها.

فيديو لحيوان أليف بطابع بشري

استخدم صورة حيوان أليف مع صوت قصير لتجربة تعبير بشري.

نصائح الموجّه

اجعل العنصر واضحًا

اختر صورة يظهر فيها العنصر بوضوح مع حجب قليل ووجه أو رأس يمكن تمييزه.

استخدم صوتًا بشريًا نقيًا

قلل الموسيقى الخلفية والضجيج ليسهل تطابق حركة الشفاه والإيقاع.

اجعل المطالبة موجزة

ضمن 300 حرف، وركز على التعبير ومدى الحركة وأسلوب الكاميرا.

أسباب اختياره

إدخال الصورة والصوت بسيط وواضح.
يمكن احتساب التكلفة بدقة قبل الإنشاء وفق مدة الصوت.
يدعم أنواعًا متعددة من العناصر وأي نسبة أبعاد للصورة.
للقدرة غير المتاحة على استخدام القناع حد واضح.

ما يجب معرفته قبل الاستخدام

لا يتيح حاليًا قناعًا أو مسارًا لتحديد عنصر من عدة عناصر.
لا يمكن إرسال أكثر من صورة واحدة وملف صوتي واحد.
يجب أن تقل مدة الصوت عن 60 ثانية.
تطبق على المطالبة حدود صارمة قدرها 300 حرف.

المعلمات القابلة للضبط

يساعدك على تقييم مدى ملاءمة النموذج لسيناريو عملك بسرعة.

دقة الإخراج
output_resolution
اختياري
نوع المعلمة: قائمة اختيار
الافتراضي: 1080P
720P
1080P
الوضع السريع
pe_fast_mode
اختياري
نوع المعلمة: مفتاح تبديل
الافتراضي: إيقاف
إيقاف
تشغيل
البذرة العشوائية
seed
اختياري
نوع المعلمة: عدد صحيح
الافتراضي: -1 (عشوائي)

استهلاك النقاط

27 نقطة لكل ثانية صوت

يُحسب الحجز المسبق وفق مدة الصوت المتحقق منها بسعر 27 credits لكل ثانية ويُقرّب إلى الأعلى. يجب أن تقل مدة الصوت عن 60 ثانية، لذلك يقل الحجز المسبق للطلب الصالح عن 1,620 نقطة. تتم التسوية وفق الاستهلاك الفعلي بعد اكتمال المهمة.

نصيحة لتوفير النقاط

قبل توليد الصور أو الفيديو على دفعات، يُنصح بإجراء اختبار A/B بالمواد نفسها بين النموذج الحالي وبدائله من النوع نفسه، ثم بدء التوليد على دفعات بعد تأكيد النتيجة لتجنب هدر النقاط.

الأسئلة الشائعة

نماذج مشابهة موصى بها

لم تقرر بعد؟ قارن أيضًا بهذه البدائل المشابهة.

Kling AI Avatar Standard

القدرة: تتطلب الواجهة صورة واحدة بصيغة JPEG أو PNG وملفًا صوتيًا واحدًا بصيغة MPEG أو WAV أو X-WAV أو AAC أو MP4 أو OGG. حد الصورة 10 MB، وحد الصوت 100 MB و5 دقائق. يُحسب الخصم من مدة الصوت الموقعة بسعر 8 نقاط لكل ثانية مع التقريب إلى الأعلى. لا يمكن الإرسال إذا كانت المدة مفقودة أو غير صالحة أو تتجاوز 5 دقائق.

نموذج فيديو بالذكاء الاصطناعي
8 نقاط / ثانية صوت

Infinitalk

يستخدم Infinitalk في Kyeo صورة واحدة وملفًا صوتيًا واحدًا لا يتجاوز 15 ثانية ومطالبة إلزامية لإنشاء فيديو مذيع. يمكن اختيار 480p أو 720p، وإدخال `seed`، وتُحسب التكلفة وفق ثواني الصوت والدقة، لا كسعر ثابت لكل مرة.

نموذج فيديو بالذكاء الاصطناعي
3 نقاط / ثانية بدقة 480p؛ 12 نقطة / ثانية بدقة 720p

Volcengine Video Lip Sync

يعيد Video Lip Sync تشكيل حركة الشفاه في فيديو موجود باستخدام ملف صوتي بشري مستهدف. يناسب الوضع الخفيف فيديو أماميًا لشخص واحد، بينما يناسب الوضع الأساسي مشاهد الشخص الواحد الأكثر تعقيدًا ويمكنه تفعيل اكتشاف المشهد.

نموذج فيديو بالذكاء الاصطناعي
8 نقاط لكل ثانية صوت

مصادر المعلومات

أُعد محتوى الصفحة استنادًا إلى معلومات النموذج ووصف الوظائف والإعدادات المتاحة حاليًا في Kyeo AI.

ملاحظة المصدر

تعرّف إلى المسار المتاح حاليًا في OmniHuman 1.5 لفيديو تحركه صورة واحدة وملف صوتي واحد، وإخراج 720P/1080P، وصوت أقل من 60 ثانية، والتسعير بالثانية، وحدود الإتاحة. يُحسب الحجز المسبق وفق مدة الصوت المتحقق منها بسعر 27 credits لكل ثانية ويُقرّب إلى الأعلى. يجب أن تقل مدة الصوت عن 60 ثانية، لذلك يقل الحجز المسبق للطلب الصالح عن 1,620 نقطة. تتم التسوية وفق الاستهلاك الفعلي بعد اكتمال المهمة.

آخر تحديث: 2026-08-28
بيانات الواجهة الحالية لـOmniHuman V1.5
المنصة

تُستخدم للتحقق من أوضاع الإدخال وعناصر التحكم الظاهرة وحدود الوسائط وإتاحة النسخة المتصلة بالموقع حاليًا. الخيارات الفعلية هي المعروضة في الصفحة ومساحة العمل.