ข้ามไปยังเนื้อหาหลัก
โมเดลวิดีโอ AI
ByteDance
OmniHuman

OmniHuman 1.5

เส้นทางหลักของ OmniHuman 1.5 ใช้ภาพตัวแบบบุคคล สัตว์เลี้ยง หรือแอนิเมชันหนึ่งภาพร่วมกับเสียงหนึ่งคลิปเพื่อสร้างวิดีโอขับเคลื่อน ระยะเวลาเสียงตรวจด้วยลายเซ็นอัปโหลดและกำหนดการกันเครดิตก่อนสร้างโดยตรง

สถานะการเปิด
เปิดความสามารถหลักแบบจำกัด
อินพุต
1 ภาพ + 1 เสียง
เอาต์พุต
720P/1080P
การคิดราคา
27/วินาทีเสียง
สัญญาอินพุตชัดเจน: ภาพหนึ่งภาพกับเสียงหนึ่งคลิป
720P/1080P และโหมดเร็ว
ระยะเวลาเสียงที่ลงนามเข้าสู่การกันเครดิตโดยตรง
เวิร์กโฟลว์มาสก์ยังไม่เปิดและฟิลด์จะถูกปฏิเสธ
เข้าใจใน 30 วินาที
OmniHuman
27 เครดิตต่อวินาทีเสียง
ถนัดด้านใด
เวิร์กโฟลว์หลักสำหรับวิดีโอขับเคลื่อนด้วยเสียงจากภาพตัวแบบเดียว
เหมาะกับใคร
เหมาะกับผู้บรรยายเสมือน บทสนทนาตัวละครดิจิทัล คลิปพูดของสัตว์เลี้ยงหรือตัวละครแอนิเมชัน
คำค้นหายอดนิยม
วิธีใช้ OmniHuman 1.5OmniHuman 1.5 ราคาเท่าไรเสียง OmniHuman 1.5 ยาวได้กี่วินาที

สรุปในประโยคเดียว

โมเดลนี้เป็นอย่างไร?

ภาพใช้อัตราส่วนใดก็ได้ แต่ยังต้องผ่านการตรวจรูปแบบจริงและขนาดที่ลงนาม เสียงต้องอยู่ในรูปแบบที่รองรับ ไม่เกิน 10 MB และสั้นกว่า 60 วินาที พรอมต์เสริมใช้ขีดจำกัดที่เข้มงวดกว่า 300 อักขระ โดยไม่ใช้คำอธิบายที่กว้างกว่าและขัดแย้งกัน

ถนัดด้านใด
เวิร์กโฟลว์หลักสำหรับวิดีโอขับเคลื่อนด้วยเสียงจากภาพตัวแบบเดียว
เหมาะกับใคร
เหมาะกับผู้บรรยายเสมือน บทสนทนาตัวละครดิจิทัล คลิปพูดของสัตว์เลี้ยงหรือตัวละครแอนิเมชัน
ทำไมจึงใช้บน Kyeo AI
เว็บไซต์ตรวจการผูกภาพและเสียงก่อนหักเครดิต กันตามวินาทีเสียงที่เชื่อถือได้ และปิดความสามารถมาสก์ที่ยังไม่เชื่อมต่ออย่างชัดเจน

พารามิเตอร์สำคัญ

ช่วยให้ประเมินได้รวดเร็วว่าโมเดลนี้เหมาะกับกรณีใช้งานทางธุรกิจของคุณหรือไม่

รูปแบบภาพ
JPEG/PNG/WebP
ระยะเวลาเสียง
สั้นกว่า 60 วินาที
พรอมต์
ไม่บังคับ สูงสุด 300 อักขระ
ยังไม่เปิด
เวิร์กโฟลว์มาสก์ตัวแบบ

ชื่อเรียกอื่น

โมเดลเดียวกันอาจมีชื่อเรียกต่างกันในแหล่งข้อมูลแต่ละแห่ง ส่วนนี้รวบรวมไว้เพื่อให้ค้นหาและเปรียบเทียบได้ง่าย

OmniHuman V1.5
OmniHuman 1.5 ภาพพูดได้
วิดีโอ OmniHuman 1.5 ขับเคลื่อนด้วยเสียง

คำถามที่พบบ่อยของผู้ใช้

คำถามเชิงปฏิบัติเหล่านี้เน้นงาน เงื่อนไขอินพุต และผลลัพธ์ที่ควรยืนยันก่อนเลือก

วิธีใช้ OmniHuman 1.5
OmniHuman 1.5 ราคาเท่าไร
เสียง OmniHuman 1.5 ยาวได้กี่วินาที
OmniHuman 1.5 รองรับภาพแบบใด
โหมดเร็ว OmniHuman 1.5 คืออะไร

คู่มือเลือกโมเดล

ยังไม่แน่ใจว่าจะใช้โมเดลใด? ลองดูปัจจัยสำคัญเหล่านี้ก่อน

1
เลือก OmniHuman เมื่อมีเพียงภาพ

ใช้โมเดลนี้เมื่อสื่อต้นฉบับเป็นภาพนิ่งของบุคคลหรือตัวละครและต้องการให้เสียงขับเคลื่อน

2
หากมีวิดีโอบุคคลอยู่แล้วให้เปรียบเทียบลิปซิงก์

หากต้องการคงการเคลื่อนไหวและกล้องเดิมของวิดีโอ ให้เปรียบเทียบ Video Lip Sync

3
ทดลองด้วยเสียงสั้นก่อน

ใช้เสียงสั้นตามคำแนะนำเพื่อตรวจการรู้จำตัวแบบและลิปซิงก์ ก่อนขยายไปยังเนื้อหาที่ยาวขึ้น

คำเปรียบเทียบที่ค้นหาบ่อย

เปรียบเทียบตัวเลือกที่พบบ่อยในงานเดียวกัน เพื่อดูความต่างด้านอินพุต การควบคุม และค่าใช้จ่าย

อินพุตและการคิดราคาของ OmniHuman 1.5 ต่างจาก Kling AI Avatar อย่างไร
OmniHuman 1.5 กับโมเดลลิปซิงก์วิดีโอเหมาะกับสื่อแบบใด

ตารางเปรียบเทียบโมเดล

ยังเลือกไม่ได้? ตารางนี้สรุปความแตกต่างหลักระหว่างโมเดลนี้กับตัวเลือกอื่นให้ดูได้ทันที

อินพุตหลัก
OmniHuman 1.5
ภาพ 1 ภาพ + เสียง 1 คลิป
Kling AI Avatar Standard
ภาพนิ่ง 1 ภาพ + เสียงยาวได้ถึง 5 นาที
Video Lip Sync
วิดีโอ 1 คลิป + เสียง 1 คลิป

ประสบการณ์ใช้งานจริง

คำแนะนำเชิงปฏิบัติจากแหล่งข้อมูลสาธารณะ ขอบเขตปัจจุบันของเว็บไซต์ และงานตัวอย่างที่พบได้ทั่วไป

เปิดแบบจำกัดไม่เท่ากับชุดเครื่องมือช่วยเหลือครบถ้วน

การสร้างหลักเรียกใช้ได้ แต่การเลือกหลายตัวแบบที่พึ่งการตรวจมาสก์ยังไม่อยู่ในสัญญาการทำงานของเว็บไซต์

การกันเครดิตตามวินาทีเสียงตรวจสอบได้

ทราบระยะเวลาที่เชื่อถือได้ก่อนสร้างงาน จึงไม่ต้องเดาด้วยเวลาประมาณการหรือราคาคงที่

รายละเอียดความสามารถ

ขับเคลื่อนด้วยภาพและเสียง

ใช้ภาพหนึ่งภาพและเสียงหนึ่งคลิปสร้างวิดีโอที่ตัวแบบพูด

เอาต์พุตสองความละเอียด

เลือก 720P หรือ 1080P ได้

โหมดเร็ว

ยอมแลกคุณภาพบางส่วนเพื่อทิศทางการประมวลผลที่เร็วขึ้นได้

เหมาะกับงานใด

ผู้บรรยายเสมือน

ใช้ภาพตัวละครด้านหน้าและเสียงบรรยายชัดเจนสร้างคลิปอธิบาย

บทสนทนาตัวละครแอนิเมชัน

ใช้ภาพตัวละครแอนิเมชันกับเสียงบทพูดเพื่อให้ตัวละครพูด

คลิปสัตว์เลี้ยงพูดเหมือนคน

ใช้ภาพสัตว์เลี้ยงกับเสียงสั้นเพื่อทดลองการแสดงออกแบบมนุษย์

เคล็ดลับการเขียนพรอมต์

เลือกภาพตัวแบบที่ชัด

ใช้ภาพที่ตัวแบบเด่น มีสิ่งบดบังน้อย และมองเห็นใบหน้าหรือศีรษะได้

ใช้เสียงพูดสะอาด

ลดดนตรีพื้นหลังและเสียงรบกวน เพื่อช่วยให้ปากและจังหวะตรงกัน

เขียนพรอมต์ให้สั้น

สูงสุด 300 อักขระ โดยเน้นสีหน้า ขนาดการเคลื่อนไหว และสไตล์กล้อง

เหตุผลที่ควรเลือก

อินพุตภาพกับเสียงเรียบง่ายและชัดเจน
คิดราคาจากระยะเวลาเสียงได้แม่นยำก่อนสร้าง
รองรับตัวแบบหลายประเภทและอัตราส่วนภาพใดก็ได้
มีขอบเขตชัดเจนสำหรับความสามารถมาสก์ที่ยังไม่เปิด

สิ่งที่ควรรู้ก่อนใช้

ปัจจุบันไม่เปิดมาสก์หรือเวิร์กโฟลว์ระบุตัวแบบหลายคน
ส่งได้เพียงภาพหนึ่งภาพและเสียงหนึ่งคลิป
เสียงต้องสั้นกว่า 60 วินาที
พรอมต์ใช้ขีดจำกัดเข้มงวด 300 อักขระ

พารามิเตอร์ที่ปรับได้

ช่วยให้ประเมินได้รวดเร็วว่าโมเดลนี้เหมาะกับกรณีใช้งานทางธุรกิจของคุณหรือไม่

ความละเอียดเอาต์พุต
output_resolution
ไม่บังคับ
ประเภทพารามิเตอร์: รายการเลือก
ค่าเริ่มต้น: 1080P
720P
1080P
โหมดเร็ว
pe_fast_mode
ไม่บังคับ
ประเภทพารามิเตอร์: สวิตช์
ค่าเริ่มต้น: ปิด
ปิด
เปิด
ค่า seed แบบสุ่ม
seed
ไม่บังคับ
ประเภทพารามิเตอร์: จำนวนเต็ม
ค่าเริ่มต้น: -1 (สุ่ม)

เครดิตที่ใช้

27 เครดิตต่อวินาทีเสียง

คำนวณการกันเครดิตก่อนสร้างที่ 27 credits ต่อวินาทีจากระยะเวลาเสียงที่ตรวจสอบแล้วและปัดขึ้น เสียงต้องสั้นกว่า 60 วินาที ดังนั้นคำขอที่ถูกต้องจะกันไว้น้อยกว่า 1,620 เครดิต และชำระตามการใช้จริงเมื่องานเสร็จ

เคล็ดลับประหยัดเครดิต

ก่อนสร้างภาพหรือวิดีโอจำนวนมาก แนะนำให้ทดสอบ A/B ด้วยสื่อชุดเดียวกันระหว่างโมเดลนี้กับตัวเลือกประเภทเดียวกัน ยืนยันผลลัพธ์ก่อนแล้วค่อยสร้างเป็นชุดเพื่อไม่ให้เสียเครดิตโดยเปล่าประโยชน์

คำถามที่พบบ่อย

โมเดลประเภทเดียวกันที่แนะนำ

ยังไม่ได้เลือก? ลองเปรียบเทียบตัวเลือกประเภทเดียวกันเหล่านี้ด้วย

Kling AI Avatar Standard

ป้ายความสามารถ: อินเทอร์เฟซต้องใช้ภาพ JPEG หรือ PNG จำนวน 1 ภาพ และไฟล์เสียง MPEG, WAV, X-WAV, AAC, MP4 หรือ OGG จำนวน 1 ไฟล์ ภาพสูงสุด 10 MB ส่วนเสียงสูงสุด 100 MB และ 5 นาที คิดค่าบริการจากความยาวเสียงที่ลงนามแล้วในอัตรา 8 เครดิตต่อวินาทีและปัดขึ้น หากไม่มีความยาว ค่าไม่ถูกต้อง หรือเกิน 5 นาที จะส่งงานไม่ได้

โมเดลวิดีโอ AI
8 เครดิต / วินาทีเสียง

Infinitalk

Infinitalk บน Kyeo ใช้รูปภาพ 1 ไฟล์ เสียงยาวไม่เกิน 15 วินาที 1 ไฟล์ และพรอมต์ที่ต้องกรอกเพื่อสร้างวิดีโอพูด เลือก 480p หรือ 720p และระบุ `seed` ได้ ค่าใช้จ่ายคำนวณจากวินาทีเสียงกับความละเอียด ไม่ใช่ราคาคงที่ต่อครั้ง

โมเดลวิดีโอ AI
480p 3 เครดิต / วินาที; 720p 12 เครดิต / วินาที

Volcengine Video Lip Sync

Video Lip Sync ใช้วิดีโอที่มีอยู่หนึ่งคลิปและเสียงพูดเป้าหมายหนึ่งคลิปเพื่อสร้างการเคลื่อนไหวปากใหม่ โหมดเบาเหมาะกับวิดีโอคนเดียวหน้าตรง ส่วนโหมดพื้นฐานเหมาะกับฉากคนเดียวที่ซับซ้อนกว่าและเปิดตรวจฉากได้

โมเดลวิดีโอ AI
8 เครดิตต่อวินาทีเสียง

แหล่งข้อมูล

เนื้อหาในหน้านี้เรียบเรียงจากข้อมูลโมเดล คำอธิบายฟีเจอร์ และการตั้งค่าที่พร้อมใช้ปัจจุบันบน Kyeo AI

หมายเหตุแหล่งข้อมูล

ทำความรู้จักความสามารถ OmniHuman 1.5 ที่เปิดในปัจจุบัน ทั้งวิดีโอจากภาพหนึ่งภาพกับเสียงหนึ่งคลิป, 720P/1080P, เสียงสั้นกว่า 60 วินาที, ราคาต่อวินาที และขอบเขตแบบจำกัด คำนวณการกันเครดิตก่อนสร้างที่ 27 credits ต่อวินาทีจากระยะเวลาเสียงที่ตรวจสอบแล้วและปัดขึ้น เสียงต้องสั้นกว่า 60 วินาที ดังนั้นคำขอที่ถูกต้องจะกันไว้น้อยกว่า 1,620 เครดิต และชำระตามการใช้จริงเมื่องานเสร็จ

อัปเดตล่าสุด: 2026-08-28
ข้อมูลอินเทอร์เฟซปัจจุบันของ OmniHuman V1.5
แพลตฟอร์ม

ใช้ตรวจสอบโหมดอินพุต ตัวเลือกที่มองเห็น ขีดจำกัดสื่อ และสถานะของเวอร์ชันที่เชื่อมต่อกับเว็บไซต์ในปัจจุบัน โดยยึดตัวเลือกบนหน้าและพื้นที่ทำงานเป็นหลัก