Chuyển đến nội dung chính
Mô hình video AI
ByteDance
OmniHuman

OmniHuman 1.5

Quy trình cốt lõi của OmniHuman 1.5 dùng một ảnh chủ thể là người, thú cưng hoặc nhân vật hoạt hình cùng một audio để tạo video chuyển động. Thời lượng audio được xác minh bằng chữ ký tải lên và trực tiếp quyết định mức tạm giữ trước khi tạo.

Trạng thái mở
Mở có giới hạn năng lực cốt lõi
Đầu vào
1 ảnh+1 audio
Đầu ra
720P/1080P
Tính phí
27/giây audio
Hợp đồng đầu vào rõ ràng gồm một ảnh và một audio
720P/1080P cùng chế độ nhanh
Thời lượng audio có chữ ký trực tiếp tham gia mức tạm giữ
Luồng hỗ trợ mặt nạ chưa mở và trường này bị từ chối cứng
Tổng quan trong 30 giây
OmniHuman
27 điểm cho mỗi giây audio
Mô hình làm tốt điều gì
Quy trình video cốt lõi điều khiển bằng audio dành cho ảnh một chủ thể.
Phù hợp với ai
Phù hợp với người thuyết minh, lời thoại nhân vật ảo, video nói của thú cưng hoặc nhân vật hoạt hình.
Mọi người đang tìm kiếm
cách dùng OmniHuman 1.5OmniHuman 1.5 giá bao nhiêuaudio OmniHuman 1.5 dài tối đa bao lâu

Hiểu nhanh trong một câu

Mô hình này thế nào?

Ảnh có thể dùng tỷ lệ bất kỳ nhưng vẫn phải vượt qua kiểm tra định dạng thực và kích thước có chữ ký. Audio phải thuộc định dạng được hỗ trợ, không quá 10 MB và ngắn hơn 60 giây. Prompt tùy chọn dùng giới hạn nghiêm ngặt hơn là 300 ký tự, không áp dụng mô tả rộng hơn đang xung đột.

Mô hình làm tốt điều gì
Quy trình video cốt lõi điều khiển bằng audio dành cho ảnh một chủ thể.
Phù hợp với ai
Phù hợp với người thuyết minh, lời thoại nhân vật ảo, video nói của thú cưng hoặc nhân vật hoạt hình.
Vì sao nên dùng trên Kyeo AI
Nền tảng xác minh liên kết ảnh và audio trước khi trừ điểm, tạm giữ theo số giây audio đáng tin cậy và ghi rõ năng lực mặt nạ chưa được tích hợp.

Thông số chính

Giúp bạn nhanh chóng đánh giá mô hình có phù hợp với nhu cầu thực tế hay không.

Định dạng ảnh
JPEG/PNG/WebP
Thời lượng audio
Dưới 60 giây
Prompt
Tùy chọn, tối đa 300 ký tự
Chưa mở
Luồng mặt nạ chủ thể

Tên gọi khác

Cùng một mô hình có thể được gọi bằng nhiều tên trong các tài liệu khác nhau. Chúng tôi tổng hợp tại đây để bạn dễ tìm kiếm và so sánh.

OmniHuman V1.5
OmniHuman 1.5 làm ảnh biết nói
video OmniHuman 1.5 điều khiển bằng audio

Câu hỏi thường gặp của người dùng

Các câu hỏi thực tế này tập trung vào nhiệm vụ, điều kiện đầu vào và kết quả cần xác nhận trước khi chọn.

cách dùng OmniHuman 1.5
OmniHuman 1.5 giá bao nhiêu
audio OmniHuman 1.5 dài tối đa bao lâu
OmniHuman 1.5 hỗ trợ ảnh nào
chế độ nhanh OmniHuman 1.5 là gì

Hướng dẫn lựa chọn

Vẫn chưa biết nên dùng mô hình nào? Hãy xem trước các tiêu chí quyết định quan trọng này.

1
Chọn OmniHuman khi chỉ có ảnh

Dùng mô hình này khi tư liệu nguồn là ảnh tĩnh của người hoặc nhân vật và cần audio điều khiển.

2
So sánh đồng bộ khẩu hình khi đã có video người thật

Nếu cần giữ nguyên hành động và góc máy của video gốc, hãy so sánh Video Lip Sync.

3
Thử bằng audio ngắn trước

Dùng audio ngắn được khuyến nghị để kiểm tra nhận diện chủ thể và khẩu hình trước khi mở rộng nội dung.

Các so sánh được tìm kiếm nhiều

So sánh các lựa chọn phổ biến trên cùng một nhiệm vụ để làm rõ khác biệt về đầu vào, kiểm soát và chi phí.

Đầu vào và cách tính phí của OmniHuman 1.5 khác Kling AI Avatar như thế nào?
OmniHuman 1.5 và mô hình đồng bộ khẩu hình video phù hợp với loại tư liệu nào?

Bảng so sánh mô hình

Chưa biết nên chọn mô hình nào? Bảng này giúp bạn nhìn rõ khác biệt cốt lõi giữa mô hình hiện tại và các lựa chọn thay thế.

Đầu vào cốt lõi
OmniHuman 1.5
1 ảnh+1 audio
Kling AI Avatar Standard
1 ảnh+1 audio
Video Lip Sync
1 video+1 audio

Trải nghiệm sử dụng thực tế

Hướng dẫn thực tế dựa trên nguồn công khai, giới hạn hiện tại của trang và những nhiệm vụ tiêu biểu.

Mở có giới hạn không đồng nghĩa đã có đủ bộ công cụ hỗ trợ

Khả năng tạo cốt lõi có thể gọi, nhưng chọn một chủ thể trong nhiều chủ thể bằng phát hiện mặt nạ vẫn chưa thuộc hợp đồng vận hành.

Tạm giữ theo giây audio có thể xác minh

Thời lượng đáng tin cậy đã biết trước khi tạo tác vụ nên không cần đoán bằng thời lượng ước tính hoặc giá cố định.

Chi tiết khả năng

Điều khiển bằng ảnh và audio

Dùng một ảnh và một đoạn âm thanh để tạo video chủ thể đang nói.

Đầu ra hai độ phân giải

Có thể chọn 720P hoặc 1080P.

Chế độ nhanh

Cho phép đánh đổi một phần chất lượng để hướng đến xử lý nhanh hơn.

Phù hợp để làm gì

Người thuyết minh ảo

Dùng ảnh chính diện của nhân vật và lời thoại rõ để tạo video giải thích ngắn.

Lời thoại nhân vật hoạt hình

Dùng ảnh nhân vật hoạt hình và audio hội thoại để tạo cảnh nhân vật phát biểu.

Video thú cưng nhân hóa

Kết hợp ảnh thú cưng với audio ngắn để thử biểu đạt nhân hóa.

Mẹo viết câu lệnh

Giữ chủ thể rõ ràng

Chọn ảnh có chủ thể nổi bật, ít bị che khuất, khuôn mặt hoặc đầu dễ nhận biết.

Dùng giọng nói sạch

Giảm nhạc nền và tiếng ồn để khẩu hình cùng nhịp điệu dễ căn hơn.

Giữ prompt ngắn gọn

Tối đa 300 ký tự, tập trung vào biểu cảm, biên độ động tác và phong cách góc máy.

Vì sao nên chọn

Đầu vào ảnh và audio đơn giản, rõ ràng.
Có thể tính phí chính xác theo thời lượng audio trước khi tạo.
Hỗ trợ nhiều loại chủ thể và mọi tỷ lệ ảnh.
Năng lực mặt nạ chưa mở có ranh giới rõ.

Điều cần biết trước khi dùng

Hiện chưa mở mặt nạ hoặc quy trình chỉ định một trong nhiều chủ thể.
Chỉ gửi được một ảnh và một audio.
Audio phải ngắn hơn 60 giây.
Prompt dùng giới hạn nghiêm ngặt 300 ký tự.

Tham số có thể điều chỉnh

Giúp bạn nhanh chóng đánh giá mô hình có phù hợp với nhu cầu thực tế hay không.

Độ phân giải đầu ra
output_resolution
Tùy chọn
Loại tham số: Danh sách chọn
Mặc định: 1080P
720P
1080P
Chế độ nhanh
pe_fast_mode
Tùy chọn
Loại tham số: Công tắc
Mặc định: tắt
Tắt
Bật
Hạt giống ngẫu nhiên
seed
Tùy chọn
Loại tham số: Số nguyên
Mặc định: -1 (ngẫu nhiên)

Mức tiêu hao điểm

27 điểm cho mỗi giây audio

Mức tạm giữ trước khi tạo được tính theo 27 credits cho mỗi giây audio đã xác minh rồi làm tròn lên. Audio phải ngắn hơn 60 giây nên yêu cầu hợp lệ có mức tạm giữ dưới 1.620 điểm. Tác vụ được quyết toán theo tiêu hao thực tế sau khi hoàn tất.

Mẹo tiết kiệm điểm

Trước khi tạo hàng loạt hình ảnh hoặc video, bạn nên dùng cùng một bộ tư liệu để thử nghiệm A/B giữa mô hình hiện tại và các lựa chọn tương tự. Hãy xác nhận kết quả trước khi chạy hàng loạt để tránh lãng phí điểm.

Câu hỏi thường gặp

Mô hình tương tự nên xem

Vẫn chưa quyết định? Hãy tiện thể so sánh các lựa chọn tương tự này.

Kling AI Avatar Standard

Nhãn khả năng: Giao diện yêu cầu đúng 1 ảnh JPEG hoặc PNG và 1 tệp âm thanh MPEG, WAV, X-WAV, AAC, MP4 hoặc OGG. Ảnh tối đa 10 MB; âm thanh tối đa 100 MB và 5 phút. Chi phí dùng thời lượng âm thanh đã ký ở mức 8 điểm mỗi giây rồi làm tròn lên. Không thể gửi nếu thiếu thời lượng, thời lượng không hợp lệ hoặc dài hơn 5 phút.

Mô hình video AI
8 điểm / giây âm thanh

Infinitalk

Infinitalk trên Kyeo dùng 1 ảnh, 1 tệp âm thanh không quá 15 giây và prompt bắt buộc để tạo video đọc lời. Có thể chọn 480p hoặc 720p, cũng có thể điền `seed`; chi phí tính theo số giây âm thanh và độ phân giải, không phải giá cố định mỗi lần.

Mô hình video AI
480p 3 điểm / giây; 720p 12 điểm / giây

Volcengine Video Lip Sync

Video Lip Sync dùng một video có sẵn và một audio giọng nói mục tiêu để tạo lại khẩu hình. Chế độ nhẹ dành cho video một người nhìn chính diện; chế độ cơ bản dành cho cảnh một người phức tạp hơn và có thể bật phát hiện cảnh.

Mô hình video AI
8 điểm cho mỗi giây audio

Nguồn thông tin

Nội dung trang được tổng hợp từ tài liệu mô hình, mô tả tính năng và các thiết lập hiện có trên Kyeo AI.

Ghi chú nguồn

Tìm hiểu OmniHuman 1.5 hiện dùng một ảnh và một audio để tạo video 720P/1080P, audio dưới 60 giây, phí theo giây và các giới hạn mở. Mức tạm giữ trước khi tạo được tính theo 27 credits cho mỗi giây audio đã xác minh rồi làm tròn lên. Audio phải ngắn hơn 60 giây nên yêu cầu hợp lệ có mức tạm giữ dưới 1.620 điểm. Tác vụ được quyết toán theo tiêu hao thực tế sau khi hoàn tất.

Cập nhật lần cuối: 2026-08-28
Thông tin giao diện hiện tại của OmniHuman V1.5
Nền tảng

Dùng để kiểm tra chế độ đầu vào, tùy chọn hiển thị, giới hạn tệp và trạng thái của phiên bản đang được kết nối với trang. Các lựa chọn thực tế theo trang mô hình và khu vực làm việc.