跳至主要內容
AI 影片模型
ByteDance
OmniHuman

OmniHuman 1.5

OmniHuman 1.5 目前的核心路徑會以一張人物、寵物或動漫主體圖片和一段音訊生成驅動影片。音訊長度由上傳簽章驗證,並直接決定建立任務前的預授權。

開放狀態
核心能力有限開放
輸入
1 圖+1 音訊
輸出
720P/1080P
計費
27/音訊秒
一張圖片加一段音訊的明確輸入合約
720P/1080P 與快速模式
音訊長度簽章直接納入預授權
遮罩輔助流程暫未開放,且相關欄位會被硬性拒絕
30 秒快速瞭解
OmniHuman
每秒音訊 27 點
它擅長什麼
面向單一主體圖片的音訊驅動影片核心工作流程。
適合哪些使用者
適合人物講解、虛擬角色對白、寵物或動漫主體的口播短片。
熱門搜尋
OmniHuman 1.5 怎麼用OmniHuman 1.5 多少錢OmniHuman 1.5 音訊最長幾秒

一句話瞭解

這個模型表現如何?

圖片可採用任意畫面比例,但仍須通過真實格式與簽章尺寸驗證;音訊必須使用支援的格式、不超過 10 MB,且短於 60 秒。選填提示詞會採用更嚴格的 300 個字元上限,不會使用互相衝突的較寬描述。

它擅長什麼
面向單一主體圖片的音訊驅動影片核心工作流程。
適合哪些使用者
適合人物講解、虛擬角色對白、寵物或動漫主體的口播短片。
為什麼要在 Kyeo AI 使用
本站會在扣點前驗證圖片與音訊的綁定,依可信音訊秒數預授權,並明確關閉尚未接入的遮罩能力。

關鍵參數總覽

協助你快速評估此模型是否符合你的業務情境。

圖片格式
JPEG/PNG/WebP
音訊長度
短於 60 秒
提示詞
選填,最多 300 個字元
暫未開放
主體遮罩流程

其他名稱

同一個模型在不同資料中可能有不同名稱,這裡統一整理,方便搜尋與比較。

OmniHuman V1.5
OmniHuman 1.5 圖片說話
OmniHuman 1.5 音訊驅動影片

使用者常見問題

從實際任務、輸入條件和結果要求出發,整理選擇模型時最需要確認的問題。

OmniHuman 1.5 怎麼用
OmniHuman 1.5 多少錢
OmniHuman 1.5 音訊最長幾秒
OmniHuman 1.5 支援哪些圖片
OmniHuman 1.5 快速模式是什麼

選擇指南

還在猶豫該用哪個模型嗎?先查看這幾個關鍵決策點。

1
只有圖片時選擇 OmniHuman

來源素材為靜態人物或角色圖片,且需要由音訊驅動時可使用本模型。

2
已有真人影片時比較對嘴模型

若需要保留原影片動作與鏡頭,可比較 Video Lip Sync。

3
先用短音訊驗證效果

先使用建議的短音訊測試主體辨識與對嘴,再延伸至較長內容。

使用者常搜尋的比較

把常見候選放在同一任務下比較,協助你確認輸入方式、控制項和成本差異。

OmniHuman 1.5 與 Kling AI Avatar 的輸入和計費有何差異?
OmniHuman 1.5 與影片對嘴模型分別適合哪些素材?

模型橫向比較表

還在猶豫該選哪一個嗎?這張表協助你快速看清目前模型與替代方案的核心差異。

核心輸入
OmniHuman 1.5
1 張圖片+1 段音訊
Kling AI Avatar Standard
1 張圖片+1 段音訊
Video Lip Sync
1 段影片+1 段音訊

實際使用體驗

結合公開資料、目前站內邊界和典型任務,說明模型適合與不適合的情況。

有限開放不等於完整輔助套件

核心生成可以呼叫,但依賴遮罩偵測的多主體選擇能力仍未納入本站執行合約。

依音訊秒數預授權可以驗證

可信長度在建立任務前已知,因此不需要用估算片長或固定價格猜測。

功能詳解

圖片音訊驅動

使用一張圖片和一段聲音生成主體說話影片。

雙解析度輸出

可選擇 720P 或 1080P。

快速模式

允許以一定的品質取捨,換取更快的處理方向。

適合做什麼

虛擬講解員

使用角色正面圖片和清晰旁白製作講解短片。

動漫角色對白

使用動漫主體圖片和對白音訊生成角色發言。

寵物擬人短片

使用寵物照片搭配短音訊嘗試擬人表達。

提示詞技巧

保持主體清楚

選擇主體明顯、遮擋少,且臉部或頭部可辨識的圖片。

音訊使用乾淨人聲

減少背景音樂和雜訊,以利對齊嘴型與節奏。

提示詞保持簡短

最多 300 個字元,聚焦於表情、動作幅度與鏡頭風格。

選擇它的理由

圖片加音訊的輸入簡單明確。
音訊長度可在建立任務前精確計費。
支援多類主體和任意圖片畫面比例。
未開放遮罩能力有清楚邊界。

使用前須知

目前不開放遮罩或指定多主體流程。
只能提交一張圖片與一段音訊。
音訊必須短於 60 秒。
提示詞採用嚴格的 300 個字元上限。

可調整參數

協助你快速評估此模型是否符合你的業務情境。

輸出解析度
output_resolution
選填
參數類型: 下拉選單
預設:1080P
720P
1080P
快速模式
pe_fast_mode
選填
參數類型: 開關
預設:關閉
關閉
開啟
隨機種子
seed
選填
參數類型: 整數
預設:-1(隨機)

點數消耗

每秒音訊 27 點

依已驗證音訊長度,以每秒 27 credits 計算建立任務前的預授權並無條件進位;音訊必須短於 60 秒,因此合法請求的預授權低於 1,620 點。任務完成後按實際消耗結算。

節省點數的小技巧

批次生成圖片或影片前,建議先用同一組素材,在目前模型與同類候選模型之間進行 AB 測試;確認效果後再批次執行,避免浪費點數。

常見問題

同類模型推薦

還沒決定該用哪個嗎?也可以比較這幾個同類候選模型。

Kling AI Avatar Standard

能力標籤: 前台要求恰好 1 張 JPEG 或 PNG 圖片及 1 段 MPEG、WAV、X-WAV、AAC、MP4 或 OGG 音訊。圖片最大 10 MB;音訊最大 100 MB、最長 5 分鐘。 依已驗簽的音訊長度按 8 點/秒計算並向上取整;長度缺失、無效或超過 5 分鐘時無法送出。

AI 影片模型
8 點數 / 音訊秒

Infinitalk

Infinitalk 在 Kyeo 使用 1 張圖片、1 個不超過 15 秒的音訊檔案與必填提示詞,生成虛擬人物播報影片。可選 480p 或 720p,也能填寫 `seed`;費用依音訊秒數與解析度計算,不是固定的單次價格。

AI 影片模型
480p 每秒 3 點數;720p 每秒 12 點數

Volcengine Video Lip Sync

Video Lip Sync 使用一段既有影片和一段目標人聲音訊重新製作嘴型。輕量模式適合正面單人影片,基礎模式則適合較複雜的單人場景,並可開啟場景偵測。

AI 影片模型
每秒音訊 8 點

資訊來源

頁面內容結合模型資料、功能說明和 Kyeo AI 目前可用設定整理。

來源說明

瞭解 OmniHuman 1.5 目前開放的一張圖片加一段音訊驅動影片、720P/1080P、音訊短於 60 秒、按秒計費及有限開放邊界。 依已驗證音訊長度,以每秒 27 credits 計算建立任務前的預授權並無條件進位;音訊必須短於 60 秒,因此合法請求的預授權低於 1,620 點。任務完成後按實際消耗結算。

最後更新: 2026-08-28
OmniHuman V1.5 目前介面資料
平台

用於核對本站目前接入版本的輸入模式、可見設定、素材限制與可用狀態;實際選項以頁面和工作台為準。