メインコンテンツへ移動
AI動画モデル
ByteDance
OmniHuman

OmniHuman 1.5

OmniHuman 1.5の現在の中核経路では、人物、ペット、アニメキャラクターなどの画像1枚と音声1本から駆動動画を生成します。アップロード署名で検証した音声時間が、タスク作成前の事前確保額を直接決めます。

公開状態
中核機能を制限付きで公開
入力
1画像+1音声
出力
720P/1080P
料金
音声1秒あたり27
画像1枚と音声1本という明確な入力契約
720P/1080Pと高速モード
署名済みの音声時間を事前確保額に直接反映
マスク補助フローは現在非公開で、フィールドも拒否
30秒でわかる
OmniHuman
音声の秒数ごとに27クレジット
得意なこと
単一の被写体画像から音声駆動動画を作る中核ワークフローです。
おすすめのユーザー
人物の解説、バーチャルキャラクターの会話、ペットやアニメキャラクターのナレーション短編に適しています。
よく検索されているキーワード
OmniHuman 1.5の使い方OmniHuman 1.5の料金OmniHuman 1.5の音声は何秒までか

ひとことで紹介

このモデルの特徴

画像のアスペクト比は自由ですが、実際の形式と署名された寸法情報の検証は必要です。音声は対応形式で10 MB以内、かつ60秒未満にする必要があります。任意のプロンプトには、競合する広い記述ではなく、より厳格な300文字上限を適用します。

得意なこと
単一の被写体画像から音声駆動動画を作る中核ワークフローです。
おすすめのユーザー
人物の解説、バーチャルキャラクターの会話、ペットやアニメキャラクターのナレーション短編に適しています。
Kyeo AIで使うメリット
当サイトはクレジット消費前に画像と音声の紐付けを検証し、信頼できる音声秒数で事前確保し、非公開のマスク機能を明確に遮断します。

主な仕様

このモデルが用途やビジネスに合うか、すばやく判断できます。

画像形式
JPEG/PNG/WebP
音声の長さ
60秒未満
プロンプト
任意、最大300文字
現在非公開
被写体マスクのフロー

別名

同じモデルでも資料によって呼び方が異なる場合があります。検索や比較がしやすいよう、ここにまとめています。

OmniHuman V1.5
OmniHuman 1.5 写真を話させる
OmniHuman 1.5 音声駆動動画

よくある質問

タスク、入力条件、必要な結果から、モデルを選ぶ前に確認したい実用的な質問を整理しています。

OmniHuman 1.5の使い方
OmniHuman 1.5の料金
OmniHuman 1.5の音声は何秒までか
OmniHuman 1.5で使える画像
OmniHuman 1.5の高速モードとは

選び方ガイド

どのモデルを使うか迷ったら、まず次のポイントを確認しましょう。

1
元素材が画像ならOmniHumanを選ぶ

静止した人物やキャラクター画像を音声で動かしたい場合に使います。

2
人物動画があるならリップシンクと比較する

元動画の動作とカメラを維持する場合は、Video Lip Syncと比較してください。

3
まず短い音声で効果を確かめる

推奨される短い音声で被写体認識と口の動きを確認してから、長い内容へ広げます。

よく検索される比較

同じタスクで候補を比べ、入力方法、制御項目、コストの違いを確認できます。

OmniHuman 1.5とKling AI Avatarでは入力と料金がどう違いますか?
OmniHuman 1.5と動画リップシンクモデルはどの素材に向いていますか?

モデル比較表

どれを選ぶか迷っている方のために、現在のモデルと代替候補の主な違いを一覧にしました。

中核入力
OmniHuman 1.5
画像1枚+音声1本
Kling AI Avatar Standard
画像1枚+音声1本
Video Lip Sync
動画1本+音声1本

実際の使用感

公開情報、現在のサイト内の範囲、代表的なタスクに基づく実用的な案内です。

制限付き公開は補助機能一式の公開を意味しない

中核生成は呼び出せますが、マスク検出に依存する複数被写体の選択は当サイトの実行契約に含まれません。

音声秒数による事前確保は検証できる

信頼できる長さをタスク作成前に取得できるため、推定時間や固定料金で見積もる必要がありません。

機能の詳細

画像・音声駆動

画像1枚と音声1本から、被写体が話す動画を生成します。

2つの出力解像度

720Pまたは1080Pを選択できます。

高速モード

一定の品質とのトレードオフで、より速い処理を目指す設定です。

おすすめの用途

バーチャル解説者

キャラクターの正面画像と明瞭なナレーションで解説動画を作ります。

アニメキャラクターの会話

アニメキャラクターの画像と会話音声から発話動画を生成します。

ペットの擬人化短編

ペットの写真と短い音声で、人のように話す表現を試します。

プロンプトのコツ

被写体が明瞭な画像を選ぶ

被写体が目立ち、遮蔽が少なく、顔や頭部を認識しやすい画像を使います。

雑音の少ない声を使う

BGMやノイズを減らし、口の動きとリズムを合わせやすくします。

プロンプトを短く保つ

300文字以内で、表情、動きの大きさ、カメラスタイルに絞ります。

選ぶメリット

画像と音声という入力がシンプルで明確です。
タスク作成前に音声時間から料金を正確に計算できます。
複数種の被写体と任意の画像比率に対応します。
非公開のマスク機能との境界が明確です。

利用前の注意点

現在はマスクや複数被写体の指定フローを公開していません。
送信できるのは画像1枚と音声1本だけです。
音声は60秒未満でなければなりません。
プロンプトには厳格な300文字上限を適用します。

調整できる項目

このモデルが用途やビジネスに合うか、すばやく判断できます。

出力解像度
output_resolution
任意
パラメータの種類: プルダウン
初期値:1080P
720P
1080P
高速モード
pe_fast_mode
任意
パラメータの種類: 切り替え
初期値:オフ
オフ
オン
ランダムシード
seed
任意
パラメータの種類: 整数
初期値:-1(ランダム)

消費クレジット

音声の秒数ごとに27クレジット

検証済みの音声時間を1秒あたり27クレジットで計算し、タスク作成前の事前確保額を切り上げます。音声は60秒未満でなければならないため、有効なリクエストの事前確保額は1,620クレジット未満です。完了後に実際の消費量で精算します。

クレジット節約のヒント

画像や動画を一括生成する前に、同じ素材を使って現在のモデルと類似候補をA/Bテストするのがおすすめです。効果を確認してから一括処理すれば、クレジットの無駄を抑えられます。

よくある質問

類似モデル

まだ決まっていない場合は、こちらの類似候補も比較してみてください。

Kling AI Avatar Standard

機能タグ: 画面ではJPEGまたはPNG画像を1枚、MPEG、WAV、X-WAV、AAC、MP4、OGG音声を1件指定します。画像は最大10MB、音声は最大100MB・5分です。 署名検証済みの音声時間を1秒あたり8クレジットで計算し、端数を切り上げます。時間がない、無効、または5分を超える場合は送信できません。

AI動画モデル
音声の秒数ごとに8クレジット

Infinitalk

InfinitalkはKyeoで、画像1枚、15秒以内の音声1ファイル、必須のプロンプトからナレーション動画を生成します。480pまたは720pを選べ、`seed`も入力できます。料金は音声の秒数と解像度で計算し、1回固定ではありません。

AI動画モデル
480pは3クレジット/秒、720pは12クレジット/秒

Volcengine Video Lip Sync

Video Lip Syncは、既存動画と目標音声を使って口元の動きを作り直します。ライトモードは正面を向いた1人の動画向けで、ベーシックモードはより複雑な1人の場面を扱い、シーン検出も有効にできます。

AI動画モデル
音声の秒数ごとに8クレジット

情報源

モデル資料、機能説明、Kyeo AIで現在利用できる設定をもとに作成しています。

情報源について

OmniHuman 1.5で現在使える画像1枚と音声1本による動画生成、720P/1080P、60秒未満の音声、秒単位料金、制限付き機能を解説します。 検証済みの音声時間を1秒あたり27クレジットで計算し、タスク作成前の事前確保額を切り上げます。音声は60秒未満でなければならないため、有効なリクエストの事前確保額は1,620クレジット未満です。完了後に実際の消費量で精算します。

最終更新: 2026-08-28
OmniHuman V1.5 の現行インターフェース情報
プラットフォーム

現在サイトに接続されている版の入力モード、表示設定、素材制限、提供状況を確認するための情報です。実際に選べる項目はページとワークベンチを基準にしてください。