OmniHuman 1.5
OmniHuman 1.5の現在の中核経路では、人物、ペット、アニメキャラクターなどの画像1枚と音声1本から駆動動画を生成します。アップロード署名で検証した音声時間が、タスク作成前の事前確保額を直接決めます。
ひとことで紹介
このモデルの特徴
画像のアスペクト比は自由ですが、実際の形式と署名された寸法情報の検証は必要です。音声は対応形式で10 MB以内、かつ60秒未満にする必要があります。任意のプロンプトには、競合する広い記述ではなく、より厳格な300文字上限を適用します。
主な仕様
このモデルが用途やビジネスに合うか、すばやく判断できます。
別名
同じモデルでも資料によって呼び方が異なる場合があります。検索や比較がしやすいよう、ここにまとめています。
よくある質問
タスク、入力条件、必要な結果から、モデルを選ぶ前に確認したい実用的な質問を整理しています。
選び方ガイド
どのモデルを使うか迷ったら、まず次のポイントを確認しましょう。
静止した人物やキャラクター画像を音声で動かしたい場合に使います。
元動画の動作とカメラを維持する場合は、Video Lip Syncと比較してください。
推奨される短い音声で被写体認識と口の動きを確認してから、長い内容へ広げます。
よく検索される比較
同じタスクで候補を比べ、入力方法、制御項目、コストの違いを確認できます。
モデル比較表
どれを選ぶか迷っている方のために、現在のモデルと代替候補の主な違いを一覧にしました。
実際の使用感
公開情報、現在のサイト内の範囲、代表的なタスクに基づく実用的な案内です。
制限付き公開は補助機能一式の公開を意味しない
音声秒数による事前確保は検証できる
機能の詳細
画像・音声駆動
2つの出力解像度
高速モード
おすすめの用途
バーチャル解説者
アニメキャラクターの会話
ペットの擬人化短編
プロンプトのコツ
被写体が明瞭な画像を選ぶ
雑音の少ない声を使う
プロンプトを短く保つ
選ぶメリット
利用前の注意点
調整できる項目
このモデルが用途やビジネスに合うか、すばやく判断できます。
消費クレジット
検証済みの音声時間を1秒あたり27クレジットで計算し、タスク作成前の事前確保額を切り上げます。音声は60秒未満でなければならないため、有効なリクエストの事前確保額は1,620クレジット未満です。完了後に実際の消費量で精算します。
画像や動画を一括生成する前に、同じ素材を使って現在のモデルと類似候補をA/Bテストするのがおすすめです。効果を確認してから一括処理すれば、クレジットの無駄を抑えられます。
よくある質問
類似モデル
まだ決まっていない場合は、こちらの類似候補も比較してみてください。
Kling AI Avatar Standard
機能タグ: 画面ではJPEGまたはPNG画像を1枚、MPEG、WAV、X-WAV、AAC、MP4、OGG音声を1件指定します。画像は最大10MB、音声は最大100MB・5分です。 署名検証済みの音声時間を1秒あたり8クレジットで計算し、端数を切り上げます。時間がない、無効、または5分を超える場合は送信できません。
Infinitalk
InfinitalkはKyeoで、画像1枚、15秒以内の音声1ファイル、必須のプロンプトからナレーション動画を生成します。480pまたは720pを選べ、`seed`も入力できます。料金は音声の秒数と解像度で計算し、1回固定ではありません。
情報源
モデル資料、機能説明、Kyeo AIで現在利用できる設定をもとに作成しています。
OmniHuman 1.5で現在使える画像1枚と音声1本による動画生成、720P/1080P、60秒未満の音声、秒単位料金、制限付き機能を解説します。 検証済みの音声時間を1秒あたり27クレジットで計算し、タスク作成前の事前確保額を切り上げます。音声は60秒未満でなければならないため、有効なリクエストの事前確保額は1,620クレジット未満です。完了後に実際の消費量で精算します。
現在サイトに接続されている版の入力モード、表示設定、素材制限、提供状況を確認するための情報です。実際に選べる項目はページとワークベンチを基準にしてください。