Aller au contenu principal
Modèle vidéo IA
ByteDance
OmniHuman

OmniHuman 1.5

Le parcours principal d’OmniHuman 1.5 transforme une image de personne, d’animal ou de personnage animé et un audio en vidéo pilotée. La durée de l’audio est vérifiée par une signature d’import et détermine directement la préautorisation.

Disponibilité
Parcours principal ouvert de façon limitée
Entrées
1 image + 1 audio
Sortie
720P/1080P
Prix
27/seconde d’audio
Contrat clair : une image et un audio
720P/1080P avec mode rapide
Durée audio signée directement utilisée pour la préautorisation
Parcours auxiliaire de masque non ouvert et champ strictement refusé
L’essentiel en 30 secondes
OmniHuman
27 crédits par seconde d’audio
Ses points forts
Un workflow principal de vidéo pilotée par audio à partir d’une image de sujet unique.
À qui s’adresse-t-il ?
Convient aux présentateurs, aux dialogues de personnages virtuels, ainsi qu’aux courtes vidéos parlées d’animaux ou de sujets animés.
Recherches populaires
Comment utiliser OmniHuman 1.5 ?Combien coûte OmniHuman 1.5 ?Quelle durée audio maximale accepte OmniHuman 1.5 ?

En une phrase

Que vaut ce modèle ?

L’image peut adopter n’importe quel format visuel, mais son type réel et ses dimensions signées doivent être validés. L’audio doit utiliser un format pris en charge, peser 10 Mo au plus et durer moins de 60 secondes. Le prompt facultatif suit le plafond plus strict de 300 caractères, sans reprendre une description contradictoire plus large.

Ses points forts
Un workflow principal de vidéo pilotée par audio à partir d’une image de sujet unique.
À qui s’adresse-t-il ?
Convient aux présentateurs, aux dialogues de personnages virtuels, ainsi qu’aux courtes vidéos parlées d’animaux ou de sujets animés.
Pourquoi l’utiliser sur Kyeo AI ?
Avant le débit, le site vérifie le lien entre image et audio, préautorise selon une durée audio fiable et maintient fermée la capacité de masque qui n’est pas intégrée.

Paramètres essentiels

Évaluez rapidement si ce modèle convient à votre activité.

Formats d’image
JPEG/PNG/WebP
Durée de l’audio
Moins de 60 secondes
Prompt
Facultatif, 300 caractères maximum
Pas encore ouvert
Parcours avec masque du sujet

Autres noms

Un même modèle peut porter des noms différents selon les sources. Ils sont regroupés ici pour faciliter la recherche et la comparaison.

OmniHuman V1.5
photo parlante OmniHuman 1.5
vidéo OmniHuman 1.5 pilotée par audio

Questions fréquentes des utilisateurs

Ces questions pratiques portent sur la tâche, les entrées et le résultat à confirmer avant de choisir.

Comment utiliser OmniHuman 1.5 ?
Combien coûte OmniHuman 1.5 ?
Quelle durée audio maximale accepte OmniHuman 1.5 ?
Quelles images OmniHuman 1.5 accepte-t-il ?
À quoi sert le mode rapide d’OmniHuman 1.5 ?

Guide de choix

Pour choisir entre plusieurs modèles, commencez par ces critères essentiels.

1
Choisir OmniHuman lorsque la source est une image

Utilisez ce modèle si vous partez d’une image statique de personne ou de personnage à animer avec un audio.

2
Comparer la synchronisation labiale si une vidéo existe déjà

Pour conserver les gestes et la caméra d’une vidéo existante, comparez Video Lip Sync.

3
Valider d’abord avec un audio court

Un essai court aide à vérifier la détection du sujet et la synchronisation avant d’étendre le contenu.

Comparaisons souvent recherchées

Comparez des alternatives courantes sur une même tâche pour clarifier les différences d’entrées, de contrôle et de coût.

Quelles différences d’entrée et de prix entre OmniHuman 1.5 et Kling AI Avatar ?
Quels médias conviennent à OmniHuman 1.5 et à un modèle de synchronisation labiale vidéo ?

Tableau comparatif

Vous hésitez encore ? Ce tableau met en évidence les principales différences entre ce modèle et ses alternatives.

Entrées principales
OmniHuman 1.5
1 image + 1 audio
Kling AI Avatar Standard
1 image + 1 audio
Video Lip Sync
1 vidéo + 1 audio

Retour d’usage

Des conseils pratiques fondés sur les sources publiques, les limites actuelles du site et des tâches représentatives.

Une ouverture limitée ne comprend pas toute la suite d’outils

Le parcours principal est appelable, mais la sélection de plusieurs sujets qui dépend d’un masque ne fait pas encore partie du contrat d’exécution du site.

La préautorisation à la seconde d’audio est vérifiable

La durée fiable est connue avant la création ; il n’est donc pas nécessaire d’estimer la durée ni d’utiliser un prix forfaitaire.

Fonctions en détail

Pilotage par image et audio

Créer une vidéo où le sujet d’une image parle à partir d’un audio.

Deux résolutions de sortie

Choisir 720P ou 1080P.

Mode rapide

Privilégier un traitement plus rapide en acceptant un compromis de qualité.

Usages adaptés

Présentateur virtuel

Créer une courte présentation à partir d’un portrait frontal et d’une narration claire.

Dialogue de personnage animé

Faire parler un personnage animé depuis une image et un audio de dialogue.

Courte vidéo d’animal personnifié

Associer une photo d’animal à un court audio pour essayer une expression personnifiée.

Conseils de prompt

Garder le sujet bien visible

Choisir une image avec un sujet net, peu masqué, et un visage ou une tête clairement identifiable.

Utiliser une voix propre

Réduire musique et bruit de fond afin de faciliter l’alignement de la bouche et du rythme.

Rester concis

En 300 caractères maximum, se concentrer sur l’expression, l’amplitude des mouvements et le style de caméra.

Pourquoi le choisir ?

Entrées image et audio simples et explicites.
Durée audio facturable avec précision avant la création.
Plusieurs types de sujets et tous formats visuels d’image.
Limite claire pour la capacité de masque non ouverte.

À savoir avant de l’utiliser

Aucun parcours de masque ou de sélection d’un sujet parmi plusieurs actuellement.
Une seule image et un seul audio par requête.
Audio obligatoirement inférieur à 60 secondes.
Prompt soumis au plafond strict de 300 caractères.

Paramètres réglables

Évaluez rapidement si ce modèle convient à votre activité.

Résolution de sortie
output_resolution
Facultatif
Type de paramètre: Liste de sélection
Par défaut : 1080P
720P
1080P
Mode rapide
pe_fast_mode
Facultatif
Type de paramètre: Interrupteur
Par défaut : désactivé
Désactivé
Activé
Graine aléatoire
seed
Facultatif
Type de paramètre: Entier
Par défaut : -1 (aléatoire)

Coût en crédits

27 crédits par seconde d’audio

La préautorisation est calculée à 27 crédits par seconde d’audio vérifiée, puis arrondie à l’entier supérieur. L’audio doit durer moins de 60 secondes : une requête valide reste donc sous 1 620 crédits de préautorisation. La tâche est ensuite réglée selon la consommation réelle.

Conseil pour économiser des crédits

Avant de générer une série d’images ou de vidéos, effectuez un test A/B avec les mêmes médias sur ce modèle et des modèles similaires. Lancez la série après avoir validé le résultat pour éviter de gaspiller des crédits.

Questions fréquentes

Modèles similaires

Vous hésitez encore ? Comparez aussi ces modèles similaires.

Kling AI Avatar Standard

Type de workflow: L’interface exige exactement 1 image JPEG ou PNG et 1 fichier audio MPEG, WAV, X-WAV, AAC, MP4 ou OGG. L’image est limitée à 10 MB ; l’audio à 100 MB et 5 minutes. Le débit est calculé à partir de la durée audio signée, à 8 crédits par seconde, puis arrondi au supérieur. Une durée absente, invalide ou supérieure à 5 minutes ne peut pas être envoyée.

Modèle vidéo IA
8 crédits / seconde audio

Infinitalk

Infinitalk utilise sur Kyeo 1 image, 1 audio de 15 secondes maximum et un prompt obligatoire pour produire une vidéo de présentation. La résolution 480p ou 720p et le `seed` sont au choix ; le coût dépend des secondes audio et de la résolution, et non d’un prix fixe par requête.

Modèle vidéo IA
480p : 3 crédits / s ; 720p : 12 crédits / s

Volcengine Video Lip Sync

Video Lip Sync adapte les mouvements de bouche d’une vidéo existante à un audio vocal cible. Le mode léger vise les vidéos frontales à une personne ; le mode de base convient à des scènes individuelles plus complexes et peut activer la détection de scènes.

Modèle vidéo IA
8 crédits par seconde d’audio

Sources

Le contenu de cette page est établi à partir des informations sur le modèle, de ses fonctions et des réglages actuellement disponibles sur Kyeo AI.

Note sur les sources

Découvrez le parcours ouvert d’OmniHuman 1.5 : une image et un audio pour créer une vidéo 720P/1080P, audio inférieur à 60 secondes et prix à la seconde. La préautorisation est calculée à 27 crédits par seconde d’audio vérifiée, puis arrondie à l’entier supérieur. L’audio doit durer moins de 60 secondes : une requête valide reste donc sous 1 620 crédits de préautorisation. La tâche est ensuite réglée selon la consommation réelle.

Dernière mise à jour: 2026-08-28
Données de l’interface actuelle de OmniHuman V1.5
Plateforme

Elles servent à vérifier les modes d’entrée, réglages visibles, limites des médias et disponibilité de la version actuellement reliée au site. Les options réelles sont celles de la page et de l’espace de création.