Ir al contenido principal
Modelo de vídeo con IA
ByteDance
OmniHuman

OmniHuman 1.5

El flujo principal de OmniHuman 1.5 genera un vídeo a partir de una imagen de una persona, mascota o personaje de animación y una pista de audio. La duración del audio se verifica durante la carga y determina directamente la preautorización previa a la creación.

Disponibilidad
Funciones principales con acceso limitado
Entrada
1 imagen + 1 audio
Salida
720P/1080P
Cobro
27/segundo de audio
Contrato claro de una imagen y un audio
720P/1080P y modo rápido
La duración firmada del audio participa directamente en la preautorización
El flujo auxiliar de máscara no está disponible y sus campos se rechazan
Resumen en 30 segundos
OmniHuman
27 créditos por segundo de audio
En qué destaca
Un flujo principal de vídeo controlado por audio para una imagen con un solo sujeto.
Para quién es
Adecuado para presentadores, diálogos de personajes virtuales y clips hablados de mascotas o sujetos de animación.
Búsquedas populares
cómo usar OmniHuman 1.5cuánto cuesta OmniHuman 1.5cuál es la duración máxima del audio en OmniHuman 1.5

En pocas palabras

¿Qué ofrece este modelo?

La imagen puede tener cualquier relación de aspecto, pero debe superar la comprobación de formato real y dimensiones firmadas. El audio debe usar un formato admitido, ocupar como máximo 10 MB y durar menos de 60 segundos. El prompt opcional sigue el límite más estricto de 300 caracteres y no adopta descripciones más amplias que se contradicen.

En qué destaca
Un flujo principal de vídeo controlado por audio para una imagen con un solo sujeto.
Para quién es
Adecuado para presentadores, diálogos de personajes virtuales y clips hablados de mascotas o sujetos de animación.
Por qué usarlo en Kyeo AI
El sitio verifica la vinculación de imagen y audio antes de descontar créditos, preautoriza según segundos fiables de audio y mantiene cerrada la función de máscara no integrada.

Parámetros principales

Te ayuda a evaluar rápidamente si este modelo encaja con tu caso de uso.

Formato de imagen
JPEG/PNG/WebP
Duración del audio
Menos de 60 segundos
Prompt
Opcional, hasta 300 caracteres
No disponible
Flujo de máscara de sujeto

Otros nombres

Un mismo modelo puede aparecer con nombres distintos según la fuente. Aquí los reunimos para facilitar la búsqueda y la comparación.

OmniHuman V1.5
hacer hablar una imagen con OmniHuman 1.5
vídeo controlado por audio OmniHuman 1.5

Preguntas frecuentes de los usuarios

Estas preguntas prácticas se centran en la tarea, las entradas y el resultado que conviene confirmar antes de elegir.

cómo usar OmniHuman 1.5
cuánto cuesta OmniHuman 1.5
cuál es la duración máxima del audio en OmniHuman 1.5
qué imágenes acepta OmniHuman 1.5
qué es el modo rápido de OmniHuman 1.5

Guía de elección

¿Aún no sabes qué modelo usar? Empieza por estos puntos clave.

1
Elige OmniHuman cuando solo tengas una imagen

Usa este modelo cuando el recurso visual sea una imagen estática de una persona o personaje y quieras animarla con audio.

2
Compara sincronización labial si ya tienes un vídeo

Si quieres conservar los movimientos y la cámara de un vídeo existente, compara Video Lip Sync.

3
Valida primero con un audio corto

Prueba la detección del sujeto y la sincronización labial con un audio breve antes de ampliar la duración.

Comparaciones frecuentes

Compara alternativas habituales en la misma tarea para aclarar diferencias de entrada, control y coste.

¿En qué se diferencian la entrada y el cobro de OmniHuman 1.5 y Kling AI Avatar?
¿Cuándo conviene usar OmniHuman 1.5 o un modelo de sincronización labial para vídeo?

Tabla comparativa de modelos

¿No sabes cuál elegir? Esta tabla muestra de un vistazo las principales diferencias entre el modelo actual y sus alternativas.

Entrada principal
OmniHuman 1.5
1 imagen + 1 audio
Kling AI Avatar Standard
1 imagen + 1 audio
Video Lip Sync
1 vídeo + 1 audio

Experiencia de uso real

Orientación práctica basada en fuentes públicas, límites actuales del sitio y tareas representativas.

El acceso limitado no incluye todo el conjunto auxiliar

La generación principal puede utilizarse, pero la selección de sujetos que depende de una máscara aún no forma parte del contrato de ejecución del sitio.

La preautorización por segundos de audio es verificable

La duración fiable se conoce antes de crear la tarea, por lo que no hace falta estimarla ni adivinar un precio fijo.

Capacidades en detalle

Vídeo desde imagen y audio

Usa una imagen y una voz para generar un vídeo del sujeto hablando.

Salida en dos resoluciones

Permite elegir 720P o 1080P.

Modo rápido

Permite sacrificar parte de la calidad para buscar un procesamiento más rápido.

Para qué sirve

Presentador virtual

Crea un vídeo explicativo con una imagen frontal del personaje y una narración clara.

Diálogo de un personaje de animación

Genera una intervención con una imagen del personaje y un audio de diálogo.

Clip de mascota humanizada

Prueba una expresión hablada con una fotografía de mascota y un audio breve.

Consejos para prompts

Mantén el sujeto visible

Elige una imagen con el sujeto bien definido, pocas oclusiones y el rostro o la cabeza reconocibles.

Usa una voz limpia

Reduce la música de fondo y el ruido para facilitar la alineación de boca y ritmo.

Mantén el prompt breve

Con un máximo de 300 caracteres, céntrate en la expresión, la amplitud del movimiento y el estilo de cámara.

Por qué elegirlo

La entrada de imagen y audio es sencilla y precisa.
La duración del audio permite calcular el precio antes de la creación.
Admite varios tipos de sujeto y cualquier relación de aspecto de imagen.
La función de máscara no disponible tiene un límite explícito.

Lo que debes saber antes de usarlo

Actualmente no admite máscaras ni selección de varios sujetos.
Solo permite una imagen y un audio.
El audio debe durar menos de 60 segundos.
El prompt tiene un límite estricto de 300 caracteres.

Parámetros configurables

Te ayuda a evaluar rápidamente si este modelo encaja con tu caso de uso.

Resolución de salida
output_resolution
Opcional
Tipo de parámetro: Selector
Valor predeterminado: 1080P
720P
1080P
Modo rápido
pe_fast_mode
Opcional
Tipo de parámetro: Interruptor
Valor predeterminado: desactivado
Desactivado
Activado
Semilla aleatoria
seed
Opcional
Tipo de parámetro: Número entero
Valor predeterminado: -1 (aleatoria)

Consumo de créditos

27 créditos por segundo de audio

La preautorización se calcula con 27 credits por cada segundo verificado de audio y se redondea hacia arriba. El audio debe durar menos de 60 segundos, por lo que una solicitud válida requiere menos de 1,620 créditos. Al terminar la tarea se liquida el consumo real.

Consejo para ahorrar

Antes de generar imágenes o videos por lotes, prueba el modelo actual y otras opciones similares con los mismos recursos. Cuando confirmes el resultado, inicia el lote para evitar gastar créditos de más.

Preguntas frecuentes

Modelos similares

¿Aún no te decides? Compara también estas alternativas similares.

Kling AI Avatar Standard

Capacidades: La interfaz exige exactamente 1 imagen JPEG o PNG y 1 audio MPEG, WAV, X-WAV, AAC, MP4 u OGG. La imagen admite hasta 10 MB; el audio, hasta 100 MB y 5 minutos. El cargo usa la duración de audio firmada a 8 créditos por segundo y redondea al alza. No se puede enviar una duración ausente, no válida o superior a 5 minutos.

Modelo de vídeo con IA
8 créditos / segundo de audio

Infinitalk

Infinitalk en Kyeo usa 1 imagen, 1 archivo de audio de hasta 15 segundos y un prompt obligatorio para generar un vídeo de presentación. Puedes elegir 480p o 720p y escribir `seed`; el coste depende de los segundos de audio y la resolución, no es un precio fijo por solicitud.

Modelo de vídeo con IA
480p: 3 créditos / segundo; 720p: 12 créditos / segundo

Volcengine Video Lip Sync

Video Lip Sync rehace el movimiento de los labios de un vídeo existente para ajustarlo a un audio de voz. El modo ligero está pensado para vídeos frontales de una sola persona; el básico admite escenas individuales más complejas y puede activar la detección de escenas.

Modelo de vídeo con IA
8 créditos por segundo de audio

Fuentes de información

El contenido de esta página reúne documentación del modelo, descripciones de funciones y la configuración disponible actualmente en Kyeo AI.

Nota sobre las fuentes

Conoce OmniHuman 1.5: genera vídeo con una imagen y un audio, 720P/1080P, audio de menos de 60 segundos, precio por segundo y funciones limitadas. La preautorización se calcula con 27 credits por cada segundo verificado de audio y se redondea hacia arriba. El audio debe durar menos de 60 segundos, por lo que una solicitud válida requiere menos de 1,620 créditos. Al terminar la tarea se liquida el consumo real.

Última actualización: 2026-08-28
Datos de la interfaz actual de OmniHuman V1.5
Plataforma

Se usan para comprobar los modos de entrada, controles visibles, límites de archivos y disponibilidad de la versión conectada al sitio. La página y el espacio de trabajo muestran las opciones reales.