OmniHuman 1.5
El flujo principal de OmniHuman 1.5 genera un vídeo a partir de una imagen de una persona, mascota o personaje de animación y una pista de audio. La duración del audio se verifica durante la carga y determina directamente la preautorización previa a la creación.
En pocas palabras
¿Qué ofrece este modelo?
La imagen puede tener cualquier relación de aspecto, pero debe superar la comprobación de formato real y dimensiones firmadas. El audio debe usar un formato admitido, ocupar como máximo 10 MB y durar menos de 60 segundos. El prompt opcional sigue el límite más estricto de 300 caracteres y no adopta descripciones más amplias que se contradicen.
Parámetros principales
Te ayuda a evaluar rápidamente si este modelo encaja con tu caso de uso.
Otros nombres
Un mismo modelo puede aparecer con nombres distintos según la fuente. Aquí los reunimos para facilitar la búsqueda y la comparación.
Preguntas frecuentes de los usuarios
Estas preguntas prácticas se centran en la tarea, las entradas y el resultado que conviene confirmar antes de elegir.
Guía de elección
¿Aún no sabes qué modelo usar? Empieza por estos puntos clave.
Usa este modelo cuando el recurso visual sea una imagen estática de una persona o personaje y quieras animarla con audio.
Si quieres conservar los movimientos y la cámara de un vídeo existente, compara Video Lip Sync.
Prueba la detección del sujeto y la sincronización labial con un audio breve antes de ampliar la duración.
Comparaciones frecuentes
Compara alternativas habituales en la misma tarea para aclarar diferencias de entrada, control y coste.
Tabla comparativa de modelos
¿No sabes cuál elegir? Esta tabla muestra de un vistazo las principales diferencias entre el modelo actual y sus alternativas.
Experiencia de uso real
Orientación práctica basada en fuentes públicas, límites actuales del sitio y tareas representativas.
El acceso limitado no incluye todo el conjunto auxiliar
La preautorización por segundos de audio es verificable
Capacidades en detalle
Vídeo desde imagen y audio
Salida en dos resoluciones
Modo rápido
Para qué sirve
Presentador virtual
Diálogo de un personaje de animación
Clip de mascota humanizada
Consejos para prompts
Mantén el sujeto visible
Usa una voz limpia
Mantén el prompt breve
Por qué elegirlo
Lo que debes saber antes de usarlo
Parámetros configurables
Te ayuda a evaluar rápidamente si este modelo encaja con tu caso de uso.
Consumo de créditos
La preautorización se calcula con 27 credits por cada segundo verificado de audio y se redondea hacia arriba. El audio debe durar menos de 60 segundos, por lo que una solicitud válida requiere menos de 1,620 créditos. Al terminar la tarea se liquida el consumo real.
Antes de generar imágenes o videos por lotes, prueba el modelo actual y otras opciones similares con los mismos recursos. Cuando confirmes el resultado, inicia el lote para evitar gastar créditos de más.
Preguntas frecuentes
Modelos similares
¿Aún no te decides? Compara también estas alternativas similares.
Kling AI Avatar Standard
Capacidades: La interfaz exige exactamente 1 imagen JPEG o PNG y 1 audio MPEG, WAV, X-WAV, AAC, MP4 u OGG. La imagen admite hasta 10 MB; el audio, hasta 100 MB y 5 minutos. El cargo usa la duración de audio firmada a 8 créditos por segundo y redondea al alza. No se puede enviar una duración ausente, no válida o superior a 5 minutos.
Infinitalk
Infinitalk en Kyeo usa 1 imagen, 1 archivo de audio de hasta 15 segundos y un prompt obligatorio para generar un vídeo de presentación. Puedes elegir 480p o 720p y escribir `seed`; el coste depende de los segundos de audio y la resolución, no es un precio fijo por solicitud.
Volcengine Video Lip Sync
Video Lip Sync rehace el movimiento de los labios de un vídeo existente para ajustarlo a un audio de voz. El modo ligero está pensado para vídeos frontales de una sola persona; el básico admite escenas individuales más complejas y puede activar la detección de escenas.
Fuentes de información
El contenido de esta página reúne documentación del modelo, descripciones de funciones y la configuración disponible actualmente en Kyeo AI.
Conoce OmniHuman 1.5: genera vídeo con una imagen y un audio, 720P/1080P, audio de menos de 60 segundos, precio por segundo y funciones limitadas. La preautorización se calcula con 27 credits por cada segundo verificado de audio y se redondea hacia arriba. El audio debe durar menos de 60 segundos, por lo que una solicitud válida requiere menos de 1,620 créditos. Al terminar la tarea se liquida el consumo real.
Se usan para comprobar los modos de entrada, controles visibles, límites de archivos y disponibilidad de la versión conectada al sitio. La página y el espacio de trabajo muestran las opciones reales.