Modelos de video con IA
Consulta y compara modelos como Sora 2, Kling, Veo 3.1 y Hailuo · 39 modelos disponibles · 10 modelos disponibles solo como referencia
Compara modelos de texto a vídeo e imagen a vídeo para clips, control de cámara, fotogramas inicial y final y otras tareas de vídeo.
Seedance 2.0 / Capacidades — text no acepta material; frames exige un primer fotograma y admite uno último; reference exige un prompt y al menos una referencia de imagen, vídeo o audio. La referencia multimodal no se puede enviar junto con los campos de primer y último fotograma. Seedance 2.0 admite tres escenas mutuamente excluyentes: texto, fotogramas y referencia multimodal. La salida disponible actualmente es 720p, 1080p y 4K durante 4–15 segundos; las solicitudes con vídeo de referencia solo están disponibles en 1080p o 4K porque son las combinaciones con precio vigente. 164–3.840 créditos por solicitud
Seedance 2.0 Fast / Capacidades — text no acepta material; frames exige un primer fotograma y admite uno último; reference exige un prompt y al menos una referencia de imagen, vídeo o audio. La referencia multimodal no se puede enviar junto con los campos de primer y último fotograma. 480p/720p · 4–15 · 47–450 créditos por tarea.
Seedance 1.5 Pro / Capacidades — Seedance 1.5 Pro de Kyeo admite texto o hasta 2 imágenes y ofrece 480p/720p/1080p, 4–12 segundos, generación de audio, 6 relaciones de aspecto y bloqueo de cámara. El rango de 7–180 créditos depende de la combinación de parámetros; ni el nombre Pro ni un precio mayor demuestran que la calidad, la estabilidad o la aptitud para publicar estén verificadas en esta página.
HappyHorse 1.0 / Capacidades — Los flujos disponibles actualmente incluyen vídeo solo con prompt, vídeo con una imagen y vídeo de referencia con entre 2 y 9 imágenes. La edición de un vídeo existente no está disponible actualmente en esta página.
Wan 2.7 reúne texto a vídeo, imagen a vídeo con fotograma inicial o inicial y final, y edición de vídeo. Ofrece 720p y 1080p; compara a la vez archivos, duración, formato y créditos estimados.
Sin medios se selecciona texto a vídeo, exactamente una imagen selecciona imagen a vídeo y entre uno y tres vídeos seleccionan la edición de vídeo; no se pueden mezclar imágenes y vídeos. El valor predeterminado es 1080p, 5 segundos, estructura de planos desactivada y filtro de contenido activado.
Wan 2.5 Video en Kyeo: flujos de texto y una imagen, 5/10 segundos, 720p/1080p, límites del prompt y créditos de 60–200. Kyeo cobra con precisión según resolución y duración: 720p a 5 segundos cuesta 60 créditos, 720p a 10 segundos 120, 1080p a 5 segundos 100 y 1080p a 10 segundos 200; el valor predeterminado de 720p a 5 segundos es 60 créditos. Wan 2.5: cómo calcular 60/100/120/200 créditos — Wan 2.5 Video en Kyeo: flujos de texto y una imagen, 5/10 segundos, 720p/1080p, límites del prompt y créditos de 60–200.
Wan 2.2 A14B Turbo no es un único flujo en Kyeo: sin material se usa la generación a partir de texto; al subir una imagen se pasa a la generación a partir de imagen; y solo una imagen junto con audio activa el flujo de voz. Las tres rutas tienen distintas resoluciones, créditos y controles visibles, así que conviene confirmar primero la combinación de materiales.
Wan 2.2 Animate Replace usa un vídeo de origen y una imagen de sustitución subidos desde el espacio de trabajo para cambiar un personaje, con salida a 480p, 580p o 720p. El precio usa los segundos verificados del vídeo de origen y no admite URL multimedia arbitrarias.
Kyeo ofrece seis combinaciones válidas: en Standard, 768P a 6/10 segundos y 1080P a 6 segundos cuestan 25/40/40 créditos; en Pro cuestan 40/80/70 créditos. 1080P no admite 10 segundos. Obligatorio: 1 archivo JPG/PNG/WebP de hasta 10 MB.
Hailuo Pro genera vídeos de 6 segundos en 1080P desde texto, una imagen o fotogramas inicial y final. Cada solicitud cuesta 57 créditos y añadir el fotograma final no cambia el precio.
Hailuo Standard combina texto a vídeo con animación desde un primer fotograma y un último fotograma opcional. Sus cinco combinaciones cuestan entre 12 y 50 créditos.
Conoce Kling 3.0 en Kyeo AI: 3–15 segundos, un plano o hasta 5 planos, fotogramas inicial/final, sonido y tarifas por segundo std/pro/4k. Es adecuada para especificar fotogramas inicial/final o dividir un concepto de 3–15 segundos en hasta 5 planos breves. La consistencia de personas, el movimiento labial, el texto, el sonido y la unión entre planos aún deben validarse con resultados reales.
¿Qué entradas necesita Kling 3.0 Motion Control? — 1 imagen más 1 vídeo — La facturación usa la duración firmada del vídeo: 20 créditos por segundo en `720p` o 27 en `1080p`, multiplicados por la duración verificada de 3–30 segundos y redondeados hacia arriba. Una duración ausente o inválida bloquea la generación.
Kling 2.6 en Kyeo es un servicio de vídeo con dos flujos: sin imagen llama a texto a vídeo y con imagen llama a imagen única a vídeo. Ambos ofrecen 5/10 segundos y el control `sound`; texto a vídeo añade tres proporciones. Las cuatro combinaciones de cobro son 55, 110, 110 y 220 créditos.
Kling 2.6 Motion Control: una imagen y un vídeo, límites de orientación, 3–30 segundos y tarifas por segundo de 11 créditos en 720p o 18 en 1080p. Sirve para comprobar si la transferencia de movimiento de un solo personaje encaja con tu imagen y vídeo; el cuerpo, el rostro, las manos, la identidad, el fondo, el texto y los movimientos rápidos deben probarse con material propio.
Kling V2.5 Turbo Pro en Kyeo ofrece generación de vídeo a partir de texto e imágenes: sin imagen usa la ruta de texto y, al cargar 1–2 imágenes, cambia a la ruta de imagen con fotogramas inicial y final. Ambas rutas permiten elegir 5 o 10 segundos y consumen 42 u 84 créditos respectivamente.
Kling V2.1 Master es la entrada actual de Kyeo para texto y una sola imagen a vídeo en 1080p. Sin imagen usa el flujo de texto; con 1 imagen JPEG/PNG usa el flujo de imagen. Ambos permiten generar 5 o 10 segundos y cuestan 160 o 320 créditos.
Kling V2.1 Pro es la entrada de Kyeo para imagen a vídeo con fotogramas inicial y final en High Quality (1080p). Exige 1 imagen inicial y permite añadir la imagen 2 para definir el cierre; generar 5 o 10 segundos cuesta 50 o 100 créditos respectivamente.
Kling V2.1 Standard es la entrada actual de Kyeo para vídeo desde una sola imagen en 720p. Exige 1 imagen JPEG/PNG y un prompt, y puede generar 5 o 10 segundos; Kyeo cobra 25 o 50 créditos respectivamente.
Capacidades: La interfaz exige exactamente 1 imagen JPEG o PNG y 1 audio MPEG, WAV, X-WAV, AAC, MP4 u OGG. La imagen admite hasta 10 MB; el audio, hasta 100 MB y 5 minutos. El cargo usa la duración de audio firmada a 16 créditos por segundo y redondea al alza. No se puede enviar una duración ausente, no válida o superior a 5 minutos.
Capacidades: La interfaz exige exactamente 1 imagen JPEG o PNG y 1 audio MPEG, WAV, X-WAV, AAC, MP4 u OGG. La imagen admite hasta 10 MB; el audio, hasta 100 MB y 5 minutos. El cargo usa la duración de audio firmada a 8 créditos por segundo y redondea al alza. No se puede enviar una duración ausente, no válida o superior a 5 minutos.
Infinitalk en Kyeo usa 1 imagen, 1 archivo de audio de hasta 15 segundos y un prompt obligatorio para generar un vídeo de presentación. Puedes elegir 480p o 720p y escribir `seed`; el coste depende de los segundos de audio y la resolución, no es un precio fijo por solicitud.
Runway admite actualmente texto a vídeo y vídeo desde una sola imagen. La generación básica ofrece 720p durante 5 segundos, 720p durante 10 segundos y 1080p durante 5 segundos.
Runway — Runway Aleph admite imagen de referencia — 90 créditos fijos / vez. Sirve para pedir a partir de un vídeo existente que se añadan, eliminen o sustituyan elementos, se cambie la iluminación o se transforme el estilo y el contenido de la imagen. Sirve para pedir a partir de un vídeo existente que se añadan, eliminen o sustituyan elementos, se cambie la iluminación o se transforme el estilo y el contenido de la imagen.
¿Kyeo AI usa ahora Grok Imagine Video 1.5 Preview? Selección de ruta de plataforma — 1–15 segundos; 480p o 720p; hasta 7 imágenes de referencia
Topaz Video Upscaler es el flujo actual de Kyeo para procesar un vídeo con un factor de ampliación. Recibe una URL de vídeo y `1x / 2x / 4x`, usa `2x` por defecto y no admite prompts.
Veo3.1 Quality es la ruta Veo de Kyeo que usa actualmente el identificador del proveedor Veo 3.1 Quality: una solicitud básica de texto o de 1–2 imágenes de primer y último fotograma cuesta 225 créditos fijos; después de un resultado correcto se pueden iniciar Extend, 1080p o 4K con cobro aparte. Quality es el nombre del flujo y no garantiza una calidad fija en cada resultado.
Veo3.1 Fast en Kyeo AI admite texto, fotogramas inicial/final e imágenes de referencia, con 720p/1080p/4K y duraciones de 4/6/8 segundos seleccionables. 30 / 38 / 90 créditos según resolución.
Veo3.1 Lite en Kyeo AI admite texto, fotogramas inicial/final e imágenes de referencia, con 720p/1080p/4K y duraciones de 4/6/8 segundos seleccionables. 15 / 23 / 75 créditos según resolución.
Kling 3.0 Turbo está pensado para generar vídeos cortos de 3–15 segundos. Sin imagen usa el modo texto; al subir una imagen válida cambia a imagen a vídeo. La resolución y la duración determinan directamente la preautorización previa a la creación.
Seedance 2.0 Mini reúne en una sola entrada la generación desde texto, fotogramas inicial/final y referencias multimodales. Los vídeos de referencia forman parte de la fórmula previa a la creación, por lo que su duración y la de salida deben verificarse con datos fiables.
Seedance 2.5 reúne en un único contrato estricto un máximo de 30 segundos, una mayor cantidad de recursos y entradas de referencia orientadas a la edición de vídeo. La duración automática no se calcula como 5 segundos: se preautoriza con el máximo de salida de 30 segundos.
MiniMax H3 ofrece 768P y 2K con generación desde texto, fotogramas inicial/final y referencias de imagen, vídeo y audio. La duración del vídeo de referencia y las imágenes a partir de la 6.ª participan en la preautorización previa a la creación.
HappyHorse 1.1 selecciona el flujo según la cantidad de imágenes: sin imágenes usa texto, con 1 usa la imagen como fotograma inicial y con 2–9 entra en el modo de referencias. Los tres modos comparten resolución, duración y tarifa por segundo.
El flujo principal de OmniHuman 1.5 genera un vídeo a partir de una imagen de una persona, mascota o personaje de animación y una pista de audio. La duración del audio se verifica durante la carga y determina directamente la preautorización previa a la creación.
Video Lip Sync rehace el movimiento de los labios de un vídeo existente para ajustarlo a un audio de voz. El modo ligero está pensado para vídeos frontales de una sola persona; el básico admite escenas individuales más complejas y puede activar la detección de escenas.
Wan 3.0 combina los niveles Standard y Prime con generación por texto, fotograma inicial/final y referencias multimodales firmadas. La reserva multiplica la tarifa de la variante y la resolución por la suma de los segundos verificados del vídeo de entrada y los segundos de salida reservados, y redondea el total una sola vez. La duración inteligente reserva 30 segundos de salida y no está disponible con vídeo de referencia.
Estado actual — Está disponible la generación de una sola toma desde texto, un fotograma inicial o un par inicial y final. La referencia de vídeo, la transformación, las tomas múltiples y los elementos aún no están disponibles.
Seedance 1.0 Pro se relaciona con un flujo anterior de Seedance Pro para crear vídeo desde texto o imágenes. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Seedance 1.0 Pro Fast se relaciona con un flujo anterior de Seedance centrado en crear vídeo rápidamente desde una imagen. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Seedance 1.0 Lite se relaciona con un flujo anterior de Seedance para crear vídeos cortos desde texto o imágenes. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Luma Modify Video se relaciona con edición del contenido y el estilo visual de un vídeo existente mediante instrucciones escritas. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Sora 2 Pro se relaciona con una referencia histórica de Sora 2 Pro para generación de vídeo de nivel superior. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Sora 2 se relaciona con una referencia histórica de Sora 2 para generar vídeo desde texto o imágenes. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Sora Watermark Remover se relaciona con un flujo histórico para limpiar elementos visibles de un vídeo existente. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Gemini Omni Video está pensado para flujos de vídeo que comienzan con texto, una imagen o varias referencias. La generación no está disponible en este sitio, por lo que la página se centra en el estado, los límites y las alternativas utilizables.
La información completa se conserva, pero la generación online no está disponible.
PixVerse V6 está pensado para vídeos cortos que comienzan con texto, una o dos imágenes o varias referencias. La generación no está disponible, por lo que la página presenta el contexto verificado, los límites y las alternativas utilizables.
La información completa se conserva, pero la generación online no está disponible.
Wan 2.6 Flash se relaciona con un flujo de la familia Wan 2.6 orientado a una generación de vídeo más rápida. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Flux 3 pertenece actualmente a la categoría de vídeo del mercado de modelos fuente pública y aparece como Coming Soon. Su ficha solo publica las etiquetas Text to Video e Image to Video. Kyeo no lo ha habilitado y no deduce sus capacidades de interfaz a partir de la familia de imágenes Flux 2.
Wan Animate 2 figura como Coming Soon en el mercado ascendente y solo tiene la etiqueta Video to Video. Su página pública presenta animación de personajes, pero aquí no están habilitados la generación, las cargas, el precio ni los parámetros de API.