Zum Hauptinhalt springen

KI-Videomodelle

Vergleiche verbreitete KI-Videomodelle wie Sora 2, Kling, Veo 3.1 und Hailuo · Derzeit 39 Modelle verfügbar · 10 Modelle dienen nur zur Information

Vergleiche Text-zu-Video- und Bild-zu-Video-Modelle für Clips, Kamerasteuerung, Start- und Endbilder und weitere Videoaufgaben.

Seedance 2.0 / Funktion — text akzeptiert keine Assets; frames verlangt ein Startbild und optional ein Endbild; reference verlangt einen Prompt und mindestens eine Bild-, Video- oder Audioreferenz. Multimodale Referenzen dürfen nicht zugleich mit Start-/Endbild-Feldern gesendet werden. Seedance 2.0 unterstützt drei sich gegenseitig ausschließende Szenen: Text, Frames und multimodale Referenz. Aktuell aufrufbar sind 720p, 1080p und 4K mit 4–15 Sekunden; Anfragen mit Referenzvideo sind nur bei 1080p oder 4K verfügbar, da nur diese Kombinationen aktuell bepreist sind. 164–3.840 Credits pro Anfrage

Text zu Video
Bild zu Video
Referenz zu Video

Seedance 2.0 Fast / Funktion — text akzeptiert keine Assets; frames verlangt ein Startbild und optional ein Endbild; reference verlangt einen Prompt und mindestens eine Bild-, Video- oder Audioreferenz. Multimodale Referenzen dürfen nicht zugleich mit Start-/Endbild-Feldern gesendet werden. 480p/720p · 4–15 · 47–450 Punkte / Anfrage.

Text zu Video
Bild zu Video
Referenz zu Video

Seedance 1.5 Pro / Funktion — Kyeos Seedance 1.5 Pro unterstützt reinen Text oder bis zu 2 Bilder und bietet 480p/720p/1080p, 4–12 Sekunden, Audiogenerierung, 6 Seitenverhältnisse und gesperrte Kamera. 7–180 Punkte ergeben sich aus der Parameterkombination; der Name Pro und höhere Punkte belegen weder geprüfte Bildqualität noch Stabilität oder Veröffentlichungsfähigkeit.

Text zu Video
Bild zu Video

HappyHorse 1.0 / Fähigkeiten — Die derzeit verfügbaren Workflows umfassen Videos nur aus einem Prompt, Videos aus einem Bild und Referenzvideos mit 2 bis 9 Bildern. Das Bearbeiten eines vorhandenen Videos ist auf dieser Seite derzeit nicht verfügbar.

Text zu Video
Bild zu Video
Referenz zu Video

Wan 2.7 verbindet Text-zu-Video, Bild-zu-Video mit Startbild oder Start- und Endbild sowie Videobearbeitung. Bei 720p und 1080p sollten Medien, Dauer, Format und geschätzte Credits gemeinsam verglichen werden.

Text zu Video
Bild zu Video
Video zu Video
70-315

Ohne Medien wird Text-zu-Video gewählt, genau ein Bild wählt Bild-zu-Video und ein bis drei Videos wählen Videobearbeitung; Bilder und Videos dürfen nicht gemischt werden. Standard sind 1080p, 5 Sekunden, Aufnahmestruktur Aus und Inhaltsfilter Ein.

Text zu Video
Bild zu Video
Video zu Video

Erfahre, wie Wan 2.5 Video in Kyeo AI Text- und Einzelbild-Video verarbeitet, welche 5-/10-Sekunden- und 720p-/1080p-Optionen gelten, wie sich Prompts unterscheiden und wie 60–200 Punkte abgerechnet werden. Kyeo rechnet genau nach Auflösung und Dauer ab: 720p/5 Sekunden 60 Punkte, 720p/10 Sekunden 120 Punkte, 1080p/5 Sekunden 100 Punkte und 1080p/10 Sekunden 200 Punkte; standardmäßig kosten 720p/5 Sekunden 60 Punkte. Wie berechnen sich die 60/100/120/200 Punkte von Wan 2.5? — Erfahre, wie Wan 2.5 Video in Kyeo AI Text- und Einzelbild-Video verarbeitet, welche 5-/10-Sekunden- und 720p-/1080p-Optionen gelten, wie sich Prompts unterscheiden und wie 60–200 Punkte abgerechnet werden.

Text zu Video
Bild zu Video

Wan 2.2 A14B Turbo ist in Kyeo kein einzelner Workflow: Ohne Assets wird Text generiert, mit einem Bild Bild-zu-Video verwendet, und erst ein Bild plus Audio aktiviert die Sprachroute. Auflösung, Punkte und sichtbare Steuerungen unterscheiden sich je Workflow; vor der Auswahl die Asset-Kombination prüfen.

Text zu Video
Bild zu Video
Bild mit Sprache zu Video

Wan 2.2 Animate Replace ersetzt eine Rolle anhand eines in der Workbench hochgeladenen Quellvideos und Ersatzbildes und bietet 480p, 580p oder 720p. Die Abrechnung verwendet verifizierte Quellvideosekunden; beliebige Medien-URLs können nicht direkt eingegeben werden.

Videomotiv ersetzen
Ursprüngliche Bewegung beibehalten

Kyeo bietet sechs gültige Kombinationen: Standard 768P mit 6/10 Sekunden und 1080P mit 6 Sekunden kostet 25/40/40 Punkte; Pro kostet entsprechend 40/80/70 Punkte. 1080P unterstützt keine 10 Sekunden. 1 JPG/PNG/WebP-Datei erforderlich, höchstens 10 MB.

Bild zu Video

Hailuo Pro / Fähigkeiten — Diese Seite stützt sich auf offizielle MiniMax-Materialien zu Hailuo 02 und den aktuell verifizierten Produktvertrag der Website. Sie beschreibt nur die freigegebenen Text- und Bild-Workflows, überprüfbare Grenzen und Punktepreise. Kyeo bietet nur eine Pro-Kombination: Text- und Bildanfragen sind fest auf 1080P und 6 Sekunden eingestellt und kosten jeweils 57 Punkte; ein Endbild kostet keinen Aufpreis.

Text zu Video
Bild zu Video

Hailuo Standard verbindet Text-zu-Video mit der Animation eines Startbilds und einem optionalen Endbild. Fünf bepreiste Kombinationen reichen von 12 bis 50 Punkten.

Text zu Video
Bild zu Video
42-405

Prüfe Kling 3.0 Video in Kyeo AI mit 3–15 Sekunden, Einzelaufnahme und bis zu 5 Mehrfachaufnahmen, Start-/Endbildern, Ton und std/pro/4k-Raten pro Sekunde. Geeignet für festgelegte Start-/Endbilder oder um ein 3–15-Sekunden-Konzept in bis zu 5 kurze Aufnahmen zu teilen. Personenidentität, Lippenbewegung, Text, Ton und Aufnahmeübergänge müssen anhand echter Ergebnisse abgenommen werden.

Text zu Video
Bild zu Video

Welche Eingaben braucht Kling 3.0 Motion Control? — 1 Bild plus 1 Video — Abgerechnet wird die signierte Videodauer: 20 Punkte 1080p Sekunde für `720p` oder 27 für `1080p`, multipliziert mit geprüften 3–30 Sekunden und aufgerundet. Fehlende oder ungültige Dauer lehnt die Generierung ab.

Bewegungsvideo als Referenz
Hintergrundquelle wählbar
55-220

Kling 2.6 ist in Kyeo ein Videodienst mit zwei Workflows: Ohne Bild wird Text-zu-Video, mit Bild Einzelbild-zu-Video aufgerufen. Beide bieten 5/10 Sekunden und den `sound`-Umschalter; Text-zu-Video bietet zusätzlich drei Seitenverhältnisse. Die vier Abrechnungskombinationen sind 55, 110, 110 und 220 Punkte.

Text zu Video
Bild zu Video

Kling 2.6 Motion Control mit einem Bild und Video, Ausrichtungsgrenzen, 3–30 Sekunden sowie 11 Punkten/Sekunde bei 720p oder 18 bei 1080p. Geeignet, um zu prüfen, ob die Bewegungsübertragung einer einzelnen Figur zu eigenen Bildern und Videos passt; Körper, Gesicht, Hände, Identität, Hintergrund, Text und schnelle Bewegungen mit eigenen Materialien testen.

Bewegungsvideo als Referenz
Figur animieren

Kling V2.5 Turbo Pro bietet in Kyeo Text- und Bild-zu-Video: Ohne Bild läuft die Textroute, mit 1–2 Bildern wechselt es zur Bildroute mit Start-/Endbild. Beide Routen bieten 5 oder 10 Sekunden und kosten jeweils 42 oder 84 Punkte.

Text zu Video
Bild zu Video

Kling V2.1 Master ist Kyeos aktueller 1080p-Einstieg für Text- und Einzelbild-Video. Ohne Bild läuft der Textworkflow, mit 1 JPEG/PNG-Bild der Bildworkflow; beide Routen kosten für 5 oder 10 Sekunden jeweils 160 oder 320 Punkte.

Text zu Video
Bild zu Video

Kling V2.1 Pro ist Kyeos High-Quality-Einstieg (1080p) für Bild-zu-Video mit Start- und Endbild. Ein Startbild ist erforderlich, ein zweites Bild kann das Ende festlegen; 5 Sekunden kosten 50 und 10 Sekunden 100 Punkte.

Bild zu Video

Kling V2.1 Standard ist Kyeos aktueller 720p-Einstieg für Einzelbild-Video. Er verlangt 1 JPEG/PNG-Bild und einen Prompt, erzeugt 5- oder 10-Sekunden-Videos und berechnet dafür 25 bzw. 50 Punkte.

Bild zu Video

Funktionsprofil: Die Oberfläche verlangt genau 1 JPEG- oder PNG-Bild und 1 MPEG-, WAV-, X-WAV-, AAC-, MP4- oder OGG-Audiodatei. Das Bild darf bis zu 10 MB groß sein; Audio bis zu 100 MB und 5 Minuten. Die signierte Audiodauer wird mit 16 Punkten pro Sekunde berechnet und aufgerundet. Eine fehlende, ungültige oder mehr als 5 Minuten lange Dauer kann nicht eingereicht werden.

Digitaler Sprecher
Bild sprechen lassen

Fähigkeitsprofil: Die Oberfläche verlangt genau 1 JPEG- oder PNG-Bild und 1 MPEG-, WAV-, X-WAV-, AAC-, MP4- oder OGG-Audiodatei. Das Bild darf bis zu 10 MB groß sein; Audio bis zu 100 MB und 5 Minuten. Die signierte Audiodauer wird mit 8 Punkten pro Sekunde berechnet und aufgerundet. Eine fehlende, ungültige oder mehr als 5 Minuten lange Dauer kann nicht eingereicht werden.

Digitaler Sprecher
Bild sprechen lassen

Infinitalk erstellt bei Kyeo aus 1 Bild, 1 höchstens 15 Sekunden langen Audiodatei und einem erforderlichen Prompt ein Sprechvideo. 480p oder 720p sowie `seed` sind auswählbar; die Kosten richten sich nach Audiodauer und Auflösung und sind kein fester Einzelpreis.

Digitaler Sprecher
Bild sprechen lassen
12-30

Runway unterstützt derzeit Text-zu-Video und Video aus einem einzelnen Startbild. Verfügbar sind 720p für 5 Sekunden, 720p für 10 Sekunden und 1080p für 5 Sekunden.

Text zu Video
Bild zu Video

Runway — Unterstützt Runway Aleph Referenzbilder — Feste 90 Punkte pro Anfrage. Geeignet für Anweisungen zum Hinzufügen, Entfernen, Ersetzen, Neubeleuchten, Ändern des Stils oder Verändern von Bildinhalten in einem vorhandenen Video. Geeignet für Anweisungen zum Hinzufügen, Entfernen, Ersetzen, Neubeleuchten, Ändern des Stils oder Verändern von Bildinhalten in einem vorhandenen Video.

Videostil ändern
Ursprüngliche Bewegung beibehalten

Nutzt Kyeo AI aktuell Grok Imagine Video 1.5 Preview? Auswahl der Plattformroute — 1–15 Sekunden; 480p oder 720p; bis zu 7 Referenzbilder

Text zu Video
Bild zu Video

Topaz Video Upscaler ist bei Kyeo ein Workflow zur Verarbeitung eines einzelnen Videos mit einem Faktor. Er nimmt eine Video-URL und `1x / 2x / 4x` an, verwendet standardmäßig `2x` und akzeptiert keinen Prompt.

Video schärfen
Auflösung erhöhen

Veo3.1 Quality ist die bei Kyeo aktuell unter der öffentliche Quelle-Kennung Veo 3.1 Quality verwendete Veo-Route. Eine reine Texteingabe oder 1–2 Start-/Endframe-Bilder kostet in der Basisanfrage feste 225 Punkte; nach Erfolg können Extend, 1080p oder 4K separat gestartet werden. „Quality“ ist ein Workflowname und garantiert keine feste Ausgabequalität.

Text zu Video
Bild zu Video

Veo3.1 Fast auf Kyeo AI unterstützt Text, Start-/Endbilder und Referenzbilder mit direkter Wahl von 720p/1080p/4K sowie 4/6/8 Sekunden. 30 / 38 / 90 Credits je Auflösung.

Text zu Video
Bild zu Video
Referenz zu Video

Veo3.1 Lite auf Kyeo AI unterstützt Text, Start-/Endbilder und Referenzbilder mit direkter Wahl von 720p/1080p/4K sowie 4/6/8 Sekunden. 15 / 23 / 75 Credits je Auflösung.

Text zu Video
Bild zu Video
Referenz zu Video

Kling 3.0 Turbo ist für kurze Videos von 3–15 Sekunden ausgelegt: Ohne Bild wird der Textmodus verwendet, nach dem Upload eines zulässigen Bildes der Bild-zu-Video-Modus. Auflösung und Dauer bestimmen direkt die Vorautorisierung vor der Erstellung.

Text zu Video
Bild zu Video

Seedance 2.0 Mini deckt in einem Zugang Text, Start-/Endbilder und multimodale Referenzgenerierung ab. Referenzvideos fließen in die Preisformel vor der Erstellung ein, daher müssen sowohl Mediendauer als auch Ausgabedauer vorher verlässlich geprüft werden.

Text zu Video
Bild zu Video
Referenz zu Video
102-4110

Seedance 2.5 vereint eine Grenze von 30 Sekunden, hohe Materiallimits und videoähnliche Bearbeitungsreferenzen in einem strikten Szenenvertrag. Die automatische Dauer wird nicht anhand der standardmäßigen 5 Sekunden unterschätzt, sondern mit dem Maximum von 30 Sekunden vorautorisiert.

Text zu Video
Bild zu Video
Referenz zu Video
Video zu Video

MiniMax H3 bietet 768P und 2K sowie Text-, Start-/Endbild- und Bild-/Video-/Audio-Referenzen. Die Dauer von Referenzvideos und die Anzahl der Bilder ab dem 6. Bild fließen in die Vorautorisierung vor der Erstellung ein.

Text zu Video
Bild zu Video
Referenz zu Video

HappyHorse 1.1 wählt den Workflow automatisch anhand der Bildanzahl: ohne Bild den Textmodus, mit 1 Bild Startbild-zu-Video und mit 2–9 Bildern den Referenzmodus. Alle drei Modi verwenden dieselben Auflösungen, Dauern und Sekundentarife.

Text zu Video
Bild zu Video
Referenz zu Video

Der aktuelle Kernpfad von OmniHuman 1.5 erzeugt aus einem Bild einer Person, eines Haustiers oder einer animierten Figur und einem Audio ein gesteuertes Video. Die Audiodauer wird durch eine Upload-Signatur geprüft und bestimmt direkt die Vorautorisierung vor der Erstellung.

image-audio-to-video

Video Lip Sync erzeugt für ein vorhandenes Video neue Lippenbewegungen anhand eines Zielaudios. Der Leichtmodus ist für frontale Einzelpersonen gedacht, der Basismodus für komplexere Szenen mit einer Person und kann eine Szenenerkennung aktivieren.

video-audio-to-video

Wan 3.0 verbindet Standard- und Prime-Stufen mit Text-, Start-/Endbild- und signierter multimodaler Referenzgenerierung. Die Reservierung entspricht dem Tarif für Variante und Auflösung multipliziert mit der Summe aus verifizierten Eingabevideosekunden und reservierten Ausgabesekunden; die Gesamtsumme wird einmal aufgerundet. Die intelligente Dauer reserviert 30 Ausgabesekunden und ist mit Referenzvideos nicht verfügbar.

Text zu Video
Bild zu Video
Referenz zu Video
Video zu Video

Aktueller Status — Verfügbar ist die überprüfbare Einzelshot-Erzeugung aus Text oder aus einem Startbild beziehungsweise Start- und Endbild. Videoreferenz, Transformation, Mehrfachshots und Elemente bleiben geschlossen, weil diese Vertragszweige weiterhin mehrdeutig sind.

Text zu Video
Bild zu Video
Derzeit nicht verfügbar

Seedance 1.0 Pro steht für einen früheren Seedance-Pro-Workflow für Videos aus Text oder Bildern. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Video
Bild zu Video
Derzeit nicht verfügbar

Seedance 1.0 Pro Fast steht für einen früheren Seedance-Workflow für schnelle Videos aus einem Bild. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Bild zu Video
Derzeit nicht verfügbar

Seedance 1.0 Lite steht für einen früheren Seedance-Workflow für kurze Videos aus Text oder Bildern. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Video
Bild zu Video
Derzeit nicht verfügbar

Luma Modify Video steht für die Bearbeitung von Inhalt und Bildstil eines vorhandenen Videos anhand schriftlicher Anweisungen. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Videostil ändern
Vorhandenes Video bearbeiten
Derzeit nicht verfügbar

Sora 2 Pro steht für eine historische Sora-2-Pro-Referenz für höherwertige Videogenerierung. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Video
Bild zu Video
Derzeit nicht verfügbar

Sora 2 steht für eine historische Sora-2-Referenz für Videos aus Text oder Bildern. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Video
Bild zu Video
Derzeit nicht verfügbar

Sora Watermark Remover steht für einen historischen Workflow zur visuellen Bereinigung vorhandener Videos. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Wasserzeichen entfernen
Sora-Link verarbeiten
Derzeit nicht verfügbar

Gemini Omni Video ist für Videoworkflows gedacht, die mit Text, einem Bild oder mehreren Referenzen beginnen. Da die Generierung auf dieser Website derzeit nicht verfügbar ist, stehen Status, Grenzen und nutzbare Alternativen im Mittelpunkt.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Derzeit nicht verfügbar

PixVerse V6 ist für kurze Videoworkflows aus Text, ein bis zwei Bildern oder mehreren Referenzen gedacht. Da die Generierung derzeit nicht verfügbar ist, zeigt die Seite bestätigten Hintergrund, Grenzen und nutzbare Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Derzeit nicht verfügbar

Wan 2.6 Flash steht für einen Wan-2.6-Workflow mit Schwerpunkt auf schnellerer Videogenerierung. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Kommt bald

Flux 3 gehört derzeit zur Videokategorie des öffentliche Quelle-Modellmarkts und ist als Coming Soon markiert. Seine Karte veröffentlicht nur Text to Video und Image to Video. Kyeo hat es nicht freigeschaltet und leitet keine Schnittstellenfähigkeiten aus der Flux-2-Bildfamilie ab.

Text zu Video
Bild zu Video
Demnächst verfügbar

Wan Animate 2 ist im vorgelagerten Markt derzeit als Coming Soon mit lediglich Video to Video gekennzeichnet. Die öffentliche Seite zeigt Figurenanimation, doch Erzeugung, Uploads, Preise und API-Parameter sind hier nicht aktiviert.

Video zu Video