OmniHuman 1.5
Der aktuelle Kernpfad von OmniHuman 1.5 erzeugt aus einem Bild einer Person, eines Haustiers oder einer animierten Figur und einem Audio ein gesteuertes Video. Die Audiodauer wird durch eine Upload-Signatur geprüft und bestimmt direkt die Vorautorisierung vor der Erstellung.
Kurz erklärt
Wie ist dieses Modell einzuordnen?
Das Bild darf jedes Seitenverhältnis haben, muss aber dennoch die Prüfung des tatsächlichen Formats und der signierten Abmessungen bestehen. Das Audio muss ein unterstütztes Format haben, höchstens 10 MB groß und kürzer als 60 Sekunden sein. Für den optionalen Prompt gilt der strengere Grenzwert von 300 Zeichen; widersprüchliche, weiter gefasste Angaben werden nicht verwendet.
Wichtige Parameter
Damit kannst du schnell einschätzen, ob dieses Modell zu deinem Anwendungsszenario passt.
Andere Bezeichnungen
Dasselbe Modell kann in verschiedenen Quellen unterschiedlich heißen. Hier sind die Bezeichnungen für Suche und Vergleich zusammengeführt.
Häufige Nutzerfragen
Diese praktischen Fragen betreffen Aufgabe, Eingabebedingungen und Ergebnisanforderungen, die du vor der Auswahl prüfen solltest.
Entscheidungshilfe
Noch unsicher bei der Modellwahl? Prüfe zunächst diese Entscheidungskriterien.
Nutze dieses Modell, wenn das Ausgangsmaterial ein statisches Personen- oder Charakterbild ist, das durch Audio gesteuert werden soll.
Wenn Bewegung und Kamera des Originalvideos erhalten bleiben sollen, vergleiche Video Lip Sync.
Teste Motiverkennung und Lippenbewegung zunächst mit einem kurzen empfohlenen Audio, bevor du längere Inhalte verwendest.
Häufig gesuchte Vergleiche
Vergleiche gängige Alternativen für dieselbe Aufgabe, um Unterschiede bei Eingaben, Steuerung und Kosten zu erkennen.
Modellvergleich
Du bist bei der Wahl unsicher? Die Tabelle zeigt die wichtigsten Unterschiede zwischen diesem Modell und Alternativen auf einen Blick.
Erfahrungen aus der Praxis
Praktische Hinweise auf Grundlage öffentlicher Quellen, aktueller Website-Grenzen und repräsentativer Aufgaben.
Eingeschränkte Verfügbarkeit ist nicht das vollständige Hilfswerkzeug
Vorautorisierung nach Audiosekunden ist überprüfbar
Funktionen im Detail
Steuerung mit Bild und Audio
Zwei Ausgabeauflösungen
Schnellmodus
Geeignete Aufgaben
Virtueller Erklärer
Dialog einer Anime-Figur
Vermenschlichter Haustierclip
Prompt-Tipps
Motiv klar erkennbar halten
Saubere Sprachaufnahme verwenden
Prompt kurz halten
Warum dieses Modell?
Vor der Nutzung beachten
Einstellbare Parameter
Damit kannst du schnell einschätzen, ob dieses Modell zu deinem Anwendungsszenario passt.
Punkteverbrauch
Die Vorautorisierung wird mit 27 Credits pro geprüfter Audiosekunde berechnet und aufgerundet. Das Audio muss kürzer als 60 Sekunden sein; daher liegt eine zulässige Vorautorisierung unter 1.620 Punkten. Nach Abschluss wird der tatsächliche Verbrauch abgerechnet.
Bevor du Bilder oder Videos in Serie generierst, solltest du dieselben Ausgangsmedien in einem A/B-Test mit dem aktuellen Modell und ähnlichen Alternativen vergleichen. Starte die Serie erst, wenn das Ergebnis passt, um keine Punkte zu verschwenden.
Häufig gestellte Fragen
Ähnliche Modelle
Noch unentschieden? Vergleiche auch diese ähnlichen Modelle.
Kling AI Avatar Standard
Fähigkeitsprofil: Die Oberfläche verlangt genau 1 JPEG- oder PNG-Bild und 1 MPEG-, WAV-, X-WAV-, AAC-, MP4- oder OGG-Audiodatei. Das Bild darf bis zu 10 MB groß sein; Audio bis zu 100 MB und 5 Minuten. Die signierte Audiodauer wird mit 8 Punkten pro Sekunde berechnet und aufgerundet. Eine fehlende, ungültige oder mehr als 5 Minuten lange Dauer kann nicht eingereicht werden.
Infinitalk
Infinitalk erstellt bei Kyeo aus 1 Bild, 1 höchstens 15 Sekunden langen Audiodatei und einem erforderlichen Prompt ein Sprechvideo. 480p oder 720p sowie `seed` sind auswählbar; die Kosten richten sich nach Audiodauer und Auflösung und sind kein fester Einzelpreis.
Volcengine Video Lip Sync
Video Lip Sync erzeugt für ein vorhandenes Video neue Lippenbewegungen anhand eines Zielaudios. Der Leichtmodus ist für frontale Einzelpersonen gedacht, der Basismodus für komplexere Szenen mit einer Person und kann eine Szenenerkennung aktivieren.
Quellen
Die Seite beruht auf Modellinformationen, Funktionsbeschreibungen und den derzeit auf Kyeo AI verfügbaren Einstellungen.
Erfahre mehr über OmniHuman 1.5 mit genau einem Bild und einem Audio, 720P/1080P, Audios unter 60 Sekunden, sekundengenauer Abrechnung und eingeschränktem Umfang. Die Vorautorisierung wird mit 27 Credits pro geprüfter Audiosekunde berechnet und aufgerundet. Das Audio muss kürzer als 60 Sekunden sein; daher liegt eine zulässige Vorautorisierung unter 1.620 Punkten. Nach Abschluss wird der tatsächliche Verbrauch abgerechnet.
Damit werden Eingabemodi, sichtbare Einstellungen, Mediengrenzen und Verfügbarkeit der derzeit angebundenen Version geprüft. Maßgeblich sind die Optionen auf der Seite und im Arbeitsbereich.