Zum Hauptinhalt springen
KI-Videomodell
ByteDance
OmniHuman

OmniHuman 1.5

Der aktuelle Kernpfad von OmniHuman 1.5 erzeugt aus einem Bild einer Person, eines Haustiers oder einer animierten Figur und einem Audio ein gesteuertes Video. Die Audiodauer wird durch eine Upload-Signatur geprüft und bestimmt direkt die Vorautorisierung vor der Erstellung.

Verfügbarkeit
Kernfunktionen eingeschränkt verfügbar
Eingabe
1 Bild + 1 Audio
Ausgabe
720P/1080P
Abrechnung
27 pro Audiosekunde
Eindeutiger Eingabevertrag: ein Bild plus ein Audio
720P/1080P und Schnellmodus
Signierte Audiodauer fließt direkt in die Vorautorisierung ein
Masken-Workflow ist nicht verfügbar und entsprechende Felder werden strikt abgelehnt
In 30 Sekunden erklärt
OmniHuman
27 Punkte pro Audiosekunde
Worin ist es stark?
Ein Kernworkflow für audiogesteuerte Videos aus dem Bild eines einzelnen Motivs.
Für wen eignet es sich?
Geeignet für erklärende Personenclips, Dialoge virtueller Figuren sowie Sprechvideos mit Haustieren oder Anime-Motiven.
Häufig gesucht
OmniHuman 1.5 verwendenWas kostet OmniHuman 1.5?Wie lang darf das Audio für OmniHuman 1.5 sein?

Kurz erklärt

Wie ist dieses Modell einzuordnen?

Das Bild darf jedes Seitenverhältnis haben, muss aber dennoch die Prüfung des tatsächlichen Formats und der signierten Abmessungen bestehen. Das Audio muss ein unterstütztes Format haben, höchstens 10 MB groß und kürzer als 60 Sekunden sein. Für den optionalen Prompt gilt der strengere Grenzwert von 300 Zeichen; widersprüchliche, weiter gefasste Angaben werden nicht verwendet.

Worin ist es stark?
Ein Kernworkflow für audiogesteuerte Videos aus dem Bild eines einzelnen Motivs.
Für wen eignet es sich?
Geeignet für erklärende Personenclips, Dialoge virtueller Figuren sowie Sprechvideos mit Haustieren oder Anime-Motiven.
Warum auf Kyeo AI verwenden?
Kyeo prüft die Bindung von Bild und Audio vor der Abbuchung, autorisiert anhand verlässlicher Audiosekunden vor und schließt die nicht integrierte Maskenfunktion ausdrücklich aus.

Wichtige Parameter

Damit kannst du schnell einschätzen, ob dieses Modell zu deinem Anwendungsszenario passt.

Bildformate
JPEG/PNG/WebP
Audiodauer
Kürzer als 60 Sekunden
Prompt
Optional, höchstens 300 Zeichen
Noch nicht verfügbar
Workflow mit Motivmaske

Andere Bezeichnungen

Dasselbe Modell kann in verschiedenen Quellen unterschiedlich heißen. Hier sind die Bezeichnungen für Suche und Vergleich zusammengeführt.

OmniHuman V1.5
OmniHuman 1.5 sprechendes Bild
OmniHuman 1.5 Audio-zu-Video

Häufige Nutzerfragen

Diese praktischen Fragen betreffen Aufgabe, Eingabebedingungen und Ergebnisanforderungen, die du vor der Auswahl prüfen solltest.

OmniHuman 1.5 verwenden
Was kostet OmniHuman 1.5?
Wie lang darf das Audio für OmniHuman 1.5 sein?
Welche Bilder unterstützt OmniHuman 1.5?
Was ist der Schnellmodus von OmniHuman 1.5?

Entscheidungshilfe

Noch unsicher bei der Modellwahl? Prüfe zunächst diese Entscheidungskriterien.

1
OmniHuman wählen, wenn nur ein Bild vorliegt

Nutze dieses Modell, wenn das Ausgangsmaterial ein statisches Personen- oder Charakterbild ist, das durch Audio gesteuert werden soll.

2
Bei vorhandenem Personenvideo Lippensynchronisation vergleichen

Wenn Bewegung und Kamera des Originalvideos erhalten bleiben sollen, vergleiche Video Lip Sync.

3
Wirkung zuerst mit kurzem Audio prüfen

Teste Motiverkennung und Lippenbewegung zunächst mit einem kurzen empfohlenen Audio, bevor du längere Inhalte verwendest.

Häufig gesuchte Vergleiche

Vergleiche gängige Alternativen für dieselbe Aufgabe, um Unterschiede bei Eingaben, Steuerung und Kosten zu erkennen.

Wie unterscheiden sich Eingaben und Abrechnung von OmniHuman 1.5 und Kling AI Avatar?
Für welche Materialien eignen sich OmniHuman 1.5 und ein Video-Lippensynchronisationsmodell?

Modellvergleich

Du bist bei der Wahl unsicher? Die Tabelle zeigt die wichtigsten Unterschiede zwischen diesem Modell und Alternativen auf einen Blick.

Kerneingabe
OmniHuman 1.5
1 Bild + 1 Audio
Kling AI Avatar Standard
1 Bild + 1 Audio
Video Lip Sync
1 Video + 1 Audio

Erfahrungen aus der Praxis

Praktische Hinweise auf Grundlage öffentlicher Quellen, aktueller Website-Grenzen und repräsentativer Aufgaben.

Eingeschränkte Verfügbarkeit ist nicht das vollständige Hilfswerkzeug

Die Kerngenerierung ist aufrufbar, die von Maskenerkennung abhängige Auswahl eines Motivs aus mehreren ist jedoch nicht Teil des Kyeo-Laufzeitvertrags.

Vorautorisierung nach Audiosekunden ist überprüfbar

Die verlässliche Dauer steht vor der Auftragserstellung fest; deshalb muss weder mit einer Schätzdauer noch mit einem Pauschalpreis gerechnet werden.

Funktionen im Detail

Steuerung mit Bild und Audio

Erzeugt aus einem Bild und einer Stimme ein Video mit sprechendem Motiv.

Zwei Ausgabeauflösungen

720P oder 1080P können gewählt werden.

Schnellmodus

Erlaubt eine schnellere Verarbeitungsrichtung mit einem möglichen Qualitätskompromiss.

Geeignete Aufgaben

Virtueller Erklärer

Erstelle mit einem frontal aufgenommenen Charakterbild und klarer Stimme einen kurzen Erklärclip.

Dialog einer Anime-Figur

Lass eine Anime-Figur anhand eines Bildes und eines Dialogaudios sprechen.

Vermenschlichter Haustierclip

Probiere mit einem Haustierfoto und kurzem Audio einen vermenschlichten Ausdruck aus.

Prompt-Tipps

Motiv klar erkennbar halten

Wähle ein Bild mit deutlich sichtbarem, wenig verdecktem Motiv und erkennbarem Gesicht oder Kopf.

Saubere Sprachaufnahme verwenden

Reduziere Hintergrundmusik und Rauschen, damit Lippenbewegung und Rhythmus besser ausgerichtet werden können.

Prompt kurz halten

Nutze höchstens 300 Zeichen und konzentriere dich auf Ausdruck, Bewegungsstärke und Kamerastil.

Warum dieses Modell?

Einfache, eindeutige Eingabe aus Bild und Audio.
Die Audiodauer ermöglicht eine genaue Berechnung vor der Erstellung.
Unterstützt mehrere Motivarten und beliebige Bildseitenverhältnisse.
Klare Grenze für die nicht verfügbare Maskenfunktion.

Vor der Nutzung beachten

Masken oder die Auswahl eines Motivs aus mehreren sind aktuell nicht verfügbar.
Es können nur ein Bild und ein Audio eingereicht werden.
Das Audio muss kürzer als 60 Sekunden sein.
Für den Prompt gilt das strikte Limit von 300 Zeichen.

Einstellbare Parameter

Damit kannst du schnell einschätzen, ob dieses Modell zu deinem Anwendungsszenario passt.

Ausgabeauflösung
output_resolution
Optional
Parametertyp: Auswahl
Standard: 1080P
720P
1080P
Schnellmodus
pe_fast_mode
Optional
Parametertyp: Schalter
Standard: Aus
Aus
Ein
Zufallsseed
seed
Optional
Parametertyp: Ganzzahl
Standard: -1 (zufällig)

Punkteverbrauch

27 Punkte pro Audiosekunde

Die Vorautorisierung wird mit 27 Credits pro geprüfter Audiosekunde berechnet und aufgerundet. Das Audio muss kürzer als 60 Sekunden sein; daher liegt eine zulässige Vorautorisierung unter 1.620 Punkten. Nach Abschluss wird der tatsächliche Verbrauch abgerechnet.

Tipp zum Punktesparen

Bevor du Bilder oder Videos in Serie generierst, solltest du dieselben Ausgangsmedien in einem A/B-Test mit dem aktuellen Modell und ähnlichen Alternativen vergleichen. Starte die Serie erst, wenn das Ergebnis passt, um keine Punkte zu verschwenden.

Häufig gestellte Fragen

Ähnliche Modelle

Noch unentschieden? Vergleiche auch diese ähnlichen Modelle.

Kling AI Avatar Standard

Fähigkeitsprofil: Die Oberfläche verlangt genau 1 JPEG- oder PNG-Bild und 1 MPEG-, WAV-, X-WAV-, AAC-, MP4- oder OGG-Audiodatei. Das Bild darf bis zu 10 MB groß sein; Audio bis zu 100 MB und 5 Minuten. Die signierte Audiodauer wird mit 8 Punkten pro Sekunde berechnet und aufgerundet. Eine fehlende, ungültige oder mehr als 5 Minuten lange Dauer kann nicht eingereicht werden.

KI-Videomodell
8 Punkte / Audiosekunde

Infinitalk

Infinitalk erstellt bei Kyeo aus 1 Bild, 1 höchstens 15 Sekunden langen Audiodatei und einem erforderlichen Prompt ein Sprechvideo. 480p oder 720p sowie `seed` sind auswählbar; die Kosten richten sich nach Audiodauer und Auflösung und sind kein fester Einzelpreis.

KI-Videomodell
480p: 3 Punkte pro Sekunde; 720p: 12 Punkte pro Sekunde

Volcengine Video Lip Sync

Video Lip Sync erzeugt für ein vorhandenes Video neue Lippenbewegungen anhand eines Zielaudios. Der Leichtmodus ist für frontale Einzelpersonen gedacht, der Basismodus für komplexere Szenen mit einer Person und kann eine Szenenerkennung aktivieren.

KI-Videomodell
8 Punkte pro Audiosekunde

Quellen

Die Seite beruht auf Modellinformationen, Funktionsbeschreibungen und den derzeit auf Kyeo AI verfügbaren Einstellungen.

Hinweis zu den Quellen

Erfahre mehr über OmniHuman 1.5 mit genau einem Bild und einem Audio, 720P/1080P, Audios unter 60 Sekunden, sekundengenauer Abrechnung und eingeschränktem Umfang. Die Vorautorisierung wird mit 27 Credits pro geprüfter Audiosekunde berechnet und aufgerundet. Das Audio muss kürzer als 60 Sekunden sein; daher liegt eine zulässige Vorautorisierung unter 1.620 Punkten. Nach Abschluss wird der tatsächliche Verbrauch abgerechnet.

Zuletzt geprüft: 2026-08-28
Aktuelle Schnittstellenangaben zu OmniHuman V1.5
Plattform

Damit werden Eingabemodi, sichtbare Einstellungen, Mediengrenzen und Verfügbarkeit der derzeit angebundenen Version geprüft. Maßgeblich sind die Optionen auf der Seite und im Arbeitsbereich.