Zum Hauptinhalt springen

KI-Audiomodelle

Probiere verbreitete Modelle für KI-Voiceover, Text-zu-Sprache und Klangeffekte online aus · Derzeit 6 Modelle verfügbar · 4 Modelle dienen nur zur Information

Vergleiche Modelle für Text-to-Speech, Voiceover, Dialoge mit mehreren Stimmen, Musikentwürfe und Soundeffekte.

Suno Music ist auf Kyeo AI der Einstieg in die Musikgenerierung aus Text. Das aktuelle Formular bietet nur einen Prompt, die Versionsauswahl und den Instrumental-Schalter. Nach einer erfolgreichen Generierung lassen sich geeignete Ergebnisse verlängern, in WAV umwandeln oder in Gesang und Begleitung trennen. Bedienelemente des offiziellen Suno-Produkts für Lyrics, Titel, Stilgewichtung, Persona, Voices, Custom Models oder My Taste sind auf dieser Seite nicht verfügbar.

Text zu Audio

Suno Sounds ist auf Kyeo AI der Einstieg in die Soundgenerierung aus Text. Zur Auswahl stehen V5 oder V5.5, eine Ausrichtung auf One-Shot oder Loop sowie optional 1–300 BPM und eine Tonart. Beta-Funktionen, die Anzahl der Samples und Abonnementrechte des offiziellen Produkts lassen sich nicht automatisch auf die Ergebnisse auf Kyeo AI übertragen.

Text zu Audio

Suno Lyrics ist auf Kyeo AI der Einstieg in die Lyrics-Generierung aus Text. Gib ein Thema oder Anforderungen mit höchstens 200 Zeichen ein und sieh dir nach Abschluss des Auftrags die erkannten Titel- und Lyrics-Texte an.

Songtext schreiben
Songtextentwurf

ElevenLabs Dialogue V3 erzeugt derzeit zeilenbasierte Dialoge: Für jede Zeile werden Text und Stimme festgelegt, Kyeo AI rechnet nach der Gesamtzahl der Dialogzeichen ab. Es ist kein Echtzeit-Sprachagent. ElevenLabs weist außerdem darauf hin, dass mehrere Generierungen nötig sein können, um ein brauchbares Ergebnis auszuwählen. Prüfe zunächst mit einer Probe Rollenwechsel, Emotions-Tags, Sprachcode, Ausgabeformat und die Vollständigkeit längerer Skripte.

Dialog zu Audio

ElevenLabs Turbo 2.5 ist der derzeit auf Kyeo AI beibehaltene Text-zu-Sprache-Workflow für eine einzelne Stimme. Du kannst eine verfügbare Stimme wählen und stability, similarity_boost, style, speed, timestamps, vorherigen und nachfolgenden Kontext sowie language_code einstellen. Aufträge lassen sich weiterhin absenden, doch ElevenLabs empfiehlt inzwischen Flash v2.5 als Ersatz. Niedrige Latenz, Sprachunterstützung, Zeitstempelgenauigkeit, Stimmrechte und Ausgabequalität werden auf dieser Seite nicht von Kyeo AI garantiert.

Text zu Sprache

ElevenLabs Multilingual V2 ist auf Kyeo AI der aktuell angebundene Workflow für besonders natürliches Voiceover mit einer Stimme. Das Frontend ähnelt Turbo 2.5, die Aufgaben unterscheiden sich jedoch: Turbo dient eher als schnelle TTS-Basis, Multilingual V2 eher als Hauptmodell für lange Erzähltexte, sprachübergreifende Inhalte und eine langfristig einheitliche Markenstimme. Auch hier gibt es nur eine feste Stimmenliste und 5.000 Zeichen. Entscheidend sind jedoch die hörbare Konsistenz und die Frage, ob sie den doppelten Zeichenpreis rechtfertigt.

Text zu Sprache
Derzeit nicht verfügbar

Die offizielle Schnittstelle von ElevenLabs Sound Effect V2 kann anhand von Textbeschreibungen Soundeffekte erzeugen. Die aktuelle Laufzeit von Kyeo AI deaktiviert dieses Modell; die Seite bietet keinen Generierungszugang, erstellt keine Aufträge und zieht keine Punkte ab.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Audio
Derzeit nicht verfügbar

ElevenLabs Audio Isolation steht für Audiobereinigung, die Sprache von Hintergrundgeräuschen trennt. Die Generierung ist geschlossen; es entstehen weder Auftrag noch Punkteabbuchung. Die Seite bietet geprüften Kontext und verweist auf aktive Alternativen.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Aufnahme bereinigen
Stimme isolieren
Derzeit nicht verfügbar

Für Gemini 3.1 Flash TTS ist der Vertrag für Dialoge mit mehreren Sprechern und die Stimmsteuerung bestätigt. Da sich der schlimmste Audioverbrauch vor der Auftragserstellung nicht nachweisen lässt, bleibt derzeit nur diese indexierbare Detailseite verfügbar.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Sprache
dialogue-to-speech
Derzeit nicht verfügbar

Gemini 2.5 Pro TTS ist für detaillierteres Stimmendesign mit mehreren Rollen ausgelegt. Da die Obergrenze des ausgegebenen Audioverbrauchs fehlt, werden derzeit nur indexierbare Vertragsinformationen und alternative Wege veröffentlicht.

Die vollständigen Modellinformationen bleiben verfügbar; eine Online-Generierung wird derzeit nicht unterstützt.

Text zu Sprache
dialogue-to-speech