Modelos de audio con IA
Prueba modelos de voz, texto a voz y generación de efectos de sonido · 6 modelos disponibles · 4 modelos disponibles solo como referencia
Compara modelos para texto a voz, locución, diálogos con varias voces, borradores musicales y efectos de sonido.
Suno Music es la entrada de Kyeo AI para generar música a partir de texto. El formulario actual solo ofrece el prompt, la versión y el selector de música instrumental. Tras una generación correcta, los resultados que cumplan los requisitos se pueden extender, convertir a WAV o separar en pistas vocales. La página no incluye controles del producto oficial como letra, título, peso del estilo, Persona, Voices, Custom Models o My Taste.
Suno Sounds es la entrada de Kyeo AI para generar sonidos a partir de texto. Permite elegir V5 o V5.5, orientar el resultado a una sola reproducción o a un bucle y, de forma opcional, establecer un BPM entre 1 y 300 y una tonalidad. Las funciones Beta, la cantidad de muestras y los derechos de suscripción del producto oficial no se trasladan automáticamente a los resultados de la plataforma.
Suno Lyrics es la entrada de Kyeo AI para generar letras a partir de texto. Introduce un tema o unos requisitos de hasta 200 caracteres y, cuando termine la tarea, consulta los títulos y las letras que se hayan procesado.
ElevenLabs Dialogue V3 genera actualmente diálogos línea por línea: en cada línea se escribe el texto y se elige una voz, y Kyeo AI factura según el total de caracteres del diálogo. No es un agente de voz en tiempo real; la información oficial también advierte que puede ser necesario generar varias veces para encontrar un resultado útil. Recomendamos empezar con una muestra para comprobar los cambios de personaje, las etiquetas de emoción, el código de idioma, el formato de salida y la integridad de guiones largos.
ElevenLabs Turbo 2.5 es el flujo de texto a voz individual que Kyeo mantiene actualmente. Permite elegir una voz de la plataforma y ajustar stability, similarity_boost, style, speed, timestamps, el contexto anterior y posterior y language_code. Todavía se pueden enviar tareas, pero ElevenLabs recomienda sustituirlo por Flash v2.5. La página no presenta la baja latencia, la compatibilidad de idiomas, la precisión de las marcas de tiempo, la autorización de las voces ni la calidad de salida como garantías de Kyeo.
ElevenLabs Multilingual V2 es la página integrada actualmente en Kyeo AI para doblaje individual de alta naturalidad. Comparte un formulario similar con Turbo 2.5, pero los límites reales de las tareas son distintos: Turbo funciona como referencia para doblaje rápido, mientras que Multilingual V2 se orienta más a narraciones largas, contenido en varios idiomas y una voz de marca estable. En la plataforma también usa una lista fija de voces y un límite de 5.000 caracteres, pero la decisión se centra en la estabilidad percibida y en si compensa pagar el doble por carácter, no solo en la velocidad.
ElevenLabs Sound Effect V2 puede crear efectos de sonido a partir de texto, pero ahora no está disponible en Kyeo AI. Esta ficha no permite iniciar una generación, no crea tareas y no descuenta créditos.
La información completa se conserva, pero la generación online no está disponible.
ElevenLabs Audio Isolation se relaciona con limpieza de audio que separa la voz del ruido de fondo. La generación está cerrada, por lo que no se crean tareas ni cargos de créditos. Aquí encontrarás contexto verificado y alternativas activas.
La información completa se conserva, pero la generación online no está disponible.
Gemini 3.1 Flash TTS tiene funciones confirmadas para diálogos con varios hablantes y control de voz, pero el consumo máximo de audio no puede demostrarse antes de crear una tarea; por ahora solo se mantiene su ficha informativa.
La información completa se conserva, pero la generación online no está disponible.
Gemini 2.5 Pro TTS está orientado a diseñar voces de varios personajes con mayor detalle. Como todavía falta un límite demostrable del audio de salida, solo se publica una ficha informativa con alternativas disponibles.
La información completa se conserva, pero la generación online no está disponible.