Ir al contenido principal
Modelos de audio con IA
Google
Gemini TTS

Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS tiene funciones confirmadas para diálogos con varios hablantes y control de voz, pero el consumo máximo de audio no puede demostrarse antes de crear una tarea; por ahora solo se mantiene su ficha informativa.

No disponible para uso en línea por el momento

Esta página solo permite consultar las capacidades, los casos de uso y la información pública del modelo. No aparecerá en el espacio de trabajo de la página de inicio ni permitirá enviar tareas de generación.

Estado actual
Preautorización bloqueada
Formato de entrada
Hablantes + diálogo ordenado
Límite de uso
Sin tareas ni cargos
No es Coming Soon: las condiciones de preautorización todavía no están completas.
Están confirmados los campos de varios hablantes, orden del diálogo, acento, estilo y ritmo.
No aparece en el selector, no crea tareas y no descuenta créditos.
Resumen en 30 segundos
Gemini TTS
No disponible actualmente
En qué destaca
Candidato de Gemini TTS orientado a generar voz con rapidez y controlar diálogos con varios personajes.
Para quién es
Personas que siguen las tendencias de podcasts, narración y voces de personajes, y quieren preparar guiones de evaluación para cuando se habilite.
Búsquedas populares
Gemini 3.1 Flash TTS está disponibleGemini 3.1 Flash TTS doblaje con varios hablantesprecio de Gemini 3.1 Flash TTS

En pocas palabras

¿Qué ofrece este modelo?

No es un modelo Coming Soon ni ha sido retirado. La limitación procede del margen de seguridad de la preautorización: los conjuntos de hablantes y diálogos no tienen un límite total, y tampoco existe un máximo demostrable que relacione el texto con los tokens de audio de salida. Por ello, el modelo no aparece en el selector y todas las solicitudes se rechazan antes de descontar créditos.

En qué destaca
Candidato de Gemini TTS orientado a generar voz con rapidez y controlar diálogos con varios personajes.
Para quién es
Personas que siguen las tendencias de podcasts, narración y voces de personajes, y quieren preparar guiones de evaluación para cuando se habilite.
Por qué usarlo en Kyeo AI
La página publica primero las capacidades confirmadas y el motivo del bloqueo; no aparecerá en el área de trabajo ni en la API hasta que se cierre el límite de preautorización.

Parámetros principales

Te ayuda a evaluar rápidamente si este modelo encaja con tu caso de uso.

Proveedor
Google
Familia
Gemini TTS
Entrada confirmada
Configuración de hablantes y diálogo ordenado
Texto por intervención
Hasta 10.000 caracteres
Dato pendiente
Límite máximo de tokens de audio de salida

Otros nombres

Un mismo modelo puede aparecer con nombres distintos según la fuente. Aquí los reunimos para facilitar la búsqueda y la comparación.

Gemini Flash TTS
Gemini 3.1 Text to Speech

Preguntas frecuentes de los usuarios

Estas preguntas prácticas se centran en la tarea, las entradas y el resultado que conviene confirmar antes de elegir.

Gemini 3.1 Flash TTS está disponible
Gemini 3.1 Flash TTS doblaje con varios hablantes
precio de Gemini 3.1 Flash TTS
cómo usar Gemini TTS
alternativas a Gemini TTS

Guía de elección

¿Aún no sabes qué modelo usar? Empieza por estos puntos clave.

1
Necesitas ahora un diálogo con varias voces

Utiliza primero ElevenLabs Dialogue V3 y prueba la separación de personajes con un guion breve.

2
Necesitas ahora una voz individual rápida

Compara primero ElevenLabs Turbo 2.5 y Multilingual V2.

3
Quieres preparar una prueba futura

Guarda tres guiones no sensibles: narración, entrevista a dos voces y escena breve con personajes.

Comparaciones frecuentes

Compara alternativas habituales en la misma tarea para aclarar diferencias de entrada, control y coste.

Gemini 3.1 Flash TTS o ElevenLabs Dialogue V3
por qué Gemini 3.1 Flash TTS no genera por ahora
qué controles de voz admite Gemini 3.1 Flash TTS

Tabla comparativa de modelos

¿No sabes cuál elegir? Esta tabla muestra de un vistazo las principales diferencias entre el modelo actual y sus alternativas.

Experiencia de uso real

Orientación práctica basada en fuentes públicas, límites actuales del sitio y tareas representativas.

La baja latencia no sustituye un límite de coste

Aunque el modelo priorice la velocidad, sin un máximo de tokens de audio de salida no se puede garantizar que la preautorización cubra el coste.

Las entradas multihablante amplían el peor caso

Si el tamaño total de los conjuntos no está limitado, 10.000 caracteres por intervención no representan el máximo de toda la solicitud.

Capacidades en detalle

Configuración multihablante

El contrato permite definir un identificador, una voz y un acento para cada hablante.

Diálogo ordenado

Las intervenciones se producen en orden y cada texto queda vinculado a un hablante declarado.

Control de voz

Permite describir la escena, el tono general, el perfil de audio, el estilo y el ritmo.

Para qué sirve

Planificación de podcasts

Prepara un guion separado por papeles para presentador e invitado.

Preparación de escenas con personajes

Organiza el orden del diálogo, las emociones y el ritmo de varios personajes.

Evaluación futura con el mismo guion

Cuando se habilite, compara diferenciación de voces, latencia y créditos reales.

Consejos para prompts

Mantén constantes los identificadores

Cada intervención debe corresponder a un hablante previamente declarado.

Valida primero con un guion breve

Comprueba nombres propios, pausas y separación de personajes antes de ampliar el texto.

No deduzcas la duración de salida

La longitud del texto no demuestra el máximo consumo de tokens de audio.

Por qué elegirlo

Los campos de hablantes, diálogos y control de voz ya están definidos.
Cubre búsquedas tanto de narración individual como de diálogo con varios personajes.
La página informativa y el uso real permanecen estrictamente separados.

Lo que debes saber antes de usarlo

Actualmente no se pueden crear tareas de voz ni descontar créditos.
Aunque cada intervención admite hasta 10.000 caracteres, los conjuntos de hablantes y diálogos no tienen un límite total.
El precio de los tokens de entrada no demuestra el peor coste de los tokens de audio de salida.

No disponible actualmente

Esta página solo permite consultar las capacidades, los casos de uso y la información pública del modelo. No aparecerá en el espacio de trabajo de la página de inicio ni permitirá enviar tareas de generación. Candidato de Gemini TTS orientado a generar voz con rapidez y controlar diálogos con varios personajes.

Esta página no incluye parámetros adicionales para el usuario.

Preguntas frecuentes

Modelos similares

¿Aún no te decides? Compara también estas alternativas similares.

ElevenLabs Dialogue V3

ElevenLabs Dialogue V3 genera actualmente diálogos línea por línea: en cada línea se escribe el texto y se elige una voz, y Kyeo AI factura según el total de caracteres del diálogo. No es un agente de voz en tiempo real; la información oficial también advierte que puede ser necesario generar varias veces para encontrar un resultado útil. Recomendamos empezar con una muestra para comprobar los cambios de personaje, las etiquetas de emoción, el código de idioma, el formato de salida y la integridad de guiones largos.

Modelo de audio con IA
14 créditos / 1000 caracteres

ElevenLabs Turbo 2.5

ElevenLabs Turbo 2.5 es el flujo de texto a voz individual que Kyeo mantiene actualmente. Permite elegir una voz de la plataforma y ajustar stability, similarity_boost, style, speed, timestamps, el contexto anterior y posterior y language_code. Todavía se pueden enviar tareas, pero ElevenLabs recomienda sustituirlo por Flash v2.5. La página no presenta la baja latencia, la compatibilidad de idiomas, la precisión de las marcas de tiempo, la autorización de las voces ni la calidad de salida como garantías de Kyeo.

Modelo de audio con IA
6 créditos / 1000 caracteres

ElevenLabs Multilingual V2

ElevenLabs Multilingual V2 es la página integrada actualmente en Kyeo AI para doblaje individual de alta naturalidad. Comparte un formulario similar con Turbo 2.5, pero los límites reales de las tareas son distintos: Turbo funciona como referencia para doblaje rápido, mientras que Multilingual V2 se orienta más a narraciones largas, contenido en varios idiomas y una voz de marca estable. En la plataforma también usa una lista fija de voces y un límite de 5.000 caracteres, pero la decisión se centra en la estabilidad percibida y en si compensa pagar el doble por carácter, no solo en la velocidad.

Modelo de audio con IA
12 créditos / 1000 caracteres

Fuentes de información

El contenido de esta página reúne documentación del modelo, descripciones de funciones y la configuración disponible actualmente en Kyeo AI.

Nota sobre las fuentes

Se han confirmado los controles de hablantes, diálogos y voz de Gemini 3.1 Flash TTS, así como sus tarifas por token. Sin embargo, no es posible demostrar antes de crear la solicitud el límite máximo de tokens de audio de salida, por lo que la generación permanece desactivada en este sitio.

Última actualización: 2026-08-28
Gemini 3.1 Flash TTS — Generación no disponible temporalmente
Análisis editorial