Ir para o conteúdo principal
Modelo de áudio com IA
Google
Gemini TTS

Gemini 3.1 Flash TTS

O Gemini 3.1 Flash TTS já tem um contrato confirmado para diálogos com vários locutores e controles de voz. Como não é possível demonstrar o consumo máximo possível de áudio antes da criação, esta página permanece indexável, mas a geração está desativada.

Uso online indisponível no momento

Esta página serve apenas para consultar recursos, casos de uso e informações públicas. O modelo não aparece na área de criação da página inicial e não aceita tarefas de geração.

Status atual
Bloqueado na pré-autorização
Formato de entrada
Locutores + diálogos em sequência
Limite operacional
Sem criar tarefa nem descontar créditos
Não é Coming Soon: as condições de pré-autorização ainda estão incompletas.
Já foram confirmados os campos de vários locutores, ordem das falas, sotaque, estilo e ritmo.
O modelo não aparece no seletor, não cria tarefas e não desconta créditos.
Resumo em 30 segundos
Gemini TTS
Indisponível no momento
No que ele se destaca
Candidato da família Gemini TTS voltado à geração rápida de voz e ao controle de diálogos com vários personagens.
Para quem é indicado
Pessoas que acompanham tendências de diálogos para podcasts, locução e vozes de personagens e querem preparar roteiros para avaliações futuras.
Buscas populares
Gemini 3.1 Flash TTS já está disponívelGemini 3.1 Flash TTS para diálogos com várias vozespreço do Gemini 3.1 Flash TTS

Em uma frase

Este modelo vale a pena?

Este caso não é Coming Soon nem descontinuação do modelo. A restrição vem do limite de segurança da pré-autorização: os arrays de locutores e falas não têm um total máximo definido, e não há um pior caso comprovável que relacione o texto aos tokens de áudio na saída. Por isso, o modelo não aparece no seletor e toda solicitação é recusada antes do desconto de créditos.

No que ele se destaca
Candidato da família Gemini TTS voltado à geração rápida de voz e ao controle de diálogos com vários personagens.
Para quem é indicado
Pessoas que acompanham tendências de diálogos para podcasts, locução e vozes de personagens e querem preparar roteiros para avaliações futuras.
Por que usar na Kyeo AI
A página apresenta os recursos confirmados e o motivo do bloqueio; o modelo não entra na área de criação nem na interface de uso antes que o limite de pré-autorização seja comprovado.

Parâmetros principais

Avalie rapidamente se o modelo é adequado para o seu cenário.

Empresa
Google
Família do modelo
Gemini TTS
Entrada confirmada
Configuração de locutores e diálogos em sequência
Texto por trecho
Até 10.000 caracteres
Informação pendente
Limite máximo de tokens de áudio na saída

Outros nomes

O mesmo modelo pode aparecer com nomes diferentes em fontes distintas. Reunimos essas variações para facilitar a busca e a comparação.

Gemini Flash TTS
Gemini 3.1 Text to Speech

Perguntas comuns

Estas perguntas práticas tratam da tarefa, das entradas e do resultado que devem ser confirmados antes da escolha.

Gemini 3.1 Flash TTS já está disponível
Gemini 3.1 Flash TTS para diálogos com várias vozes
preço do Gemini 3.1 Flash TTS
como usar o Gemini TTS
alternativas ao Gemini TTS

Guia de escolha

Confira os principais critérios antes de escolher um modelo.

1
Para gerar diálogos com várias vozes agora

Considere o ElevenLabs Dialogue V3 e use um roteiro curto para verificar se as vozes dos personagens ficam bem diferenciadas.

2
Para gerar rapidamente uma única voz agora

Compare primeiro ElevenLabs Turbo 2.5 e Multilingual V2.

3
Para preparar uma avaliação futura

Separe três roteiros não sensíveis: uma locução, uma entrevista com duas pessoas e uma cena curta com personagens.

Comparações mais buscadas

Compare alternativas comuns na mesma tarefa para esclarecer diferenças de entrada, controle e custo.

Qual escolher: Gemini 3.1 Flash TTS ou ElevenLabs Dialogue V3?
Por que o Gemini 3.1 Flash TTS está indisponível no momento?
Quais controles de voz o Gemini 3.1 Flash TTS aceita?

Tabela comparativa

Compare rapidamente o modelo atual e as alternativas nos critérios mais importantes.

Experiência de uso

Orientação prática baseada em fontes públicas, limites atuais do site e tarefas representativas.

Baixa latência não substitui um limite de custo

Mesmo com foco em velocidade, a ausência de um limite máximo de tokens de áudio impede garantir que a pré-autorização seja suficiente.

Vários personagens ampliam o pior consumo possível

Sem um limite total para os arrays, o teto de 10.000 caracteres por trecho não representa o limite de toda a solicitação.

Recursos em detalhes

Configuração de vários locutores

O contrato exige um identificador, uma voz e um sotaque para cada locutor.

Diálogos em sequência

As falas saem na ordem definida, e cada trecho é associado a um locutor já declarado.

Controles de voz

É possível descrever a cena, o tom geral, o perfil do áudio, o estilo e o ritmo.

Casos de uso

Planejamento de diálogos para podcasts

Prepare um roteiro com papéis separados para apresentador e convidado.

Preparação de cenas curtas com personagens

Planeje a ordem das falas e o ritmo emocional de cada personagem.

Avaliação futura com o mesmo roteiro

Quando o modelo for liberado, compare a distinção das vozes, a latência e o consumo real de créditos.

Dicas de prompt

Use identificadores consistentes para os locutores

Cada fala deve apontar para um locutor já declarado.

Comece por um roteiro curto

Confira nomes próprios, pausas e distinção entre personagens antes de aumentar o texto.

Não estime a duração da saída

O tamanho do texto, por si só, não comprova o limite máximo de tokens de áudio.

Por que escolher

Os campos de locutores, diálogos e controles de voz já estão definidos.
A proposta abrange buscas por locução com uma voz e conversas com vários personagens.
A página informativa permanece rigorosamente separada de qualquer uso do modelo.

O que saber antes de usar

Não é possível criar tarefas de voz nem descontar créditos no momento.
Embora cada trecho aceite até 10.000 caracteres, os arrays de locutores e falas não têm limite total.
O preço dos tokens de entrada não comprova o pior custo dos tokens de áudio na saída.

Indisponível no momento

Esta página serve apenas para consultar recursos, casos de uso e informações públicas. O modelo não aparece na área de criação da página inicial e não aceita tarefas de geração. Candidato da família Gemini TTS voltado à geração rápida de voz e ao controle de diálogos com vários personagens.

Esta página não tem outros parâmetros públicos no momento.

Perguntas frequentes

Modelos semelhantes

Ainda não decidiu? Compare também estas alternativas semelhantes.

ElevenLabs Dialogue V3

ElevenLabs Dialogue V3 gera diálogos linha por linha: você insere a fala e escolhe a voz de cada linha, e a Kyeo AI cobra pelo total de caracteres das falas. Não é um agente de voz em tempo real, e a documentação oficial alerta que várias gerações podem ser necessárias para encontrar um resultado aproveitável. Recomendamos testar antes as trocas de personagem, as marcações de emoção, o código do idioma, o formato de saída e a integridade de roteiros longos.

Modelo de áudio com IA
14 créditos por 1000 caracteres

ElevenLabs Turbo 2.5

ElevenLabs Turbo 2.5 é o fluxo de texto para fala com uma voz que a Kyeo mantém disponível. É possível escolher uma voz da plataforma e ajustar stability, similarity_boost, style, speed, timestamps, contexto anterior e posterior e language_code. O envio continua disponível, mas a ElevenLabs atualmente recomenda substituí-lo pelo Flash v2.5. A página não apresenta baixa latência, idiomas aceitos, precisão dos timestamps, autorização da voz nem qualidade da saída como garantias da Kyeo.

Modelo de áudio com IA
6 créditos por 1000 caracteres

ElevenLabs Multilingual V2

ElevenLabs Multilingual V2 é a ferramenta atual da Kyeo AI para fala mais natural com uma voz. Ela usa um formulário semelhante ao Turbo 2.5, mas atende a outro objetivo: Turbo funciona como referência de locução rápida, enquanto Multilingual V2 é voltado a narrações longas, conteúdo em vários idiomas e manutenção de uma voz de marca. A integração também usa uma lista fixa de vozes e aceita até 5.000 caracteres, mas a decisão passa da velocidade para a estabilidade sonora e para saber se vale pagar o dobro por caractere.

Modelo de áudio com IA
12 créditos por 1000 caracteres

Fontes

O conteúdo combina informações do modelo, descrições dos recursos e configurações atualmente disponíveis na Kyeo AI.

Nota sobre as fontes

Foram confirmados os controles de locutor, diálogo e voz do Gemini 3.1 Flash TTS, além das tarifas por token. No entanto, ainda não é possível demonstrar antes da solicitação qual seria o limite máximo de tokens de áudio na saída; por isso, a geração permanece indisponível nesta plataforma.

Última atualização: 2026-08-28
Gemini 3.1 Flash TTS — Geração indisponível no momento
Avaliação editorial