Gemini 3.1 Flash TTS
O Gemini 3.1 Flash TTS já tem um contrato confirmado para diálogos com vários locutores e controles de voz. Como não é possível demonstrar o consumo máximo possível de áudio antes da criação, esta página permanece indexável, mas a geração está desativada.
Uso online indisponível no momento
Esta página serve apenas para consultar recursos, casos de uso e informações públicas. O modelo não aparece na área de criação da página inicial e não aceita tarefas de geração.
Em uma frase
Este modelo vale a pena?
Este caso não é Coming Soon nem descontinuação do modelo. A restrição vem do limite de segurança da pré-autorização: os arrays de locutores e falas não têm um total máximo definido, e não há um pior caso comprovável que relacione o texto aos tokens de áudio na saída. Por isso, o modelo não aparece no seletor e toda solicitação é recusada antes do desconto de créditos.
Parâmetros principais
Avalie rapidamente se o modelo é adequado para o seu cenário.
Outros nomes
O mesmo modelo pode aparecer com nomes diferentes em fontes distintas. Reunimos essas variações para facilitar a busca e a comparação.
Perguntas comuns
Estas perguntas práticas tratam da tarefa, das entradas e do resultado que devem ser confirmados antes da escolha.
Guia de escolha
Confira os principais critérios antes de escolher um modelo.
Considere o ElevenLabs Dialogue V3 e use um roteiro curto para verificar se as vozes dos personagens ficam bem diferenciadas.
Compare primeiro ElevenLabs Turbo 2.5 e Multilingual V2.
Separe três roteiros não sensíveis: uma locução, uma entrevista com duas pessoas e uma cena curta com personagens.
Comparações mais buscadas
Compare alternativas comuns na mesma tarefa para esclarecer diferenças de entrada, controle e custo.
Tabela comparativa
Compare rapidamente o modelo atual e as alternativas nos critérios mais importantes.
Experiência de uso
Orientação prática baseada em fontes públicas, limites atuais do site e tarefas representativas.
Baixa latência não substitui um limite de custo
Vários personagens ampliam o pior consumo possível
Recursos em detalhes
Configuração de vários locutores
Diálogos em sequência
Controles de voz
Casos de uso
Planejamento de diálogos para podcasts
Preparação de cenas curtas com personagens
Avaliação futura com o mesmo roteiro
Dicas de prompt
Use identificadores consistentes para os locutores
Comece por um roteiro curto
Não estime a duração da saída
Por que escolher
O que saber antes de usar
Indisponível no momento
Esta página serve apenas para consultar recursos, casos de uso e informações públicas. O modelo não aparece na área de criação da página inicial e não aceita tarefas de geração. Candidato da família Gemini TTS voltado à geração rápida de voz e ao controle de diálogos com vários personagens.
Perguntas frequentes
Modelos semelhantes
Ainda não decidiu? Compare também estas alternativas semelhantes.
ElevenLabs Dialogue V3
ElevenLabs Dialogue V3 gera diálogos linha por linha: você insere a fala e escolhe a voz de cada linha, e a Kyeo AI cobra pelo total de caracteres das falas. Não é um agente de voz em tempo real, e a documentação oficial alerta que várias gerações podem ser necessárias para encontrar um resultado aproveitável. Recomendamos testar antes as trocas de personagem, as marcações de emoção, o código do idioma, o formato de saída e a integridade de roteiros longos.
ElevenLabs Turbo 2.5
ElevenLabs Turbo 2.5 é o fluxo de texto para fala com uma voz que a Kyeo mantém disponível. É possível escolher uma voz da plataforma e ajustar stability, similarity_boost, style, speed, timestamps, contexto anterior e posterior e language_code. O envio continua disponível, mas a ElevenLabs atualmente recomenda substituí-lo pelo Flash v2.5. A página não apresenta baixa latência, idiomas aceitos, precisão dos timestamps, autorização da voz nem qualidade da saída como garantias da Kyeo.
ElevenLabs Multilingual V2
ElevenLabs Multilingual V2 é a ferramenta atual da Kyeo AI para fala mais natural com uma voz. Ela usa um formulário semelhante ao Turbo 2.5, mas atende a outro objetivo: Turbo funciona como referência de locução rápida, enquanto Multilingual V2 é voltado a narrações longas, conteúdo em vários idiomas e manutenção de uma voz de marca. A integração também usa uma lista fixa de vozes e aceita até 5.000 caracteres, mas a decisão passa da velocidade para a estabilidade sonora e para saber se vale pagar o dobro por caractere.
Fontes
O conteúdo combina informações do modelo, descrições dos recursos e configurações atualmente disponíveis na Kyeo AI.
Foram confirmados os controles de locutor, diálogo e voz do Gemini 3.1 Flash TTS, além das tarifas por token. No entanto, ainda não é possível demonstrar antes da solicitação qual seria o limite máximo de tokens de áudio na saída; por isso, a geração permanece indisponível nesta plataforma.