Ir para o conteúdo principal
Modelo de vídeo com IA
ByteDance
OmniHuman

OmniHuman 1.5

O fluxo principal do OmniHuman 1.5 usa uma imagem de pessoa, animal ou personagem de animação e um áudio para gerar o vídeo. A duração do áudio é validada pela assinatura do upload e define diretamente a pré-autorização.

Disponibilidade
Recursos principais com acesso limitado
Entrada
1 imagem + 1 áudio
Saída
720P/1080P
Preço
27 por segundo de áudio
Contrato claro de uma imagem mais um áudio
Saída em 720P/1080P e modo rápido
Duração assinada do áudio participa diretamente da pré-autorização
Fluxo auxiliar de máscara ainda indisponível, com rejeição explícita dos campos
Resumo em 30 segundos
OmniHuman
27 créditos por segundo de áudio
No que ele se destaca
Um fluxo principal de vídeo guiado por áudio para uma única imagem de sujeito.
Para quem é indicado
Indicado para apresentadores virtuais, falas de personagens, animais ou figuras de animação em clipes curtos.
Buscas populares
como usar OmniHuman 1.5quanto custa OmniHuman 1.5qual é a duração máxima do áudio no OmniHuman 1.5

Em uma frase

Este modelo vale a pena?

A imagem pode ter qualquer proporção, mas ainda precisa passar pela validação de formato real e dimensões assinadas. O áudio deve usar um formato aceito, ter no máximo 10 MB e durar menos de 60 segundos. O prompt opcional segue o limite mais estrito de 300 caracteres, sem adotar uma descrição mais ampla que entra em conflito com esse contrato.

No que ele se destaca
Um fluxo principal de vídeo guiado por áudio para uma única imagem de sujeito.
Para quem é indicado
Indicado para apresentadores virtuais, falas de personagens, animais ou figuras de animação em clipes curtos.
Por que usar na Kyeo AI
Antes da cobrança, o site valida o vínculo entre imagem e áudio, pré-autoriza pelo número confiável de segundos e deixa indisponível a capacidade de máscara ainda não integrada.

Parâmetros principais

Avalie rapidamente se o modelo é adequado para o seu cenário.

Formatos de imagem
JPEG/PNG/WebP
Duração do áudio
Menos de 60 segundos
Prompt
Opcional, até 300 caracteres
Ainda indisponível
Fluxo com máscara do sujeito

Outros nomes

O mesmo modelo pode aparecer com nomes diferentes em fontes distintas. Reunimos essas variações para facilitar a busca e a comparação.

OmniHuman V1.5
foto falante OmniHuman 1.5
vídeo guiado por áudio OmniHuman 1.5

Perguntas comuns

Estas perguntas práticas tratam da tarefa, das entradas e do resultado que devem ser confirmados antes da escolha.

como usar OmniHuman 1.5
quanto custa OmniHuman 1.5
qual é a duração máxima do áudio no OmniHuman 1.5
quais imagens o OmniHuman 1.5 aceita
o que é o modo rápido do OmniHuman 1.5

Guia de escolha

Confira os principais critérios antes de escolher um modelo.

1
Escolha OmniHuman quando tiver somente uma imagem

Use este modelo quando o material de origem for uma imagem estática de pessoa ou personagem que precisa ser animada pelo áudio.

2
Compare sincronização labial se já houver um vídeo

Se for necessário manter movimentos e câmera de um vídeo existente, compare o Video Lip Sync.

3
Teste primeiro com áudio curto

Comece com um trecho breve para avaliar a identificação do sujeito e o movimento labial antes de ampliar o conteúdo.

Comparações mais buscadas

Compare alternativas comuns na mesma tarefa para esclarecer diferenças de entrada, controle e custo.

Quais são as diferenças de entrada e preço entre OmniHuman 1.5 e Kling AI Avatar?
Quando escolher OmniHuman 1.5 ou um modelo de sincronização labial em vídeo?

Tabela comparativa

Compare rapidamente o modelo atual e as alternativas nos critérios mais importantes.

Entrada principal
OmniHuman 1.5
1 imagem + 1 áudio
Kling AI Avatar Standard
1 imagem + 1 áudio
Video Lip Sync
1 vídeo + 1 áudio

Experiência de uso

Orientação prática baseada em fontes públicas, limites atuais do site e tarefas representativas.

Acesso limitado não inclui todo o conjunto auxiliar

A geração principal pode ser chamada, mas a seleção entre vários sujeitos, que depende de detecção de máscara, ainda não faz parte do contrato do site.

A pré-autorização por segundo de áudio é verificável

A duração confiável é conhecida antes da criação, portanto não é preciso estimar tempo nem presumir um preço fixo.

Recursos em detalhes

Vídeo guiado por imagem e áudio

Use uma imagem e uma voz para gerar um vídeo do sujeito falando.

Duas resoluções de saída

Escolha 720P ou 1080P.

Modo rápido

Permite priorizar um processamento mais rápido com possível compensação de qualidade.

Casos de uso

Apresentador virtual

Crie um clipe explicativo com uma imagem frontal do personagem e uma narração clara.

Diálogo de personagem animado

Combine uma imagem de personagem com um áudio de fala.

Vídeo de animal com fala

Experimente uma expressão humanizada usando foto de animal e áudio curto.

Dicas de prompt

Mantenha o sujeito nítido

Escolha uma imagem com sujeito evidente, pouca obstrução e rosto ou cabeça reconhecíveis.

Use voz limpa no áudio

Reduza música de fundo e ruído para facilitar o alinhamento do ritmo e dos movimentos labiais.

Escreva um prompt breve

Dentro de 300 caracteres, foque expressão, intensidade do movimento e estilo de câmera.

Por que escolher

Entrada simples e clara com imagem e áudio.
A duração do áudio permite calcular o preço antes da criação.
Aceita vários tipos de sujeito e qualquer proporção de imagem.
A capacidade de máscara ainda indisponível tem limites explícitos.

O que saber antes de usar

Máscaras e seleção de vários sujeitos ainda não estão disponíveis.
Só é possível enviar uma imagem e um áudio.
O áudio deve ter menos de 60 segundos.
O prompt segue o limite estrito de 300 caracteres.

Parâmetros ajustáveis

Avalie rapidamente se o modelo é adequado para o seu cenário.

Resolução de saída
output_resolution
Opcional
Tipo de parâmetro: Seleção
Padrão: 1080P
720P
1080P
Modo rápido
pe_fast_mode
Opcional
Tipo de parâmetro: Alternância
Padrão: desativado
Desativado
Ativado
Semente aleatória
seed
Opcional
Tipo de parâmetro: Número inteiro
Padrão: -1 (aleatória)

Consumo de créditos

27 créditos por segundo de áudio

A pré-autorização é calculada com 27 créditos por segundo da duração verificada do áudio e arredondada para cima. Como o áudio deve ter menos de 60 segundos, uma solicitação válida exige menos de 1.620 créditos. O acerto final usa o consumo real após a conclusão.

Dica para economizar créditos

Antes de gerar imagens ou vídeos em lote, faça um teste A/B com os mesmos materiais neste modelo e em alternativas semelhantes. Confirme o resultado antes de produzir em volume para evitar o desperdício de créditos.

Perguntas frequentes

Modelos semelhantes

Ainda não decidiu? Compare também estas alternativas semelhantes.

Kling AI Avatar Standard

Capacidades: A interface exige exatamente 1 imagem JPEG ou PNG e 1 áudio MPEG, WAV, X-WAV, AAC, MP4 ou OGG. A imagem pode ter até 10 MB; o áudio, até 100 MB e 5 minutos. A cobrança usa a duração de áudio assinada a 8 créditos por segundo e arredonda para cima. Não é possível enviar uma duração ausente, inválida ou superior a 5 minutos.

Modelo de vídeo com IA
8 créditos / segundo de áudio

Infinitalk

O Infinitalk usa na Kyeo 1 imagem, 1 arquivo de áudio de até 15 segundos e um prompt obrigatório para gerar um vídeo de apresentação. A resolução pode ser 480p ou 720p e `seed` é opcional; o custo depende dos segundos de áudio e da resolução, não de um preço fixo por geração.

Modelo de vídeo com IA
3 créditos / segundo em 480p; 12 em 720p

Volcengine Video Lip Sync

O Video Lip Sync refaz o movimento labial de um vídeo existente para acompanhar um áudio de destino. O modo leve atende vídeos frontais com uma pessoa; o básico é voltado a cenas individuais mais complexas e pode ativar detecção de cenas.

Modelo de vídeo com IA
8 créditos por segundo de áudio

Fontes

O conteúdo combina informações do modelo, descrições dos recursos e configurações atualmente disponíveis na Kyeo AI.

Nota sobre as fontes

Veja como o OmniHuman 1.5 gera vídeo em 720P/1080P com uma imagem e um áudio de menos de 60 segundos, preço por segundo e limites de acesso. A pré-autorização é calculada com 27 créditos por segundo da duração verificada do áudio e arredondada para cima. Como o áudio deve ter menos de 60 segundos, uma solicitação válida exige menos de 1.620 créditos. O acerto final usa o consumo real após a conclusão.

Última atualização: 2026-08-28
Dados da interface atual do OmniHuman V1.5
Plataforma

Usados para conferir modos de entrada, controles visíveis, limites de mídia e disponibilidade da versão conectada ao site. A página e o espaço de criação mostram as opções reais.