Strona główna/Poradniki/Faça um retrato falar com áudio próprio ou autorizado em português
Gerador de lip sync com IA

Faça um retrato falar com áudio próprio ou autorizado em português

Envie um retrato próprio, fictício ou autorizado, adicione uma gravação que você pode usar, escolha Aurora, Fabric ou OmniHuman e revise boca, mandíbula e expressão.

Equipe AINudeOpublikowano 30/04/2026Aktualizacja 16/07/202615 min de leitura
  • Áudio autorizado em PT-BR e outros idiomas compatíveis
  • Três modelos com opções de 480p, 720p e 1080p
  • Preço calculado pela duração real do áudio

Mais econômico

25 créditos/s

Modelos

3

Resolução máxima

1080p

Faça um retrato falar com áudio próprio ou autorizado em português

Faça um retrato falar com áudio próprio ou autorizado em português

Faça um retrato falar com áudio próprio ou autorizado em português — ilustracja 2

Faça um retrato falar com áudio próprio ou autorizado em português — ilustracja 2

Faça um retrato falar com áudio próprio ou autorizado em português — ilustracja 3

Faça um retrato falar com áudio próprio ou autorizado em português — ilustracja 3

Faça um retrato falar com áudio próprio ou autorizado em português — ilustracja 4

Faça um retrato falar com áudio próprio ou autorizado em português — ilustracja 4

Resposta direta

O que é lip sync com IA?

É a geração de um vídeo falado a partir de uma imagem e uma faixa de voz.

O sistema analisa os sons do áudio e cria movimento de lábios, mandíbula, bochechas, olhos e cabeça para a pessoa da foto parecer falar. No AINude, você envia ou informa a URL autorizada de uma imagem e de um áudio, escolhe modelo e resolução e gera o clipe.

Lip sync não cria roteiro, voz ou tradução. A ferramenta usa exatamente o áudio fornecido. Para outro idioma, grave ou gere a nova locução antes; para substituir a fala dentro de um vídeo existente, use Dublagem de Vídeo.

A melhor entrada é um retrato frontal ou três quartos leve, com boca visível, expressão neutra, boa luz e apenas uma pessoa. O melhor áudio tem uma voz em primeiro plano, sem música alta, eco, saturação ou longos silêncios.

Serve para

  • Influencer virtual e apresentador recorrente.
  • UGC sintético e anúncio autorizado.
  • Aula, treinamento e explicação curta.
  • Personagem de game, anime ou história.
  • Mensagem de avatar e personagem fictícia inequivocamente adulta.

A ferramenta não verifica se a fala é verdadeira. Quem publica responde por consentimento, autoria do áudio, publicidade e possível indução do público a erro.

Não confunda

Lip sync, dublagem ou imagem para vídeo?

Os três fluxos produzem vídeo, mas partem de entradas diferentes.

FerramentaEntradaSaídaUse quando
Lip SyncUma foto + um áudio prontoNovo vídeo faladoVocê quer fazer uma foto falar
Dublagem de vídeoVídeo existente com falaVídeo com nova faixa de idioma ou vozVocê quer localizar uma gravação pronta
Imagem para vídeoFoto + descrição de movimentoVídeo com ação e câmeraVocê quer animar sem seguir fonemas de áudio
Avatar de IARoteiro e configuração do apresentadorApresentação geradaVocê quer um fluxo de apresentador mais estruturado

Não use Imagem para Vídeo esperando sincronia de boca precisa; para áudio pronto, abra /lip-sync.

Modelos reais

Aurora, Fabric ou OmniHuman: qual escolher?

Compare resolução, controle e custo atual por segundo.

ModeloResoluçãoCustoPrompt de movimentoMelhor uso
Fabric 1.0480p25 créditos/sNãoRascunho mais econômico
Aurora480p30 créditos/sSimTeste barato com direção de expressão
Aurora720p40 créditos/sSimConteúdo social com controle
Fabric 1.0720p50 créditos/sNãoSaída direta sem escrever prompt
OmniHuman 1.5720p55 créditos/sSimPersonagem com direção adicional
OmniHuman 1.51080p55 créditos/sSimMaior resolução disponível no fluxo

Aurora abre em 720p por padrão, Fabric em 720p e OmniHuman em 1080p. Troque para 480p antes do teste quando quiser reduzir custo.

Fluxo de trabalho

Como fazer uma foto falar em cinco passos

Prepare os arquivos antes de gastar créditos na versão final.

1. Abra Lip Sync e escolha o modelo. Para o primeiro teste, Fabric 480p é a opção de menor custo; use Aurora se precisar descrever expressão e movimento; escolha OmniHuman quando 1080p ou sua direção adicional forem importantes.

2. Envie uma foto própria ou autorizada, ou use uma URL direta de um arquivo que você controla. Centralize um rosto, deixe olhos, nariz, boca, queixo e pescoço visíveis e evite máscara, microfone, mão, cabelo ou copo sobre os lábios.

3. Envie o áudio ou informe uma URL direta. A página detecta a duração e calcula o total. Reproduza a faixa antes de gerar para conferir começo, fim, volume e silêncio.

4. Em Aurora ou OmniHuman, escreva um prompt curto de movimento. Fabric não usa esse campo. Escolha resolução e confirme o cálculo de créditos exibido.

5. Gere e revise o vídeo sem som, depois com som e por fim quadro a quadro nos trechos problemáticos. Confira identidade, dentes, lábios, olhos, mandíbula, cabelo, fundo e duração.

Antes de clicar em gerar

  • Imagem e áudio pertencem a você ou foram autorizados.
  • Há apenas uma voz principal.
  • A boca está totalmente visível.
  • Modelo, resolução e custo estão corretos.
  • O roteiro não fabrica fala ou endosso de outra pessoa.

A interface aceita upload ou URL tanto para imagem quanto para áudio. Se um formato incomum falhar, converta a imagem para JPG/PNG e o áudio para MP3/WAV.

Imagem de entrada

Qual foto dá melhor sincronia labial?

O modelo precisa reconstruir boca e rosto sem adivinhar partes ocultas.

ElementoPrefiraEviteEfeito
ÂnguloFrontal ou três quartos levePerfil completoMais informação para lábios e mandíbula
EnquadramentoClose ou plano médioRosto minúsculo no corpo inteiroMais pixels para boca, olhos e pele
ExpressãoNeutra ou sorriso discreto com boca fechadaGrito, careta ou boca muito abertaPonto inicial mais estável
LuzUniforme e frontal suaveSombra dura cruzando os lábiosReduz cintilação de pele e dentes
OclusãoBoca e queixo livresCabelo, barba longa, mão, máscara ou microfone cobrindoEvita bordas e lábios incompletos
PessoasUma pessoa centralCasal ou grupoEvita animar o rosto errado

Barba curta funciona, mas barba muito densa sobre o contorno dos lábios pode diminuir a leitura da boca.

Áudio em PT-BR

Grave para a boca, não apenas para o ouvido

Dicção clara e pausas naturais ajudam o modelo a mapear cada som.

Grave em ambiente silencioso, a uma distância constante do microfone. Fale em volume normal, sem sussurrar, gritar ou acelerar. Evite música, reverberação, redução de ruído agressiva e cortes no meio de sílabas.

O áudio pode estar em português brasileiro, português europeu ou outro idioma porque a ferramenta segue o sinal de voz. Ela não reescreve sotaque, gramática ou pronúncia. Revise nomes próprios, números, siglas e palavras estrangeiras antes de enviar.

Remova silêncio longo no começo e no fim, mas preserve pequenas pausas entre frases. Para roteiro de 15 segundos, escreva cerca de 30 a 40 palavras, grave e meça; ritmo varia por pessoa, então a duração real do arquivo é a referência de cobrança.

Roteiro de teste em português

  • “Oi, eu sou a Luna, sua criadora virtual.”
  • “Hoje vou mostrar três detalhes deste produto.”
  • “Veja a textura, o acabamento e como usar.”
  • “Conte nos comentários qual teste você quer ver depois.”

Grave uma frase de cinco a oito segundos antes do roteiro completo. Ela revela rápido se foto, voz e modelo combinam.

Aurora e OmniHuman

Prompts de movimento para foto falando

O áudio define a fala; o prompt dirige postura, olhar e expressão nos modelos compatíveis.

#1Aula e explicação
A

Apresentador natural

A pessoa adulta fala diretamente para a câmera com expressão atenta, piscar natural, pequenos movimentos de cabeça e respiração sutil. Preserve exatamente rosto, idade, cabelo, roupa, enquadramento, luz e fundo. Câmera fixa, boca sincronizada ao áudio, sem gesto exagerado, sem troca de identidade e sem texto.

Controle

  • Olhar na câmera.
  • Cabeça sutil.
  • Câmera fixa.
  • Identidade preservada.
Model cenowy
Aurora: 30 créditos/s em 480p ou 40 em 720p.
Kompromisy
Foto com boca aberta pode provocar dentes instáveis.
Najlepiej sprawdzi się dla
Curso, treinamento e vídeo institucional.
#2Publicidade
U

UGC de produto

A criadora virtual adulta fala em português brasileiro com energia leve, mantém contato visual e segura o produto autorizado abaixo do queixo sem cobrir a boca. Pequenos movimentos de sobrancelha e cabeça, mãos estáveis, rótulo preservado, câmera de celular fixa, sem inventar gesto, texto ou troca de embalagem.

Controle

  • Produto abaixo da boca.
  • Rótulo estável.
  • Energia moderada.
  • Sem depoimento falso.
Model cenowy
OmniHuman: 55 créditos/s em 720p ou 1080p.
Kompromisy
Lip sync não corrige rótulo deformado na imagem de entrada.
Najlepiej sprawdzi się dla
Demonstração e anúncio identificado como publicidade.
#3Shorts e streaming
P

Personagem gamer

O personagem adulto reage ao áudio com expressão divertida controlada, leve inclinação da cabeça e piscar natural. Preserve rosto, cabelo, headset, roupa e setup RGB. A boca permanece totalmente visível, câmera frontal fixa, sem grito visual, sem fundo pulsando, sem pessoa extra e sem legenda automática.

Controle

  • Headset sem cobrir rosto.
  • Expressão controlada.
  • Setup preservado.
  • Sem legenda automática.
Model cenowy
Aurora: 40 créditos/s em 720p.
Kompromisy
Luz RGB forte sobre a pele pode causar cintilação.
Najlepiej sprawdzi się dla
Reação, introdução e recado de streamer virtual.
#4Avatar 18+ original
P

Personagem adulta fictícia

A personagem feminina fictícia e inequivocamente adulta fala com voz calma e expressão confiante, respirando de forma sutil e mantendo contato visual. Preserve idade adulta, rosto, corpo, cabelo, figurino, pose sentada e quarto. Plano médio fixo, boca sincronizada, figurino inalterado, sem gesto sexual, sem pessoa extra, sem coerção, sem aparência juvenil e sem mudar identidade.

Controle

  • Adulta fictícia.
  • Movimento discreto.
  • Roupa preservada.
  • Sem deepfake.
Model cenowy
O preço depende do modelo; disponibilidade adulta pode variar pelo provedor.
Kompromisy
O provedor de lip sync pode moderar ou recusar solicitações; não use imagem, voz ou semelhança de pessoa real em contexto sexual.
Najlepiej sprawdzi się dla
Mensagem adulta de personagem original em plataforma compatível.

Preço por duração

Quanto custa um lip sync de 10 segundos?

A interface multiplica a duração detectada pela tarifa e arredonda o total para cima.

ModeloResoluçãoTaxa10 segundos15 segundos
Fabric 1.0480p25 créditos/s250 créditos375 créditos
Aurora480p30 créditos/s300 créditos450 créditos
Aurora720p40 créditos/s400 créditos600 créditos
Fabric 1.0720p50 créditos/s500 créditos750 créditos
OmniHuman 1.5720p55 créditos/s550 créditos825 créditos
OmniHuman 1.51080p55 créditos/s550 créditos825 créditos

Um áudio de 7,21 segundos no Fabric 480p custa ceil(7,21 × 25) = 181 créditos. Corte silêncio desnecessário antes de gerar.

Diagnóstico

Como corrigir boca estranha, atraso e rosto instável

Mude uma entrada por vez para descobrir a causa.

ProblemaCausa provávelPróximo teste
Boca parece de borrachaFoto em ângulo, expressão extrema ou fala rápidaUse retrato frontal neutro e grave frase mais curta em ritmo normal
Dentes piscam ou mudamBoca aberta na fonte ou poucos detalhesUse foto de maior qualidade com boca fechada e luz uniforme
Fala parece atrasadaSilêncio, eco, música ou corte ruim no áudioLimpe começo e fim, deixe uma voz seca e teste cinco segundos
Rosto muda durante o clipeImagem pequena ou prompt com muita açãoAproxime o rosto e peça câmera fixa, identidade e fundo preservados
Cabeça balança demaisDireção ampla ou cadência vocal intensaPeça pequenos movimentos e reduza ênfase da gravação
Olhos e piscar ficam estranhosOlhar fora da câmera ou sombra forteUse foto com olhos nítidos e peça piscar natural discreto
Modelo anima pessoa erradaHá dois ou mais rostosRecorte para deixar uma única pessoa central

Não alongue um clipe ruim. Corrija primeiro uma frase curta e depois use a mesma configuração no roteiro completo.

Outro idioma

Como localizar um personagem para português brasileiro

Tradução natural precisa caber no tempo e na intenção da fala original.

Se você só tem uma foto, traduza o roteiro, grave a nova voz em PT-BR e use Lip Sync. Se já tem um vídeo falado, use Dublagem de Vídeo para preservar o material de origem e trabalhar a nova faixa.

Não traduza palavra por palavra. Encurte ou expanda frases para manter duração, pausas e ênfase. Troque unidades, moeda, datas, tratamento e chamadas para ação pelo uso brasileiro quando a mensagem permitir.

Nomes de marca e termos técnicos devem ter pronúncia aprovada. Grave uma versão de referência e peça revisão a falante brasileiro antes de publicar uma campanha. Não clone a voz de dublador, ator, influencer ou cliente sem autorização específica.

Revisão PT-BR

  • Vocabulário brasileiro natural.
  • Duração próxima do áudio planejado.
  • Números e nomes pronunciados corretamente.
  • Chamada para ação adequada ao Brasil.
  • Direito de uso da voz documentado.

O lip sync segue áudio, não avalia se a tradução está correta ou se o sotaque combina com a personagem.

Imagem e voz

Não faça alguém dizer o que nunca disse

Retrato e áudio podem identificar pessoas diferentes e ambos exigem direito de uso.

Use pessoa fictícia ou alguém que autorizou foto, animação facial, fala não íntima, contexto, publicação e prazo. Permissão para postar uma foto não autoriza criar vídeo, publicidade, conteúdo político, sexualização ou imitação de depoimento.

A ferramenta não clona voz; ela anima a imagem usando a gravação fornecida. Ainda assim, a faixa pode conter voz protegida ou ter sido clonada em outro serviço. Guarde autorização do locutor e não atribua áudio sintético a pessoa real.

Em vídeo realista, identifique o uso de IA quando a plataforma exigir e confirme as regras vigentes antes de publicar. Não crie falso endosso comercial, confissão, notícia, orientação médica ou fala política.

Proibido no fluxo responsável

  • Deepfake de pessoa privada sem permissão.
  • Fala falsa atribuída a autoridade, celebridade ou político.
  • Depoimento de produto que nunca ocorreu.
  • Voz roubada ou clonada sem autorização.
  • Qualquer sexualização de menor.
  • Qualquer deepfake íntimo de pessoa real.

Consulte orientações atuais da ANPD e da plataforma de destino sobre conteúdo sintético, imagem, voz e rotulagem.

Conteúdo adulto

Lip sync adulto deve partir de personagem fictícia e inequivocamente adulta

A imagem pode ter sido criada em outro fluxo, mas o modelo de lip sync ainda aplica disponibilidade, moderação e regras próprias.

Para conteúdo 18+, gere primeiro por texto uma personagem fictícia clara e inequivocamente adulta, depois use uma voz e um roteiro que você pode publicar. Mantenha a boca visível e limite o movimento para reduzir oscilações.

Não use foto, voz ou semelhança de pessoa real em contexto sexual, mesmo com alegação de autorização. Não fabrique intimidade, depoimento, relacionamento ou fala que a pessoa nunca produziu.

O gerador de imagem e o Lip Sync são fluxos separados. Não afirme que o lip sync é sem filtro: aceitação e disponibilidade variam por modelo ou provedor, e bloqueios não devem ser contornados.

Checklist adulto

  • Personagem fictícia e inequivocamente adulta.
  • Todas as pessoas são claramente adultas.
  • Sem coerção, intoxicação ou violência sexual.
  • Sem semelhança deliberada com pessoa pública.
  • Arquivos privados com acesso restrito.
  • Plataforma de publicação permite o conteúdo.

Mais liberdade temática não significa ausência de moderação ou responsabilidade. Menor e deepfake íntimo de pessoa real são sempre excluídos.

Perguntas frequentes

Dúvidas sobre gerador de lip sync com IA

Como fazer uma foto falar com IA?

Abra /lip-sync, envie uma foto frontal autorizada e um áudio, escolha Fabric, Aurora ou OmniHuman, confira duração, resolução e créditos e gere o vídeo.

O lip sync funciona em português brasileiro?

Sim. A ferramenta segue os sons do áudio e pode usar uma gravação em PT-BR. Ela não traduz, corrige pronúncia nem cria a voz.

Qual modelo de lip sync é mais barato?

Fabric 1.0 em 480p custa 25 créditos por segundo. Para prompt de movimento, Aurora 480p custa 30 por segundo.

Qual modelo gera em 1080p?

OmniHuman 1.5 oferece 1080p por 55 créditos por segundo. A opção 720p do mesmo modelo tem a mesma taxa atual.

Aurora e Fabric são iguais?

Não. Aurora aceita prompt de movimento em 480p ou 720p. Fabric não usa prompt e custa 25 créditos/s em 480p ou 50 em 720p.

Quanto custa um vídeo falado de 10 segundos?

Custa de 250 créditos no Fabric 480p a 550 no OmniHuman 720p ou 1080p. O valor exato aparece depois que a duração do áudio é detectada.

Preciso escrever prompt?

No Aurora e OmniHuman, sim: descreva expressão, olhar, cabeça, câmera e elementos a preservar. No Fabric, não há campo de prompt.

Posso enviar um vídeo em vez de foto?

O fluxo Lip Sync atual pede imagem e áudio. Para um vídeo existente, abra Dublagem de Vídeo ou outra ferramenta de edição compatível.

Por que a boca ficou estranha?

As causas mais comuns são rosto pequeno, perfil, boca aberta na foto, oclusão, fala rápida, eco ou música. Teste um retrato frontal neutro com cinco segundos de voz limpa.

Posso usar voz clonada?

Somente se você tiver direito de usar e sintetizar essa voz. O Lip Sync não clona a voz; ele recebe o áudio pronto e anima a imagem.

Posso fazer lip sync NSFW?

A aceitação pode variar por modelo. Use apenas personagem original e inequivocamente adulta, com áudio próprio ou licenciado. Não use imagem, voz ou semelhança de pessoa real em contexto sexual.

Preciso identificar que o vídeo foi criado com IA?

Em conteúdo realista, siga a regra da plataforma. TikTok exige rótulo para AIGC realista e YouTube exige divulgação de conteúdo realista significativamente alterado ou sintético.

Imagem + áudio

Faça seu retrato falar em português

Comece com uma frase curta no Fabric 480p, valide boca e identidade e só então gere a versão final.

  • Upload ou URL para imagem e áudio.
  • 480p, 720p e 1080p conforme o modelo.
  • Custo calculado antes da geração.