Capivara Tomando Milk Shake - Capivara Tomando Milk Shake para Colorir | Mundo dos Jogos
Capivara Tomando Milk Shake para Colorir | Mundo dos Jogos

O que é e como funciona esse trend da capivara com milk shake

O formato viral de capivara tomando milk shake veio de um vídeo editado com IA generativa, provavelmente rodando no Midjourney ou Stable Diffusion, que ganhou tração nas redes sociais. A premissa é simples: uma capivara realista sentada num balcão de lanchonete, segurando um copo alto com milk shake, iluminação cinemática e uma vibe meio nostálgica dos anos 90. O que muita gente não entende de cara é que isso não é filmagem real. É tudo gerado por modelo de difusão, com inpainting eupscale quando necessário. Eu comecei a trabalhar com isso há cerca de dois anos, quando o formato começou a aparecer em loops no TikTok. Nos primeiros meses eu tentava gerar imagens perfeitas num só prompt e gastava horas refinando. Agora consigo produzir variações consistentes em cerca de 20 minutos, dependendo da complexidade do cenário.

Como fazer capivara tomando milk shake com IA

Você vai precisar de pelo menos uma ferramenta de geração de imagem por IA. As mais estáveis pra esse tipo de conteúdo hoje são Midjourney v6, Flux.1, e Stable Diffusion XL com LoRA customizado. Se o seu foco for consistência entre múltiplas imagens do mesmo personagem, Stable Diffusion com ControlNet é imbatível. Pra quem tá começando, Midjourney é mais rápido, mas custa mais caro por uso. O prompt base que eu uso segue essa estrutura: primeiro a subject principal, depois o ambiente, iluminação, estilo de imagem e parâmetros técnicos. Algo como "a capybara sitting at a diner counter, holding a tall glass milkshake with whipped cream, warm interior lighting, photorealistic, shallow depth of field, cinematic color grading". No Midjourney eu adiciono --ar 16:9 --style raw --s 250. No Stable Diffusion, eu uso um checkpoint realista como Juggernaut XL ou RealVisXL, resolução 768x1344, e negativo prompt com coisas como "cartoon, anime, deformed paws, extra limbs".

O maior erro que eu vejo pessoas cometendo é pedir a imagem inteira de uma vez. A IA tende a distorcer as patas da capivara ou deformar o copo. Minha solução foi fazer o processo em duas etapas: primeiro gero a capivara sozinha, depois faço inpainting pro copo e milk shake. Assim controlo cada elemento separadamente.

Dica prática que ninguém conta

A textura do leite batido é o ponto onde a maioria das gerações falha. A IA entende "milk shake" como uma massa homogênea sem camadas visuais. O workaround que eu encontrei foi adicionar ao prompt termos como "layered vanilla and strawberry milkshake, visible cream swirl, condensation on glass, straw sticking out". Isso força o modelo a gerar detalhes texturais que dão credibilidade à imagem. Sem esses qualifiers, o copo fica com aspecto de plástico fundido.

Problema real que eu enfrentei e a solução

👉 Clique no botão abaixo para saber mais sobre o assunto!

Num projeto recente, precisei gerar uma sequência de 8 imagens da mesma capivara em poses diferentes, todas segurando milk shake, com aparência consistentemente idêntica. O Midjourney simplesmente não entregava isso. Cada gerar era uma capivara diferente. Eu terminei exportando uma face reference do Midjourney usando o comando --cref, treinando um LoRA simples com 15 imagens da capivara base no trainme.do, e rodando tudo no Stable Diffusion com IP-Adapter Face ID pra manter a consistência facial e corporal. Isso reduziu meu tempo de iteration de 3 horas pra 40 minutos por lote de 8 imagens.

Limitações importantes que você precisa saber

Esse formato tem problemas sérios de escalabilidade. Geração de imagens com capivaras em cenas complexas ainda produz artefatos frequentes: patas extras, focinhos deformados, copos que se fundem com as patas. Quando você precisa de 50 variações pra um campanha, pelo menos 15 a 20 vão ter problemas visíveis que precisam de correção manual com inpainting ou Photoshop. O custo de produção sobe significativamente. Outro ponto: modelos de texto-pra-imagem atuais não entendem física de líquidos de verdade. Milk shake escorrendo, gelo derretendo, respingos — tudo isso é manualmente retoqueável, não gerado automaticamente. Se o seu projeto exige realismo fotográfico extremo, você vai gastar mais tempo editando do que gerando.

Pra quem quer algo mais rápido e confiável sem depender de refinamento manual constante, minha recomendação é usar o Leonardo AI com o modelo Phoenix ou a nova versão do Flux. Ambos lidam melhor com composição de cena do que modelos mais antigos. Mas ainda assim, reserve 30 minutos por imagem pra ajustes finos.

Links úteis

Pra testar o workflow, o Midjourney roda em Discord (discord.com) com assinatura a partir de 10 dólares por mês. O Stable Diffusion é gratuito se você tiver placa de vídeo NVIDIA com 8GB VRAM mínimo, e você pode rodar localmente com Automatic1111 ou ComfyUI. O Flux.1 tá disponível via replicate.com com cobrança por uso. Eu recomendo começar com o Flux.1 dev no replicate — gera imagens de qualidade decente rápido, e o custo por imagem fica em torno de 2 centavos de dólar.