Pular para o conteúdo
Prompts de imagem

Gerador de Prompts para Stable Diffusion

Monte prompts em palavras-chave, pesos e prompts negativos para SDXL e SD 1.5 em segundos.

Gerador de prompts para Stable Diffusion montando um prompt em palavras-chave com pesos e um prompt negativo para SDXL
Gerador de Prompts para Stable Diffusion
Monte prompts em palavras-chave, pesos e prompts negativos para SDXL e SD 1.5 em segundos.

Roda inteiramente no seu navegador. Seu texto nunca é enviado para lugar nenhum.

O Stable Diffusion não lê um prompt como um chatbot lê. Ele tokeniza seu texto, transforma isso em um embedding e usa esse embedding para guiar cada passo de denoise, do ruído puro até a imagem. Uma frase educada e bem construída gasta a maior parte do orçamento em palavras que não carregam nenhum sinal visual. Uma pilha enxuta de substantivos e modificadores gasta tudo em pixels.

O gerador acima é o nosso gerador de prompts de imagem com preset para Stable Diffusion: ele te entrega tags separadas por vírgula mais um prompt negativo combinando, em vez de texto corrido. Roda no seu navegador, do começo ao fim. Nada é enviado, nada é armazenado e não existe conta para criar.

Escreva em palavras-chave, não em frases

Coloque estas duas versões lado a lado:

  • "A beautiful photograph of an old fisherman who is standing on a dock at sunset"
  • "old fisherman, weathered face, standing on wooden dock, sunset, golden hour, 85mm, highly detailed"

Mesma ideia. A segunda dá ao modelo uma dúzia de âncoras visuais aproveitáveis em vez de três. Três hábitos respondem pela maior parte do ganho:

  • Comece pelo sujeito. Os primeiros tokens tendem a dominar a composição, então enterrar o sujeito no fim faz o modelo tratá-lo como detalhe.
  • Separe com vírgulas. Cada bloco entre vírgulas funciona como uma tag que o modelo consegue agarrar sozinha.
  • Corte adjetivos que não descrevem nada visível. "amazing", "perfect" e "stunning" queimam tokens sem mover um pixel.

Uma ordem de blocos que se sustenta em qualquer checkpoint: sujeito, detalhes do sujeito, pose ou ação, cenário, iluminação, câmera ou meio, estilo de arte, tags de qualidade.

neon-lit ramen stall, rain-slick alley, Tokyo at night, steam rising, reflections on wet asphalt, cinematic lighting, 35mm, shallow depth of field, film grain

Treze blocos, zero enchimento. Se descrever imagens com esse nível de precisão é novo para você, o guia de prompts de imagem percorre cada bloco com exemplos de antes e depois.

Pesos: diga ao modelo o que de fato importa

A maioria das interfaces de Stable Diffusion (AUTOMATIC1111, Forge, ComfyUI, InvokeAI) aceita peso de atenção. Coloque um termo entre parênteses com um número e você ajusta a força com que o sampler puxa para ele.

  • (red scarf:1.3) — algo em torno de 30% mais forte que o padrão
  • (background:0.7) — empurrado para trás, menos insistente
  • ((crown)) — a forma antiga com aninhamento, cerca de 1,21x; o número explícito é mais fácil de raciocinar

Fique entre 0.6 e 1.5. Passando de 1.6, você começa a ver sangramento de cor, membros duplicados ou um sujeito que engole o quadro inteiro. Quando dois conceitos brigam, abaixe o que importa menos em vez de subir o que você quer. Baixar deforma a imagem muito menos do que forçar para cima.

Dica: Mude um peso por vez e mantenha a seed fixa. Se você editar o peso, a redação e o sampler na mesma rodada, não aprende nada sobre qual mudança fez o trabalho.

O prompt negativo pesa mais aqui do que em qualquer outro lugar

Midjourney e DALL-E quase não te dão controle sobre o que evitar. O Stable Diffusion te dá um segundo prompt inteiro, e ele não é um filtro pregado no final. A cada passo, o sampler roda o modelo duas vezes: uma condicionada ao seu prompt, outra condicionada ao negativo, e depois empurra o resultado para longe do negativo. Deixe esse campo vazio e ele usa a string vazia em silêncio, e é por isso que imagens sem negativo saem tantas vezes moles e lavadas.

portrait of an old fisherman, weathered face, salt-crusted beard, golden hour, harbour in background, 85mm, highly detailed Negative prompt: blurry, low quality, extra fingers, deformed hands, watermark, text, jpeg artifacts, oversaturated, cartoon

Mantenha o negativo honesto. Um paredão de 60 tokens com tudo que você já viu alguém recomendar achata o estilo junto com os defeitos. Comece por correções de anatomia, artefatos de compressão e marcas d'água, e só acrescente termos quando o problema realmente aparecer. Nosso gerador de prompt negativo monta uma lista inicial a partir do que você está fotografando, o que rende bem mais do que copiar o bloco de alguém num fórum.

CFG, steps, sampler e seed em português claro

  • CFG scale decide o quanto o modelo obedece ao seu texto ao pé da letra. Perto de 3 ele improvisa. Perto de 7 ele te segue mantendo textura natural. Acima de 12 ele exagera: contraste estourado, cores fritas, mãos deformadas. Fotorrealismo gosta de 5 a 8. Ilustração tolera 7 a 10.
  • Steps é a quantidade de passadas de denoise. Samplers modernos entregam imagens limpas entre 20 e 30. Ir até 80 compra basicamente uma espera maior e uma imagem levemente diferente, não melhor.
  • Sampler é o algoritmo que remove o ruído. DPM++ 2M Karras é o padrão seguro. Euler a é não determinístico de um jeito útil e muda bastante conforme o número de steps. Escolha um e pare de mexer enquanto ajusta o prompt.
  • Seed é o padrão de ruído inicial. Mesma seed, mesmo prompt, mesmas configurações, mesma imagem, sempre. Essa reprodutibilidade é a coisa mais útil que o Stable Diffusion tem e as ferramentas fechadas não têm.

SDXL e SD 1.5 pedem prompts diferentes

O SDXL tem um text encoder bem mais forte, então lida com frases curtas e naturais que confundiriam o 1.5. Dá para escrever "a woman reading a letter by candlelight, seventeenth century Dutch painting" e receber algo coerente. Ele também precisa de muito menos tags de qualidade. Correntes como "masterpiece, best quality, 8k, ultra detailed, trending on artstation" eram muleta para o encoder fraco do 1.5; no SDXL elas só acrescentam um verniz genérico.

O SD 1.5 recompensa o oposto: tags densas, pesos explícitos, negativos mais longos e muita dependência dos checkpoints da comunidade. Ele foi treinado em 512x512, então pedir 1024x1024 direto costuma render duas cabeças ou um torso duplicado. Gere em 512x768 e depois faça upscale.

O SDXL foi treinado em 1024x1024 e dá conta de 832x1216 ou 1216x832 tranquilamente. Dê a ele uma tela de 512px e a qualidade cai em vez de subir. Seja qual for a base, mantenha as dimensões como múltiplos de 64.

Checkpoints e LoRAs mudam o que suas palavras significam

O mesmo prompt dá resultados completamente diferentes em checkpoints diferentes, porque um checkpoint é um fine-tune com vocabulário próprio. Modelos de anime esperam tags no estilo Danbooru. Merges fotorrealistas esperam linguagem de câmera. Um modelo treinado em arte legendada responde a nomes de artistas e movimentos. Leia o que o autor do checkpoint escreveu no Hugging Face antes de supor que seu prompt vai funcionar lá, e confira a Stability AI para saber em que cada versão base foi de fato treinada.

LoRAs entram por cima e são chamados com sintaxe do tipo <lora:filmgrain_v2:0.7>. Aquele número no fim é a força. Dois ou três LoRAs a 1.0 cada vão brigar e virar papa; 0.5 a 0.8 costuma misturar melhor. Muitos LoRAs também precisam de uma palavra-gatilho no prompt para fazer qualquer coisa.

Itere com a seed travada

Esse é o fluxo que separa quem consegue o que quer de quem passa uma hora tentando a sorte.

  1. Gere um lote de quatro a oito com seeds aleatórias até uma composição chegar perto.
  2. Copie essa seed e trave.
  3. Mude exatamente uma coisa — um peso, uma tag, o CFG em um ponto.
  4. Gere de novo e compare. A composição fica no lugar, então a diferença que você vê é a diferença que você fez.
  5. Com o prompt do jeito certo, volte a seed para aleatória e produza variações em lote.
architectural photograph, brutalist concrete library, (morning fog:1.2), low angle, wide shot, cold overcast light, ultra wide 16mm lens, sharp detail Negative prompt: people, cars, warm tones, blurry, distorted perspective, low resolution

A mesma disciplina vale para modelos de texto, e o raciocínio por trás dela está nos fundamentos de engenharia de prompt. Escrever para outros modelos de imagem é outro dialeto: veja o gerador de prompts para Midjourney para sintaxe movida a parâmetros, ou o gerador de prompts para DALL·E se você quiser frases descritivas completas em vez de tags.

FAQ

Perguntas frequentes

Sim, totalmente. Não há créditos, limite de teste nem plano pago travando o resultado. O GetEasyPrompt roda o gerador no seu navegador, então não pagamos por requisição e não temos nada para medir.
Não. Não tem cadastro, não tem login e não tem chave de API. O texto do seu prompt fica no seu dispositivo e nunca é enviado a um servidor, o que também significa que nada do que você digita aqui é registrado ou armazenado.
O prompt negativo é uma segunda lista de termos dos quais o sampler se afasta ativamente a cada passo de denoise, não um filtro aplicado no fim. Deixar esse campo vazio é o motivo de tantas imagens saírem moles ou lavadas. Comece com termos de anatomia e artefato como extra fingers, deformed hands, watermark e jpeg artifacts, e só acrescente mais quando enxergar um problema específico.
CFG de 5 a 8 com 20 a 30 steps cobre a maior parte do trabalho fotorrealista, e de 7 a 10 combina com ilustração e resultado estilizado. Acima de CFG 12 a imagem frita: contraste estourado, cores queimadas, mãos quebradas. Passar de uns 40 steps raramente melhora algo com samplers modernos como o DPM++ 2M Karras.
Sim. O SDXL tem um text encoder mais forte, então frases curtas e naturais funcionam e correntes longas de tags de qualidade como masterpiece, best quality, 8k só acrescentam um verniz genérico. O SD 1.5 quer tags densas separadas por vírgula, pesos explícitos e um prompt negativo mais longo. A resolução também muda: gere em torno de 512x768 no 1.5 e 1024x1024 ou 832x1216 no SDXL.
Os prompts que você gera aqui são seus para usar como quiser, sem exigência de atribuição. Se as imagens resultantes são seguras comercialmente depende da licença do modelo, então confira os termos do checkpoint ou LoRA específico que você carregou, já que muitos fine-tunes da comunidade no Hugging Face trazem cláusulas de uso não comercial ou de atribuição que a licença base da Stability não tem.

Escreva seu próximo prompt em segundos

Transforme uma ideia solta em um prompt claro e estruturado que qualquer IA consegue seguir. Grátis, privado e sem precisar de conta.

Abrir o Otimizador de PromptsVer todas as ferramentas