Gerador de Prompts para Stable Diffusion
Monte prompts em palavras-chave, pesos e prompts negativos para SDXL e SD 1.5 em segundos.

Roda inteiramente no seu navegador. Seu texto nunca é enviado para lugar nenhum.
O Stable Diffusion não lê um prompt como um chatbot lê. Ele tokeniza seu texto, transforma isso em um embedding e usa esse embedding para guiar cada passo de denoise, do ruído puro até a imagem. Uma frase educada e bem construída gasta a maior parte do orçamento em palavras que não carregam nenhum sinal visual. Uma pilha enxuta de substantivos e modificadores gasta tudo em pixels.
O gerador acima é o nosso gerador de prompts de imagem com preset para Stable Diffusion: ele te entrega tags separadas por vírgula mais um prompt negativo combinando, em vez de texto corrido. Roda no seu navegador, do começo ao fim. Nada é enviado, nada é armazenado e não existe conta para criar.
Escreva em palavras-chave, não em frases
Coloque estas duas versões lado a lado:
- "A beautiful photograph of an old fisherman who is standing on a dock at sunset"
- "old fisherman, weathered face, standing on wooden dock, sunset, golden hour, 85mm, highly detailed"
Mesma ideia. A segunda dá ao modelo uma dúzia de âncoras visuais aproveitáveis em vez de três. Três hábitos respondem pela maior parte do ganho:
- Comece pelo sujeito. Os primeiros tokens tendem a dominar a composição, então enterrar o sujeito no fim faz o modelo tratá-lo como detalhe.
- Separe com vírgulas. Cada bloco entre vírgulas funciona como uma tag que o modelo consegue agarrar sozinha.
- Corte adjetivos que não descrevem nada visível. "amazing", "perfect" e "stunning" queimam tokens sem mover um pixel.
Uma ordem de blocos que se sustenta em qualquer checkpoint: sujeito, detalhes do sujeito, pose ou ação, cenário, iluminação, câmera ou meio, estilo de arte, tags de qualidade.
Treze blocos, zero enchimento. Se descrever imagens com esse nível de precisão é novo para você, o guia de prompts de imagem percorre cada bloco com exemplos de antes e depois.
Pesos: diga ao modelo o que de fato importa
A maioria das interfaces de Stable Diffusion (AUTOMATIC1111, Forge, ComfyUI, InvokeAI) aceita peso de atenção. Coloque um termo entre parênteses com um número e você ajusta a força com que o sampler puxa para ele.
(red scarf:1.3)— algo em torno de 30% mais forte que o padrão(background:0.7)— empurrado para trás, menos insistente((crown))— a forma antiga com aninhamento, cerca de 1,21x; o número explícito é mais fácil de raciocinar
Fique entre 0.6 e 1.5. Passando de 1.6, você começa a ver sangramento de cor, membros duplicados ou um sujeito que engole o quadro inteiro. Quando dois conceitos brigam, abaixe o que importa menos em vez de subir o que você quer. Baixar deforma a imagem muito menos do que forçar para cima.
O prompt negativo pesa mais aqui do que em qualquer outro lugar
Midjourney e DALL-E quase não te dão controle sobre o que evitar. O Stable Diffusion te dá um segundo prompt inteiro, e ele não é um filtro pregado no final. A cada passo, o sampler roda o modelo duas vezes: uma condicionada ao seu prompt, outra condicionada ao negativo, e depois empurra o resultado para longe do negativo. Deixe esse campo vazio e ele usa a string vazia em silêncio, e é por isso que imagens sem negativo saem tantas vezes moles e lavadas.
Mantenha o negativo honesto. Um paredão de 60 tokens com tudo que você já viu alguém recomendar achata o estilo junto com os defeitos. Comece por correções de anatomia, artefatos de compressão e marcas d'água, e só acrescente termos quando o problema realmente aparecer. Nosso gerador de prompt negativo monta uma lista inicial a partir do que você está fotografando, o que rende bem mais do que copiar o bloco de alguém num fórum.
CFG, steps, sampler e seed em português claro
- CFG scale decide o quanto o modelo obedece ao seu texto ao pé da letra. Perto de 3 ele improvisa. Perto de 7 ele te segue mantendo textura natural. Acima de 12 ele exagera: contraste estourado, cores fritas, mãos deformadas. Fotorrealismo gosta de 5 a 8. Ilustração tolera 7 a 10.
- Steps é a quantidade de passadas de denoise. Samplers modernos entregam imagens limpas entre 20 e 30. Ir até 80 compra basicamente uma espera maior e uma imagem levemente diferente, não melhor.
- Sampler é o algoritmo que remove o ruído. DPM++ 2M Karras é o padrão seguro. Euler a é não determinístico de um jeito útil e muda bastante conforme o número de steps. Escolha um e pare de mexer enquanto ajusta o prompt.
- Seed é o padrão de ruído inicial. Mesma seed, mesmo prompt, mesmas configurações, mesma imagem, sempre. Essa reprodutibilidade é a coisa mais útil que o Stable Diffusion tem e as ferramentas fechadas não têm.
SDXL e SD 1.5 pedem prompts diferentes
O SDXL tem um text encoder bem mais forte, então lida com frases curtas e naturais que confundiriam o 1.5. Dá para escrever "a woman reading a letter by candlelight, seventeenth century Dutch painting" e receber algo coerente. Ele também precisa de muito menos tags de qualidade. Correntes como "masterpiece, best quality, 8k, ultra detailed, trending on artstation" eram muleta para o encoder fraco do 1.5; no SDXL elas só acrescentam um verniz genérico.
O SD 1.5 recompensa o oposto: tags densas, pesos explícitos, negativos mais longos e muita dependência dos checkpoints da comunidade. Ele foi treinado em 512x512, então pedir 1024x1024 direto costuma render duas cabeças ou um torso duplicado. Gere em 512x768 e depois faça upscale.
O SDXL foi treinado em 1024x1024 e dá conta de 832x1216 ou 1216x832 tranquilamente. Dê a ele uma tela de 512px e a qualidade cai em vez de subir. Seja qual for a base, mantenha as dimensões como múltiplos de 64.
Checkpoints e LoRAs mudam o que suas palavras significam
O mesmo prompt dá resultados completamente diferentes em checkpoints diferentes, porque um checkpoint é um fine-tune com vocabulário próprio. Modelos de anime esperam tags no estilo Danbooru. Merges fotorrealistas esperam linguagem de câmera. Um modelo treinado em arte legendada responde a nomes de artistas e movimentos. Leia o que o autor do checkpoint escreveu no Hugging Face antes de supor que seu prompt vai funcionar lá, e confira a Stability AI para saber em que cada versão base foi de fato treinada.
LoRAs entram por cima e são chamados com sintaxe do tipo <lora:filmgrain_v2:0.7>. Aquele número no fim é a força. Dois ou três LoRAs a 1.0 cada vão brigar e virar papa; 0.5 a 0.8 costuma misturar melhor. Muitos LoRAs também precisam de uma palavra-gatilho no prompt para fazer qualquer coisa.
Itere com a seed travada
Esse é o fluxo que separa quem consegue o que quer de quem passa uma hora tentando a sorte.
- Gere um lote de quatro a oito com seeds aleatórias até uma composição chegar perto.
- Copie essa seed e trave.
- Mude exatamente uma coisa — um peso, uma tag, o CFG em um ponto.
- Gere de novo e compare. A composição fica no lugar, então a diferença que você vê é a diferença que você fez.
- Com o prompt do jeito certo, volte a seed para aleatória e produza variações em lote.
A mesma disciplina vale para modelos de texto, e o raciocínio por trás dela está nos fundamentos de engenharia de prompt. Escrever para outros modelos de imagem é outro dialeto: veja o gerador de prompts para Midjourney para sintaxe movida a parâmetros, ou o gerador de prompts para DALL·E se você quiser frases descritivas completas em vez de tags.
Perguntas frequentes
Ferramentas relacionadas
Continue lendo
Escreva seu próximo prompt em segundos
Transforme uma ideia solta em um prompt claro e estruturado que qualquer IA consegue seguir. Grátis, privado e sem precisar de conta.


