Saltar al contenido
Prompts de imágenes

Generador de Prompts para Stable Diffusion

Crea prompts por palabras clave, pesos y prompts negativos para SDXL y SD 1.5 en segundos.

Generador de prompts para Stable Diffusion creando un prompt de palabras clave con pesos y un prompt negativo para SDXL
Generador de Prompts para Stable Diffusion
Crea prompts por palabras clave, pesos y prompts negativos para SDXL y SD 1.5 en segundos.

Funciona por completo en tu navegador. Tu texto nunca se sube a ningún servidor.

Stable Diffusion no lee un prompt como lo hace un chatbot. Tokeniza tu texto, lo convierte en un embedding y usa ese embedding para guiar cada paso de eliminación de ruido, desde el ruido puro hasta la imagen. Una frase educada y bien construida gasta casi todo su presupuesto en palabras que no llevan ninguna señal visual. Una pila apretada de sustantivos y modificadores lo gasta todo en píxeles.

El generador de arriba es el preset para Stable Diffusion de nuestro generador de prompts de imágenes, así que te devuelve etiquetas separadas por comas con su prompt negativo a juego, en vez de prosa. Funciona entero en tu navegador: no se sube nada, no se guarda nada y no hay ninguna cuenta que crear.

Escribe en palabras clave, no en frases

Ponlas una al lado de la otra:

  • «A beautiful photograph of an old fisherman who is standing on a dock at sunset»
  • «old fisherman, weathered face, standing on wooden dock, sunset, golden hour, 85mm, highly detailed»

La misma idea. La segunda versión le da al modelo una docena de anclas visuales aprovechables en lugar de tres. Tres hábitos concentran casi toda la mejora:

  • Empieza por el sujeto. Los primeros tokens tienden a dominar la composición, así que si lo entierras al final el modelo lo trata como algo secundario.
  • Separa con comas. Cada bloque entre comas se comporta como una etiqueta a la que el modelo puede agarrarse por su cuenta.
  • Borra los adjetivos que no describen nada visible. «amazing», «perfect» y «stunning» queman tokens sin mover un solo píxel.

Un orden de bloques que aguanta bien en cualquier checkpoint: sujeto, detalles del sujeto, pose o acción, entorno, iluminación, cámara o medio, estilo artístico, etiquetas de calidad.

neon-lit ramen stall, rain-slick alley, Tokyo at night, steam rising, reflections on wet asphalt, cinematic lighting, 35mm, shallow depth of field, film grain

Trece bloques, cero relleno. Si describir imágenes con esta precisión te resulta nuevo, la guía sobre cómo escribir prompts de imágenes repasa bloque por bloque con ejemplos de antes y después.

Pesos: dile al modelo qué importa de verdad

Casi todas las interfaces de Stable Diffusion (AUTOMATIC1111, Forge, ComfyUI, InvokeAI) admiten pesos de atención. Envuelve un término entre paréntesis con un número y escalas la fuerza con la que el sampler tira hacia él.

  • (red scarf:1.3) — alrededor de un 30 % más fuerte que por defecto
  • (background:0.7) — se va al fondo, menos insistente
  • ((crown)) — la forma anidada de toda la vida, unas 1,21 veces; el número explícito es más fácil de razonar

Muévete entre 0,6 y 1,5. Pasando de 1,6 empiezan a aparecer sangrados de color, extremidades duplicadas o un sujeto que se come el encuadre entero. Cuando dos conceptos pelean, baja el que te importa menos en lugar de subir el que quieres. Bajar deforma la imagen mucho menos que forzar hacia arriba.

Consejo: Cambia un peso cada vez y deja la semilla fija. Si tocas el peso, la redacción y el sampler en la misma tirada, no aprendes nada sobre cuál de los tres hizo el trabajo.

El prompt negativo pesa aquí más que en ningún otro sitio

Midjourney y DALL·E casi no te dan control sobre lo que quieres evitar. Stable Diffusion te da un segundo prompt completo, y no es un filtro pegado al final. En cada paso el sampler ejecuta el modelo dos veces: una condicionada por tu prompt y otra por el negativo, y luego empuja el resultado lejos del negativo. Si dejas ese campo vacío, usa en silencio la cadena vacía; por eso tantas imágenes sin negativo salen blandas y embarradas.

portrait of an old fisherman, weathered face, salt-crusted beard, golden hour, harbour in background, 85mm, highly detailed Negative prompt: blurry, low quality, extra fingers, deformed hands, watermark, text, jpeg artifacts, oversaturated, cartoon

Mantén el negativo honesto. Un muro de 60 tokens con todo lo que has visto recomendado alguna vez te aplana el estilo junto con los defectos. Arranca con anatomía, artefactos de compresión y marcas de agua, y añade términos solo cuando veas el problema de verdad. Nuestro generador de prompts negativos arma una lista inicial a partir del sujeto que estás fotografiando, que rinde bastante mejor que copiar el bloque de otra persona en un foro.

CFG, steps, sampler y semilla, en cristiano

  • La escala CFG decide con cuánta literalidad obedece el modelo a tu texto. Cerca de 3 improvisa. Cerca de 7 te sigue sin perder textura natural. Por encima de 12 se pasa de frenada: contraste crujiente, colores quemados, manos rotas. El fotorrealismo se lleva bien con 5 a 8. La ilustración tolera de 7 a 10.
  • Los steps son las pasadas de eliminación de ruido. Los samplers modernos entregan imágenes limpias entre 20 y 30. Subir a 80 casi siempre te compra una espera más larga y una imagen distinta, no una mejor.
  • El sampler es el algoritmo que quita el ruido. DPM++ 2M Karras es la opción segura por defecto. Euler a es no determinista de una forma útil y se mueve bastante según el número de steps. Elige uno y no lo toques mientras ajustas el prompt.
  • La semilla es el patrón de ruido inicial. Misma semilla, mismo prompt y mismos ajustes dan la misma imagen, siempre. Esa reproducibilidad es lo más útil que tiene Stable Diffusion y no tienen las herramientas cerradas.

SDXL y SD 1.5 piden prompts distintos

SDXL trae un codificador de texto mucho más potente, así que digiere frases naturales cortas que confundirían a la 1.5. Puedes escribir «a woman reading a letter by candlelight, seventeenth century Dutch painting» y sale algo coherente. También necesita muchísimas menos etiquetas de calidad. Cadenas tipo «masterpiece, best quality, 8k, ultra detailed, trending on artstation» eran muletas para el codificador flojo de la 1.5; en SDXL casi solo añaden un brillo genérico.

SD 1.5 premia justo lo contrario: etiquetas densas, pesos explícitos, negativos largos y mucho apoyo en checkpoints de la comunidad. Se entrenó a 512x512, así que pedirle 1024x1024 de entrada suele dar dos cabezas o un torso doblado. Genera a 512x768 y luego escala.

SDXL se entrenó a 1024x1024 y aguanta sin problema 832x1216 o 1216x832. Dale un lienzo de 512 px y la calidad baja en vez de subir. Uses la base que uses, mantén las dimensiones en múltiplos de 64.

Los checkpoints y los LoRA cambian lo que significan tus palabras

El mismo prompt da resultados salvajemente distintos según el checkpoint, porque un checkpoint es un fine-tune con su propio vocabulario. Los modelos de anime esperan etiquetas al estilo Danbooru. Los merges fotorrealistas esperan lenguaje de cámara. Un modelo entrenado con arte descrito responde a nombres de artistas y de movimientos. Lee lo que dejó escrito el autor del checkpoint en Hugging Face antes de dar por hecho que tu prompt se traslada, y consulta Stability AI para ver con qué se entrenó realmente cada versión base.

Los LoRA se montan encima y se invocan con una sintaxis del tipo <lora:filmgrain_v2:0.7>. Ese número final es la fuerza. Dos o tres LoRA a 1.0 cada uno pelean entre sí y producen papilla; entre 0,5 y 0,8 suelen mezclarse mejor. Muchos LoRA además necesitan una palabra de activación en el prompt para hacer absolutamente nada.

Itera con la semilla fija

Este es el flujo que separa a quien consigue lo que quería de quien se pasa una hora dándole a generar.

  1. Genera un lote de cuatro a ocho con semillas aleatorias hasta que una composición se acerque.
  2. Copia esa semilla y bloquéala.
  3. Cambia exactamente una cosa: un peso, una etiqueta, un punto de CFG.
  4. Vuelve a generar y compara. La composición se queda quieta, así que la diferencia que ves es la diferencia que hiciste tú.
  5. Cuando el prompt esté fino, devuelve la semilla a aleatorio y saca variaciones por lotes.
architectural photograph, brutalist concrete library, (morning fog:1.2), low angle, wide shot, cold overcast light, ultra wide 16mm lens, sharp detail Negative prompt: people, cars, warm tones, blurry, distorted perspective, low resolution

La misma disciplina vale para los modelos de texto, y el razonamiento que hay detrás está desarrollado en fundamentos de ingeniería de prompts. Escribir para otros modelos de imagen es otro dialecto: mira el generador de prompts para Midjourney si buscas sintaxis de parámetros, o el generador de prompts para DALL·E si prefieres frases descriptivas completas en lugar de etiquetas.

FAQ

Preguntas frecuentes

Sí, del todo. No hay créditos, ni límite de prueba, ni plan de pago que bloquee el resultado. GetEasyPrompt ejecuta el generador en tu navegador, así que no pagamos por petición y no hay nada que medir.
No. No hay registro, ni inicio de sesión, ni clave de API. El texto de tu prompt se queda en tu dispositivo y nunca se envía a un servidor, lo que también significa que nada de lo que escribas aquí queda registrado ni guardado.
Un prompt negativo es una segunda lista de términos de los que el sampler se aleja activamente en cada paso de eliminación de ruido, no un filtro aplicado al final. Dejarlo vacío es la razón de que tantas imágenes salgan blandas o embarradas. Empieza con términos de anatomía y artefactos como extra fingers, deformed hands, watermark y jpeg artifacts, y añade más solo cuando veas un problema concreto.
CFG de 5 a 8 con 20 a 30 steps cubre casi todo el trabajo fotorrealista, y de 7 a 10 encaja mejor con ilustración y estilos marcados. Por encima de CFG 12 la imagen se fríe: contraste crujiente, colores reventados, manos rotas. Pasar de unos 40 steps rara vez mejora nada con samplers modernos como DPM++ 2M Karras.
Sí. SDXL tiene un codificador de texto más fuerte, así que las frases naturales cortas funcionan y las cadenas largas de etiquetas de calidad tipo masterpiece, best quality, 8k solo añaden un brillo genérico. SD 1.5 pide etiquetas densas separadas por comas, pesos explícitos y un prompt negativo más largo. La resolución también cambia: genera en torno a 512x768 en la 1.5 y a 1024x1024 o 832x1216 en SDXL.
Los prompts que generas aquí son tuyos y puedes usarlos como quieras, sin atribución. Que las imágenes resultantes sean seguras a nivel comercial depende de la licencia del modelo, así que revisa las condiciones del checkpoint o del LoRA concreto que hayas cargado: muchos fine-tunes de la comunidad en Hugging Face llevan cláusulas de uso no comercial o de atribución que la licencia base de Stability no impone.

Escribe tu próximo prompt en segundos

Convierte una idea difusa en un prompt claro y estructurado que cualquier IA pueda seguir. Gratis, privado y sin cuenta.

Abrir el Optimizador de PromptsVer todas las herramientas