Generador de Prompts para Stable Diffusion
Crea prompts por palabras clave, pesos y prompts negativos para SDXL y SD 1.5 en segundos.

Funciona por completo en tu navegador. Tu texto nunca se sube a ningún servidor.
Stable Diffusion no lee un prompt como lo hace un chatbot. Tokeniza tu texto, lo convierte en un embedding y usa ese embedding para guiar cada paso de eliminación de ruido, desde el ruido puro hasta la imagen. Una frase educada y bien construida gasta casi todo su presupuesto en palabras que no llevan ninguna señal visual. Una pila apretada de sustantivos y modificadores lo gasta todo en píxeles.
El generador de arriba es el preset para Stable Diffusion de nuestro generador de prompts de imágenes, así que te devuelve etiquetas separadas por comas con su prompt negativo a juego, en vez de prosa. Funciona entero en tu navegador: no se sube nada, no se guarda nada y no hay ninguna cuenta que crear.
Escribe en palabras clave, no en frases
Ponlas una al lado de la otra:
- «A beautiful photograph of an old fisherman who is standing on a dock at sunset»
- «old fisherman, weathered face, standing on wooden dock, sunset, golden hour, 85mm, highly detailed»
La misma idea. La segunda versión le da al modelo una docena de anclas visuales aprovechables en lugar de tres. Tres hábitos concentran casi toda la mejora:
- Empieza por el sujeto. Los primeros tokens tienden a dominar la composición, así que si lo entierras al final el modelo lo trata como algo secundario.
- Separa con comas. Cada bloque entre comas se comporta como una etiqueta a la que el modelo puede agarrarse por su cuenta.
- Borra los adjetivos que no describen nada visible. «amazing», «perfect» y «stunning» queman tokens sin mover un solo píxel.
Un orden de bloques que aguanta bien en cualquier checkpoint: sujeto, detalles del sujeto, pose o acción, entorno, iluminación, cámara o medio, estilo artístico, etiquetas de calidad.
Trece bloques, cero relleno. Si describir imágenes con esta precisión te resulta nuevo, la guía sobre cómo escribir prompts de imágenes repasa bloque por bloque con ejemplos de antes y después.
Pesos: dile al modelo qué importa de verdad
Casi todas las interfaces de Stable Diffusion (AUTOMATIC1111, Forge, ComfyUI, InvokeAI) admiten pesos de atención. Envuelve un término entre paréntesis con un número y escalas la fuerza con la que el sampler tira hacia él.
(red scarf:1.3)— alrededor de un 30 % más fuerte que por defecto(background:0.7)— se va al fondo, menos insistente((crown))— la forma anidada de toda la vida, unas 1,21 veces; el número explícito es más fácil de razonar
Muévete entre 0,6 y 1,5. Pasando de 1,6 empiezan a aparecer sangrados de color, extremidades duplicadas o un sujeto que se come el encuadre entero. Cuando dos conceptos pelean, baja el que te importa menos en lugar de subir el que quieres. Bajar deforma la imagen mucho menos que forzar hacia arriba.
El prompt negativo pesa aquí más que en ningún otro sitio
Midjourney y DALL·E casi no te dan control sobre lo que quieres evitar. Stable Diffusion te da un segundo prompt completo, y no es un filtro pegado al final. En cada paso el sampler ejecuta el modelo dos veces: una condicionada por tu prompt y otra por el negativo, y luego empuja el resultado lejos del negativo. Si dejas ese campo vacío, usa en silencio la cadena vacía; por eso tantas imágenes sin negativo salen blandas y embarradas.
Mantén el negativo honesto. Un muro de 60 tokens con todo lo que has visto recomendado alguna vez te aplana el estilo junto con los defectos. Arranca con anatomía, artefactos de compresión y marcas de agua, y añade términos solo cuando veas el problema de verdad. Nuestro generador de prompts negativos arma una lista inicial a partir del sujeto que estás fotografiando, que rinde bastante mejor que copiar el bloque de otra persona en un foro.
CFG, steps, sampler y semilla, en cristiano
- La escala CFG decide con cuánta literalidad obedece el modelo a tu texto. Cerca de 3 improvisa. Cerca de 7 te sigue sin perder textura natural. Por encima de 12 se pasa de frenada: contraste crujiente, colores quemados, manos rotas. El fotorrealismo se lleva bien con 5 a 8. La ilustración tolera de 7 a 10.
- Los steps son las pasadas de eliminación de ruido. Los samplers modernos entregan imágenes limpias entre 20 y 30. Subir a 80 casi siempre te compra una espera más larga y una imagen distinta, no una mejor.
- El sampler es el algoritmo que quita el ruido. DPM++ 2M Karras es la opción segura por defecto. Euler a es no determinista de una forma útil y se mueve bastante según el número de steps. Elige uno y no lo toques mientras ajustas el prompt.
- La semilla es el patrón de ruido inicial. Misma semilla, mismo prompt y mismos ajustes dan la misma imagen, siempre. Esa reproducibilidad es lo más útil que tiene Stable Diffusion y no tienen las herramientas cerradas.
SDXL y SD 1.5 piden prompts distintos
SDXL trae un codificador de texto mucho más potente, así que digiere frases naturales cortas que confundirían a la 1.5. Puedes escribir «a woman reading a letter by candlelight, seventeenth century Dutch painting» y sale algo coherente. También necesita muchísimas menos etiquetas de calidad. Cadenas tipo «masterpiece, best quality, 8k, ultra detailed, trending on artstation» eran muletas para el codificador flojo de la 1.5; en SDXL casi solo añaden un brillo genérico.
SD 1.5 premia justo lo contrario: etiquetas densas, pesos explícitos, negativos largos y mucho apoyo en checkpoints de la comunidad. Se entrenó a 512x512, así que pedirle 1024x1024 de entrada suele dar dos cabezas o un torso doblado. Genera a 512x768 y luego escala.
SDXL se entrenó a 1024x1024 y aguanta sin problema 832x1216 o 1216x832. Dale un lienzo de 512 px y la calidad baja en vez de subir. Uses la base que uses, mantén las dimensiones en múltiplos de 64.
Los checkpoints y los LoRA cambian lo que significan tus palabras
El mismo prompt da resultados salvajemente distintos según el checkpoint, porque un checkpoint es un fine-tune con su propio vocabulario. Los modelos de anime esperan etiquetas al estilo Danbooru. Los merges fotorrealistas esperan lenguaje de cámara. Un modelo entrenado con arte descrito responde a nombres de artistas y de movimientos. Lee lo que dejó escrito el autor del checkpoint en Hugging Face antes de dar por hecho que tu prompt se traslada, y consulta Stability AI para ver con qué se entrenó realmente cada versión base.
Los LoRA se montan encima y se invocan con una sintaxis del tipo <lora:filmgrain_v2:0.7>. Ese número final es la fuerza. Dos o tres LoRA a 1.0 cada uno pelean entre sí y producen papilla; entre 0,5 y 0,8 suelen mezclarse mejor. Muchos LoRA además necesitan una palabra de activación en el prompt para hacer absolutamente nada.
Itera con la semilla fija
Este es el flujo que separa a quien consigue lo que quería de quien se pasa una hora dándole a generar.
- Genera un lote de cuatro a ocho con semillas aleatorias hasta que una composición se acerque.
- Copia esa semilla y bloquéala.
- Cambia exactamente una cosa: un peso, una etiqueta, un punto de CFG.
- Vuelve a generar y compara. La composición se queda quieta, así que la diferencia que ves es la diferencia que hiciste tú.
- Cuando el prompt esté fino, devuelve la semilla a aleatorio y saca variaciones por lotes.
La misma disciplina vale para los modelos de texto, y el razonamiento que hay detrás está desarrollado en fundamentos de ingeniería de prompts. Escribir para otros modelos de imagen es otro dialecto: mira el generador de prompts para Midjourney si buscas sintaxis de parámetros, o el generador de prompts para DALL·E si prefieres frases descriptivas completas en lugar de etiquetas.
Preguntas frecuentes
Herramientas relacionadas
Sigue leyendo
Escribe tu próximo prompt en segundos
Convierte una idea difusa en un prompt claro y estructurado que cualquier IA pueda seguir. Gratis, privado y sin cuenta.


