Vous avez peut‑être rencontré des problèmes comme « I can't get an upper-body-only image… », « I can't get a full-body image… », ou « The torso looks long… ». Ces soucis proviennent souvent d’un choix inadéquat de la taille d’image. En adoptant des dimensions optimales, vous augmentez les chances d’obtenir des corps proportionnés et des détails convaincants. Cet article explique les tailles d’image recommandées et comment les ajuster selon le mode portrait, carré et paysage, avec des conseils tirés des descriptions et exemples fournis dans le matériel de référence.
Pourquoi la taille d’image importe
La taille et le rapport d’aspect influencent directement la stabilité de la génération et la fidélité des proportions. Stable Diffusion est principalement entraîné sur des tailles spécifiques (par exemple 512×512, 1024×1024 pour certains modèles), et dépasser largement ces budgets peut provoquer des déformations, des sujets répétés ou des arrière‑plans brouillés. Il est donc préférable de générer à la résolution native du modèle, puis d’upscaler si nécessaire.
Dimensions recommandées selon l’orientation
Limites de taille et effets sur la proportion
Les images trop grandes peuvent dégrader les proportions du corps, en particulier lorsque Width et Height dépassent 1024. À 1300×1300 environ, le torse et l’arrière‑plan peuvent montrer des résultats médiocres. Le plus sûr est de rester autour de 1024 comme valeur maximale recommandée pour beaucoup de modèles (notamment SDXL et variantes associées). Le ratio largeur/hauteur (aspect ratio) et l’alignement avec la résolution d’entraînement jouent un rôle crucial dans la qualité finale.
Versions et budgets des modèles
Les budgets et les budgets d’entraînement varient selon le modèle utilisé :
- SD 1.5 est optimisé pour 512×512; certaines configurations acceptent 768×768, mais l’échelle native demeure 512×512.
- SDXL et SD 3.5 permettent des résolutions plus élevées (1024×1024 et au-delà, avec des variantes 1 MP ou plus selon le bucket).
- FLUX propose des sorties allant jusqu’à 4 MP selon les variantes, avec une meilleure fidélité textuelle et une meilleure gestion des tailles multiples.
Pour obtenir les meilleurs résultats, générez à la résolution native du modèle, puis upscalez et recadrez selon besoin. Générer à des résolutions non natives peut provoquer des doubles sujets, des artefacts et une perte de détails.
Bonnes pratiques pour obtenir des corps proportionnés
- Commencez par une résolution sûre comme 512×512 pour SD 1.5 ou 1024×1024 pour SDXL/SD 3.5, puis évaluez les résultats et ajustez si nécessaire.
- Évitez les résolutions extrêmes (par exemple 1300×1300) qui nuisent à la proportion du torse et des membres.
- Utilisez tiling ou upscaling dédié pour des tailles plus élevées et restez dans les budgets du modèle afin de limiter les déformations.
- Choisissez des rapports d’aspect adaptés à votre sujet : portrait pour des personnages complets en position debout, paysage pour des arrière‑plans plus larges; le carré convient très bien au buste et aux poses assises.
- Respectez les contraintes techniques comme la divisibilité par 8 (ou par 16 selon le modèle) pour assurer une correspondance correcte au niveau latent.
Concrètement, comment fixer la taille dans Stable Diffusion
Pour changer la taille, réglez Width et Height dans les options du générateur.:
Notes pratiques :
- Pour obtenir des corps complets en position debout, privilégier portrait 512×768 ou carré 512×512/768×768 selon le modèle.
- Pour des images avec du texte ou des détails fins, privilégier des tailles proches du budget d’entraînement puis upscale et recadrez avec précaution.
- Gardez à l’esprit que les modèles XL et variantes offrent de meilleures résolutions et que le choix du modèle influence directement les tailles utiles.
Tableau récapitulatif des tailles et recommandations
| Orientation | Taille recommandée | Pourquoi |
|---|---|---|
| Portrait | 512×768 | Proportions plus stables, corps debout faciles à générer |
| Carré | 512×512, 768×768, 1024×1024 | Portraits et bustes bien rendus, flexibilité |
| Paysage | 768×512 | Bonne gestion des arrière‑plans; risques de déformation du corps |
Conseils avancés et considérations techniques
La résolution native du modèle guide la qualité. Stable Diffusion v1.1 est optimisé pour 256×256, tandis que les versions ultérieures aiment 512×512 et au‑delà selon le modèle. SDXL et SD 3.5 utilisent des budgets autour de 1 MP par image, avec des possibilités d’upscale après génération. Assurez‑vous que width et height soient divisibles par 8 (ou par 16 selon le modèle) pour éviter des artefacts dans l’espace latent.
Pour les utilisateurs avancés qui veulent du 4K, des techniques d’upscaling et de tiling permettent de générer des images haute résolution sans déstabiliser les proportions, à condition d’ajuster les paramètres comme les steps et les inversions textuelles (textual inversions) et d’éviter des balances de densité trop fortes qui risqueraient de déformer les traits.
Exemples d’applications et cas d’usage
En pratique, un modèle XL peut offrir de meilleures performances à 1024×1024, et des stratégies comme tiling et upscaling dédiés permettent d’obtenir des résultats propres pour des affiches ou des héroïnes en bannière. Pour des images destinées au web ou à l’impression, générer à la résolution maximale du modèle et optimiser ensuite via des outils d’upscale spécialisés (Real‑ESRGAN, 4x‑UltraSharp, etc.) est une approche recommandée.
