Installer WAN 2.1 dans ComfyUI pour faire du TXT2VID
- Gaetan Michel
- 14 mai
- 4 min de lecture
Dernière mise à jour : 12 juin
Le guide complet débutant (Windows + RTX NVIDIA)
WAN 2.1 est devenu l’un des modèles vidéo locaux les plus impressionnants du moment pour générer des vidéos IA directement depuis un prompt texte dans ComfyUI. Avec une bonne configuration, même un laptop équipé d’une RTX série 40 peut produire des vidéos bluffantes en local, sans cloud ni abonnement.
Dans ce guide ultra complet, vous allez apprendre :
Installer WAN 2.1 dans ComfyUI
Télécharger les bons modèles
Configurer un workflow TXT2VID propre
Comprendre les réglages importants
Optimiser les performances VRAM
Éviter les erreurs fréquentes
Obtenir des vidéos beaucoup plus fluides et propres
Et surtout : comprendre ce que vous faites, sans copier-coller un workflow “magique” incompréhensible.

Pourquoi WAN 2.1 impressionne autant ?
WAN 2.1 est un modèle vidéo open source capable de :
générer des vidéos depuis un texte
faire du image-to-video
gérer des mouvements crédibles
produire des vidéos cohérentes
fonctionner sur des GPU “grand public”
Contrairement à beaucoup d’anciens workflows vidéo IA :
les mouvements sont plus naturels
les arrière-plans bougent moins bizarrement
les personnages gardent mieux leur identité
les détails restent plus stables
Le modèle existe en plusieurs versions :
Modèle | Usage | VRAM recommandée |
WAN 1.3B | Rapide / léger | 8–12 Go |
WAN 14B FP8 | Qualité élevée | 12–16 Go |
WAN 14B BF16 | Très haute qualité | 24 Go+ |
Pour la majorité des débutants, le meilleur compromis est actuellement le WAN 14B FP8.
Configuration recommandée
Minimum conseillé
RTX 3060 12 Go
32 Go RAM
SSD NVMe
Windows 11
Python installé proprement
ComfyUI récent
Étape 1 — Mettre ComfyUI à jour
Avant toute chose :
Dans ComfyUI :
ouvre Manager
clique sur :
Update ComfyUI
Update All
Puis redémarre complètement ComfyUI.
WAN nécessite souvent :
des nodes récents
des dépendances CUDA récentes
des loaders spécifiques
C’est LA cause numéro 1 des erreurs.
Étape 2 — Télécharger les modèles WAN 2.1
Modèles officiels Hugging Face
WAN 14B TXT2VID FP8
Pack ComfyUI repackagé
Fichiers à télécharger
1 — Diffusion model
Télécharger :
wan2.1_t2v_14B_fp8_e4m3fn.safetensors
À placer dans :
ComfyUI/models/diffusion_models
2 — Text encoder
Télécharger :
umt5_xxl_fp8_e4m3fn_scaled.safetensors
À placer dans :
ComfyUI/models/text_encoders
3 — CLIP Vision
Télécharger :
clip_vision_h.safetensors
À placer dans :
ComfyUI/models/clip_vision
4 — VAE
Télécharger :
wan_2.1_vae.safetensors
À placer dans :
ComfyUI/models/vae
Étape 3 — Installer les custom nodes nécessaires
Le plus simple :
Dans ComfyUI :
Manager → Install Missing Custom Nodes
Puis installe automatiquement :
tous les nodes rouges
les loaders WAN
les encodeurs vidéo
Étape 4 — Charger un workflow TXT2VID
Le plus simple pour débuter :
Télécharge le workflow JSON puis :
glisser-déposer dans ComfyUI
Structure d’un workflow WAN TXT2VID
Un workflow WAN typique contient :
Prompt
↓
Text Encoder
↓
WAN Loader
↓
Sampler
↓
Video Decoder
↓
Export MP4

Réglages recommandés pour débuter
Résolution
Très conseillé au début
832x480
Pourquoi ?
Parce que :
beaucoup moins de VRAM
beaucoup plus rapide
très bon rendu
beaucoup moins de bugs
Nombre de frames
Débutant :
49 frames
≈ 2 secondes.
Pour éviter :
temps de génération énormes
crash VRAM
incohérences vidéo
FPS
16 FPS
Excellent compromis fluidité/performance.
Réglages KSampler recommandés
Sampler conseillé
uni_pc
ou
dpmpp_2m
Scheduler
simple
Steps
Rapide
20
Qualité élevée
30 à 40
CFG
WAN aime souvent :
4 à 6
Contrairement à SDXL où on monte parfois plus haut.
CFG trop élevé :
mouvements bizarres
scintillements
déformations

Mon retour d'expérience pour améliorer les vidéos
1 — Décrire un mouvement
Erreur débutant :
a woman standing in a forest
Le modèle ne sait pas quoi animer.
Bon prompt
a woman slowly walking through a mystical forest, cinematic camera movement, wind in the hair, dynamic lighting
Toujours décrire :
mouvement
caméra
ambiance
interaction
2 — Les mouvements de caméra changent tout
Ajoute souvent :
cinematic camera movement
slow camera pan
drone shot
handheld camera
tracking shot
Ça améliore énormément le réalisme.
3 — Éviter les vidéos trop longues
WAN est excellent sur :
clips courts
séquences dynamiques
animations rapides
Mais :
plus la vidéo est longue
plus les incohérences arrivent
4 — TeaCache est presque indispensable
TeaCache :
accélère énormément WAN
réduit le temps de génération
garde une bonne qualité
Sur certaines configs : gain x2 à x4.
5 — Le vrai secret : image-to-video
Beaucoup de créateurs pros :
génèrent une image parfaite avec SDXL
utilisent WAN en image-to-video
Résultat :
vidéos beaucoup plus stables
personnages cohérents
moins d’artefacts
Utiliser des LoRA avec WAN
Oui, WAN supporte :
des LoRA personnages
des motion LoRA
des styles vidéo
Mais :
tous les LoRA SDXL ne sont PAS compatibles
certains donnent du grain
certains détruisent la cohérence
Les meilleurs résultats :
LoRA entraînés spécifiquement pour WAN
motion LoRA subtils
faible strength
Réglages LoRA conseillés
Strength
0.6 à 0.9
Évite :
1.4+
Sinon :
visages détruits
mouvements instables
flickering
Erreurs fréquentes des débutants
Out of Memory
Cause :
résolution trop élevée
trop de frames
mauvais modèle
Solution :
passer en 480p
réduire les frames
utiliser FP8
Vidéo qui tremble
Cause :
CFG trop élevé
prompt trop chargé
sampler mauvais
Arrière-plan qui fond
Cause :
mouvement trop agressif
caméra mal décrite
vidéo trop longue
Workflow recommandé pour débuter
Mon conseil réel
Étape 1
TXT2IMG SDXL :
Juggernaut
RealVisXL
Flux
Étape 2
Passage dans WAN I2V
Étape 3
Upscale vidéo
Étape 4
Interpolation RIFE
C’est là qu’on commence à obtenir des résultats “cinéma IA”.
Conseils performance RTX 12 Go
Avec une RTX 5070 Ti Laptop 12 Go :
Très confortable
WAN 1.3B
480p
49 frames
TeaCache
Faisable
WAN 14B FP8
720p optimisé
petites vidéos
Difficile
longues vidéos 720p+
BF16
gros batchs
Faut-il utiliser WAN avec Comfyui aujourd’hui ?
Oui clairement.
Pour de l’IA locale :
c’est l’un des meilleurs rapports qualité/performance actuels
énorme communauté
WAN est optimisé pour ComfyUI
évolue extrêmement vite
Et surtout : il tourne réellement sur des machines “normales”.
Ce qui change tout pour les créateurs IA locaux.
Liens utiles
WAN officiel
Pack ComfyUI simplifié
Ressources communauté
Conclusion
WAN 2.1 transforme complètement la génération vidéo locale.
Avec :
un bon workflow
des prompts adaptés
une résolution raisonnable
quelques optimisations intelligentes
Même un simple laptop RTX moderne peut produire des vidéos IA impressionnantes.