Générer une vidéo IA gratuitement en 2026 : MiniMax H3, HunyuanVideo, WAN 2.2, guide complet et config PC
Dernière mise à jour : il y a 2 heures
La génération vidéo par intelligence artificielle n’est plus réservée aux plateformes cloud comme Kling, Runway, Veo ou Sora. En 2026, il est possible de générer une vidéo IA localement sur son propre PC, sans acheter de crédits à chaque essai et sans envoyer ses images sur un serveur distant.
Et l’été 2026 a changé la donne. Avec MiniMax H3, dont les poids ont été publiés le 3 août, un modèle de niveau professionnel génère désormais la vidéo et le son (dialogues, bruitages, musique) en une seule passe, directement sur votre machine.
J’ai testé plusieurs familles de modèles et différentes interfaces sur mes propres machines : MiniMax H3, HunyuanVideo 1.5, WAN 2.2, LTX, CogVideoX et AnimateDiff. Mon objectif n’est pas de désigner le modèle qui produit la démonstration officielle la plus spectaculaire, mais de déterminer ce que l’on peut réellement installer, lancer et exploiter avec une carte graphique grand public.
Dans ce guide, je vais expliquer simplement :
comment fonctionne une IA vidéo locale ;
la différence entre Text-to-Video, Image-to-Video et génération à partir de références ;
quelle quantité de VRAM est réellement nécessaire ;
quel modèle choisir entre MiniMax H3, HunyuanVideo 1.5, WAN 2.2, LTX, CogVideoX et AnimateDiff ;
comment installer et utiliser ces modèles avec Maestro, ComfyUI, Wan2GP ou Pinokio ;
ce que disent les licences, un point essentiel quand on vit en France ;
comment construire un workflow complet, de l’image de départ jusqu’à la vidéo finale ;
comment résoudre les erreurs les plus fréquentes.
La réponse rapide : MiniMax H3 est aujourd’hui le meilleur modèle de génération vidéo que l’on puisse faire tourner en local. Le moyen le plus simple de l’utiliser est Maestro sur Pinokio, mis à jour pratiquement tous les jours pour améliorer le fonctionnement et les possibilités de H3. HunyuanVideo 1.5 reste une excellente alternative pour la qualité d’image, WAN 2.2 le meilleur compromis entre polyvalence, légèreté et liberté de licence, et LTX le choix de la vitesse. En France, H3 comme HunyuanVideo imposent de vérifier la licence avant toute utilisation : j’y reviens en détail plus bas.

Qu’est-ce qu’un générateur de vidéo IA local ?
Un générateur de vidéo IA local est un modèle exécuté directement sur votre ordinateur. Le prompt, l’image de référence, les poids du modèle et le calcul restent sur votre machine pendant la génération.
Il faut distinguer trois éléments qui sont souvent confondus :
le modèle, par exemple MiniMax H3, HunyuanVideo 1.5, WAN 2.2 ou LTX ;
l’interface, par exemple Maestro, ComfyUI ou Wan2GP ;
le lanceur d’installation, par exemple Pinokio.
Pinokio ne génère donc pas lui-même une vidéo. Il facilite l’installation et le lancement d’applications capables de charger les modèles. De la même manière, ComfyUI n’est pas un modèle : c’est une interface à nodes permettant de construire un workflow autour de nombreux modèles différents. Maestro, lui, est un studio de création qui s’appuie sur Wan2GP pour faire tourner les modèles vidéo, dont MiniMax H3.
La chaîne complète ressemble à ceci :

Cette distinction évite beaucoup d’erreurs. Télécharger ComfyUI ne suffit pas : il faut ensuite récupérer le bon modèle, son VAE, ses encodeurs de texte et parfois des nodes complémentaires. À l’inverse, télécharger un fichier de plusieurs gigaoctets depuis Hugging Face ne sert à rien si l’interface ne sait pas le charger.
Pourquoi générer ses vidéos IA localement ?
Ne plus compter les crédits à chaque tentative
Une vidéo réussie demande rarement une seule génération. Il faut tester plusieurs prompts, seeds, durées, mouvements de caméra et images de départ. Sur une plateforme facturée au crédit, chaque essai raté devient frustrant.
En local, le coût principal est déjà engagé : l’achat du PC. Il reste la consommation électrique et le temps de calcul, mais vous pouvez relancer une scène dix ou vingt fois sans voir disparaître un portefeuille de crédits. Cette liberté est essentielle pour apprendre, car on progresse surtout en comparant des variantes.
Garder ses images et ses projets sur son PC
Une installation locale permet de conserver les images de référence, les prompts et les vidéos sur votre ordinateur. C’est utile pour une création personnelle, un prototype commercial ou un projet confidentiel.
Une connexion reste généralement nécessaire pour télécharger les applications, les modèles et les mises à jour. Une fois les fichiers installés, de nombreux workflows peuvent ensuite fonctionner hors ligne. Il faut néanmoins vérifier chaque application : certaines fonctions facultatives s’appuient sur une API distante. C’est le cas de MiniMax H3, dont le module de réécriture des prompts et celui qui monte la vidéo en 2K restent des services en ligne.
Contrôler toute la chaîne de génération
Avec ComfyUI, il est possible de choisir précisément :
le modèle et sa quantification ;
le prompt positif et, lorsque le modèle l’utilise, le prompt négatif ;
la seed ;
la résolution ;
le nombre de frames ;
le nombre d’étapes ;
le sampler et le scheduler ;
la force du mouvement ;
l’offload vers la RAM ;
l’interpolation ;
l’upscale ;
le codec et le format d’export.
Ce contrôle demande davantage d’apprentissage qu’un bouton « Générer », mais il permet de comprendre pourquoi une scène fonctionne. Il devient aussi possible de remplacer une seule partie du workflow sans reconstruire tout le projet.
Construire un véritable studio de création local
La génération vidéo n’est qu’une brique. Un projet complet peut associer :
FLUX, SDXL, Qwen Image ou Juggernaut XL pour les images de départ ;
MiniMax H3, HunyuanVideo, WAN ou LTX pour les animer ;
RIFE pour augmenter la fluidité ;
un modèle d’upscale pour agrandir l’image ;
un outil de génération musicale ou vocale ;
un logiciel de montage pour assembler les plans.
Avec H3, une partie de la bande-son peut désormais être générée en même temps que l’image. La musique d’ensemble et la voix off restent toutefois plus faciles à maîtriser avec des outils dédiés, comme ceux intégrés à Maestro.
J’utilise cette logique pour créer plusieurs scènes séparées, puis les réunir au montage. Les modèles actuels sont bien plus efficaces sur quelques secondes maîtrisées que sur une longue séquence censée tout raconter d’un seul coup.
Text-to-Video, Image-to-Video, TI2V et références : quelle différence ?
Text-to-Video : générer une vidéo depuis un texte
Le Text-to-Video, abrégé T2V ou TXT2VID, part uniquement d’une description.
Exemple :
A medieval blacksmith forging a glowing sword inside a dark workshop, sparks flying through the air, slow cinematic dolly-in, volumetric light, stable camera, realistic motion.
Le modèle doit inventer simultanément le personnage, le décor, les objets, l’éclairage, le cadrage et le mouvement. Cette liberté est impressionnante, mais elle augmente le risque d’incohérence : visage qui change, mains déformées, accessoires qui apparaissent ou caméra incontrôlable.
Le Text-to-Video convient bien pour explorer une idée, générer un paysage ou obtenir une composition inattendue. Pour conserver précisément un personnage ou une direction artistique, je préfère généralement partir d’une image.
Image-to-Video : animer une image existante
L’Image-to-Video, abrégé I2V ou IMG2VID, utilise une image de départ. Celle-ci peut être une photo ou une image générée avec une IA locale.
Le modèle connaît déjà :
le visage et la tenue du personnage ;
le décor ;
la palette de couleurs ;
la lumière ;
le cadrage ;
la direction artistique.
Il doit principalement ajouter du mouvement. Dans mes essais, c’est la méthode la plus fiable pour produire un plan propre et conserver une identité visuelle d’une scène à l’autre.
TI2V : un même modèle pour le texte et l’image
WAN 2.2 TI2V‑5B est souvent recherché sous les noms « WAN 2.2 5B », « WAN2.2 TI2V 5B » ou « WAN 2.2 5B image to video ». TI2V signifie ici que le modèle réunit des capacités de génération depuis le texte et depuis une image.
Le dépôt officiel de WAN 2.2 indique que la version TI2V‑5B prend en charge la génération en 720p. Cela ne veut pas dire que chaque PC pourra générer confortablement en 1280 × 704 avec tous les paramètres au maximum. La quantification, l’offload et l’interface utilisée changent fortement la mémoire nécessaire et la vitesse.
Première et dernière image, références : les modes de MiniMax H3
MiniMax H3 va plus loin. Sa version téléchargeable, H3-Base, existe en deux checkpoints (fiche ComfyUI) :
FL2VA : texte vers vidéo, première image, dernière image, ou première et dernière image pour imposer le début et la fin d’un plan ;
Ref2VA : génération à partir de références, jusqu’à 9 images, 3 vidéos et 3 extraits audio.
Le mode références est idéal pour garder le même personnage d’un plan à l’autre : on lui montre le visage, la tenue et le décor, puis on décrit l’action. Dans les deux cas, H3 génère le son stéréo en même temps que l’image.
Méthode | Entrée | Principal avantage | Principale limite |
Text-to-Video | Prompt | Liberté créative | Cohérence plus difficile |
Image-to-Video | Image + prompt | Identité et composition mieux conservées | Dépend de la qualité de l’image |
TI2V | Texte ou image selon le workflow | Polyvalence dans une même famille | Installation parfois plus complexe |
Première et dernière image | Deux images + prompt | Début et fin du plan maîtrisés | Transition parfois forcée |
Références (H3 Ref2VA) | Images, vidéos, audio + prompt | Personnage et univers cohérents, son inclus | Modèle lourd, plus lent |
Quel matériel faut-il pour générer une vidéo IA localement ?
La VRAM est le premier critère
La vidéo IA demande beaucoup plus de mémoire que la génération d’une image fixe. Le modèle doit traiter plusieurs dizaines d’images en maintenant une cohérence temporelle.
VRAM | Ce que l’on peut raisonnablement viser |
6 à 8 Go | Modèles légers, quantification, faible résolution et clips courts |
12 Go | WAN 2.2 5B et modèles optimisés, avec compromis et offload |
16 Go | Très bon point de départ pour des workflows vidéo avancés |
24 Go | Modèles lourds, meilleure résolution et moins de compromis |
32 Go | Gros workflows et davantage de confort pour le post-traitement |
Quel matériel faut-il pour générer une vidéo IA localement ?
La VRAM est le premier critère
La vidéo IA demande beaucoup plus de mémoire que la génération d’une image fixe. Le modèle doit traiter plusieurs dizaines d’images en maintenant une cohérence temporelle. Avec MiniMax H3, il faut en plus générer le son et faire tourner un encodeur de texte de 32 milliards de paramètres.
VRAM | Exemples de cartes RTX | Ce que l’on peut raisonnablement viser | MiniMax H3 |
8 Go | RTX 5060, 5060 Ti 8 Go, 4060 | Modèles légers, quantification, faible résolution et clips courts | Non conseillé |
12 Go | RTX 5070, 3060 12 Go, 5070 Ti Laptop | WAN 2.2 5B et modèles optimisés, avec compromis et offload | Possible en version compressée, environ 30 min par clip |
16 Go | RTX 5060 Ti 16 Go, 5070 Ti, 5080 | Très bon point de départ pour des workflows vidéo avancés | Jouable en version compressée, plus de 15 min par clip |
24 Go | RTX 3090 et 4090 d’occasion, 5090 Laptop | Modèles lourds, meilleure résolution et moins de compromis | Plus confortable |
32 Go | RTX 5090 | Gros workflows et davantage de confort pour le post-traitement | Environ 2 min par clip |
Ce tableau est une indication pratique, pas une garantie universelle. Deux workflows utilisant le même modèle peuvent avoir des besoins très différents. Une version FP16, FP8, INT4, GGUF ou une autre quantification ne consomme pas la même quantité de VRAM.
Les RTX 50 actuelles se répartissent en 8, 12, 16 et 32 Go ; les cartes de 24 Go sont des RTX 3090 et 4090 d’occasion ou la RTX 5090 Laptop. Aucune carte RTX de 18 Go n’existe aujourd’hui : cette capacité n’est attendue qu’avec les RTX 50 Super, pas avant 2027 selon les rumeurs.
Une carte récente avec 8 Go peut être très rapide, mais échouer avant le début du calcul si le workflow ne tient pas en mémoire. Une RTX 3090 de 24 Go reste donc extrêmement intéressante pour la vidéo IA locale malgré son âge.
Pour le détail des besoins de H3, FLUX.2 et WAN 2.2 selon votre budget, consultez mon guide PC pour IA locale en 2026 : quelle config pour SDXL, FLUX.2 et la vidéo IA ?. Pour choisir une carte, voyez aussi mon comparatif des RTX pour la génération d’images et de vidéos IA locale.
Tester avant d’acheter : louer une carte graphique dans le cloud
Avant d’investir plusieurs centaines ou milliers d’euros dans une carte graphique, vous pouvez la louer quelques heures. Des sites spécialisés donnent accès à une RTX 4090, une RTX 5090 ou une carte professionnelle, facturée à l’heure, voire à la seconde. On y installe ComfyUI, souvent en un clic grâce à des modèles prêts à l’emploi, puis on lance son propre workflow.
C’est le meilleur moyen de savoir quel matériel il vous faut réellement selon votre usage. La méthode :
choisissez un workflow représentatif de ce que vous voulez faire : un clip WAN 2.2, un plan MiniMax H3, une série d’images FLUX ;
lancez-le sur une carte de 24 Go (RTX 4090), puis sur une carte de 32 Go (RTX 5090) ;
notez le temps par clip et la VRAM réellement utilisée, visible avec la commande nvidia-smi ;
comparez avec votre PC actuel : si l’écart change votre façon de travailler, l’achat se justifie ; sinon, une location ponctuelle suffit.
Service | Exemples de cartes | Prix indicatif | À savoir |
RTX 4090 24 Go, RTX 5090 32 Go | 0,34 à 0,69 $/h (4090), 0,69 à 0,99 $/h (5090) | Facturation à la seconde, modèles ComfyUI prêts à l’emploi, crédits offerts via le lien après 10 $ dépensés (5 $ pour les clients européens) | |
RTX 4090, RTX 5090 | Environ 0,31 $/h (4090), 0,34 $/h (5090) | Place de marché aux prix variables selon l’hébergeur, modèle ComfyUI officiel | |
RTX A6000 48 Go, L40S 48 Go | Environ 0,45 $/h (A6000), 0,87 $/h (L40S) | Cartes professionnelles de 48 Go, confortables pour MiniMax H3 |
Les liens vers ces trois services sont des liens de parrainage ou d’affiliation : ils ne vous coûtent rien de plus et soutiennent IA Locale Facile.
Prix relevés entre juillet et août 2026, hors stockage, à vérifier au moment de louer (RunPod, Vast.ai, CUDO Compute).
Une heure de RTX 5090 coûte moins d’un euro : quelques euros suffisent pour tester MiniMax H3 pendant une soirée, là où un PC équipé de cette carte dépasse 4 000 €. Quelques précautions :
arrêtez ou supprimez l’instance après usage, car elle est facturée tant qu’elle tourne ;
le stockage des modèles est souvent facturé à part, même instance arrêtée : chez RunPod, un volume reste payant tant qu’il existe ;
sur Vast.ai, vérifiez le coût de la bande passante avant de télécharger des dizaines de gigaoctets de modèles ;
vos fichiers quittent votre PC : pour un projet confidentiel, on perd l’avantage principal du local ;
louer un GPU ne change rien aux licences : l’autorisation de MiniMax reste nécessaire pour utiliser H3 depuis la France.
NVIDIA, AMD ou Intel Arc ?
NVIDIA reste généralement le chemin le plus simple sous Windows. CUDA bénéficie d’une large compatibilité avec PyTorch, ComfyUI et les optimisations utilisées par les modèles vidéo.
AMD et Intel Arc progressent, mais la compatibilité dépend davantage du modèle, du système et de l’interface. Il est parfois nécessaire d’utiliser une version spécifique, Linux, DirectML, ZLUDA ou d’autres solutions. Pour un achat dont l’objectif principal est l’IA locale, je privilégie encore une carte NVIDIA disposant d’assez de VRAM.
Combien de RAM faut-il ?
Je conseille 32 Go de RAM comme base réaliste et 64 Go pour travailler plus confortablement avec des modèles lourds ou un offload important. Pour MiniMax H3, 64 Go deviennent pratiquement indispensables.
Quand la VRAM manque, une partie du modèle peut être déplacée vers la mémoire vive. Cela rend certains workflows exécutables, mais la génération ralentit. La RAM ne transforme pas une carte de 8 Go en carte de 24 Go : elle sert de solution de secours, avec un coût en vitesse.
Le processeur est-il important ?
La carte graphique effectue l’essentiel du calcul. Le processeur intervient dans le chargement, la préparation des données, certains offloads et l’encodage final.
Un CPU récent améliore le confort, mais je préfère investir d’abord dans la VRAM, puis dans la RAM et le stockage. Acheter le processeur le plus cher tout en choisissant une carte graphique trop limitée serait un drôle de moyen d’obtenir une barre de progression très bien administrée.
Quel espace disque prévoir ?
Les modèles, encodeurs, VAE et différentes quantifications prennent rapidement plusieurs centaines de gigaoctets. À lui seul, le jeu de fichiers le plus compact de MiniMax H3 pèse environ 42,5 Go.
Je recommande :
un SSD NVMe de 1 To pour découvrir quelques modèles ;
2 To pour tester plusieurs familles, H3 compris, sans supprimer des fichiers chaque semaine ;
au moins 100 à 200 Go réellement libres avant une installation vidéo complète ;
une organisation séparant modèles, workflows, entrées et sorties.
Un SSD presque plein peut faire échouer les téléchargements et ralentir Windows. Il est également prudent de conserver une copie des workflows qui fonctionnent avant de mettre à jour les nodes.
Classement des meilleurs modèles de vidéo IA locale en 2026
Mon classement privilégie la qualité réelle, la cohérence, la facilité d’utilisation et l’intérêt sur un PC personnel. J’y ajoute une colonne licence, car deux des trois premiers modèles ne sont pas librement utilisables en France.
Rang | Modèle | Point fort | Profil conseillé | Licence en France |
1 | MiniMax H3 | Qualité, cohérence et son natif | Le meilleur rendu possible, via Maestro ou ComfyUI | UE exclue : autorisation MiniMax à demander |
2 | HunyuanVideo 1.5 | Rendu cinématique | Création haut de gamme avec moins de VRAM que H3 | UE exclue par la licence Tencent |
3 | WAN 2.2 | Polyvalence et écosystème | Utilisation régulière dans ComfyUI | Apache 2.0, usage libre |
4 | LTX-2 / LTX-2.5 | Vitesse et chaîne audio-vidéo | Itération rapide et workflows modernes | LTX-2.5 libre sous 10 M$ de revenus annuels |
5 | CogVideoX 1.5 | Respect des descriptions | Plans simples et narratifs | Selon la variante |
6 | AnimateDiff | Contrôle avec l’écosystème SDXL | Animation stylisée et workflows avancés | Selon le checkpoint utilisé |
Ce classement n’est pas une vérité gravée dans le silicium. Un modèle plus léger, bien maîtrisé, peut être plus utile qu’un modèle supérieur qui oblige à attendre longtemps entre chaque essai. Et la licence peut, à elle seule, décider de votre choix pour un projet commercial.
Top 1 : MiniMax H3, le meilleur modèle de génération vidéo en local
MiniMax H3 est, de loin, le meilleur modèle de génération vidéo que l’on puisse faire tourner chez soi en 2026. Il dépasse HunyuanVideo 1.5 et WAN 2.2 sur la qualité d’image, la cohérence des personnages et le respect du prompt, et il ajoute ce qu’aucun des deux ne sait faire : le son.
Annoncé le 31 juillet 2026, H3 a vu ses poids publiés le 3 août. Il accepte en entrée du texte, des images, des vidéos et des sons, et génère des clips de 4 à 15 secondes à 24 images par seconde, avec un audio stéréo natif en 32 kHz (annonce officielle, fiche du modèle). Il comprend 11 langues, dont le français. Il s’est classé premier du classement Artificial Analysis pour l’édition vidéo avec audio (source).
Pourquoi il arrive en première position
H3 combine :
une qualité d’image et une cohérence temporelle supérieures à tout ce que j’ai testé en local ;
un son généré en même temps que l’image : dialogues, bruitages et ambiances sont synchronisés avec l’action ;
la génération à partir de références (jusqu’à 9 images, 3 vidéos et 3 extraits audio), idéale pour garder le même personnage d’un plan à l’autre ;
le contrôle de la première et de la dernière image ;
des prompts compris en français, y compris pour les dialogues ;
un écosystème qui s’est construit en quelques jours : support natif dans ComfyUI dès la sortie, puis dans Wan2GP et Maestro.
Pour un clip, une bande-annonce, une scène de manga ou un court-métrage avec dialogues, c’est aujourd’hui mon premier choix.
Ce que vous pouvez vraiment faire tourner chez vous
Seule la partie centrale du système, H3-Base, est téléchargeable. Elle produit des vidéos en 768p, soit 1344 × 768 en 16:9. Le module qui réécrit et enrichit vos prompts (H3-Context-IR) et celui qui monte la vidéo en 2K (H3-Regenerate-2K) restent des services en ligne de MiniMax (fiche du modèle).

Le modèle est lourd : un transformer de 33 milliards de paramètres, plus un encodeur de texte basé sur Qwen3-VL-32B. MiniMax ne publie aucun minimum officiel de VRAM. La communauté a créé des versions compressées (INT4, GGUF, NF4) qui rendent H3 exploitable sur des cartes grand public.
Maestro : la façon la plus simple d’utiliser MiniMax H3
Maestro a ajouté le support de H3 dès le 4 août, dans sa version 1.5.5, en s’appuyant sur Wan2GP pour faire tourner le modèle (source). Depuis, Maestro est mis à jour pratiquement tous les jours pour améliorer le fonctionnement et les possibilités de H3 : gestion de la mémoire, nouveaux modes de génération, réglages supplémentaires.
C’est la méthode que je recommande pour découvrir H3 sans construire de workflow ComfyUI :
envoyez votre demande d’autorisation à MiniMax (voir la partie licence ci-dessous) ;
installez Pinokio, puis Maestro, en suivant mon guide complet de Maestro sur Pinokio ;
mettez Maestro à jour depuis Pinokio avant chaque session, les améliorations pour H3 arrivant très souvent ;
sélectionnez MiniMax H3 parmi les modèles vidéo et laissez Maestro télécharger les fichiers adaptés à votre carte ;
commencez par un clip de 5 secondes en 1344 × 768 ou moins ;
une fois une version stable trouvée, notez-la : avec des mises à jour aussi fréquentes, une nouveauté peut parfois casser un réglage qui fonctionnait.
MiniMax a annoncé que Wan2GP faisait tourner H3 avec 5 à 6 Go de VRAM, et qu’une version NF4 publiée par DiffSynth-Studio descendait vers 7 à 8 Go. Ces chiffres viennent de MiniMax et n’ont pas été vérifiés de façon indépendante : attendez-vous à des temps de génération très longs sur ces configurations.
Installer MiniMax H3 dans ComfyUI
Pour garder un contrôle total, ComfyUI prend en charge H3 nativement (guide ComfyUI) :
obtenez l’autorisation de MiniMax ;
mettez ComfyUI à jour (version 0.30.0 ou plus récente) ;
ouvrez la bibliothèque de modèles de workflow, rubrique Vidéo, et choisissez un workflow MiniMax H3 : texte vers vidéo, image vers vidéo ou vidéo à partir de références ;
laissez ComfyUI télécharger les fichiers proposés ; avec 16 Go de VRAM, préférez une version compressée INT4 ou GGUF du modèle et de l’encodeur de texte ;
réglez la sortie sur 1344 × 768 pour du 16:9 natif, et commencez par des clips de 5 secondes ;
installez Sage Attention : selon ComfyUI, cela double environ la vitesse de génération.
Prévoyez de la place : le jeu de fichiers compact pour le texte et l’image vers vidéo pèse environ 42,5 Go. Si ComfyUI n’est pas encore installé, voici quelle version de ComfyUI choisir sur Windows.
Combien de VRAM pour MiniMax H3 ?
L’impact de la VRAM est énorme. Un testeur de la communauté a mesuré le temps d’un clip de 1344 × 768 d’environ 6 secondes, avec une version compressée, en bridant volontairement la mémoire disponible à environ 32, 18 et 12 Go (source). Voici ce que ces mesures donnent pour les cartes RTX réellement disponibles :

Avec une RTX 5090 et ses 32 Go, un clip sort en 2 min 09. Une carte de 16 Go (RTX 5060 Ti 16 Go, RTX 5070 Ti ou RTX 5080) dépassera les 15 min 10 mesurées à 18 Go. Avec 12 Go (RTX 5070 ou RTX 5070 Ti Laptop), comptez 31 min 31. Avec 8 Go, H3 n’est pas conseillé.
Avec 12 Go, ça fonctionne, mais une demi-heure par clip rend chaque essai coûteux. C’est le modèle qui justifie le plus une carte à forte VRAM.
La licence : le point à régler avant d’installer H3 en France
C’est le piège à connaître. La licence communautaire de H3 s’applique au monde entier, sauf l’Union européenne, le Royaume-Uni, la Corée du Sud et les États-Unis (source). L’exclusion couvre aussi les vidéos générées : en France, on ne peut ni utiliser le modèle ni publier ses résultats sans autorisation.
La solution est simple : remplir le formulaire d’autorisation MiniMax avant de télécharger les poids. Retenez aussi que :
au-delà de 20 millions de dollars de revenus annuels, une autorisation écrite de MiniMax est exigée ;
un produit ou un service construit sur H3 doit afficher la mention « MiniMax H3 » ;
pour monétiser vos vidéos, vérifiez précisément ce que couvre l’autorisation obtenue ;
l’API en ligne de MiniMax reste accessible partout, avec ses propres conditions.
Ce paragraphe n’est pas un avis juridique : lisez le fichier LICENSE du modèle, dont le texte peut évoluer.
Ses limites
MiniMax H3 reste exigeant :
sous 16 Go de VRAM, chaque clip demande de la patience ;
64 Go de RAM deviennent pratiquement indispensables ;
la version locale plafonne à 768p, le 2K restant un service en ligne ;
sans le module Context-IR, il faut soigner ses prompts soi-même ;
l’écosystème est jeune et évolue chaque jour, ce qui apporte des améliorations mais aussi, parfois, des régressions.
Bien écrire son prompt MiniMax H3
Avec H3, le prompt décrit aussi le son. Précisez l’action, la caméra, la lumière, puis les bruits, la musique et les éventuels dialogues entre guillemets, avec leur langue.
Exemple :
Un forgeron frappe une épée incandescente dans un atelier sombre. Des étincelles jaillissent à chaque impact. Il lève les yeux vers la caméra et dit en français : « La forge ne dort jamais. » Son : coups de marteau métalliques, crépitement du feu, léger écho. Travelling avant lent, caméra stable, lumière chaude.
Gardez une seule action principale et une seule réplique par plan. Un personnage qui court, parle, se bat et chante en cinq secondes produit rarement un résultat exploitable, même avec le meilleur modèle du moment.
Top 2 : HunyuanVideo 1.5, le rendu cinématique avec moins de VRAM
HunyuanVideo 1.5 était mon premier choix avant l’arrivée de MiniMax H3. Il reste l’un des modèles les plus impressionnants pour l’équilibre entre qualité d’image, cohérence temporelle et rendu cinématique, avec un modèle nettement plus léger que H3.
Tencent présente HunyuanVideo 1.5 comme un modèle vidéo de 8,3 milliards de paramètres conçu pour réduire la barrière matérielle par rapport aux modèles beaucoup plus lourds. Il prend en charge le Text-to-Video et l’Image-to-Video. Il ne génère pas de son : il faudra l’ajouter au montage.
Les points forts de HunyuanVideo 1.5
Je le trouve particulièrement convaincant pour :
les personnages humains ;
les scènes cinématiques ;
les mouvements subtils du visage et du corps ;
les travellings lents ;
les univers réalistes ou semi-réalistes ;
les images de manga et d’animation ;
la fumée, la lumière et les particules.
Sur les bons résultats, le mouvement paraît moins artificiel et le décor se déforme moins qu’avec des modèles plus anciens. Les plans peuvent devenir réellement exploitables après interpolation, upscale et montage.
Pourquoi il arrive en deuxième position
HunyuanVideo 1.5 combine une excellente qualité visuelle, une bonne cohérence entre les frames, des mouvements de caméra crédibles et une bonne conservation de l’ambiance de l’image initiale. H3 le dépasse sur la cohérence des personnages, le respect du prompt et, surtout, le son.
Son avantage reste la légèreté : avec 8,3 milliards de paramètres contre 33 pour H3, il est plus rapide et plus confortable sur une carte de 12 ou 16 Go. C’est le bon choix lorsque vous voulez un rendu très soigné sans passer une demi-heure sur chaque clip.
Attention à la licence en France
Comme H3, HunyuanVideo 1.5 est distribué sous une licence qui ne s’applique pas dans l’Union européenne, au Royaume-Uni ni en Corée du Sud. La licence communautaire de Tencent exclut explicitement ces territoires. Pour un projet commercial en France, WAN 2.2 et sa licence Apache 2.0 restent l’option la plus sereine.
Ses limites
HunyuanVideo 1.5 reste exigeant. « Léger » est une notion relative dans l’univers des modèles vidéo : 8,3 milliards de paramètres ne tiennent pas dans la poche intérieure d’un ordinateur portable.
Avec 12 Go de VRAM, il faut sélectionner une implémentation optimisée, réduire la durée ou la résolution et accepter l’offload. La compatibilité et la mémoire réellement nécessaire dépendent fortement de la quantification et de l’interface.
Pour un premier test :
commencez en Image-to-Video ;
utilisez une image propre ;
demandez un mouvement simple ;
limitez la durée ;
testez une résolution raisonnable ;
n’ajoutez l’upscale qu’après avoir sélectionné le bon résultat.
Bien écrire son prompt HunyuanVideo
Le guide officiel des prompts HunyuanVideo 1.5 recommande de décrire clairement le sujet, l’action, la caméra, le style et l’ambiance.
Exemple :
A Viking warrior stands on a cliff above a stormy sea. His cape moves slowly in the wind, lightning illuminates the clouds, slow cinematic orbit around the character, stable camera, realistic natural movement, dramatic blue lighting.
Évitez d’empiler des actions incompatibles. Un plan de cinq secondes ne peut pas facilement contenir un combat, une transformation, une course, un dialogue et trois changements de caméra.
Top 3 : WAN 2.2, le meilleur compromis pour la vidéo IA locale
WAN 2.2 est incontournable pour générer une vidéo IA en local. Sa force ne vient pas seulement de la qualité du modèle : il bénéficie d’un vaste écosystème de workflows ComfyUI, de quantifications et d’interfaces optimisées. C’est aussi le seul des trois premiers modèles sous licence Apache 2.0 : vous pouvez l’utiliser librement en France, y compris pour des vidéos monétisées.
Les versions plus récentes de WAN (2.6 et suivantes) ne sont, elles, proposées qu’en API payante : elles ne se téléchargent pas.
Pourquoi WAN 2.2 est aussi important
WAN 2.2 est particulièrement bon pour :
l’Image-to-Video ;
les mouvements de caméra ;
les paysages et scènes réalistes ;
les animaux ;
les vêtements, la fumée, l’eau et le vent ;
les plans cinématiques ;
les utilisateurs qui veulent personnaliser leur workflow dans ComfyUI.
Il peut encore déformer les mains, les objets manipulés ou les interactions entre plusieurs personnes. Il vaut mieux isoler chaque action dans un plan court. Et il ne génère pas de son.
WAN 2.2 TI2V‑5B : le modèle à connaître
WAN 2.2 TI2V‑5B constitue une porte d’entrée majeure pour les PC grand public. Son nom apparaît sous plusieurs variantes dans les recherches : WAN 2.2 5B, WAN2.2‑TI2V‑5B, WAN 5B ou WAN 2.2 local.
Le « 5B » correspond à environ cinq milliards de paramètres. Cette version est plus accessible que les variantes WAN 2.2 beaucoup plus lourdes. Le dépôt officiel prévoit le Text-to-Video et l’Image-to-Video en 720p, avec des options d’offload pour l’inférence sur un seul GPU.
Pour une installation détaillée, consultez mon tutoriel consacré à WAN 2.2 5B avec ComfyUI.
Peut-on utiliser WAN 2.2 avec 8 ou 12 Go de VRAM ?
Avec 8 Go, la version 5B fonctionne avec un workflow optimisé. Avec 12 Go, la version 14B, la plus belle, devient accessible grâce aux fichiers GGUF compressés, à condition d’être patient.
Les réglages qui réduisent le plus souvent la consommation sont :
une quantification plus légère ;
moins de frames ;
une résolution inférieure ;
l’offload CPU ;
le chargement séquentiel des composants ;
la fermeture des logiciels utilisant le GPU ;
un VAE optimisé ou un décodage par blocs lorsque le workflow le permet.
WAN 2.1 est-il encore utile ?
Oui. WAN 2.1 dispose de nombreux workflows éprouvés. Sa version T2V‑1.3B a notamment été conçue pour rester accessible sur des GPU grand public. Un workflow déjà stable peut rester préférable à une installation WAN 2.2 mal configurée.
Vous pouvez consulter mon guide sur WAN 2.1 Light X2V dans ComfyUI.
Comment éviter une caméra incontrôlable avec WAN ?
Un prompt vague comme « camera moves around the subject » peut produire un mouvement excessif. Décrivez une seule trajectoire et son intensité :
Slow cinematic dolly-in, stable camera, subtle natural body movement, gentle wind in the clothes, background remains consistent.
Les mots slow, stable, subtle et gentle aident souvent à calmer le mouvement. Le modèle n’a pas besoin que le caméraman se prenne pour un drone de course à chaque plan.
Top 4 : LTX-2, LTX-2.5 et la famille LTX pour générer plus vite
LTX a longtemps été présenté comme une solution rapide pour la vidéo locale. En 2026, il faut distinguer les anciens modèles LTX-Video, la génération LTX-2 et LTX-2.5, sorti en août 2026.
Le dépôt officiel de LTX-2 décrit un modèle unifié capable de générer l’audio et la vidéo. LTX-2.5 poursuit dans cette voie : ses poids sont libres d’usage commercial pour les structures réalisant moins de 10 millions de dollars de revenus annuels, et son application LTX Desktop vise les cartes de 16 Go (fiche LTX-2.5). L’écosystème comprend également des intégrations ComfyUI.
Pourquoi LTX reste intéressant
La famille LTX convient particulièrement pour :
tester rapidement une idée ;
créer des aperçus ;
préparer un storyboard animé ;
expérimenter avec l’audio et la vidéo sans la lourdeur de H3 ;
multiplier les variantes avant une génération finale ;
travailler dans un workflow ComfyUI moderne.
La vitesse est un avantage créatif. Attendre longtemps pour découvrir qu’un personnage part dans la mauvaise direction ralentit considérablement l’apprentissage. Un modèle rapide permet de valider le cadrage et le mouvement, puis de reproduire le plan avec MiniMax H3, HunyuanVideo ou WAN si l’on souhaite une autre esthétique.
C’est aussi l’alternative la plus simple à H3 pour générer image et son ensemble avec une licence plus souple pour un créateur français.
Les limites de LTX
La consommation réelle dépend de la version et du mode utilisés. Les promesses de résolution ou de fréquence d’images indiquées par un projet ne signifient pas qu’un PC moyen produira immédiatement une longue vidéo 4K en un clic.
Selon la scène, les visages et les textures peuvent également paraître moins stables que dans les meilleurs résultats de MiniMax H3 ou de HunyuanVideo 1.5. Je le considère comme une excellente solution d’itération, pas comme un bouton magique dispensant du montage.
Top 5 : CogVideoX 1.5, toujours intéressant pour le respect du prompt
CogVideoX conserve un intérêt pour les scènes simples et précisément décrites. Il existe en Text-to-Video et en Image-to-Video selon les variantes.
Ses points forts
CogVideoX est utile pour :
les mouvements lents ;
les paysages ;
les objets clairement identifiés ;
les scènes narratives simples ;
les prompts descriptifs ;
les utilisateurs disposant déjà d’un workflow stable.
Ses limites
Face à MiniMax H3, HunyuanVideo 1.5, WAN 2.2 ou LTX, CogVideoX paraît moins moderne sur certains mouvements. Selon l’implémentation, il peut aussi être lent et gourmand. La licence change selon la variante : vérifiez-la avant un usage commercial.
Il ne faut toutefois pas supprimer un workflow fonctionnel simplement parce qu’un nouveau modèle vient de sortir. Un modèle maîtrisé avec les bons paramètres peut produire de meilleurs résultats qu’une nouveauté utilisée au hasard.
Le dépôt officiel de CogVideo permet de retrouver les variantes et les instructions techniques disponibles.
Top 6 : AnimateDiff, la boîte à outils pour SDXL
AnimateDiff est plus ancien et ne joue pas exactement dans la même catégorie. Il ajoute une dimension temporelle à l’écosystème Stable Diffusion.
Pourquoi AnimateDiff reste utile
AnimateDiff permet notamment :
d’utiliser des checkpoints Stable Diffusion ou SDXL adaptés ;
d’exploiter certains LoRA ;
d’ajouter ControlNet ;
de construire des boucles ;
de créer des animations stylisées ;
de contrôler précisément le sampling et le contexte temporel.
Pour une animation de manga, un style très particulier ou un workflow déjà basé sur SDXL, il reste pertinent.
Pourquoi il n’est plus mon premier choix photoréaliste
AnimateDiff demande davantage de réglages : motion modules, context options, samplers, ControlNet et nodes spécialisés. Pour animer rapidement une photographie, MiniMax H3, HunyuanVideo 1.5 ou WAN 2.2 produisent un mouvement bien plus naturel.
En revanche, AnimateDiff conserve une souplesse rare. Il ressemble davantage à une boîte de construction qu’à un modèle vidéo monolithique.
Maestro, Pinokio, Wan2GP ou ComfyUI : que faut-il installer ?
Pinokio pour simplifier l’installation
Pinokio aide à installer et lancer des applications locales sans gérer manuellement chaque commande Python ou Git.
Le principe général est le suivant :
installer Pinokio ;
ouvrir son catalogue ;
choisir une application comme Maestro, ComfyUI ou Wan2GP ;
vérifier le disque d’installation ;
lancer le script ;
attendre le téléchargement des dépendances ;
ouvrir l’interface locale.
Pinokio simplifie l’installation, mais il ne supprime pas toutes les précautions. Vérifiez l’espace disque, l’origine du script et sa date de mise à jour. Retrouvez mon guide complet pour installer Pinokio.
Maestro, le plus simple pour MiniMax H3
Maestro réunit plusieurs étapes de création dans une interface orientée projet : images, vidéos, musique, voix off et clonage vocal. Son mode Director est utile pour découper une idée en plans, générer des images, les animer et organiser le résultat.
C’est aujourd’hui la porte d’entrée la plus simple vers MiniMax H3. Maestro a intégré H3 dès le 4 août et reçoit depuis des mises à jour pratiquement quotidiennes qui améliorent son fonctionnement et ses possibilités. Pensez à le mettre à jour depuis Pinokio avant chaque session.
Je le recommande à ceux qui veulent construire un clip ou un court-métrage sans commencer immédiatement par un grand workflow ComfyUI. Tout est détaillé dans mon test de Maestro sur Pinokio.
Wan2GP pour les configurations grand public
Wan2GP est centré sur la génération vidéo locale et les optimisations mémoire. Il facilite l’utilisation de plusieurs familles de modèles, dont WAN et MiniMax H3 depuis sa version 12.41, sur des cartes qui ne peuvent pas charger les poids complets en VRAM. C’est d’ailleurs le moteur utilisé par Maestro pour faire tourner H3.
Il est particulièrement intéressant avec 8 à 16 Go de VRAM. Les versions, modèles et quantifications disponibles évoluent rapidement : vérifiez ce que propose précisément votre installation.
ComfyUI pour le contrôle total
ComfyUI reste l’interface la plus flexible. Chaque opération est représentée par un node relié aux autres :
prompt et image de référence ;
encodeurs et modèle vidéo ;
sampling des frames ;
décodage VAE ;
interpolation RIFE ;
upscale et export MP4.
Cette logique permet de remplacer un composant, d’ajouter un ControlNet, de choisir une quantification ou de modifier l’export. Elle explique aussi pourquoi ComfyUI peut sembler difficile au début. ComfyUI prend en charge MiniMax H3 nativement, avec des workflows prêts à l’emploi.
Le meilleur apprentissage consiste à ouvrir un workflow fonctionnel, puis à comprendre chaque groupe de nodes. N’installez pas cinquante extensions avant d’avoir lancé une première génération : quand tout casse, trouver le responsable devient alors un épisode entier de série policière.
Pour aller plus loin, consultez mon guide pour apprendre la génération d’images et de vidéos IA locale sur PC.
Comment installer WAN 2.2 5B dans ComfyUI ?
WAN 2.2 5B reste le meilleur point de départ pour apprendre la vidéo dans ComfyUI, avant de passer à MiniMax H3. L’installation exacte varie selon le workflow, mais la méthode générale reste la même.
1. Mettre ComfyUI à jour
WAN 2.2 utilise des nodes et chargeurs récents. Mettez ComfyUI à jour avant de chercher une erreur dans le modèle. Sauvegardez néanmoins votre installation ou vos workflows importants avant une grosse mise à jour.
2. Charger un workflow compatible WAN 2.2 TI2V‑5B
Utilisez un workflow prévu précisément pour la variante 5B. Un workflow WAN 2.1 ou WAN 2.2 14B ne réclame pas nécessairement les mêmes fichiers.
3. Installer les nodes manquants
ComfyUI Manager peut identifier une partie des nodes manquants. Redémarrez complètement ComfyUI après l’installation.
4. Télécharger tous les composants demandés
Un workflow WAN peut demander :
le modèle de diffusion ;
le VAE ;
un ou plusieurs encodeurs de texte ;
un modèle de vision pour l’Image-to-Video ;
des LoRA ou accélérateurs facultatifs.
Respectez les dossiers et les noms attendus. Un modèle placé dans checkpoints alors que le node cherche dans diffusion_models ne sera pas détecté.
5. Commencer avec des paramètres raisonnables
Pour valider l’installation :
utilisez une courte séquence ;
choisissez une résolution inférieure au maximum ;
gardez le nombre d’étapes recommandé par l’auteur du workflow ;
utilisez une image respectant le ratio prévu ;
évitez l’upscale pendant le premier test.
Une fois le premier MP4 obtenu, modifiez un paramètre à la fois.
Le meilleur workflow pour créer une vidéo IA locale
Une bonne vidéo IA suit toujours les mêmes grandes étapes, détaillées ensuite :

Étape 1 : découper l’idée
Une vidéo d’une minute doit être pensée comme une suite de plans courts. Définissez pour chacun :
le sujet ;
le cadrage ;
l’action principale ;
le mouvement de caméra ;
la durée ;
le son ou la réplique, si vous utilisez MiniMax H3 ;
la transition vers le plan suivant.
Cette préparation limite les générations inutiles et améliore la continuité.
Étape 2 : créer une image de départ propre
Utilisez FLUX, SDXL, Qwen Image ou un checkpoint spécialisé. Vérifiez le visage, les mains, les proportions, les objets, l’arrière-plan et la lumière. Avec H3, ces images peuvent aussi servir de références pour garder le même personnage sur tous les plans.
Une mauvaise image devient rarement une excellente vidéo. Le modèle vidéo peut animer un personnage, mais il n’est pas le service après-vente universel des erreurs anatomiques.
Étape 3 : écrire un prompt de mouvement
En Image-to-Video, il n’est pas nécessaire de redécrire chaque détail visible. Concentrez-vous sur l’action et la caméra.
The character slowly raises his head and looks toward the camera. His clothes move gently in the wind. Sparks float through the air. Slow cinematic dolly-in, stable camera, natural motion.
Ce prompt indique :
le mouvement principal ;
les mouvements secondaires ;
la trajectoire de caméra ;
le rythme ;
le niveau de stabilité.
Avec MiniMax H3, ajoutez une ligne pour le son : bruitages, ambiance et éventuelle réplique.
Étape 4 : générer court et léger
Commencez par trois à cinq secondes. Une prévisualisation suffit pour vérifier la direction du mouvement, le visage, le décor et la caméra. Avec H3, où chaque clip peut prendre plusieurs dizaines de minutes sur 12 Go, cette étape est encore plus importante : validez l’idée avec LTX ou WAN 5B, puis lancez la version finale sur H3.
Si le résultat échoue, ne modifiez pas simultanément le prompt, la seed, le nombre d’étapes et la résolution. Changez un seul paramètre pour comprendre son effet.
Étape 5 : interpoler avec RIFE
RIFE crée des images intermédiaires. Une vidéo générée à faible fréquence peut devenir plus fluide à 24, 30, 48 ou 60 images par seconde.
RIFE ne corrige pas une mauvaise animation. Si une main traverse une table, il ajoutera simplement des étapes très fluides à cette traversée. Avec un clip H3, vérifiez que l’audio reste synchronisé après interpolation.
Étape 6 : effectuer l’upscale
Il est souvent plus efficace de générer dans une résolution modérée, puis d’agrandir uniquement les meilleurs plans. C’est particulièrement vrai pour H3, dont la version locale s’arrête à 768p.
L’ordre conseillé est :
génération ;
sélection ;
interpolation ;
upscale ;
montage ;
compression finale.
Générer directement en 1080p augmente fortement la mémoire et le temps de calcul sans garantir un gain proportionnel.
Étape 7 : monter et sonoriser
Assemblez plusieurs clips courts. Le montage sert à masquer les débuts imparfaits, varier les cadrages, synchroniser les actions avec la musique et ajouter une voix.
Avec MiniMax H3, les bruitages et répliques sont déjà dans chaque clip : il reste à harmoniser les niveaux sonores et à poser une musique d’ensemble, par exemple générée dans Maestro. Une vidéo IA locale réussie est rarement une génération brute. C’est le résultat d’une sélection et d’un assemblage.
Comment écrire un bon prompt pour MiniMax H3, WAN, Hunyuan ou LTX ?
Une structure simple fonctionne bien :
Sujet + action + mouvement secondaire + caméra + lumière + ambiance + qualité du mouvement.
Avec MiniMax H3 ou LTX, ajoutez à la fin : + son (bruitages, ambiance, musique, réplique entre guillemets et sa langue).
Exemple photoréaliste
A woman walks slowly through a rainy neon-lit street. Her coat moves gently in the wind, reflections shimmer on the wet ground, slow tracking shot, stable cinematic camera, realistic natural motion, atmospheric lighting.
Exemple manga
Anime football player prepares a powerful shot, energy builds around his body, dust rises from the ground, dynamic low-angle camera, dramatic stadium lighting, fluid anime motion, consistent character design.
Exemple cinématique
A medieval blacksmith strikes a glowing sword. Sparks burst at each impact, smoke moves slowly in the workshop, close-up tracking shot, warm firelight, stable camera, realistic motion.
Exemple avec son pour MiniMax H3
Un jeune footballeur portant le numéro 10 frappe le ballon en pleine lucarne. La foule se lève d’un bond. Son : impact sourd du ballon, rugissement du stade, un commentateur crie en français : « But ! Quel tir incroyable ! » Plan en contre-plongée, ralenti, lumière de fin de journée.
Les erreurs de prompt les plus fréquentes
Évitez :
plusieurs mouvements de caméra incompatibles ;
trop d’actions simultanées ;
les descriptions contradictoires ;
les transformations inutiles ;
les phrases immenses sans hiérarchie ;
plusieurs répliques dans un même plan de quelques secondes ;
les demandes impossibles à réaliser en quelques secondes.
Une action principale claire produit généralement un meilleur résultat qu’une liste de souhaits.
Quel modèle choisir selon sa carte graphique ?

Avec 8 Go de VRAM (RTX 5060, 4060)
Privilégiez :
WAN 2.2 5B, le meilleur choix à ce niveau ;
LTX dans un mode adapté ;
AnimateDiff avec des paramètres raisonnables ;
une faible résolution ;
peu de frames ;
l’offload CPU.
MiniMax H3 n’est pas conseillé ici. Wan2GP annonce bien des profils très économes en mémoire, mais les temps de génération deviennent décourageants. La vidéo reste possible, avec des compromis importants.
Avec 12 Go de VRAM
Avec 12 Go (RTX 5070, RTX 3060 12 Go, RTX 5070 Ti Laptop), on peut déjà travailler sérieusement sur :
WAN 2.2 TI2V‑5B et WAN 2.2 14B en GGUF ;
HunyuanVideo 1.5 via un workflow optimisé ;
LTX ;
AnimateDiff avancé ;
MiniMax H3 en version compressée, via Maestro ou ComfyUI, en comptant environ 30 minutes par clip.
C’est la quantité dont je dispose sur ma RTX 5070 Ti Laptop. Elle permet de créer de vraies séquences, mais oblige à choisir soigneusement les paramètres. Pour H3, mieux vaut valider d’abord le plan avec un modèle plus rapide, puis lancer la version finale.
Avec 16 Go de VRAM
Seize gigaoctets offrent un excellent compromis. Une RTX 5060 Ti 16 Go, une RTX 5070 Ti, une RTX 5080 ou une RTX 4070 Ti Super permet d’utiliser des workflows plus confortables, de réduire l’offload et de faire tourner MiniMax H3 compressé dans des conditions jouables, en comptant plus de 15 minutes par clip.
Avec 24 Go ou plus
Une RTX 3090, une RTX 4090 ou une RTX 5090 Laptop avec 24 Go réduit fortement les compromis, et H3 devient confortable. Une RTX 5090 de bureau et ses 32 Go génère un clip H3 en environ 2 minutes, mais son prix la réserve aux passionnés ou aux usages intensifs.
Résoudre les erreurs les plus fréquentes
Erreur CUDA Out of Memory
Cette erreur indique que la VRAM ne suffit pas pour l’opération demandée.
Essayez, dans cet ordre :
fermer les applications utilisant le GPU ;
réduire le nombre de frames ;
réduire la résolution ;
utiliser une version quantifiée (INT4, GGUF, NF4 pour H3) ;
activer l’offload ;
utiliser un décodage VAE par blocs si disponible ;
redémarrer complètement ComfyUI ou Maestro ;
choisir un modèle plus léger.
Le modèle n’apparaît pas dans ComfyUI
Vérifiez son dossier, son extension, le node de chargement et le nom attendu. Actualisez l’interface ou redémarrez ComfyUI.
Un fichier WAN placé dans le dossier des checkpoints classiques n’apparaîtra pas forcément dans un chargeur destiné aux modèles de diffusion. Pour H3, vérifiez aussi que votre ComfyUI est en version 0.30.0 ou plus récente.
Le workflow affiche des nodes rouges
Installez les custom nodes manquants avec ComfyUI Manager, puis redémarrez. Si le node reste absent, vérifiez si son dépôt existe toujours et s’il est compatible avec votre version de ComfyUI.
MiniMax H3 fonctionnait hier et plus aujourd’hui dans Maestro
Maestro étant mis à jour presque tous les jours, une nouvelle version peut modifier un réglage ou une dépendance. Relancez la mise à jour depuis Pinokio, puis redémarrez complètement l’application. Si le problème persiste, consultez le journal des modifications et signalez le bug : les corrections arrivent généralement vite.
L’image devient noire ou très claire
Le problème vient souvent du mauvais VAE, d’une quantification incompatible, d’un format d’image incorrect ou de paramètres prévus pour une autre version du modèle.
Le visage change
Utilisez une image de meilleure qualité, raccourcissez la séquence et réduisez les rotations. Un mouvement subtil conserve mieux l’identité qu’un tour complet de la caméra. Avec H3, le mode références aide beaucoup.
La vidéo tremble
Ajoutez des indications comme stable camera, locked camera, smooth motion ou slow dolly-in. Réduisez le nombre d’actions et évitez les changements brusques.
La génération est trop lente
Testez d’abord en faible résolution avec moins de frames. Validez le prompt avant de lancer la version finale. Vérifiez également que le GPU est réellement utilisé et que le modèle n’est pas presque entièrement déporté dans la RAM. Pour H3 dans ComfyUI, installez Sage Attention.
IA vidéo locale ou services cloud : que choisir ?
Critère | IA vidéo locale | Kling, Runway, Veo ou Sora |
Coût par essai | Pas de crédit, mais électricité et matériel | Crédits ou abonnement |
Confidentialité | Fichiers conservés sur le PC | Envoi vers un service distant |
Installation | Technique au départ, simplifiée par Pinokio et Maestro | Très simple |
Contrôle | Très élevé avec ComfyUI | Dépend de l’interface |
Vitesse | Dépend de votre GPU | Infrastructure distante puissante |
Son | Natif avec MiniMax H3 ou LTX | Selon le service |
Licence | À vérifier modèle par modèle | Conditions du service |
Les deux approches peuvent être complémentaires. Le cloud est pratique pour obtenir rapidement un résultat avec une puissance inaccessible à domicile. Le local devient intéressant pour multiplier les essais, conserver ses fichiers et maîtriser toute la chaîne. Avec MiniMax H3, l’écart de qualité entre le local et le cloud n’a jamais été aussi faible.
Entre les deux, la location d’une carte graphique chez RunPod, Vast.ai ou CUDO Compute permet de faire tourner vous-même les modèles ouverts sur une machine distante, sans les acheter. C’est idéal pour tester le matériel dont vous avez besoin avant d’investir, comme expliqué dans la partie consacrée à la VRAM.
Conclusion : quel est le meilleur générateur de vidéo IA local en 2026 ?
MiniMax H3 prend la première place de mon classement. Qualité d’image, cohérence des personnages, génération à partir de références et son natif : c’est le meilleur modèle de génération vidéo que l’on puisse faire tourner chez soi. Avec Maestro, mis à jour pratiquement tous les jours pour améliorer son fonctionnement, il devient accessible sans construire un seul workflow.
HunyuanVideo 1.5 reste un excellent choix pour un rendu cinématique avec moins de VRAM. WAN 2.2 demeure le plus polyvalent, le plus léger et le seul du podium sous licence Apache 2.0. LTX-2 et LTX-2.5 accélèrent l’expérimentation, y compris avec le son. CogVideoX conserve une utilité pour les descriptions précises, tandis qu’AnimateDiff reste une boîte à outils remarquable pour exploiter SDXL, les LoRA et ControlNet.
Mon classement final est donc :
MiniMax H3 pour la meilleure qualité générale et le son natif ;
HunyuanVideo 1.5 pour le rendu cinématique avec moins de VRAM ;
WAN 2.2 pour la polyvalence, les workflows ComfyUI et la licence libre ;
LTX-2 et LTX-2.5 pour l’itération rapide et l’audio-vidéo ;
CogVideoX 1.5 pour les scènes descriptives ;
AnimateDiff pour le contrôle et l’écosystème Stable Diffusion.
Pour générer une vidéo IA gratuitement en 2026 simplement, installez Pinokio, puis Maestro pour profiter de MiniMax H3. Pour maîtriser chaque étape, ComfyUI reste l’outil le plus puissant. Et en France, n’oubliez pas de demander l’autorisation de MiniMax avant d’utiliser H3.
La génération vidéo locale n’est pas encore instantanée. Elle demande des essais, du stockage et une carte graphique qui fera parfois entendre son opinion. Mais elle permet déjà de créer sur un PC personnel des scènes sonorisées qui auraient demandé une équipe et un budget considérables il y a quelques années.
FAQ : Générer une vidéo IA gratuitement en 2026
Peut-on générer une vidéo IA gratuitement et localement ?
Oui. Plusieurs modèles et interfaces peuvent être téléchargés et exécutés gratuitement selon leurs licences. Il faut toutefois posséder un PC adapté, prévoir assez de stockage et payer l’électricité consommée pendant les calculs.
Quel est le meilleur modèle de vidéo IA locale en 2026 ?
MiniMax H3 est aujourd’hui le meilleur, grâce à sa qualité d’image, sa cohérence et son son natif. HunyuanVideo 1.5 reste une excellente alternative plus légère, WAN 2.2 le plus polyvalent, et LTX le plus rapide.
Qu’est-ce que MiniMax H3 ?
MiniMax H3 est un modèle vidéo à poids ouverts sorti fin juillet 2026. Il combine texte, images, vidéos et sons en entrée, et génère des clips de 4 à 15 secondes avec un son stéréo natif. La version téléchargeable produit des vidéos en 768p.
MiniMax H3 est-il gratuit ?
Les poids se téléchargent gratuitement. En France, il faut cependant obtenir une autorisation de MiniMax, car sa licence exclut l’Union européenne. Monétiser les vidéos demande de vérifier ce que couvre cette autorisation.
Comment installer MiniMax H3 facilement ?
Le plus simple est d’installer Pinokio, puis Maestro, qui intègre H3 et reçoit des mises à jour pratiquement quotidiennes. Pour un contrôle total, ComfyUI propose des workflows H3 natifs.
Combien de VRAM faut-il pour MiniMax H3 ?
16 Go est un minimum pratique, avec plus de 15 minutes par clip, et 32 Go l’idéal, avec environ 2 minutes. Avec 12 Go, une version compressée fonctionne, mais comptez environ 30 minutes par clip. Prévoyez aussi 64 Go de RAM et environ 42,5 Go d’espace disque.
MiniMax H3 peut-il générer en 2K en local ?
Non. La version locale, H3-Base, s’arrête à 768p. Le passage en 2K reste un service en ligne de MiniMax. En local, on génère en 768p puis on effectue un upscale.
MiniMax H3 comprend-il le français ?
Oui. H3 prend en charge 11 langues, dont le français, y compris pour les dialogues générés dans la bande-son.
Qu’est-ce que WAN 2.2 5B ?
WAN 2.2 TI2V‑5B est un modèle vidéo d’environ cinq milliards de paramètres capable de générer depuis un texte ou une image selon le workflow. Il constitue l’une des versions les plus intéressantes pour une installation locale sur un PC grand public.
WAN 2.2 5B fonctionne-t-il dans ComfyUI ?
Oui. ComfyUI prend en charge WAN 2.2 via des nodes et workflows adaptés. Il faut télécharger la bonne variante du modèle, le VAE, les encodeurs et les éventuels composants demandés par le workflow.
Quelle résolution utiliser avec WAN 2.2 5B ?
Le modèle officiel prend en charge la génération 720p, notamment en 1280 × 704 dans ses exemples. Sur une carte limitée en VRAM, commencez plus bas ou utilisez les paramètres recommandés par votre workflow, puis effectuez un upscale.
Peut-on utiliser WAN 2.2 avec 8 Go de VRAM ?
Oui, avec la version 5B et un workflow optimisé. Il faut réduire la résolution, le nombre de frames et utiliser l’offload. Douze ou seize gigaoctets offrent un usage beaucoup plus confortable.
Peut-on utiliser HunyuanVideo 1.5 avec 12 Go de VRAM ?
Une implémentation optimisée peut le permettre avec quantification, offload et paramètres raisonnables. Commencez par une courte séquence en résolution modérée. Vérifiez aussi sa licence, qui exclut l’Union européenne.
Quelle différence entre MiniMax H3 et HunyuanVideo 1.5 ?
H3 offre une meilleure cohérence, un meilleur respect du prompt et un son natif, mais il est bien plus lourd. HunyuanVideo 1.5 est plus rapide sur une carte moyenne et reste très cinématique, sans son.
Quelle différence entre HunyuanVideo 1.5 et WAN 2.2 ?
HunyuanVideo 1.5 m’a donné une meilleure qualité moyenne et un rendu très cinématique. WAN 2.2 dispose d’un écosystème plus large, d’une licence Apache 2.0 et peut être plus pratique à intégrer dans ComfyUI.
Quel modèle vidéo local est le plus rapide ?
Les variantes LTX sont particulièrement intéressantes pour générer rapidement des aperçus. La vitesse dépend néanmoins de la version, de la quantification, de la résolution, du nombre de frames et de la carte graphique.
Quels modèles génèrent le son avec la vidéo ?
MiniMax H3 génère un son stéréo natif : dialogues, bruitages et ambiances. La famille LTX-2 et LTX-2.5 génère aussi audio et vidéo ensemble. HunyuanVideo, WAN, CogVideoX et AnimateDiff produisent des vidéos muettes.
ComfyUI fonctionne-t-il entièrement en local ?
Oui, la génération peut fonctionner localement. Une connexion est nécessaire pour télécharger ComfyUI, les nodes, les modèles et les mises à jour. Certaines extensions particulières peuvent toutefois appeler des services externes.
Quelle différence entre ComfyUI et Pinokio ?
Pinokio installe et lance des applications. ComfyUI est une interface à nodes qui exécute les workflows de génération. Pinokio peut donc servir à installer ComfyUI, mais ne le remplace pas.
Quelle différence entre ComfyUI et Wan2GP ?
ComfyUI offre un contrôle maximal et permet de modifier chaque étape. Wan2GP propose une approche centrée sur la vidéo et les optimisations mémoire, et prend en charge MiniMax H3. Le premier est plus personnalisable, le second plus direct.
Qu’est-ce que Maestro ?
Maestro est un studio de création local, installable avec Pinokio, qui réunit images, vidéos, musique et voix. Il s’appuie sur Wan2GP pour faire tourner MiniMax H3 et est mis à jour pratiquement tous les jours.
Faut-il choisir le Text-to-Video ou l’Image-to-Video ?
L’Image-to-Video est généralement plus stable, car l’apparence du personnage et le décor sont déjà définis. Le Text-to-Video offre davantage de liberté, mais il demande au modèle d’inventer toute la scène.
Comment garder le même personnage dans plusieurs vidéos ?
Avec MiniMax H3, utilisez le mode références en lui fournissant plusieurs images du personnage. Avec les autres modèles, créez des images de référence cohérentes, éventuellement avec un LoRA, puis utilisez l’Image-to-Video.
Pourquoi le visage change-t-il pendant une vidéo IA ?
Les rotations fortes, les actions rapides et les longues séquences augmentent les déformations. Utilisez une image nette, limitez le mouvement et générez des clips plus courts.
À quoi sert RIFE ?
RIFE ajoute des images intermédiaires pour augmenter la fréquence d’images et fluidifier le mouvement. Il ne répare pas les déformations déjà présentes dans la vidéo.
Faut-il générer directement en 1080p ?
Pas forcément. Il est souvent plus efficace de générer dans une résolution modérée, de sélectionner le meilleur plan, puis de l’interpoler et de l’agrandir.
Combien de RAM faut-il pour la vidéo IA locale ?
Trente-deux gigaoctets constituent une bonne base. Soixante-quatre gigaoctets sont préférables pour les modèles lourds, et pratiquement indispensables pour MiniMax H3.
Combien d’espace disque faut-il prévoir ?
Prévoyez au moins 100 à 200 Go libres pour commencer sérieusement. MiniMax H3 seul demande environ 42,5 Go dans sa version la plus compacte.
Peut-on utiliser une RTX Laptop ?
Oui. Une RTX Laptop de 12, 16 ou 24 Go peut générer de véritables vidéos IA. Elle est généralement moins rapide qu’une carte de bureau portant un nom proche, mais les workflows optimisés restent exploitables.
Une RTX 3090 est-elle encore intéressante pour la vidéo IA ?
Oui. Ses 24 Go de VRAM restent très utiles, notamment pour MiniMax H3. Pour les modèles vidéo, cette quantité de mémoire compte plus que l’âge de l’architecture.
Peut-on tester une carte graphique avant de l’acheter ?
Oui. Des services comme RunPod, Vast.ai ou CUDO Compute louent des RTX 4090, RTX 5090 ou cartes professionnelles à l’heure, souvent pour moins d’un euro. Lancez votre propre workflow dessus et comparez le temps de génération avec votre PC avant d’investir.
Peut-on générer une longue vidéo localement ?
Oui, en assemblant plusieurs clips courts. Les modèles actuels obtiennent de meilleurs résultats sur quelques secondes, jusqu’à 15 secondes pour H3. Le montage permet ensuite de créer un film, un clip ou une vidéo YouTube beaucoup plus longue.
Quel modèle choisir pour une vidéo manga ou anime ?
MiniMax H3, HunyuanVideo 1.5 et WAN 2.2 fonctionnent bien à partir d’une image anime. AnimateDiff reste intéressant pour utiliser des checkpoints et LoRA SDXL spécialisés.
Quel modèle choisir pour une vidéo photoréaliste ?
MiniMax H3 est mon premier choix, suivi de HunyuanVideo 1.5 et WAN 2.2. La qualité de l’image de départ et la simplicité du mouvement restent déterminantes.
L’IA vidéo locale remplace-t-elle Kling, Runway, Veo ou Sora ?
Pas totalement. Les services cloud offrent une grande simplicité et beaucoup de puissance. L’IA locale apporte la confidentialité, l’absence de crédits par essai, le choix des modèles et, avec MiniMax H3, une qualité qui s’en rapproche fortement.










Commentaires