MiniMax H3 (33B) VRAM requirements
The biggest open video release of 2026 and the most downloaded ComfyUI repo of the year: 33B parameters, 4–15 second clips with native stereo sound. Two variants (first/last-frame and reference-to-video); load one.
01The files, and how much VRAM each needs
| File | Size | Needed | Min. VRAM | Quality | Source |
|---|---|---|---|---|---|
| 16-bit | 66.3 GB | 72.1 GB | 73 GB | the original weights | Comfy-Org/MiniMax-H3 → |
| Q8_0 | 36.0 GB | 41.8 GB | 42 GB | practically identical to the original | Abiray/MiniMax-H3-GGUF → |
| INT8 | 34.0 GB | 39.8 GB | 40 GB | practically identical to the original | Comfy-Org/MiniMax-H3 → |
| Q6_K | 28.2 GB | 34.0 GB | 35 GB | very close to the original | Abiray/MiniMax-H3-GGUF → |
| Q5_K_M | 23.9 GB | 29.7 GB | 30 GB | close; small differences in fine detail | Abiray/MiniMax-H3-GGUF → |
| Q4_K_M | 19.9 GB | 25.7 GB | 26 GB | good; some loss in fine detail and text | Abiray/MiniMax-H3-GGUF → |
| Q3_K_M | 15.6 GB | 21.4 GB | 22 GB | noticeable loss of detail | Abiray/MiniMax-H3-GGUF → |
“Needed” = file + 5 GB working memory + 0.8 GB system reserve.
02By amount of VRAM
03Best GPU for MiniMax H3
The cheapest cards (by launch price) that run it well, and every card sorted by memory: best GPU for MiniMax H3 → Planning bigger images or longer clips? Open the calculator →
04By graphics card
| GPU | VRAM | Verdict | Best file | Needed |
|---|---|---|---|---|
| Desktop graphics cards | ||||
| RTX 2060 6 GB | 6 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3050 6 GB | 6 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2070 Super 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2080 Super 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3050 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3060 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3060 Ti 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3070 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3070 Ti 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 4060 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 4060 Ti 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 5050 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 5060 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 5060 Ti 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 7600 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 9050 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 9060 XT 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| Arc B570 10 GB | 10 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 3080 10 GB | 10 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 2080 Ti 11 GB | 11 GB | Offload only | Q4_K_M | 25.7 GB |
| Arc B580 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 2060 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 3060 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 3080 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 3080 Ti 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4070 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4070 Super 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4070 Ti 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5070 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7700 XT 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 9070 GRE 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| Arc A770 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4060 Ti 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4070 Ti Super 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4080 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4080 Super 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5060 Ti 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5070 Ti 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5080 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7600 XT 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7800 XT 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7900 GRE 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 9060 XT 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 9070 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 9070 XT 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7900 XT 20 GB | 20 GB | Offload only | Q3_K_M | 21.4 GB |
| Arc Pro B60 24 GB | 24 GB | Tight | Q3_K_M | 21.4 GB |
| RTX 3090 24 GB | 24 GB | Tight | Q3_K_M | 21.4 GB |
| RTX 3090 Ti 24 GB | 24 GB | Tight | Q3_K_M | 21.4 GB |
| RTX 4090 24 GB | 24 GB | Tight | Q3_K_M | 21.4 GB |
| RX 7900 XTX 24 GB | 24 GB | Tight | Q3_K_M | 21.4 GB |
| Arc Pro B70 32 GB | 32 GB | Runs | Q5_K_M | 29.7 GB |
| RTX 5090 32 GB | 32 GB | Runs | Q5_K_M | 29.7 GB |
| Laptop GPUs | ||||
| RTX 3050 Laptop 4 GB | 4 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3050 Ti Laptop 4 GB | 4 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2060 Laptop 6 GB | 6 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3050 Laptop 6 GB | 6 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3060 Laptop 6 GB | 6 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 4050 Laptop 6 GB | 6 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2070 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2070 Super Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2080 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 2080 Super Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3070 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3070 Ti Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 3080 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 4060 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 4070 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 5050 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 5060 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 5070 Laptop 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 7600M 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 7600M XT 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 7600S 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RX 7700S 8 GB | 8 GB | Not practical | Q3_K_M | 21.4 GB |
| RTX 4080 Laptop 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5070 Laptop 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5070 Ti Laptop 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7800M 12 GB | 12 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 3080 Laptop 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 3080 Ti Laptop 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 4090 Laptop 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5080 Laptop 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RX 7900M 16 GB | 16 GB | Offload only | Q4_K_M | 25.7 GB |
| RTX 5090 Laptop 24 GB | 24 GB | Tight | Q3_K_M | 21.4 GB |
| Unified memory | ||||
| Radeon 8060S (Strix Halo) 96 GB | 96 GB | Runs well | 16-bit | 72.1 GB |
| Apple Silicon Macs (by memory) | ||||
| Mac 16 GB | 12.7 GB | Offload only | Q4_K_M | 25.7 GB |
| Mac 18 GB | 14.4 GB | Offload only | Q4_K_M | 25.7 GB |
| Mac 24 GB | 19.6 GB | Offload only | Q3_K_M | 21.4 GB |
| Mac 32 GB | 26.8 GB | Runs | Q4_K_M | 25.7 GB |
| Mac 36 GB | 30.2 GB | Runs | Q5_K_M | 29.7 GB |
| Mac 48 GB | 40.2 GB | Runs | Q6_K | 34.0 GB |
| Mac 64 GB | 55.7 GB | Runs well | Q8_0 | 41.8 GB |
| Mac 96 GB | 85 GB | Runs well | 16-bit | 72.1 GB |
| Mac 128 GB | 115.4 GB | Runs well | 16-bit | 72.1 GB |
| Mac 192 GB | 175.4 GB | Runs well | 16-bit | 72.1 GB |
| Mac 256 GB | 236.9 GB | Runs well | 16-bit | 72.1 GB |
| Mac 512 GB | 498.1 GB | Runs well | 16-bit | 72.1 GB |
On RTX 40/50 GPUs the FP8 file is preferred over Q8_0 when both fit (hardware FP8). All verdicts are calculated; see how the numbers work.
05Text encoder, VAE and other files
| File | Folder | Size | When | |
|---|---|---|---|---|
| Qwen3-VL 32B NVFP4 (AWQ) qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders | 15.7 GB | text encoder · smaller, recommended | Download → |
| Qwen3-VL 32B INT8 (convrot) qwen3vl_32b_minimax_h3_int8_convrot.safetensors | models/text_encoders | 27.1 GB | text encoder · alternative | Download → |
| Qwen3-VL 32B BF16 qwen3vl_32b_minimax_h3_bf16.safetensors | models/text_encoders | 51.5 GB | text encoder · alternative | Download → |
| MiniMax H3 video VAE FP16 minimax_h3_video_vae_fp16.safetensors | models/vae | 5.2 GB | required | Download → |
| MiniMax H3 audio VAE FP32 minimax_h3_audio_vae_fp32.safetensors | models/vae | 0.6 GB | required | Download → |
The files the official ComfyUI workflows load next to the model. Sizes read from Hugging Face (2026-09-25). Every GPU page for this model lists the exact set to download for that card, with the total.
Qwen3-VL 32B: 51.5 GB as 16-bit, 27.1 GB as INT8, 15.7 GB as NVFP4. ComfyUI encodes the prompt first and can push the encoder out of VRAM before sampling, so it does not have to fit together with the model. On 16 GB the encoder itself is too big for VRAM, so let it run from system RAM: slower prompt encoding, same images.
06Where the files go in ComfyUI
| File | Folder | Loader node |
|---|---|---|
| Diffusion model (.safetensors: 16-bit, FP8, INT8) | ComfyUI/models/diffusion_models | Load Diffusion Model |
| GGUF file (.gguf) | ComfyUI/models/unet | Unet Loader (GGUF) — from the ComfyUI-GGUF node pack |
| Text encoder | ComfyUI/models/text_encoders | Load CLIP / DualCLIPLoader (or the GGUF versions) |
| VAE | ComfyUI/models/vae | Load VAE |
Standard ComfyUI folders. After copying files, press R in ComfyUI (or restart it) to refresh the lists. Some uploads need their uploader's own loader node — see the notes above.
07AMD, Intel and NVIDIA: which file types are fast
| File type | RTX 50 | RTX 40 | RTX 30 / 20 | RX 9000 | RX 7000/6000 · Strix Halo | Intel Arc |
|---|---|---|---|---|---|---|
| 16-bit | Runs | Runs | Runs | Runs | Runs | Runs |
| INT8 | Native INT8 | Native INT8 | Native INT8 | Native INT8 | Native INT8 | No INT8 speed-up |
| GGUF | Runs (GGUF node) | Runs (GGUF node) | Runs (GGUF node) | Runs (GGUF node) | Runs (GGUF node) | Runs (GGUF node) |
Every file type loads on every listed GPU, so the memory verdicts apply to all of them. What differs is speed: FP8 maths needs RTX 40/50 or RX 9000 (with ROCm 6.4+ and PyTorch 2.7+); ComfyUI's INT8 maths runs on NVIDIA and AMD, not on Intel; GGUF is unpacked on the fly on any GPU, which costs some speed. NVFP4 files are fast only on RTX 50. AMD runs ComfyUI on Windows through ROCm, Intel through PyTorch XPU; some custom nodes are NVIDIA-only. Source: ComfyUI model_management.py. AMD and Intel guide →
08Measured and reported results
| Label | GPU | Setup | Result | Peak VRAM | Date | Source |
|---|---|---|---|---|---|---|
| reported | RTX 3090 24 GB | transformer variant not stated; NVFP4 text encoder · 832x480 “render 23 min 17 s ... peak VRAM ~19.8 GB of 24 GB” 15.08 s clip at 24 fps with audio; needs --disable-pinned-memory on 32 GB RAM; 23 min 17 s = 1397 s; no date shown | 1397 s / clip (362 frames) | 19.8 GB | — | github.com → |
Reported results are other people's numbers, copied as published, with a link. Settings, drivers and ComfyUI versions differ, so compare them with care. Send yours.
09Training a LoRA for MiniMax H3
No trainer documentation with a VRAM figure for this model was found yet. What the trainers say for other models →
10Every file tracked for MiniMax H3
| File | Type | Size | Repo |
|---|---|---|---|
| MiniMax-H3-FL2VA-Q8_0.gguf (fl2va) | Q8_0 | 36.04 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q8_0.gguf (ref2va) | Q8_0 | 36.04 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q6_K.gguf (fl2va) | Q6_K | 28.22 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q6_K.gguf (ref2va) | Q6_K | 28.22 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q5_K_M.gguf (fl2va) | Q5_K_M | 23.89 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q5_K_S.gguf (fl2va) | Q5_K_S | 23.89 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q5_K_M.gguf (ref2va) | Q5_K_M | 23.89 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q5_K_S.gguf (ref2va) | Q5_K_S | 23.89 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q5_0.gguf (fl2va) | Q5_0 | 22.78 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q5_0.gguf (ref2va) | Q5_0 | 22.78 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q4_K_M.gguf (fl2va) | Q4_K_M | 19.86 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q4_K_S.gguf (fl2va) | Q4_K_S | 19.85 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q4_K_M.gguf (ref2va) | Q4_K_M | 19.85 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q4_K_S.gguf (ref2va) | Q4_K_S | 19.85 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q4_0.gguf (fl2va) | Q4_0 | 18.64 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q4_0.gguf (ref2va) | Q4_0 | 18.64 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q3_K_M.gguf (fl2va) | Q3_K_M | 15.57 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-FL2VA-Q3_K_S.gguf (fl2va) | Q3_K_S | 15.57 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q3_K_M.gguf (ref2va) | Q3_K_M | 15.57 GB | Abiray/MiniMax-H3-GGUF → |
| MiniMax-H3-Ref2VA-Q3_K_S.gguf (ref2va) | Q3_K_S | 15.57 GB | Abiray/MiniMax-H3-GGUF → |
| minimax_h3_fl2va_bf16.safetensors (fl2va) | BF16 | 66.28 GB | Comfy-Org/MiniMax-H3 → |
| minimax_h3_ref2va_bf16.safetensors (ref2va) | BF16 | 66.28 GB | Comfy-Org/MiniMax-H3 → |
| minimax_h3_ref2va_int8_convrot.safetensors (ref2va) | INT8 | 34.04 GB | Comfy-Org/MiniMax-H3 → |
| minimax_h3_fl2va_int8_convrot.safetensors (fl2va) | INT8 | 34.04 GB | Comfy-Org/MiniMax-H3 → |
33B (HF API 33.1B) omni transformer generating video WITH native stereo audio, 4-15 s, 768p native (2K via upscale pass). Two denoisers: fl2va (text/first/last-frame-to-video+audio) and ref2va (up to 9 images/3 videos/3 audio refs); load one. 'Pruned' variants are smaller official Comfy-Org cuts (40.2 GB bf16 vs 66.3 GB). VAEs: minimax_h3_video_vae_fp16 5207808496 + minimax_h3_audio_vae_fp32 605254808. Native ComfyUI support (day-0, Aug 2026 blog); Comfy blog says smallest variants total 42.5 GB (from 123.6 GB). unsloth/MiniMax-H3-GGUF (~1.18M downloads, pruned only, quants named Q3_K/Q4_K/UD-*) is documented for stable-diffusion.cpp, not ComfyUI - not listed.