Most models in ComfyUI need two or three files: the model itself (in models/diffusion_models, or models/unet for GGUF), a text encoder (models/text_encoders) and a VAE (models/vae). Many of these files are shared: one T5-XXL or one Wan VAE serves several models, so you only download it once.
models/text_encoders · 44 text encoder files
| File | Size | Used by |
|---|---|---|
| umt5_xxl_fp16.safetensors UMT5-XXL FP16 | 11.4 GB | Wan 2.1 14B, Wan 2.1 1.3B, Wan 2.1 I2V 480P, Wan 2.1 I2V 720P … |
| umt5_xxl_fp8_e4m3fn_scaled.safetensors UMT5-XXL FP8 (scaled) | 6.7 GB | Wan 2.1 14B, Wan 2.1 1.3B, Wan 2.1 I2V 480P, Wan 2.1 I2V 720P … |
| t5xxl_fp16.safetensors T5-XXL FP16 | 9.8 GB | FLUX.1 dev, FLUX.1 schnell, FLUX.1 Kontext, FLUX.1 Krea … |
| clip_l.safetensors CLIP-L | 0.2 GB | FLUX.1 dev, FLUX.1 schnell, FLUX.1 Kontext, FLUX.1 Krea … |
| t5xxl_fp8_e4m3fn.safetensors T5-XXL FP8 | 4.9 GB | FLUX.1 dev, FLUX.1 schnell, FLUX.1 Kontext, FLUX.1 Krea … |
| qwen_2.5_vl_7b.safetensors Qwen2.5-VL 7B BF16 | 16.6 GB | Qwen-Image, Qwen-Image-Edit, HunyuanImage 2.1, HunyuanVideo 1.5 |
| qwen_2.5_vl_7b_fp8_scaled.safetensors Qwen2.5-VL 7B FP8 | 9.4 GB | Qwen-Image, Qwen-Image-Edit, HunyuanImage 2.1, HunyuanVideo 1.5 |
| qwen_3_4b.safetensors Qwen3 4B BF16 | 8.0 GB | FLUX.2 klein 4B, Z-Image Turbo, Z-Image |
| qwen_3_4b_fp8_mixed.safetensors Qwen3 4B FP8 | 5.6 GB | FLUX.2 klein 4B, Z-Image Turbo, Z-Image |
| t5xxl_fp8_e4m3fn_scaled.safetensors T5-XXL FP8 scaled | 5.2 GB | HiDream-I1, HiDream-I1 Full, LTX-Video 13B |
| byt5_small_glyphxl_fp16.safetensors ByT5 small Glyph-XL | 0.4 GB | HunyuanImage 2.1, HunyuanVideo 1.5 |
| clip_g.safetensors CLIP-G | 1.4 GB | SD 3.5 Large, SD 3.5 Medium |
| clip_g_hidream.safetensors CLIP-G (HiDream) | 1.4 GB | HiDream-I1, HiDream-I1 Full |
| clip_l_hidream.safetensors CLIP-L (HiDream) | 0.2 GB | HiDream-I1, HiDream-I1 Full |
| gemma_3_12B_it.safetensors Gemma 3 12B BF16 | 24.4 GB | LTX-2, LTX-2.3 |
| gemma_3_12B_it_fp4_mixed.safetensors Gemma 3 12B FP4 mixed | 9.4 GB | LTX-2, LTX-2.3 |
| gemma_3_12B_it_fp8_scaled.safetensors Gemma 3 12B FP8 (scaled) | 13.2 GB | LTX-2, LTX-2.3 |
| llama_3.1_8b_instruct_fp8_scaled.safetensors Llama 3.1 8B Instruct FP8 | 9.1 GB | HiDream-I1, HiDream-I1 Full |
| qwen3vl_32b_minimax_h3_bf16.safetensors Qwen3-VL 32B BF16 | 51.5 GB | MiniMax H3, MiniMax H3 Pruned |
| qwen3vl_32b_minimax_h3_int8_convrot.safetensors Qwen3-VL 32B INT8 (convrot) | 27.1 GB | MiniMax H3, MiniMax H3 Pruned |
| qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors Qwen3-VL 32B NVFP4 (AWQ) | 15.7 GB | MiniMax H3, MiniMax H3 Pruned |
| qwen3vl_4b_bf16.safetensors Qwen3-VL 4B BF16 | 8.9 GB | Krea 2, Mage-Flow |
| qwen3vl_8b_fp8_scaled.safetensors Qwen3-VL 8B FP8 | 10.6 GB | Ideogram 4, Boogu-Image |
| ernie-image-prompt-enhancer.safetensors ERNIE prompt enhancer (optional) | 6.9 GB | ERNIE-Image |
| gemma4-12b-with-proj-ltx-2.5-bf16.safetensors Gemma 4 12B + LTX projection BF16 | 26.3 GB | LTX-2.5 |
| gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors Gemma 4 12B + LTX projection INT8 (convrot) | 15.4 GB | LTX-2.5 |
| gemma4_e2b_it_int8_convrot.safetensors Gemma 4 E2B INT8 (prompt enhancer, optional) | 5.2 GB | LTX-2.5 |
| gemma_2_2b_fp16.safetensors Gemma 2 2B FP16 | 5.2 GB | Lumina 2.0 |
| llava_llama3_fp16.safetensors LLaVA-Llama3 FP16 | 16.1 GB | HunyuanVideo 13B |
| llava_llama3_fp8_scaled.safetensors LLaVA-Llama3 FP8 (scaled) | 9.1 GB | HunyuanVideo 13B |
| ltx-2-19b-dev_embeddings_connectors.safetensors LTX-2 text embeddings connectors (projection) | 2.9 GB | LTX-2 |
| ltx-2.3-22b-dev_embeddings_connectors.safetensors LTX-2.3 text embeddings connectors (projection) | 2.3 GB | LTX-2.3 |
| ming_image_0.1_ling_mini_2.0_bf16.safetensors Ling-Mini-2.0 BF16 | 36.7 GB | Ming-Image |
| ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors Ling-Mini-2.0 INT8 | 19.5 GB | Ming-Image |
| ming_image_0.1_ling_mini_2.0_w4a8.safetensors Ling-Mini-2.0 (4-bit w4a8) | 12.8 GB | Ming-Image |
| ministral-3-3b.safetensors Ministral 3 3B | 7.7 GB | ERNIE-Image |
| mistral_3_small_flux2_bf16.safetensors Mistral 3 Small BF16 | 35.6 GB | FLUX.2 dev |
| mistral_3_small_flux2_fp8.safetensors Mistral 3 Small FP8 | 18.0 GB | FLUX.2 dev |
| qwen3vl_4b_fp8_scaled.safetensors Qwen3-VL 4B FP8 | 5.2 GB | Krea 2 |
| qwen3vl_8b_bf16.safetensors Qwen3-VL 8B BF16 | 17.5 GB | Qwen-Image 2.1 |
| qwen3vl_8b_int8_convrot.safetensors Qwen3-VL 8B INT8 | 9.4 GB | Qwen-Image 2.1 |
| qwen3vl_8b_nvfp4.safetensors Qwen3-VL 8B NVFP4 | 6.3 GB | Ideogram 4 |
| qwen_3_8b.safetensors Qwen3 8B BF16 | 16.4 GB | FLUX.2 klein 9B |
| qwen_3_8b_fp8mixed.safetensors Qwen3 8B FP8 | 8.7 GB | FLUX.2 klein 9B |
models/vae · 22 VAE files
| File | Size | Used by |
|---|---|---|
| ae.safetensors FLUX.1 VAE (ae) | 0.3 GB | FLUX.1 dev, FLUX.1 schnell, FLUX.1 Kontext, FLUX.1 Krea … |
| wan_2.1_vae.safetensors Wan 2.1 VAE | 0.3 GB | Wan 2.1 14B, Wan 2.1 1.3B, Wan 2.1 I2V 480P, Wan 2.1 I2V 720P … |
| flux2-vae.safetensors FLUX.2 VAE | 0.3 GB | FLUX.2 dev, FLUX.2 klein 9B, FLUX.2 klein 4B, Ideogram 4 … |
| qwen_image_vae.safetensors Qwen-Image VAE | 0.3 GB | Krea 2, Qwen-Image, Qwen-Image-Edit |
| minimax_h3_audio_vae_fp32.safetensors MiniMax H3 audio VAE FP32 | 0.6 GB | MiniMax H3, MiniMax H3 Pruned |
| minimax_h3_video_vae_fp16.safetensors MiniMax H3 video VAE FP16 | 5.2 GB | MiniMax H3, MiniMax H3 Pruned |
| Wan2_1_VAE_bf16.safetensors Wan 2.1 VAE BF16 (Kijai) | 0.3 GB | Wan Animate 2, SCAIL-2 |
| flux1_vae_bf16.safetensors FLUX.1 VAE BF16 | 0.2 GB | Boogu-Image |
| hunyuan_image_2.1_vae_fp16.safetensors HunyuanImage 2.1 VAE | 0.8 GB | HunyuanImage 2.1 |
| hunyuan_video_vae_bf16.safetensors HunyuanVideo VAE BF16 | 0.5 GB | HunyuanVideo 13B |
| hunyuanvideo15_vae_fp16.safetensors HunyuanVideo 1.5 VAE FP16 | 2.5 GB | HunyuanVideo 1.5 |
| ltx-2-19b-dev_audio_vae.safetensors LTX-2 audio VAE | 0.2 GB | LTX-2 |
| ltx-2-19b-dev_video_vae.safetensors LTX-2 video VAE | 2.4 GB | LTX-2 |
| ltx-2.3-22b-dev_audio_vae.safetensors LTX-2.3 audio VAE | 0.4 GB | LTX-2.3 |
| ltx-2.3-22b-dev_video_vae.safetensors LTX-2.3 video VAE | 1.5 GB | LTX-2.3 |
| ltx-2.5-audio-vae-bf16.safetensors LTX-2.5 audio VAE + vocoder BF16 | 0.4 GB | LTX-2.5 |
| ltx-2.5-video-vae-bf16.safetensors LTX-2.5 video VAE (DiffVAE) BF16 | 1.5 GB | LTX-2.5 |
| LTXV-13B-0.9.8-dev-VAE.safetensors LTXV 13B 0.9.8 VAE (standalone, QuantStack) | 2.5 GB | LTX-Video 13B |
| mage_flow_vae_bf16.safetensors Mage-Flow VAE | 0.3 GB | Mage-Flow |
| ming_image_vae_bf16.safetensors Ming-Image VAE | 0.3 GB | Ming-Image |
| qwen_image_2.1_vae_bf16.safetensors Qwen-Image 2.1 VAE | 0.7 GB | Qwen-Image 2.1 |
| wan2.2_vae.safetensors Wan 2.2 VAE | 1.4 GB | Wan 2.2 5B |
models/clip_vision · 3 vision encoder files
| File | Size | Used by |
|---|---|---|
| clip_vision_h.safetensors CLIP Vision H | 1.3 GB | Wan 2.1 I2V 480P, Wan 2.1 I2V 720P, Wan 2.2 Animate, Wan Animate 2 … |
| llava_llama3_vision.safetensors LLaVA-Llama3 vision | 0.6 GB | HunyuanVideo 13B |
| sigclip_vision_patch14_384.safetensors SigCLIP vision patch14 384 | 0.9 GB | HunyuanVideo 1.5 |
models/audio_encoders · 1 audio encoder file
| File | Size | Used by |
|---|---|---|
| wav2vec2_large_english_fp16.safetensors wav2vec2 large English FP16 (audio encoder) | 0.6 GB | Wan 2.2 S2V |
models/latent_upscale_models · 3 latent upscaler files
| File | Size | Used by |
|---|---|---|
| ltx-2-spatial-upscaler-x2-1.0.safetensors LTX-2 spatial upscaler x2 | 1.0 GB | LTX-2 |
| ltx-2.3-spatial-upscaler-x2-1.1.safetensors LTX-2.3 spatial upscaler x2 1.1 | 1.0 GB | LTX-2.3 |
| ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors LTX-2.5 latent spatial upscaler x2 | 1.0 GB | LTX-2.5 |
models/checkpoints · 1 checkpoint file
| File | Size | Used by |
|---|---|---|
| sam3.1_multiplex_fp16.safetensors SAM 3.1 multiplex FP16 (segmentation) | 1.7 GB | SCAIL-2 |
The main model files are listed on each model page, with the right size for your card.