ComfyUI trên 8GB VRAM: test thật với MiniMax H3
Chạy ComfyUI v0.33.0 trên RTX 2060 8GB: cài gì, workflow MiniMax H3 video/image nào chạy nổi, VRAM còn đâu. Kèm verdict cho máy tầm trung.
ComfyUI trên 8GB VRAM: test thật với MiniMax H3
Máy tôi chỉ có RTX 2060 8GB — con số này 2 năm trước đủ xỉn, nay là nút thắt khi AI video tràn về. Nhưng ComfyUI v0.33.0 vẫn chạy tốt nếu biết cách. Bài này ghi lại bộ setup thật tôi đang dùng hàng ngày, kèm workflow đã test chạy nổi trên 8GB.
Thành thật đầu bài: đây không phải bài hướng dẫn từ tài liệu. Tôi viết từ máy thật (RTX 2060 8GB, driver 610.47, CUDA 13.3) với ComfyUI đang chạy trên đó. Số liệu VRAM là quan sát thực tế, không phải spec sheet.
Vấn đề
Hầu hết tutorial ComfyUI trên web giả định bạn có 24GB+. Mở video workflow là thấy ngay bãi tha ma: thử load model → OOM → đọc forum → cài thêm 3 node → lại OOM. Tốn cả buổi tối mà không ra 1 frame.
Trên 8GB thật ra vấn đề không phải model chạy được hay không — mà là chọn đúng workflow biết tiết kiệm VRAM. Model phải làm chuyện này.
Setup
Cấu hình tôi đang chạy (đúng con số trên máy):
| Thành phần | Giá trị |
|---|---|
| GPU | RTX 2060 8GB (driver 610.47, CUDA 13.3) |
| ComfyUI | v0.33.0 (commit 0d808580, Aug 2026) |
| Frontend package | comfyui-frontend-package 1.49.6 |
| Custom nodes | 11 bộ (Easy-Use, GGUF, VideoHelperSuite, IPAdapter_plus, LayerDiffuse, KJNodes...) |
| Model chính | MiniMax H3 (text encoder Q2_K GGUF, diffusion int8 pruned, turbo LoRA) |
| Anime SD | GhostMix-V1.2, Animagine XL 3.1, AOM3, Anitoon |
Model MiniMax H3 được chọn vì nó có hẳn phiên bản quantized + pruned + turbo LoRA sinh ra cho máy VRAM thấp: text encoder về GGUF Q2_K (giảm ~75% so với fp16), diffusion model int8 pruned, video VAE fp16.
Kết quả test
Workflow minimax_h3_rtx2060 — chạy thật trên 8GB
Workflow này tôi tự dựng trên máy, nhồi đủ trick tiết kiệm VRAM:
- MiniMaxChunkFeedForward với
chunks: 4,seq_threshold: 4096— cắt feed-forward thành 4 chunk để không bao giờ cấp phát attention full-length. - MiniMaxLowVRAMAttention với
head_chunks: 4— attention chạy theo từng nhóm head, VRAM giảm mạnh ở chi phí tốc độ. - Text encoder GGUF quantized thay vì fp16.
- Diffusion int8 pruned thay vì fp16/bf16.
Kết quả trung thực:
| Hạng mục | Kết quả | |---|---| | Tạo video clip ngắn | Chạy được, không OOM | | Image generation (anime SDXL/1.5) | Mượt — đây là sở trường 8GB | | Video generation dài / nhiều frame | OOM nếu đẩy quá — cần chia nhỏ | | Turbo LoRA (8 step) | OK — số bước ít = VRAM peak thấp hơn | | Chi phí | 0 VND phần mềm, chỉ tốn điện |
Con số thật: máy tôi đang chạy 22 process (Telegram, Docker, browser, code editor)
cùng lúc mà nvidia-smi vẫn thấy 8GB đủ cho ComfyUI — nghĩa là không cần khóa máy
sạch để chạy.
Điểm đáng kể
- IPAdapter + LayerDiffuse chạy được trên 8GB — rút 2 nhánh này là mất 1 nửa sức mạnh ComfyUI rồi.
- Big-LAMA inpaint + BirefNet background removal có model nặng chừng nào vẫn OK vì xử lý trên latent nhỏ.
- ComfyUI hút model theo kiểu chạy tới đâu load tới đó — không phải load hết 1 lúc.
Chi phí
- Bản thân ComfyUI: 0 VND. MIT, repo công khai, update theo git.
- Máy: nếu bạn đã có GPU ≥ 8GB thì chẳng tốn gì thêm. Nếu định mua: 12GB là điểm ngọt hiện tại (đủ SDXL thoải mái + video ngắn), 8GB là tối thiểu khả dụng.
- Thời gian setup: lần đầu ~45 phút nếu đã biết cài Python. Lần sau còn 10 phút vì đã có sẵn bộ custom nodes.
Giới hạn
- 8GB không phải để render video dài. Mọi thứ dưới ~10 giây là ổn; muốn video đủ dài, đẹp như H100 bạn đang xem demo phải sang máy thuê GPU (và đắt).
- Quantized model nhanh nhưng chất lượng từ ngữ/phím có giảm đôi chút so với fp16 — chấp nhận được vì đổi lại chạy được trên máy đang có.
- Chưa test sâu video generation dài, mới dừng ở clip ngắn.
- Các con số thời gian render tôi không đo chính xác từng giây — bạn nên tự chạy trên máy mình, nó phụ thuộc GPU.
Verdict
Đáng thử nếu bạn có máy ≥ 8GB VRAM và muốn AI image/video generation local không bị khóa theo API. Đây là workflow chạy được thật, không phải demo.
Không nên dùng nếu: bạn cần video dài chất lượng cao mỗi ngày — lúc đó thuê GPU/model API rẻ và đỡ đau hơn tự render, hoặc đợi model thế hệ mới tối ưu thêm.
Nếu theo, bắt đầu với: ComfyUI v0.33 + bộ 11 custom node cơ bản + 1 SD anime checkpoint
trước, trong workflow minimax_h3_rtx2060 làm benchmark — rồi mới nhét thêm node.
Bài cùng chủ đề AI tools mới có thể bạn xem: đánh giá OmniVoice TTS tiếng Việt chạy local (cùng hạ tầng GPU này dùng chung).