GPU cũ cuối cùng cũng đáng dùng cho home server AI

GPU cũ cuối cùng cũng “khả dụng” cho home server AI — và bạn không cần 24GB VRAM

Tóm tắt từ bài XDA Developers (Ayush Pande, 12/09/2026)

Nhiều người vẫn tin rằng để chạy LLM tại nhà bạn phải có GPU đời mới với VRAM khổng lồ (24GB trở lên). Tác giả Ayush Pande trên XDA lập luận điều ngược lại: nhờ kiến trúc Mixture-of-Experts (MoE), ngay cả GPU cũ 12GB VRAM hay đời Pascal như GTX 1080 (8GB) cũng có thể chạy những mô hình lớn tới 35B với tốc độ đáp ứng được cho công việc thật.

Vấn đề với cách chạy LLM “cổ điển”

Trước MoE, người chơi LLM local thường phải:

  • Quant mô hình xuống INT2 — chạy được nhưng độ chính xác sụt giảm tệ hại.
  • Dùng cờ -ngl để offload một phần sang CPU — GPU khô hơn nhưng CPU trở thành bottleneck, tốc độ sinh token tụt thảm.

Kết quả: nếu muốn “vừa GPU cũ, vừa chất lượng”, gần như không thể.

MoE thay đổi cách chơi

Mô hình MoE chia trọng lượng thành nhiều “experts” feed-forward nhỏ chạy song song. Router chỉ kích hoạt experts phù hợp cho từng token. Nghĩa là: router + attention giữ trong VRAM, còn phần experts nặng có thể offload sang RAM hệ thống. llama.cpp hỗ trợ điều này qua cờ --n-cpu-moe.

Con số thực nghiệm

  • RTX 3080 Ti (12GB VRAM) chạy Qwen3.6-35B-A3B (Q4_K_M) đạt ≥25 tokens/giây. Đủ nhanh để tác giả dùng làm VS Code companion, agent harness trên Raspberry Pi và máy chủ giám sát Pulse.
  • GTX 1080 (Pascal, 8GB) chạy Gemma-4-26B-A4B đạt ~14 tokens/giây — tốc độ chậm nhưng vẫn đủ cho chạy background (Open Notebook, Paperless-GPT).
  • Gemma-4-E4B (embedding per-layer) chạy trên RTX 3080 Ti: ~100 t/s; GTX 1080: 35–40 t/s; thậm chí Arc A750 / GTX 1060 laptop: ~30 t/s. Tác giả dắt bộ này vào pipeline voice assistant Home Assistant.

Ý nghĩa thực tế cho home lab

Thay vì bỏ tiền mua RTX 4090/5090 chỉ để “chạy được LLM”, bạn có thể:

  • Dùng lại RTX 3080/4070Ti 12GB cũ làm máy chủ inference “gần thời gian thực” (coding, RAG, tool-use agents).
  • Tận dụng GTX 1080/1080 Ti hay Arc A750 làm node background cho batch tasks, summarization, embeddings.
  • Kết hợp nhiều GPU cũ bằng llama.cpp multi-GPU để “cộng VRAM”.

Những quan điểm cần phân biệt

Bài viết không nói có thể thay thế RTX 5090 — bài sắp xếp giá trị tiện ích: nếu công việc của bạn là inference 24/7 ở cỡ vài tok/s, GPU cũ đủ. Chỉ cần spec mới khi chạy dense models lớn, parallel cao, hay fine-tuning.

Bài gốc (tiếng Anh): Old GPUs are finally practical for home server AI — XDA

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *