Thử hơn 20 local LLM: 4 model tôi giữ lại, mỗi model một vai trò

Cái bẫy phổ biến nhất khi chơi local LLM (mô hình ngôn ngữ chạy trên máy cá nhân) là thấy benchmark cao là tải về. Kết quả: SSD chật cứng những model hầu như không bao giờ mở. Sau hơn một năm mày mò và quay qua hơn 20 model, tác giả XDA Developers Yash Patel đã rút ra một nguyên tắc đơn giản: không cần một model "đánh bại mọi đối thủ" — chỉ cần vài model đúng việc. Đây là 4 model cuối cùng còn lại trên máy anh ấy, mỗi chiếc gánh một vai trò riêng.

Bộ máy chạy đằng sau

Trước khi nói model, cần biết phần cứng — vì với local LLM, tốc độ là chuyện tương đối theo máy:

  • RAM: 32GB
  • GPU: RTX 5070
  • CPU: Intel Core Ultra 9
  • SSD: 1TB

Tất cả model chạy qua KoboldCpp ở định dạng GGUF (bản lượng tử hóa — quantization — để vừa VRAM/RAM). Tổng dung lượng 4 model khoảng 43–45GB trên đĩa. Đừng hoảng: đó là dung lượng ổ cứng, không có nghĩa là mỗi lần chạy cần bấy nhiêu RAM, và càng không phải mở cả 4 cùng lúc.

KoboldCpp cho phép đẩy một phần layers của model vào VRAM, phần còn lại nằm ở system RAM. Càng nhiều layers trên GPU, tốc độ sinh token càng nhanh — nghĩa là VRAM không đủ vẫn chạy được, chỉ là chậm hơn.

1. Qwen 3.6 27B — lính chủ lực cho viết code

Vai trò: code, debug, refactor, đọc code cũ.

Bản dùng: Q5_K_S, khoảng 18GB — model nặng nhất trong 4 chiếc.

Đây là lựa chọn "chất lượng trên tốc độ": các đoạn code dài phải đợi lâu hơn, nhưng output sạch hơn, ít phải quay lại sửa. Với người làm technical, thời gian tiết kiệm được từ việc ít dọn dẹp sau này đáng giá hơn vài chục giây chờ đợi.

Lưu ý quan trọng: bản tác giả thực tế tải về là phiên bản third-party fusion (có chữ "Fable Fusion", "UnHeritic" trong tên) — tức là bản pha trộn và lượng tử hóa bởi cộng đồng, không phải bản chính thức của Alibaba. Chất lượng và mức độ align an toàn không thể quy về model gốc.

2. Gemma 4 12B — việc vặt hằng ngày, mở là chạy

Vai trò: hỏi đáp nhanh, tóm tắt, giải thích khái niệm, brainstorm ý tưởng, code nhẹ.

Bản dùng: Q4_0 instruction-tuned, khoảng 7–8GB.

Model 12B ở mức 4-bit là "điểm ngọt" cho người mới bắt đầu: máy có 16GB RAM là có cơ hội chạy mượt, tải nhanh, và để lại tài nguyên cho các app khác. Nếu model nằm gọn trong VRAM, trải nghiệm tương tác sẽ rất "snappy". Đây là chiếc model "mở là dùng" cho 80% công việc thường ngày.

3. gpt-oss-20b — suy nghĩ sâu cho vấn đề phức tạp

Vai trò: vấn đề nhiều tầng, so sánh phương án, kiểm tra logic của một ý tưởng.

Bản dùng: Q6_K, khoảng 11–12GB.

Khi câu hỏi cần reasoning thật sự thay vì phản xạ, tác giả chuyển sang model open-weight của OpenAI này. Chậm hơn các model nhỏ, nhưng đổi lại là lập luận đầy đủ và chặt chẽ hơn. Theo thông số chính thức: khoảng 21B tổng tham số, ~3.6B tham số kích hoạt mỗi token (kiến trúc MoE), chạy được trên thiết bị 16GB RAM. Nhưng "chạy được" khác "chạy nhanh" — context dài và GPU offload sẽ quyết định cảm giác thực tế.

4. Llama 3.3 8B (bản community) — sáng tác và thử văn phong

Vai trò: viết chuyện, xây dựng nhân vật, thử các phong cách viết.

Bản dùng: Q6_K, khoảng 7GB.

Model nhỏ, tải nhanh — đổi prompt xong là chạy lại được ngay, rất hợp với việc "thử – sửa – thử lại" trong sáng tác. Nhưng cần đọc kỹ nguồn: Meta chỉ phát hành Llama 3.3 chính thức ở bản 70B. Bản 8B tác giả dùng là community fine-tune (ghi chú Thinking, Heretic, Uncensored trên model card), nguồn và dữ liệu huấn luyện không minh bạch như bản gốc. Dùng để sáng tác thì thoải mái; dùng cho tài liệu khách hàng hay dữ liệu nội bộ cần đánh giá rủi ro nguồn gốc trước.

Vì sao chịu khó chạy local?

  • Privacy: prompt và tài liệu không rời khỏi máy bạn — hợp đồng, dự án chưa công bố, dữ liệu nhạy cảm đều ở lại local.
  • Offline: tải model và tool xong là cắt mạng vẫn chạy.
  • Không subscription: không trả phí AI hàng tháng.

Đổi lại, bạn trả bằng thứ khác: dung lượng SSD, RAM, VRAM, điện năng và thời gian chờ.

Lời khuyên nếu bạn mới bắt đầu

Đừng sao chép nguyên list 4 model. Cách tiếp cận hợp lý hơn:

  1. Bắt đầu bằng một model nhỏ 7–12GB (như Gemma 4 12B Q4) cho việc hằng ngày.
  2. Thêm một model lớn hơn theo nhu cầu thực tế — code nặng thì 27B, reasoning sâu thì gpt-oss-20b.
  3. Với các bản uncensored / community mod, luôn kiểm tra model card, tác giả và model gốc trước khi tải.
  4. Local LLM không phải để thay thế cloud AI mọi lúc — nó là để bạn sở hữu một phần năng lực AI mà không gửi dữ liệu đi đâu, với chi phí chỉ là phần cứng bạn đã có.

    Nguồn

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *