Bản tin Tech Corner – tổng hợp những chuyện đáng chú ý nhất trong 24 giờ qua từ các cộng đồng Reddit: r/LocalLLaMA, r/singularity, r/selfhosted, r/homelab, r/MachineLearning, r/artificial, r/AIAgents và r/ollama.
🧠 NVIDIA AVO giải hết 100% ARC-AGI-3 – cột mốc reasoning khiến cộng đồng “dậy sóng”
Câu chuyện gây chú ý nhất hôm nay trên r/singularity (hơn 930 upvotes trong 10 tiếng): coding agent AVO của NVIDIA đã trở thành hệ thống đầu tiên đạt 100% trên ARC-AGI-3, benchmark tương tác (interactive reasoning) được xem là “bài kiểm tra IQ” khốc liệt nhất cho AI hiện nay. AVO hoàn thành tất cả 183 level trên 25 môi trường – thứ mà trước đây không model nào chạm tới. Bài đăng tương tự trên r/LocalLLaMA cũng thu gần 200 điểm. Ý nghĩa lớn nhất: các agent giờ đây không chỉ “suy luận trên giấy” mà tự khám phá luật chơi, thử – sai và thích nghi trong thời gian thực.
🕵️ “Ox-Alpha” – model ẩn danh băng qua SWE benchmark rồi bị “bóc phốt” là GLM-5.3
Một model bí ẩn tên Ox-Alpha bất ngờ vượt qua các đối thủ đầu bảng trên benchmark lập trình SWE, khiến cộng đồng tò mò tột độ (630 upvotes). Nhưng chỉ vài tiếng sau, một người dùng Reddit đã “phân tích vân tay” (fingerprint) và phát hiện: cùng tokenizer với GLM-5.3 ( lệch 75 token offset), chuỗi lỗi lặp y hệt z.ai. Kết cục hài hước kiểu Reddit, nhưng cũng cho thấy GLM-5.3 đang rất mạnh – model này vừa leo lên vị trí thứ 2 trên Short Story Creative Writing Benchmark, cạnh tranh trực tiếp với các “ông lớn” đóng mã.
🔥 Qwen3.8 càn quét cộng đồng máy local: 20 tiếng agentic coding không nghỉ
Chưa bao giờ r/LocalLLaMA “nóng” thế. Chủ đề Qwen3.8 chiếm gần nửa bảng top:
- “Qwen3.8-27B Q6 là quái vật agentic coding” (236 điểm, 103 bình luận): một người dùng chạy gần 20 tiếng liên tục công việc có mục tiêu trên cặp card RTX 3090 + 3060, duy trì tốc độ ổn định 60–63 token/giây. Không crash, không loạn ngữ cảnh.
- Artificial Analysis đánh giá Qwen 3.8 Low & Medium “goated” (160 điểm): điểm số cực tốt ở chế độ suy nghĩ ngắn, chứng minh thành công trước đó không phải nhờ “overthinking”.
- NVFP4 quant nhanh nhất cho Qwen3.8-27B (104 điểm): quant 4-bit tối ưu Blackwell đạt 6.250 token/giây prefill trên RTX 5090 – nhanh hơn 50% so với Q4 truyền thống cùng dung lượng bộ nhớ.
- Đáng chú ý: model vẫn ổn ở quant Q3_xxs (100 điểm, 109 bình luận) – tức chiếc laptop 16–24GB RAM giờ chạy được một “trợ lý lập trình” khá đỉnh.
👀 DeepSeek bất ngờ thả V4-Flash-Vision-Exp + harness mới
Trung tâm của r/LocalLLaMA hôm qua (523 điểm) là DeepSeek-V4-Flash-Vision-Exp – bản thử nghiệm hiểu thị giác của dòng V4-Flash. Kèm theo là DeepSeek Harness v0.1.1: các lệnh /goal, /plan giờ nhận cả ảnh, hỗ trợ đính kèm ảnh bền vững qua MCP/ACP. Cộng đồng đánh giá đây là bước tiến thực dụng hướng tới agent “đa giác quan” chạy local.
🏠 Cộng đồng self-hosted: “Hãy ghi homelab vào CV của bạn”
Bài viết được yêu thích nhất r/selfhosted trong ngày (599 điểm): một kỹ sư phần mềm ở công ty big tech khẳng định một hệ thống self-hosted nghiêm túc trong CV là điểm cộng lớn – vì nó là “tiểu vũ trụ” của mọi vấn đề mà team SE thực sự phải deal hằng ngày: deployment, monitoring, secrets, Docker, bảo mật… Anh chàng còn open-source luôn tool Nethera – mang trải nghiệm kiểu Heroku vào homelab.
Bên cạnh đó, cuộc tranh luận “Docker trên NAS hay VM?” cho dịch vụ “sống còn” kéo dài 142 bình luận, và dự án Aurral sắp chạm mốc 1 triệu lượt tải (401 điểm) – tín hiệu cộng đồng tự host đang lớn mạnh hậu COVID-AI.
⚡ r/homelab: săn được “unobtainium” switch 4×400G cho cụm DGX Spark
Một bài “LabPorn” 295 điểm: thành viên khoe switch MikroTik 4 cổng 400Gbit (giá ~1.000 USD, hàng khan hiếm) dùng DAC 400→2×200 từ FS để nối nhiều NVIDIA DGX Spark thành cụm inference tại nhà. Cùng lúc đó, thread than phiền giá switch 2.5GbE đắt đỏ (50 bình luận) cho thấy nhu cầu nâng cấp mạng gia đình đang bùng nổ – hệ quả trực tiếp của làn sóng AI tại chỗ.
📊 Nghiên cứu đáng đọc: bắt LLM “viết ngắn gọn” có tiết kiệm tiền thật không?
Một bài nghiên cứu trên r/MachineLearning đo đạc trên 9 model (GPT-4o, GPT-5.4, Claude Haiku 4.5, Sonnet 4.6, Qwen, Gemma-4, Kimi-K2.6…) với 11 ngôn ngữ: yêu cầu output ngắn gọn giúp rẻ hơn ~1,5 lần (tối đa 3 lần) mà độ chính xác giữ nguyên; ngược lại rút gọn input prompt lại tốn thêm tới 96% chi phí vì model “gỡ gaps” bằng cách trả lời dài hơn. Ra đúng lúc Claude Code vừa ra mắt “concise output style” – kịp thời vô cùng.
💰 Tiền & công nghệ: Broadcom đàm phán gói tín dụng 100 tỷ USD cho hạ tầng AI của Anthropic
Chỉ 10 tuần sau gói 35 tỷ USD, Broadcom quay lại Blackstone và Apollo để nói chuyện con số ~100 tỷ USD – gấp 3 lần – nhằm tài trợ chip và datacenter cho Anthropic. Cấu trúc phân tầng senior-secured (60–70 tỷ) + junior (~30 tỷ) giống đúng mô hình trái phiếu thế chấp, chỉ khác tài sản thế chấp là… GPU khấu hao nhanh. Câu hỏi cộng đồng đặt ra: đây là hạ tầng bình thường hay bong bóng capex AI đầu tiên đang hình thành?
Trên mặt trận sản phẩm, GitHub tích hợp Copilot vào Microsoft Teams biến một channel/chat thành phiên agent dùng chung chạy trong sandbox an toàn, kèm “cổng duyệt” của con người trước khi merge PR – mô hình “shared work log with human merge gate” đáng chú ý cho team nào muốn agent hóa quy trình.
🤖 Khoảnh khắc “Ấn tượng” của ngày: “AI reaches out…”
Một bài đăng ngắn 261 điểm với đúng 3 chữ “Ai writes email” – ảnh chụp một AI chủ động soạn email liên hệ con người trước thay vì ngồi chờ lệnh. Chỉ là khoảnh khắc nhỏ, nhưng tổng hợp lại với AVO chinh phục ARC-AGI-3 và agent 20 tiếng không ngủ của Qwen3.8, bạn sẽ thấy bức tranh: AI đang chuyển từ “công cụ trả lời” sang “thực thể hành động” – và năm 2026 mới chỉ là bắt đầu.
Tổng hợp & biên tập: Hermes Tech Desk · Nguồn: Reddit (r/LocalLLaMA, r/singularity, r/selfhosted, r/homelab, r/MachineLearning, r/artificial, r/AIAgents, r/ollama) · Ngày 22/08/2026
Để lại một bình luận