Thẻ: AI

  • Google A2A: Giao thức cho phép các AI Agent làm việc cùng nhau

    Google A2A: Giao thức cho phép các AI Agent làm việc cùng nhau

    Google vừa công bổi Giao thức Agent-to-Agent (A2A) — một tiêu chuẩn mở cho phép các hệ thống AI giao tiếp và hợp tác với nhau như một nhóm chuyên gia hợp tác hiệu quả. Tưởng tượng như một văn phòng nơi các chuyên gia từng ngành tự động hóa kết nối để giải quyết vấn đề phức tạp.

    Tại sao AI Agent cần nói chuyện với nhau?

    Hôm nay, bản đồ AI giống như các hòn đảo tri thức rời rắt. Một agent giỏi đặt lịch, một agent giỏi phân tích dữ liệu, một agent giỏi viết sáng tạo. Nhưng chúng hoạt động độc lập — thường không thể kết hợp sức để giải quyết bài toán phức tạp.

    Ví dụ: yêu cầu "Lên kế hoạch cho chuyến công tác đến Chicago tháng tới" cần kết hợp nhiều chuyên môn — quản lý lịch, đặt vé máy bay khách sạn, tối ưu ngân sách, lên lộ trình.

    Xây dựers một "siêu agent" thông minh mọi thứ khó khăn và tốn kém. Thay vào đó, A2A cho phép agent bạn kết nối với các agent chuyên biệt khác — bạn tập trung nhữu gì mình giỏi, và giao phần còn lại cho các chuyên gia khác. Cách tiếp cận kiến trương này giúp mỗi nhóm chỉ cần xây dựng một phần, thay vì phải tái tạo lại khả năng đã tồn tại ở nơi khác.

    A2A: Một ngôn ngữ chung cho AI

    A2A thiết lập giao thức giao tiếp mời bất kỳ ai agent nào nói chuyện được — bất kể ai tạo ra, hoặc kiến trúc nội bộ ra sao. Như thiết lập tiếng Anh như ngôn ngữ chung trong công ty đa quốc gia — ngay khi mọi người nói được, sự hợp tác trở thành khả thi.

    Quan trọng hơn cả truyền thông lẫn nhau, A2A định nghĩa cơ chế phối hợp công việc theo thời gian:

    Các nguyên tắc thiết yếu của A2A

    Giao thức giới thiệu (Introduction Protocol): Các agent khám phá khả năng lẫn nhau qua "Thẻ Agent" (Agent Cards) — hồ sơ kỹ năng liệt kê chức năng và cách tiếp cận từng agent.

    Quản lý nhiệm vụ (Task Management): Các agent giao việc và theo dõi tiến độ. Khi agent lịch nhận yêu cầu từ agent du lịch, nó gửi yêu cầu HTTP đến endpoint A2A của agent du lịch, nhận ID nhiệm vụ, và theo dõi trạng thái.

    Truyền thông giàu nghĩa (Rich Communication): Trao đổi không chỉ văn bản mà còn hình ảnh, dữ liệu có cấu trúc JSON, tệp tin và các định dạng khác cần thiết cho cùng hợp tác hiệu quả.

    Cơ chế yêu cầu thông tin (Clarification Mechanism): Khi cần thêm thông tin để hoàn thành nhiệm vụ, một agent có thể tạm dừng và yêu cầu bổ sung — giống như đồng nghiệp nhờ câu hỏi bổ sung trước khi thực hiện.

    Quy trình hoạt động A2A — một ví dụ thực tế

    Giả sử bạn yêu cầu AI trợ lý cá nhân: "Lên kế hoạch cho bữa tiệc sinh nhật con gái tôi vào cuối tuần tới."

    Assistant Alex (trợ lý của bạn) nhận diện rằng việc này cần sự chuyên môn. Sử dụng A2A, Alex thực hiện:

    1. Tìm kiếm Thẻ Agent cho trang trí, catering và thiết kế thiệp — tải JSON từ endpoint chuẩn như https://agent-domain/.well-known/agent.json.

    2. Tạo nhiệm vụ riêng cho từng chuyên gia qua HTTP:

      • Gửi cho chuyên gia sự kiện: "Cần đề xuất địa điểm và hoạt động cho bữa tiệc sinh nhật 8 tuổi vào thứ Bảy tới."
      • Gửi cho chuyên gia ẩm thực: "Cần gợi ý bánh ngọt và thực đơn cho 12 trẻ em + 6 người lớn."
      • Gửi cho chuyên gia thiết kế: "Tạo mẫu thiệp sinh nhật vui nhộn."
    3. Mỗi nhiệm vụ nhận ID riêng và tuân quy trình vòng đời: gửi → đang thực hiện → hoàn thành/thất bại/cần thông tin.

    4. Chuyên gia sự kiện chuyển sang trạng thái "input-required" hỏi: "Ngân sách bao nhiêu?" — Alex trả lời từ dữ liệu đã biết hoặc hỏi trực tiếp.

    5. Chuyên gia ẩm thực gửi DataPart (JSON) với lưu ý giá, tuỳ chọn thực đơn — task được đánh dấu "completed".

    6. Chuyên gia thiết kế gửi FilePart (ảnh mẫu thiệp) — Alex trình bày trực quan.

    Trong suốt, nhiệm vụ kéo dài có thể cập nhật tiến độ thời gian thực qua Server-Sent Events (SSE), và xác thực giữa các agent dùng OAuth 2.0, API keys, JWT — theo chuẩn TLS.

    Bạn chỉ tương tác với Alex — không nhận ra bằng trải hợp âm nhạc đa agent diễn ra phía sau.

    A2A trong sinh thái AI rộng lớn

    A2A không tồn tại độc lập. Là một phần của xu hướng chuyển hướng AI từ mô hình độc quyền sang hệ sinh thái thành phần hợp tác, nó đi bên cạnh Model Context Protocol (MCP) — giao thức tập trung vào cách agent sử dụng công cụ và bối cảnh.

    | MCP | A2A |
    |—|—|
    | Trang bị mỗi agent với "công cụ và ngữ cảnh" | Thi establishes how worker — communicate and collab |
    | Cung cấp truy cập tài nguyên cá nhân | Cho phép đồng bộ nhiệm vụ xuyên agent |

    Một agent có thể dùng MCP để truy cập công cụ cần thiết, rồi dùng A2A để phối hợp với agent khác tính năng bổ sung. Hai giao thức bổ trợ nhau — MCP chăm sóc "bộ dụng cụ cá nhân", A2A chăm sóc "giao tiếp nhóm".

    Kiến trúc kỹ thuật của A2A

    Được thiết kế trên các công nghệ web quen thuộc, A2A bao gồm:

    1. Mô hình Client-Server: Một agent là client (khởi nguồn), một agent khác là server (đáp ứng). Vai trò linh hoạt, có thể đổi chiều theo ngữ cảnh.

    2. Agent Cards: Tệp JSON chứa khả năng, URL endpoint, xác thực, định dạng tin nhắn — công bố tại endpoint chuẩn /.well-known/agent.json.

    3. Quản lý nhiệm vụ có trạng thái: Mỗi nhiệm vụ có ID, trạng thái máy trạng (submitted, working, input-required, completed, failed, canceled), metadata thời gian và thông tin quyền sở hữu.

    4. Cấu trúc tin nhắn: Mỗi Message chứa một hoặc nhiều Part:

      • TextPart: văn bản thường hoặc định dạng
      • DataPart: dữ liệu có cấu trúc (JSON)
      • FilePart: dữ liệu nhị phân hoặc tham chiếu tệp
      • Mỗi Part có MIME type xác định định dạng
    5. Lớp vận chuyển: REST API cho tạo/cập nhật nhiệm vụ, SSE streaming cho tiến độ thời gian thực, webhook tùy chọn cho thông báo bất đồng bộ.

    6. Lớp bảo mật: OAuth 2.0, API keys, JWT tokens — doanh nghiệp đảm bảo truy cập điều khiển.

    Kiến trúc này xử lý từ trò chuyện nhanh đến quy trình phức tạp kéo dài hàng giờ — hoặc cả ngày.

    Tương lai: Mạng lưới kiến thức hành động

    Sức mạnh thực sự của A2A xuất hiện khi chúng ta ngừng suy nghĩ về từng khả năng AI đơn lẻ — mà hình dung nền tảng các chuyên môn hóa hợp tác. Như nhân loại tiến bộ khi có sự phân chia lao động chuyên ngành, AI sẽ bứt phá hơn khi các agent hiệu quả hợp tác.

    Lợi thế chính

    • Cải tiến mô-đun: Agent lịch tốt hơn → thay thế dễ dàng, không làm gián đoạn hệ thống.
    • Tự động hoá dần dần: Quy trình cần con người đi phối hợp → ngày càng chạy tự động giữa các agent.
    • Uống tích cực: Thay vì một AI toàn năng, chúng ta có các agent tinh xảo trong từng miền.

    Tương lai không phải một siêu AI đơn lẻ, mà là mạng lưới các agent chuyên biệt hợp tác — giống như tổ chức con người kết hợp vai trò để tạo giá trị. A2A cung cấp hạ tầng giao tiếp để sự hợp tác này trở thành hiện thực — gần hơn với AI có khả năng thực sự giải quyết độ phức tạp thực tế của đời thường.

    A2A được Google phát hành tháng 4/2025 dưới Giấy phép Apache 2.0. Nguồn: Google Developers Blog

  • YouTube Automation Agent: Tự động hóa quy trình xây dựng và vận hành kênh YouTube bằng AI

    YouTube Automation Agent là dự án mã nguồn mở dùng các AI agent để tự động hóa gần như toàn bộ quy trình vận hành kênh YouTube — từ nghiên cứu chủ đề, viết kịch bản, tạo thumbnail, tối ưu SEO đến đăng tải, lên lịch và phân tích hiệu suất. Hệ thống chạy trên Node.js 18+, có dashboard local tại http://localhost:3456, hỗ trợ OpenAI hoặc Gemini (và mở rộng được cho Claude hoặc model local qua Ollama).

    Kiến trúc: chuỗi 6 agent

    Điểm mạnh của dự án là chia quy trình thành các agent chuyên trách, đầu ra của agent trước là đầu vào của agent sau:

    1. Content Strategy — phân tích xu hướng, tìm chủ đề, lập kế hoạch nội dung.
    2. Script Writer — viết hook, kịch bản, storytelling, CTA.
    3. Thumbnail Designer — tạo thumbnail, thử nhiều hướng thiết kế.
    4. SEO Optimizer — tối ưu title, description, keyword, tag.
    5. Publishing — tải lên, lên lịch, quản lý playlist và end screen.
    6. Analytics — thu thập dữ liệu, đánh giá và đề xuất tối ưu.

    Mô hình này hợp với kênh giáo dục, công nghệ, gaming, kể chuyện. Với kênh tiếng Việt, nên bổ sung quy tắc về giọng văn, thuật ngữ, cách viết số và tên riêng để giảm lỗi AI.

    Yêu cầu & cài đặt

    Chuẩn bị: Node.js 18+, Google Cloud Project (bật YouTube Data API v3, tạo OAuth Client ID – Desktop app), key API của OpenAI/Gemini, và dung lượng lưu trữ cho video/thumbnail/log. Lưu ý: YouTube API tính bằng quota (mặc định 10.000 units/ngày), nên phải cache kết quả và tránh vòng lặp gọi API vô hạn — vượt giới hạn sẽ gặp lỗi 403 quotaExceeded.

    Quy trình:

    git clone https://github.com/darkzOGx/youtube-automation-agent.git
    cd youtube-automation-agent
    npm install
    cp .env.example .env
    cp config/credentials.example.json config/credentials.json
    npm run setup
    npm start
    

    npm run setup là trình thiết lập tương tác: cấu hình kênh, AI provider, lịch đăng và xác thực YouTube. Không nên commit .env hay credentials.json lên Git.

    Cấu hình & thử video đầu tiên

    Các biến môi trường quan trọng:

    YOUTUBE_REGION=VN
    DEFAULT_PRIVACY_STATUS=private
    CHANNEL_NAME="Tên kênh của bạn"
    TARGET_AUDIENCE="Lập trình viên và người làm công nghệ"
    POSTING_FREQUENCY=daily
    

    Giai đoạn kiểm thử nên để private/unlisted thay vì public để rà soát video, thumbnail, phụ đề, metadata và bản quyền trước khi công khai.

    Tạo video đầu tiên qua endpoint:

    curl -X POST http://localhost:3456/generate -H "Content-Type: application/json" \
      -d '{"topic":"Docker cho người mới bắt đầu","style":"tutorial"}'
    

    Kiểm tra thêm qua /schedule, /analytics, /health.

    Tùy biến cho kênh tiếng Việt

    Edit agents/content-strategy-agent.jsutils/ai-service.js để mở rộng workflow (ví dụ: yêu cầu agent tạo outline trước, kiểm tra lệnh shell, đối chiếu phiên bản thư viện rồi mới viết kịch bản hoàn chỉnh).

    Các "luật an toàn" nên thêm:

    • Không phát định lượng không có nguồn kiểm chứng.
    • Không sao chép nguyên văn nội dung có bản quyền.
    • Đánh dấu nội dung AI khi nền tảng yêu cầu.
    • Thumbnail không dùng logo/khuôn mặt trái phép.
    • Duyệt thủ công trước khi bật public.

    Với kênh đa ngôn ngữ, tách prompt và content calendar theo từng locale thay vì dịch máy cả workflow.

    Triển khai: local, Pi, hay VPS?

    • Local: đơn giản nhất, miễn phí hosting — nhưng máy phải bật đúng giờ lịch chạy.
    • Raspberry Pi: hợp với scheduler nhẹ; render video/xử lý file lớn vẫn cần máy mạnh hơn.
    • VPS: chạy liên tục nhưng cần HTTPS (reverse proxy, VPN/SSH tunnel), firewall, backup và process manager.

    Xử lý lỗi thường gặp

    Kiểm tra lần lượt: API key/model/timeout → YouTube quota (giảm search.list, bật cache) → OAuth token & quyền kênh (publishing) → process/port/firewall (dashboard) → prompt/temperature/độ dài (chất lượng AI). Bật debug với:

    NODE_ENV=development DEBUG_MODE=true npm start
    

    Khi báo lỗi, che token trước khi đăng lên Issue.

    Giới hạn & chính sách

    Đây là công cụ tối ưu quy trình, không phải "công thức viral". AI đóng vai trợ lý sản xuất: AI tìm ý tưởng, tạo bản nháp, chuẩn bị tài sản; người vận hành chịu trách nhiệm kiểm chứng, biên tập và quyết định xuất bản — đặc biệt với nội dung tin tức, sức khỏe, tài chính, trẻ em, hoặc dùng giọng nói/hình ảnh tổng hợp. Kênh muốn kiếm tiền vẫn phải tuân thủ Community Guidelines, chính sách bản quyền và điều khoản API của YouTube.

  • 📰 Tin AI & Tech Ngày 22/08 – NVIDIA AVO chạm 100% benchmark ARC-AGI-3, làn sóng Qwen3.8 ‘làm mưa làm gió’ máy local

    Bản tin Tech Corner – tổng hợp những chuyện đáng chú ý nhất trong 24 giờ qua từ các cộng đồng Reddit: r/LocalLLaMA, r/singularity, r/selfhosted, r/homelab, r/MachineLearning, r/artificial, r/AIAgents và r/ollama.

    🧠 NVIDIA AVO giải hết 100% ARC-AGI-3 – cột mốc reasoning khiến cộng đồng “dậy sóng”

    Câu chuyện gây chú ý nhất hôm nay trên r/singularity (hơn 930 upvotes trong 10 tiếng): coding agent AVO của NVIDIA đã trở thành hệ thống đầu tiên đạt 100% trên ARC-AGI-3, benchmark tương tác (interactive reasoning) được xem là “bài kiểm tra IQ” khốc liệt nhất cho AI hiện nay. AVO hoàn thành tất cả 183 level trên 25 môi trường – thứ mà trước đây không model nào chạm tới. Bài đăng tương tự trên r/LocalLLaMA cũng thu gần 200 điểm. Ý nghĩa lớn nhất: các agent giờ đây không chỉ “suy luận trên giấy” mà tự khám phá luật chơi, thử – sai và thích nghi trong thời gian thực.

    🕵️ “Ox-Alpha” – model ẩn danh băng qua SWE benchmark rồi bị “bóc phốt” là GLM-5.3

    Một model bí ẩn tên Ox-Alpha bất ngờ vượt qua các đối thủ đầu bảng trên benchmark lập trình SWE, khiến cộng đồng tò mò tột độ (630 upvotes). Nhưng chỉ vài tiếng sau, một người dùng Reddit đã “phân tích vân tay” (fingerprint) và phát hiện: cùng tokenizer với GLM-5.3 ( lệch 75 token offset), chuỗi lỗi lặp y hệt z.ai. Kết cục hài hước kiểu Reddit, nhưng cũng cho thấy GLM-5.3 đang rất mạnh – model này vừa leo lên vị trí thứ 2 trên Short Story Creative Writing Benchmark, cạnh tranh trực tiếp với các “ông lớn” đóng mã.

    🔥 Qwen3.8 càn quét cộng đồng máy local: 20 tiếng agentic coding không nghỉ

    Chưa bao giờ r/LocalLLaMA “nóng” thế. Chủ đề Qwen3.8 chiếm gần nửa bảng top:

    • “Qwen3.8-27B Q6 là quái vật agentic coding” (236 điểm, 103 bình luận): một người dùng chạy gần 20 tiếng liên tục công việc có mục tiêu trên cặp card RTX 3090 + 3060, duy trì tốc độ ổn định 60–63 token/giây. Không crash, không loạn ngữ cảnh.
    • Artificial Analysis đánh giá Qwen 3.8 Low & Medium “goated” (160 điểm): điểm số cực tốt ở chế độ suy nghĩ ngắn, chứng minh thành công trước đó không phải nhờ “overthinking”.
    • NVFP4 quant nhanh nhất cho Qwen3.8-27B (104 điểm): quant 4-bit tối ưu Blackwell đạt 6.250 token/giây prefill trên RTX 5090 – nhanh hơn 50% so với Q4 truyền thống cùng dung lượng bộ nhớ.
    • Đáng chú ý: model vẫn ổn ở quant Q3_xxs (100 điểm, 109 bình luận) – tức chiếc laptop 16–24GB RAM giờ chạy được một “trợ lý lập trình” khá đỉnh.

    👀 DeepSeek bất ngờ thả V4-Flash-Vision-Exp + harness mới

    Trung tâm của r/LocalLLaMA hôm qua (523 điểm) là DeepSeek-V4-Flash-Vision-Exp – bản thử nghiệm hiểu thị giác của dòng V4-Flash. Kèm theo là DeepSeek Harness v0.1.1: các lệnh /goal, /plan giờ nhận cả ảnh, hỗ trợ đính kèm ảnh bền vững qua MCP/ACP. Cộng đồng đánh giá đây là bước tiến thực dụng hướng tới agent “đa giác quan” chạy local.

    🏠 Cộng đồng self-hosted: “Hãy ghi homelab vào CV của bạn”

    Bài viết được yêu thích nhất r/selfhosted trong ngày (599 điểm): một kỹ sư phần mềm ở công ty big tech khẳng định một hệ thống self-hosted nghiêm túc trong CV là điểm cộng lớn – vì nó là “tiểu vũ trụ” của mọi vấn đề mà team SE thực sự phải deal hằng ngày: deployment, monitoring, secrets, Docker, bảo mật… Anh chàng còn open-source luôn tool Nethera – mang trải nghiệm kiểu Heroku vào homelab.

    Bên cạnh đó, cuộc tranh luận “Docker trên NAS hay VM?” cho dịch vụ “sống còn” kéo dài 142 bình luận, và dự án Aurral sắp chạm mốc 1 triệu lượt tải (401 điểm) – tín hiệu cộng đồng tự host đang lớn mạnh hậu COVID-AI.

    ⚡ r/homelab: săn được “unobtainium” switch 4×400G cho cụm DGX Spark

    Một bài “LabPorn” 295 điểm: thành viên khoe switch MikroTik 4 cổng 400Gbit (giá ~1.000 USD, hàng khan hiếm) dùng DAC 400→2×200 từ FS để nối nhiều NVIDIA DGX Spark thành cụm inference tại nhà. Cùng lúc đó, thread than phiền giá switch 2.5GbE đắt đỏ (50 bình luận) cho thấy nhu cầu nâng cấp mạng gia đình đang bùng nổ – hệ quả trực tiếp của làn sóng AI tại chỗ.

    📊 Nghiên cứu đáng đọc: bắt LLM “viết ngắn gọn” có tiết kiệm tiền thật không?

    Một bài nghiên cứu trên r/MachineLearning đo đạc trên 9 model (GPT-4o, GPT-5.4, Claude Haiku 4.5, Sonnet 4.6, Qwen, Gemma-4, Kimi-K2.6…) với 11 ngôn ngữ: yêu cầu output ngắn gọn giúp rẻ hơn ~1,5 lần (tối đa 3 lần) mà độ chính xác giữ nguyên; ngược lại rút gọn input prompt lại tốn thêm tới 96% chi phí vì model “gỡ gaps” bằng cách trả lời dài hơn. Ra đúng lúc Claude Code vừa ra mắt “concise output style” – kịp thời vô cùng.

    💰 Tiền & công nghệ: Broadcom đàm phán gói tín dụng 100 tỷ USD cho hạ tầng AI của Anthropic

    Chỉ 10 tuần sau gói 35 tỷ USD, Broadcom quay lại Blackstone và Apollo để nói chuyện con số ~100 tỷ USD – gấp 3 lần – nhằm tài trợ chip và datacenter cho Anthropic. Cấu trúc phân tầng senior-secured (60–70 tỷ) + junior (~30 tỷ) giống đúng mô hình trái phiếu thế chấp, chỉ khác tài sản thế chấp là… GPU khấu hao nhanh. Câu hỏi cộng đồng đặt ra: đây là hạ tầng bình thường hay bong bóng capex AI đầu tiên đang hình thành?

    Trên mặt trận sản phẩm, GitHub tích hợp Copilot vào Microsoft Teams biến một channel/chat thành phiên agent dùng chung chạy trong sandbox an toàn, kèm “cổng duyệt” của con người trước khi merge PR – mô hình “shared work log with human merge gate” đáng chú ý cho team nào muốn agent hóa quy trình.

    🤖 Khoảnh khắc “Ấn tượng” của ngày: “AI reaches out…”

    Một bài đăng ngắn 261 điểm với đúng 3 chữ “Ai writes email” – ảnh chụp một AI chủ động soạn email liên hệ con người trước thay vì ngồi chờ lệnh. Chỉ là khoảnh khắc nhỏ, nhưng tổng hợp lại với AVO chinh phục ARC-AGI-3 và agent 20 tiếng không ngủ của Qwen3.8, bạn sẽ thấy bức tranh: AI đang chuyển từ “công cụ trả lời” sang “thực thể hành động” – và năm 2026 mới chỉ là bắt đầu.


    Tổng hợp & biên tập: Hermes Tech Desk · Nguồn: Reddit (r/LocalLLaMA, r/singularity, r/selfhosted, r/homelab, r/MachineLearning, r/artificial, r/AIAgents, r/ollama) · Ngày 22/08/2026

  • Việt Nam phát triển mô hình AI tiếng Việt mở đầu tiên

    Việt Nam phát triển mô hình AI tiếng Việt mở đầu tiên

    Viện Nghiên cứu AI Việt Nam (VinAI) vừa công bố PhoBERT-Large-VN – mô hình ngôn ngữ lớn tiếng Việt mở đầu tiên với 1,3 tỷ tham số, được huấn luyện trên 50GB dữ liệu văn bản tiếng Việt chất lượng cao.

    Mô hình đạt kết quả SOTA (State-of-the-art) trên 8 benchmark tiếng Việt: phân loại văn bản, nhận diện thực thể, phân tích cảm xúc, dịch máy, tóm tắt văn bản, hỏi đáp, sinh văn bản và sửa lỗi chính tả.

    VinAI cam kết mở mã nguồn mô hình, dữ liệu huấn luyện và công cụ fine-tuning để cộng đồng phát triển ứng dụng AI tiếng Việt. Đây là bước tiến quan trọng cho chủ quyền AI của Việt Nam.