Tuần này, cuộc đua AI dịch chuyển rõ rệt từ việc chỉ tăng năng lực mô hình sang tối ưu toàn bộ hệ thống: suy luận siêu nhanh, điều phối nhiều agent, bảo mật zero-trust, lượng tử hóa 4-bit và đánh giá cách agent thực sự nghiên cứu.
Tin tức mô hình và nền tảng AI
- 13/8 — OpenAI thử nghiệm GPT‑5.6 Sol Ultrafast: Chế độ mới chạy GPT‑5.6 Sol nhanh tối đa 14 lần, đạt tới 750 token đầu ra mỗi giây trên hạ tầng Cerebras.
- 13/8 — Hướng dẫn xây dựng ứng dụng với GPT‑5.6: OpenAI cho thấy retained reasoning và context compaction có thể nâng ARC‑AGI‑3 từ 13,3% lên 38,3% trong khi dùng ít hơn khoảng sáu lần token đầu ra.
- 12/8 — Doanh nghiệp đang đưa AI vào công việc như thế nào: Dữ liệu OpenAI cho thấy nhóm doanh nghiệp tiên phong tạo lượng token trên mỗi người dùng cao hơn 8,3 lần, với Codex chiếm 64% tổng mức dùng Codex và ChatGPT trong doanh nghiệp.
- 17/8 — The Defender’s Window: OpenAI đề xuất chuyển phòng thủ an ninh sang các agent hoạt động liên tục nhưng bị giới hạn bởi least privilege, defense-in-depth và quyền thực thi có kiểm soát.
- 13/8 — Google giới thiệu Gemini 3.7 Flash: Mô hình Flash mới tập trung vào coding và agent, đạt 43,6 trên FrontierCode và 65,3 trên DeepSWE với mức giá giới thiệu 0,75 USD cho input và 3,75 USD cho output mỗi triệu token.
- 12/8 — Google Research: Recall mới là nút thắt của tri thức tham số: Benchmark WikiProfile gồm 2.150 sự kiện cho thấy các LLM tiên tiến thường đã mã hóa thông tin cần thiết nhưng không truy xuất được đúng lúc.
- 13/8 — Anthropic nghiên cứu các hệ thống multi-agent đang nổi: Thí nghiệm với các swarm tới 45 agent cho thấy cộng tác có thể tăng mạnh số lỗ hổng được tìm thấy nhưng đồng thời tạo xung đột hợp nhất, cô lập thông tin, xu hướng thuận theo số đông và lỗi hệ thống.
- 14/8 — Anthropic bổ sung watermark cho văn bản Claude: Các phiên bản Claude tương lai sẽ dùng watermark xác suất tương tự SynthID‑Text mà không chèn ký tự ẩn, token phụ hay thông tin nhận dạng người dùng.
- 17/8 — Năm khả năng Claude mới trên Microsoft Foundry: Claude trên Azure hiện hỗ trợ structured outputs, web search, web fetch, MCP connector và tool search trong khi prompt và completion vẫn nằm trong môi trường Azure.
- 14/8 — Toàn cảnh mô hình mở mùa hè 2026: Hugging Face ghi nhận số repository mô hình công khai tăng từ 2,43 lên 2,96 triệu, Qwen đạt hơn 151.000 biến thể và các mô hình dưới 1B tham số chiếm 83% lượt tải.
- 12/8 — Meta xây dựng Scam Alert cho WhatsApp: Hệ thống phân loại lừa đảo chạy tùy chọn ngay trên thiết bị để duy trì mã hóa đầu cuối, không tự động báo cáo hội thoại và dùng differential privacy cho phân tích.
Paper AI, LLM và Computer Vision đáng chú ý
- 12/8 — Spark‑to‑Paper: Bộ 13 kỹ năng ghép nối trong coding assistant tự động hóa quy trình từ ý tưởng đến bản thảo, đạt 99,5% trích dẫn hợp lệ và nâng khả năng phát hiện nội dung bịa đặt từ 14% lên 92%.
- 14/8 — RA‑Bench: Phát hiện deepfake video trong khủng hoảng: Benchmark 17.886 video cho thấy cả 19 nhóm detector truyền thống và đa phương thức đều khó tổng quát hóa khi video bị nén, chỉnh sửa hoặc lan truyền qua mạng xã hội.
- 14/8 — S²VOPD: Phương pháp dùng ảnh sạch làm self-teacher và ảnh tăng cường mạnh làm đầu vào student giúp cải thiện trung bình 6,76 điểm ở các tác vụ nhận thức thị giác chi tiết mà không cần nhãn hay teacher lớn hơn.
- 14/8 — Intern‑S2‑Mobius: Kiến trúc tách bộ nhớ FFN dùng chung khỏi các khối tự chú ý lặp giúp mô hình 7B đạt mức baseline với 62,6% dữ liệu huấn luyện và tăng tốc suy luận Qwen3.5‑35B gần bốn lần.
- 13/8 — Beyond Final Scores: Đánh giá bảy mô hình trên 36 nhiệm vụ R&D dài hạn cho thấy agent hiện giống bộ tối ưu kỹ thuật hơn nhà nghiên cứu tự trị vì chủ yếu kết hợp kỹ thuật có sẵn và hiếm khi tạo ra phương pháp thực sự mới.
- 14/8 — Agentic Transaction: Paper diễn giải lại ACID thành Semantic Atomicity, Consistency, Isolation và Durability để thiết kế giao dịch đáng tin cậy cho hệ thống agent có hành vi bất định.
- 12/8 — Microsoft MindTopo: Benchmark kiểm tra năm thuộc tính topology cho thấy vision-language model làm khá tốt nhận thức tĩnh nhưng suy giảm rõ rệt khi phải lập kế hoạch tương tác trong không gian.
- 17/8 — Google PhotoScan: Ước lượng nguy cơ chuyển hóa từ ảnh điện thoại: Mô hình suy ra thành phần cơ thể và nguy cơ kháng insulin từ ảnh smartphone, đạt kết quả gần phép đo DXA trong môi trường nghiên cứu lâm sàng.
- 12/8 — Liquid AI phát hành LFM2.5‑VL‑3B: VLM 3B chạy trên thiết bị hỗ trợ đọc tài liệu, giao diện và visual grounding với dung lượng khoảng 3 GB, đạt 20 token/giây trên Galaxy S26 Ultra.
Thủ thuật coding, agent engineering và hạ tầng
- 17/8 — Xây dựng AI agent zero-trust với Google ADK: Mẫu mã nguồn mở kết hợp chữ ký phần cứng cho thao tác ghi, sandbox gVisor và semantic gateway xác định để tránh xem prompt như một ranh giới bảo mật.
- 13/8 — Google phát hành Credentio: Thư viện C++ mã nguồn mở xác minh C2PA 2.2/2.4 cục bộ với bộ nhớ thấp và hỗ trợ tệp đa phương tiện dung lượng nhiều gigabyte.
- 12/8 — Instructions Hygiene cho coding agent: Microsoft khuyên giữ file hướng dẫn repository thật ngắn, chỉ chứa lệnh chuẩn, lựa chọn cục bộ, ràng buộc bắt buộc và những sự thật mà agent không thể tự suy ra từ code.
- 13/8 — Routing và failover cho Microsoft.Extensions.AI: Các primitive thử nghiệm mới hỗ trợ định tuyến theo nội dung, chuyển nhà cung cấp khi lỗi và áp dụng chính sách chọn mô hình tùy chỉnh.
- 17/8 — GitHub Canvases cho quy trình agent: Canvas lưu giữ kế hoạch, trạng thái, kiểm chứng và phê duyệt ngoài luồng chat để quy trình agent dễ điều khiển, audit và review hơn.
- 14/8 — Đưa agent của các công cụ SDLC vào GitHub: Agent từ Amplitude, Endor Labs, LaunchDarkly và PagerDuty có thể mang ngữ cảnh sản phẩm, bảo mật, phát hành và sự cố trực tiếp vào quy trình phát triển GitHub.
- 18/8 — NVIDIA lượng tử hóa Nemotron 3.5 Lightning bằng QAD và NVFP4: Quantization-aware distillation giảm checkpoint từ 66 GB xuống 22 GB và tăng thông lượng tối đa bốn lần trong khi giữ độ chính xác tốt hơn post-training quantization.
- 13/8 — Bài học từ việc tái lập 2.200 paper ICML: Hơn 1.200 người cùng coding agent tạo 6.816 logbook cho 2.226 paper trong 19 ngày, chứng minh agent có thể mở rộng kiểm tra reproducibility nhưng vẫn cần xác minh của con người.
Programming Education và học tập thích ứng
- 13/8 — LittleLearner: Nhóm nghiên cứu huấn luyện mô hình 5B từ đầu trên curriculum 88 tỷ token chỉ chứa kiến thức tới lớp 5 để tạo môi trường kiểm soát cho nghiên cứu cách mô hình tiếp thu kiến thức mới.
- 12/8 — Nhu cầu của sinh viên đối với adaptive learning dùng AI: Khảo sát 134 sinh viên ICT cho thấy họ ưu tiên nội dung thích ứng, bài tập tự sinh, theo dõi tiến độ và truy cập di động nhưng vẫn muốn giáo viên kiểm soát độ chính xác và quyền riêng tư.
Nhận định cuối tuần
Ba tín hiệu lớn nhất là tốc độ suy luận đang trở thành lợi thế cạnh tranh ngang với chất lượng mô hình, hệ thống agent bắt đầu được thiết kế như hạ tầng phân tán có giao dịch và ranh giới bảo mật thực sự, còn cộng đồng nghiên cứu đang chuyển từ hỏi “agent đạt bao nhiêu điểm” sang kiểm tra agent đã lập kế hoạch, thử nghiệm, thất bại và tái sử dụng kinh nghiệm như thế nào.