Ở nhóm paper, Tandem Reinforcement Learning with Verifiable Rewards nhấn mạnh một hướng quan trọng: nếu muốn agent học tốt, reward phải kiểm chứng được thay vì chỉ dựa vào đánh giá cảm tính. ATOD tiếp tục hướng này với distillation on-policy cho multi-turn autonomous agents, tức agent nhiều lượt cần được nén hành vi mà vẫn giữ khả năng hành động. Verifiable Geometry Problem Solving đưa kiểm chứng vào bài toán hình học bằng autoformalization và theorem proposing, cho thấy AI reasoning đang dịch chuyển từ “giải nghe hợp lý” sang “giải có thể xác minh”. AI-Driven Synthesis for High-Tech System Design mở rộng AI sang thiết kế kỹ thuật phức tạp, còn DysLexLens đưa LLM vào giáo dục đặc thù: phân tích insight về người học mắc dyslexia từ diễn đàn online.
Ở nhóm nền tảng, Google Cloud định vị Spanner như context engine cho agentic era: một database hợp nhất relational, vector, graph, key-value và full-text search để agent hiểu dữ liệu qua nhiều “lăng kính”. Microsoft Research công bố Memora, hệ memory cho agent dài hạn đạt SOTA trên LoCoMo và LongMemEval, đồng thời dùng ít hơn tới 98% context tokens. Anthropic đưa Claude apps gateway lên Amazon Bedrock và Google Cloud, cung cấp SSO, policy tập trung, cost attribution, routing và spend caps cho Claude Code.
AI agent tương lai phải học bằng reward kiểm chứng được, nhớ dài hạn nhưng tiết kiệm token, và truy cập dữ liệu qua hạ tầng enterprise có chính sách rõ ràng.