Google

  • MCP Stateless loại bỏ ràng buộc phiên trạng thái, giúp máy chủ agent mở rộng ngang, chạy serverless và cân bằng tải dễ hơn.
  • Agent Plugins 1.0 chuẩn hóa cách đóng gói Skills và MCP để viết một lần, dùng trên nhiều nền tảng agent.
  • WeatherNext Cyclones nâng dự báo bão ba ngày lên độ chính xác của dự báo hai ngày trước đây và được mở trọng số.
  • Gemini Omni cho phép tạo hoặc chỉnh sửa video từ văn bản, ảnh, âm thanh và video bằng hội thoại tự nhiên.

Microsoft

  • Năm mẫu multi-agent cung cấp công thức triển khai tuần tự, đồng thời, bàn giao, trò chuyện nhóm và điều phối động.
  • Speech-to-text đa kênh giữ riêng từng người nói trong một luồng thời gian thực, giảm nhu cầu xử lý nhiều kết nối song song.
  • Agent Optimizer dùng dấu vết hoạt động và bộ đánh giá để tự động đề xuất cấu hình agent tốt hơn.
  • Capability host chỉ ra lớp kết nối bắt buộc để Foundry Agent truy cập an toàn các tài nguyên riêng tư.
  • Khi nào RL hữu ích cho thấy GRPO hiệu quả nhất khi SFT còn những lỗi suy luận có thể sửa bằng khám phá.
  • Hill-climbing trong Foundry đề xuất cải tiến mô hình từng bước qua distillation, SFT và RFT, đồng thời đo chất lượng, độ trễ, chi phí.

Anthropic và OpenAI

  • Claude và giả thuyết Riemann nâng cận dưới số nghiệm thỏa giả thuyết từ 41,6% lên 67,2%, kèm chứng minh Lean có thể kiểm tra.
  • Fable 5 Biology Safeguards giảm khoảng 85% trường hợp truy vấn sinh học vô hại bị chuyển xuống mô hình dự phòng.
  • Cập nhật GPT‑5.6 cải thiện Sol, bổ sung thanh điều chỉnh suy luận và đưa Luna thành lựa chọn mặc định rộng rãi hơn cho người dùng miễn phí.
  • Đánh giá Astra cho thấy chưa thể loại trừ mức năng lực mạng “Critical”, buộc OpenAI tăng cô lập, giám sát và bảo vệ trọng số.
  • Daybreak Cyber Partners đưa mô hình mạng tiên tiến tới các đối tác được phê duyệt trong phạm vi kiểm thử, ghi log và giám sát chặt chẽ.

Paper, code và giáo dục

  • AgentOPSD gán công trạng theo từng lượt không cần critic hay rollout bổ sung, đạt 89,1% trên ALFWorld.
  • SFT Conflicts, RL Coexists giải thích RL tạo cập nhật thưa và gần trực giao, nhờ đó giảm xung đột giữa nhiều nhiệm vụ so với SFT.
  • StreamArena xây benchmark 243 video dài trung bình 88,8 phút để kiểm tra trí nhớ và tương tác video liên tục.
  • Chất lượng mã C++ do AI tạo ghi nhận mức tăng 5–8% tài nguyên tính toán, nhưng phản hồi theo taxonomy giảm 11,1% cảnh báo mục tiêu.
  • OpenCode kết hợp TRL huấn luyện trực tiếp coding agent bằng AsyncGRPO trên chính token và hành động nó tạo trong sandbox thật.
  • TutorMoments cho thấy gia sư AI thường giúp quá mức, làm giảm cơ hội tự suy luận và “vật lộn có ích” của người học.
  • Knowledge Distillation hiệu quả dùng top‑K logits ngoại tuyến và fused KL để tăng thông lượng tới 41% và huấn luyện ngữ cảnh dài gấp bốn lần.
  • Muse Glimmer đưa mô hình đa phương thức 30B giấy phép Apache 2.0 tới thiết bị cục bộ với khả năng dùng công cụ, hiểu ảnh và video.
  • NVIDIA Cosmos 3 hợp nhất suy luận thị giác, mô phỏng thế giới và dự đoán hành động thành nền tảng mở cho robot, xe tự hành và vision AI.
Posted in , ,