-
Ở nhóm nghiên cứu, BetaPRM đề xuất reward model theo từng bước suy luận, đồng thời ước lượng độ tin cậy của phần thưởng; khi kết hợp Adaptive Computation Allocation, hệ thống giảm tới 33.57% token so với Best-of-16. AutoResearchClaw mở hướng AI hỗ trợ nghiên cứu tự động, nơi agent không chỉ tìm tài liệu mà còn tự củng cố quy trình làm nghiên cứu. Aurora biến chỉnh sửa video thành tác vụ của VLM agent dùng công cụ: AI hiểu yêu cầu mơ hồ, lập kế hoạch, rồi điều khiển video diffusion để sửa video. Formal Skill…