• Paper “Process Rewards with Learned Reliability” giải quyết một điểm yếu quan trọng của các mô hình suy luận hiện nay: khi AI giải toán hoặc lập luận nhiều bước, ta thường dùng Process Reward Model – PRM để chấm điểm từng bước. Nhưng PRM truyền thống chỉ đưa ra một điểm số, ví dụ bước này có vẻ đúng bao nhiêu phần trăm, mà không nói điểm số đó có đáng tin hay không. Vì vậy, hệ thống phía sau dễ coi một phán đoán thiếu chắc chắn như tín hiệu chắc chắn. Nhóm tác giả đề xuất…