-
Bài báo “LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling” đặt ra một vấn đề quan trọng: muốn LLM trả lời tốt hơn, không nhất thiết phải huấn luyện lại mô hình lớn hơn; ta có thể phân bổ thêm tính toán lúc suy luận, gọi là test-time scaling. Nhưng trước đây, các chiến lược này thường do con người tự thiết kế bằng kinh nghiệm: khi nào mở thêm nhánh suy luận, khi nào tiếp tục, thăm dò, cắt nhánh hoặc dừng. Nhóm tác giả đề xuất AutoTTS, một framework để AI agent tự khám phá chiến lược…