-
Paper The Meta-Agent Challenge đặt ra một câu hỏi rất lớn: thay vì chỉ kiểm tra AI có giải được bài toán hay không, hãy kiểm tra xem AI có thể tự thiết kế, lập trình, đánh giá và tối ưu một agent khác để giải bài toán hay không. Đây là một proxy thực nghiệm cho ý tưởng “recursive self-improvement” — AI cải tiến chính hệ thống AI. Benchmark MAC-v1 gồm 5 miền: AIME toán, GPQA/HLE khoa học sau đại học, LiveCodeBench lập trình thi đấu, SWE-Bench sửa lỗi repo và Terminal-Bench thao tác terminal dài hạn. Meta-agent…