• Bài báo Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs đặt ra một thước đo mới cho năng lực toán học của AI. Sau khi các mô hình lớn đạt mức rất cao ở toán kiểu Olympic, câu hỏi tiếp theo là: AI có thể chạm tới toán nghiên cứu thật hay chưa? Soohak trả lời bằng một benchmark gồm 439 bài toán, được viết mới từ đầu bởi 64 nhà toán học, nhằm giảm rủi ro mô hình đã “nhìn thấy đề” trong dữ liệu huấn luyện. Soohak có hai phần chính: Challenge gồm 340…