-
Trong bài DOPD: Dual On-policy Distillation, “teacher” là mô hình AI lớn hơn, mạnh hơn, có nhiệm vụ hướng dẫn. “Student” là mô hình AI nhỏ hơn, rẻ hơn, cần học lại năng lực của teacher để có thể chạy hiệu quả trong thực tế. Thông thường, để huấn luyện student, người ta dùng distillation: cho student quan sát hoặc bắt chước cách teacher tạo câu trả lời. Với on-policy distillation, student không chỉ học từ dữ liệu có sẵn, mà tự sinh câu trả lời của mình trước; sau đó teacher đánh giá và chỉ dẫn từng token.…