• Ở nhóm nghiên cứu, LongLive-2.0 của NVIDIA tập trung vào tạo video dài hiệu quả hơn, dùng NVFP4 và KV cache lượng tử hóa để tăng tốc 2.15× khi training, 1.84× khi inference, đạt 45.7 FPS với mô hình 5B. PUMA đặt vấn đề ngược lại với xu hướng “nghĩ càng dài càng tốt”: mô hình nên dừng khi suy luận đã hội tụ, giúp giảm trung bình 26.2% token mà vẫn giữ chất lượng. Paper về Knowing–Doing Gap cho thấy AI agent có thể biết cần dùng công cụ nhưng không gọi công cụ, với độ lệch tới…