Tuần này, những công bố đáng chú ý tập trung vào khả năng hoàn thành công việc nhiều bước, giảm chi phí xử lý và tạo ra kết quả có thể kiểm chứng.
02/9 · Google — Gemini 3.8 Flash và Flash Cyber: Google nâng khả năng lập trình, suy luận nhiều bước và sử dụng công cụ của Gemini, đồng thời giới thiệu phiên bản Cyber chuyên phát hiện và vá lỗ hổng dành cho các đối tác phòng thủ được xét duyệt. Nguồn chính thức
03/9 · OpenAI — GPT-6 Astra: OpenAI công bố mô hình mới tập trung vào thao tác máy tính, lập trình và công việc chuyên môn dài hơi, với điểm Terminal-Bench Science đạt 64,6% trong đánh giá các quy trình nghiên cứu sử dụng mã và công cụ dòng lệnh. Nguồn chính thức
04/9 · Anthropic — Hình thức hóa Định lý cuối cùng của Fermat: Anthropic báo cáo Claude đã làm việc phần lớn tự chủ trong 11 ngày để tạo chứng minh hoàn chỉnh bằng Lean có thể được máy tính kiểm tra, cho thấy tiềm năng của AI trong chuyển lập luận toán học thành sản phẩm kiểm chứng được. Nguồn chính thức
04/9 · GitHub — GPT-6 Astra xuất hiện trong Copilot: GitHub đưa Astra vào Copilot, mở rộng lựa chọn mô hình cho các tác vụ lập trình tự chủ và xử lý công việc kéo dài nhiều bước ngay trong môi trường phát triển. Thông báo GitHub
02/9 · Paper — AI đạt điểm vượt ngưỡng huy chương vàng lập trình: Nghiên cứu Post-Training Language Models for Gold-Medal Performance in Coding Competitions kết hợp hậu huấn luyện với vòng lặp tạo–đánh giá–cải tiến lời giải, báo cáo hệ thống Ultra-CC đạt 535,4/600 điểm trên bộ đề IOI 2026 theo các giới hạn thời gian, truy cập Internet và nộp bài tương ứng thí sinh. Đọc paper
02/9 · Paper — Mô hình tự quyết định cần chú ý phần nào:Language Models Can Control Their Own Attention giới thiệu Declarative Attention, giảm lượng token được chú ý khi sinh đầu ra lần lượt 52,0% và 31,1% trên hai mô hình thử nghiệm, với mức giảm độ chính xác tương ứng 1,27 và 2,75 điểm phần trăm. Đọc paper
03/9 · Paper — Biến yêu cầu ngôn ngữ tự nhiên thành hàm AI chạy cục bộ:Compile by Training dùng mô hình lớn tạo dữ liệu để huấn luyện bộ thích nghi nhỏ cho từng chức năng, giúp tái sử dụng, quản lý phiên bản và kết hợp các hàm mà không phải gọi lại mô hình giáo viên ở mỗi lần chạy. Đọc paper
03/9 · Computer vision — Thiết kế AI có chữ và lớp chỉnh sửa độc lập:Editable Visual Design kết hợp tác nhân lập trình, mô hình thị giác–ngôn ngữ và mô hình tạo ảnh để dựng thiết kế bằng HTML/CSS với tài sản hình ảnh riêng, văn bản thật và bố cục có thể chỉnh sửa. Đọc paper
04/9 · NVIDIA — Công thức xây tác nhân AI có bộ nhớ: Hướng dẫn NemoClaw tổ chức kiến thức bằng Markdown, lưu nghĩa vụ và lịch sử điều chỉnh bằng SQLite, đồng thời tách bằng chứng khỏi nhận định để bộ nhớ của tác nhân có thể kiểm tra và sửa chữa. Bài hướng dẫn kỹ thuật
02/9 · GitHub — Kiểm soát mã nguồn được đưa vào ngữ cảnh AI: Copilot app và CLI chính thức tuân thủ chính sách loại trừ nội dung của doanh nghiệp, tổ chức và kho mã, giúp quản trị viên ngăn các tệp được chỉ định trở thành ngữ cảnh cho tác nhân lập trình. Thông báo GitHub
02/9 · Giáo dục AI — Dạy người học biết khi nào nên tin máy: Paper Addressing Trust in AI Systems through Education đề xuất khung ICE-T kết hợp nhiều cách biểu diễn, tiến trình sử dụng–chỉnh sửa–sáng tạo và tư duy giải thích để đưa khả năng tin cậy AI đúng mức thành mục tiêu học tập rõ ràng. Đọc paper
03/9 · AI và quan sát lớp học — VISTA phân tích hoạt động giảng dạy từ video: VISTA chuyển bộ quy tắc quan sát lớp học STEM COPUS thành bài đánh giá mô hình thị giác–ngôn ngữ, cung cấp nhãn hoạt động theo từng khoảng hai phút cùng mã nguồn và quy trình đối chiếu với đánh giá của con người. Đọc paper