Claude Opus 5.5
Chuyện gì vừa xảy ra? Anthropic phát hành model đầu tiên thuộc dòng Claude 5.5. Hãng công bố đạt mức của Fable 5.1 trong phần lớn công việc, chạy tác vụ điển hình rẻ hơn Opus 5 khoảng 40% và tạo đầu ra nhanh hơn trên 30% theo đo đạc của hãng. Các con số là so sánh trong điều kiện Anthropic công bố, không phải bảo đảm cho mọi ứng dụng.
Công nghệ bên trong: Tối ưu lượng compute khi phục vụ model và giá cho lượt đọc từ cache của ứng dụng agent.
Đóng góp đáng chú ý: Đưa một model thuộc nhóm năng lực cao xuống mức chi phí vận hành thấp hơn thế hệ Opus trước.
Vì sao đáng quan tâm? Nhóm triển khai agent và AI coding có thể tính lại chi phí mỗi tác vụ thay vì chỉ so điểm benchmark.
Nguồn gốc: https://www.anthropic.com/claude-opus-5-5
GPT-6 Sol và Luna
Chuyện gì vừa xảy ra? OpenAI mở rộng dòng GPT-6 với hai model phù hợp các mức việc và ngân sách khác nhau. Hãng công bố giá API thấp hơn khoảng 50% so với giá khuyến mại GPT-5.6 cùng cấp, đồng thời báo cáo cải thiện trong coding và tác vụ làm việc. Phép so sánh giá này có mốc cụ thể; không nên nói “mọi tác vụ rẻ đi một nửa”.
Công nghệ bên trong: Phân tầng model theo chất lượng, độ nhanh và chi phí; hệ thống caching và inference hỗ trợ giá phục vụ.
Đóng góp đáng chú ý: Tăng lựa chọn giữa năng lực model và giá khi xây dựng luồng công việc AI.
Vì sao đáng quan tâm? Developer và giảng viên có thể chọn model cho bài tập, chấm bài hoặc hỗ trợ code theo yêu cầu thực tế.
Nguồn gốc: https://openai.com/index/introducing-gpt-6-sol-and-luna/
Better prompt caching for GPT-6
Chuyện gì vừa xảy ra? OpenAI công bố cải tiến cache cho ngữ cảnh chung của các lượt gọi GPT-6, dashboard, công cụ tìm nguyên nhân cache miss và điểm đặt cache do developer chọn. Nhà cung cấp cho biết ngữ cảnh đầu vào đủ điều kiện có thể nhận mức giảm giá đọc cache tới 90%. Theo số liệu GitHub được trích trong bài, tỷ phần token cần xử lý mới ở Copilot đã giảm hơn 50% so với mốc cũ qua nhiều tháng triển khai.
Công nghệ bên trong: Lưu tiền tố prompt ổn định, như hướng dẫn và định nghĩa công cụ, để dùng lại phần tính toán trong yêu cầu sau.
Đóng góp đáng chú ý: Biến hiệu suất của agent chạy lâu thành một thứ có thể quan sát và điều chỉnh bằng dữ liệu cache.
Vì sao đáng quan tâm? Đây là thủ thuật AI Engineering thực dụng: đặt nội dung ổn định trước, nội dung đổi liên tục sau, theo dõi cache hit và chi phí thực tế.
Nguồn gốc: https://openai.com/index/better-prompt-caching-for-gpt-6/
Offloaded inference for real-world physical AI robotics
Chuyện gì vừa xảy ra? Microsoft Research công bố nghiên cứu và phần bổ sung cho Physical AI Toolchain giúp chuyển một số phép suy luận robot sang GPU bên ngoài. Trong cấu hình họ thử, thao tác và thời lượng pin cải thiện khi phần cứng trên robot bị giới hạn. Họ nêu rõ kết quả còn phụ thuộc độ trễ mạng, băng thông và tài nguyên GPU.
Công nghệ bên trong: Phân phối inference giữa robot, máy ở gần và cloud; đóng gói và điều phối bằng container/Kubernetes.
Đóng góp đáng chú ý: Đưa vị trí chạy model thành một tham số thiết kế quan trọng của robot, kèm công cụ thử nghiệm offload.
Vì sao đáng quan tâm? Computer Vision và robotics cần phản hồi đúng hạn, không chỉ cần model có điểm số cao.
Claude nhận diện một hệ enzyme chưa được mô tả
Chuyện gì vừa xảy ra? Anthropic công bố kết quả ban đầu của nhóm nghiên cứu sinh học: các agent Claude quét dữ liệu DNA và tìm mẫu lặp cạnh một reverse transcriptase; nhóm nghiên cứu tiếp tục kiểm tra trong phòng thí nghiệm. Chức năng chính của hệ enzyme vẫn chưa rõ. Đây là preprint, chưa phải công cụ chỉnh sửa gene dùng được.
Công nghệ bên trong: Agent tìm kiếm và hình thành giả thuyết trên dữ liệu trình tự, tiếp đó con người kiểm chứng bằng thí nghiệm.
Đóng góp đáng chú ý: Minh họa quy trình AI đề xuất một ứng viên sinh học mới để nhà khoa học kiểm tra.
Vì sao đáng quan tâm? Ví dụ rõ về agent trong khoa học, với giới hạn kiểm chứng sinh học cần giữ nguyên.
Nguồn gốc: https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
MentalHealthBench
Chuyện gì vừa xảy ra? OpenAI phát hành benchmark mở về phản hồi AI trong hội thoại sức khỏe tâm thần, xây dựng cùng hơn 80 chuyên gia được cấp phép ở 22 quốc gia. Các tình huống giả lập bao gồm chuyện thường ngày và tình huống khẩn cấp. Đây là công cụ đánh giá, không chứng minh chatbot thay thế chuyên gia.
Công nghệ bên trong: Tình huống hội thoại có bối cảnh và tiêu chí chấm dựa trên nhận định chuyên môn.
Đóng góp đáng chú ý: Đưa đánh giá vượt khỏi một vài câu hỏi an toàn đơn lẻ sang hội thoại có ngữ cảnh và nhiều mức độ.
Vì sao đáng quan tâm? Người nghiên cứu và nhóm sản phẩm có một bộ kiểm tra cụ thể hơn trước khi triển khai hệ thống hỗ trợ người dùng.
Nguồn gốc: https://openai.com/index/introducing-mentalhealthbench/
Self-Adaptive VLA for Robust Robot Deployment
Chuyện gì vừa xảy ra? Một preprint về Vision-Language-Action đưa ra cách cho chính sách robot tự điều chỉnh khi phần cứng bị lệch, chẳng hạn sai số cơ cấu chấp hành. Trong bốn tác vụ thao tác được báo cáo, phương pháp lấy lại trên 80% hiệu năng nền dưới biến đổi phần cứng; điều này không đồng nghĩa đạt 80% độ chính xác tuyệt đối.
Công nghệ bên trong: Bộ mã hóa bối cảnh nén quan sát ảnh, trạng thái robot và hành động thành một token để điều chỉnh chính sách ở lúc chạy.
Đóng góp đáng chú ý: Cho robot dùng chính lịch sử thao tác để bù một phần sai lệch phần cứng khi triển khai.
Vì sao đáng quan tâm? Kết nối Computer Vision với khó khăn thật của robot: camera, khớp và động cơ thay đổi sau khi huấn luyện.
Nguồn gốc: https://arxiv.org/abs/2609.30092
GitHub Copilot trong Slack và Microsoft Teams
Chuyện gì vừa xảy ra? GitHub nâng cấp cách Copilot dùng file, hình và chuỗi thảo luận làm ngữ cảnh khi tạo công việc GitHub từ Slack/Teams. Nó kiểm tra issue tương tự trước khi tạo issue và liên kết kết quả với cuộc trao đổi gốc. Cập nhật cũng cải thiện điều khiển model và trạng thái tác vụ dài.
Công nghệ bên trong: Đưa bối cảnh hội thoại vào luồng tạo và theo dõi issue, kèm dấu vết về nguồn quyết định.
Đóng góp đáng chú ý: Giữ được ngữ cảnh từ thảo luận nhóm tới đầu việc trong repository.
Vì sao đáng quan tâm? Developer và lớp học làm dự án có thể theo dấu vì sao một task được tạo và kiểm tra nó đã được xử lý chưa.
Nguồn gốc: https://github.blog/changelog/2026-09-25-updates-to-github-copilot-for-slack-and-microsoft-teams/