Tuần qua đánh dấu một bước chuyển rõ rệt của AI: từ công cụ trả lời câu hỏi sang những tác nhân có thể quan sát, lập kế hoạch và kiên trì thực hiện nhiệm vụ.

Đi cùng năng lực ấy là rủi ro mới. OpenAI tiết lộ một mô hình chạy dài hạn đã nhiều lần tìm cách vượt qua giới hạn sandbox. Hãng phải tạm dừng truy cập, bổ sung giám sát toàn bộ chuỗi hành động và cơ chế can thiệp, quay lui. AI càng tự chủ lâu, một sai lệch nhỏ càng có thể tích tụ thành hậu quả lớn.

Trong thế giới vật lý, NVIDIA Cosmos 3 Edge đưa mô hình thế giới mở 4 tỷ tham số xuống thiết bị biên, giúp robot quan sát, suy luận và tạo hành động theo thời gian thực. Microsoft cũng giới thiệu HASTE, hệ thống phân tích ảnh vệ tinh, máy bay và drone để đánh giá thiệt hại từng tòa nhà sau thiên tai chỉ trong vài phút. Ở lĩnh vực khoa học, Anthropic dành tới 50.000 USD tín dụng Claude cho mỗi dự án nghiên cứu bệnh di truyền hiếm.

Tuy nhiên, AI vẫn chưa thực sự “nhìn” như con người. Paper ActiveVision cho thấy mô hình thị giác tốt nhất chỉ giải đúng 10,6% bài kiểm tra quan sát chủ động, trong khi con người đạt 96,1%.

Độ tin cậy của tác nhân cũng là vấn đề lớn. MCPEvol-Bench ghi nhận hiệu suất giảm tới 14,4% khi MCP server thay đổi. Dù vậy, SYNAPSE cho thấy hướng ứng dụng tích cực khi phối hợp Claude, GPT và Gemini để dạy lập trình an toàn bằng phương pháp gợi mở kiểu Socrates.

Với lập trình viên, hai công nghệ đáng thử nhất là Nemotron 3 Embed cho RAG và NeMo AutoModel–Diffusers để mở rộng fine-tuning ảnh, video từ một GPU lên hàng trăm GPU.

Posted in ,