Các nhà nghiên cứu Microsoft cho biết các mô hình AI vẫn chưa có khả năng giải quyết những bài toán phức tạp.
Các nhà nghiên cứu của Microsoft đã phát hiện giới hạn của các mô hình ngôn ngữ lớn (LLM) hiện đại khi thực hiện các nhiệm vụ phức tạp nhiều lần
Trong khuôn khổ các thí nghiệm, Microsoft Research nhận thấy ngay cả những mô hình AI tiên tiến nhất cũng mắc phải lỗi nghiêm trọng khi được giao thực hiện các thao tác dài và đa giai đoạn. Trong số các hệ thống đã thử nghiệm – Gemini 3.1 Pro, Claude 4.6 Opus và GPT 5.4 – trung bình mỗi mô hình mất khoảng 25 % nội dung tài liệu sau quá trình xử lý tự động.
Những gì họ thực tế kiểm tra
* Đánh giá DELEGATE‑52
Được tạo bởi nhóm Philip Labana, Tobias Schnabel và Jennifer Nevill. Nó mô phỏng quy trình làm việc trong 52 lĩnh vực chuyên môn: từ lập trình và ghi nốt cho tới kết tinh học.
* Tiêu chí đánh giá
Các mô hình được đánh giá dựa trên mức độ bảo toàn tính toàn vẹn của tài liệu sau 20 vòng xử lý. Ngưỡng “sẵn sàng” đặt ở mức 98 % – nếu kết quả thấp hơn, nhiệm vụ được coi là thất bại.
Kết luận chính
Lĩnh vực | Kết quả tốt nhất | Lập trình | Các chỉ số mạnh nhất | Ngôn ngữ tự nhiên | Mô hình ít đáng tin cậy nhất
---|---|---|---|---|---
* Sự suy giảm chất lượng
Trong hơn 80 % kết hợp tài liệu, chất lượng đã giảm xuống dưới 80 %. Mô hình tốt nhất (Gemini 3.1 Pro) chỉ đáp ứng tiêu chí sẵn sàng trong 11 trên 52 lĩnh vực.
* Lỗi “nhảy”
Các tổn thất không diễn ra dần dần mà là “nhảy”: trong một vòng tương tác, mô hình có thể mất từ 10 đến 30 % độ chính xác. Các mô hình tiên tiến hơn (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) cố gắng tránh các lỗi nhỏ, hoãn xử lý chúng cho các giai đoạn sau và giảm số lần tương tác.
* Quản lý theo đại lý
Khi sử dụng công cụ trong chế độ quản lý đại lý, kết quả không được cải thiện: vào cuối vòng, chất lượng giảm khoảng 6 %.
Điều này có nghĩa gì đối với người dùng
Các nhà khoa học nhấn mạnh rằng người dùng vẫn cần kiểm soát kỹ lưỡng hoạt động của hệ thống AI khi giao cho chúng quyền hạn. Các mô hình hiện tại chỉ có thể làm việc tự động trong các lĩnh vực hẹp.
Tuy nhiên, tác giả của bộ đánh giá lưu ý một tiến triển đáng kể: dòng mô hình OpenAI đã cải thiện hiệu suất từ 14,7 % lên 71,5 % trong vòng 16 tháng. Điều này chứng minh rằng LLM vẫn đang phát triển, nhưng hiện tại vẫn bị giới hạn trong các nhiệm vụ phức tạp nhiều lần.
Bình luận (0)
Chia sẻ ý kiến của bạn — vui lòng lịch sự và đúng chủ đề.
Đăng nhập để bình luận