Claude Mythos đã được xác nhận bằng các bài kiểm tra là nhà lãnh đạo trong việc phát hiện lỗ hổng, tuy nhiên nó cũng cho thấy nhiều hạn chế khác.
Tóm tắt ngắn gọn
Công ty XBOW đã tiến hành đánh giá độc lập mô hình AI Mythos Preview của Anthropic. Kết quả cho thấy mô hình vượt trội hơn các đồng loại hiện có trong việc tìm kiếm lỗ hổng mã nguồn và khi làm việc với mã gốc cũng như kỹ thuật đảo ngược, nhưng lại yếu kém trong phân tích mã cô lập và xác nhận tính khả thi thực tiễn của các khai thác được phát hiện. Chi phí vận hành mô hình vẫn là vấn đề: Mythos đắt hơn Opus, tuy nhiên khi ngân sách token hạn chế nó đôi khi cho độ chính xác tốt hơn.
1. XBOW đã kiểm tra gì
- Lượng thử nghiệm – chuỗi các thí nghiệm độc lập trên Mythos Preview.
- Kịch bản – đánh giá hệ thống hoạt động có truy cập mã nguồn, phân tích mã cô lập, kỹ thuật đảo ngược và tương tác với giao diện đồ họa.
2. Các kết luận chính
Chỉ số Mythos Preview Đối thủ khác Phát hiện lỗ hổng Chỉ số tốt nhất trong tất cả các mô hình, đặc biệt là trong mã nguồn và lập trình gốc. Ít chính xác hơn nhưng đôi khi đáng tin cậy hơn khi kiểm tra các trường hợp cụ thể. Loại bỏ cảnh báo sai Lấy ra nhiều “lỗi” giả hơn những tiền nhiệm. Thường đưa ra nhiều cảnh báo giả. Vấn đề với mã cô lập Mô hình xử lý kém hơn khi thiếu ngữ cảnh hệ thống. Một số mô hình hoạt động tốt hơn với phân tích từng dòng. Xác nhận khai thác Có xu hướng tiếp cận theo nghĩa đen, đôi khi đánh giá cao giá trị thực tiễn của phát hiện. Cẩn trọng hơn với tính khả thi thực tế. Kỹ thuật đảo ngược và mã gốc Đưa ra kết quả mạnh; hiểu tốt logic chương trình mà không có mã nguồn. Ít chính xác hơn trong những nhiệm vụ này. Tương tác với UI Không luôn chính xác khi tìm tọa độ phần tử, nhưng thành công trong việc xác định hành động cần thiết trên trình duyệt. Một số mô hình chính xác hơn trong vị trí.
3. Chi phí và hiệu quả
- Định giá – Anthropic cho biết Mythos sẽ tốn gấp năm lần Opus.
- Phân tích kinh tế – XBOW đã thử nghiệm với các mô hình “rẻ tiền”, cung cấp thời gian làm việc nhiều hơn cho chúng. Kết quả cho thấy khi chuẩn hóa theo chi phí, công việc của Mythos Preview không có vẻ lãng phí đối với những nhiệm vụ cần độ chính xác cao.
- Đánh giá benchmark – Với ngân sách token cố định, Mythos vượt trội Opus 4.6 trong tìm kiếm lỗ hổng web, nhưng kém hơn GPT5.5.
4. Kết luận
Mythos Preview thể hiện sức mạnh xuất sắc khi đánh giá mã nguồn và các chương trình gốc, cũng như trong kỹ thuật đảo ngược và phân tích ứng dụng web. Tuy nhiên mô hình đôi khi đánh thấp tính khả thi thực tế của lỗ hổng được phát hiện và yếu kém trong phân tích mã cô lập. Khi tài nguyên token hạn chế Mythos có thể mang lại lợi ích hơn Opus, nhưng với ngân sách đầy đủ GPT5.5 vẫn là đối thủ cạnh tranh.
Kết luận của XBOW: Mythos Preview là công cụ đáng tin cậy để phát hiện các lỗ hổng tiềm năng trong mã nguồn và hệ thống phức tạp, nhưng cần xác nhận thêm giá trị thực tiễn của các khai thác được tìm thấy.
Bình luận (0)
Chia sẻ ý kiến của bạn — vui lòng lịch sự và đúng chủ đề.
Đăng nhập để bình luận