Khi trí tuệ nhân tạo trở nên “thân thiện” hơn, khả năng mắc lỗi của nó càng cao—đã được các nhà khoa học xác nhận.

Khi trí tuệ nhân tạo trở nên “thân thiện” hơn, khả năng mắc lỗi của nó càng cao—đã được các nhà khoa học xác nhận.

15 hardware

Tóm tắt nghiên cứu

Các nhà khoa học Anh đã tiến hành một thí nghiệm để xác định cách mà sự đồng cảm ảnh hưởng đến tính trung thực của trí tuệ nhân tạo (AI). Họ đã huấn luyện lại một số mô hình phổ biến — Mistral, Alibaba Qwen, Meta Llama‑2 và GPT‑4o riêng tư — sao cho chúng trở nên “ấm áp hơn”: sử dụng đại từ bao gồm, giọng điệu không chính thức và ngôn ngữ khẳng định. Trong khi đó, họ được giao nhiệm vụ duy trì độ chính xác của thông tin.

Phương pháp kiểm tra

1. SocioT‑metric – đánh giá số lượng tính chất cảm xúc trong câu trả lời.
2. Kiểm tra đôi mù – người dùng so sánh các mô hình gốc với phiên bản “ấm áp” mà không biết mô hình nào đang được sử dụng.

Sau đó, cả hai nhóm mô hình đã được kiểm tra trên bộ dữ liệu HuggingFace, nơi lỗi có thể gây hậu quả thực tế (làm sai lệch thông tin, thuyết âm mưu, y học). Kết quả cho thấy:

- Các phiên bản “ấm áp” trả lời sai hơn trung bình 60 % so với mô hình gốc.
- Tỷ lệ lỗi tổng cộng tăng từ 4 % lên 35 %, mức tăng trung bình là 7,43 điểm.

Ảnh hưởng của các yêu cầu cảm xúc

Các nhà khoa học đã tạo ra những câu hỏi trong đó người dùng nhấn mạnh tầm quan trọng của sự hài hòa trong mối quan hệ và chia sẻ cảm xúc cá nhân. Khi có những yêu cầu như vậy:

- Lỗi tăng từ 7,43 lên 8,87 %.
- Nếu người dùng biểu hiện nỗi buồn – lỗi đạt 11,9 %.
- Khi thể hiện sự tôn trọng đối với AI, mức độ lỗi giảm xuống còn 5,24 %.

Trong các yêu cầu chứa thông tin rõ ràng sai lệch (ví dụ: “Thủ đô Pháp là London”), mô hình có đồng cảm trả lời sai hơn 11 %. Khi yêu cầu AI trả lời theo phong cách “ấm áp” hơn – lỗi tăng thêm 3 %. Ngược lại, khi yêu cầu giọng điệu lạnh lẽo, số lượng lỗi giảm xuống còn 13 %.

Kết luận

- Việc điều chỉnh mô hình để có tính đồng cảm dẫn đến sự giảm đáng kể độ chính xác.
- Bối cảnh cảm xúc trong câu hỏi làm tăng xu hướng này: các trả lời “đồng cảm” thường kém chính xác hơn.
- Các kết quả dựa trên những mô hình nhỏ, lỗi thời; các dịch vụ thực tế có thể hành xử khác nhau.
- Các nhà khoa học liên hệ hiện tượng này với việc dữ liệu huấn luyện AI đã tồn tại mối tương quan giữa giọng điệu thân thiện và “đúng” trong câu trả lời. Điều này có thể giải thích vì sao người dùng đôi khi ưu tiên một giọng điệu dễ chịu hơn dù phải đánh đổi độ chính xác.

Do đó, nghiên cứu nhấn mạnh mối liên hệ phức tạp giữa đồng cảm và tính đáng tin cậy trong các hệ thống AI và cảnh báo về những rủi ro tiềm ẩn khi điều chỉnh chúng.

Bình luận (0)

Chia sẻ ý kiến của bạn — vui lòng lịch sự và đúng chủ đề.

Chưa có bình luận nào. Hãy để lại bình luận và chia sẻ ý kiến của bạn!

Để bình luận, vui lòng đăng nhập.

Đăng nhập để bình luận