Rẻ để tạo, đắt để kiểm chứng: Chi phí ẩn của đầu ra AI
DeepMind
Google/DeepMind
Anthropic
OpenAI
DeepSeek
Bài viết khám phá sự bất đối xứng do AI tạo ra: trong khi việc tạo bản nháp và câu trả lời hiện nay rẻ, việc xác minh tính chính xác của chúng vẫn khó khăn và tốn kém. Nó nêu bật nghiên cứu cho thấy ngay cả những sự thật riêng lẻ đúng cũng có thể kết hợp thành kết luận sai, và các công cụ xác minh, cả con người và tự động, có những hạn chế đáng kể.
Bài báo thảo luận về thách thức trong việc xác thực nội dung do AI tạo ra, nhấn mạnh sự bất đối xứng giữa chi phí tạo nội dung thấp và chi phí xác thực cao. Các nhà nghiên cứu thuộc Đại học Quốc gia Đài Loan đã phát hiện rằng các mô hình ngôn ngữ có thể kết hợp các sự kiện có thể xác thực về những người khác nhau thành một tiểu sử duy nhất của một người không tồn tại; các chỉ số tính xác thực tiêu chuẩn đã bỏ qua sự kiện này, và sau khi điều chỉnh sự mơ hồ về thực thể, điểm số của bốn mô hình nguồn mở đã giảm hơn 10%. Một nghiên cứu mang tên Verify with Caution đã kiểm tra năm chỉ số tính xác thực trên mười một bộ dữ liệu, và phát hiện ra sự không nhất quán và lỗi, đặc biệt là khi văn bản hỗ trợ cách xa so với tuyên bố. Trong các thí nghiệm trên con người, sự trợ giúp của AI đã đẩy nhanh quá trình xác thực nhưng dẫn đến sự tin tưởng quá mức khi mô hình đưa ra các giải thích hợp lý nhưng sai; việc trình bày cả ưu điểm và nhược điểm đã giảm thiểu vấn đề này nhưng không mang lại lợi thế đáng kể so với tìm kiếm thông tin. Bài báo so sánh việc xác thực giữa các lĩnh vực: mã nguồn có trình biên dịch và các bài kiểm tra, toán học sử dụng xác minh chứng minh chính thức (ví dụ: AlphaProof và AlphaGeometry 2 đã giải được bốn bài toán tại Kỳ thi Olympic Toán học Quốc tế năm 2024), nhưng phân tích và chiến lược thì khó xác thực hơn. Các đề xuất bao gồm trình bày nguồn thông tin trước, như trong phương pháp Attribute First, then Generate, và sử dụng phần thưởng quy trình (ThinkPRM) để kiểm tra các bước lập luận. Bài báo cũng đề cập đến phương pháp tiếp cận dựa trên rủi ro của NIST và Đạo luật AI Châu Âu, những thứ yêu cầu nhiều tài liệu và giám sát hơn đối với các hệ thống có rủi ro cao.
Nguồn: Habr — хаб ИИ —
bản gốc
