Các mô hình AI lập luận: Cách chúng hoạt động và tại sao chúng quan trọng
OpenAI
Anthropic
Google/DeepMind
DeepSeek
Các Mô hình Lập luận Lớn (Large Reasoning Models, LRMs) mô phỏng tư duy chậm của con người, vượt trội hơn so với các Mô hình Ngôn ngữ Lớn (Large Language Models, LLMs) cổ điển trong việc giải quyết các vấn đề phức tạp. Hoạt động của chúng dựa trên lập luận chuỗi suy nghĩ (chain-of-thought reasoning), tính toán bổ sung trong quá trình suy luận và học tăng cường. Dù đạt được những kết quả ấn tượng, con đường đến Trí tuệ Nhân tạo Tổng quát (Artificial General Intelligence, AGI) vẫn còn rộng mở.
Vào mùa thu năm 2024, OpenAI đã giới thiệu mô hình o1, trở thành một hiện tượng: trong kỳ thi toán AIME, nó đạt 74% ở chế độ một lần thử và lên tới 93% khi chọn đồng thuận, trong khi GPT-4o chỉ giải được 12% số bài. Trên benchmark GPQA Diamond, o1 đạt 78%, vượt qua điểm trung bình của chuyên gia. Những kết quả này cho thấy khả năng của các Mô hình Lập luận Lớn (Large Reasoning Models - LRMs), mô phỏng kiểu tư duy "Hệ thống 2" chậm rãi mà Kahneman đã mô tả. Các mô hình khác được xếp vào nhóm LRM bao gồm Anthropic (Claude Fable 5, Mythos 5, Opus 4.8), Gemini 3.1 Pro của Google, DeepSeek R1 và GLM-5.2. Không giống như các mô hình ngôn ngữ lớn tự hồi quy cổ điển (Large Language Models - LLMs), hoạt động như "Hệ thống 1" nhanh chóng, các mô hình lập luận sử dụng chuỗi suy nghĩ, tính toán bổ sung tại thời điểm suy luận (test-time compute) và học tăng cường. Chúng tạo ra các token lập luận mà người dùng không nhìn thấy, làm tăng thời gian xử lý yêu cầu lên một phút hoặc hơn. Nghiên cứu đã chỉ ra rằng chiến lược "suy nghĩ lâu hơn" hiệu quả hơn việc chỉ tăng quy mô mô hình: một mô hình có thể hoạt động tốt như một LLM lớn gấp 14 lần nếu có đủ thời gian suy nghĩ. DeepSeek-R1 của Trung Quốc đã tích hợp lập luận trực tiếp vào chính mô hình, loại bỏ bộ "phê bình" bên ngoài.
Nguồn: 3DNews —
bản gốc
