Mô hình AI nhỏ rẻ hơn 11 lần so với GPT-5.6 Luna và gần như ngang bằng trong bài kiểm tra logic
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Lab đã công bố kết quả thử nghiệm cho mô hình lý luận BDH-CQ của họ, có 150 triệu tham số và đạt 29,5% trên chuẩn ARC-AGI-1. Chi phí tính toán của mô hình là 0,0007 USD mỗi tác vụ, rẻ hơn 11 lần so với GPT-5.6 Luna của OpenAI, mô hình đạt 34,2% với chi phí 0,008 USD mỗi tác vụ. Phòng thí nghiệm lập luận rằng các kiến trúc thay thế có thể cải thiện đáng kể hiệu quả chi phí.
Pathway Lab, công ty chuyên nghiên cứu các kiến trúc khác với transformer, đã công bố kết quả của mô hình suy luận BDH-CQ. Dù chỉ có 150 triệu tham số, mô hình này đã đạt 29,5% trên benchmark ARC-AGI-1, trong khi chi phí chỉ 0,0007 đô la cho mỗi tác vụ. Điều này khiến nó rẻ hơn 11 lần so với mô hình nhỏ GPT-5.6 Luna của OpenAI, vốn đạt 34,2% và tốn 0,008 đô la mỗi tác vụ ngay cả sau khi đã giảm giá 80%. Để so sánh, Anthropic Claude Opus 5 và Google Gemini 3.1 Pro đạt 97–98% trong cùng bài kiểm tra nhưng tốn 0,5–0,6 đô la mỗi tác vụ, đắt gần một nghìn lần. Alibaba Qwen3 235B tốn hơn gấp ba lần so với BDH-CQ nhưng hiệu suất lại kém hơn. Phòng thí nghiệm cho biết sự khác biệt đến từ cơ chế suy luận: hầu hết các mô hình AI hiện tại tạo ra văn bản trung gian tiêu tốn token, trong khi BDH-CQ giải quyết vấn đề một cách âm thầm trong bộ nhớ. Các thử nghiệm ban đầu cho thấy BDH-CQ tuân theo các quy luật mở rộng (scaling laws) tiêu chuẩn tương đương với các mô hình transformer có từ 1 đến 600 tỷ tham số. Pathway có kế hoạch giải quyết các nhiệm vụ khó hơn, bao gồm suy luận toán học, bài kiểm tra ARC-AGI-2, và cuối cùng là đánh giá đầy đủ ARC-AGI-3, với hy vọng rằng lợi thế về hiệu quả sẽ được duy trì trên các bài toán lớn và phức tạp hơn.
Nguồn: 3DNews —
bản gốc
