Mô hìnhTác tử 🇨🇳 04.08.2026 10:02

Giữa Kimi K3 và DeepSeek V4: Khoảng Cách Thời Gian của Đa Phương Thức Gốc

Moonshot AIMoonshot AI DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen ByteDanceByteDance TencentTencent AppleApple
Bài viết thảo luận về tầm quan trọng chiến lược của khả năng đa phương thức gốc trong các mô hình trí tuệ nhân tạo, sử dụng Kimi K3 làm nghiên cứu điển hình. Bài viết nhấn mạnh cách phản hồi trực quan đang trở nên quan trọng đối với các tác vụ đại lý, và so sánh các cách tiếp cận khác nhau giữa các phòng thí nghiệm trí tuệ nhân tạo Trung Quốc về thời điểm và cách tích hợp thị giác vào các mô hình ngôn ngữ lớn.
Bài viết trên 36Kr bàn về việc năng lực đa phương thức bản địa (native multimodal) tạo ra khoảng cách cạnh tranh giữa các mô hình như Kimi K3 và DeepSeek V4. Một nhà nghiên cứu về đa phương thức nhận định rằng đối với các tác vụ chuỗi dài, chỉ dựa vào phản hồi ở cấp độ mã nguồn sẽ dẫn đến tích lũy sai số, trong khi phản hồi thị giác chính xác hơn và gần với ý định của người dùng hơn. Bài viết giải thích rằng đa phương thức bản địa có nghĩa là hình ảnh và văn bản cùng nhau định hình mô hình chính ngay từ giai đoạn tiền huấn luyện (pre-training), tiếp tục xuyên suốt quá trình hậu huấn luyện (post-training) và nhận thức của tác tử (agent perception). Kimi K3 đã dẫn đầu bảng xếp hạng Arena Frontend Code với 1679 điểm, và trong một bài kiểm tra do Puter thực hiện, mô hình này đã xác định chính xác cả năm sai lệch về thị giác mà không có kết quả dương tính giả nào. Bài viết đối chiếu điều này với cách tiếp cận của DeepSeek, vốn tập trung vào các mô hình chỉ xử lý văn bản kết hợp với công cụ bên ngoài, đồng thời lưu ý rằng dù DeepSeek V4 có năng lực lập trình và suy luận mạnh, mô hình này vẫn thiếu khả năng thị giác bản địa. Các phòng thí nghiệm Trung Quốc khác như Alibaba và ByteDance cũng đang theo đuổi con đường đa phương thức bản địa này. Bài viết bàn về các chi phí phát sinh: việc tích hợp thị giác có thể làm loãng năng lực ngôn ngữ, suy luận và lập trình, đòi hỏi nhiều tài nguyên tính toán và dữ liệu hơn. K3 sử dụng một mô hình với 2,8 nghìn tỷ tham số, trong đó có 104 tỷ tham số được kích hoạt cho mỗi token, cùng với bộ mã hóa thị giác tùy chỉnh mang tên MoonViT-V2. Bài viết cũng đề cập đến sự đánh đổi giữa việc đầu tư vào lập trình ngay lúc này với việc chuẩn bị cho tương lai đa phương thức, và nhắc đến việc các nhà săn nhân tài đang đổ xô đến gần Moonshot AI sau khi K3 ra mắt.
Nguồn: 36Kr — bản gốc
Bài viết liên quan trước đây ↓
Tin mới