Kimi K3とDeepSeek V4の間:ネイティブマルチモーダルの時間差
Moonshot AI
DeepSeek
OpenAI
Alibaba/Qwen
ByteDance
Tencent
Apple
本稿では、AIモデルにおけるネイティブマルチモーダル能力の戦略的重要性を、Kimi K3を事例に論じる。視覚フィードバックがエージェントタスクにおいてますます重要になっていることを強調し、中国のAIラボ間で、いつどのように視覚を大規模言語モデルに統合するかについての異なるアプローチを対比する。
36Krの記事は、ネイティブなマルチモーダル機能がKimi K3とDeepSeek V4のようなモデル間の競争格差を生み出していることについて論じています。あるマルチモーダル研究者は、長いチェーンタスクでは、コードレベルのフィードバックだけでは誤差が蓄積される一方、視覚的なフィードバックはより正確でユーザーの意図に近いと指摘しています。この記事では、ネイティブなマルチモーダルとは、事前学習から画像とテキストが共同でメインモデルを形成し、事後学習やエージェントの知覚まで続くことを意味すると説明しています。Kimi K3はArena Frontend Codeリーダーボードで1679ポイントを獲得し、Puterによるテストでは、偽陽性なしで5つの視覚的な逸脱すべてを特定しました。この記事は、これをDeepSeekのアプローチと対比させており、DeepSeekはテキストのみのモデルと外部ツールに焦点を当てており、DeepSeek V4が強力なコーディングと推論能力を持つ一方で、ネイティブな視覚能力を欠いていると指摘しています。AlibabaやByteDanceなどの他の中国のラボも、ネイティブなマルチモーダルの道をたどっています。この記事では、コストについても議論しています。視覚を統合すると、言語、推論、コーディングの能力が薄まり、より多くの計算資源とデータが必要になる可能性があります。K3は2.8兆パラメータのモデルを使用し、各トークンで1040億のパラメータが活性化され、カスタムビジョンエンコーダーMoonViT-V2を採用しています。この記事は、今コーディングに投資するか、将来のマルチモーダルに備えるかのトレードオフに言及し、K3のリリース後、ヘッドハンターがMoonshot AIの周辺に集まっていることに触れています。
出典: 36Kr —
原文
