中国のオープンウェイトAI「Kimi K3」が米国のフロンティアモデルに挑戦
Moonshot AI
OpenAI
Anthropic
Meta
Mistral
DeepSeek
中国のスタートアップであるMoonshot AIは、2.8兆パラメータを備えたオープンウェイトモデル「Kimi K3」を公開し、ベンチマークで最高のパフォーマンスを達成したと主張しています。Artificial Analysisによる独立したテストでは、同社のインテリジェンス指数で、Claude Fable 5とGPT-5.6 Solに次ぐ第3位にランクインしました。Kimi K3は、エージェントタスクや自動化タスクで優れており、米国のフロンティアモデルにとって大きな挑戦となっています。
中国のスタートアップであるMoonshot AIは、中国のインターネット・コマースグループであるAlibabaの支援を受けており、パラメータ数2.8兆のオープンウェイトモデル「Kimi K3」をリリースした。内部ベンチマークによると、その性能は非常に優れており、競合他社のハイエンド版であるClaude Fable 5やGPT-5.6 Solの直後に位置する。コーディングタスクでは、Kimi K3は6つの分野のうち2つで勝利し、他のすべての分野で少なくとも3位に入った。ユニバーサルエージェントとしてはさらに優れており、6つのテストのうち3つで勝利した一方、Fable 5が総合的にリードしている。ラボ「Artificial Analysis」による独立した評価でも同様の結果が見られた。Kimiは彼らのインテリジェンス指数で57ポイントを獲得し、ランキングを17位から3位に上げ、Claude Fable 5にわずか3ポイント、GPT-5.6 Solに2ポイント差に迫った。Kimi K3は、エージェント型および自動化タスクで特に優れた性能を発揮し、自動化ではFable 5を上回った。幻覚率はK2バージョン(51%)と比較して有意に増加したが、Fable 5(55%)やGPT-5.6 Sol(85%)はこの指標でさらに悪い結果だった。これは、DeepSeekが2025年1月にリリースされたことに続く、OpenAI、Google、Anthropicによる確立されたマルチモーダルAIへのもう一つの根本的な挑戦であり、米国のチップ輸出規制にもかかわらず、オープンソースモデルが西側の最先端モデルと競争できることを示唆している。
出典: Heise online —
原文
