モデルエージェント 🇷🇺 28.07.2026 07:03

Kimi K3 を PAC1 と ECOM1 でテスト:204 タスクの結果と失敗分析

Moonshot AIMoonshot AI
Moonshot AI は 7 月に Kimi K3 をオープンソース化しました。このモデルは 2 つの BitGN ベンチマーク(PAC1 と ECOM1)上で 204 のオープントレースを用いてテストされました。結果は、単純な検索や計算では強いパフォーマンスを示す一方、複数ファイルにわたるアトミック操作、信頼できない入力のチェック、長いテーブルの一貫性において頻繁に失敗することが示されました。
Moonshot AIは、7月27日にKimi K3のオープンウェイトを公開し、テクニカルレポートも発表した。性能を独自に検証するため、同モデルを2つのBitGNタスクセット、すなわちPAC1(文書、請求書、受信箱、バッチファイル変更)とECOM1(カタログ、在庫、カート、決済、返品、物流)で実行した。PAC1では104点中61点(二値評価)、ECOM1では100点中44.75点(部分点評価)を獲得した。204件のオープントレースにより、すべてのコマンドと状態変化を検査できる。PAC1では、単純な検索と算術タスクで90〜92%の成功率を達成したが、三つの主要な障害モードが明らかになった:厳密なスキーマの違反(類似しているが誤ったフィールド名を書き込む)、非原子的なバッチ操作(完全なセット検証前の部分的なファイル変更)、および非ブロッキングな信頼できない入力チェック(危険なコンテンツを検出したが、アクションが実行されたまま)。ECOM1では、正確なSKU検索と標準的なチェックアウトは良好に機能したが、障害モードとして、複数行レポートにおける行間の状態喪失、過剰な異常フラグ付け、プライベートデータ読み取り前のアイデンティティチェックの欠如、信頼できない入力による状態変化が見られた。最適化タスク(ディスパッチスケジューリング)では、実現可能だが準最適な計画を提供した。他の公開BitGN実行との比較では、Kimi K3は単純なタスクでは競争力があるが、複雑な多段階制約では劣ることが示された。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース