Mistral AI、Leanstral 1.5をリリース:形式検証で記録的な成果を挙げる無料モデル
Mistral
OpenAI
Mistral AIは、総パラメータ119B(活性化時6B)のApache-2.0ライセンスの無料モデルLeanstral 1.5をリリースし、形式検証で最先端の成果を達成しました。miniF2Fベンチマークを飽和させ、PutnamBenchの問題587/672を解決し、FATE-H(87%)とFATE-X(34%)で新記録を樹立しました。また、オープンソースリポジトリで実際のバグを発見しました。
Mistral AIは、総パラメータ数119B、アクティブパラメータ数わずか6BのApache-2.0ライセンスのフリーモデル「Leanstral 1.5」をリリースしました。形式検証において大幅な性能向上を実現し、miniF2Fを飽和させ、PutnamBenchの672問題中587問を解決、FATE-H(87%)とFATE-X(34%)で最先端の結果を達成しました。学習には、中間学習、教師ありファインチューニング、および2つのRL環境(Leanコンパイラフィードバックを用いた定理証明のためのマルチターン環境と、生のファイルシステムで開発者のように動作するコードエージェント環境)でのCISPOを用いた強化学習が含まれています。Leanstral 1.5は強力なテスト時スケーリングを示し、PutnamBenchの性能は50,000トークンで44問解決から400万トークンで587問に向上しました。また、コード検証にも優れ、AVL木の時間計算量保証を証明し、テストした57のリポジトリでこれまで知られていなかった5つのバグを発見しました。このモデルは、Hugging Faceと無料のAPIエンドポイントを通じて完全にオープンソース化されています。
出典: Mistral AI —
原文
