Liquid AI、オープンウェイト双方向エンコーダ LFM2.5-Encoder-230M および 350M をリリース
Liquid AI
Liquid AI は、LFM2 ハイブリッドバックボーンをベースにした 2 つのオープンウェイト双方向エンコーダ、LFM2.5-Encoder-230M と 350M をリリースしました。これらは 8,192 トークンのコンテキストを備えています。350M モデルは 17 タスクで 14 モデル中 4 位にランクインし、XLM-R XL などの大規模モデルを上回っています。両エンコーダは CPU 展開に最適化されており、230M モデルは 8K コンテキストで ModernBERT-base よりも大幅に高速です。
Liquid AIは、LFM2ハイブリッドバックボーンに基づく2つのオープンウェイト双方向エンコーダ、LFM2.5-Encoder-230MとLFM2.5-Encoder-350Mをリリースしました。両モデルは8,192トークンのコンテキストをサポートします。これらはLFM2.5デコーダバックボーンから、causal attentionを双方向に置き換え、短い畳み込みを非因果的にし、30%のマスク言語モデリング目的でトレーニングすることで変換されました。トレーニングは2段階で行われました。最初に1,024トークンで一般的な言語能力を獲得し、その後コンテキストを8,192トークンに拡張しました。350Mモデルは17タスクの平均スコア81.02を達成し、14モデル中4位となりました。これはXLM-R XL(3.5B)、ModernBERT-large(395M)、XLM-R large(560M)に次ぐものです。230Mモデルは79.29を達成し、ModernBERT-baseおよびすべてのEuroBERTモデルを上回りました。CPUで8Kトークンを処理する場合、230Mモデルは1回のフォワードパスに約28秒かかり、ModernBERT-baseの90秒以上を大きく下回ります。エンコーダはエッジデバイス、規制対象のオンプレミスシステム、および大量処理パイプラインを対象としています。これらは、trust_remote_code=Trueを指定してtransformersを通じてロードし、ファインチューニングが必要です。また、Liquid AIはHugging Face Spaces上に5つのCPU専用デモを提供しています。
出典: MarkTechPost —
原文
