Moonshot AI

Dernières actualités, modèles et sorties d'IA de Moonshot AI. ['GLM-5.2', 'Hermes', 'K3', 'K3-mini', 'K3-MoE', 'Kimi', 'Kimi 2.6', 'Kimi-2.6', 'Kimi 3', 'Kimi 3T', 'Kimi Hosted Agent', 'Kimi k1.5', 'Kimi K1.5', 'Kimi K2', 'Kimi K2.5', 'Kimi-K2.5-1T-A32B', 'Kimi K2.6', 'Kimi K2.7', 'Kimi K2.7 Code', 'Kimi K2 Thinking', 'Kimi K3', 'Kimi K3.5', 'Kimi K5', 'Kimi Linear', 'Kivine', 'Mamba', 'Mamba-2', 'Mamba-3', 'MiniCPM-RobotManip', 'MiniCPM-RobotTrack', 'Minimax', 'Ornith‑1.0‑35B', 'Qwen3-0.6B', 'Qwen3-30B-A3B', 'Qwen3-4B-Instruct-2507', 'qwen3.5-9b', 'Strands Agents', 'модель с триллионом параметров']

Modèles 🇷🇺

Comment fonctionne Kimi K3 : 2,8 billions de paramètres, attention linéaire et agents à un million de jetons

Moonshot AI a publié les poids de son modèle Kimi K3, un modèle multimodal basé sur une architecture de mélange d'experts avec 2,8 billions de paramètres, dont 104 milliards sont activés par jeton. Dans certains benchmarks de programmation et d'utilisation d'outils, le modèle surpasse ses concurrents, mais en moyenne, il est en retard par rapport à certains d'entre eux.

Moonshot AIMoonshot AI AnthropicAnthropic OpenAIOpenAI
Habr — хаб ИИ27.07 · 23:03
Recherche 🇺🇸

Gestion des niveaux de raisonnement dans les grands modèles de langage

Sebastian Raschka explique comment les modes de raisonnement de complexité variable (faible, moyenne, élevée) fonctionnent dans les grands modèles de langage. Il aborde les méthodes d'apprentissage par renforcement avec récompenses vérifiables, ainsi que les mécanismes de basculement entre les modes, y compris les approches utilisées dans des modèles comme DeepSeek-R1, Qwen3 et GPT-5.6.

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka27.07 · 20:04
Infos fraîches