Moonshot AI

Neueste KI-Nachrichten, Modelle und Releases von Moonshot AI. ['GLM-5.2', 'Hermes', 'K3', 'K3-mini', 'K3-MoE', 'Kimi', 'Kimi 2.6', 'Kimi-2.6', 'Kimi 3', 'Kimi 3T', 'Kimi Hosted Agent', 'Kimi k1.5', 'Kimi K1.5', 'Kimi K2', 'Kimi K2.5', 'Kimi-K2.5-1T-A32B', 'Kimi K2.6', 'Kimi K2.7', 'Kimi K2.7 Code', 'Kimi K2 Thinking', 'Kimi K3', 'Kimi K3.5', 'Kimi K5', 'Kimi Linear', 'Kivine', 'Mamba', 'Mamba-2', 'Mamba-3', 'MiniCPM-RobotManip', 'MiniCPM-RobotTrack', 'Minimax', 'Ornith‑1.0‑35B', 'Qwen3-0.6B', 'Qwen3-30B-A3B', 'Qwen3-4B-Instruct-2507', 'qwen3.5-9b', 'Strands Agents', 'модель с триллионом параметров']

Modelle 🇷🇺

Wie Kimi K3 funktioniert: 2,8 Billionen Parameter, lineare Aufmerksamkeit und Agenten mit Millionen Tokens

Moonshot AI hat die Gewichte seines Kimi-K3-Modells veröffentlicht, einem multimodalen Modell, das auf einer Mixture-of-Experts-Architektur mit 2,8 Billionen Parametern basiert, von denen 104 Milliarden pro Token aktiviert werden. In bestimmten Programmier- und Tool-Nutzungs-Benchmarks übertrifft das Modell die Konkurrenz, bleibt aber im Durchschnitt hinter einigen davon zurück.

Moonshot AIMoonshot AI AnthropicAnthropic OpenAIOpenAI
Habr — хаб ИИ27.07 · 23:03
Forschung 🇺🇸

Verwaltung von Reasoning-Stufen in großen Sprachmodellen

Sebastian Raschka erklärt, wie Reasoning-Modi unterschiedlicher Komplexität (niedrig, mittel, hoch) in großen Sprachmodellen funktionieren. Er diskutiert Methoden des bestärkenden Lernens mit überprüfbaren Belohnungen sowie Mechanismen zum Wechsel zwischen den Modi, einschließlich Ansätze, die in Modellen wie DeepSeek-R1, Qwen3 und GPT-5.6 verwendet werden.

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka27.07 · 20:04
Aktuelle Nachrichten