Moonshot AI

Tin tức, mô hình và bản phát hành AI mới nhất từ Moonshot AI. ['GLM-5.2', 'Hermes', 'K3', 'K3-mini', 'K3-MoE', 'Kimi', 'Kimi 2.6', 'Kimi-2.6', 'Kimi 3', 'Kimi 3T', 'Kimi Hosted Agent', 'Kimi k1.5', 'Kimi K1.5', 'Kimi K2', 'Kimi K2.5', 'Kimi-K2.5-1T-A32B', 'Kimi K2.6', 'Kimi K2.7', 'Kimi K2.7 Code', 'Kimi K2 Thinking', 'Kimi K3', 'Kimi K3.5', 'Kimi K5', 'Kimi Linear', 'Kivine', 'Mamba', 'Mamba-2', 'Mamba-3', 'MiniCPM-RobotManip', 'MiniCPM-RobotTrack', 'Minimax', 'Ornith‑1.0‑35B', 'Qwen3-0.6B', 'Qwen3-30B-A3B', 'Qwen3-4B-Instruct-2507', 'qwen3.5-9b', 'Strands Agents', 'модель с триллионом параметров']

Mô hình 🇷🇺

Cách Kimi K3 hoạt động: 2,8 nghìn tỷ tham số, chú ý tuyến tính và tác nhân triệu token

Moonshot AI đã phát hành trọng số của mô hình Kimi K3, một mô hình đa phương thức dựa trên kiến trúc Hỗn hợp chuyên gia (Mixture of Experts) với 2,8 nghìn tỷ tham số, trong đó 104 tỷ được kích hoạt mỗi token. Trong một số điểm chuẩn về lập trình và sử dụng công cụ, mô hình vượt trội hơn đối thủ, nhưng trung bình lại tụt hậu so với một số đối thủ.

Moonshot AIMoonshot AI AnthropicAnthropic OpenAIOpenAI
Habr — хаб ИИ27.07 · 23:03
Nghiên cứu 🇺🇸

Managing Reasoning Levels in Large Language Models

Sebastian Raschka explains how reasoning modes of varying complexity (low, medium, high) work in large language models. He discusses reinforcement learning methods with verifiable rewards, as well as mechanisms for switching between modes, including approaches used in models like DeepSeek-R1, Qwen3, and GPT-5.6.

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka27.07 · 20:04
Tin mới