DeepSeek 预告 R2 模型并推出新推理扩展方法 SPCT
DeepSeek 发布了一项研究,提出自我原则批评调优(SPCT)方法,旨在提升通用奖励模型在推理时的可扩展性。同时,该公司预告了其下一代模型 R2 即将发布,预计将基于纯强化学习方法。
DeepSeek
OpenAI
DeepSeek 发布了一项研究,提出自我原则批评调优(SPCT)方法,旨在提升通用奖励模型在推理时的可扩展性。同时,该公司预告了其下一代模型 R2 即将发布,预计将基于纯强化学习方法。
DeepSeek
OpenAI
Moonshot AI 发布了其 Kimi K3 模型的权重,这是一个基于混合专家架构的多模态模型,拥有 2.8 万亿参数,每个 token 激活 1040 亿参数。在某些编程和工具使用基准测试中,该模型优于竞争对手,但平均而言,它落后于其中一些模型。
Moonshot AI
Anthropic
OpenAI