-
Guardoc Health 使用 Amazon Nova 处理医疗文档
EN
AWS ML blog ·
27.07 20:03
-
快手新RL方法SRPO:训练效率比GRPO提升10倍用于大模型训练
EN
Synced ·
27.07 18:04
-
GSPO:用于语言模型的可扩展强化学习
ZH
Alibaba Qwen ·
27.07 17:05
-
word2vec 究竟学到了什么?研究者终于有了精确的训练理论
EN
BAIR (Berkeley AI) ·
27.07 17:04
-
无需时序差分学习的强化学习:一种新的“分而治之”算法
EN
BAIR (Berkeley AI) ·
27.07 17:04