-
现代大语言模型中注意力机制的视觉指南
EN
Sebastian Raschka ·
28.07 15:05
-
DeepSeek自研芯片再次激怒黄仁勋
ZH
DeepSeek (GNews) ·
28.07 13:03
-
StruQ和SecAlign:防御提示注入攻击
EN
BAIR (Berkeley AI) ·
27.07 17:06
-
超越标准大语言模型:线性注意力混合体、文本扩散、代码世界模型与小规模递归Transformer
EN
Sebastian Raschka ·
27.07 17:04
-
从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新
EN
Sebastian Raschka ·
27.07 17:03