研究 🇷🇺 05.08.2026 04:05

几乎未经训练的神经网络:什么是储层计算

Intel CorporationIntel Corporation
储层计算是一种非常规的机器学习方法,其中大部分网络权重是随机生成的,且从不修改,仅训练输出层。这种方法避免了递归神经网络中的梯度消失或梯度爆炸问题,并能实现极快的训练速度。文章解释了其架构、回声状态特性以及应用,还指出像一桶水这样的物理系统也可以充当储层。
在机器学习中,标准做法是通过反向传播训练所有网络权重。储层计算则颠覆了这一做法:大部分权重是随机且固定的,仅训练输出层。这是出于训练循环神经网络(RNN)时由于梯度消失和爆炸而难以捕捉长期依赖的考虑。储层计算通过不向循环权重传播梯度,完全规避了这一问题。其架构包括一个随机输入矩阵、一个大型随机循环储层以及一个可训练的输出层。储层状态更新为 x(t) = tanh(W*x(t-1) + W_in*u(t)),输出为 y(t) = W_out*x(t)。通过岭回归训练 W_out,只需解一个方程,其速度比训练长短期记忆网络(LSTM)快几个数量级。关键条件是回波状态属性,通过将储层权重矩阵的谱半径设为小于1来保证。储层将输入投影到高维空间,使得模式在该空间中变得线性可分。储层计算在2001年由Herbert Jaeger作为回声状态网络,以及2002年由Wolfgang Maass作为液态状态机分别独立提出;'储层计算'这一术语后来在2005-2007年间被创造。物理储层,比如一桶水,也已被演示。其应用包括混沌系统预测、嵌入式设备上的语音识别以及机器人控制。局限性包括需手动调整储层大小和谱半径,以及与变换器相比,在非常长的依赖关系上表现不佳。近年来,储层计算不再那么突出,但在物理人工智能和类脑系统(如Intel Loihi 2)中仍具有相关性。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻