-
梯度下降(Gradient Descent):
- 基本思想:通过计算损失函数的梯度,沿着负梯度方向更新参数,以减少损失。
- 公式:[ \theta = \theta - \eta \nabla\theta J(\theta) ] (\theta) 是参数,(\eta) 是学习率,(\nabla\theta J(\theta)) 是损失函数的梯度。
-
随机梯度下降(Stochastic Gradient Descent,SGD):
- 基本思想:使用小批量数据来计算梯度,减少计算量,适合处理大规模数据。
- 公式:[ \theta = \theta - \eta \cdot \frac{1}{m} \sum{i=1}^{m} \nabla\theta J(\theta; x_i, y_i) ] (m) 是小批量数据的大小。
-
Adam优化器(Adam,Adaptive Moment Estimation):
- 基本思想:结合动量和指数移动平均,结合了参数的自适应学习率,适用于大规模数据集。
- 公式:[ m_t = \beta2 m{t-1} + (1 - \beta_2) \nabla J(\theta; x_t) ] [ v_t = \beta1 v{t-1} + (1 - \beta_1) \nabla J(\theta; x_t) ] [ \theta = \theta - \frac{\eta m_t}{\sqrt{v_t} + \epsilon} ] (\beta_1) 和 (\beta_2) 是动量系数,(\epsilon) 是防止除以零的微调项。
-
Momentum优化器:
- 基本思想:结合了动量法,降低随机梯度下降的震荡性,加快收敛速度。
- 公式:[ vt = \beta v{t-1} + g_t ] [ \theta = \theta - \eta v_t ] (v_t) 是动量项。
-
AdamW优化器:
- 基本思想:结合了Adam优化器和权重衰减(L2正则化),防止过拟合。
- 公式:[ m_t = \beta2 m{t-1} + (1 - \beta_2) \nabla J(\theta; x_t) ] [ v_t = \beta1 v{t-1} + (1 - \beta_1) \nabla J(\theta; x_t)^2 ] [ \text{权重更新} = \theta - \eta \frac{m_t}{\sqrt{v_t} + \epsilon} ] [ \beta = \beta_1 \cdot \frac{1}{1 + \gamma t} ] (\gamma) 是权重衰减的衰减速率。
-
Batch Normalization(BN):
- 基本思想:对批量数据进行标准化和归一化,加速网络收敛,减少过拟合。
- 公式:[ \mu = \frac{1}{m} \sum_{i=1}^{m} xi ] [ \sigma^2 = \frac{1}{m} \sum{i=1}^{m} (x_i - \mu)^2 ] [ Y_i = \gamma \frac{x_i - \mu}{\sigma} + \beta ]
-
Dropout:
- 基本思想:在神经网络的某些节点中随机失活,减少co Leiation。
- 公式:[ y_i = f(x_i) \cdot (1 - p) ] (p) 是保持节点节点的几率。
-
ResNet(残差网络):
- 基本思想:在残差网络中,保持每个节点的输出,直接连接到下一个节点,用于处理长距离依赖。
- 公式:[ h(x) = \sigma(b_1 \cdot h(x) + b_2 \cdot h(x-1) + ... + b_n \cdot h(x-k) + a \cdot x) ]
-
LSTM(长短期记忆网络):
- 基本思想:处理序列数据,通过记忆单元用于捕捉长距离依赖。
- 公式:[ h_t = \tanh(Wh h{t-1} + Uh h{t-2} + ... + Vh h{t-k} + W_s x_t + Us s{t-1} + ... + Vs s{t-k} + b) ]
-
GRU(长短期记忆单元):
- 基本思想:GRU是LSTM的一种简化版本,通过合并 forget gate和 update gate,减少参数数量。
- 公式:[ ht = \sigma(W h{t-1} + U h{t-2} + ... + V h{t-k} + b) ] [ ct = c{t-1} + \tanh(Wc h{t-1} + Uc h{t-2} + ... + Vc h{t-k} + b) ] [ ht = \tanh(W h{t-1} + U c_t + V b) ]
-
Attention Mechanism:
- 基本思想:在每个节点之间添加注意力机制,捕捉输入序列中的重要信息。
- 公式:[ \text{ attended} = \sum_{i=1}^{n} \text{softmax}(Q_i A_i K_i) V_i ] (Q_i) 和 (K_i) 是查询和键矩阵,(A_i) 是注意力矩阵。
-
Masking:
- 基本思想:在某些节点中添加掩码,限制注意力传播范围。
- 公式:[ \text{ attended} = \sum_{i=1}^{n} \text{mask}_i \cdot \text{softmax}(Q_i A_i K_i) V_i ]
-
Elm (Extreme Learning Machine):
- 基本思想:通过随机初始化权重,计算每个节点的输出,然后用线性回归模型进行预测。
- 公式:[ F_i(w) = w \cdot x_i ] [ y = FN(F{N-1}(\dots F_1(x))) ]
这些节点更新方法根据具体任务选择,不同方法在处理不同数据集时表现各异。
