Adam Optimizer Explorer (vs SGD) next

Adam Optimizer Explorer 2D Quadratic

Visual comparison of Adam vs SGD on an anisotropic noisy quadratic surface. Adjust learning rate, momentum (β1), variance decay (β2), and noise to see trajectory and loss curves.

Parameters

\( \begin{aligned} m_t &= \beta_1 m_{t-1} + (1-\beta_1) g_t,\\ v_t &= \beta_2 v_{t-1} + (1-\beta_2) g_t^{2},\\ \hat m_t &= \frac{m_t}{1-\beta_1^{t}},\quad \hat v_t = \frac{v_t}{1-\beta_2^{t}},\\ heta_{t+1} &= \theta_t - \alpha \frac{\hat m_t}{\sqrt{\hat v_t}+\varepsilon} \end{aligned} \)
Tip: Large curvature ratio makes one direction steep → plain SGD oscillates; Adam adapts step sizes more effectively.

Trajectory

Adam Path SGD Path Start End

Loss Curves

Final Adam Loss: {{adam.loss[adam.loss.length-1] | number:5}}
Final SGD Loss: {{sgd.loss[sgd.loss.length-1] | number:5}}
Adam Steps: {{adam.x.length}}
SGD Steps: {{sgd.x.length}}

Explanation