Robocikowo>ROBOCIKOWO
Trening

Ridge

1970AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Metoda regresji liniowej z regularyzacją L2 (kara na kwadrat normy współczynników), która ogranicza przeuczenie i stabilizuje estymację przy współliniowości cech.
Kluczowa innowacja
Wprowadzenie kary L2 na wielkość współczynników do regresji liniowej, co pozwoliło uzyskać stabilne, obciążone estymatory nawet przy współliniowości i macierzy XᵀX bliskiej osobliwości.
Kategoria
Trening
Poziom abstrakcji
Building block
Poziom operacji
TreningModel
Zastosowania
Regresja z współliniowymi cechamiProblemy źle postawione i odwrotneDane wielowymiarowe (p > n)Stabilizacja modeli liniowychWygładzanie w statystyce i ekonometriiBaseline w uczeniu maszynowym

Jak działa

Do funkcji straty najmniejszych kwadratów dodaje się człon kary α·Σwⱼ². Optymalizacja tego celu prowadzi do zmodyfikowanych równań normalnych, których rozwiązanie zamknięte to ŵ = (XᵀX + αI)⁻¹Xᵀy. Dodanie αI „podnosi grzbiet” (stąd nazwa) na diagonali macierzy XᵀX, gwarantując jej odwracalność i lepsze uwarunkowanie. Parametr α steruje kompromisem: dla α→0 estymator dąży do OLS, dla dużego α współczynniki są silnie kurczone w kierunku zera. Cechy powinny być wystandaryzowane, bo kara zależy od skali; wyrazu wolnego (intercept) zwykle się nie karze. Optymalne α dobiera się walidacją krzyżową (np. RidgeCV, uogólniona walidacja krzyżowa GCV).

Rozwiązany problem

Zwykła metoda najmniejszych kwadratów (OLS) daje estymatory o dużej wariancji, gdy cechy są silnie skorelowane (współliniowość) lub gdy macierz XᵀX jest bliska osobliwości bądź nieodwracalna (np. gdy liczba cech przekracza liczbę obserwacji). Prowadzi to do niestabilnych, przeuczonych modeli. Ridge rozwiązuje ten problem przez regularyzację L2, która stabilizuje odwracanie macierzy i ogranicza przeuczenie.

Komponenty

Linear modelPredyktor

Parametryczny predyktor liniowy ŷ = Xw, którego współczynniki są estymowane z regularyzacją.

INMacierz cech: n obserwacji, d cech.
OUTWektor predykcji.
L2 penalty termRegularyzator

Człon regularyzacyjny karzący kwadrat normy euklidesowej współczynników, kurczący je w kierunku zera.

L1 penalty (Lasso)Kara L1 dająca rozwiązania rzadkie (zerowanie współczynników).
Elastic NetKombinacja kar L1 i L2.

Oficjalna

Closed-form estimatorEstymator

Rozwiązanie zmodyfikowanych równań normalnych ŵ = (XᵀX + αI)⁻¹Xᵀy.

Oficjalna

Implementacja

Pułapki implementacyjne
Brak standaryzacji cechWysoka

Kara L2 zależy od skali cech; bez standaryzacji cechy o dużych wartościach są słabiej regularyzowane.

Rozwiązanie:Wystandaryzuj cechy (średnia 0, wariancja 1) przed dopasowaniem.
Karanie wyrazu wolnegoŚrednia

Włączenie interceptu do kary wprowadza błąd zależny od przesunięcia celu.

Rozwiązanie:Wyłącz intercept z regularyzacji.
Zły dobór parametru αWysoka

Zbyt małe α nie ogranicza przeuczenia, zbyt duże powoduje niedouczenie.

Rozwiązanie:Dobierz α walidacją krzyżową (RidgeCV / GCV).

Ewolucja

Oryginalny paper · 1970 · Technometrics, 12(1), 55–67 · Arthur E. Hoerl
Ridge Regression: Biased Estimation for Nonorthogonal Problems
Arthur E. Hoerl, Robert W. Kennard
1963
Regularyzacja Tichonowa
Punkt przełomowy

Andriej Tichonow formułuje metodę regularyzacji problemów źle postawionych — matematyczny odpowiednik Ridge.

1970
Hoerl & Kennard formalizują Ridge Regression
Punkt przełomowy

Dwa artykuły w Technometrics wprowadzają regresję grzbietową w statystyce i jej zastosowania do problemów nieortogonalnych.

1996
Lasso (kara L1) jako alternatywa

Robert Tibshirani wprowadza Lasso, dające rozwiązania rzadkie — kontrast dla proporcjonalnego kurczenia Ridge.

2005
Elastic Net łączy L1 i L2

Zou i Hastie łączą kary L1 i L2, godząc rzadkość Lasso ze stabilnością Ridge.

Hiperparametry (konfigurowalne osie)

Siła regularyzacji (α / λ)Krytyczna

Nieujemny współczynnik kary L2; kontroluje kompromis obciążenie–wariancja. α→0 zbliża do OLS, duże α silnie kurczy współczynniki.

0.1 – 1.0Typowy zakres startowy przy wystandaryzowanych cechach.
logspace(-6, 6)Siatka do walidacji krzyżowej (RidgeCV).
SolverŚrednia

Algorytm rozwiązania: dekompozycja SVD/Cholesky, lsqr, sparse_cg, sag/saga, lbfgs.

Standaryzacja cechWysoka

Ridge nie jest niezmiennicza względem skali cech; standaryzacja jest zwykle konieczna dla sensownej regularyzacji.

Dopasowanie wyrazu wolnegoNiska

Czy dopasować i (zwykle) nie karać wyrazu wolnego.

Złożoność obliczeniowa

Złożoność czasowa: O(n · d²). Złożoność przestrzenna: O(d²).

Wąskie gardło obliczeniowe

Odwracanie / faktoryzacja macierzy (XᵀX + αI)

Głównym kosztem jest rozwiązanie układu równań normalnych z regularyzowaną macierzą d×d.

Paradygmat wykonania

Tryb główny
Gęsty

Wszystkie współczynniki są aktywne w każdej predykcji; brak routingu czy warunkowej aktywacji.

Wzorzec aktywacji
Wszystkie ścieżki aktywne

Równoległość

Poziom równoległości
W pełni równoległy

Operacje gęstej algebry liniowej (mnożenie macierzy, faktoryzacja, iloczyn skalarny przy predykcji) dobrze się zrównoleglają w bibliotekach BLAS/LAPACK.

Zakres
TreningInferencja

Wymagania sprzętowe

Podstawowe

Algorytm oparty na podstawowej algebrze liniowej działa na dowolnym sprzęcie.

Dobry fit

Dla małych i średnich zbiorów CPU z BLAS/AVX jest w pełni wystarczające.

Możliwe

GPU przyspiesza operacje macierzowe przy bardzo dużych danych.