Texto y documentos
Números y cálculo
Datos y formatos
Seguridad
Desarrollo y DevOps
Inteligencia Artificial
Finanzas
Salud y bienestar
Productividad
Juegos y entretenimiento
Multimedia y diseño
Empresa
Guía de uso
Qué es y para qué sirve

La regresión busca la curva que mejor pasa por una nube de puntos, para poder predecir el valor y a partir de un x. Cada punto es una observación (por ejemplo, horas de estudio → nota); la curva ajustada resume la tendencia y te deja estimar la y de una x que no habías medido. Aquí lo ves en vivo: mueves puntos y la curva, el error y el R² se recalculan al instante, todo en tu navegador.

Cómo se usa (paso a paso)

1. Arrastra cualquier punto para moverlo; la curva se reajusta al soltar.
2. Haz clic en un hueco del gráfico para añadir un punto nuevo.
3. Mueve el control Grado para pasar de recta a curva, y Regularización λ para suavizarla.
4. Lee abajo el MSE y el R² del ajuste.
5. Botones: Quitar último borra el último punto, Vaciar los borra todos y Reiniciar vuelve al ejemplo inicial (10 puntos, grado 1, λ 0).

Regresión lineal (la recta)

Con Grado 1 el ajuste es una recta y = a·x + b: la regresión lineal clásica. Es el modelo más simple y robusto: capta la tendencia general (si al crecer x sube o baja y, y con qué pendiente) sin dejarse llevar por el ruido de cada punto. Empieza siempre por aquí; sube el grado solo si la recta claramente no sigue la forma de los datos.

Mínimos cuadrados (cómo se ajusta)

La curva se elige por mínimos cuadrados: se busca la que hace mínima la suma de los errores al cuadrado entre cada punto y la curva (los residuos). Se elevan al cuadrado para que los errores por arriba y por abajo no se cancelen y para penalizar más los grandes. Internamente se resuelve un sistema lineal exacto (ecuaciones normales), no por tanteo. Minimizar ese error equivale a la máxima verosimilitud (MLE) si se asume que el ruido de los datos es gaussiano.

Grado del polinomio y sobreajuste

El Grado (de 1 a 7) es cuántas curvas puede hacer el polinomio: grado 1 = recta, 2 = parábola, y a más grado, más ondulaciones. Un grado alto reduce el error sobre estos puntos pero suele empeorar: sobreajusta (overfitting), es decir, pasa casi por todos los puntos persiguiendo el ruido y luego generaliza mal a datos nuevos. Es el equilibrio sesgo-varianza: demasiado simple no capta la forma, demasiado complejo memoriza el ruido. Elige el grado más bajo que siga la tendencia.

Residuos, MSE y R²

Las líneas grises verticales son los residuos: la distancia de cada punto a la curva, o sea el error que comete el modelo en ese punto.

• MSE (loss) — error cuadrático medio: el promedio de esos residuos al cuadrado. Más bajo = mejor ajuste; es exactamente lo que el ajuste minimiza.
• R² — coeficiente de determinación: qué fracción de la variación de y explica el modelo. Va de 0 a 1: 1 = la curva pasa por todos los puntos, 0 = no mejora a predecir siempre la media (y puede salir negativo si ajusta peor que la propia media).

Error con datos no vistos

El MSE mide lo bien que la curva se aprende sus puntos, y con más grado siempre baja. El error con datos no vistos mide lo que importa: lo bien que adivina uno nuevo. Se calcula dejando cada punto fuera, ajustando sin él y viendo cuánto falla al predecirlo (validación cruzada «dejando uno fuera»). Con los datos de ejemplo: grado 1 → 0,36; grado 7 → 25,7, aunque su MSE sea más bajo. Cuando uno baja y el otro sube, es sobreajuste; sube λ y verás cómo lo frena.

La ecuación y la predicción

Arriba a la derecha tienes la ecuación de la curva ajustada: con grado 1, y = a·x + b. Esos coeficientes son todo lo que el modelo ha aprendido de los puntos; entrenar es buscarlos, y por eso cambian mientras arrastras.

El control Predecir en x es usar el modelo: elige una x y lee la y que da la curva (el punto verde). Si la llevas fuera del rango de los datos, estás extrapolando: con grado 1 la recta sigue razonable; con grado 7 la curva se dispara en los bordes, y es la forma más directa de ver por qué un modelo que se ajusta de maravilla a sus datos puede predecir fatal.

Regularización λ (ridge = MAP)

La Regularización λ (de 0 a 10) combate el sobreajuste sin bajar el grado: penaliza los pesos grandes del polinomio (ridge), lo que suaviza la curva y la hace menos sensible al ruido. Con λ = 0 es mínimos cuadrados puro; al subir λ, la curva se aplana y tiende hacia una recta. Equivale a añadir un prior gaussiano sobre los pesos: en términos bayesianos, pasas de MLE a MAP. La penalización no afecta al término independiente (intercepto).

Regresión y MLEMínimos cuadrados, overfitting, ridge
Regresión y MLEAjuste por mínimos cuadrados, overfitting y regularización (ridge = MAP)
02468100246810xy

Pasa el cursor por el gráfico para leer sus coordenadas.Toca el gráfico o un punto para leer sus coordenadas.

Arrastra los puntos. Clic en un hueco añade un punto. Las líneas grises son los residuos (error de cada punto).

Para mover la vista, arrastra con el botón derecho o la rueda pulsada (en pantalla táctil, mantén pulsado y arrastra). La rueda acerca y aleja.

Arrastra los puntos. Un toque en un hueco añade un punto. Las líneas grises son los residuos (error de cada punto).

Para mover la vista, mantén pulsado un momento y arrastra. Los botones de arriba acercan, alejan y encuadran.

y = 0,687·x + 1,658

Grado
1
Regularización λ
0
Predecir en x
5
Predicciónx = 5 → y = 5,094
MSE (loss)0,236
R²0,942
Error con datos no vistos0,363

Minimizar el MSE = máxima verosimilitud con ruido gaussiano (MLE). Subir el grado sobreajusta datos ruidosos; λ (ridge) equivale a un prior gaussiano sobre los pesos → MAP. Es el equilibrio sesgo-varianza.