Texte & documents
Nombres & calcul
Données & formats
Sécurité
Développement & DevOps
Intelligence artificielle
Finances
Santé et bien-être
Productivité
Jeux et divertissement
Multimédia & design
Entreprise
Guide d'utilisation
Ce que c'est et à quoi ça sert

La régression cherche la courbe qui passe le mieux à travers un nuage de points, pour pouvoir prédire la valeur y à partir d'un x. Chaque point est une observation (par exemple, heures d'étude → note) ; la courbe ajustée résume la tendance et vous permet d'estimer le y d'un x que vous n'aviez pas mesuré. Vous le voyez ici en direct : déplacez les points et la courbe, l'erreur et le R² se recalculent instantanément, tout dans votre navigateur.

Comment l'utiliser (étape par étape)

1. Faites glisser n'importe quel point pour le déplacer ; la courbe se réajuste quand vous relâchez.
2. Cliquez dans un espace vide du graphique pour ajouter un nouveau point.
3. Déplacez le contrôle Degré pour passer d'une droite à une courbe, et Régularisation λ pour la lisser.
4. Lisez en bas le MSE et le R² de l'ajustement.
5. Boutons : Retirer le dernier efface le dernier point, Vider les efface tous et Réinitialiser revient à l'exemple initial (10 points, degré 1, λ 0).

Régression linéaire (la droite)

Avec le Degré 1, l'ajustement est une droite y = a·x + b : la régression linéaire classique. C'est le modèle le plus simple et robuste : il capte la tendance générale (si y monte ou descend quand x augmente, et avec quelle pente) sans se laisser emporter par le bruit de chaque point. Commencez toujours par là ; n'augmentez le degré que si la droite ne suit clairement pas la forme des données.

Moindres carrés (comment l'ajustement se fait)

La courbe est choisie par moindres carrés : on cherche celle qui rend minimale la somme des erreurs au carré entre chaque point et la courbe (les résidus). On les élève au carré pour que les erreurs par excès et par défaut ne s'annulent pas et pour pénaliser davantage les grandes erreurs. En interne, un système linéaire exact est résolu (équations normales), pas par tâtonnement. Minimiser cette erreur équivaut au maximum de vraisemblance (MLE) si l'on suppose que le bruit des données est gaussien.

Degré du polynôme et surapprentissage

Le Degré (de 1 à 7) est le nombre de courbures que peut prendre le polynôme : degré 1 = droite, 2 = parabole, et plus le degré est élevé, plus il y a d'ondulations. Un degré élevé réduit l'erreur sur ces points mais empire généralement : surapprentissage (overfitting), c'est-à-dire qu'il passe presque par tous les points en poursuivant le bruit puis généralise mal à de nouvelles données. C'est l'équilibre biais-variance : trop simple ne capte pas la forme, trop complexe mémorise le bruit. Choisissez le degré le plus bas qui suit la tendance.

Résidus, MSE et R²

Les lignes grises verticales sont les résidus : la distance de chaque point à la courbe, c'est-à-dire l'erreur que commet le modèle à ce point.

• MSE (loss) — erreur quadratique moyenne : la moyenne de ces résidus au carré. Plus bas = meilleur ajustement ; c'est exactement ce que minimise l'ajustement.
• R² — coefficient de détermination : quelle fraction de la variation de y le modèle explique. Va de 0 à 1 : 1 = la courbe passe par tous les points, 0 = n'améliore pas la prédiction de la moyenne (et peut être négatif si l'ajustement est pire que la moyenne elle-même).

Erreur avec des données non vues

Le MSE mesure à quel point la courbe apprend ses propres points, et avec un degré plus élevé, il baisse toujours. L'erreur avec des données non vues mesure ce qui compte : à quel point elle devine un nouveau point. Elle se calcule en laissant chaque point de côté, en ajustant sans lui et en voyant à quel point la prédiction se trompe pour lui (validation croisée « leave-one-out »). Avec les données d'exemple : degré 1 → 0,36 ; degré 7 → 25,7, même si son MSE est plus bas. Quand l'un baisse et l'autre monte, c'est du surapprentissage ; augmente λ et tu verras comment ça le freine.

L'équation et la prédiction

En haut à droite se trouve l'équation de la courbe ajustée : avec un degré 1, y = a·x + b. Ces coefficients sont tout ce que le modèle a appris à partir des points ; entraîner, c'est les chercher, et c'est pourquoi ils changent pendant que tu fais glisser.

Le contrôle Prédire en x consiste à utiliser le modèle : choisis un x et lis le y que donne la courbe (le point vert). Si tu l'emmènes en dehors de la plage des données, tu es en train d'extrapoler : avec un degré 1, la droite reste raisonnable ; avec un degré 7, la courbe s'envole sur les bords, et c'est la façon la plus directe de voir pourquoi un modèle qui s'ajuste à merveille à ses données peut prédire terriblement mal.

Régularisation λ (ridge = MAP)

La Régularisation λ (de 0 à 10) combat le surapprentissage sans réduire le degré : elle pénalise les poids élevés du polynôme (ridge), ce qui lisse la courbe et la rend moins sensible au bruit. Avec λ = 0, c'est le moindres carrés pur ; en augmentant λ, la courbe s'aplatit et tend vers une droite. Cela équivaut à ajouter un prior gaussien sur les poids : en termes bayésiens, on passe du MLE au MAP. La pénalisation n'affecte pas le terme indépendant (ordonnée à l'origine).

Régression et MLEMoindres carrés, surapprentissage, ridge
Régression et MLEAjustement par moindres carrés, surapprentissage et régularisation (ridge = MAP)
02468100246810xy

Passe le curseur sur le graphique pour lire ses coordonnées.Touche le graphique ou un point pour lire ses coordonnées.

Fais glisser les points. Clique dans un espace vide pour ajouter un point. Les lignes grises sont les résidus (l'erreur de chaque point).

Pour déplacer la vue, fais glisser avec le bouton droit ou la molette enfoncée (sur un écran tactile, maintiens appuyé et fais glisser). La molette permet de zoomer et dézoomer.

Fais glisser les points. Un tap sur un espace vide ajoute un point. Les lignes grises sont les résidus (l'erreur de chaque point).

Pour déplacer la vue, maintiens appuyé un instant et fais glisser. Les boutons du haut permettent de zoomer, dézoomer et cadrer.

y = 0,687·x + 1,658

Degré
1
Régularisation λ
0
Prédire en x
5
Prédictionx = 5 → y = 5,094
MSE (loss)0,236
R²0,942
Erreur avec des données non vues0,363

Minimiser le MSE = maximum de vraisemblance avec bruit gaussien (MLE). Augmenter le degré surajuste les données bruitées ; λ (ridge) équivaut à un prior gaussien sur les poids → MAP. C'est l'équilibre biais-variance.