La formule
Interpreter le resultat
Ce qui est considéré comme bon dépend entièrement du domaine. Les sciences physiques attendent couramment plus de 0,9 ; les modèles de comportement humain sont déjà bons au-dessus de 0,3. Un R² très élevé sur des données sociales est plus souvent un signe de surapprentissage que de pertinence.
Ou cela se complique. Le R² ne dit rien sur la spécification correcte du modèle. Le quartet d'Anscombe est constitué de quatre jeux de données aux statistiques de régression identiques et aux formes complètement différentes — le graphique des résidus montre ce que le R² ne peut pas révéler.
Cela dépend du domaine. Au-dessus de 0,7, c'est fort dans la plupart des contextes appliqués ; 0,3–0,5 est normal en sciences sociales ; et tout ce qui dépasse 0,95 sur des données réelles désordonnées mérite la méfiance.
Chaque fois que l'on compare des modèles comportant un nombre différent de prédicteurs, ce qui est le cas la plupart du temps en régression multiple. Le R² simple favorise toujours le modèle le plus grand.
Comment calculer
Le R² est la proportion de la variation de la variable expliquée par un modèle. Un R² de 0,61 signifie que le modèle explique 61 % de la variance et laisse 39 % inexpliqués.
L'ajout de prédicteurs ne peut jamais faire baisser le R², même lorsqu'il s'agit de pur bruit. Le R² ajusté pénalise chaque variable supplémentaire, de sorte qu'il peut diminuer — c'est ce qui en fait la bonne mesure pour comparer des modèles de tailles différentes.