Exemples en classe — Régression logistique

Jeu de données : Default (package ISLR) — défaut de paiement sur carte de crédit, en fonction du solde (balance), du revenu (income) et du statut étudiant (student).

1. Exploration visuelle

Avant d’ajuster quoi que ce soit, on aimerait visualiser les données pour se faire une idée de la relation entre le défaut et les variables explicatives. On peut représenter le défaut (0/1) en fonction du solde de carte de crédit, en coloriant selon le statut étudiant.

Discussion. Pourquoi une droite de régression linéaire simple serait-elle mal adaptée ici ? Que remplace-t-on par quoi dans un modèle logistique ?

2. Ajustement du modèle

À essayer en direct (modifier la cellule ci-dessous et réexécuter) :

  • Retirer income du modèle — est-ce que balance et student changent beaucoup ?
  • Remplacer family = binomial par family = binomial(link = "probit") — les conclusions changent-elles ?

3. Interprétation des coefficients

Discussion — le piège de student. Comparez le signe du coefficient de studentYes ci-dessus avec ce qu’on obtient en ignorant balance :

Le signe change-t-il ? Comment l’expliquer à partir du graphique de la section 1 (indice : les étudiants ont-ils tendance à avoir des soldes plus élevés ou plus faibles) ?

4. Prédiction

Discussion. À solde égal, qui a la probabilité de défaut prédite la plus élevée ? Est-ce cohérent avec l’interprétation des coefficients de la section 3 ?

5. Classification et seuil

Discussion. Très peu de défauts sont correctement classés avec un seuil de 0.5 — pourquoi ? Quel compromis cela illustre-t-il (lien avec la section « Spécificité, sensibilité et courbe ROC » du chapitre) ?

À essayer en direct — changer le seuil ci-dessous et réexécuter :