library(FNN)
library(KernSmooth)
arbres <- read.csv("arbres.csv")STT-4300 — Régression II
Labo 1
Date11 mars 2026
SujetRégression non paramétrique : kNN et estimateur de noyau
Objectifs
- Implémenter et comparer l’estimateur des \(k\) plus proches voisins (\(k\)NN) et l’estimateur de noyau de Nadaraya-Watson.
- Comprendre, de façon empirique, le compromis biais-variance associé au choix de \(k\) et de la fenêtre \(h\).
- Sélectionner \(k\) et \(h\) par validation croisée et comparer les courbes ajustées obtenues.
Mise en contexte
On utilise le jeu de données arbres (télécharger), décrit dans les notes de cours : 200 arbres de l’inventaire forestier du Québec, tirés de donneesbleues.ca. La réponse \(Y\) est la hauteur (height_m, en m) et la variable explicative \(X\) est le diamètre à hauteur de poitrine (diameter_cm, en cm), comme dans le chapitre sur la régression non paramétrique.
Consignes
- Produire un nuage de points de la hauteur en fonction du diamètre et discuter brièvement pourquoi une relation linéaire semble inadéquate. Noter aussi deux particularités du jeu de données : plusieurs arbres ont exactement le même diamètre, et les gros arbres sont rares.
- À l’aide de
knn.reg(librairieFNN), ajuster l’estimateur kNN pour plusieurs valeurs de \(k\) (par exemple \(k = 2, 5, 9, 25, 60\)). Superposer les courbes ajustées au nuage de points et commenter l’effet de \(k\) sur la rugosité de la courbe et sur son comportement pour les gros arbres. - Utiliser le critère
PRESSdeknn.reg(LOOCV) pour sélectionner \(k_{\min}\). Comparer avec la valeur \(k_{\min} = 9\) obtenue dans les notes. Que se passe-t-il pour les diamètres ex æquo? - À l’aide de
locpoly(librairieKernSmooth,degree = 0), ajuster l’estimateur de Nadaraya-Watson pour plusieurs valeurs de la fenêtre \(h\) (en cm). Encore une fois, illustrer l’effet de \(h\) sur la courbe ajustée. - Choisir \(h\) par validation croisée (vous pouvez coder vous-même une boucle de LOOCV ou de \(K\)-fold CV, ou utiliser la formule explicite des notes) et comparer la courbe obtenue à celle de kNN avec \(k_{\min}\).
- En une dizaine de lignes, comparer les deux approches : avantages, inconvénients, et situations où l’une serait préférable à l’autre (notamment en présence de plusieurs variables explicatives, par exemple le diamètre et l’âge ; voir la distance de Mahalanobis dans les notes).
Matériel
- Notes de cours : Régression non paramétrique — kNN et noyau
- Données :
arbres.csv - Librairies R :
FNN,KernSmooth