Définition
Mesure scalaire résumant la discrimination d'un test diagnostique ou d'un modèle prédictif : c'est la probabilité qu'un cas positif choisi au hasard obtienne un score supérieur à celle d'un cas négatif choisi au hasard ; calculée comme aire sous la courbe ROC et variant de 0 à 1 (0,5 = hasard).

Principe

Principe
L'AUC évalue la séparabilité par ordre des deux classes de résultat sur l'ensemble des seuils décisionnels et est invariante par transformations monotones du score ; elle mesure donc la discrimination indépendamment du seuil choisi ou de la prévalence.

Démonstration

Démonstration
Scénario illustratif : un biomarqueur fournit des scores continus de risque. Sur un échantillon de validation, on construit la courbe ROC et on obtient AUC = 0,85. Interprétation : pour un malade et un non‑malade choisis au hasard, il y a 85 % de chances que le score du malade soit supérieur à celui du non‑malade, indiquant une bonne discrimination pour tous les seuils.

Mauvaise application

Mauvaise application
Considérer l'AUC comme une mesure de calibration, d'utilité clinique ou de valeur prédictive positive. L'erreur consiste à confondre capacité de classement et exactitude des probabilités prédites ou du bénéfice décisionnel ; une AUC élevée peut coexister avec une mauvaise calibration ou des seuils produisant trop de faux positifs.

Conséquence

Conséquence
Choisir un modèle uniquement sur l'AUC privilégie le classement mais peut conduire à des décisions cliniques inappropriées si la calibration, les probabilités prédites, les seuils, les coûts des erreurs ou la prévalence sont ignorés ; l'adoption fondée seulement sur l'AUC risque d'estimer incorrectement le bénéfice.

Inversion

Inversion
Lorsque les conséquences décisionnelles dépendent d'un seuil spécifique, que la prévalence est extrême ou que différentes formes de courbe ROC donnent la même AUC, l'AUC n'est plus le meilleur indicateur ; il faut alors privilégier des mesures spécifiques au seuil, la calibration ou l'analyse décisionnelle.

Limite

Limite
Clairement dans la définition : résultat binaire avec score continu ou ordinal produisant une courbe ROC. Cas limite : problèmes multi‑classes ou données de survie censurées nécessitant des définitions d'AUC adaptées. Hors définition : mesures de calibration, différences de risque absolu ou estimés d'effet causal.

Tension sémantique

Tension sémantique
Discrimination (classement mesuré par l'AUC) versus calibration/utilité décisionnelle (exactitude des probabilités prédites et résultats seuilés) ; améliorer l'un n'améliore pas nécessairement l'autre.

Synthèse

Synthèse
L'AUC résume la capacité d'un modèle à classer par risque sur tous les seuils ; elle est nécessaire mais insuffisante pour juger de l'utilité clinique — il faut la compléter par des vérifications de calibration, des mesures spécifiques aux seuils et une analyse décisionnelle adaptée.