// Silo Modélisation — Étape 3 / 7

Gestion du Déséquilibre

En ressources humaines, les signaux qui comptent le plus sont souvent les plus discrets. Apprenez à paramétrer vos modèles pour qu'ils cessent d'ignorer la rareté.

Contexte : Dans le monde de la Data Science appliquée aux ressources humaines, la majorité des phénomènes que nous cherchons désespérément à anticiper sont, par nature, minoritaires. Qu'il s'agisse d'un départ de collaborateur (turnover), d'un cas d'absentéisme de très longue durée ou d'une demande spontanée de rupture conventionnelle, ces événements ne touchent chaque mois qu'une infime fraction de vos effectifs globaux. Statistiquement, votre base de données est submergée par la masse des collaborateurs "stables".


Objectif : Ce phénomène s'appelle le déséquilibre des classes (Data Imbalance). L'objectif de cette étape est d'ajuster, de corriger et de rééquilibrer artificiellement vos échantillons de données avant de les soumettre à l'intelligence artificielle. Sans cette correction, les modèles mathématiques souffrent d'une forme de paresse algorithmique : ils choisissent systématiquement la solution de facilité en prédisant l'état le plus fréquent, rendant vos outils d'aide à la décision totalement inefficaces.


Valeur : Maîtriser le traitement du déséquilibre des classes permet de passer d'un modèle "théoriquement parfait mais inutile" à un outil opérationnel à forte valeur ajoutée. Pour les directions RH, cela signifie des prévisions fiables capables de lever des alertes précoces sur les profils à risque, d'allouer vos budgets de rétention au bon endroit, et de nouer une relation de confiance entre les managers de terrain et vos analyses prédictives.

Le piège des 92% de précision : L'illusion mathématique

Imaginons que votre entreprise affiche un taux de turnover annuel de 8%. C’est une excellente performance macroéconomique. Traduisons cela sous l'angle de la Data Science : dans votre fichier d'export SIRH, 92% des lignes correspondent à des collaborateurs fidèles (la classe majoritaire), et seulement 8% à des collaborateurs ayant démissionné (la classe minoritaire).


Si vous donnez ce fichier brut à une intelligence artificielle sans consigne particulière, celle-ci va chercher à maximiser sa réussite globale. Elle va rapidement découvrir une astuce imparable : prédire que 100% des salariés vont rester dans l'entreprise.


En faisant cela, l'IA affiche fièrement un taux de précision de 92%. Sur le papier, les équipes non averties pourraient crier au génie. En réalité, ce modèle est une coquille vide : il a été incapable de détecter le moindre départ réel. Il n'a trouvé aucun des 8% de collaborateurs qui ont effectivement quitté la structure. C'est pour briser cette illusion optique qu'interviennent les techniques de rééchantillonnage.

Les deux stratégies pour rééquilibrer vos données

Pour forcer l'algorithme à prêter attention aux 8% de profils minoritaires, la Data Science dispose de deux leviers principaux. Voyons comment les vulgariser simplement pour vos équipes.

1. Le sous-échantillonnage (Undersampling) : Réduire la masse

Cette méthode consiste à faire "maigrir" artificiellement la classe majoritaire. Dans notre exemple, on va conserver l'intégralité des profils des démissionnaires (les 8%), et on va tirer au sort un volume équivalent de profils parmi les collaborateurs stables.


On se retrouve alors face à un nouveau jeu de données condensé composé à 50% de personnes stables et à 50% de personnes parties. L'IA est obligée d'étudier les caractéristiques des deux groupes à parts égales.
Le bémol : En jetant une grande partie de vos données de collaborateurs stables, vous risquez de priver le modèle d'informations précieuses sur ce qui fait la fidélité de vos équipes.

2. Le sur-échantillonnage (Oversampling) et la magie de l'algorithme SMOTE

À l'inverse, cette approche consiste à multiplier le groupe minoritaire pour le mettre au niveau du grand groupe. Au lieu de faire un simple copier-coller des profils de démissionnaires (ce qui provoquerait des erreurs d'apprentissage), on utilise une méthode mathématique baptisée SMOTE (Synthetic Minority Over-sampling Technique).


SMOTE ne duplique pas les lignes : il analyse les points communs des collaborateurs partis (par exemple : une baisse de salaire relative associée à une forte charge de travail et une baisse des formations vécue à l'Étape 2) et crée de toutes pièces des "salariés virtuels" dotés de caractéristiques similaires mais légèrement nuancées. L'algorithme dispose alors d'une matière riche et abondante pour apprendre à repérer les signaux faibles du départ.

Changer de lunettes : Délaisser la Précision pour le Rappel et le F1-Score

Lorsque vos données sont déséquilibrées, vous devez interdire à vos data scientists d'évaluer l'outil avec le "Taux de précision global". Vous devez imposer de nouvelles grilles de lecture RH, beaucoup plus concrètes :

• Le Rappel (Recall) : C'est la capacité du modèle à lever la main sur TOUS les départs. Un rappel de 90% signifie que sur 100 démissions réelles à venir, l'IA a réussi à en intercepter 90. C'est l'indicateur à privilégier si votre priority absolue est de ne perdre aucun talent.

• La Précision (Precision) : C'est la fiabilité de l'alerte. Si l'IA désigne 10 personnes comme "à risque de départ", et que 8 d'entre elles comptaient vraiment démissionner, votre précision est de 80%. Une bonne précision évite que vos Responsables RH ne perdent du temps à mener des entretiens de rétention auprès de salariés parfaitement heureux.

• Le F1-Score : C'est l'arbitre de paix. Le F1-score combine mathématiquement le Rappel et la Précision en une seule note. Plus il est proche de 100%, plus votre modèle a trouvé le parfait équilibre entre "détecter un maximum de cas" et "éviter les fausses alertes".

Tableau de pilotage : Quelle métrique choisir selon votre enjeu RH ?

Le choix d'ajustement de l'algorithme dépend avant tout de votre stratégie d'entreprise :

Votre Enjeu Métier RH Métrique à Maximiser Conséquence Pratique sur le Terrain
Pénurie extrême de talents (ex: Cybersécurité). Aucun départ n'est tolérable. Le Rappel (Recall) L'IA ratissera large. Vous capterez tous les départs, quitte à traiter quelques fausses alertes.
Temps RH très limité. Les équipes ne peuvent mener que 3 entretiens par semaine. La Précision Chaque alerte déclenchée est une certitude. Aucun rendez-vous n'est programmé pour rien.
Pilotage global du plan de transformation RH à l'échelle du Groupe. Le F1-Score L'équilibre parfait pour des prévisions budgétaires et humaines saines et stables.

Aperçu logique : L'application de SMOTE sur un index RH

Pour vos équipes techniques, l'intégration de ce filtre d'équilibrage intervient juste après l'ingénierie des variables développée à l'étape précédente :

// Rééquilibrage d'un échantillon de turnover via la librairie Imbalanced-Learn
from imblearn.over_sampling import SMOTE

# X contient nos variables RH composites, y contient l'indicateur "Départ (0 ou 1)"
smote_rh = SMOTE(random_state=42)
X_equilibre, y_equilibre = smote_rh.fit_resample(X_features_rh, y_cible_turnover)

# Notre jeu de données contient désormais strictement autant de 'Départs' que de 'Présences'

Poursuivre la construction de votre modèle RH

Maintenant que vos données sont enrichies et parfaitement équilibrées pour ne plus masquer les comportements rares, une question éthique et légale majeure se pose : comment entraîner votre modèle prédictif tout en garantissant le secret absolu des données personnelles de vos collaborateurs ?

Étape 4 : Anonymisation et protection de la vie privée (RGPD) →

Questions fréquentes sur le déséquilibre des données RH

Qu'est-ce que le déséquilibre des classes en Data RH ?

Le déséquilibre des classes (ou Data Imbalance) survient lorsque l'événement que l'on souhaite prédire (ex: une démission) est mathématiquement rare par rapport à la situation globale (les collaborateurs qui restent). L'IA a alors tendance à ignorer le signal minoritaire.

Pourquoi un taux de précision de 92% peut-il cacher un modèle inutile ?

Si votre entreprise a un turnover de 8%, un modèle d'IA paresseux qui prédit que "personne ne s'en va" aura raison dans 92% des cas. Le taux de précision global est excellent, mais le modèle est totalement incapable de détecter les 8% de démissions réelles.

Quelle est la différence entre le Rappel et la Précision en RH ?

Le Rappel mesure la capacité du modèle à capter tous les départs réels (ne rater aucun signal). La Précision mesure la certitude que les alertes déclenchées sont vraies (éviter les fausses alertes qui fatiguent les managers).

Comment fonctionne l'algorithme SMOTE pour les Ressources Humaines ?

SMOTE est une méthode de sur-échantillonnage qui ne se contente pas de copier-coller les données des démissionnaires. Elle crée mathématiquement des profils de "clones virtuels" cohérents pour aider l'algorithme à s'entraîner sur un volume équilibré.

Qu'est-ce que le sous-échantillonnage (undersampling) ?

Cette technique consiste à retirer aléatoirement des données de la majorité stable (les collaborateurs fidèles) pour présenter à l'IA un jeu de données à parts égales (50% de stables, 50% de départs). Elle s'utilise principalement sur de très grands effectifs.

Qu'est-ce que le F1-Score et pourquoi est-ce la métrique reine ?

Le F1-Score est la moyenne mathématique équilibrée entre la Précision et le Rappel. C'est le seul indicateur fiable pour juger de la performance réelle d'une IA RH face à un problème de données déséquilibrées.

Vos modèles d'IA RH manquent-ils de fiabilité ?
Prendre rendez-vous avec un consultant