Structurer la donnée RH à grande échelle : le cas ModelRH
CV, offres d'emploi et référentiels utilisent rarement le même vocabulaire. Pour ModelRH, nous avons construit un pipeline qui extrait, rapproche et hiérarchise ces données avant de produire des analyses prospectives.
Le point difficile n'était pas de générer du texte. Il fallait d'abord transformer des données RH hétérogènes en un référentiel commun, traçable et révisable par les experts.
Le problème : la prospective des métiers ne passe pas à l'échelle
Anticiper l'évolution des métiers et des compétences est un travail d'expert : il faut lire le marché, comprendre les facteurs exogènes (transition climatique, automatisation, IA, démographie, réglementation) et en déduire ce qui attend chaque métier.
Le problème, c'est le volume. Faire cette analyse pour un métier prend des heures. Pour des centaines de métiers et de compétences, en testant à chaque fois un scénario optimiste, central et pessimiste, c'est tout simplement infaisable à la main.
Avant notre intervention, la donnée RH était dispersée et hétérogène : CV, bases d'offres d'emploi, référentiels métiers, chacun avec son vocabulaire. Impossible de comparer ou de modéliser sans des semaines de retraitement manuel.
"Le savoir-faire d'analyse existait. Ce qui manquait, c'était la capacité à le démultiplier sur des centaines de métiers, sans y passer des mois."
✕ Avant Tensoria
- • Donnée RH éparse, vocabulaire incohérent entre sources
- • Analyse prospective faite métier par métier, à la main
- • Un seul scénario testé, faute de temps
- • Des semaines de retraitement avant toute modélisation
- • Rapports rédigés intégralement à la main
✓ Après Tensoria
- • Donnée extraite et regroupée sur un référentiel commun
- • Modélisation automatisée sur des centaines de métiers
- • Plusieurs scénarios contrastés testés en parallèle
- • Analyses prospectives générées automatiquement
- • L'expert RH valide au lieu de tout produire
Vous avez de la donnée à exploiter et un sujet trop volumineux pour vos équipes ?
En discuter (30 min, gratuit)Du texte libre au référentiel de compétences
Un pipeline hybride : extraction LLM, calcul sémantique, règles déterministes et contrôle humain
Extraire sans perdre la structure
PyMuPDF lit les PDF natifs, Mistral OCR prend le relais sur les scans et Gemini produit des sorties contraintes par des schémas Pydantic. Les CV sont anonymisés avant traitement.
Rapprocher par le sens
Sentence-Transformers et la similarité cosinus présélectionnent les catégories proches. Le catalogue soumis au LLM passe d'environ 200 entrées à un ensemble de 50 à 100 candidates, ce qui réduit le bruit, la latence et le coût.
Harmoniser et hiérarchiser
Les libellés sont rattachés à un référentiel commun qui contient le domaine, la macro-compétence, la compétence harmonisée et la formulation source. Le ROME sert de donnée de référence.
Faire relire les cas incertains
Un seuil de confiance configurable envoie les matchings ambigus en revue. L'expert peut conserver, fusionner ou remplacer la proposition avant l'export Excel, JSON ou Parquet.
Une architecture conçue pour le traitement de masse
Ingestion
PDF, CV, offres et référentiels sont lus, anonymisés et transformés en sorties structurées
Pré-matching
Les embeddings réduisent l'espace de recherche avant l'arbitrage du modèle génératif
Contrôle qualité
Validation Pydantic, retry, seuil de confiance et revue humaine limitent les erreurs silencieuses
Industrialisation
Prefect orchestre 14 flux avec concurrence, reprise et suivi d'état sur S3 Scaleway
Vous avez des milliers de documents ou de libellés métier à harmoniser ?
Évaluer mon cas d'usagePourquoi le LLM ne fait pas tout
Envoyer toutes les compétences et toutes les catégories dans un seul prompt serait lent, coûteux et difficile à contrôler. Le modèle génératif est utile pour comprendre une formulation ambiguë, pas pour remplacer chaque calcul du pipeline.
Le système combine donc des briques spécialisées : extraction structurée par LLM, calcul de similarité par embeddings, stockage analytique dans DuckDB et Parquet, orchestration Prefect et revue humaine des cas peu confiants.
Le regroupement sémantique décrit ici un résultat métier : rapprocher des formulations différentes qui désignent une compétence comparable. Ce n'est pas un clustering non supervisé présenté comme une boîte noire.
La bonne brique pour chaque décision
- LLM + schémas Pydantic : extraire des champs cohérents depuis des documents variables
- Embeddings + similarité cosinus : présélectionner rapidement les catégories sémantiquement proches
- Règles et référentiels : préserver une hiérarchie métier stable et explicable
- Human-in-the-loop : décider sur les cas ambigus au lieu de masquer l'incertitude
Les résultats
Des capacités techniques observables, sans inventer un pourcentage de productivité
Flux Prefect
Les étapes de traitement sont orchestrées séparément, avec concurrence configurable, état et reprise sur erreur.
Catégories candidates
Le pré-matching sémantique réduit le contexte avant arbitrage LLM, au lieu d'envoyer tout le catalogue.
Formations indexées
Un moteur TF-IDF réimplémenté en Rust alimente la recherche de la suite applicative sans dépendance Python.
Horizons prospectifs
Le générateur croise secteurs, métiers, facteurs exogènes, scénarios et horizons dans des sorties structurées.
Ce que ces chiffres ne disent pas
Ils décrivent la capacité du système, pas un gain de temps inventé. La qualité métier dépend encore des sources, du référentiel choisi et de la validation des analystes RH.
L'IA modélise, l'expert RH décide
Une projection n'est pas une vérité. Notre rôle est de la rendre fiable, traçable et challengeable.
Les faits, sans arrondir
Un score de prospective reste une hypothèse, pas une prédiction certaine. C'est précisément pour cela que nous modélisons plusieurs scénarios : pour montrer un éventail de futurs possibles, pas une seule vérité.
Les agents IA ne décident de rien. Ils préparent la matière à grande échelle. L'expert RH choisit les scénarios pertinents, challenge les hypothèses du modèle et valide chaque analyse avant diffusion.
Chaque résultat reste rattaché à ses entrées : quels facteurs, quel scénario, quelles données source. On peut toujours remonter le fil d'un score, le comprendre et le contester.
🔍 Ce qui rend la prospective fiable
Modéliser un futur optimiste, central et pessimiste donne une fourchette honnête, au lieu d'un faux point de certitude.
Chaque score remonte à ses facteurs et à ses données source, donc reste vérifiable et contestable par un expert.
L'IA fait le travail de masse, l'expert RH garde la main sur les choix et la validation finale.
Envie d'industrialiser une analyse sans perdre la maîtrise ?
Réserver un appel stratégiqueÀ qui s'adresse un pipeline de structuration comme celui-ci
L'architecture sert toute organisation qui consolide des sources hétérogènes dans un référentiel métier
Observatoires de branche
Suivre l'évolution des métiers d'une filière et publier des analyses prospectives régulières, à jour et à l'échelle.
OPCO et organismes de formation
Anticiper les compétences à développer et calibrer l'offre de formation sur les besoins futurs des métiers.
Directions RH et GPEC
Construire une gestion prévisionnelle des emplois et des compétences appuyée sur des scénarios, pas sur l'intuition.
Cabinets de conseil RH
Démultiplier la production d'analyses pour les clients, sans recruter une armée d'analystes.
Grands employeurs
Cartographier l'impact des transitions (climat, IA, énergie) sur ses propres métiers et préparer la reconversion.
Toute analyse de données à grande échelle
Marché, risque, supply chain : dès qu'il faut extraire, harmoniser puis analyser des données textuelles, la même architecture hybride s'applique.
Votre organisation est dans la liste ? Parlons de votre cas précis.
Réserver un appel gratuitQuestions fréquentes sur la structuration des données RH
Pour aller plus loin
Structurer des données non structurées avec l'IA
Institut de sondage : génération de rapports par IA
Agent IA immobilier : génération du pré-état daté
Génération de rapports par IA
Expert LLM, NLP et agents IA sur mesure
Automatisations et agents IA sur mesure
Structurez vos données métier à grande échelle
Documents, libellés ou référentiels difficiles à rapprocher : examinons le pipeline adapté à vos sources.
