📊 Prospective RH & Compétences · France

Structurer la donnée RH à grande échelle : le cas ModelRH

CV, offres d'emploi et référentiels utilisent rarement le même vocabulaire. Pour ModelRH, nous avons construit un pipeline qui extrait, rapproche et hiérarchise ces données avant de produire des analyses prospectives.

Le point difficile n'était pas de générer du texte. Il fallait d'abord transformer des données RH hétérogènes en un référentiel commun, traçable et révisable par les experts.

14
Flux de traitement orchestrés
200 → 50 à 100
Catégories avant arbitrage LLM
5 ans
Horizon de projection
8 400
Formations indexées dans la suite

Le problème : la prospective des métiers ne passe pas à l'échelle

Anticiper l'évolution des métiers et des compétences est un travail d'expert : il faut lire le marché, comprendre les facteurs exogènes (transition climatique, automatisation, IA, démographie, réglementation) et en déduire ce qui attend chaque métier.

Le problème, c'est le volume. Faire cette analyse pour un métier prend des heures. Pour des centaines de métiers et de compétences, en testant à chaque fois un scénario optimiste, central et pessimiste, c'est tout simplement infaisable à la main.

Avant notre intervention, la donnée RH était dispersée et hétérogène : CV, bases d'offres d'emploi, référentiels métiers, chacun avec son vocabulaire. Impossible de comparer ou de modéliser sans des semaines de retraitement manuel.

"Le savoir-faire d'analyse existait. Ce qui manquait, c'était la capacité à le démultiplier sur des centaines de métiers, sans y passer des mois."

Avant Tensoria

  • Donnée RH éparse, vocabulaire incohérent entre sources
  • Analyse prospective faite métier par métier, à la main
  • Un seul scénario testé, faute de temps
  • Des semaines de retraitement avant toute modélisation
  • Rapports rédigés intégralement à la main

Après Tensoria

  • Donnée extraite et regroupée sur un référentiel commun
  • Modélisation automatisée sur des centaines de métiers
  • Plusieurs scénarios contrastés testés en parallèle
  • Analyses prospectives générées automatiquement
  • L'expert RH valide au lieu de tout produire

Vous avez de la donnée à exploiter et un sujet trop volumineux pour vos équipes ?

En discuter (30 min, gratuit)

Du texte libre au référentiel de compétences

Un pipeline hybride : extraction LLM, calcul sémantique, règles déterministes et contrôle humain

🧲
Étape 1

Extraire sans perdre la structure

PyMuPDF lit les PDF natifs, Mistral OCR prend le relais sur les scans et Gemini produit des sorties contraintes par des schémas Pydantic. Les CV sont anonymisés avant traitement.

IA
🧠
Étape 2

Rapprocher par le sens

Sentence-Transformers et la similarité cosinus présélectionnent les catégories proches. Le catalogue soumis au LLM passe d'environ 200 entrées à un ensemble de 50 à 100 candidates, ce qui réduit le bruit, la latence et le coût.

📝
Étape 3

Harmoniser et hiérarchiser

Les libellés sont rattachés à un référentiel commun qui contient le domaine, la macro-compétence, la compétence harmonisée et la formulation source. Le ROME sert de donnée de référence.

Étape 4

Faire relire les cas incertains

Un seuil de confiance configurable envoie les matchings ambigus en revue. L'expert peut conserver, fusionner ou remplacer la proposition avant l'export Excel, JSON ou Parquet.

Une architecture conçue pour le traitement de masse

1

Ingestion

PDF, CV, offres et référentiels sont lus, anonymisés et transformés en sorties structurées

2

Pré-matching

Les embeddings réduisent l'espace de recherche avant l'arbitrage du modèle génératif

3

Contrôle qualité

Validation Pydantic, retry, seuil de confiance et revue humaine limitent les erreurs silencieuses

4

Industrialisation

Prefect orchestre 14 flux avec concurrence, reprise et suivi d'état sur S3 Scaleway

Vous avez des milliers de documents ou de libellés métier à harmoniser ?

Évaluer mon cas d'usage

Pourquoi le LLM ne fait pas tout

Envoyer toutes les compétences et toutes les catégories dans un seul prompt serait lent, coûteux et difficile à contrôler. Le modèle génératif est utile pour comprendre une formulation ambiguë, pas pour remplacer chaque calcul du pipeline.

Le système combine donc des briques spécialisées : extraction structurée par LLM, calcul de similarité par embeddings, stockage analytique dans DuckDB et Parquet, orchestration Prefect et revue humaine des cas peu confiants.

Le regroupement sémantique décrit ici un résultat métier : rapprocher des formulations différentes qui désignent une compétence comparable. Ce n'est pas un clustering non supervisé présenté comme une boîte noire.

La bonne brique pour chaque décision

  • LLM + schémas Pydantic : extraire des champs cohérents depuis des documents variables
  • Embeddings + similarité cosinus : présélectionner rapidement les catégories sémantiquement proches
  • Règles et référentiels : préserver une hiérarchie métier stable et explicable
  • Human-in-the-loop : décider sur les cas ambigus au lieu de masquer l'incertitude

Les résultats

Des capacités techniques observables, sans inventer un pourcentage de productivité

14

Flux Prefect

Les étapes de traitement sont orchestrées séparément, avec concurrence configurable, état et reprise sur erreur.

200 → 50 à 100

Catégories candidates

Le pré-matching sémantique réduit le contexte avant arbitrage LLM, au lieu d'envoyer tout le catalogue.

8 400

Formations indexées

Un moteur TF-IDF réimplémenté en Rust alimente la recherche de la suite applicative sans dépendance Python.

1 / 3 / 5 ans

Horizons prospectifs

Le générateur croise secteurs, métiers, facteurs exogènes, scénarios et horizons dans des sorties structurées.

Ce que ces chiffres ne disent pas

Ils décrivent la capacité du système, pas un gain de temps inventé. La qualité métier dépend encore des sources, du référentiel choisi et de la validation des analystes RH.

L'IA modélise, l'expert RH décide

Une projection n'est pas une vérité. Notre rôle est de la rendre fiable, traçable et challengeable.

Les faits, sans arrondir

Un score de prospective reste une hypothèse, pas une prédiction certaine. C'est précisément pour cela que nous modélisons plusieurs scénarios : pour montrer un éventail de futurs possibles, pas une seule vérité.

Les agents IA ne décident de rien. Ils préparent la matière à grande échelle. L'expert RH choisit les scénarios pertinents, challenge les hypothèses du modèle et valide chaque analyse avant diffusion.

Chaque résultat reste rattaché à ses entrées : quels facteurs, quel scénario, quelles données source. On peut toujours remonter le fil d'un score, le comprendre et le contester.

🔍 Ce qui rend la prospective fiable

Plusieurs scénarios, pas un seul

Modéliser un futur optimiste, central et pessimiste donne une fourchette honnête, au lieu d'un faux point de certitude.

Traçabilité des scores

Chaque score remonte à ses facteurs et à ses données source, donc reste vérifiable et contestable par un expert.

L'humain au point de décision

L'IA fait le travail de masse, l'expert RH garde la main sur les choix et la validation finale.

Envie d'industrialiser une analyse sans perdre la maîtrise ?

Réserver un appel stratégique

À qui s'adresse un pipeline de structuration comme celui-ci

L'architecture sert toute organisation qui consolide des sources hétérogènes dans un référentiel métier

🏛️

Observatoires de branche

Suivre l'évolution des métiers d'une filière et publier des analyses prospectives régulières, à jour et à l'échelle.

🎓

OPCO et organismes de formation

Anticiper les compétences à développer et calibrer l'offre de formation sur les besoins futurs des métiers.

👥

Directions RH et GPEC

Construire une gestion prévisionnelle des emplois et des compétences appuyée sur des scénarios, pas sur l'intuition.

📈

Cabinets de conseil RH

Démultiplier la production d'analyses pour les clients, sans recruter une armée d'analystes.

🏭

Grands employeurs

Cartographier l'impact des transitions (climat, IA, énergie) sur ses propres métiers et préparer la reconversion.

🔁

Toute analyse de données à grande échelle

Marché, risque, supply chain : dès qu'il faut extraire, harmoniser puis analyser des données textuelles, la même architecture hybride s'applique.

Votre organisation est dans la liste ? Parlons de votre cas précis.

Réserver un appel gratuit

Questions fréquentes sur la structuration des données RH

Le pipeline extrait d'abord les compétences depuis les CV, offres et fiches métier. Des embeddings rapprochent ensuite les formulations d'un référentiel commun. Le LLM arbitre sur un catalogue réduit et les correspondances peu confiantes sont envoyées en validation humaine. Notre article explique en détail comment structurer des données non structurées avec l'IA.
L'agent de modélisation projette des facteurs exogènes (transition climatique, transition énergétique, automatisation et IA, démographie, réglementation) selon plusieurs scénarios contrastés, par exemple optimiste, central et pessimiste. Il applique ces scénarios à des centaines de métiers et compétences, sur un horizon de plusieurs années, pour produire un score d'impact par métier et par scénario.
L'extraction structurée identifie les compétences, puis Sentence-Transformers et la similarité cosinus présélectionnent les catégories proches. Le pré-matching réduit environ 200 catégories à un ensemble de 50 à 100 candidates avant arbitrage LLM. Les cas ambigus sont revus par un expert ; il ne s'agit pas d'un clustering aveugle.
Non. Les agents IA font le travail de masse : extraire, structurer, modéliser des centaines de métiers sur plusieurs scénarios, rédiger un premier jet d'analyse. L'expert RH garde la décision : il choisit les scénarios pertinents, challenge les hypothèses et valide les analyses avant diffusion. L'IA prépare la matière, l'humain tranche.
Aux organisations qui doivent consolider des sources RH hétérogènes et anticiper l'évolution des métiers : observatoires de branche, OPCO, directions RH et GPEC, cabinets de conseil et organismes de formation.
Oui. Extraction, validation par schéma, pré-matching, harmonisation et revue humaine s'appliquent aussi aux catalogues fournisseurs, contrats, dossiers techniques et nomenclatures qualité. Découvrez nos automatisations métier.

Structurez vos données métier à grande échelle

Documents, libellés ou référentiels difficiles à rapprocher : examinons le pipeline adapté à vos sources.