Développement data

Construire, tester et déployer des modèles pour permettre la prédiction, la détection ou l’explication d’un phénomène.

Expertise

“Tous les modèles sont faux mais quelques uns sont utiles” (George Box).

Les missions de développement data ont précisément pour objectif de développer des modèles utiles.

Utiles premièrement dans la réponse concrète qu’ils apportent à une problématique clef : Puis-je anticiper la survenue d’une panne ? (Maintenance Prédictive) Le process que j’ai mis en place est-il respecté ? Où sont les goulets d’étranglement ? (Process Mining) Comment organiser au mieux mon réapprovisionnement ? (Optimisation) Comment identifier les points de faiblesse sur mon réseau ? (Analyse vibratoire), etc.

Utiles dans le sens d’utilisés — c’est-à-dire correctement déployés et intégrés à l’écosystème logiciel en place.

Selon où vous en êtes dans cette chaîne, nous intervenons sur un segment particulier ou sur l’ensemble de la chaîne full stack, c’est-à-dire :

  • La modélisation (du nettoyage de données à la détection de patterns).
  • Le déploiement
  • L’industrialisation et l’observabilité
  • La diffusion des bonnes pratiques de développement data.

Illustration/Cas d’usage

Modélisation

Une organisation se confronte à un problème récurrent qu’elle ne sait actuellement pas résoudre (rupture d’approvisionnement, pannes similaires à répétition, processus qui prend systématiquement du retard, turnover plus élevé que la concurrence, etc.). Elle dispose de données — ou pourrait en disposer — et souhaite une réponse précise à cette problématique.

modelisation

Nous vous accompagnons dans toutes les étapes de la modélisation — de la collecte/nettoyage de données à l’évaluation fine des résultats du modèle. Au-delà de la réponse apportée, nous vous aidons à comprendre les sous-jacents statistiques : pourquoi éviter tel ou tel modèle dans ce contexte ? Comment faire en sorte que les prédictions se généralisent bien ? Suis-je vraiment sûr de ce que je vois ?

Déploiement

Une organisation dispose de data scientists à même de développer et sélectionner des modèles pertinents. Toutefois, les relations avec les autres départements sont complexes (outils, SLA, environnements de prod) et les modèles peinent à franchir la frontière du notebook.

modelisation_marts

Nous vous aidons à mettre en place un workflow de déploiement robuste et reproductible — qu’il s’agisse d’inférence à la volée ou par batch — en s’appuyant sur les standards du marché (versioning de modèles, monitoring de drift, pipelines CI/CD). L’objectif : transformer ce qui est développé à la main en configuration pilotable et maintenable par l’équipe.

Diffusion de bonnes pratiques

Nous accompagnons également vos équipes à mieux collaborer et communiquer en mettant en perspective les attentes et les habitudes de chaque département.

best practices

Lorsque le data engineer pense à la scalabilité de son pipeline, le data analyst pense aux exceptions liées à une subtilité business dans la définition de ses métriques, et le data scientist à la signification statistique de ce calcul souvent imparfait (et l’on pourrait ajouter au tableau le platform engineer, l’ingénieur DevOps, etc.). Autant de départements qui ont leurs enjeux, leurs roadmaps, leurs appréhensions. Nous intervenons sous forme d’ateliers, de revues de code croisées ou de pair programming inter-équipes pour faire tomber ces silos et aligner les pratiques autour d’un socle commun.