Retour aux projets
PythonData EngineeringOpérations CRMLivré

Pipeline de collecte, nettoyage et enrichissement des données CRM

Workflows Python pour le scraping, le nettoyage, le rapprochement et la préparation de mises à jour CRM sur environ 22 000 pharmacies.

Projet réalisé pendant l’expérience chez Les Préparations de l’Apothicaire.

01 · Vue d’ensemble

Du besoin opérationnel à un système technique traçable.

Le dataset CRM nécessitait un nettoyage et un enrichissement ciblés avant de pouvoir alimenter des mises à jour opérationnelles fiables. Les informations provenaient d’exports CRM, de fichiers de référence et de sources web publiques. Des workflows Python ont normalisé et rapproché ces entrées avec les bons enregistrements, puis préparé des fichiers Excel et CSV pour contrôle et import CRM.

Niveau d’automatisation : Workflows de traitement Python avec fichiers intermédiaires et orchestration manuelle.

22 043

Dossiers de pharmacies observés dans un dataset de travail majeur

19 959

Lignes dans un workbook orienté import CRM

02 · Architecture

Un flux structuré, sans infrastructure ajoutée non documentée.

  1. Exports CRM / référence

  2. Sources web publiques

  3. Collecte et scraping Python

  4. Nettoyage et standardisation

  5. Matching et rapprochement

  6. Enrichissement ciblé

  7. Dataset de mise à jour CRM

  8. Contrôle / import

03 · Collecte et traitement Python

Collecte et traitement Python

  • Requêtes HTTP GET, parcours d’annuaires et parsing HTML avec requests et BeautifulSoup
  • Transformations pandas, expressions régulières et normalisation Unicode
  • Exports CSV / Excel versionnés et horodatés

04 · Nettoyage et standardisation

Nettoyage et standardisation

  • Suppression des accents
  • Normalisation de la casse et des espaces
  • Standardisation des codes postaux et téléphones
  • Contrôle syntaxique des emails
  • Gestion des valeurs nulles
  • Suppression des colonnes techniques temporaires

05 · Matching déterministe

Matching déterministe

  • Nom normalisé + code postal
  • Rue normalisée + code postal
  • Téléphone normalisé + code postal
  • Clés composites sans fuzzy matching

06 · Contrôles qualité

Contrôles qualité

  • Normalisation avant comparaison
  • Datasets de référence
  • Gestion des doublons
  • Validation syntaxique de certains champs
  • Versionnement intermédiaire
  • Statistiques au niveau des scripts
  • Revue humaine avant import

07 · Livrables produits

Livrables produits

  • Datasets nettoyés
  • Datasets enrichis
  • Fichiers de matching
  • Fichiers de récupération des ID CRM
  • CSV de mise à jour email
  • Workbooks prêts pour import
  • Exports de scraping horodatés
  • Scripts Python réutilisables

08 · Limites actuelles

Limites actuelles

  • Orchestration manuelle entre scripts et fichiers
  • Chemins locaux codés en dur dans certains scripts
  • Pas de suite de tests automatisés
  • Pas de journalisation persistante
  • Aucun write-back direct confirmé via l’API Zoho CRM
  • Matching déterministe uniquement
  • Certaines sources ou certains scripts historiques sont manquants

Ma contribution

Responsabilités et travail livré.

  • Création de scripts Python pour la collecte structurée de données publiques et l’enrichissement ciblé.
  • Conception de règles de matching déterministes fondées sur des clés composites normalisées.
  • Nettoyage et standardisation de datasets orientés CRM.
  • Rapprochement d’exports CRM avec plusieurs datasets de référence.
  • Préparation de fichiers Excel et CSV ciblés pour contrôle et import CRM.
Les niveaux de preuve, limites et statuts de livraison sont identiques à la version anglaise.