Vous recherchez des ressources sur le Fonds de finance sociale ? Commencez ici.

ConnaissanceRessources

Analyse des défis liés au pipeline ETL

Le projet pilote éclaireur a permis à l’Approche commune de la mesure d’impact de prendre conscience d’un point essentiel : les pipelines ETL constituaient l’un des principaux obstacles — voire le principal— à la mesure de l’impact pour les organisations à vocation sociale (SPO) participantes. Pour les organisations qui collectaient déjà des données, la principale difficulté à laquelle elles étaient confrontées – et sont toujours confrontées – en matière de mesure d’impact réside dans le travail fastidieux consistant à rassembler des données individuelles et relatives aux événements pour en faire des indicateurs. Nous estimons que ce défi constitue un problème systémique affectant l’ensemble du secteur caritatif, de l’innovation sociale et de la finance sociale, entravant ainsi une mesure d’impact efficace, l’adoption du numérique et l’efficacité des programmes.

CA-ETLsolutions-bluebackground

Qu'est-ce qu'un pipeline ETL ?

ELT signifie « extraire, transformer et charger ». Le terme « pipeline » désigne une séquence d’étapes au cours desquelles les données sont extraites de leur forme brute — généralement des données au niveau individuel ou au niveau des événements —, puis nettoyées et structurées dans un format adapté à leur agrégation en indicateurs. Ce processus peut aller d’une simple agrégation de données à des opérations très complexes impliquant plusieurs ensembles de données et des calculs sophistiqués.
Le calcul d’un indicateur de rendement simple peut prendre 60 minutes. Un indicateur d’impact complexe peut parfois nécessiter plusieurs jours de travail, même pour un analyste de données expérimenté. Une organisation qui suit 15 indicateurs trimestriels pourrait facilement consacrer deux semaines par an uniquement aux transformations de données, sans compter la collecte, la visualisation et la prise de décision. En mettant en lumière ce point sensible crucial, nous espérons que l’Approche commune pourra favoriser l’émergence de solutions plus efficaces et mieux ciblées.

Exemple simple de pipeline ETL : Maple Tree Society

Maple Tree Society est une petite organisation comptant seulement quelques employés, dotée d’un niveau de maturité numérique modéré et disposant d’un ensemble stable de priorités stratégiques à suivre et à présenter au conseil d’administration pour la reddition de comptes.
L’un des indicateurs relatifs à l’une des priorités stratégiques est le « nombre de participants aux événements Maple Tree ». Cet indicateur, qui semble simple à première vue, nécessite de regrouper les données de participation provenant d’Eventbrite (pour les événements en ligne) et de fichiers Excel internes (pour les événements en présentiel). Les étapes de transformation sont les suivantes :

  • Extraction: téléchargement de fichiers .csv depuis Eventbrite et collecte des listes de présence en présentiel par e-mail.
  • Transformation: ouvrir des fichiers, copier et coller des données, utiliser des formules de comptage simples, créer de nouveaux tableaux, relier ou transcrire des données, et calculer des totaux.
  • Chargement: copier-coller le chiffre final calculé dans un tableau de bord ou un rapport.

Ce processus, en apparence simple, prend entre 45 et 60 minutes à la Maple Tree Society par période de reddition de comptes, et ce pour un seul indicateur. Avec plus de 15 indicateurs, la compilation des données annuelles devient une tâche colossale (1 à 2 journées complètes), ce qui a souvent pour conséquence que les données ne sont utilisées que pour les rapports de fin d’année, plutôt que pour un suivi ou une gestion en continu.

Exemple de pipeline ETL complexe : White Oak Alliance

White Oak Alliance est une organisation de taille moyenne comptant plus de 40 employés et présentant un niveau élevé de maturité numérique. Elle dispose d’un évaluateur à temps plein au sein de son personnel.
White Oak cherche à suivre le « pourcentage d’expulsions évitées grâce à ses services ». Cela nécessite l’intégration des données issues de deux bases de données sophistiquées : le système de gestion de la responsabilité et des ressources (ARMS), qui recense les services de prévention des expulsions, et le système d’information sur les personnes et les familles sans domicile (HIFIS), qui recense la situation en matière de logement. La complexité résulte des éléments suivants :

  • Extraction: Exécution de rapports spécialisés à partir des systèmes ARMS et HIFIS, ce qui nécessite souvent le recours à du personnel disposant d’une expertise spécifique.
  • Transformation: téléchargement de fichiers .csv, ouverture de ces fichiers dans Excel, reformatage des données pour assurer leur cohérence, identification des personnes distinctes dans les différents ensembles de données, utilisation de fonctions RECHERCHEV avancées pour fusionner les données, correction des omissions en contactant les chargés de dossier, et réalisation des calculs finaux pour le numérateur, le dénominateur et le pourcentage.
  • Chargement: enregistrement du pourcentage final dans un rapport.

Cette transformation complexe peut prendre à White Oak Alliance plus d’une heure par trimestre pour un seul indicateur. En tant qu’organisme proposant de multiples services et disposant de nombreux programmes et indicateurs, White Oak se contente souvent de compiler uniquement les données exigées par les organismes bailleurs de fonds, ce qui entraîne une sous-utilisation importante des données collectées à des fins d’apprentissage et d’amélioration en interne.

Les répercussions à l'échelle du secteur

Ce défi lié au pipeline ETL dépasse largement le cadre des participants au Projet pilote éclaireur. Il s’agit d’un obstacle majeur à une utilisation efficace des données dans l’ensemble du secteur caritatif, de l’innovation sociale et de la finance sociale.

Des éléments attestant d’un problème commun

Les dirigeants de l’ensemble du secteur, notamment les représentants d’organismes spécialisés dans les données, de partenaires philanthropiques et d’intermédiaires, ne cessent de faire écho à ce défi. Ils le considèrent comme un problème fondamental et majeur qui trouve un écho profond dans leurs propres expériences et observations concernant les obstacles systémiques auxquels sont confrontées les organisations à vocation sociale.

Charity Navigator et Impact Matters: « Nous avons rencontré des difficultés à ce sujet. »

Purpose Analytics: « C’est le principal problème que nous constatons. »

Fondation Trillium de l’Ontario: « Cela ne nous surprend pas. Nous constatons cela. »

LIFT Impact Partners: « Cela correspond tout à fait à ce que nous avons observé dans le cadre de notre travail avec les organisations à but social (SPO). Le document a très bien saisi les nuances de cette question. »

Le rapport 2020 sur l’autonomisation par les données (Data Empowerment Report ) du Nonprofit Technology Enterprise Network (NTEN) met indirectement en évidence le défi que représente le pipeline ETL, en soulignant que la grande majorité des organisations ne disposent que de 25 % ou moins de personnel capable de générer des rapports personnalisés (page 23).

Conséquences

L’incapacité à transformer efficacement les données individuelles et celles relatives aux événements en indicateurs signifie que les SPO et les intermédiaires de finance sociale (IFS) ne sont pas en mesure de transformer les données collectées en informations pertinentes. Cela a plusieurs conséquences majeures :

  • Utilisation limitée des données: les SPO collectent souvent de vastes quantités de données, mais ne sont pas en mesure de les exploiter pour la prise de décisions stratégiques ou pour tirer des enseignements, au-delà des exigences élémentaires en matière de reddition de comptes.
  • Informations cloisonnées: les données restent enfermées dans des systèmes disparates, ce qui rend pratiquement impossible toute analyse exhaustive et toute réflexion portant sur l’ensemble des programmes.
  • Coûts élevés: le caractère manuel et chronophage des transformations rend la collecte des données et la reddition de comptes fastidieuses et coûteuses.
  • Obstacles au partage des données: en l’absence de données normalisées et transformées, le partage constructif des données entre les organisations ou avec les organismes bailleurs de fonds reste un défi majeur.

Un monde de solutions, mais aucune issue

Il existe des solutions au problème du pipeline ETL. Les data scientists et les professionnels de l’intelligence d’affaires indiquent que ces solutions sont largement disponibles et peuvent être adaptées à divers budgets. Il existe de meilleures façons pour la Maple Tree Society et la White Oak Alliance de mener à bien leur travail, à des prix abordables pour elles. Et pourtant, le problème du pipeline ETL persiste.

Parmi les solutions existantes, on peut citer :

  • Automatisations utilisant des outils de type « Integration Platform as a Service » (iPaaS), tels que Zapier, IFTTT, Make (anciennement Integromat) et Workato, qui permettent de relier différentes applications logicielles et d’automatiser des tâches.
  • Des scripts sur mesure permettant d’extraire des rapports, d’effectuer des transformations et d’exporter des données mises en forme. Purpose Analytics, par exemple, a développé de telles applications pour les utilisateurs de HIFIS.
  • Optimisez les flux de processus afin de rationaliser les étapes manuelles et de réduire les pertes d’efficacité.
  • Regrouper les données sur un nombre réduit de plateformes afin de réduire le nombre de sources de données.
  • Mieux exploiter les fonctionnalités existantes de la plateforme en tirant parti des fonctionnalités sous-utilisées au sein des logiciels actuels.
  • Recourir aux services d’un consultant et faire appel à une expertise externe pour mettre en place des systèmes de données. Si certaines organisations du secteur public ont obtenu de bons résultats dans ce domaine, les exemples de collaborations frustrantes sont plus nombreux. Cela montre bien que, bien que des moyens financiers soient souvent disponibles pour résoudre les problèmes liés aux données, même avec ces moyens, les solutions semblent hors de portée.
  • Renforcer les capacités internes en donnant aux collaborateurs les moyens de gérer les données.

Principaux obstacles

Si les solutions sont courantes et que les difficultés liées au pipeline ETL sont fréquentes, cela signifie qu’il existe d’autres problèmes qui empêchent ces solutions d’atteindre les organisations qui en ont besoin. L’Approche commune émet l’hypothèse que les obstacles suivants font barrière à la mise en œuvre de ces solutions :

  1. Manque de précision dans le vocabulaire: les SPO évoquent souvent des difficultés liées à la « mesure » ou au « reddition de comptes », plutôt que de mentionner précisément le « pipeline ETL » ou la « transformation des données ». Ce vocabulaire imprécis conduit à des solutions génériques (telles que les logiciels de mesure d’impact) qui ne s’attaquent pas au cœur du problème. Si les SPO pouvaient formuler clairement les obstacles spécifiques liés à la transformation, ils pourraient solliciter une aide plus ciblée et éviter de revenir sans cesse sur des éléments fondamentaux, tels que les théories du changement ou les indicateurs clés de performance (KPI), à chaque fois qu’ils font appel à un nouveau consultant.
  2. Le terme ambigu de « renforcement des capacités » : trop souvent, l’identification du problème s’arrête au terme « capacités ». Des capacités pour quoi, exactement ? La « mesure d’impact » est une notion trop vague. La « transformation des données » est trop vague. Nous pouvons plutôt nous pencher sur les éléments constitutifs de la solution : manque d’expertise dans la mise en place et la maintenance d’un outil iPaaS, expertise insuffisante pour identifier, recruter et encadrer un consultant efficace, ou expertise limitée en matière de développement de systèmes d’information de gestion.
  3. Difficulté liée à la segmentation des solutions: ni les fournisseurs de solutions, ni les intermédiaires (formateurs, spécialistes du renforcement des capacités) ne disposent actuellement d’un cadre clair permettant d’aider les SPO à identifier la solution adaptée à leur problème spécifique de transformation des données. Pour déterminer si un OVS a besoin d’une optimisation des processus, d’outils iPaaS ou d’une application sur mesure, il faut faire appel à une personne ayant une bonne vue d’ensemble de l’éventail des solutions disponibles et sachant à quels problèmes de transformation des données celles-ci sont les mieux adaptées. L’élaboration et la diffusion d’un tel cadre — sous la forme d’un questionnaire ou d’une grille d’évaluation — constituent une entreprise de grande envergure.
CA-ETLsolutions-3