Le cycle de vie de l'analytique
Pour viser une prise de décision basée sur les données (DDDM), l'analyse des données, que ce soit par le biais de l'analytique des données (DA) ou de l'analytique avancée (AA), est cruciale, chacune suivant les mêmes activités globales mais avec des complexités et des résultats différents. Le processus, semblable à une forme d'art, implique des étapes telles que la définition de la question, la collecte et l'analyse des données, la présentation des résultats et le maintien de l'analytique, toutes essentielles pour comprendre et naviguer dans les complexités et les défis des scénarios du monde réel, comme illustré par des cas d'utilisation dans les rapports réglementaires et les insights clients.

Par Charles Kincaid, Responsable de la Compétence en Science des Données, Experis
"Les règles de soins capillaires sont simples et finies." - Elle Woods
Lorsqu'on aspire à une prise de décision basée sur les données (DDDM), l'un des composants les plus importants est l'analyse des données. Cela peut être fait avec l'analytique des données (DA), aussi connu sous le nom de statistiques descriptives, ou l'analytique avancée (AA), également connu sous le nom de statistiques inférentielles. Les deux ont leur place et suivent les mêmes activités globales. Examinons ce que sont ces activités.
D'abord, réalisez que ce que nous allons dire n'est qu'un guide. Contrairement aux soins capillaires, le processus d'analyse des données est désordonné, compliqué et plein d'essais et d'erreurs. Pour la simple raison que nous essayons de comprendre le monde, et la vie est désordonnée, compliquée et pleine d'essais et d'erreurs. Mais avec cette mise en garde à l'esprit, ce cadre sera très utile.
Vue d'ensemble
Une façon de décomposer le cycle de vie de l'analytique à cette vue de 30 000 pieds, c'est en cinq étapes : Définir la Question, Collecter les données, Analyser les données, Présenter les résultats, Maintenir l'Analytique. Comme le montre le graphique ci-dessous, il existe de nombreuses autres sous-tâches à chaque étape.
Tout comme la gestion des personnes, la science des données est un art ainsi qu'un processus. S'il existe une seule réponse vraie, il peut être difficile de dire si nous l'avons trouvée ou non. L'objectif de l'analytique en tant que scientifique des données est de trouver la meilleure réponse avec les informations auxquelles nous avons accès. Pour mieux voir cela, considérons deux cas d'utilisation où l'analytique est utilisée depuis longtemps : les Rapports Réglementaires et les Insights Clients.
Rapports Réglementaires
Prenons par exemple les hypothèques pour acheter une maison. Les réglementations fédérales, comme dans la Loi sur le Logement Équitable, interdisent la discrimination dans tous les aspects de l'achat d'un prêt immobilier. Supposons que nous travaillons pour une institution financière qui accorde des prêts. En tant que scientifiques des données dans cette institution, nous sommes chargés de répondre à la question commerciale de savoir si nous discriminons ou non, puis de rapporter nos résultats au gouvernement fédéral et à la direction.
La première chose que nous faisons est de collecter les données sur chaque personne demandant un prêt, généralement stockées dans une base de données relationnelle. Cela inclurait des facteurs financiers (par exemple, dettes en pourcentage du revenu, pourcentage de la valeur empruntée, score de crédit), caractéristiques du prêt (par exemple, conventionnel vs gouvernemental, durée du prêt) et, bien sûr, des données démographiques, telles que l'âge, la race, le sexe, l'origine nationale, l'état civil et la religion. Pour chaque personne, nous incluons également s'ils ont reçu le prêt ou non (décision).
Il est important de prendre en compte tous les facteurs lors de cette analyse et les techniques statistiques utilisées par les institutions réelles peuvent le faire. Nous allons simplifier et considérer un tableau croisé de la race vs la décision. L'analyse calcule le nombre de personnes de chaque race qui ont reçu le prêt et le nombre qui ne l'ont pas reçu. Nous pouvons ensuite calculer des statistiques de test qui déterminent si les différences dans les pourcentages de chaque race sont statistiquement significatives ou non. Si elles ne sont pas statistiquement significatives, alors il se pourrait qu'il n'y ait aucun biais dans les pratiques de prêt. Il se pourrait également qu'il n'y ait pas assez de données pour montrer un biais qui pourrait exister. Si les résultats sont statistiquement significatifs, alors il y a indication que certaines races sont traitées différemment des autres races (toutes choses étant égales par ailleurs).
Nous créerions ensuite un rapport avec des statistiques descriptives sur les données et les résultats de notre analyse statistique inférentielle. Ce rapport serait soumis aux autorités compétentes pour examen.
Dans cet exemple, la collecte des données et la présentation des résultats sont assez standard. Toutes les informations sont collectées sur la demande de prêt et le rapport est réglementé par le gouvernement fédéral. L'analyse elle-même, en revanche, peut être l'étape la plus compliquée et controversée. Il est difficile d'admettre l'existence de biais, même s'ils sont involontaires. Puisque l'analytique peut être en partie un art, comme lors du nettoyage des données ou de la sélection du bon modèle, il y a souvent des choix concurrentiels (quelle couleur de vert utiliser sur vos murs, par exemple) et les gens peuvent avoir des préférences différentes et légitimes.
Aperçus des clients
Une analyse plus compliquée à réaliser est la modélisation du comportement des clients. Supposons que vous soyez un scientifique des données travaillant pour une entreprise de télécommunications. De nouveaux clients augmentent les revenus et les clients qui partent réduisent nos revenus. L'attrition des clients, ou le churn, peut être causée par de nombreuses choses, dont certaines sont sous notre contrôle. Par exemple, peut-être qu'ils ont eu un mauvais service, de mauvaises expériences avec le centre d'appels, ou qu'ils trouvent le prix trop élevé ; pour ces raisons et bien d'autres, un client peut partir. En tant que scientifique des données dans cette entreprise, notre objectif commercial est de réduire le nombre de clients qui partent. Selon notre modèle simple, considérons les étapes que nous prendrions pour atteindre cet objectif.
La première étape est la collecte des données. Dans notre scénario, cela va probablement être très difficile. Nous ne savons pas nécessairement pourquoi les clients partent, donc nous ne pouvons pas pointer vers les données que nous voulons. Par conséquent, nous devons collecter tous les points de données d'interaction client que nous pouvons. Puisque les clients interagissent avec de nombreuses parties de notre organisation, nous devons identifier, accéder et combiner des données de chacune de ces sources, probablement cloisonnées. Nous voudrions des informations sur les clients eux-mêmes (par exemple, nom, adresse, titre de poste, statut d'emploi, état civil et âge), et des données de Finance sur leurs achats et paiements (par exemple, portefeuille de produits, historique de paiement, durée de service et valeur à vie). Nous voudrions également des données sur leurs interactions avec l'entreprise (par exemple, site web, centre d'appels et contacts en magasin). À moins que l'entreprise de télécommunications n'ait travaillé pendant de nombreuses années pour créer une vue unique du client, et une vue à 360 degrés à cela, il sera très difficile de rassembler toutes ces données en un seul dossier client.
MAIS une fois cela fait (!), nous commençons l'analyse. Les premières étapes sont généralement des statistiques descriptives pour répondre à des questions simples sur le comportement des clients. Quelles étaient les principales raisons de leur départ ? Sont-ils partis volontairement ou non ? Combien de temps restent-ils clients avant de partir ? Ensuite, nous passons à l'analytique avancée et construisons des modèles qui prédisent bien leur probabilité de départ. Ici, cependant, il ne s'agit pas seulement de savoir s'ils vont partir, mais des raisons probables de leur départ.
Une fois le modèle construit, nous l'appliquerons chaque mois à nos clients actifs. À partir du modèle, nous obtenons une probabilité de départ. Nous pourrions décider que toute probabilité supérieure à 80% est importante pour nous à examiner. Ensuite, nous déterminons à partir du modèle, et des statistiques descriptives que nous avons faites, les raisons probables de leur départ. Cette information seule n'est cependant pas suffisante. Nous devons agir dessus et le faire assez tôt pour pouvoir affecter leur comportement. Nous voulons faire quelque chose qui les empêche de partir.
Les informations sur la probabilité et la raison du départ sont transmises à l'équipe de rétention des clients. La présentation des résultats pourrait, dans une organisation moins mature, être effectuée via un tableur. Dans une organisation plus mature devenue plus numérique, ces résultats seront disponibles via une API dans une interface que l'équipe de rétention des clients accède. Ils interagiront avec le client selon la raison probable de leur départ. Peut-être offriront-ils une promotion pour les engager pour quelques années de plus, ou une carte-cadeau en guise de remerciement et pour demander pardon suite à un récent fiasco au centre d'appels.
Après l'intervention, les résultats sont suivis. Sont-ils restés ou sont-ils partis ? S'ils sont restés, combien de temps sont-ils restés ? Les données issues de ces types de questions sont réintégrées dans le modèle. Savoir si et pourquoi ils partent ne suffit pas. Notre véritable objectif souhaité est qu'ils restent des clients précieux pendant longtemps.
Conclusion
Ces deux exemples assez différents montrent le cycle de vie analytique de haut niveau. Ils passent tous les deux par les étapes de collecte des données, d'analyse des données et de présentation des résultats. La manière dont cela est fait diffère pour chaque exemple. Dans la mesure du possible, l'automatisation du processus est la plus souhaitée. Une fois que vous commencez à combiner l'analytique avancée et l'automatisation, vous obtenez une version d'intelligence artificielle spécifique. Une fois cela fait pour ce processus, nous pouvons commencer le suivant. Il y a toujours plus de décisions qui bénéficieraient d'une analyse de données améliorée.
