Construction de data-sets par APIs et Web Service

Durée : 28 heures – Évaluation : Travaux pratiques

 

Présentation

La formation vise à fournir une base solide en matière de manipulation et d’organisation des données. Ce module a pour but de collecter, construire, ranger et présenter des données existantes brutes dans des formats divers. Il permet de placer et différencier les définitions entre supports initialement structurés ou non structurés. Il offre aux élèves l’occasion de savoir présenter des données à l’écrit ou à l’oral. La construction et la représentation des données se font sous la forme de bases de données, de fichiers CSV, d’API, de Web service voire d’autres. Les préparations se font par l’utilisation des outils comme R, Python, tableurs et autres. Ce cours permet de comprendre les enjeux éthiques, et présente des valeurs et organisations exploitables. Il aide à mieux appréhender l’utilisation des données dans l’IA et à appliquer ses compétences dans un contexte professionnel. La création d’APIs en utilisant des technologies pour manipuler, ranger et exploiter les données, permet de les rendre accessibles. Disposer d’une interface pour les données facilite la communication entre divers services informatiques pour respecter les normes et les standards en vigueur. La visualisation et l’organisation des données via des Web services permet à l’ensemble des équipes IT d’une entreprise d’assurer l’interopérabilité des systèmes.

À l’issue du cours, les élèves doivent comprendre comment disposer des valeurs de données en fonction de leurs caractéristiques pour en fournir une base d’informations pour les cours de mathématiques, Big Data, Machine Learning, …

Arthur JAFFRE
Arthur JAFFRE

Arthur est Architecte des systèmes d'information dans les processus industriels, avec une spécialisation en Intelligence Artificielle. Il a débuté sa carrière professionnelle dans l'informatique au sein de la jeune pousse Oky Doky, en qualité de Chargé de projets IA.

Objectifs pédagogiques

  • Comprendre les différents types de data-sets et leur importance dans l’analyse
  • Acquérir des compétences pratiques en manipulation de données avec R et Python
  • Maîtriser l’organisation et le tri des données en appliquant la théorie des ensembles
  • Développer et documenter des APIs et le Web service pour présenter les données

Plan du module

  1. Construction de DataSets – APIs, Web Service
    • Identifier les différentes sources et types de données, avec rôle et impact sur les résultats de l’IA
    • Qu’est-ce qu’un data-set, types et importance dans l’analyse de données, en abordant collecte, importation et gestion des données, incluant les problématiques éthiques
  2. Collecte de données : Sources ouvertes, Web Scraping, et API
    • Importation de données à partir de fichiers (CSV, JSON, XML)
    • Mise en forme, organisation, gestion des biais et des données manquantes
    • Éthique, vie privée et les limites d’utilisation des API (rate limiting)
  3. Outils et applications
    • R et Python pour la manipulation des données
    • Détection, traitement des valeurs manquantes, et importance de la normalisation et de la standardisation des données
    • Intégration API avec package httr ou jsonlite pour appeler une API et transformer la réponse JSON en data.frame
    • Intégration API avec librairie requests pour appeler une API, puis Pandas pour structurer les données
    • Différences entre R vs Python pour la manipulation des données et la consommation d’APIs
  4. Organisation des Données
    • Normalisation et standardisation des données
    • Concepts de création de caractéristiques (feature engineering) et de sélection de caractéristiques
    • Introduction aux jointures et aux relations entre data-sets, fusion de data-sets internes et externes
  5. Script pour la collecte automatisée
    • Appel d’API périodique (toutes les heures) pour collecter des données
    • Stockage des résultats dans un fichier CSV ou une base de données locale (SQLite)
  6. Introduction à l’exposition de données via API
    • Pourquoi exposer ses données via une API ? (Partage, réutilisation, microservices)
    • Conception d’une API simple : endpoint /data qui renvoie le data-set nettoyé au format JSON
    • Flask (Python) ou Plumber (R) pour créer une API minimale qui expose un data-set statique
    • Exposer un data-set via une API Flak/Plumber et la tester avec curl ou un navigateur
  7. Théorie des Ensembles et Présentation des Données
    • Endpoints d’API pour faire des opérations ensemblistes sur les données (/api/union, /api/intersection)
    • Opérations d’ensembles pour filtrer et organiser un data-set
  8. Visualisation Dynamique via API
    • Plotly/Dash (Python) ou Shiny (R) pour créer des tableaux de bord interactifs
    • Intégration de la visualisation des données avec des bibliothèques comme Bokeh ou Dash pour des applications web
    • Dashboard pour se connecter à l’API pour afficher les données en temps réel
  9. Documentation des APIs
    • Importance de la documentation : Développer, maintenir, et réutiliser
    • Swagger/OpenAPI : Définition standardisée d’une API
    • Documenter l’API Flask/Plumber en utilisant Flask-RESTx (Python) ou swagger ( (via plumber)
  10. Structurer une Présentation de Data-sets
    • Comment rédiger un rapport de résultats clair et concis
    • Présentation des résultats avec conclusions, recommandations
    • Inclure la documentation de l’API (Swagger) et les métadonnées
  11. Sécurisation des API
    • Pourquoi sécuriser une API ? (Protection des données, authentification, autorisation)
    • Mécanismes de sécurité (Clé API, authentification par Token, délégation d’autorisation, validation des entrées, limitation du nombre de requêtes, chiffrement des échanges, ….)

Bibliographie et ressources

  • FastAPI en Action – Créer des API REST haute performance et des microservices avec Python et les outils modernes (Adrien Colvay, éditeur : Independently published, ISBN-13 : 9798259312128 – 2026)
  • L’intelligence artificielle décryptée – Comprendre les enjeux et risques éthiques de l’IA pour mieux l’appréhender (Kathleen Desveaud, éditeur : éditions EMS, ISBN : 9782376879619, 2376879612 – 2024)
  • FastAPI (Bill Lubanovic, éditeur : O’Reilly Media, ISBN : 9781098135478, 1098135474 – 2023)
  • Les fondamentaux de la visualisation de données (Tiffany Andry, Suzanne Kieffer, François Lambotte, éditeur : De Boeck supérieur, EAN 9782807341579, ISBN 978-2-8073-4157-9 – 2022)
  • Pratique de la data science avec R – Arranger, visualiser, analyser et présenter des données ( Christian Paroissin, éditeur : éditions Ellipses, ISBN : 9782340054837, 2340054834 – 2021)
  • Devenez un data pionnier – Comprendre et exploiter les données en entreprise (Gauthier Vasseur – MARDAGA – ISBN 978-2-8047-2033-9, 2804720330 – 2021)
  • Data visualisation de l’extraction des données à leur représentation graphique (Nathan Yau, traducteur/contributeur : Xavier Guesnu, éditeur : Eyrolles, ISBN : 9782212135992, 2212135998 – 2013)

Ce module fait partie de notre parcours Mastère Intelligence Artificielle (Bac+5) en première année.

Plutôt envie de découvrir ce module en immersion avant de vous inscrire ?
Participez à une de nos prochaines journées découvertes.