DP-900 · Azure Data Fundamentals
25 questions DP-900 corrigées
Des questions au format exact de l'examen Microsoft DP-900, chacune avec sa bonne réponse et son explication. Gratuit, sans inscription, sans compte à créer.
Analytique de données
1. Quel service Azure est une plateforme d'analytique unifiée qui combine l'entreposage de données d'entreprise et l'analytique du Big Data ?
Réponse : Azure Synapse Analytics
Synapse Analytics réunit entrepôt d'entreprise et traitement Big Data dans une même plateforme. Blob Storage ne fait que stocker, Cosmos DB sert des charges opérationnelles à faible latence, et Logic Apps automatise des flux applicatifs.
Concepts de données
2. Quel type de données est le mieux décrit comme organisé selon un schéma fixe de lignes et de colonnes, comme dans une table de base de données relationnelle ?
Réponse : Données structurées
Un schéma fixe de lignes et de colonnes définit les données structurées. Le semi-structuré porterait des clés sans schéma imposé, le non structuré aucun repère interne, et des données binaires brutes n'offriraient rien à interroger.
Données non-relationnelles
3. Quelle caractéristique définit fondamentalement une base de données NoSQL par rapport à une base relationnelle ?
Réponse : Elle ne stocke pas de schéma rigide et fixe imposé à toutes les données
Le propre du NoSQL est de ne pas imposer un schéma identique à tous les enregistrements. Organiser systématiquement en tables normalisées avec clés étrangères décrit le relationnel, l'usage du SQL n'est pas obligatoire, et les transactions ACID sur plusieurs tables ne sont pas garanties partout.
Données relationnelles
4. Dans un modèle de données relationnel, comment sont organisées les données au sein d'une base ?
Réponse : Sous forme de tables composées de lignes et de colonnes
Le modèle relationnel range les données en tables : des lignes pour les enregistrements, des colonnes pour les attributs. Les documents JSON imbriqués relèvent des bases de documents, les nœuds et arêtes des bases de graphes, et les paires clé-valeur d'un magasin plus simple encore.
Analytique de données
5. Comment définit-on principalement un data warehouse (entrepôt de données) ?
Réponse : Un dépôt central de données structurées optimisé pour l'analytique et le reporting
L'entrepôt est un dépôt central de données structurées, organisé pour l'analyse et le reporting. Une base transactionnelle sert les opérations quotidiennes, un stockage de fichiers bruts sans schéma décrit un lac, et la messagerie temps réel répond à un autre besoin.
Concepts de données
6. Un fichier JSON contenant des objets dont les propriétés varient d'un enregistrement à l'autre est un exemple de quel type de données ?
Réponse : Données semi-structurées
Des propriétés qui varient d'un objet à l'autre, mais toujours nommées : c'est du semi-structuré. Des données structurées imposeraient les mêmes colonnes partout, des données relationnelles des tables liées, et du non structuré n'offrirait aucune clé.
Données non-relationnelles
7. Dans un magasin de données de type clé-valeur, comment sont organisées les données ?
Réponse : Chaque valeur est associée à une clé unique servant d'identifiant de recherche
Le magasin clé-valeur associe un identifiant unique à une valeur, et l'accès passe par cette clé. Les nœuds reliés par des arêtes décrivent un graphe, un arbre XML validé par un schéma un document, et des lignes et colonnes typées un modèle relationnel.
Données relationnelles
8. Que représente une ligne dans une table relationnelle ?
Réponse : Une instance unique de l'entité modélisée
Une ligne est une occurrence de l'entité : un client précis, une commande précise. Un index accélère la recherche sans représenter de donnée métier, une contrainte d'intégrité pose une règle, et le type de donnée décrit une colonne, pas une ligne.
Analytique de données
9. Quelle est la caractéristique principale d'un data lake (lac de données) ?
Réponse : Il stocke de grands volumes de données brutes dans divers formats, structurés ou non
Un lac de données accueille des fichiers bruts de tout format, sans schéma imposé à l'écriture. Il n'est réservé ni aux transactions bancaires, ni aux données strictement relationnelles, et n'applique justement aucun schéma rigide au moment de l'ingestion.
Concepts de données
10. Parmi les éléments suivants, lequel est un exemple typique de données non structurées ?
Réponse : Une vidéo ou une image
Une image ou une vidéo n'a pas d'organisation interne exploitable : données non structurées. Un document JSON porte des clés, un fichier CSV des colonnes, et une table SQL un schéma complet — trois exemples de données au contraire bien organisées.
Données non-relationnelles
11. Quel type de données non-relationnelles est le mieux représenté par un document JSON ?
Réponse : Une base de données documentaire
Un document JSON avec ses champs propres appelle une base documentaire. Une base relationnelle imposerait le même schéma à tous, une base en colonnes viserait l'agrégation sur de gros volumes, et une base graphe se concentrerait sur les relations entre entités.
Données relationnelles
12. À quoi sert une clé primaire dans une table relationnelle ?
Réponse : Identifier de manière unique chaque ligne de la table
La clé primaire identifie chaque ligne sans ambiguïté et n'accepte jamais de valeur nulle. Elle ne trie pas les colonnes, ne chiffre rien et n'a aucun lien avec un compte de stockage : son unique fonction est de garantir l'unicité de l'enregistrement.
Analytique de données
13. Que signifie l'acronyme ETL dans le contexte de l'intégration de données ?
Réponse : Extract, Transform, Load
ETL signifie Extract, Transform, Load : extraire, transformer, puis charger dans la cible. Les autres formules mélangent des mots plausibles — transfer, log, launch, encode — mais aucune ne désigne le processus d'intégration réellement décrit par cet acronyme.
Concepts de données
14. Quelle charge de travail est optimisée pour un grand volume de petites transactions rapides comme les insertions et mises à jour d'enregistrements ?
Réponse : OLTP (traitement transactionnel en ligne)
OLTP encaisse un flot d'écritures courtes avec une latence minimale : c'est le rôle d'une caisse ou d'un guichet. OLAP et le data warehousing font l'inverse — de longues lectures sur de gros volumes agrégés — et le traitement par lots accumule avant de traiter, donc sans réponse immédiate.
Données non-relationnelles
15. Qu'est-ce qu'Azure Cosmos DB ?
Réponse : Un service de base de données NoSQL distribué à l'échelle mondiale et multi-modèle
Cosmos DB est la base NoSQL multi-modèle d'Azure, répliquée à l'échelle mondiale. Ce n'est ni un moteur relationnel compatible T-SQL, ni un outil de visualisation, ni un service de stockage de fichiers volumineux — ce dernier rôle revient à Blob Storage.
Données relationnelles
16. Quel est le rôle d'une clé étrangère (foreign key) ?
Réponse : Établir un lien référentiel vers la clé primaire d'une autre table
La clé étrangère fait deux choses : elle exprime la relation entre deux tables, et elle la fait respecter — impossible d'enregistrer une commande pour un client inexistant, ni de supprimer ce client sans traiter ses commandes. C'est l'intégrité référentielle.
Analytique de données
17. Quelle est la différence clé entre ELT et ETL ?
Réponse : Dans ELT, les données sont chargées d'abord puis transformées dans le système cible
En ELT, on charge d'abord puis on transforme dans le système cible, dont on exploite la puissance de calcul. L'extraction reste bien présente, la transformation aussi, et rien ne limite l'approche aux données non structurées.
Concepts de données
18. Quel type de système est spécifiquement conçu pour l'analyse de grands volumes de données historiques et l'agrégation en vue de la prise de décision ?
Réponse : OLAP
OLAP agrège des historiques pour éclairer une décision. OLTP viserait des transactions unitaires, un cache en mémoire accélère des accès répétés sans rien analyser, et une base de messagerie ne fait que transporter des messages.
Données non-relationnelles
19. Quelle API d'Azure Cosmos DB est recommandée par Microsoft pour les nouveaux projets et travaille nativement avec des documents JSON ?
Réponse : API pour NoSQL
L'API pour NoSQL est l'API native de Cosmos DB, recommandée pour tout nouveau projet, et manipule des documents JSON. Les API pour Cassandra, Table et Gremlin existent surtout pour accueillir des applications déjà écrites pour ces modèles.
Données relationnelles
20. Quel est l'objectif principal de la normalisation d'une base de données relationnelle ?
Réponse : Réduire la redondance des données et améliorer l'intégrité
Normaliser, c'est répartir l'information pour qu'une donnée ne soit écrite qu'une fois, ce qui évite les anomalies de mise à jour. Augmenter la duplication va dans le sens inverse, supprimer les relations casserait le modèle, et rien n'est converti en format non structuré.
Analytique de données
21. Quel service Azure est principalement dédié à l'orchestration de pipelines ETL/ELT dans le cloud ?
Réponse : Azure Data Factory
Data Factory crée, planifie et orchestre les pipelines d'intégration. Azure Monitor surveille les ressources, Key Vault protège les secrets, et le service d'annuaire gère les identités : aucun ne déplace de données.
Concepts de données
22. Dans une organisation, quel rôle est principalement responsable de la conception et de la mise en place des pipelines d'ingestion et de transformation des données ?
Réponse : Data engineer (ingénieur de données)
L'ingénieur de données construit les tuyaux : ingestion, transformation, alimentation des entrepôts. L'administrateur de base de données veille sur une base existante, l'analyste exploite les données une fois disponibles, et le data scientist bâtit des modèles à partir de ce que le pipeline a livré.
Données non-relationnelles
23. Quelle API d'Azure Cosmos DB permet de stocker et interroger des données sous forme de graphe ?
Réponse : API pour Gremlin
Gremlin parcourt des sommets et des arêtes : c'est l'API de graphe. L'API pour NoSQL et celle pour MongoDB manipulent des documents, l'API pour Table des paires clé-valeur — trois modèles qui ne savent pas suivre une relation de proche en proche.
Données relationnelles
24. Quel est le principal avantage d'un index sur une table ?
Réponse : Accélérer la recherche et la récupération des lignes
Un index accélère la recherche, au prix d'un peu d'espace et d'écritures plus lentes. Il ne chiffre aucune colonne, ne réduit pas la taille du fichier de données, et n'interdit les doublons que s'il est explicitement déclaré unique.
Analytique de données
25. Dans Power BI, à quoi sert principalement un rapport (report) ?
Réponse : Présenter des visualisations interactives détaillées sur une ou plusieurs pages
Le rapport est l'espace d'exploration : plusieurs pages, des filtres, des visuels qui réagissent les uns aux autres. C'est là qu'on cherche une réponse — alors que le tableau de bord, lui, se contente de synthétiser sur une seule page.