Logo DummyExamsDummyExams
Logo AWS

Entraînement gratuit · sans inscription

30 questions d'entraînement AWS DAS-C01 gratuites

De vraies questions d'entraînement pour l'examen AWS Data Analytics (DAS-C01), avec les réponses et des explications détaillées. Mis à jour en 2026.

Questions gratuites

30

Score de réussite

750 sur 1000

Durée de l'examen

170 minutes

Banque de questions

Plus de 83 questions

Voici 30 vraies questions d'entraînement pour l'examen AWS Data Analytics (DAS-C01). Chaque question affiche la bonne réponse et une explication détaillée lorsque vous la révélez. Servez-vous en pour évaluer votre niveau : si vous obtenez moins de 70 % à ces 30 questions, prévoyez au moins 4 semaines de révision supplémentaires avant de réserver.

Questions d'entraînement DAS-C01

  1. FreePracticeQuiz.questionLabelStorage

    Une application de streaming lit des données depuis Amazon Kinesis Data Streams et les écrit immédiatement dans un bucket Amazon S3 toutes les 10 secondes. L'application lit les données de centaines de shards. L'intervalle de traitement par lots ne peut pas être modifié en raison d'une autre exigence. Les données sont consultées via Amazon Athena. Les utilisateurs constatent une dégradation des performances des requêtes au fil du temps. Quelle action peut aider à améliorer les performances des requêtes ?

    A
    Fusionner les fichiers dans Amazon S3 pour former des fichiers plus volumineux.
    B
    Augmenter le nombre de shards dans Kinesis Data Streams.
    C
    Ajouter de la mémoire et de la capacité CPU à l'application de streaming.
    D
    Écrire les fichiers dans plusieurs buckets S3.
  2. FreePracticeQuiz.questionLabelAnalytics

    Une équipe de data scientists prévoit d'analyser des données de tendances de marché pour la nouvelle stratégie d'investissement de leur entreprise. Ces données de tendances proviennent de cinq sources différentes et en gros volumes. L'équipe souhaite utiliser Amazon Kinesis pour répondre à ce cas d'usage. Elle utilise des requêtes de type SQL pour analyser les tendances et souhaite envoyer des notifications à partir de certains motifs significatifs observés. Par ailleurs, les data scientists veulent enregistrer les données dans Amazon S3 à des fins d'archivage et de retraitement historique, et utiliser autant que possible des services managés AWS. L'équipe souhaite mettre en œuvre la solution la moins coûteuse. Quelle solution répond à ces exigences ?

    A
    Publier les données dans un seul flux de données Kinesis. Déployer une application personnalisée utilisant la Kinesis Client Library (KCL) pour analyser les tendances et envoyer les notifications via Amazon SNS. Configurer Kinesis Data Firehose sur le flux de données Kinesis pour persister les données dans un bucket S3.
    B
    Publier les données dans un seul flux de données Kinesis. Déployer Kinesis Data Analytics sur le flux pour analyser les tendances et configurer une fonction AWS Lambda en sortie pour envoyer les notifications via Amazon SNS. Configurer Kinesis Data Firehose sur le flux de données Kinesis pour persister les données dans un bucket S3.
    C
    Publier les données dans deux flux de données Kinesis. Déployer Kinesis Data Analytics sur le premier flux pour analyser les tendances et configurer une fonction AWS Lambda en sortie pour envoyer les notifications via Amazon SNS. Configurer Kinesis Data Firehose sur le second flux de données Kinesis pour persister les données dans un bucket S3.
    D
    Publier les données dans deux flux de données Kinesis. Déployer une application personnalisée utilisant la Kinesis Client Library (KCL) sur le premier flux pour analyser les tendances et envoyer les notifications via Amazon SNS. Configurer Kinesis Data Firehose sur le second flux de données Kinesis pour persister les données dans un bucket S3.
  3. FreePracticeQuiz.questionLabelDatabases

    Une grande entreprise reçoit tout au long de la journée des fichiers de partenaires externes sur Amazon EC2. En fin de journée, les fichiers sont fusionnés en un seul fichier, compressés au format gzip et téléversés vers Amazon S3. La taille totale de tous les fichiers avoisine 100 Go par jour. Une fois les fichiers téléversés vers Amazon S3, un programme AWS Batch exécute une commande COPY pour charger les fichiers dans un cluster Amazon Redshift. Quelle modification du programme accélérera le processus COPY ?

    A
    Téléverser les fichiers individuels vers Amazon S3 et exécuter la commande COPY dès que les fichiers sont disponibles.
    B
    Répartir les fichiers de manière que leur nombre soit un multiple du nombre de slices du cluster Amazon Redshift. Compresser en gzip et téléverser les fichiers vers Amazon S3. Exécuter la commande COPY sur ces fichiers.
    C
    Répartir les fichiers de manière que leur nombre soit un multiple du nombre de nœuds de calcul du cluster Amazon Redshift. Compresser en gzip et téléverser les fichiers vers Amazon S3. Exécuter la commande COPY sur ces fichiers.
    D
    Appliquer un sharding en découpant les fichiers de sorte que les colonnes distkey ayant les mêmes valeurs se retrouvent dans le même fichier. Compresser en gzip et téléverser les fichiers shardés vers Amazon S3. Exécuter la commande COPY sur ces fichiers.
  4. FreePracticeQuiz.questionLabelAnalytics

    Dans une entreprise, une unité métier téléverse des fichiers .csv vers un bucket Amazon S3. L'équipe de la plateforme de données a mis en place un crawler AWS Glue pour la découverte et la création des tables et des schémas. Un job AWS Glue écrit les données traitées des tables créées vers une base de données Amazon Redshift. Le job AWS Glue gère correctement le mappage des colonnes et la création de la table Amazon Redshift. Lorsque le job AWS Glue est relancé pour une raison quelconque dans la journée, des doublons apparaissent dans la table Amazon Redshift. Quelle solution mettra à jour la table Redshift sans doublons lors des relances de jobs ?

    A
    Modifier le job AWS Glue pour copier les lignes dans une table de préparation (staging). Ajouter des commandes SQL en postactions dans la classe DynamicFrameWriter pour remplacer les lignes existantes de la table principale.
    B
    Charger les données précédemment insérées dans une base MySQL depuis le job AWS Glue. Réaliser une opération d'upsert dans MySQL et copier les résultats vers la table Amazon Redshift.
    C
    Utiliser l'API dropDuplicates() des DataFrame d'Apache Spark pour éliminer les doublons, puis écrire les données dans Amazon Redshift.
    D
    Utiliser la transformation intégrée ResolveChoice d'AWS Glue pour sélectionner la valeur la plus récente de la colonne.
  5. FreePracticeQuiz.questionLabelDatabases

    Une compagnie aérienne stocke des données au format .csv dans Amazon S3 avec un AWS Glue Data Catalog. Les analystes de données souhaitent joindre ces données à des données de centre d'appels stockées dans Amazon Redshift, dans le cadre d'un traitement par lots quotidien. Le cluster Amazon Redshift est déjà fortement sollicité. La solution doit être managée, serverless, performante et minimiser la charge sur le cluster Amazon Redshift existant. Elle doit également demander un minimum d'effort et de développement. Quelle solution répond à ces exigences ?

    A
    Décharger les données du centre d'appels depuis Amazon Redshift vers Amazon S3 à l'aide d'une fonction AWS Lambda. Réaliser la jointure avec des scripts ETL AWS Glue.
    B
    Exporter les données du centre d'appels depuis Amazon Redshift avec un shell Python dans AWS Glue. Réaliser la jointure avec des scripts ETL AWS Glue.
    C
    Créer une table externe avec Amazon Redshift Spectrum pour les données du centre d'appels et réaliser la jointure avec Amazon Redshift.
    D
    Exporter les données du centre d'appels depuis Amazon Redshift vers Amazon EMR avec Apache Sqoop. Réaliser la jointure avec Apache Hive.
  6. FreePracticeQuiz.questionLabelDatabases

    Une grande entreprise de covoiturage compte des milliers de chauffeurs dans le monde qui servent chaque jour des millions de clients uniques. L'entreprise a décidé de migrer un data mart existant vers Amazon Redshift. Le schéma existant comprend les tables suivantes : une table de faits trips contenant les informations sur les courses terminées ; une table de dimension drivers pour les profils des chauffeurs ; une table de faits customers contenant les informations de profil des clients. L'entreprise analyse les détails des courses par date et par destination afin d'examiner la rentabilité par région. Les données des chauffeurs changent rarement. Les données des clients changent fréquemment. Quelle conception de tables offre les meilleures performances de requête ?

    A
    Utiliser DISTSTYLE KEY (destination) pour la table trips avec un tri par date. Utiliser DISTSTYLE ALL pour les tables drivers et customers.
    B
    Utiliser DISTSTYLE EVEN pour la table trips avec un tri par date. Utiliser DISTSTYLE ALL pour la table drivers. Utiliser DISTSTYLE EVEN pour la table customers.
    C
    Utiliser DISTSTYLE KEY (destination) pour la table trips avec un tri par date. Utiliser DISTSTYLE ALL pour la table drivers. Utiliser DISTSTYLE EVEN pour la table customers.
    D
    Utiliser DISTSTYLE EVEN pour la table drivers avec un tri par date. Utiliser DISTSTYLE ALL pour les deux tables de faits.
  7. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise éditrice de logiciels héberge une application sur AWS et publie de nouvelles fonctionnalités chaque semaine. Dans le cadre du processus de test de l'application, il faut développer une solution qui analyse les journaux de chaque instance Amazon EC2 afin de vérifier que l'application fonctionne comme prévu après chaque déploiement. La solution de collecte et d'analyse doit être hautement disponible et capable d'afficher les nouvelles informations avec un délai minimal. Quelle méthode l'entreprise doit-elle utiliser pour collecter et analyser les journaux ?

    A
    Activer la supervision détaillée sur Amazon EC2, utiliser l'agent Amazon CloudWatch pour stocker les journaux dans Amazon S3 et utiliser Amazon Athena pour une analyse de journaux rapide et interactive.
    B
    Utiliser l'agent Amazon Kinesis Producer Library (KPL) sur Amazon EC2 pour collecter et envoyer les données vers Kinesis Data Streams, puis les transférer vers Amazon Elasticsearch Service et les visualiser avec Amazon QuickSight.
    C
    Utiliser l'agent Amazon Kinesis Producer Library (KPL) sur Amazon EC2 pour collecter et envoyer les données vers Kinesis Data Firehose, puis les transférer vers Amazon Elasticsearch Service et Kibana.
    D
    Utiliser les abonnements Amazon CloudWatch pour accéder à un flux de journaux en temps réel et les faire livrer à Amazon Kinesis Data Streams, puis transférer les données vers Amazon Elasticsearch Service et Kibana.
  8. FreePracticeQuiz.questionLabelDatabases

    Une entreprise industrielle collecte depuis un an des données de capteurs IoT provenant d'équipements de son atelier et les stocke dans Amazon Redshift pour une analyse quotidienne. Un analyste de données a déterminé qu'avec un débit d'ingestion attendu d'environ 2 To par jour, le cluster sera sous-dimensionné dans moins de 4 mois. Une solution à long terme est nécessaire. L'analyste indique que la plupart des requêtes ne portent que sur les 13 derniers mois de données, mais qu'il existe aussi des rapports trimestriels qui doivent interroger l'ensemble des données générées ces 7 dernières années. Le directeur technique (CTO) s'inquiète des coûts, de la charge d'administration et des performances d'une solution à long terme. Quelle solution l'analyste de données doit-il retenir pour répondre à ces exigences ?

    A
    Créer un job quotidien dans AWS Glue pour effectuer un UNLOAD des enregistrements de plus de 13 mois vers Amazon S3 et les supprimer d'Amazon Redshift. Créer une table externe dans Amazon Redshift pointant vers l'emplacement S3. Utiliser Amazon Redshift Spectrum pour joindre les données de plus de 13 mois.
    B
    Prendre un instantané du cluster Amazon Redshift. Restaurer le cluster vers un nouveau cluster utilisant des nœuds dense storage offrant une capacité de stockage supplémentaire.
    C
    Exécuter une instruction CREATE TABLE AS SELECT (CTAS) pour déplacer les enregistrements de plus de 13 mois vers des données partitionnées par trimestre dans Amazon Redshift Spectrum adossé à Amazon S3.
    D
    Décharger toutes les tables d'Amazon Redshift vers un bucket Amazon S3 en utilisant S3 Intelligent-Tiering. Utiliser AWS Glue pour explorer l'emplacement du bucket S3 afin de créer des tables externes dans un AWS Glue Data Catalog. Créer un cluster Amazon EMR avec Auto Scaling pour les besoins d'analyse quotidiens et utiliser Amazon Athena pour les rapports trimestriels, les deux s'appuyant sur le même AWS Glue Data Catalog.
  9. FreePracticeQuiz.questionLabelAnalytics

    Une société financière héberge un data lake dans Amazon S3 et un entrepôt de données sur un cluster Amazon Redshift. L'entreprise utilise Amazon QuickSight pour créer des tableaux de bord et souhaite sécuriser l'accès depuis son Active Directory sur site vers Amazon QuickSight. Comment les données doivent-elles être sécurisées ?

    A
    Utiliser un connecteur Active Directory et l'authentification unique (SSO) dans un environnement de réseau d'entreprise.
    B
    Utiliser un point de terminaison VPC pour se connecter à Amazon S3 depuis Amazon QuickSight et un rôle IAM pour s'authentifier auprès d'Amazon Redshift.
    C
    Établir une connexion sécurisée en créant un point de terminaison S3 pour connecter Amazon QuickSight et un point de terminaison VPC pour se connecter à Amazon Redshift.
    D
    Placer Amazon QuickSight et Amazon Redshift dans le groupe de sécurité et utiliser un point de terminaison Amazon S3 pour connecter Amazon QuickSight à Amazon S3.
  10. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise américaine de vente de baskets a lancé son site web mondial. Toutes les données transactionnelles sont stockées dans Amazon RDS et les données historiques de transactions consolidées le sont dans Amazon Redshift, dans la région us-east-1. L'équipe de business intelligence (BI) souhaite améliorer l'expérience utilisateur en proposant un tableau de bord des tendances de baskets. Elle décide d'utiliser Amazon QuickSight pour afficher les tableaux de bord du site. Pendant le développement, une équipe au Japon a provisionné Amazon QuickSight dans ap-northeast-1. L'équipe rencontre des difficultés pour connecter Amazon QuickSight depuis ap-northeast-1 à Amazon Redshift dans us-east-1. Quelle solution résoudra ce problème tout en répondant aux exigences ?

    A
    Dans la console Amazon Redshift, configurer les instantanés inter-régions et définir ap-northeast-1 comme région de destination. Restaurer le cluster Amazon Redshift à partir de l'instantané et le connecter à Amazon QuickSight lancé dans ap-northeast-1.
    B
    Créer un point de terminaison VPC entre le VPC d'Amazon QuickSight et le VPC d'Amazon Redshift afin qu'Amazon QuickSight puisse accéder aux données d'Amazon Redshift.
    C
    Créer une chaîne de connexion au point de terminaison Amazon Redshift incluant l'information de région et l'utiliser dans Amazon QuickSight pour se connecter à Amazon Redshift.
    D
    Créer un nouveau groupe de sécurité pour Amazon Redshift dans us-east-1 avec une règle entrante autorisant l'accès depuis la plage d'adresses IP appropriée des serveurs Amazon QuickSight dans ap-northeast-1.
  11. FreePracticeQuiz.questionLabelAnalytics

    Une compagnie d'assurance dispose de données brutes au format JSON envoyées sans planification prédéfinie, via un flux de diffusion Amazon Kinesis Data Firehose, vers un bucket Amazon S3. Un crawler AWS Glue est planifié toutes les 8 heures pour mettre à jour le schéma dans le catalogue de données des tables stockées dans le bucket S3. Les analystes de données analysent les données avec Apache Spark SQL sur Amazon EMR configuré avec AWS Glue Data Catalog comme metastore. Les analystes signalent que, parfois, les données qu'ils reçoivent sont obsolètes. Un ingénieur de données doit leur donner accès aux données les plus récentes. Quelle solution répond à ces exigences ?

    A
    Créer un schéma externe fondé sur AWS Glue Data Catalog sur le cluster Amazon Redshift existant afin d'interroger les nouvelles données dans Amazon S3 avec Amazon Redshift Spectrum.
    B
    Utiliser Amazon CloudWatch Events avec l'expression rate (1 hour) pour exécuter le crawler AWS Glue toutes les heures.
    C
    Avec l'AWS CLI, modifier la planification d'exécution du crawler AWS Glue de 8 heures à 1 minute.
    D
    Exécuter le crawler AWS Glue depuis une fonction AWS Lambda déclenchée par une notification d'événement S3:ObjectCreated:* sur le bucket S3.
  12. FreePracticeQuiz.questionLabelAnalytics

    Un analyste de données utilise AWS Glue pour organiser, nettoyer, valider et formater un jeu de données de 200 Go. Il a déclenché le job avec le type de worker Standard. Après 3 heures, le statut du job AWS Glue est toujours RUNNING. Les journaux d'exécution n'affichent aucun code d'erreur. L'analyste souhaite réduire la durée d'exécution du job sans surprovisionner. Quelles actions doit-il entreprendre ?

    A
    Activer les job bookmarks dans AWS Glue pour estimer le nombre d'unités de traitement de données (DPU). En fonction des métriques relevées, augmenter la valeur du paramètre de job executor-cores.
    B
    Activer les métriques de job dans AWS Glue pour estimer le nombre d'unités de traitement de données (DPU). En fonction des métriques relevées, augmenter la valeur du paramètre de job maximum capacity.
    C
    Activer les métriques de job dans AWS Glue pour estimer le nombre d'unités de traitement de données (DPU). En fonction des métriques relevées, augmenter la valeur du paramètre de job spark.yarn.executor.memoryOverhead.
    D
    Activer les job bookmarks dans AWS Glue pour estimer le nombre d'unités de traitement de données (DPU). En fonction des métriques relevées, augmenter la valeur du paramètre de job num-executors.
  13. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise diffuse en streaming ses données de facturation à fort volume (100 Mo/s) vers Amazon Kinesis Data Streams. Un analyste de données a partitionné les données sur account_id afin que tous les enregistrements d'un même compte aillent vers le même shard Kinesis et que l'ordre soit préservé. En construisant un consommateur personnalisé avec le SDK Java de Kinesis, l'analyste remarque que, parfois, les messages arrivent dans le désordre pour un account_id. Après investigation, il découvre que les messages désordonnés semblent provenir de shards différents pour un même account_id et qu'ils apparaissent lors d'un redimensionnement du flux. Quelle est l'explication de ce comportement et quelle est la solution ?

    A
    Il y a plusieurs shards dans un flux et l'ordre doit être préservé au sein du shard. L'analyste doit s'assurer qu'il n'y a qu'un seul shard dans le flux et qu'aucun redimensionnement n'est effectué.
    B
    Le processus de génération de la clé de hachage des enregistrements ne fonctionne pas correctement. L'analyste doit générer une clé de hachage explicite côté producteur afin que les enregistrements soient dirigés précisément vers le bon shard.
    C
    Les enregistrements ne sont pas reçus dans l'ordre par Kinesis Data Streams. Le producteur doit utiliser l'appel d'API PutRecords au lieu de PutRecord avec le paramètre SequenceNumberForOrdering.
    D
    Le consommateur ne termine pas le traitement du shard parent avant de traiter les shards enfants après un redimensionnement du flux. L'analyste doit traiter intégralement le shard parent avant de traiter les shards enfants.
  14. FreePracticeQuiz.questionLabelStorage

    Une entreprise de transport utilise des capteurs IoT installés sur des camions pour collecter des données de véhicules pour sa flotte de livraison mondiale. Elle envoie actuellement les données des capteurs sous forme de petits fichiers .csv vers Amazon S3. Les fichiers sont ensuite chargés dans un cluster Amazon Redshift de 10 nœuds à deux slices par nœud, et interrogés à la fois par Amazon Athena et Amazon Redshift. L'entreprise souhaite optimiser les fichiers pour réduire le coût des requêtes et accélérer le chargement des données dans le cluster Amazon Redshift. Quelle solution répond à ces exigences ?

    A
    Utiliser AWS Glue pour convertir tous les fichiers .csv en un seul gros fichier Apache Parquet. Charger le fichier dans Amazon Redshift avec COPY et l'interroger avec Athena depuis Amazon S3.
    B
    Utiliser Amazon EMR pour convertir chaque fichier .csv en Apache Avro. Charger les fichiers dans Amazon Redshift avec COPY et les interroger avec Athena depuis Amazon S3.
    C
    Utiliser AWS Glue pour convertir les fichiers .csv en un seul gros fichier Apache ORC. Charger le fichier dans Amazon Redshift avec COPY et l'interroger avec Athena depuis Amazon S3.
    D
    Utiliser AWS Glue pour convertir les fichiers .csv en Apache Parquet afin de créer 20 fichiers Parquet. Charger les fichiers dans Amazon Redshift avec COPY et les interroger avec Athena depuis Amazon S3.
  15. FreePracticeQuiz.questionLabelStorage

    Une entreprise migre ses jobs ETL existants sur site vers Amazon EMR. Le code se compose d'une série de jobs écrits en Java. L'entreprise doit réduire la charge des administrateurs système sans modifier le code sous-jacent. En raison de la sensibilité des données, la conformité impose l'utilisation du chiffrement du volume racine sur tous les nœuds du cluster. Les standards de l'entreprise exigent que les environnements soient provisionnés via AWS CloudFormation lorsque c'est possible. Quelle solution satisfait ces exigences ?

    A
    Installer Hadoop open source sur des instances Amazon EC2 dont les volumes racine sont chiffrés. Configurer le cluster dans le modèle CloudFormation.
    B
    Utiliser un modèle CloudFormation pour lancer un cluster EMR. Dans la section de configuration du cluster, définir une action d'amorçage pour activer TLS.
    C
    Créer une AMI personnalisée avec des volumes racine chiffrés. Configurer Amazon EMR pour utiliser cette AMI personnalisée via la propriété CustomAmiId dans le modèle CloudFormation.
    D
    Utiliser un modèle CloudFormation pour lancer un cluster EMR. Dans la section de configuration du cluster, définir une action d'amorçage qui chiffre le volume racine de chaque nœud.
  16. FreePracticeQuiz.questionLabelSecurity & Compliance

    Un hôpital utilise des capteurs médicaux portables pour collecter des données auprès des patients. Il conçoit une solution en quasi-temps réel capable d'ingérer les données de manière sécurisée et à grande échelle. La solution doit également pouvoir supprimer les informations médicales protégées (PHI) des patients du flux de données et stocker les données dans un stockage durable. Quelle solution répond à ces exigences avec le moins de charge opérationnelle ?

    A
    Ingérer les données avec Amazon Kinesis Data Streams, qui invoque une fonction AWS Lambda utilisant la Kinesis Client Library (KCL) pour supprimer toutes les PHI. Écrire les données dans Amazon S3.
    B
    Ingérer les données avec Amazon Kinesis Data Firehose pour les écrire dans Amazon S3. Faire déclencher par Amazon S3 une fonction AWS Lambda qui analyse les données des capteurs pour supprimer toutes les PHI dans Amazon S3.
    C
    Ingérer les données avec Amazon Kinesis Data Streams pour les écrire dans Amazon S3. Faire lancer par le flux de données une fonction AWS Lambda qui analyse les données des capteurs et supprime toutes les PHI dans Amazon S3.
    D
    Ingérer les données avec Amazon Kinesis Data Firehose pour les écrire dans Amazon S3. Mettre en place une fonction AWS Lambda de transformation qui analyse les données des capteurs pour supprimer toutes les PHI.
  17. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise de médias souhaite réaliser de l'apprentissage automatique et de l'analytique sur les données de son data lake Amazon S3. Deux besoins de transformation de données permettront aux consommateurs internes de créer des rapports : des transformations quotidiennes de 300 Go de données de formats variés arrivant dans Amazon S3 à heure planifiée ; des transformations ponctuelles de plusieurs téraoctets de données archivées dans le data lake S3. Quelle combinaison de solutions répond de manière économique aux exigences de transformation des données de l'entreprise ? (Choisissez TROIS réponses)

    A
    Pour les données quotidiennes entrantes, utiliser des crawlers AWS Glue pour analyser et identifier le schéma.
    B
    Pour les données quotidiennes entrantes, utiliser Amazon Athena pour analyser et identifier le schéma.
    C
    Pour les données quotidiennes entrantes, utiliser Amazon Redshift pour réaliser les transformations.
    D
    Pour les données quotidiennes entrantes, utiliser des workflows AWS Glue avec des jobs AWS Glue pour réaliser les transformations.
    E
    Pour les données archivées, utiliser Amazon EMR pour réaliser les transformations de données.
    F
    Pour les données archivées, utiliser Amazon SageMaker pour réaliser les transformations de données.
  18. FreePracticeQuiz.questionLabelDatabases

    Une agence marketing souhaite améliorer ses capacités de reporting et de business intelligence. Pendant la phase de planification, elle a interrogé les parties prenantes concernées et découvert que : l'équipe opérations exécute ses rapports toutes les heures sur les données du mois en cours ; l'équipe commerciale veut utiliser plusieurs tableaux de bord Amazon QuickSight présentant une vue glissante des 30 derniers jours selon plusieurs catégories, et souhaite voir les données dès qu'elles atteignent le backend de reporting ; l'équipe finance exécute ses rapports quotidiennement sur les données du mois précédent et une fois par mois sur les 24 derniers mois de données. Le système contient actuellement 400 To de données, avec 100 To supplémentaires attendus chaque mois. L'entreprise recherche la solution la plus économique possible. Quelle solution répond à ses exigences ?

    A
    Stocker les 24 derniers mois de données dans Amazon Redshift. Configurer Amazon QuickSight avec Amazon Redshift comme source de données.
    B
    Stocker les 2 derniers mois de données dans Amazon Redshift et le reste des mois dans Amazon S3. Mettre en place un schéma et une table externes pour Amazon Redshift Spectrum. Configurer Amazon QuickSight avec Amazon Redshift comme source de données.
    C
    Stocker les 24 derniers mois de données dans Amazon S3 et les interroger avec Amazon Redshift Spectrum. Configurer Amazon QuickSight avec Amazon Redshift Spectrum comme source de données.
    D
    Stocker les 2 derniers mois de données dans Amazon Redshift et le reste des mois dans Amazon S3. Utiliser un cluster Amazon EMR de longue durée avec Apache Spark pour interroger les données au besoin. Configurer Amazon QuickSight avec Amazon EMR comme source de données.
  19. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise souhaite améliorer la satisfaction des utilisateurs de son système domotique en ajoutant des fonctionnalités à son moteur de recommandation. Chaque capteur pousse de façon asynchrone ses données JSON imbriquées vers Amazon Kinesis Data Streams via la Kinesis Producer Library (KPL) en Java. Les statistiques issues d'un ensemble de capteurs défaillants montrent que, lorsqu'un capteur dysfonctionne, ses données enregistrées ne sont pas toujours envoyées vers le cloud. L'entreprise a besoin d'une solution offrant une analytique en quasi-temps réel sur les données des capteurs les plus à jour. Quelle solution permet à l'entreprise de répondre à ces exigences ?

    A
    Définir la propriété RecordMaxBufferedTime de la KPL à « -1 » pour désactiver la mise en tampon côté capteur. Utiliser Kinesis Data Analytics pour enrichir les données via un script SQL de détection d'anomalies développé en interne. Pousser les données enrichies vers un ensemble de flux de données Kinesis et activer la fonction de transformation des données pour aplatir le fichier JSON. Instancier un cluster Amazon Redshift dense storage et l'utiliser comme destination du flux de diffusion Kinesis Data Firehose.
    B
    Mettre à jour le code des capteurs pour utiliser l'appel PutRecord/PutRecords de l'API Kinesis Data Streams avec le SDK AWS pour Java. Utiliser Kinesis Data Analytics pour enrichir les données via un script SQL de détection d'anomalies développé en interne. Diriger la sortie de l'application KDA vers un flux de diffusion Kinesis Data Firehose, activer la fonction de transformation des données pour aplatir le fichier JSON et définir comme destination Firehose un cluster Amazon Elasticsearch Service.
    C
    Définir la propriété RecordMaxBufferedTime de la KPL à « 0 » pour désactiver la mise en tampon côté capteur. Connecter à chaque flux un flux de diffusion Kinesis Data Firehose dédié et activer la fonction de transformation des données pour aplatir le fichier JSON avant de l'envoyer vers un bucket Amazon S3. Charger les données S3 dans un cluster Amazon Redshift.
    D
    Mettre à jour le code des capteurs pour utiliser l'appel PutRecord/PutRecords de l'API Kinesis Data Streams avec le SDK AWS pour Java. Utiliser AWS Glue pour récupérer et traiter les données du flux via la Kinesis Client Library (KCL). Instancier un cluster Amazon Elasticsearch Service et utiliser AWS Lambda pour y pousser directement les données.
  20. FreePracticeQuiz.questionLabelSecurity & Compliance

    Une grande entreprise dispose d'un data lake central pour réaliser des analyses dans différents départements. Chaque département utilise un compte AWS distinct et stocke ses données dans un bucket Amazon S3 de ce compte. Chaque compte AWS utilise AWS Glue Data Catalog comme catalogue de données. Les besoins d'accès au data lake varient selon les rôles : les analystes juniors ne doivent avoir qu'un accès en lecture aux données de leur département ; les analystes seniors peuvent accéder à plusieurs départements, y compris le leur, mais uniquement pour un sous-ensemble de colonnes. Quelle solution permet d'obtenir ces schémas d'accès tout en minimisant les coûts et les tâches d'administration ?

    A
    Regrouper tous les comptes AWS en un seul compte. Créer des buckets S3 distincts pour chaque département et déplacer toutes les données de chaque compte vers le compte central du data lake. Migrer les catalogues de données individuels vers un catalogue central et appliquer des permissions fines pour donner à chaque utilisateur l'accès requis aux tables et bases de données dans AWS Glue et Amazon S3.
    B
    Conserver la structure des comptes et les catalogues AWS Glue individuels de chaque compte. Ajouter un compte central de data lake et utiliser AWS Glue pour cataloguer les données des différents comptes. Configurer un accès inter-comptes pour que les crawlers AWS Glue analysent les données de chaque bucket S3 départemental afin d'identifier le schéma et d'alimenter le catalogue. Ajouter les analystes seniors au compte central et appliquer des contrôles d'accès très détaillés dans le Data Catalog et Amazon S3.
    C
    Mettre en place un compte AWS dédié au data lake central. Utiliser AWS Lake Formation pour cataloguer les emplacements inter-comptes. Sur chaque bucket S3 individuel, modifier la politique de bucket pour accorder les permissions S3 au rôle lié au service Lake Formation. Utiliser les permissions Lake Formation pour ajouter des contrôles d'accès fins autorisant les analystes seniors à consulter des tables et colonnes précises.
    D
    Mettre en place un compte AWS dédié au data lake central et configurer un bucket S3 central. Utiliser un blueprint AWS Lake Formation pour déplacer les données des différents buckets vers le bucket S3 central. Sur chaque bucket individuel, modifier la politique de bucket pour accorder les permissions S3 au rôle lié au service Lake Formation. Utiliser les permissions Lake Formation pour ajouter des contrôles d'accès fins permettant aux analystes juniors et seniors de consulter des tables et colonnes précises.
  21. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise a développé un nouveau site web de reporting électoral qui utilise Amazon Kinesis Data Firehose pour livrer les journaux complets d'AWS WAF vers un bucket Amazon S3. L'entreprise recherche désormais une option peu coûteuse pour réaliser cette analyse ponctuelle de données avec des visualisations des journaux, en demandant un effort de développement minimal. Quelle solution répond à ces exigences ?

    A
    Utiliser un crawler AWS Glue pour créer et mettre à jour une table dans le catalogue de données Glue à partir des journaux. Utiliser Athena pour les analyses ad hoc et Amazon QuickSight pour élaborer les visualisations de données.
    B
    Créer un second flux de diffusion Kinesis Data Firehose pour livrer les fichiers de journaux à Amazon Elasticsearch Service (Amazon ES). Utiliser Amazon ES pour les recherches textuelles dans les journaux à des fins d'analyse ad hoc et Kibana pour les visualisations de données.
    C
    Créer une fonction AWS Lambda pour convertir les journaux au format .csv. Ajouter ensuite cette fonction à la configuration de transformation de Kinesis Data Firehose. Utiliser Amazon Redshift pour réaliser des analyses ad hoc des journaux avec des requêtes SQL et Amazon QuickSight pour élaborer les visualisations de données.
    D
    Créer un cluster Amazon EMR et utiliser Amazon S3 comme source de données. Créer un job Apache Spark pour réaliser les analyses ad hoc et utiliser Amazon QuickSight pour élaborer les visualisations de données.
  22. FreePracticeQuiz.questionLabelAnalytics

    Un analyste de données conçoit une solution permettant d'interroger interactivement des jeux de données en SQL via une connexion JDBC. Les utilisateurs joindront des données stockées dans Amazon S3 au format Apache ORC avec des données stockées dans Amazon Elasticsearch Service (Amazon ES) et Amazon Aurora MySQL. Quelle solution fournira les résultats LES PLUS à jour ?

    A
    Utiliser des jobs AWS Glue pour effectuer un ETL des données depuis Amazon ES et Aurora MySQL vers Amazon S3. Interroger les données avec Amazon Athena.
    B
    Utiliser Amazon DMS pour diffuser les données depuis Amazon ES et Aurora MySQL vers Amazon Redshift. Interroger les données avec Amazon Redshift.
    C
    Interroger tous les jeux de données sur place avec Apache Spark SQL exécuté sur un endpoint de développement AWS Glue.
    D
    Interroger tous les jeux de données sur place avec Apache Presto exécuté sur Amazon EMR.
  23. FreePracticeQuiz.questionLabelDatabases

    Une entreprise de commerce de détail construit sa solution d'entrepôt de données avec Amazon Redshift. Dans ce cadre, elle charge des centaines de fichiers dans la table de faits créée dans son cluster Amazon Redshift. L'entreprise souhaite que la solution atteigne le débit le plus élevé et exploite au mieux les ressources du cluster lors du chargement des données dans sa table de faits. Comment répondre à ces exigences ?

    A
    Utiliser plusieurs commandes COPY pour charger les données dans le cluster Amazon Redshift.
    B
    Utiliser S3DistCp pour charger plusieurs fichiers dans le Hadoop Distributed File System (HDFS) et utiliser un connecteur HDFS pour ingérer les données dans le cluster Amazon Redshift.
    C
    Utiliser autant de commandes LOAD qu'il y a de nœuds dans le cluster Amazon Redshift et charger les données en parallèle sur chaque nœud.
    D
    Utiliser une seule commande COPY pour charger les données dans le cluster Amazon Redshift.
  24. FreePracticeQuiz.questionLabelStorage

    Une fois par mois, une entreprise reçoit un fichier .csv de 100 Mo compressé en gzip. Le fichier contient 50 000 enregistrements d'annonces immobilières et est stocké dans Amazon S3 Glacier. L'entreprise a besoin que son analyste de données interroge un sous-ensemble des données pour un fournisseur précis. Quelle est la solution la plus économique ?

    A
    Charger les données dans Amazon S3 et les interroger avec Amazon S3 Select.
    B
    Interroger les données directement depuis Amazon S3 Glacier avec Amazon Glacier Select.
    C
    Charger les données dans Amazon S3 et les interroger avec Amazon Athena.
    D
    Charger les données dans Amazon S3 et les interroger avec Amazon Redshift Spectrum.
  25. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise qui surveille les conditions météorologiques sur des chantiers distants met en place une solution de collecte des données de température provenant des deux stations météo suivantes : la station A, qui compte 10 capteurs, et la station B, qui en compte cinq. Ces stations ont été positionnées par des experts métier sur site. Chaque capteur possède un identifiant unique. Les données collectées par chaque capteur seront recueillies via Amazon Kinesis Data Streams. En fonction du débit total entrant et sortant, un unique flux de données Amazon Kinesis à deux shards a été créé. Deux clés de partition ont été créées à partir des noms des stations. Pendant les tests, un goulet d'étranglement apparaît sur les données provenant de la station A, mais pas de la station B. Après vérification, il est confirmé que le débit total du flux reste inférieur au débit alloué à Kinesis Data Streams. Comment résoudre ce goulet d'étranglement sans augmenter le coût global ni la complexité de la solution, tout en conservant les exigences de qualité de collecte des données ?

    A
    Augmenter le nombre de shards dans Kinesis Data Streams pour accroître le niveau de parallélisme.
    B
    Créer un flux de données Kinesis distinct pour la station A avec deux shards et y diriger les données des capteurs de la station A.
    C
    Modifier la clé de partition pour utiliser l'identifiant du capteur au lieu du nom de la station.
    D
    Réduire le nombre de capteurs de la station A de 10 à 5.
  26. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise construit un data lake et doit ingérer des données depuis une base de données relationnelle contenant des données de séries temporelles. Elle souhaite utiliser des services managés pour y parvenir. Le processus doit être planifié quotidiennement et ne remonter que les données incrémentales de la source vers Amazon S3. Quelle est l'approche LA PLUS économique pour répondre à ces exigences ?

    A
    Utiliser AWS Glue pour se connecter à la source de données via des pilotes JDBC. N'ingérer que les enregistrements incrémentaux à l'aide des job bookmarks.
    B
    Utiliser AWS Glue pour se connecter à la source de données via des pilotes JDBC. Stocker la dernière clé mise à jour dans une table Amazon DynamoDB et ingérer les données en utilisant cette clé comme filtre.
    C
    Utiliser AWS Glue pour se connecter à la source de données via des pilotes JDBC et ingérer l'intégralité du jeu de données. Utiliser les bibliothèques Apache Spark appropriées pour comparer le jeu de données et trouver le delta.
    D
    Utiliser AWS Glue pour se connecter à la source de données via des pilotes JDBC et ingérer l'intégralité des données. Utiliser AWS DataSync pour garantir que seul le delta est écrit dans Amazon S3.
  27. FreePracticeQuiz.questionLabelSecurity & Compliance

    Une société de crédit immobilier dispose d'un microservice d'acceptation des paiements. Ce microservice utilise le client de chiffrement Amazon DynamoDB avec des clés gérées par AWS KMS pour chiffrer les données sensibles avant de les écrire dans DynamoDB. L'équipe finance doit pouvoir charger ces données dans Amazon Redshift et agréger les valeurs des champs sensibles. Le cluster Amazon Redshift est partagé avec d'autres analystes de données d'unités métier différentes. Quelles étapes un analyste de données doit-il suivre pour réaliser cette tâche de manière efficace et sécurisée ?

    A
    Créer une fonction AWS Lambda pour traiter le flux DynamoDB. Déchiffrer les données sensibles avec la même clé KMS. Enregistrer la sortie dans un bucket S3 à accès restreint réservé à l'équipe finance. Créer dans Amazon Redshift une table finance accessible uniquement à l'équipe finance. Utiliser la commande COPY pour charger les données d'Amazon S3 vers cette table.
    B
    Créer une fonction AWS Lambda pour traiter le flux DynamoDB. Enregistrer la sortie dans un bucket S3 à accès restreint réservé à l'équipe finance. Créer dans Amazon Redshift une table finance accessible uniquement à l'équipe finance. Utiliser la commande COPY avec le rôle IAM ayant accès à la clé KMS pour charger les données de S3 vers cette table.
    C
    Créer un cluster Amazon EMR avec un rôle EMR_EC2_DefaultRole ayant accès à la clé KMS. Créer des tables Apache Hive référençant les données stockées dans DynamoDB et la table finance dans Amazon Redshift. Dans Hive, sélectionner les données de DynamoDB puis insérer le résultat dans la table finance d'Amazon Redshift.
    D
    Créer un cluster Amazon EMR. Créer des tables Apache Hive référençant les données stockées dans DynamoDB. Insérer le résultat dans le bucket Amazon S3 à accès restreint réservé à l'équipe finance. Utiliser la commande COPY avec le rôle IAM ayant accès à la clé KMS pour charger les données d'Amazon S3 vers la table finance d'Amazon Redshift.
  28. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise a développé plusieurs jobs AWS Glue pour valider et transformer ses données provenant d'Amazon S3 et les charger dans Amazon RDS for MySQL par lots, une fois par jour. Les jobs ETL lisent les données S3 avec un DynamicFrame. Actuellement, les développeurs ETL rencontrent des difficultés à ne traiter que les données incrémentales à chaque exécution, car le job AWS Glue traite l'intégralité des données d'entrée S3 à chaque exécution. Quelle approche permettrait aux développeurs de résoudre ce problème avec un minimum de code ?

    A
    Faire lire aux jobs ETL les données d'Amazon S3 avec un DataFrame.
    B
    Activer les job bookmarks sur les jobs AWS Glue.
    C
    Créer une logique personnalisée dans les jobs ETL pour suivre les objets S3 déjà traités.
    D
    Faire supprimer par les jobs ETL les objets ou données déjà traités d'Amazon S3 après chaque exécution.
  29. FreePracticeQuiz.questionLabelStorage

    Une entreprise de médias effectue des analyses sur les données de logs générées par ses applications. Le nombre de tâches d'analyse concurrentes a récemment augmenté, et les performances globales des tâches existantes se dégradent à mesure que de nouvelles tâches s'ajoutent. Les données partitionnées sont stockées dans Amazon S3 One Zone-Infrequent Access (S3 One Zone-IA) et le traitement analytique est réalisé sur des clusters Amazon EMR utilisant EMR File System (EMRFS) avec la vue cohérente activée. Un analyste de données a déterminé que les nœuds de tâches EMR mettent de plus en plus de temps à lister les objets dans Amazon S3. Quelle action est la PLUS susceptible d'améliorer les performances d'accès aux données de logs dans Amazon S3 ?

    A
    Utiliser une fonction de hachage pour créer une chaîne aléatoire et l'ajouter au début des préfixes d'objets lors du stockage des données de logs dans Amazon S3.
    B
    Utiliser une politique de cycle de vie pour faire passer la classe de stockage S3 des données de logs vers S3 Standard.
    C
    Augmenter les unités de capacité de lecture (RCU) de la table Amazon DynamoDB partagée.
    D
    Redéployer les clusters EMR les plus lents dans une autre zone de disponibilité.
  30. FreePracticeQuiz.questionLabelAnalytics

    Une entreprise financière utilise Apache Hive sur Amazon EMR pour des requêtes ad hoc. Les utilisateurs se plaignent de performances médiocres. Un analyste de données relève les éléments suivants : environ 90 % des requêtes sont soumises dans l'heure qui suit l'ouverture des marchés ; l'utilisation de Hadoop Distributed File System (HDFS) ne dépasse jamais 10 %. Quelle solution permettrait de résoudre ces problèmes de performances ?

    A
    Créer des configurations d'instance fleet pour les nœuds core et task. Créer une politique de mise à l'échelle automatique pour étendre les groupes d'instances en fonction de la métrique Amazon CloudWatch CapacityRemainingGB. Créer une politique de mise à l'échelle automatique pour réduire l'instance fleet en fonction de la métrique CloudWatch CapacityRemainingGB.
    B
    Créer des configurations d'instance fleet pour les nœuds core et task. Créer une politique de mise à l'échelle automatique pour étendre les groupes d'instances en fonction de la métrique Amazon CloudWatch YARNMemoryAvailablePercentage. Créer une politique de mise à l'échelle automatique pour réduire l'instance fleet en fonction de la métrique CloudWatch YARNMemoryAvailablePercentage.
    C
    Créer des configurations d'instance group pour les nœuds core et task. Créer une politique de mise à l'échelle automatique pour étendre les groupes d'instances en fonction de la métrique Amazon CloudWatch CapacityRemainingGB. Créer une politique de mise à l'échelle automatique pour réduire les groupes d'instances en fonction de la métrique CloudWatch CapacityRemainingGB.
    D
    Créer des configurations d'instance group pour les nœuds core et task. Créer une politique de mise à l'échelle automatique pour étendre les groupes d'instances en fonction de la métrique Amazon CloudWatch YARNMemoryAvailablePercentage. Créer une politique de mise à l'échelle automatique pour réduire les groupes d'instances en fonction de la métrique CloudWatch YARNMemoryAvailablePercentage.
Progression : 0 sur 30 question(s) complétée(s)

Prêt pour l'examen DAS-C01 complet ?

Accédez à l'ensemble des Plus de 83 questions, à la simulation chronométrée et à l'analyse de vos points faibles. Formules à partir de 2,99 $ — les crédits n'expirent jamais.

Voir les tarifs

Questions fréquentes

S'agit-il de vraies questions d'entraînement DAS-C01 ?+
Oui. Ces 30 questions sont extraites directement de notre banque de Plus de 83 questions, rédigées et relues par des praticiens certifiés. Elles reproduisent le style, la difficulté et le périmètre de l'examen officiel AWS DAS-C01.
L'examen DAS-C01 est-il difficile ?+
L'examen AWS Data Analytics (DAS-C01) est considéré comme un examen à score minimal (score de réussite : 750 sur 1000). La plupart des candidats ont besoin de 4 à 8 semaines de préparation ciblée. Utilisez ces questions gratuites pour évaluer votre niveau avant de vous lancer dans un plan de révision complet.
Combien de questions comporte le vrai examen DAS-C01 ?+
L'examen officiel DAS-C01 comporte 65 questions (50 notées, 15 non notées).
Faut-il s'inscrire pour utiliser ces questions ?+
Non. Ces 30 questions sont gratuites et ne nécessitent aucune inscription. Si vous souhaitez la simulation chronométrée, l'analyse de vos performances et l'accès à l'ensemble des Plus de 83 questions, nos formules payantes débutent à 2,99 $ par examen, avec des crédits qui n'expirent jamais.

Continuer à réviser

Réussissez DAS-C01 du premier coup

Rejoignez les candidats qui utilisent DummyExams pour s'entraîner avec des examens chronométrés réalistes, des explications détaillées et une analyse de leurs points faibles.

Commencer l'examen blanc DAS-C01 complet