Práctica gratuita · sin registro
30 preguntas de práctica gratuitas de AWS DAS-C01
Preguntas de práctica reales para el examen AWS Data Analytics (DAS-C01), con respuestas y explicaciones detalladas. Actualizado en 2026.
Preguntas gratuitas
30
Puntuación de aprobado
750 de 1000
Duración del examen
170 minutos
Banco de preguntas
Más de 83 preguntas
A continuación tienes 30 preguntas de práctica reales para el examen AWS Data Analytics (DAS-C01). Cada pregunta muestra la respuesta correcta y una explicación detallada cuando la revelas. Úsalas para medir tu preparación: si obtienes menos del 70 % en estas 30 preguntas, prevé al menos 4 semanas más de estudio antes de reservar.
Preguntas de práctica de DAS-C01
- FreePracticeQuiz.questionLabelStorageUna aplicación de streaming lee datos de Amazon Kinesis Data Streams y los escribe inmediatamente en un bucket de Amazon S3 cada 10 segundos. La aplicación lee datos de cientos de shards. El intervalo de procesamiento por lotes no puede cambiarse debido a otro requisito. Los datos se consultan mediante Amazon Athena. Los usuarios observan una degradación del rendimiento de las consultas con el paso del tiempo. ¿Qué acción puede ayudar a mejorar el rendimiento de las consultas?AFusionar los archivos en Amazon S3 para formar archivos más grandes.BAumentar el número de shards en Kinesis Data Streams.CAñadir más memoria y capacidad de CPU a la aplicación de streaming.DEscribir los archivos en varios buckets de S3.
- FreePracticeQuiz.questionLabelAnalyticsUn equipo de científicos de datos planea analizar datos de tendencias de mercado para la nueva estrategia de inversión de su empresa. Los datos de tendencias proceden de cinco fuentes distintas y en grandes volúmenes. El equipo quiere utilizar Amazon Kinesis para cubrir su caso de uso. Emplea consultas de tipo SQL para analizar tendencias y desea enviar notificaciones a partir de ciertos patrones significativos detectados. Además, los científicos de datos quieren guardar los datos en Amazon S3 para archivado y reprocesamiento histórico, y usar servicios gestionados de AWS siempre que sea posible. El equipo quiere implementar la solución de menor coste. ¿Qué solución cumple estos requisitos?APublicar los datos en un único flujo de datos de Kinesis. Desplegar una aplicación personalizada con la Kinesis Client Library (KCL) para analizar tendencias y enviar notificaciones mediante Amazon SNS. Configurar Kinesis Data Firehose sobre el flujo de datos de Kinesis para persistir los datos en un bucket de S3.BPublicar los datos en un único flujo de datos de Kinesis. Desplegar Kinesis Data Analytics sobre el flujo para analizar tendencias y configurar una función de AWS Lambda como salida para enviar notificaciones mediante Amazon SNS. Configurar Kinesis Data Firehose sobre el flujo de datos de Kinesis para persistir los datos en un bucket de S3.CPublicar los datos en dos flujos de datos de Kinesis. Desplegar Kinesis Data Analytics sobre el primer flujo para analizar tendencias y configurar una función de AWS Lambda como salida para enviar notificaciones mediante Amazon SNS. Configurar Kinesis Data Firehose sobre el segundo flujo de datos de Kinesis para persistir los datos en un bucket de S3.DPublicar los datos en dos flujos de datos de Kinesis. Desplegar una aplicación personalizada con la Kinesis Client Library (KCL) sobre el primer flujo para analizar tendencias y enviar notificaciones mediante Amazon SNS. Configurar Kinesis Data Firehose sobre el segundo flujo de datos de Kinesis para persistir los datos en un bucket de S3.
- FreePracticeQuiz.questionLabelDatabasesUna gran empresa recibe archivos de terceros en Amazon EC2 a lo largo del día. Al final de la jornada, los archivos se combinan en un único archivo, se comprimen en gzip y se suben a Amazon S3. El tamaño total de todos los archivos ronda los 100 GB diarios. Una vez subidos a Amazon S3, un programa de AWS Batch ejecuta un comando COPY para cargar los archivos en un clúster de Amazon Redshift. ¿Qué modificación del programa acelerará el proceso COPY?ASubir los archivos individuales a Amazon S3 y ejecutar el comando COPY en cuanto los archivos estén disponibles.BDividir los archivos de modo que su número sea un múltiplo del número de slices del clúster de Amazon Redshift. Comprimir en gzip y subir los archivos a Amazon S3. Ejecutar el comando COPY sobre esos archivos.CDividir los archivos de modo que su número sea un múltiplo del número de nodos de cómputo del clúster de Amazon Redshift. Comprimir en gzip y subir los archivos a Amazon S3. Ejecutar el comando COPY sobre esos archivos.DAplicar sharding dividiendo los archivos de forma que las columnas distkey con los mismos valores queden en el mismo archivo. Comprimir en gzip y subir los archivos fragmentados a Amazon S3. Ejecutar el comando COPY sobre esos archivos.
- FreePracticeQuiz.questionLabelAnalyticsEn una empresa, una unidad de negocio sube archivos .csv a un bucket de Amazon S3. El equipo de la plataforma de datos ha configurado un crawler de AWS Glue para el descubrimiento y la creación de tablas y esquemas. Un job de AWS Glue escribe los datos procesados de las tablas creadas en una base de datos de Amazon Redshift. El job de AWS Glue gestiona correctamente el mapeo de columnas y la creación de la tabla de Amazon Redshift. Cuando el job de AWS Glue se vuelve a ejecutar por cualquier motivo durante el día, se introducen registros duplicados en la tabla de Amazon Redshift. ¿Qué solución actualizará la tabla de Redshift sin duplicados cuando los jobs se vuelvan a ejecutar?AModificar el job de AWS Glue para copiar las filas en una tabla de staging. Añadir comandos SQL como postactions en la clase DynamicFrameWriter para sustituir las filas existentes de la tabla principal.BCargar los datos insertados previamente en una base de datos MySQL desde el job de AWS Glue. Realizar una operación de upsert en MySQL y copiar los resultados a la tabla de Amazon Redshift.CUsar la API dropDuplicates() de los DataFrame de Apache Spark para eliminar duplicados y después escribir los datos en Amazon Redshift.DUsar la transformación integrada ResolveChoice de AWS Glue para seleccionar el valor más reciente de la columna.
- FreePracticeQuiz.questionLabelDatabasesUna aerolínea tiene datos en formato .csv almacenados en Amazon S3 con un AWS Glue Data Catalog. Los analistas de datos quieren unir estos datos con datos del centro de llamadas almacenados en Amazon Redshift como parte de un proceso por lotes diario. El clúster de Amazon Redshift ya está sometido a una carga elevada. La solución debe ser gestionada, serverless, eficaz y minimizar la carga sobre el clúster de Amazon Redshift existente. Además debe requerir el mínimo esfuerzo y desarrollo. ¿Qué solución cumple estos requisitos?ADescargar los datos del centro de llamadas desde Amazon Redshift a Amazon S3 con una función de AWS Lambda. Realizar la unión con scripts ETL de AWS Glue.BExportar los datos del centro de llamadas desde Amazon Redshift con un shell de Python en AWS Glue. Realizar la unión con scripts ETL de AWS Glue.CCrear una tabla externa con Amazon Redshift Spectrum para los datos del centro de llamadas y realizar la unión con Amazon Redshift.DExportar los datos del centro de llamadas desde Amazon Redshift a Amazon EMR con Apache Sqoop. Realizar la unión con Apache Hive.
- FreePracticeQuiz.questionLabelDatabasesUna gran empresa de viajes compartidos cuenta con miles de conductores en todo el mundo que atienden a millones de clientes únicos cada día. La empresa ha decidido migrar un data mart existente a Amazon Redshift. El esquema actual incluye las siguientes tablas: una tabla de hechos trips con información de los viajes completados; una tabla de dimensión drivers con los perfiles de los conductores; una tabla de hechos customers con la información de perfil de los clientes. La empresa analiza los detalles de los viajes por fecha y destino para examinar la rentabilidad por región. Los datos de los conductores cambian rara vez. Los datos de los clientes cambian con frecuencia. ¿Qué diseño de tablas ofrece el mejor rendimiento de consulta?AUsar DISTSTYLE KEY (destination) para la tabla trips y ordenar por fecha. Usar DISTSTYLE ALL para las tablas drivers y customers.BUsar DISTSTYLE EVEN para la tabla trips y ordenar por fecha. Usar DISTSTYLE ALL para la tabla drivers. Usar DISTSTYLE EVEN para la tabla customers.CUsar DISTSTYLE KEY (destination) para la tabla trips y ordenar por fecha. Usar DISTSTYLE ALL para la tabla drivers. Usar DISTSTYLE EVEN para la tabla customers.DUsar DISTSTYLE EVEN para la tabla drivers y ordenar por fecha. Usar DISTSTYLE ALL para ambas tablas de hechos.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa de software aloja una aplicación en AWS y publica nuevas funcionalidades cada semana. Como parte del proceso de pruebas de la aplicación, debe desarrollarse una solución que analice los registros de cada instancia de Amazon EC2 para garantizar que la aplicación funciona según lo previsto tras cada despliegue. La solución de recopilación y análisis debe tener alta disponibilidad y capacidad para mostrar la información nueva con la mínima demora. ¿Qué método debe usar la empresa para recopilar y analizar los registros?AHabilitar la supervisión detallada en Amazon EC2, usar el agente de Amazon CloudWatch para almacenar los registros en Amazon S3 y usar Amazon Athena para un análisis de registros rápido e interactivo.BUsar el agente de la Amazon Kinesis Producer Library (KPL) en Amazon EC2 para recopilar y enviar datos a Kinesis Data Streams y de ahí trasladarlos a Amazon Elasticsearch Service, visualizándolos con Amazon QuickSight.CUsar el agente de la Amazon Kinesis Producer Library (KPL) en Amazon EC2 para recopilar y enviar datos a Kinesis Data Firehose y de ahí trasladarlos a Amazon Elasticsearch Service y Kibana.DUsar suscripciones de Amazon CloudWatch para acceder a un flujo de registros en tiempo real y entregarlos a Amazon Kinesis Data Streams para después trasladar los datos a Amazon Elasticsearch Service y Kibana.
- FreePracticeQuiz.questionLabelDatabasesUna empresa industrial lleva un año recopilando datos de sensores IoT de dispositivos de su planta y los almacena en Amazon Redshift para su análisis diario. Un analista de datos ha determinado que, con una tasa de ingesta prevista de unos 2 TB diarios, el clúster quedará infradimensionado en menos de 4 meses. Se necesita una solución a largo plazo. El analista indica que la mayoría de las consultas solo hacen referencia a los últimos 13 meses de datos, pero también existen informes trimestrales que deben consultar todos los datos generados en los últimos 7 años. El director de tecnología (CTO) está preocupado por los costes, el esfuerzo administrativo y el rendimiento de una solución a largo plazo. ¿Qué solución debe utilizar el analista de datos para cumplir estos requisitos?ACrear un job diario en AWS Glue que haga UNLOAD de los registros con más de 13 meses a Amazon S3 y los elimine de Amazon Redshift. Crear una tabla externa en Amazon Redshift que apunte a la ubicación de S3. Usar Amazon Redshift Spectrum para unir los datos con más de 13 meses.BTomar una instantánea del clúster de Amazon Redshift. Restaurar el clúster en uno nuevo con nodos dense storage que aporten capacidad de almacenamiento adicional.CEjecutar una sentencia CREATE TABLE AS SELECT (CTAS) para mover los registros con más de 13 meses a datos particionados trimestralmente en Amazon Redshift Spectrum respaldado por Amazon S3.DDescargar todas las tablas de Amazon Redshift a un bucket de Amazon S3 usando S3 Intelligent-Tiering. Usar AWS Glue para rastrear la ubicación del bucket de S3 y crear tablas externas en un AWS Glue Data Catalog. Crear un clúster de Amazon EMR con Auto Scaling para las necesidades analíticas diarias y usar Amazon Athena para los informes trimestrales, usando ambos el mismo AWS Glue Data Catalog.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa financiera aloja un data lake en Amazon S3 y un almacén de datos en un clúster de Amazon Redshift. La empresa usa Amazon QuickSight para crear cuadros de mando y quiere asegurar el acceso desde su Active Directory local a Amazon QuickSight. ¿Cómo deben protegerse los datos?AUsar un conector de Active Directory e inicio de sesión único (SSO) en un entorno de red corporativa.BUsar un endpoint de VPC para conectarse a Amazon S3 desde Amazon QuickSight y un rol de IAM para autenticarse en Amazon Redshift.CEstablecer una conexión segura creando un endpoint de S3 para conectar Amazon QuickSight y un endpoint de VPC para conectarse a Amazon Redshift.DColocar Amazon QuickSight y Amazon Redshift en el grupo de seguridad y usar un endpoint de Amazon S3 para conectar Amazon QuickSight a Amazon S3.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa estadounidense de venta de zapatillas ha lanzado su sitio web global. Todos los datos transaccionales se almacenan en Amazon RDS y los datos históricos de transacciones ya depurados se almacenan en Amazon Redshift en la región us-east-1. El equipo de business intelligence (BI) quiere mejorar la experiencia de usuario ofreciendo un cuadro de mando de tendencias de zapatillas. El equipo decide usar Amazon QuickSight para representar los cuadros de mando del sitio web. Durante el desarrollo, un equipo en Japón aprovisionó Amazon QuickSight en ap-northeast-1. El equipo tiene dificultades para conectar Amazon QuickSight desde ap-northeast-1 con Amazon Redshift en us-east-1. ¿Qué solución resolverá este problema y cumplirá los requisitos?AEn la consola de Amazon Redshift, configurar instantáneas entre regiones y establecer ap-northeast-1 como región de destino. Restaurar el clúster de Amazon Redshift a partir de la instantánea y conectarlo con Amazon QuickSight lanzado en ap-northeast-1.BCrear un endpoint de VPC desde la VPC de Amazon QuickSight hacia la VPC de Amazon Redshift para que Amazon QuickSight pueda acceder a los datos de Amazon Redshift.CCrear una cadena de conexión al endpoint de Amazon Redshift que incluya la información de la región y usarla en Amazon QuickSight para conectarse a Amazon Redshift.DCrear un nuevo grupo de seguridad para Amazon Redshift en us-east-1 con una regla de entrada que autorice el acceso desde el rango de direcciones IP correspondiente a los servidores de Amazon QuickSight en ap-northeast-1.
- FreePracticeQuiz.questionLabelAnalyticsUna compañía de seguros dispone de datos en bruto en formato JSON que se envían sin una planificación predefinida, mediante un flujo de entrega de Amazon Kinesis Data Firehose, a un bucket de Amazon S3. Un crawler de AWS Glue está programado cada 8 horas para actualizar el esquema en el catálogo de datos de las tablas almacenadas en el bucket de S3. Los analistas de datos analizan los datos con Apache Spark SQL en Amazon EMR configurado con AWS Glue Data Catalog como metastore. Los analistas comentan que, en ocasiones, los datos que reciben están desactualizados. Un ingeniero de datos debe darles acceso a los datos más recientes. ¿Qué solución cumple estos requisitos?ACrear un esquema externo basado en AWS Glue Data Catalog en el clúster de Amazon Redshift existente para consultar los datos nuevos en Amazon S3 con Amazon Redshift Spectrum.BUsar Amazon CloudWatch Events con la expresión rate (1 hour) para ejecutar el crawler de AWS Glue cada hora.CCon la AWS CLI, modificar la programación de ejecución del crawler de AWS Glue de 8 horas a 1 minuto.DEjecutar el crawler de AWS Glue desde una función de AWS Lambda activada por una notificación de evento S3:ObjectCreated:* en el bucket de S3.
- FreePracticeQuiz.questionLabelAnalyticsUn analista de datos usa AWS Glue para organizar, depurar, validar y formatear un conjunto de datos de 200 GB. Lanzó el job con el tipo de worker Standard. Tras 3 horas, el estado del job de AWS Glue sigue siendo RUNNING. Los registros de la ejecución no muestran códigos de error. El analista quiere reducir el tiempo de ejecución del job sin sobreaprovisionar. ¿Qué acciones debe llevar a cabo?AHabilitar los job bookmarks en AWS Glue para estimar el número de unidades de procesamiento de datos (DPU). Según las métricas obtenidas, aumentar el valor del parámetro de job executor-cores.BHabilitar las métricas de job en AWS Glue para estimar el número de unidades de procesamiento de datos (DPU). Según las métricas obtenidas, aumentar el valor del parámetro de job maximum capacity.CHabilitar las métricas de job en AWS Glue para estimar el número de unidades de procesamiento de datos (DPU). Según las métricas obtenidas, aumentar el valor del parámetro de job spark.yarn.executor.memoryOverhead.DHabilitar los job bookmarks en AWS Glue para estimar el número de unidades de procesamiento de datos (DPU). Según las métricas obtenidas, aumentar el valor del parámetro de job num-executors.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa envía en streaming sus datos de facturación de gran volumen (100 MB/s) a Amazon Kinesis Data Streams. Un analista de datos particionó los datos por account_id para asegurar que todos los registros de una cuenta vayan al mismo shard de Kinesis y se mantenga el orden. Al construir un consumidor personalizado con el SDK de Java de Kinesis, el analista observa que, a veces, los mensajes llegan desordenados para un account_id. Al investigar, descubre que los mensajes desordenados parecen provenir de shards distintos para el mismo account_id y aparecen cuando se ejecuta un redimensionamiento del flujo. ¿Cuál es la explicación de este comportamiento y cuál es la solución?AHay varios shards en un flujo y el orden debe mantenerse dentro del shard. El analista debe asegurarse de que solo haya un shard en el flujo y de que no se ejecuten redimensionamientos.BEl proceso de generación de la clave hash de los registros no funciona correctamente. El analista debe generar una clave hash explícita en el lado del productor para que los registros se dirijan con precisión al shard adecuado.CKinesis Data Streams no recibe los registros en orden. El productor debe usar la llamada a la API PutRecords en lugar de PutRecord con el parámetro SequenceNumberForOrdering.DEl consumidor no termina de procesar el shard padre antes de procesar los shards hijos tras un redimensionamiento del flujo. El analista debe procesar por completo el shard padre antes de procesar los shards hijos.
- FreePracticeQuiz.questionLabelStorageUna empresa de transporte utiliza sensores IoT instalados en camiones para recopilar datos de vehículos de su flota global de reparto. Actualmente envía los datos de los sensores en pequeños archivos .csv a Amazon S3. Después, los archivos se cargan en un clúster de Amazon Redshift de 10 nodos con dos slices por nodo y se consultan tanto con Amazon Athena como con Amazon Redshift. La empresa quiere optimizar los archivos para reducir el coste de las consultas y también mejorar la velocidad de carga de datos en el clúster de Amazon Redshift. ¿Qué solución cumple estos requisitos?AUsar AWS Glue para convertir todos los archivos .csv en un único archivo grande de Apache Parquet. Cargar el archivo en Amazon Redshift con COPY y consultarlo con Athena desde Amazon S3.BUsar Amazon EMR para convertir cada archivo .csv a Apache Avro. Cargar los archivos en Amazon Redshift con COPY y consultarlos con Athena desde Amazon S3.CUsar AWS Glue para convertir los archivos .csv en un único archivo grande de Apache ORC. Cargar el archivo en Amazon Redshift con COPY y consultarlo con Athena desde Amazon S3.DUsar AWS Glue para convertir los archivos .csv a Apache Parquet y crear 20 archivos Parquet. Cargar los archivos en Amazon Redshift con COPY y consultarlos con Athena desde Amazon S3.
- FreePracticeQuiz.questionLabelStorageUna empresa está migrando sus jobs ETL locales a Amazon EMR. El código consta de una serie de jobs escritos en Java. La empresa necesita reducir la carga de los administradores de sistemas sin cambiar el código subyacente. Debido a la sensibilidad de los datos, el cumplimiento normativo exige usar cifrado del volumen raíz en todos los nodos del clúster. Los estándares corporativos exigen aprovisionar los entornos mediante AWS CloudFormation siempre que sea posible. ¿Qué solución satisface estos requisitos?AInstalar Hadoop de código abierto en instancias de Amazon EC2 con volúmenes raíz cifrados. Configurar el clúster en la plantilla de CloudFormation.BUsar una plantilla de CloudFormation para lanzar un clúster de EMR. En la sección de configuración del clúster, definir una acción de arranque que habilite TLS.CCrear una AMI personalizada con volúmenes raíz cifrados. Configurar Amazon EMR para que use esa AMI personalizada mediante la propiedad CustomAmiId en la plantilla de CloudFormation.DUsar una plantilla de CloudFormation para lanzar un clúster de EMR. En la sección de configuración del clúster, definir una acción de arranque que cifre el volumen raíz de cada nodo.
- FreePracticeQuiz.questionLabelSecurity & ComplianceUn hospital utiliza dispositivos sensores médicos ponibles para recopilar datos de los pacientes. El hospital está diseñando una solución en tiempo casi real capaz de ingerir los datos de forma segura y a escala. La solución también debe poder eliminar la información sanitaria protegida (PHI) de los pacientes de los datos en streaming y almacenar los datos en un almacenamiento duradero. ¿Qué solución cumple estos requisitos con la menor carga operativa?AIngerir los datos con Amazon Kinesis Data Streams, que invoca una función de AWS Lambda mediante la Kinesis Client Library (KCL) para eliminar toda la PHI. Escribir los datos en Amazon S3.BIngerir los datos con Amazon Kinesis Data Firehose para escribirlos en Amazon S3. Hacer que Amazon S3 active una función de AWS Lambda que analice los datos de los sensores para eliminar toda la PHI en Amazon S3.CIngerir los datos con Amazon Kinesis Data Streams para escribirlos en Amazon S3. Hacer que el flujo de datos lance una función de AWS Lambda que analice los datos de los sensores y elimine toda la PHI en Amazon S3.DIngerir los datos con Amazon Kinesis Data Firehose para escribirlos en Amazon S3. Implementar una función de transformación de AWS Lambda que analice los datos de los sensores para eliminar toda la PHI.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa de medios quiere realizar aprendizaje automático y análisis sobre los datos que residen en su data lake de Amazon S3. Existen dos requisitos de transformación de datos que permitirán a los consumidores internos crear informes: transformaciones diarias de 300 GB de datos con distintos formatos de archivo que llegan a Amazon S3 a una hora programada; transformaciones puntuales de terabytes de datos archivados en el data lake de S3. ¿Qué combinación de soluciones cumple de forma rentable los requisitos de transformación de datos de la empresa? (Elija TRES)APara los datos diarios entrantes, usar crawlers de AWS Glue para rastrear e identificar el esquema.BPara los datos diarios entrantes, usar Amazon Athena para rastrear e identificar el esquema.CPara los datos diarios entrantes, usar Amazon Redshift para realizar las transformaciones.DPara los datos diarios entrantes, usar workflows de AWS Glue con jobs de AWS Glue para realizar las transformaciones.EPara los datos archivados, usar Amazon EMR para realizar las transformaciones de datos.FPara los datos archivados, usar Amazon SageMaker para realizar las transformaciones de datos.
- FreePracticeQuiz.questionLabelDatabasesUna empresa de marketing quiere mejorar sus capacidades de reporting y business intelligence. Durante la fase de planificación entrevistó a las partes interesadas y descubrió que: el equipo de operaciones ejecuta sus informes cada hora sobre los datos del mes en curso; el equipo comercial quiere usar varios cuadros de mando de Amazon QuickSight para mostrar una vista móvil de los últimos 30 días según varias categorías, y también quiere ver los datos en cuanto llegan al backend de reporting; el equipo financiero ejecuta sus informes a diario sobre los datos del mes anterior y una vez al mes sobre los últimos 24 meses de datos. Actualmente hay 400 TB de datos en el sistema, con 100 TB adicionales previstos cada mes. La empresa busca la solución más rentable posible. ¿Qué solución cumple sus requisitos?AAlmacenar los últimos 24 meses de datos en Amazon Redshift. Configurar Amazon QuickSight con Amazon Redshift como fuente de datos.BAlmacenar los últimos 2 meses de datos en Amazon Redshift y el resto de los meses en Amazon S3. Configurar un esquema y una tabla externos para Amazon Redshift Spectrum. Configurar Amazon QuickSight con Amazon Redshift como fuente de datos.CAlmacenar los últimos 24 meses de datos en Amazon S3 y consultarlos con Amazon Redshift Spectrum. Configurar Amazon QuickSight con Amazon Redshift Spectrum como fuente de datos.DAlmacenar los últimos 2 meses de datos en Amazon Redshift y el resto de los meses en Amazon S3. Usar un clúster de Amazon EMR de larga duración con Apache Spark para consultar los datos cuando sea necesario. Configurar Amazon QuickSight con Amazon EMR como fuente de datos.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa quiere mejorar la satisfacción de los usuarios de su sistema domótico añadiendo más funcionalidades a su motor de recomendación. Cada sensor envía de forma asíncrona sus datos JSON anidados a Amazon Kinesis Data Streams mediante la Kinesis Producer Library (KPL) en Java. Las estadísticas de un conjunto de sensores averiados mostraron que, cuando un sensor funciona mal, los datos que registra no siempre se envían a la nube. La empresa necesita una solución que ofrezca análisis en tiempo casi real sobre los datos de los sensores más actualizados. ¿Qué solución permite a la empresa cumplir estos requisitos?AEstablecer la propiedad RecordMaxBufferedTime de la KPL en «-1» para desactivar el almacenamiento en búfer en el lado del sensor. Usar Kinesis Data Analytics para enriquecer los datos mediante un script SQL de detección de anomalías desarrollado por la empresa. Enviar los datos enriquecidos a un conjunto de flujos de datos de Kinesis y habilitar la función de transformación de datos para aplanar el archivo JSON. Instanciar un clúster de Amazon Redshift dense storage y usarlo como destino del flujo de entrega de Kinesis Data Firehose.BActualizar el código de los sensores para usar la llamada PutRecord/PutRecords de la API de Kinesis Data Streams con el SDK de AWS para Java. Usar Kinesis Data Analytics para enriquecer los datos mediante un script SQL de detección de anomalías desarrollado por la empresa. Dirigir la salida de la aplicación de KDA a un flujo de entrega de Kinesis Data Firehose, habilitar la función de transformación de datos para aplanar el archivo JSON y fijar como destino de Firehose un clúster de Amazon Elasticsearch Service.CEstablecer la propiedad RecordMaxBufferedTime de la KPL en «0» para desactivar el almacenamiento en búfer en el lado del sensor. Conectar a cada flujo un flujo de entrega de Kinesis Data Firehose dedicado y habilitar la función de transformación de datos para aplanar el archivo JSON antes de enviarlo a un bucket de Amazon S3. Cargar los datos de S3 en un clúster de Amazon Redshift.DActualizar el código de los sensores para usar la llamada PutRecord/PutRecords de la API de Kinesis Data Streams con el SDK de AWS para Java. Usar AWS Glue para obtener y procesar los datos del flujo mediante la Kinesis Client Library (KCL). Instanciar un clúster de Amazon Elasticsearch Service y usar AWS Lambda para enviar los datos directamente a él.
- FreePracticeQuiz.questionLabelSecurity & ComplianceUna gran empresa dispone de un data lake central para realizar análisis en distintos departamentos. Cada departamento usa una cuenta de AWS separada y almacena sus datos en un bucket de Amazon S3 de esa cuenta. Cada cuenta de AWS usa AWS Glue Data Catalog como catálogo de datos. Los requisitos de acceso al data lake varían según el rol: los analistas junior solo deben tener acceso de lectura a los datos de su departamento; los analistas sénior pueden tener acceso a varios departamentos, incluido el suyo, pero solo a un subconjunto de columnas. ¿Qué solución logra estos patrones de acceso minimizando costes y tareas administrativas?AConsolidar todas las cuentas de AWS en una sola. Crear buckets de S3 distintos para cada departamento y mover todos los datos de cada cuenta a la cuenta central del data lake. Migrar los catálogos de datos individuales a un catálogo central y aplicar permisos detallados para dar a cada usuario el acceso necesario a las tablas y bases de datos en AWS Glue y Amazon S3.BMantener la estructura de cuentas y los catálogos individuales de AWS Glue en cada cuenta. Añadir una cuenta central de data lake y usar AWS Glue para catalogar los datos de las distintas cuentas. Configurar el acceso entre cuentas para que los crawlers de AWS Glue rastreen los datos de cada bucket de S3 departamental e identifiquen el esquema para alimentar el catálogo. Añadir a los analistas sénior a la cuenta central y aplicar controles de acceso muy detallados en el Data Catalog y en Amazon S3.CConfigurar una cuenta de AWS específica para el data lake central. Usar AWS Lake Formation para catalogar las ubicaciones entre cuentas. En cada bucket de S3 individual, modificar la política del bucket para conceder permisos de S3 al rol vinculado al servicio de Lake Formation. Usar los permisos de Lake Formation para añadir controles de acceso detallados que permitan a los analistas sénior ver tablas y columnas concretas.DConfigurar una cuenta de AWS específica para el data lake central y configurar un bucket de S3 central. Usar un blueprint de AWS Lake Formation para mover los datos de los distintos buckets al bucket central de S3. En cada bucket individual, modificar la política del bucket para conceder permisos de S3 al rol vinculado al servicio de Lake Formation. Usar los permisos de Lake Formation para añadir controles de acceso detallados que permitan tanto a los analistas junior como a los sénior ver tablas y columnas concretas.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa ha desarrollado un nuevo sitio web de reporting electoral que usa Amazon Kinesis Data Firehose para entregar los registros completos de AWS WAF a un bucket de Amazon S3. Ahora la empresa busca una opción de bajo coste para realizar este análisis de datos poco frecuente con visualizaciones de los registros, requiriendo un esfuerzo de desarrollo mínimo. ¿Qué solución cumple estos requisitos?AUsar un crawler de AWS Glue para crear y actualizar una tabla en el catálogo de datos de Glue a partir de los registros. Usar Athena para los análisis ad hoc y Amazon QuickSight para desarrollar las visualizaciones de datos.BCrear un segundo flujo de entrega de Kinesis Data Firehose para entregar los archivos de registro a Amazon Elasticsearch Service (Amazon ES). Usar Amazon ES para búsquedas de texto en los registros con fines de análisis ad hoc y Kibana para las visualizaciones de datos.CCrear una función de AWS Lambda para convertir los registros a formato .csv. Después añadir la función a la configuración de transformación de Kinesis Data Firehose. Usar Amazon Redshift para realizar análisis ad hoc de los registros con consultas SQL y Amazon QuickSight para desarrollar las visualizaciones de datos.DCrear un clúster de Amazon EMR y usar Amazon S3 como fuente de datos. Crear un job de Apache Spark para realizar los análisis ad hoc y usar Amazon QuickSight para desarrollar las visualizaciones de datos.
- FreePracticeQuiz.questionLabelAnalyticsUn analista de datos está diseñando una solución para consultar conjuntos de datos de forma interactiva con SQL mediante una conexión JDBC. Los usuarios unirán datos almacenados en Amazon S3 en formato Apache ORC con datos almacenados en Amazon Elasticsearch Service (Amazon ES) y Amazon Aurora MySQL. ¿Qué solución proporcionará los resultados MÁS actualizados?AUsar jobs de AWS Glue para hacer ETL de los datos desde Amazon ES y Aurora MySQL hacia Amazon S3. Consultar los datos con Amazon Athena.BUsar Amazon DMS para transmitir los datos desde Amazon ES y Aurora MySQL hacia Amazon Redshift. Consultar los datos con Amazon Redshift.CConsultar todos los conjuntos de datos en su ubicación original con Apache Spark SQL ejecutándose en un endpoint de desarrollo de AWS Glue.DConsultar todos los conjuntos de datos en su ubicación original con Apache Presto ejecutándose en Amazon EMR.
- FreePracticeQuiz.questionLabelDatabasesUna empresa minorista está construyendo su solución de almacén de datos con Amazon Redshift. Como parte de ese esfuerzo, la empresa carga cientos de archivos en la tabla de hechos creada en su clúster de Amazon Redshift. La empresa quiere que la solución alcance el mayor rendimiento posible y aproveche de forma óptima los recursos del clúster al cargar los datos en su tabla de hechos. ¿Cómo debe cumplir la empresa estos requisitos?AUsar varios comandos COPY para cargar los datos en el clúster de Amazon Redshift.BUsar S3DistCp para cargar varios archivos en el Hadoop Distributed File System (HDFS) y usar un conector HDFS para ingerir los datos en el clúster de Amazon Redshift.CUsar tantos comandos LOAD como nodos tenga el clúster de Amazon Redshift y cargar los datos en paralelo en cada nodo.DUsar un único comando COPY para cargar los datos en el clúster de Amazon Redshift.
- FreePracticeQuiz.questionLabelStorageUna vez al mes, una empresa recibe un archivo .csv de 100 MB comprimido con gzip. El archivo contiene 50 000 registros de anuncios inmobiliarios y se almacena en Amazon S3 Glacier. La empresa necesita que su analista de datos consulte un subconjunto de los datos correspondiente a un proveedor concreto. ¿Cuál es la solución más rentable?ACargar los datos en Amazon S3 y consultarlos con Amazon S3 Select.BConsultar los datos directamente desde Amazon S3 Glacier con Amazon Glacier Select.CCargar los datos en Amazon S3 y consultarlos con Amazon Athena.DCargar los datos en Amazon S3 y consultarlos con Amazon Redshift Spectrum.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa que supervisa las condiciones meteorológicas en obras remotas está montando una solución para recopilar datos de temperatura de las dos estaciones meteorológicas siguientes: la estación A, que tiene 10 sensores, y la estación B, que tiene cinco. Estas estaciones fueron ubicadas por expertos en la materia sobre el terreno. Cada sensor tiene un identificador único. Los datos recopilados por cada sensor se recogerán mediante Amazon Kinesis Data Streams. En función del rendimiento total de entrada y salida, se creó un único flujo de datos de Amazon Kinesis con dos shards. Se crearon dos claves de partición basadas en los nombres de las estaciones. Durante las pruebas aparece un cuello de botella en los datos procedentes de la estación A, pero no en los de la estación B. Tras la revisión, se confirma que el rendimiento total del flujo sigue siendo inferior al rendimiento asignado a Kinesis Data Streams. ¿Cómo puede resolverse este cuello de botella sin aumentar el coste ni la complejidad globales de la solución, manteniendo los requisitos de calidad en la recogida de datos?AAumentar el número de shards en Kinesis Data Streams para incrementar el nivel de paralelismo.BCrear un flujo de datos de Kinesis independiente para la estación A con dos shards y enviar a él los datos de los sensores de la estación A.CModificar la clave de partición para usar el identificador del sensor en lugar del nombre de la estación.DReducir el número de sensores de la estación A de 10 a 5.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa está construyendo un data lake y necesita ingerir datos desde una base de datos relacional que contiene datos de series temporales. La empresa quiere usar servicios gestionados para lograrlo. El proceso debe programarse a diario y traer a Amazon S3 únicamente los datos incrementales del origen. ¿Cuál es el enfoque MÁS rentable para cumplir estos requisitos?AUsar AWS Glue para conectarse al origen de datos mediante controladores JDBC. Ingerir solo los registros incrementales usando los job bookmarks.BUsar AWS Glue para conectarse al origen de datos mediante controladores JDBC. Almacenar la última clave actualizada en una tabla de Amazon DynamoDB e ingerir los datos usando esa clave como filtro.CUsar AWS Glue para conectarse al origen de datos mediante controladores JDBC e ingerir el conjunto de datos completo. Usar las bibliotecas de Apache Spark adecuadas para comparar el conjunto de datos y hallar el delta.DUsar AWS Glue para conectarse al origen de datos mediante controladores JDBC e ingerir todos los datos. Usar AWS DataSync para asegurar que solo el delta se escriba en Amazon S3.
- FreePracticeQuiz.questionLabelSecurity & ComplianceUna empresa hipotecaria dispone de un microservicio para aceptar pagos. Este microservicio usa el cliente de cifrado de Amazon DynamoDB con claves gestionadas por AWS KMS para cifrar los datos sensibles antes de escribirlos en DynamoDB. El equipo financiero debe poder cargar estos datos en Amazon Redshift y agregar los valores de los campos sensibles. El clúster de Amazon Redshift se comparte con otros analistas de datos de distintas unidades de negocio. ¿Qué pasos debe seguir un analista de datos para realizar esta tarea de forma eficiente y segura?ACrear una función de AWS Lambda para procesar el flujo de DynamoDB. Descifrar los datos sensibles con la misma clave de KMS. Guardar la salida en un bucket de S3 restringido para el equipo financiero. Crear en Amazon Redshift una tabla finance accesible solo para el equipo financiero. Usar el comando COPY para cargar los datos desde Amazon S3 a esa tabla.BCrear una función de AWS Lambda para procesar el flujo de DynamoDB. Guardar la salida en un bucket de S3 restringido para el equipo financiero. Crear en Amazon Redshift una tabla finance accesible solo para el equipo financiero. Usar el comando COPY con el rol de IAM que tiene acceso a la clave de KMS para cargar los datos desde S3 a esa tabla.CCrear un clúster de Amazon EMR con un rol EMR_EC2_DefaultRole que tenga acceso a la clave de KMS. Crear tablas de Apache Hive que hagan referencia a los datos almacenados en DynamoDB y a la tabla finance de Amazon Redshift. En Hive, seleccionar los datos de DynamoDB e insertar la salida en la tabla finance de Amazon Redshift.DCrear un clúster de Amazon EMR. Crear tablas de Apache Hive que hagan referencia a los datos almacenados en DynamoDB. Insertar la salida en el bucket restringido de Amazon S3 del equipo financiero. Usar el comando COPY con el rol de IAM que tiene acceso a la clave de KMS para cargar los datos desde Amazon S3 a la tabla finance de Amazon Redshift.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa ha desarrollado varios jobs de AWS Glue para validar y transformar sus datos de Amazon S3 y cargarlos en Amazon RDS for MySQL por lotes, una vez al día. Los jobs ETL leen los datos de S3 usando un DynamicFrame. Actualmente, los desarrolladores de ETL tienen dificultades para procesar solo los datos incrementales en cada ejecución, ya que el job de AWS Glue procesa todos los datos de entrada de S3 en cada ejecución. ¿Qué enfoque permitiría a los desarrolladores resolver el problema con el mínimo esfuerzo de programación?AHacer que los jobs ETL lean los datos de Amazon S3 usando un DataFrame.BHabilitar los job bookmarks en los jobs de AWS Glue.CCrear lógica personalizada en los jobs ETL para rastrear los objetos de S3 ya procesados.DHacer que los jobs ETL eliminen de Amazon S3 los objetos o datos procesados después de cada ejecución.
- FreePracticeQuiz.questionLabelStorageUna empresa de medios realiza análisis sobre los datos de logs generados por sus aplicaciones. Recientemente ha aumentado el número de trabajos de análisis concurrentes y el rendimiento global de los trabajos existentes se degrada a medida que se añaden nuevos trabajos. Los datos particionados se almacenan en Amazon S3 One Zone-Infrequent Access (S3 One Zone-IA) y el procesamiento analítico se realiza en clústeres de Amazon EMR mediante EMR File System (EMRFS) con la vista coherente habilitada. Un analista de datos ha determinado que los nodos de tareas de EMR tardan cada vez más en listar los objetos en Amazon S3. ¿Qué acción es la MÁS probable que mejore el rendimiento de acceso a los datos de logs en Amazon S3?AUsar una función hash para crear una cadena aleatoria y añadirla al principio de los prefijos de objeto al almacenar los datos de logs en Amazon S3.BUsar una política de ciclo de vida para cambiar la clase de almacenamiento S3 de los datos de logs a S3 Standard.CAumentar las unidades de capacidad de lectura (RCU) de la tabla compartida de Amazon DynamoDB.DVolver a desplegar en otra zona de disponibilidad los clústeres de EMR que funcionan con lentitud.
- FreePracticeQuiz.questionLabelAnalyticsUna empresa financiera utiliza Apache Hive sobre Amazon EMR para consultas ad hoc. Los usuarios se quejan de un rendimiento lento. Un analista de datos observa lo siguiente: aproximadamente el 90 % de las consultas se envían en la hora posterior a la apertura del mercado; la utilización de Hadoop Distributed File System (HDFS) nunca supera el 10 %. ¿Qué solución ayudaría a resolver los problemas de rendimiento?ACrear configuraciones de instance fleet para los nodos core y task. Crear una política de escalado automático para ampliar los grupos de instancias según la métrica CapacityRemainingGB de Amazon CloudWatch. Crear una política de escalado automático para reducir el instance fleet según la métrica CapacityRemainingGB de CloudWatch.BCrear configuraciones de instance fleet para los nodos core y task. Crear una política de escalado automático para ampliar los grupos de instancias según la métrica YARNMemoryAvailablePercentage de Amazon CloudWatch. Crear una política de escalado automático para reducir el instance fleet según la métrica YARNMemoryAvailablePercentage de CloudWatch.CCrear configuraciones de instance group para los nodos core y task. Crear una política de escalado automático para ampliar los grupos de instancias según la métrica CapacityRemainingGB de Amazon CloudWatch. Crear una política de escalado automático para reducir los grupos de instancias según la métrica CapacityRemainingGB de CloudWatch.DCrear configuraciones de instance group para los nodos core y task. Crear una política de escalado automático para ampliar los grupos de instancias según la métrica YARNMemoryAvailablePercentage de Amazon CloudWatch. Crear una política de escalado automático para reducir los grupos de instancias según la métrica YARNMemoryAvailablePercentage de CloudWatch.
¿Listo para el examen completo de DAS-C01?
Accede a todas las Más de 83 preguntas, a la simulación cronometrada y al análisis de tus puntos débiles. Planes desde 2,99 $: los créditos no caducan nunca.
Preguntas frecuentes
¿Son preguntas de práctica reales de DAS-C01?+
¿Es difícil el examen DAS-C01?+
¿Cuántas preguntas tiene el examen real de DAS-C01?+
¿Hace falta registrarse para usar estas preguntas?+
Sigue estudiando
Aprueba DAS-C01 en el primer intento
Únete a los candidatos que usan DummyExams para practicar con exámenes cronometrados realistas, explicaciones detalladas y análisis de puntos débiles.
Comenzar el examen de práctica completo de DAS-C01