wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

IMF - Big Data y Data Science

Total questions: 40

Worksheet time: 20mins

Name
Class
Date
1.

¿Qué se entiende por big data?20s

a)

Datos no estructurados.

b)

Datos generados por IoT y deben procesarse en tiempo real.

c)

Datos de tipos muy diversos como, por ejemplo, textos, imágenes, etc.

d)

Conjuntos de datos que no se pueden procesar con tecnologías tradicionales.

2.

Hadoop HDFS se basa en una idea implementada en:20s

a)

MapReduce.

b)

Facebook.

c)

Yahoo

d)

Google File System.

3.

¿Cuándo nació Hadoop como subproyecto de Lucene?20s

a)

2022

b)

2000

c)

2006

d)

1969

4.

¿Cuáles son los factores principales que han propiciado el auge del big data?20s

a)

Ley de Moore, abaratamiento del hardware, Hadoop, MapReduce.

b)

Iaas, Paas, SaaS y Serverless.

c)

Ley de Moore, explosión de la información, Hadoop, la nube.

d)

Ley de Moore, explosión de la información, Hadoop, HDFS.

5.

La generación de informes corresponde a:20s

a)

La analítica predictiva.

b)

La analítica prescriptiva.

c)

La analítica descriptiva.

d)

El aprendizaje

6.

La ciencia de datos requiere conocimiento de:20s

a)

Tecnología, matemáticas, negocio.

b)

Tecnología, negocio, ingeniería.

c)

Programación, matemáticas, Ingeniería

d)

De fútbol y un poco motos

7.

¿Cómo se llaman los repositorios de información típicos del mundo big data?20s

a)

Data mart.

b)

Almacén de datos.

c)

Lagode datos o Data Lake

d)

Base de datos.

8.

¿Cómo se llaman los repositorios de información típicos de la inteligencia de negocio?20s

a)

NoSQL

b)

Pausini´s Song

c)

Almacén de Datos o Data warehouse

d)

Ninguna de las anteriores es correcta. El profe no se entera...

9.

En un lago de datos se guardan los datos en bruto.20s

a)

Cierto. Es una de sus principales ventajas.

b)

Falso. Sería demasiado caro.

c)

Falso. Sería poco eficiente.

d)

Cierto. Aunque solo temporalmente, mientras se procesan, luego se borran

10.

¿Cuáles son las tres uves que mejor permiten caracterizar las tecnologías big data?20s

a)

Volumen, variedad, valor.

b)

Volumen, variedad, velocidad.

c)

Volumen, velocidad, valor.

d)

Volumen, velocidad, verosimilitud.

11.

Las bases de datos tradicionales:20s

a)

Están diseñadas para almacenar información estructurada.

b)

Están diseñadas para almacenar información no estructurada.

c)

Están diseñadas para almacenar información en tiempo real.

d)

Diseñadas para almacenar grandes cantidades de información.

12.

¿Qué diferencia hay entre ETL y ELT?

a)

Es lo mismo.

b)

Uno es un acrónimo en inglés y otro en español. 

c)

En un lago de datos se usa ETL y no ELT. 

d)

En un lago de datos se usa ELT y no ETL. 

13.

¿Qué tres áreas suelen ser frecuentes en un lago de datos?

a)

Desarrollo, sandbox y producción.

b)

Landing, staging, golden. 

c)

Temporal, cobre y oro. 

d)

Aterrizaje, landing y oro. 

14.

Una característica de la inteligencia de negocio es: 

a)

Ha sido desplazada por el big data.

b)

 

Trabaja con fuentes de información estructurada. 

c)

Apenas se utiliza.

d)

Usa lagos de datos. 

15.

Los registros de navegación web se caracterizan por:

a)

Generar cantidades masivas de información.

b)

Generar información muy estructurada. 

c)

Generar información poco segura. 

d)

Generar registros con una estructura muy variada. 

16.

¿Qué es más rápido? ¿Hadoop o Spark?

a)

Hadoop.

b)

Ninguno de los dos es rápido. 

c)

Los dos son similares en ese aspecto.

d)

Spark. 

17.

Hadoop utiliza un nivel de replicación por defecto de:

a)

Tres.

b)

Cuatro. 

c)

Dos. 

d)

infinito

18.

Las aplicaciones de software que trabajan con bases de datos tradicionales están diseñadas:

a)

Para procesar la información en streaming, a medida que va llegando.

b)

Para procesar la información por lotes. 

c)

Para procesar la información en tiempo real, sin apenas latencias. 

d)

Para procesar la información de manera online

19.

Hadoop es una tecnología big data que soluciona el problema de: 

a)

Una alta velocidad de los datos que deben ser procesados en streaming.

b)

Una alta latencia en el procesamiento de datos. 

c)

Una gran variedad de datos. 

d)

Un elevado volumen de datos. 

20.

La tecnología streaming se caracteriza por:

a)

Procesar un alto volumen de datos.

b)

Procesar información estructurada y no estructurada. 

c)

Procesar flujos continuos de datos. 

d)

Una alta fiabilidad a la hora de procesar los datos. 

21.

Spark es una tecnología big data que se caracteriza por: 

a)

Almacenar grandes cantidades de datos.

b)

Almacenar datos con estructuras muy variadas. 

c)

Almacenar datos de tipo NoSQL. 

d)

Procesar datos distribuidos de manera muy rápida. 

22.

Cuál de las siguientes es una librería de Spark:

a)

Spark Streaming. 

b)

Spark NoSQL.

 

c)

Spark Processor.

d)

Todas las anteriores

23.

Los componentes característicos de una arquitectura lambda son: 

a)

Capa de streaming, capa servidora, capa de tiempo real.

b)

Capa de batch, capa de streaming, capa de tiempo real.  

c)

 

Capa de lotes, capa servidora, capa de tiempo real.

d)

Capa de batch, capa servidora, capa de tiempo real.

24.

Hadoop y Spark Streaming ayuda a resolver el problema de:

a)

Consistencia y Disponibilidad

b)

Volumen y velocidad respectivamente. 

c)

No son soluciones especialmente relevantes en el mundo Big Data

d)

La influencia de la redundancia en los nodos de computación cuántica

25.

Las soluciones NoSQL ayudan a resolver el problema de:

a)

Volumen. 

b)

Velocidad. 

c)

Variedad.

 

d)

Veracidad.

26.

El HDFS se encarga de:

a)

El procesamiento distribuido.

b)

El almacenamiento distribuido. 

c)

El control distribuido. 

d)

La monitorización de recursos. 

27.

MapReduce es:

a)

Un sistema de virtualización. 

b)

Un lenguaje de programación.

c)

Un sistema de visualización. 

d)

Un marco de procesamiento distribuido. 

28.

HDFS divide un fichero de datos en:

a)

Trocitos pequeñitos

b)

Bloques.

c)

Nodos

d)

Porciones

29.

La tarea map se encarga de:

a)

Aplicar una función de reducción.

b)

Aplicar una función sobre cada fichero. 

c)

Aplicar una función de cuenta. 

d)

Aplicar una función sobre cada elemento del bloque.

30.

La tarea reduce se encarga de:

a)

Aplicar una función sobre cada elemento del bloque.

b)

Aplicar una función de reducción sobre cada bloque. 

c)

Aplicar una función de cuenta. 

d)

Aplicar una función de reducción sobre los resultados de la fase map

31.

Spark MLlib es una librería de:

a)

Tratamiento de grafos.

b)

Aprendizaje automático.

c)

Streaming.

d)

SQL. 

32.

Spark SQL es una librería para:

a)

Tratamiento de grafos.

b)

Aprendizaje automático.

c)

No existe tal librería. 

d)

SQL. 

33.

Spark LightBlue es una actualización de software basado en Cassandra y Thelma, ambos productos de la Fundación Knight

a)

Cierto, y además es Opensource

b)

Cierto, pero resulta muy caro y complejo su despliegue

c)

No existe esa herramienta

d)

Existen productos alternativos que mejoran su rendimiento

34.

¿Qué es un modelo de madurez?

a)

Define el flujo de la información en la empresa.

b)

Define los objetivos de negocio. 

c)

Define las etapas que llevan de un estado inicial a uno deseado. 

d)

Define el organigrama de la empresa. 

35.

¿Qué tipo de valor generado podemos asociar a la dimensión de la velocidad de los datos?

a)

Información más detallada de todas las transacciones.

b)

Decisiones más rápidas. 

c)

Decisiones basadas en información no estructurada. 

d)

Utilización de nuevas métricas basadas en comentarios en redes sociales.  

36.

¿Cuál de estas iniciativas está relacionada con el impacto del big data en los canales?

a)

Microsegmentación.

b)

Decisiones más rápidas. 

c)

Comercialización de grandes conjuntos de datos. 

d)

Optimización de rutas. 

37.

La optimización sociosanitaria permite:

a)

Hacer mantenimiento predictivo.

b)

Recomendar servicios. 

c)

Evitar abandonos. 

d)

Optimizar la atención a aquellos pacientes que más lo necesitan

38.

¿Cómo impacta la tecnología big data en la innovación?

a)

Ayudando a mejorar y automatizar procesos.

b)

Mejorando la toma de decisiones. 

c)

Favoreciendo la creación de nuevos productos y servicios. 

d)

Mejorando la conectividad. 

39.

¿Qué es una empresa data-driven?

a)

Aquella que toma decisiones basadas en las opiniones de los analistas de datos.

b)

Aquella que toma decisiones basadas en la experiencia de los analistas de negocio.

c)

Aquella que toma decisiones basadas en datos. 

d)

Aquella que tiene un CDO. 

40.

El modelo basado en capacidades permite generar una hoja de ruta a partir de las siguientes fases en el orden dado:

a)

Capacidades, estrategia, objetivos de negocio, casos de uso.

b)

Estrategia, objetivos de negocio, capacidades, tecnología. 

c)

Objetivos de negocio, casos de uso, capacidades, tecnología. 

d)

Estrategia, objetivos de negocio, casos de uso, capacidades.