Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

TECNOLOGIA D 2024

Total questions: 123

Worksheet time: 1hrs 2mins

Name
Class
Date
1.

Zona temporal que sirve como paso para la entrada y salida de la información en DATIO

a)

raw y master

b)

staging

c)

raw y staging

d)

Todas las anteriores

2.


¿Cuál de las siguientes opciones no es cierta para DataFrame ?

a)

RDD en Apache Spark está detrás de un DataFrame

b)

Podemos construir DataFrame a partir de diferentes fuentes de datos, archivo de datos estructurados, tablas en Hive.

c)

La interfaz de programación de aplicaciones (API) de DataFrame está disponible en varios lenguajes.

d)

Tanto en Scala como en Java, representamos DataFrame como DataSet de filas.

3.


Propietario y responsable del Sandbox. Tiene acceso a todas las funcionalidades del usuario y acceso al Sandbox Manager. Son los responsables de gobernar el sandbox y gestionar todas las peticiones de acceso al sandbox, el intercambio de datos, las aprobaciones, etc

a)

Viewer

b)

DataScientist

c)

Sandbox Admin

d)

Sandbox Owner

4.


¿Qué hace Spark Engine?

a)

Scheduling

b)

Supervisión de datos en un clúster

c)

Distribuir datos a través de un clúster

d)

Todas las anteriores

5.


Elija la declaración correcta

a)

La ejecución comienza con la llamada a la acción

b)

La ejecución comienza con la llamada a la transformación

c)

Todas las transformaciones y acciones se evalúan lazy

d)

Ninguna de las anteriores

6.


¿Cuál de las siguientes no es una fase de ejecución de consultas SQL de Spark?

a)

Análisis

b)

Optimización lógica

c)

Ejecución

d)

Planificación física

7.

Defina nodo trabajador en Apache Spark

a)

Nodo esclavo que realiza tareas asignadas

b)

Nodo que gestiona todo el proceso en el clúster

c)

Nodo que administra todo el proceso en el clúster y nodo esclavo que realiza tareas

d)

Ninguna de las anteriores

8.

¿Cuál de las siguientes no es una función de Spark Context en Apache Spark?

a)

Punto de entrada a Spark SQL

b)

Obtener el estado actual de la aplicación Spark

c)

Establecer la configuración

d)

Acceder a varios servicios

9.

Podemos crear DataFrame usando

a)

Tablas en Hive

b)

Bases de datos externas

c)

Estructuras de datos Files

d)

Todas las opciones son correctas

10.


¿Cuál de las siguientes opciones es buena para las transformaciones y acciones de bajo nivel?

a)

RDD

b)

DataFrame

c)

DataSet

d)

Todas las anteriores

11.

¿Cuáles transformaciones de kirby son permitidas en la fase de Raw?

a)

Solo se permite crear campos, aplicar filtros y en casos excepcionales, transformaciones para tokenizar

b)

Ninguna, ya que no se tiene permitido aplicar transformaciones en raw

c)

Solo se permite transformación literal, para crear campos generados

d)

Solo se permite realizar filtros en RAW para asegurarnos que cuadre la información

12.

¿Qué es coalese?

a)

Se utiliza para aumentar o disminuir las particiones de RDD, DataFrame, DataSet

b)

Se utiliza para reducir el número de particiones de forma eficiente

c)

Es un método que permite acceder a un RDD varias veces

d)

Fusiona los valores de cada tecla usando una función reductiva

13.

¿Cuáles son las características de Spark RDD?


a)

Cálculo en memoria

b)

Evaluaciones perezosas

c)

Tolerancia a fallos

d)

Todos los anteriores

14.


¿Cuál es el uso de Apache Spark en DATIO?

a)

Facilitar la comunicación entre skynet con los diferentes aplicativos.

b)

Desarrollar aplicaciones Spark

c)

Comunicación con Hadoop

d)

Ninguna de las anteriores

15.


¿En qué versión de Spark se introdujo el DataSet?


a)

Spark 1.6

b)

Spark 1.4.0

c)

Spark 2.1.0

d)

Spark 3.0.1

16.

¿Cuales son los 4 grupos de kind de un job?

a)

Developer, Egression, Sandbox, Processing

b)

Developer, Engine, Sandbox, Production

c)

Processing, Egression, Sandbox, Production

d)

Developer, Egression, Sandbox, Production

17.

Se puede acceder a la API del DataSet en:

a)

Scala y R

b)

Java y Scala

c)

Java, Scala y Python

d)

Scala y Python

18.

 

Defina partición en apache Spark:

a)

Proceso para derivar unidades lógicas de datos para mejorar el proceso

b)

Operación de RDD que produce valores que no son de RDD

c)

Método para seleccionar aquellos elementos con una condición de filtro

d)

Operación que genera un nuevo DataFrame

19.

¿Cuál de las siguientes no es una característica de Spark?

a)

Admite el cálculo en memoria

b)

Tolerancia a fallos

c)

Compatible con otros sistemas de almacenamiento de archivos

d)

Es rentable

20.


¿Qué File System admite Spark?

a)

Amazon S3

b)

Maquina Local

c)

HDFS

d)

Todas las anteriores

21.


La abstracción básica de Spark Streaming es:

a)

RDD

b)

DStream

c)

Share variable

d)

Ninguna de las anteriores

22.

Cuando las operaciones exigen uso intensivo de los discos y siguen el paradigma de MapReduce debo de utilizar

a)

Spark

b)

Hadoop

23.


¿Al realizar merge a un PR, puedo asegurar que mis componentes ya están listos para correr en producción?

a)

No, ya que falta pasar de la rama Dev a la rama master

b)

No, ya que habría que visualizar la build post-merge, asegurarnos que haya terminado exitosamente y que el objeto coincida con e job en la PR en la rama master

c)

Si, ya que al darle el botón de merge significa que los cambios se despliegan en live

d)

Si, mientras en la PR no marque algún error, significa que los componentes ya están en live

24.

¿Cuál es el propósito de usar schemas en las ingestas?

a)

Almacenar el tipo de dato en Sophia

b)

Valida que la información a ingestas coincida con ese objeto previamente gobernado

c)

Cargar la información en Datum

25.


¿Desde que fuente de Datos tiene la capacidad de leer Datio?

a)

Datio puede leer información desde Launchpad, TeraData y HDFS

b)

Datio solo puede leer desde el HDFS

c)

Datio puede leer desde cualquier fuente de datos ya que forma parte de la plataforma ETHER

d)

Datio puede leer desde TeraData, HDFS y Host

26.


¿Cuáles son los beneficios de usar Apache Spark sobre MapReduce?

a)

Uso de memoria y mayor velocidad (100 veces mas rápido en procesamiento)

b)

Uso de Disco Duro

c)

Ambas

d)

Ninguna

27.


En la optimización de Spark SQL, cuál de los siguientes no está presente en el plan lógico:

a)

Plegado constante

b)

Empuje de predicado

c)

Árbol de sintaxis abstracta

d)

Poda de proyección

28.


¿Cuántos Spark Context pueden estar activos por JVM?

a)

Más de uno

b)

Sólo uno

c)

No específico

d)

Ninguna de las anteriores

29.

La tolerancia a fallas en RDD se logra usando:

a)

Es el Kernel de Spark

b)

DAG (Directed Acyclic Graph)

c)

Mejora drásticamente el rendimiento del algoritmo iterativo

d)

Es la biblioteca de aprendizaje automático escalable que ofrece eficiencias

30.


¿Cuál de las siguientes sentencias es correcta para Spark SQL?

a)

Es el Kernel de Spark

b)

Proporciona una plataforma de ejecución para todas las aplicaciones de Spark

c)

Permite a los usuarios ejecutar sentencias SQL/HQL

d)

Habilita una poderosa aplicación interactiva de análisis de datos a través de datos de transmisión en vivo

31.


¿Qué es una transformación en Spark RDD?

a)

Toma RDD como entrada y produce uno o más RDD como salida

b)

Devuelve el resultado final de los cálculos RDD.

c)

Las formas de enviar el resultado de los ejecutores al controlador

d)

Ninguna de las anteriores

32.


¿Qué algoritmo no es la solución para un problema de regresión?

a)

Logistic Regression

b)

Ridge Regression

c)

Decision Trees

d)

Gradient-Boosted Trees

e)

Ninguna las anteriores

33.

Tipos de ingesta disponibles en skynet

a)

Diferencial, incremental y re proceso

b)

append, overwrite y reprocess

c)

Punctual, Incremental, Diferencial, re proceso

d)

Ninguna las anteriores

34.


¿Qué configuración es la correcta para tratar los datos mal formados dentro de un archivo de configuración de ingestas?

a)

La lectura debe configurarse como drop malformed para leer registros malformed

b)

El modo de lectura debe configurarse como failfast para detener el proceso

c)

La lectura se debe configurar como permissive para dejar pasar la información mal

d)

Ninguna de las anteriores

35.


¿Cuál de las siguientes opciones es de código abierto?

a)

Apache Spark

b)

Apache Hadoop

c)

Apache Flink

d)

Todas la anteriores

36.

¿De qué manera se pueden crear jobs dentro de mi flujo de desarrollo?

a)

Kirby y Hammurabi permite la creación de jobs en Dataproc, por lo que al utilizarlos se crearían los jobs para mi desarrollo

b)

Los jobs se crean por medio del flujo de CI, disparado a partir de la creación de una PR

c)

Los jobs se crean en la herramienta Dataproc-UI

d)

La creación de jobs se debe solicitar a soporte, para después hacer uso de ellos

37.


¿Cuáles son las 3 zonas del HDFS?

a)

Stagging, Raw, Master

b)

Stagging, DC-DD-Field-Raw, DC-DD-Field-Master

c)

Raw Master y/o out/staging

d)

Ninguna de las anteriores

38.


¿Cuál de las siguientes es la estructura de datos fundamental de Spark?

a)

RDD

b)

DataFrame

c)

DataSet

d)

Ninguna de las anteriores

39.


¿Cuáles son las tallas de un job?

a)

S, M y L

b)

XS, S, M, L, LL

c)

XS, S, M y L

d)

XXS, XS, S, M, L y XL

40.


¿Cuáles son los tipos de acciones?

a)

reduce(func), collect(), count(), first(), take(n), takeSample(withReplacement, num, [seed]), takeOrdered(n, [ordering]), saveAsTextFile(path)

b)

map(func), filter(func), flatMap(func), sample(withReplacement, fraction, seed)

c)

mapPartitions (func), union(otherDataset), intersection(otherDataset)

41.


¿Cuáles de las siguientes características son comunes para el RDD Y DataFrame?

a)

Inmutables

b)

Evaluaciones perezosas

c)

Tolerancia a fallos

d)

Todas las anteriores

42.


Además de los trabajos de procesamiento de secuencias, todas las funcionalidades de Spark proporciona?

a)

Machine learning

b)

Graph processing

c)

Batch processing

d)

Todas las anteriores

43.


¿Cuál es la relación entre Apache Spark y MapReduce?

a)

Igual que MapReduce

b)

Sin Java

c)

Ninguna diferencia

d)

Alternativa a MapReduce

44.


¿Qué significa RDD?

a)

Resilient Distributed DataSets

b)

Resilient Distributed Data

c)

Resilient Distributed

d)

Ninguna de las anteriores

45.


Operaciones de RDD

a)

Transformación

b)

Acción

c)

Almacenamiento en caché

d)

Todas las respuestas son correctas

46.


Apache Spark es un motor unificado de analíticas para procesar datos a gran escala *

a)

Verdadero

b)

Falso

47.


¿Qué es el Yarn?

a)

Nodo de lectura

b)

Divide las funcionalidades de gestión de recursos. Negociador de recursos

c)

El núcleo de Spark

48.


¿Dónde se debe reportar un incidente en la plataforma?

a)

Con el PO

b)

En Jira Service Management a través de un ticket en el canal de soporte Request

c)

En Jira Service Management a través de un ticket en el canal de soporte Incident

d)

En Jira Service Management a través de un ticket en el canal de soporte incidencia

49.


El almacenamiento en Caché es una técnica de optimización

a)

Si

b)

No

c)

Depende del clúster

d)

Depende del DF o RDD

50.


¿Cuáles son los entornos de trabajo en DATIO?

a)

work y live

b)

dev y live

c)

dev y work

d)

Ninguno

51.


Elija la declaración correcta para Spark Context

a)

Interactuar con el administrador de clústeres

b)

Especifica a Spark como acceder al clúster

c)

Ambas cosas

d)

Ninguna

52.


¿Cuál de las siguientes no es una transformación?

a)

flatMap

b)

Map

c)

Reduce

d)

Filter

53.

En Spark Streaming, ¿los datos pueden provenir de que fuentes?

a)

kafka

b)

flume

c)

kinesis

d)

Todas las anteriores

54.

¿Cuál de las siguientes afirmaciones es cierta sobre la transformación estrecha?

a)

Los datos necesarios para el cálculo se encuentran en varias particiones

b)

Los datos necesarios para el cálculo residen en una única partición

c)

Ambas

d)

Ninguna

55.

La operación de lectura en RDD es:

a)

De grano fino

b)

De grano grueso

c)

De grano fino o de grano grueso

d)

Ni de grano fino ni de grano grueso

56.

 

Facilita la creación de soluciones de Streaming escalables y tolerantes a fallos

a)

Spark SQL

b)

Spark Streaming

c)

GraphX

d)

Spark Core

57.


Menciona algunos de los beneficios de los DataSets:

a)

Escalables y se pueden usar para Scala y Java

b)

No tienen filas ni columnas

c)

habilidad de usar funciones lambda

d)

Todas las anteriores

58.


¿Con quien debo reportar si la ejecución de un proceso falla desde el origen?

a)

BEX

b)

APLICATIVO ORIGEN

c)

PO

d)

Frente DEV

59.

 

¿Cuál de las siguientes es la razón por la que Spark es más rápido que MapReduce?

a)

Motor de ejecución DAG y cálculo en memoria

b)

Compatibilidad con distintas API de lenguajes como Scala, Java, Python y R

c)

Los RDD son inmutables y tolerantes a fallos

d)

Ninguna de las anteriores

60.

¿En qué año Apache Spark se hizo de código abierto?

a)

2010

b)

2011

c)

2008

d)

2009

61.


¿Cuál de las siguientes tecnologías es buena para la tecnología Stream?

a)

Apache Spark

b)

Apache Hadoop

c)

Apache Flink

d)

Ninguna de las anteriores

62.

¿Se puede conectar un programa R a un clúster Spark desde?

a)

RStudio

b)

RShell

c)

RScript

d)

Todas las anteriores

63.

¿Cuántas tareas ejecuta Spark en cada partición?

a)

Cualquier número de tareas

b)

Una

c)

Más de una Menos de cinco

d)

100

64.


Apache Spark tiene API en:

a)

Java

b)

Scala

c)

Python

d)

Todas las anteriores

65.

¿Qué acceso tengo que solicitar para monitorizar la ejecución de mis jobs?

a)

Solicitar acceso a BitBucket y Jenkins

b)

Solicitar acceso a la herramienta de Argos

c)

Acceso a Dataproc-UI

d)

Acceso a History Server de Spark

66.

Motor distribuido de uso general para procesar datos.

a)

Spark SQL

b)

Mlib

c)

GraphX

d)

Spark Core

67.

 

Es el área final donde se almacenan los datos para ser utilizados por otras aplicaciones, los datos almacenados contienen formato archivo parquet

a)

master

b)

avro

c)

raw y master

d)

raw y avro

68.

 

¿Cuáles son las 2 zonas gobernadas?

a)

raw y master

b)

staging y master

c)

raw y staging

d)

master y /out/staging

69.


¿Cuáles de las siguientes sentencias no es cierto para la operación MAP( )?

a)

Map transforma un RDD de longitud N en otro RDD de longitud N.

b)

En la operación Map el desarrollador puede definir su propia lógica de negocio personalizada

c)

Se aplica a cada elemento del RDD y devuelve el resultado como un nuevo RDD

d)

Map permite devolver 0, 1 o más elementos desde la función map

70.

 

Un RDD no se puede crear a partir de datos almacenados en:

a)

S3

b)

FS Local

c)

Oracle

d)

HDFS

71.


¿Cuál es la abstracción de Spark?

a)

RDD

b)

DataSet

c)

DataStream

d)

Ninguna de las anteriores

72.


¿En cuál de las siguientes acciones no se devuelve el resultado al driver?

a)

collect

b)

top()

c)

countByValue()

d)

foreach()

73.

¿Cómo debería borrar la información del HDFS que se ingeste en live?

a)

Utilizar job de borrado HDFS de una UUAA

b)

Avisar al área de Bex para que borre la información

c)

Solicitar el borrado a Soporte y arquitectura

d)

Todas las anteriores

74.


¿Cuál de los siguientes es el punto de entrada de Spark SQL?

a)

SparkContext

b)

SparkSession

c)

A y B

d)

Ninguna

75.

 

¿Qué es un MSA?

a)

Modelo de solución de Arquitectura que genera un solution Architect

b)

Documento para entrar a BBVA

c)

Model Situation Access

d)

Ninguna de las anteriores

76.

 

Configuración correcta de disableAutomaticConversion

a)

true

b)

false

77.


¿Cuál de los siguientes no es cierto para Hadoop y Spark?

a)

Ambos usan API’s de código abierto para vincular entre diferentes herramientas

b)

Ambos son entornos informáticos de clúster

c)

Ambos tienen su propio sistema de archivos

d)

Ambas son plataformas de procesamiento de datos

78.


¿Cuál de las siguientes afirmaciones es cierta para RDD?

a)

RDD en Apache Spark es una colección inmutable de objetos

b)

RDD es un paradigma de programación

c)

Es una base de datos

d)

Ninguna de las anteriores

79.


¿Un usuario puede tener acceso directo a rutas de HDFS en work?

a)

Si, a través de un grupo de Spark (DAMXW_SE_SPUUAA)

b)

No, un usuario debe contar con el perfilado de grupo Spark (DAMXW_SE_SPUUAA)

c)

Si ya que por defecto los usuarios pueden ambientar las rutas en work

d)

No, un usuario debe estar perfilado a un grupo de Developers (DAMXW_US_DDUUAA) y este a su vez mediante permisos puede visualizar una ruta (ACLs)

80.

Además de jobs de Streaming, ¿qué otras funcionalidades ofrece Spark?

a)

Machine Learning

b)

Graph processing

c)

Batch processing

d)

Todas son correctas

81.

Apache Spark es compatible:

a)

Batch processing

b)

Stream processing

c)

Graph processing

d)

Todas las anteriores

82.


Componentes del ecosistema Spark

a)

Spark Core

b)

Spark Streaming

c)

MapReduce

d)

Mlib

e)

GraphX

83.


Es un algoritmo codicioso que realiza una partición binaria recursiva del espacio de características:

a)

Naive Bayes

b)

Random Forests

c)

Logistic Regression

d)

Decision Trees

84.


¿Cuáles son los tipos de procesamiento en DATIO?

a)

Sandbox y UUAAs

b)

Spark y Pyspark

c)

Dataproc y Sandbox

d)

Engines y Runtimes

85.


¿Qué es Yarn?

a)

Es una plataforma de gestión para ofrecer operaciones escalables en todo el clúster

b)

Es un SO distribuido basado en el Kernel de sistemas distribuidos Apache Mesos

c)

Es un lenguaje de programación

d)

Ninguna opción es correcta

86.


¿Qué ruta representa un data folder master de la ruta MDCO

a)

data/raw/mdco/data

b)

data/master/mdco/data

c)

data/staging/mdco/data

d)

ninguna de las anteriores

87.

 

Contiene herramientas con las que las tareas prácticas de aprendizaje automático son sencillas y escalables

a)

Spark SQL

b)

Spark Streaming

c)

GraphX

d)

Spark Mlib

88.


¿Cuál de las siguientes no es una acción?

a)

collect()

b)

take

c)

map

89.


Diferencia entre Kind Processing y Kind Egression

a)

No existe diferencia entre ambos

b)

Processing se asigna a ingestas y Egression a Casos de uso

c)

Processing se utiliza para procesar datos y egression se utiliza para tokenizar/destokenizar datos

d)

Processing tiene la capacidad de tokenizar datos y Egression destokenizar

90.


¿Qué es Mlib en Apache Spark?

a)

Framework de programación

b)

SQL en Spark

c)

Machine Learning

d)

Base de Datos

91.


Es la API de Spark para grafos y computación en paralelo de grafos

a)

Spark SQL

b)

Spark Streaming

c)

GraphX

d)

Spark Mlib

92.


¿Cuál es el estado de Apache Spark como proyecto de Apache Software Foundation?

a)

Proyecto

b)

Iniciativa

93.

¿Qué grupo debo solicitar si necesito ambientar datos a ciertas rutas en una UUAA en work?

a)

No es necesario solicitar algún permiso, ya que por defecto los usuarios pueden ambientar las rutas en Work

b)

Se debe solicitar al grupo egression de la UUAA, ya que tiene permisos de escritura sobre las rutas HDFS en work

c)

Se debe solicitar una ACL para que mi usuario se le de permiso de escritura (RWX)

d)

Se debe solicitar el grupo Developer

94.

 

Gracias a este módulo, puedes consultar datos estructurados de programas de Spark con SQL:

a)

Spark SQL

b)

Mlib

c)

GraphX

d)

Spark Core

95.


¿Cuál es el uso de Apache Spark?

a)

Ejecutar programas en memoria hasta 100 veces más rápido que map reduce

b)

Se puede usar desde Scala y Python Shells

c)

Ofrecer más de 80 operadores de alto nivel

d)

Ejecutar programas en R

96.

¿De cuántas formas se puede crear un RDD?

a)

4

b)

3

c)

1

d)

2

97.


Es la persona encargada de desarrollar, mantener y operar los componentes de software del proyecto en el que participa:

a)

PO

b)

SCRUM MASTER

c)

DEVELOPER

d)

STAKEHOLDER

98.


DStream internamente es:

a)

Flujo continuo de RDD

b)

Flujo continuo de DataFrame

c)

Flujo continuo de DataSet

d)

Ninguna de las anteriores

99.

¿En qué casos es conveniente utilizar un subset dentro de un archivo de configuración de Hammurabi?

a)

En los archivos de configuración de raw y master de Hammurabi siembre se debe realizar un subset

b)

No es necesario utilizar subsets ya que si no podríamos perder información

c)

Siempre que nuestro objeto sea incremental es conveniente usar un subset para validar solo la información de la fecha en la que se está ingestando y no toda la tabla

d)

Dependerá de que reglas esté aplicando en Hammurabi

100.


¿Qué es la acción en Spark RDD?

a)

Las formas de enviar el resultado de los ejecutores al controlador

b)

Toma RDD como entrada y produce uno o más RDD como salida.

c)

Crea uno o muchos nuevos RDD

d)

Todas las anteriores

101.


Cual de las siguientes declaraciones es falsa para apache Spark:

a)

Proporciona API de alto nivel en Java, Python, R y Scala.

b)

Ejecuta programas en memoria hasta 100 veces mas rápido que MapReduce

c)

Puede ser con Hadoop y puede procesar datos de Hadoop existentes

d)

Spark es marco de código abierto escrito en Java

102.


¿Cuál de los siguientes módulos de Spark Core proporciona la capacidad de programación rápida para Streaming?

a)

Spark Streaming

b)

RDD

c)

GraphX

d)

Spark RDD

103.


Elige la opción en la que se tengan transformaciones

a)

map() & filter()

b)

Shuffle() & reduce()

c)

map() & reduce()

d)

map() & sort()

104.

 

¿Donde persiste la información en Datio?

a)

HDFS

b)

Sandbox

c)

AWS

d)

Ether

105.


SparkContext guía sobre cómo acceder al clúster de Spark

a)

Verdadero

b)

Falso

106.


¿Qué tipo de procesamiento puede realzar Spark?

a)

Ninguno

b)

Solo procesamiento batch

c)

Batch y Streaming

d)

Solo Streaming

107.

 

¿Podemos añadir o configurar un nuevo cálculo de cadena después de iniciar SparkContext?

a)

SI

b)

NO

108.


Al ejecutar Spark en Yarn, ¿Debo instalar Spark en todos los nodos del Clúster?

a)

SI

b)

NO

109.


¿Cuándo evalúa Apache Spark RDD?

a)

Tras la acción

b)

Tras la transformación

c)

Tanto en transformación como en acción

110.


¿Cuál de los siguientes enunciados es cierto para SparkCore?

a)

Es el Kernel de Spark

b)

Permite a los usuarios ejecutar consultas SQL/HQL sobre Spark

c)

Mejora drásticamente el rendimiento del algoritmo iterativo

d)

Es la biblioteca de aprendizaje automático escalable que ofrece eficiencias

111.

Spark SQL traduce los comandos en códigos, estos códigos se procesan por:

a)

Driver nodes

b)

Executor Nodes

c)

Cluster Manager

d)

Ninguno de los anteriores

112.


Las deficiencias de Hadoop MapReduce fueron superadas por Spark RDD por:

a)

DAG

b)

Lazy evaluation

c)

Procesamiento en memoria

d)

Todas las anteriores

113.

 

¿Qué se hace en el caso de un archivo mal formado?

a)

Se aplica el DropMalformed que elimina los registro mal formados y los coloca en un archivo que le indiquemos.

b)

Eliminar a mano los registro malos.

c)

No, hacer nada

114.


El nivel de almacenamiento predeterminado de cache es:

a)

MEMORY_ONLY

b)

MEMORY AND DISK

c)

MEMORY_ONLY SAVE

d)

DISK_ONLY

115.

¿Cómo es la ruta para los archivos temporales del DCOM?

a)

/data/master/dcom/datatmp

b)

/data/raw/dcom/datatmp

116.


En que parte del proceso se crean los jobs

a)

Con kirby durante el desarrollo local

b)

Se solicita la creación de los jobs

c)

En el proceso de CI (Jenkins)

d)

En el deploy con Skynet

117.


¿Podemos editar los datos de RDD, por ejemplo, la conversión de casos?

a)

SI

b)

NO

118.


¿Cuál de las siguientes afirmaciones es cierta sobre DataFrame?

a)

Los DataFrames proporcionan una API más fácil de usar que los RDD

b)

La API DataFrame tiene disposiciones para la seguridad de tipos en tiempo de compilación

c)

Todos los anteriores

119.

 

¿Cuál de las siguientes es una herramienta de la biblioteca de aprendizaje automático?

a)

Persistencia

b)

Utilidades como álgebra lineal, estadística

c)

Pipelines

d)

Todo lo anterior

120.

¿Cuál de las siguientes afirmaciones es cierta para Spark Mlib?

a)

Proporciona una plataforma de ejecución para todas las aplicaciones Spark

b)

Es la biblioteca escalable de aprendizaje automático que ofrece eficiencias

c)

Permite una poderosa aplicación interactiva y de análisis de datos a través de transmisión de datos en vivo

d)

Todo lo anterior

121.


¿Cuál de las siguientes afirmaciones es cierta para Spark Shell?

a)

Ejecuta/prueba el código de la aplicación de forma interactiva

b)

Permite leer de muchos tipos de fuentes de datos

c)

Todo lo anterior

d)

Ayuda a que las aplicaciones Spark se ejecuten fácilmente en la línea de comandos del sistema

122.

 

La operación de escritura en RDD es:

a)

De grano fino

b)

De grano grueso

c)

De grano fino o de grano grueso

d)

Ni de grano fino ni de grano grueso

123.

 

¿Es posible mitigar a los rezagados en RDD?

a)

SI

b)

NO