WorksheetsTECNOLOGIA D 2024
Total questions: 123
Worksheet time: 1hrs 2mins
Zona temporal que sirve como paso para la entrada y salida de la información en DATIO
raw y master
staging
raw y staging
Todas las anteriores
¿Cuál de las siguientes opciones no es cierta para DataFrame ?
RDD en Apache Spark está detrás de un DataFrame
Podemos construir DataFrame a partir de diferentes fuentes de datos, archivo de datos estructurados, tablas en Hive.
La interfaz de programación de aplicaciones (API) de DataFrame está disponible en varios lenguajes.
Tanto en Scala como en Java, representamos DataFrame como DataSet de filas.
Propietario y responsable del Sandbox. Tiene acceso a todas las funcionalidades del usuario y acceso al Sandbox Manager. Son los responsables de gobernar el sandbox y gestionar todas las peticiones de acceso al sandbox, el intercambio de datos, las aprobaciones, etc
Viewer
DataScientist
Sandbox Admin
Sandbox Owner
¿Qué hace Spark Engine?
Scheduling
Supervisión de datos en un clúster
Distribuir datos a través de un clúster
Todas las anteriores
Elija la declaración correcta
La ejecución comienza con la llamada a la acción
La ejecución comienza con la llamada a la transformación
Todas las transformaciones y acciones se evalúan lazy
Ninguna de las anteriores
¿Cuál de las siguientes no es una fase de ejecución de consultas SQL de Spark?
Análisis
Optimización lógica
Ejecución
Planificación física
Defina nodo trabajador en Apache Spark
Nodo esclavo que realiza tareas asignadas
Nodo que gestiona todo el proceso en el clúster
Nodo que administra todo el proceso en el clúster y nodo esclavo que realiza tareas
Ninguna de las anteriores
¿Cuál de las siguientes no es una función de Spark Context en Apache Spark?
Punto de entrada a Spark SQL
Obtener el estado actual de la aplicación Spark
Establecer la configuración
Acceder a varios servicios
Podemos crear DataFrame usando
Tablas en Hive
Bases de datos externas
Estructuras de datos Files
Todas las opciones son correctas
¿Cuál de las siguientes opciones es buena para las transformaciones y acciones de bajo nivel?
RDD
DataFrame
DataSet
Todas las anteriores
¿Cuáles transformaciones de kirby son permitidas en la fase de Raw?
Solo se permite crear campos, aplicar filtros y en casos excepcionales, transformaciones para tokenizar
Ninguna, ya que no se tiene permitido aplicar transformaciones en raw
Solo se permite transformación literal, para crear campos generados
Solo se permite realizar filtros en RAW para asegurarnos que cuadre la información
¿Qué es coalese?
Se utiliza para aumentar o disminuir las particiones de RDD, DataFrame, DataSet
Se utiliza para reducir el número de particiones de forma eficiente
Es un método que permite acceder a un RDD varias veces
Fusiona los valores de cada tecla usando una función reductiva
¿Cuáles son las características de Spark RDD?
Cálculo en memoria
Evaluaciones perezosas
Tolerancia a fallos
Todos los anteriores
¿Cuál es el uso de Apache Spark en DATIO?
Facilitar la comunicación entre skynet con los diferentes aplicativos.
Desarrollar aplicaciones Spark
Comunicación con Hadoop
Ninguna de las anteriores
¿En qué versión de Spark se introdujo el DataSet?
Spark 1.6
Spark 1.4.0
Spark 2.1.0
Spark 3.0.1
¿Cuales son los 4 grupos de kind de un job?
Developer, Egression, Sandbox, Processing
Developer, Engine, Sandbox, Production
Processing, Egression, Sandbox, Production
Developer, Egression, Sandbox, Production
Se puede acceder a la API del DataSet en:
Scala y R
Java y Scala
Java, Scala y Python
Scala y Python
Defina partición en apache Spark:
Proceso para derivar unidades lógicas de datos para mejorar el proceso
Operación de RDD que produce valores que no son de RDD
Método para seleccionar aquellos elementos con una condición de filtro
Operación que genera un nuevo DataFrame
¿Cuál de las siguientes no es una característica de Spark?
Admite el cálculo en memoria
Tolerancia a fallos
Compatible con otros sistemas de almacenamiento de archivos
Es rentable
¿Qué File System admite Spark?
Amazon S3
Maquina Local
HDFS
Todas las anteriores
La abstracción básica de Spark Streaming es:
RDD
DStream
Share variable
Ninguna de las anteriores
Cuando las operaciones exigen uso intensivo de los discos y siguen el paradigma de MapReduce debo de utilizar
Spark
Hadoop
¿Al realizar merge a un PR, puedo asegurar que mis componentes ya están listos para correr en producción?
No, ya que falta pasar de la rama Dev a la rama master
No, ya que habría que visualizar la build post-merge, asegurarnos que haya terminado exitosamente y que el objeto coincida con e job en la PR en la rama master
Si, ya que al darle el botón de merge significa que los cambios se despliegan en live
Si, mientras en la PR no marque algún error, significa que los componentes ya están en live
¿Cuál es el propósito de usar schemas en las ingestas?
Almacenar el tipo de dato en Sophia
Valida que la información a ingestas coincida con ese objeto previamente gobernado
Cargar la información en Datum
¿Desde que fuente de Datos tiene la capacidad de leer Datio?
Datio puede leer información desde Launchpad, TeraData y HDFS
Datio solo puede leer desde el HDFS
Datio puede leer desde cualquier fuente de datos ya que forma parte de la plataforma ETHER
Datio puede leer desde TeraData, HDFS y Host
¿Cuáles son los beneficios de usar Apache Spark sobre MapReduce?
Uso de memoria y mayor velocidad (100 veces mas rápido en procesamiento)
Uso de Disco Duro
Ambas
Ninguna
En la optimización de Spark SQL, cuál de los siguientes no está presente en el plan lógico:
Plegado constante
Empuje de predicado
Árbol de sintaxis abstracta
Poda de proyección
¿Cuántos Spark Context pueden estar activos por JVM?
Más de uno
Sólo uno
No específico
Ninguna de las anteriores
La tolerancia a fallas en RDD se logra usando:
Es el Kernel de Spark
DAG (Directed Acyclic Graph)
Mejora drásticamente el rendimiento del algoritmo iterativo
Es la biblioteca de aprendizaje automático escalable que ofrece eficiencias
¿Cuál de las siguientes sentencias es correcta para Spark SQL?
Es el Kernel de Spark
Proporciona una plataforma de ejecución para todas las aplicaciones de Spark
Permite a los usuarios ejecutar sentencias SQL/HQL
Habilita una poderosa aplicación interactiva de análisis de datos a través de datos de transmisión en vivo
¿Qué es una transformación en Spark RDD?
Toma RDD como entrada y produce uno o más RDD como salida
Devuelve el resultado final de los cálculos RDD.
Las formas de enviar el resultado de los ejecutores al controlador
Ninguna de las anteriores
¿Qué algoritmo no es la solución para un problema de regresión?
Logistic Regression
Ridge Regression
Decision Trees
Gradient-Boosted Trees
Ninguna las anteriores
Tipos de ingesta disponibles en skynet
Diferencial, incremental y re proceso
append, overwrite y reprocess
Punctual, Incremental, Diferencial, re proceso
Ninguna las anteriores
¿Qué configuración es la correcta para tratar los datos mal formados dentro de un archivo de configuración de ingestas?
La lectura debe configurarse como drop malformed para leer registros malformed
El modo de lectura debe configurarse como failfast para detener el proceso
La lectura se debe configurar como permissive para dejar pasar la información mal
Ninguna de las anteriores
¿Cuál de las siguientes opciones es de código abierto?
Apache Spark
Apache Hadoop
Apache Flink
Todas la anteriores
¿De qué manera se pueden crear jobs dentro de mi flujo de desarrollo?
Kirby y Hammurabi permite la creación de jobs en Dataproc, por lo que al utilizarlos se crearían los jobs para mi desarrollo
Los jobs se crean por medio del flujo de CI, disparado a partir de la creación de una PR
Los jobs se crean en la herramienta Dataproc-UI
La creación de jobs se debe solicitar a soporte, para después hacer uso de ellos
¿Cuáles son las 3 zonas del HDFS?
Stagging, Raw, Master
Stagging, DC-DD-Field-Raw, DC-DD-Field-Master
Raw Master y/o out/staging
Ninguna de las anteriores
¿Cuál de las siguientes es la estructura de datos fundamental de Spark?
RDD
DataFrame
DataSet
Ninguna de las anteriores
¿Cuáles son las tallas de un job?
S, M y L
XS, S, M, L, LL
XS, S, M y L
XXS, XS, S, M, L y XL
¿Cuáles son los tipos de acciones?
reduce(func), collect(), count(), first(), take(n), takeSample(withReplacement, num, [seed]), takeOrdered(n, [ordering]), saveAsTextFile(path)
map(func), filter(func), flatMap(func), sample(withReplacement, fraction, seed)
mapPartitions (func), union(otherDataset), intersection(otherDataset)
¿Cuáles de las siguientes características son comunes para el RDD Y DataFrame?
Inmutables
Evaluaciones perezosas
Tolerancia a fallos
Todas las anteriores
Además de los trabajos de procesamiento de secuencias, todas las funcionalidades de Spark proporciona?
Machine learning
Graph processing
Batch processing
Todas las anteriores
¿Cuál es la relación entre Apache Spark y MapReduce?
Igual que MapReduce
Sin Java
Ninguna diferencia
Alternativa a MapReduce
¿Qué significa RDD?
Resilient Distributed DataSets
Resilient Distributed Data
Resilient Distributed
Ninguna de las anteriores
Operaciones de RDD
Transformación
Acción
Almacenamiento en caché
Todas las respuestas son correctas
Apache Spark es un motor unificado de analíticas para procesar datos a gran escala *
Verdadero
Falso
¿Qué es el Yarn?
Nodo de lectura
Divide las funcionalidades de gestión de recursos. Negociador de recursos
El núcleo de Spark
¿Dónde se debe reportar un incidente en la plataforma?
Con el PO
En Jira Service Management a través de un ticket en el canal de soporte Request
En Jira Service Management a través de un ticket en el canal de soporte Incident
En Jira Service Management a través de un ticket en el canal de soporte incidencia
El almacenamiento en Caché es una técnica de optimización
Si
No
Depende del clúster
Depende del DF o RDD
¿Cuáles son los entornos de trabajo en DATIO?
work y live
dev y live
dev y work
Ninguno
Elija la declaración correcta para Spark Context
Interactuar con el administrador de clústeres
Especifica a Spark como acceder al clúster
Ambas cosas
Ninguna
¿Cuál de las siguientes no es una transformación?
flatMap
Map
Reduce
Filter
En Spark Streaming, ¿los datos pueden provenir de que fuentes?
kafka
flume
kinesis
Todas las anteriores
¿Cuál de las siguientes afirmaciones es cierta sobre la transformación estrecha?
Los datos necesarios para el cálculo se encuentran en varias particiones
Los datos necesarios para el cálculo residen en una única partición
Ambas
Ninguna
La operación de lectura en RDD es:
De grano fino
De grano grueso
De grano fino o de grano grueso
Ni de grano fino ni de grano grueso
Facilita la creación de soluciones de Streaming escalables y tolerantes a fallos
Spark SQL
Spark Streaming
GraphX
Spark Core
Menciona algunos de los beneficios de los DataSets:
Escalables y se pueden usar para Scala y Java
No tienen filas ni columnas
habilidad de usar funciones lambda
Todas las anteriores
¿Con quien debo reportar si la ejecución de un proceso falla desde el origen?
BEX
APLICATIVO ORIGEN
PO
Frente DEV
¿Cuál de las siguientes es la razón por la que Spark es más rápido que MapReduce?
Motor de ejecución DAG y cálculo en memoria
Compatibilidad con distintas API de lenguajes como Scala, Java, Python y R
Los RDD son inmutables y tolerantes a fallos
Ninguna de las anteriores
¿En qué año Apache Spark se hizo de código abierto?
2010
2011
2008
2009
¿Cuál de las siguientes tecnologías es buena para la tecnología Stream?
Apache Spark
Apache Hadoop
Apache Flink
Ninguna de las anteriores
¿Se puede conectar un programa R a un clúster Spark desde?
RStudio
RShell
RScript
Todas las anteriores
¿Cuántas tareas ejecuta Spark en cada partición?
Cualquier número de tareas
Una
Más de una Menos de cinco
100
Apache Spark tiene API en:
Java
Scala
Python
Todas las anteriores
¿Qué acceso tengo que solicitar para monitorizar la ejecución de mis jobs?
Solicitar acceso a BitBucket y Jenkins
Solicitar acceso a la herramienta de Argos
Acceso a Dataproc-UI
Acceso a History Server de Spark
Motor distribuido de uso general para procesar datos.
Spark SQL
Mlib
GraphX
Spark Core
Es el área final donde se almacenan los datos para ser utilizados por otras aplicaciones, los datos almacenados contienen formato archivo parquet
master
avro
raw y master
raw y avro
¿Cuáles son las 2 zonas gobernadas?
raw y master
staging y master
raw y staging
master y /out/staging
¿Cuáles de las siguientes sentencias no es cierto para la operación MAP( )?
Map transforma un RDD de longitud N en otro RDD de longitud N.
En la operación Map el desarrollador puede definir su propia lógica de negocio personalizada
Se aplica a cada elemento del RDD y devuelve el resultado como un nuevo RDD
Map permite devolver 0, 1 o más elementos desde la función map
Un RDD no se puede crear a partir de datos almacenados en:
S3
FS Local
Oracle
HDFS
¿Cuál es la abstracción de Spark?
RDD
DataSet
DataStream
Ninguna de las anteriores
¿En cuál de las siguientes acciones no se devuelve el resultado al driver?
collect
top()
countByValue()
foreach()
¿Cómo debería borrar la información del HDFS que se ingeste en live?
Utilizar job de borrado HDFS de una UUAA
Avisar al área de Bex para que borre la información
Solicitar el borrado a Soporte y arquitectura
Todas las anteriores
¿Cuál de los siguientes es el punto de entrada de Spark SQL?
SparkContext
SparkSession
A y B
Ninguna
¿Qué es un MSA?
Modelo de solución de Arquitectura que genera un solution Architect
Documento para entrar a BBVA
Model Situation Access
Ninguna de las anteriores
Configuración correcta de disableAutomaticConversion
true
false
¿Cuál de los siguientes no es cierto para Hadoop y Spark?
Ambos usan API’s de código abierto para vincular entre diferentes herramientas
Ambos son entornos informáticos de clúster
Ambos tienen su propio sistema de archivos
Ambas son plataformas de procesamiento de datos
¿Cuál de las siguientes afirmaciones es cierta para RDD?
RDD en Apache Spark es una colección inmutable de objetos
RDD es un paradigma de programación
Es una base de datos
Ninguna de las anteriores
¿Un usuario puede tener acceso directo a rutas de HDFS en work?
Si, a través de un grupo de Spark (DAMXW_SE_SPUUAA)
No, un usuario debe contar con el perfilado de grupo Spark (DAMXW_SE_SPUUAA)
Si ya que por defecto los usuarios pueden ambientar las rutas en work
No, un usuario debe estar perfilado a un grupo de Developers (DAMXW_US_DDUUAA) y este a su vez mediante permisos puede visualizar una ruta (ACLs)
Además de jobs de Streaming, ¿qué otras funcionalidades ofrece Spark?
Machine Learning
Graph processing
Batch processing
Todas son correctas
Apache Spark es compatible:
Batch processing
Stream processing
Graph processing
Todas las anteriores
Componentes del ecosistema Spark
Spark Core
Spark Streaming
MapReduce
Mlib
GraphX
Es un algoritmo codicioso que realiza una partición binaria recursiva del espacio de características:
Naive Bayes
Random Forests
Logistic Regression
Decision Trees
¿Cuáles son los tipos de procesamiento en DATIO?
Sandbox y UUAAs
Spark y Pyspark
Dataproc y Sandbox
Engines y Runtimes
¿Qué es Yarn?
Es una plataforma de gestión para ofrecer operaciones escalables en todo el clúster
Es un SO distribuido basado en el Kernel de sistemas distribuidos Apache Mesos
Es un lenguaje de programación
Ninguna opción es correcta
¿Qué ruta representa un data folder master de la ruta MDCO
data/raw/mdco/data
data/master/mdco/data
data/staging/mdco/data
ninguna de las anteriores
Contiene herramientas con las que las tareas prácticas de aprendizaje automático son sencillas y escalables
Spark SQL
Spark Streaming
GraphX
Spark Mlib
¿Cuál de las siguientes no es una acción?
collect()
take
map
Diferencia entre Kind Processing y Kind Egression
No existe diferencia entre ambos
Processing se asigna a ingestas y Egression a Casos de uso
Processing se utiliza para procesar datos y egression se utiliza para tokenizar/destokenizar datos
Processing tiene la capacidad de tokenizar datos y Egression destokenizar
¿Qué es Mlib en Apache Spark?
Framework de programación
SQL en Spark
Machine Learning
Base de Datos
Es la API de Spark para grafos y computación en paralelo de grafos
Spark SQL
Spark Streaming
GraphX
Spark Mlib
¿Cuál es el estado de Apache Spark como proyecto de Apache Software Foundation?
Proyecto
Iniciativa
¿Qué grupo debo solicitar si necesito ambientar datos a ciertas rutas en una UUAA en work?
No es necesario solicitar algún permiso, ya que por defecto los usuarios pueden ambientar las rutas en Work
Se debe solicitar al grupo egression de la UUAA, ya que tiene permisos de escritura sobre las rutas HDFS en work
Se debe solicitar una ACL para que mi usuario se le de permiso de escritura (RWX)
Se debe solicitar el grupo Developer
Gracias a este módulo, puedes consultar datos estructurados de programas de Spark con SQL:
Spark SQL
Mlib
GraphX
Spark Core
¿Cuál es el uso de Apache Spark?
Ejecutar programas en memoria hasta 100 veces más rápido que map reduce
Se puede usar desde Scala y Python Shells
Ofrecer más de 80 operadores de alto nivel
Ejecutar programas en R
¿De cuántas formas se puede crear un RDD?
4
3
1
2
Es la persona encargada de desarrollar, mantener y operar los componentes de software del proyecto en el que participa:
PO
SCRUM MASTER
DEVELOPER
STAKEHOLDER
DStream internamente es:
Flujo continuo de RDD
Flujo continuo de DataFrame
Flujo continuo de DataSet
Ninguna de las anteriores
¿En qué casos es conveniente utilizar un subset dentro de un archivo de configuración de Hammurabi?
En los archivos de configuración de raw y master de Hammurabi siembre se debe realizar un subset
No es necesario utilizar subsets ya que si no podríamos perder información
Siempre que nuestro objeto sea incremental es conveniente usar un subset para validar solo la información de la fecha en la que se está ingestando y no toda la tabla
Dependerá de que reglas esté aplicando en Hammurabi
¿Qué es la acción en Spark RDD?
Las formas de enviar el resultado de los ejecutores al controlador
Toma RDD como entrada y produce uno o más RDD como salida.
Crea uno o muchos nuevos RDD
Todas las anteriores
Cual de las siguientes declaraciones es falsa para apache Spark:
Proporciona API de alto nivel en Java, Python, R y Scala.
Ejecuta programas en memoria hasta 100 veces mas rápido que MapReduce
Puede ser con Hadoop y puede procesar datos de Hadoop existentes
Spark es marco de código abierto escrito en Java
¿Cuál de los siguientes módulos de Spark Core proporciona la capacidad de programación rápida para Streaming?
Spark Streaming
RDD
GraphX
Spark RDD
Elige la opción en la que se tengan transformaciones
map() & filter()
Shuffle() & reduce()
map() & reduce()
map() & sort()
¿Donde persiste la información en Datio?
HDFS
Sandbox
AWS
Ether
SparkContext guía sobre cómo acceder al clúster de Spark
Verdadero
Falso
¿Qué tipo de procesamiento puede realzar Spark?
Ninguno
Solo procesamiento batch
Batch y Streaming
Solo Streaming
¿Podemos añadir o configurar un nuevo cálculo de cadena después de iniciar SparkContext?
SI
NO
Al ejecutar Spark en Yarn, ¿Debo instalar Spark en todos los nodos del Clúster?
SI
NO
¿Cuándo evalúa Apache Spark RDD?
Tras la acción
Tras la transformación
Tanto en transformación como en acción
¿Cuál de los siguientes enunciados es cierto para SparkCore?
Es el Kernel de Spark
Permite a los usuarios ejecutar consultas SQL/HQL sobre Spark
Mejora drásticamente el rendimiento del algoritmo iterativo
Es la biblioteca de aprendizaje automático escalable que ofrece eficiencias
Spark SQL traduce los comandos en códigos, estos códigos se procesan por:
Driver nodes
Executor Nodes
Cluster Manager
Ninguno de los anteriores
Las deficiencias de Hadoop MapReduce fueron superadas por Spark RDD por:
DAG
Lazy evaluation
Procesamiento en memoria
Todas las anteriores
¿Qué se hace en el caso de un archivo mal formado?
Se aplica el DropMalformed que elimina los registro mal formados y los coloca en un archivo que le indiquemos.
Eliminar a mano los registro malos.
No, hacer nada
El nivel de almacenamiento predeterminado de cache es:
MEMORY_ONLY
MEMORY AND DISK
MEMORY_ONLY SAVE
DISK_ONLY
¿Cómo es la ruta para los archivos temporales del DCOM?
/data/master/dcom/datatmp
/data/raw/dcom/datatmp
En que parte del proceso se crean los jobs
Con kirby durante el desarrollo local
Se solicita la creación de los jobs
En el proceso de CI (Jenkins)
En el deploy con Skynet
¿Podemos editar los datos de RDD, por ejemplo, la conversión de casos?
SI
NO
¿Cuál de las siguientes afirmaciones es cierta sobre DataFrame?
Los DataFrames proporcionan una API más fácil de usar que los RDD
La API DataFrame tiene disposiciones para la seguridad de tipos en tiempo de compilación
Todos los anteriores
¿Cuál de las siguientes es una herramienta de la biblioteca de aprendizaje automático?
Persistencia
Utilidades como álgebra lineal, estadística
Pipelines
Todo lo anterior
¿Cuál de las siguientes afirmaciones es cierta para Spark Mlib?
Proporciona una plataforma de ejecución para todas las aplicaciones Spark
Es la biblioteca escalable de aprendizaje automático que ofrece eficiencias
Permite una poderosa aplicación interactiva y de análisis de datos a través de transmisión de datos en vivo
Todo lo anterior
¿Cuál de las siguientes afirmaciones es cierta para Spark Shell?
Ejecuta/prueba el código de la aplicación de forma interactiva
Permite leer de muchos tipos de fuentes de datos
Todo lo anterior
Ayuda a que las aplicaciones Spark se ejecuten fácilmente en la línea de comandos del sistema
La operación de escritura en RDD es:
De grano fino
De grano grueso
De grano fino o de grano grueso
Ni de grano fino ni de grano grueso
¿Es posible mitigar a los rezagados en RDD?
SI
NO
