Font size
WorksheetsData Science & Big Data
Total questions: 18
Worksheet time: 19mins
Cómo podrías definir la Ciencia de Datos?
Es Big Data
Es el uso de la estadística para resolver problemas
Es el arte de descubrir las ideas y tendencias que se
esconden detrás de los datos.
Cuáles de los siguientes son productos de datos?
Mantener las ventas
Aumentar utilidades
Disminuir costos
Diversificar ingresos
La siguiente afirmación es falsa o verdadera?
"Un producto de datos es el resultado esperado de la explotación de los datos"
Falso
Verdadero
El Científico de Datos es quien:
Construye y soporta la infraestructura necesaria para llegar a responder el problema
Analiza, interpreta, modela y responde la pregunta
Conoce el negocio y utiliza los resultados para generar estrategias
El Ingeniero de Datos es quien:
Conoce el negocio y utiliza los resultados para generar estrategias
Construye y soporta la infraestructura necesaria para llegar a responder el problema
Analiza, interpreta, modela y responde la pregunta
Son características de un Científico de Datos:
Habilidad para plantear buenas preguntas
Habilidad para contar historias
Curiosidad
Pensamiento analítico
La siguiente afirmación es falsa o verdadera?
"Big Data se refiere al almacenamiento de datos creados por personas, herramientas o máquinas, que requiere tecnología para ser recolectados, alojados y procesados analíticamente para obtener información comercial en tiempo real."
Verdadero
Falso
La quinta y más importante V de la Big Data es:
Variedad
Volumen
Valor
Velocidad
Veracidad
Cual de las siguiente afirmaciones es VERDADERA?
La Big Data sólo puede darse en el marco de la Ciencia de Datos
La Ciencia de Datos hace parte del conjunto de campos incluidos en la Big Data.
Big Data y Ciencia de Datos son formas diferentes de llamar al mismo proceso.
La Big Data hace parte del conjunto de campos incluidos en la Ciencia de Datos.
Un Ecosistema Hadoop se presta en la Cloud como:
Software como servicio
Plataforma como servicio
Infraestructura como servicio
Las herramientas de Analítica de Datos permiten:
Recopilar información desde diferentes fuentes
Comprender y Preparar los datos
Mapear y reducir los registros de datos
Construir y Evaluar un modelo
Puedo recopilar y organizar datos desde diferentes bases de datos NO relacionales mediante:
Hive
Sqoop
HBase
Flume
El núcleo que le permite a Hadoop soportar la Big Data es:
ZooKeeper
Spark
Pig
Map Reduce
La importancia de la Visualización radica en que:
Facilita comprender los resultados del análisis de los datos
Sólo los expertos del negocio pueden leerlos
Brinda interactividad con los datos
Las etapas de la Preparación de los Datos son:
Transformación de los datos
Medidas de Diagnóstico
Ingeniería de características
Pruebas de Significancia Estadística
La Ciencia de Datos busca:
Aplicar modelos que respondan a la pregunta inicial
Aplicar algoritmos que respondan a la pregunta inicial
Construir modelos que respondan a la pregunta inicial
Construir algoritmos que respondan a la pregunta inicial
La siguiente afirmación es falsa o verdadera?
"La etapa del Enfoque Analítico en la metodología de la Ciencia de Datos es importante porque define el tipo de análisis que se le realizará a los datos para obtener la respuesta a la pregunta"
Verdadero
Falso
En HDFS, cuando un Cliente desea escribir datos:
Envía el conjunto datos al Name Node, el Name Node los distribuye y replica en los Data Nodes, almacena las ubicaciones y envía una confirmación al Cliente.
Envía la información de los datos al Name Node, el Name Node distribuye y replica los datos en los Data Nodes, almacena las ubicaciones y envía las direcciones al Cliente para su posterior lectura.
Envía la información de los datos al Name Node, el Name Node estructura la distribución y replicación de los datos, envía la estructura al Cliente, este se comunica el primer Data Node de la estructura, le envía los datos y la información de la estructura, y este Data Node se encarga del almacenamiento en los demás Data Nodes.
Envía la información de los datos al Name Node, el Name Node estructura la distribución y replicación de los datos, envía la estructura al Cliente, este se comunica el primer Data Node de la estructura, le envía los datos que le corresponden y este los almacena, luego el Cliente se comunica con el segundo Data Node y hace lo mismo, y así se repite hasta visitar todos los Data Nodes de la estructura.
