WorksheetsPreguntas sobre Datawarehouse y Ciencia de Datos
Total questions: 42
Worksheet time: 21mins
¿Cuál es la función principal de un Datawarehouse?
Almacenar datos transaccionales en tiempo real
Proporcionar un repositorio de datos estratégicos, tácticos y operativos
Reemplazar completamente a los sistemas OLTP
Realizar análisis predictivo automático
¿Qué significan las siglas ROI y VAN?
Reducción Operativa Interna y Valor Añadido Neto
Retorno sobre la inversión y Valor actual Neto
Resultados obtenidos inmediatos y Valor acumulado nominal
Retiro Operacional Inmediato y Venta a Nivel nacional
¿Qué es el Data Mining?
Un tipo de Datawarehouse
Una técnica para almacenar datos
Un conjunto de técnicas para descubrir información oculta en los datos
Un sistema de análisis transaccional
¿Cuál es una característica principal de los sistemas OLTP?
Están orientados al análisis histórico
Son de solo lectura
Procesan transacciones en línea con acceso dinámico
Almacenan datos durante años
¿Qué es el clustering en ciencia de datos?
Una técnica de predicción supervisada
Un algoritmo de regresión lineal
Una técnica de agrupamiento para separar datos similares en clusters
Un tipo de análisis de correlación
¿Cuál NO es un beneficio de reducir la dimensionalidad para modelos de machine learning?
Aumenta el sobreajuste
Reduce el tiempo de entrenamiento
Mejora la interpretabilidad
Elimina variables irrelevantes
¿Cuál es un beneficio estratégico de implementar un Datawarehouse?
Reducir la capacidad de análisis de los usuarios
Evitar la integración de fuentes de datos
Proveer información relevante y consistente para decisiones
Aumentar la redundancia de datos
¿Cuál NO es una característica típica de un Datawarehouse?
Datos provenientes solo de transacciones recientes
Acceso de solo lectura
Almacenamiento por largos periodos
Estructura orientada al análisis
¿Cuál es la principal función del analista de negocios en un equipo de BI?
Administrar bases de datos
Diseñar reportes visuales
Actuar como intermediario entre partes interesadas y el área técnica
Aplicar modelos de machine learning
¿Cuál es una diferencia clave entre OLTP y OLAP?
OLTP sirve para decisiones estratégicas y OLAP para transacciones
OLTP está orientado al análisis, OLAP al proceso
OLTP es dinámico y OLAP es estático con datos históricos
OLTP utiliza datos agregados, OLAP no
¿Cuál de los siguientes NO es un tipo común de clustering?
Clustering por decisión
Clustering jerárquico
Clustering basado en densidad
Clustering basado en partición
¿Cuándo termina el algoritmo K-Means?
Cuando se repite 100 veces
Cuando los centroides dejan de cambiar
Cuando cada punto está en su propio cluster
Cuando se eliminan todos los valores atípicos
¿Qué permite eliminar la reducción de dimensionalidad?
Todas las columnas del dataset
Los modelos de clasificación
Variables irrelevantes y ruido en los datos
Las etiquetas de clase
¿Cuál es una ventaja de K-Means?
No requiere definir el número de clusters
Es útil para clusters de cualquier forma
Es fácil de implementar y escalable
Soporta datos categóricos directamente
¿Cuál es el primer paso al aplicar K-Means?
Recalcular los centroides
Elegir el número de clusters K
¿Cuál es el primer paso al aplicar K-Means?
Recalcular los centroides
Elegir el número de clusters K
Asignar los puntos a los clusters
Elegir la métrica de evaluación
¿Qué representa la analogía de PCA como un resumen de libro?
Extraer más páginas de un libro
Eliminar todo el contenido del libro
Resumir la información esencial en menos variables
Duplicar la cantidad de contenido
¿Por qué no se recomienda la convivencia de entornos OLTP y OLAP en una misma base de datos?
Porque OLTP requiere mucha memoria
Porque OLAP necesita bases relacionales
Porque impacta negativamente el rendimiento de OLTP
Porque OLAP bloquea todas las transacciones
¿Qué función cumplen los sistemas DSS (Decision Support System)?
Facilitan únicamente reportes contables
Ayudan en la toma de decisiones incorporando reglas de análisis
Sirven exclusivamente para ventas
Realizan backups automáticos
Una de las funciones del administrador de la plataforma de BI es:
Diseñar tableros para usuarios finales
Hacer análisis predictivo con IA
Asignar permisos y respaldar scripts
Definir requerimientos funcionales
¿Cuál es una analogía usada para explicar clustering?
Clasificar libros por autor
Agrupar caramelos por color o sabor
Sumar los ingresos anuales
Identificar el lenguaje de un texto
¿Cuál es una diferencia entre PCA y LDA?
PCA se basa en clasificación, LDA en varianza
Ambos se usan solo para visualización
PCA se basa en varianza, LDA en clasificación
Ninguno reduce la dimensionalidad
¿Cuál de las siguientes funciones NO corresponde al Chief Data Officer (CDO)?
Definir qué datos se usan y con qué propósito
Programar software de bases de datos
Analizar los datos como activo estratégico
Gestionar la privacidad de los datos
¿Por qué el especialista en visualización es considerado estratégico en BI?
Por su habilidad en instalar software
Porque define las estructuras organizacionales
Porque el grado de aceptación de la solución depende de su claridad y diseño
Porque crea bases de datos complejas
¿Qué busca lograr la reducción de dimensionalidad en un conjunto de datos?
Reducir el número de variables sin perder información relevante
Eliminar todos los datos innecesarios de un sistema
Aumentar la cantidad de variables en un modelo
Reducir el número de variables sin perder información relevante
¿Qué caracteriza al algoritmo DBSCAN?
Agrupa datos basándose en jerarquías
Agrupa según partición de centroides
Agrupa datos según su densidad local
Es una técnica de clasificación supervisada
¿Cuáles son los métodos principales de reducción de dimensionalidad?
Regresión y clasificación
Selección y extracción de características
Agrupamiento y asociación
Normalización y limpieza
¿Por qué la reducción de dimensionalidad facilita la visualización de datos?
Porque convierte los datos a tablas más extensas
Porque permite representar los datos en 2D o 3D
Porque oculta las variables irrelevantes
Porque borra el ruido de los datos
¿Qué desventaja tiene K-Means?
No funciona con datos numéricos
Es lento en datasets pequeños
Es sens
Ninguna de las anteriores
¿Qué desventaja tiene K-Means?
No funciona con datos numéricos
Es lento en datasets pequeños
Es sensible a valores atípicos e inicialización
Siempre encuentra la mejor solución global
Uno de los errores frecuentes al implementar BI es:
Realizar pruebas de carga frecuentes
Formar al personal antes y durante la implementación
No recopilar datos verificados ni fiables
Elegir software de BI de código abierto
¿Qué se evalúa en un análisis de costo-beneficio en BI?
Solo el tiempo de implementación
Comparación entre costos y oportunidades asociadas a un proyecto
Número de usuarios conectados
Velocidad de ejecución de las consultas
¿Qué caracteriza al clustering jerárquico?
Usa centroides aleatorios
Agrupa datos en niveles mediante métodos aglomerativos o divisivos
Solo funciona con datos binarios
No permite representar jerarquías
¿Qué diferencia al científico de datos del ingeniero de datos?
El científico de datos usa machine learning y desarrolla herramientas de BI
El científico se encarga del soporte técnico
El científico programa scripts de respaldo
Ninguna, ambos roles son idénticos
¿Qué caracteriza a un Data Mart?
Es independiente de cualquier diseño de Datawarehouse
Es un repositorio parcial orientado a áreas específicas
Solo almacena datos históricos agregados
Es utilizado exclusivamente para transacciones OLTP
¿Cuál es el objetivo principal del Análisis Discriminante Lineal (LDA)?
Maximizar la varianza de los datos
Reducir dimensiones y maximizar la separación entre clases
Visualizar datos en 3D
Eliminar datos duplicados
¿Qué implica la función de ‘gestión de la gobernanza de datos’ en el rol del CDO?
Asignar tareas al equipo de desarrollo
Establecer quién puede usar determinados datos y en qué situaciones
Programar visualizaciones en Tableau
Crear algoritmos predictivos
¿Para qué tipo de análisis es más útil t-SNE?
Clasificación de noticias
Visualización de estructuras no lineales en datos
Cálculo de covarianzas
Selección de características redundantes
El analista de datos se enfoca principalmente en:
Gestionar la plataforma BI
Crear visualizaciones de impacto
Recopilar, preparar datos y apoyar en reportes
Definir la estrategia corporativa
¿Para qué se utilizan principalmente los sistemas OLAP?
Procesamiento de transacciones
Análisis de grandes volúmenes de datos para obtener información útil
Realizar backups diarios de información
Procesamiento automático de tickets de soporte
¿Cómo se asigna un punto a un cluster en K-Means?
Al cluster con menor número de elementos
A un cluster aleatorio
Al cluster cuyo centroide esté más cercano
Al cluster con mayor varianza
¿Qué hace PCA una vez que encuentra las direcciones principales?
Elimina esas direcciones del análisis
Reorganiza los datos alineándolos con esas direcciones
Convierte los datos a texto plano
Clasifica automáticamente los datos
