wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Fundamentos y la Jerarquía DIKW

Total questions: 53

Worksheet time: 27mins

Name
Class
Date
1.

¿Cuál es el propósito principal de la minería de datos en organizaciones que manejan grandes volúmenes de datos?

a)

Extraer patrones, anomalías y correlaciones útiles

b)

Almacenar datos con máxima redundancia

c)

Diseñar interfaces para la visualización decorativa

d)

Eliminar datos inconsistentes sin análisis posterior

2.

Completa el axioma fundamental: La meta no es tener más datos; la meta es _____.

a)

automatizar todos los procesos

b)

aumentar el volumen almacenado

c)

tomar mejores decisiones

d)

reducir costes operativos siempre

3.

¿Qué característica distingue mejor a Big Data frente a la minería de datos?

a)

Big Data requiere poco volumen; minería de datos requiere mucho

b)

Big Data es estadística; minería de datos es visualización

c)

Big Data son algoritmos; minería de datos es almacenamiento

d)

Big Data es el activo; minería de datos es la herramienta

4.

En la jerarquía DIKW, ¿qué describe mejor el nivel de Información?

a)

Capacidad de decidir y prever escenarios

b)

Mezcla de experiencia, valores e información

c)

Datos con significado, relevancia y propósito

d)

Factores objetivos y discretos del mundo real

5.

Selecciona todas las afirmaciones correctas sobre el nivel de Sabiduría en DIKW.

a)

Implica aplicar criterio, liderazgo y acción

b)

Permite tomar decisiones inteligentes y prever futuros

c)

Se basa en comparar y conectar experiencias

d)

Consiste en contextualizar, categorizar y corregir

6.

En un proyecto analítico exitoso, ¿qué es más crítico según el material?

a)

Usar visualizaciones complejas siempre

b)

Evitar cualquier corrección de los datos

c)

Iterar para convertir datos en conocimiento accionable

d)

Acumular tantos datos como sea posible

7.

¿Cuál proceso está asociado al paso de Dato a Información en DIKW?

a)

Comparación y conexiones

b)

Aplicación del criterio

c)

Contextualizar, categorizar y corregir

d)

Predicción de escenarios futuros

8.

¿Qué raíces disciplinares sustentan la minería de datos según el esquema?

a)

Diseño gráfico para presentación visual

b)

Estadística con rigor matemático

c)

Ciencias de la Computación para infraestructura

d)

IA y Machine Learning con redes neuronales

9.

Una diferencia clave destacada es que Big Data se centra en ____ mientras que la minería de datos se enfoca en ____.

a)

gestionar activos masivos; explotar esos activos

b)

crear modelos; recopilar transacciones

c)

visualizar informes; limpiar bases

d)

reducir datos; incrementar variedad

10.

¿Qué describe mejor al nivel de Conocimiento en DIKW?

a)

Datos crudos sin contexto alguno

b)

Solo hechos verificados con precisión

c)

Mezcla de experiencia, valores e información

d)

Predicciones de escenarios inciertos

11.

El nivel de Dato en DIKW se define principalmente como _____.

a)

información con propósito y relevancia contextual

b)

interpretaciones basadas en valores y experiencia

c)

decisiones inteligentes ante escenarios futuros

d)

hechos objetivos y discretos sobre un hecho

12.

¿Cuál enunciado refleja una confusión común entre Big Data y minería de datos?

a)

Big Data gestiona volumen, variedad y velocidad

b)

La minería de datos usa técnicas analíticas y algoritmos

c)

Big Data y minería de datos son exactamente lo mismo

d)

La minería de datos explota el activo de datos disponible

13.

En el diagrama de CRISP-DM, ¿qué fase se centra en definir objetivos del proyecto antes de tocar los datos?

a)

Entendimiento del negocio

b)

Comprensión de los datos

c)

Preparación de los datos

d)

Evaluación

14.

Según el ciclo CRISP-DM mostrado, ¿cuál es la secuencia inmediatamente posterior a 'Preparación de los datos'?

a)

Modelado

b)

Evaluación

c)

Despliegue

d)

Comprensión de los datos

15.

En CRISP-DM, ¿qué fase valida la calidad del modelo antes de integrarlo en el negocio?

a)

Evaluación

b)

Modelado

c)

Despliegue

d)

Comprensión de los datos

16.

Relaciona cada fase de CRISP-DM con su foco principal: 1) Entendimiento del negocio, 2) Comprensión de los datos, 3) Preparación de los datos, 4) Modelado, 5) Evaluación, 6) Despliegue.

a)

1-Definir objetivos; 2-Construir dataset; 3-Análisis; 4-Validación; 5-Integración; 6-Técnicas ML

b)

1-Limpiar ruido; 2-Definir objetivos; 3-Análisis; 4-Integración; 5-Validación; 6-Técnicas ML

c)

1-Análisis; 2-Definir objetivos; 3-Validación; 4-Construir dataset; 5-Integración; 6-Técnicas ML

d)

1-Definir objetivos; 2-Análisis; 3-Construir dataset; 4-Técnicas ML; 5-Validación; 6-Integración

17.

En el proceso KDD del diagrama, ¿qué etapa precede inmediatamente a 'Minería de Datos'?

a)

Interpretación

b)

Transformación

c)

Preprocesamiento

d)

Selección

18.

En KDD, ¿qué se indica como objetivo del 'Preprocesamiento' en el diagrama?

a)

Limpieza de ruido

b)

Elección de variables

c)

Ejecución algorítmica

d)

Evaluación de resultados

19.

Según el diagrama KDD, ¿qué fase se encarga de la evaluación tras la ejecución algorítmica?

a)

Selección

b)

Preprocesamiento

c)

Transformación

d)

Interpretación

20.

¿Cuál de las siguientes correspondencias entre CRISP-DM y KDD es la más adecuada según los diagramas?

a)

Evaluación (CRISP-DM) ↔ Transformación (KDD)

b)

Modelado (CRISP-DM) ↔ Minería de Datos (KDD)

c)

Entendimiento del negocio (CRISP-DM) ↔ Preprocesamiento (KDD)

d)

Preparación de datos (CRISP-DM) ↔ Interpretación (KDD)

21.

Selecciona TODAS las opciones que describen actividades de preparación de datos según los diagramas.

a)

Construcción del dataset

b)

Limpieza de ruido

c)

Definición de objetivos

d)

Transformación final

22.

Ambos diagramas muestran un flujo iterativo o secuencial. ¿Cuál de las siguientes afirmaciones es correcta?

a)

CRISP-DM es cíclico; KDD es lineal con etapas encadenadas

b)

Ambos son lineales sin retroalimentación

c)

CRISP-DM es lineal; KDD es cíclico sin fin

d)

Ambos son cíclicos con bucles explícitos

23.

En CRISP-DM, ¿qué etapa representa la integración del modelo en procesos reales?

a)

Comprensión de los datos

b)

Despliegue

c)

Evaluación

d)

Transformación

24.

¿Cuál es el objetivo principal de los algoritmos supervisados en aprendizaje automático?

a)

Predecir valores desconocidos a partir de ejemplos etiquetados

b)

Optimizar hardware para entrenamiento distribuido

c)

Reducir dimensionalidad ignorando variables dependientes

d)

Descubrir patrones ocultos sin etiquetas previas

25.

En redes neuronales para problemas no lineales, ¿qué característica las hace adecuadas según su inspiración biológica?

a)

Limitación a datos de baja complejidad y ruido

b)

Dependencia de reglas simbólicas deterministas

c)

Uso exclusivo de relaciones lineales simples

d)

Arquitectura inspirada en el sistema nervioso biológico

26.

¿Qué describen mejor los árboles de decisión como técnica supervisada?

a)

Mapas de calor que muestran correlaciones bivariadas

b)

Redes profundas que modelan estímulos complejos

c)

Diagramas lógicos que separan condiciones sucesivas

d)

Métodos de agrupación basados en distancia promedio

27.

La regresión lineal se utiliza principalmente para modelar:

a)

Relaciones entre variables en espacios sencillos

b)

Agrupaciones de vectores en alta dimensionalidad

c)

Secuencias temporales con transiciones ocultas

d)

Reglas de asociación entre ítems frecuentes

28.

¿Qué objetivo distingue a los algoritmos no supervisados?

a)

Calcular intervalos de confianza para estimadores

b)

Predecir variables objetivo con datos etiquetados

c)

Descubrir patrones, tendencias o agrupaciones sin etiquetas

d)

Validar hipótesis causales con experimentos controlados

29.

El agrupamiento (clustering) como K-means agrupa datos principalmente según:

a)

Secuencias lógicas en un árbol de decisión

b)

Probabilidades a priori definidas por el usuario

c)

Relaciones lineales entre variables dependientes

d)

Distancias entre vectores en el espacio de características

30.

¿Cuál de las siguientes afirmaciones sobre reglas de asociación es correcta?

a)

Etiquetan datos usando clases conocidas de referencia

b)

Descubren hechos que ocurren en común en transacciones

c)

Dividen el espacio con hiperplanos ortogonales perfectos

d)

Predicen valores continuos con mínima varianza residual

31.

Selecciona todas las técnicas que pertenecen a aprendizaje supervisado.

a)

Regresión lineal

b)

Redes neuronales

c)

Árboles de decisión

d)

Reglas de asociación

32.

Selecciona todas las técnicas que son comúnmente no supervisadas.

a)

K-means clustering

b)

CART para clasificación

c)

Apriori para reglas

d)

Perceptrón multicapa

33.

¿Cuál sería un ejemplo adecuado de uso para reglas de asociación como Apriori?

a)

Identificar productos comprados frecuentemente juntos

b)

Predecir la temperatura mañana con mínimos cuadrados

c)

Clasificar correos como spam con árboles CART

d)

Ajustar una línea recta a ventas trimestrales

34.

¿Qué herramienta está orientada a usuarios no técnicos y destaca por extracción web impulsada por IA?

a)

KNIME con flujos open‑source complejos

b)

RapidMiner con pipelines AutoML visuales

c)

Orange con widgets visuales interactivos

d)

Thunderbit con scraping asistido por IA

35.

¿Cuál describe mejor a RapidMiner según el panorama mostrado?

a)

Plataforma visual de drag‑and‑drop con AutoML

b)

Biblioteca clásica en Java para experimentación

c)

Estándar comercial para grandes organizaciones

d)

‘Lego de datos’ open‑source para flujos complejos

36.

Selecciona todas las afirmaciones correctas sobre KNIME y Orange.

a)

KNIME está pensado exclusivamente para académicos

b)

Orange se centra en programación visual con widgets

c)

Orange está dirigido principalmente a equipos corporativos

d)

KNIME se posiciona como ‘Lego de datos’ open‑source

37.

¿Qué perfil de usuario se asocia principalmente con WEKA en esta referencia?

a)

No técnico con tareas de scraping

b)

Académico con enfoque experimental

c)

Corporativo de grandes organizaciones

d)

Analista de negocio con AutoML

38.

SAS/SPSS aparece en el panorama como…

a)

Estándar comercial para grandes organizaciones

b)

Suite de scraping web con IA integrada

c)

Herramienta educativa basada en widgets

d)

Plataforma libre para flujos complejos

39.

Elige la combinación software‑característica correcta.

a)

RapidMiner — biblioteca clásica en Java

b)

KNIME — open‑source para flujos complejos

c)

Thunderbit — drag‑and‑drop con AutoML

d)

WEKA — estándar comercial corporativo

40.

En marketing, ¿qué objetivo principal persigue la detección de patrones de fuga (churn)?

a)

Aumentar la velocidad de entrega logística

b)

Optimizar la retención de clientes actuales

c)

Reducir los costos de producción industrial

d)

Incrementar el interés por deuda pública

41.

Selecciona todas las aplicaciones correctas de marketing y ventas mencionadas.

a)

Optimización de cultivo hidropónico

b)

Predicción de seísmos oceánicos

c)

Segmentación de mercado y personalización

d)

Detección de patrones de fuga de clientes

42.

En salud y genética, ¿qué combinación describe mejor el uso de datos?

a)

Edición de video y generación de subtítulos

b)

Modelado de tráfico vehicular interurbano

c)

Diagnóstico precoz y mapeo de variaciones en ADN

d)

Control de inventarios y etiquetado de productos

43.

En ingeniería eléctrica, ¿para qué se emplean los Mapas SOM según el material?

a)

Segmentación de mercado en retail

b)

Predicción de abandono de clientes

c)

Medición de audiencias en medios

d)

Análisis de gases en transformadores

44.

¿Qué tarea se asocia con recursos humanos en estas aplicaciones?

a)

Desarrollar vacunas de ARN mensajero

b)

Monitorear tormentas eléctricas en tiempo real

c)

Optimizar rutas de reparto marítimo

d)

Identificar perfiles de éxito para contratación

45.

El análisis de autoría de textos y la medición de audiencias pertenecen principalmente a:

a)

Geología minera

b)

Robótica industrial

c)

Bioinformática clínica

d)

Ciencias sociales

46.

Vincula cada dominio con su aplicación clave.

a)

Fraude: tarjetas de crédito en finanzas

b)

Churn: retención de clientes en marketing

c)

Audiencias: medición y autoría de textos

d)

Genómica: variaciones de ADN para tratamientos

47.

En el contexto de calidad del dato, ¿cuál es un riesgo principal al minar información?

a)

El acceso limitado garantiza datos perfectamente limpios

b)

Los algoritmos siempre detectan todos los patrones

c)

El ruido puede ocultar patrones importantes

d)

La anonimización elimina cualquier sesgo existente

48.

¿Qué dilema ético destaca la sección de privacidad y seguridad?

a)

Balanceo de clases en el dataset

b)

Uso de gráficos interactivos para reporting

c)

Elección de hiperparámetros del modelo

d)

Anonimización de datos y acceso limitado

49.

La interpretabilidad exige equilibrar dos aspectos. ¿Cuál es el equilibrio señalado?

a)

Escalabilidad y paralelización

b)

Velocidad y coste de cómputo

c)

Recolección y síntesis de datos

d)

Precisión y comprensión del modelo

50.

En la gobernanza de datos, ¿qué necesidad se subraya y a menudo se ignora?

a)

Mantenimiento a largo plazo y cumplimiento regulatorio

b)

Aumento de la profundidad de redes neuronales

c)

Generación de más características sintéticas

d)

Uso exclusivo de pipelines automatizados

51.

Selecciona todas las afirmaciones correctas sobre la conclusión estratégica presentada.

a)

El algoritmo correcto es universal para todo caso

b)

La iteración es clave en CRISP-DM y KDD

c)

La elección depende de la pregunta de negocio

d)

La tecnología debe optimizar la acción humana

e)

Transformar datos en sabiduría sigue DIKW

52.

¿Cuál es la prioridad implícita en la frase 'La estrategia por encima del algoritmo'?

a)

Elegir primero el clasificador más complejo

b)

Sustituir completamente a los expertos humanos

c)

Definir decisiones y objetivos antes del modelo

d)

Optimizar métricas sin contexto de negocio

53.

En salud, la interpretabilidad se considera vital. ¿Cuál sería una justificación adecuada?

a)

Para evitar cualquier requisito regulatorio

b)

Porque siempre mejora la precisión numérica

c)

Necesidad de explicar decisiones clínicas críticas

d)

Ya que elimina por completo el ruido del dato