wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Ciencia de Datos

Total questions: 58

Worksheet time: 31mins

Name
Class
Date
1.

Permite generar un modelo lineal en el que el valor de la variable dependiente o respuesta se determina a partir de un conjunto de variables independientes llamadas predictores,

a)

Regresión lineal múltiple

b)

Colinialidad

c)

Multicolinialidad

d)

Estimación de las matrices

2.

Se emplean para poder determinar qué impacto tienen en el modelo cada una de las variables

a)

Regresión lineal

b)

Jackknife

c)

Coeficientes parciales estandarizados

d)

Estimadores

3.

Se obtienen al estandarizar (sustraer la media y dividir entre la desviación estándar) las variables predictoras previo ajuste del modelo.

a)

Regresión lineal múltiple

b)

Coeficientes parciales estandarizados

c)

Mercados financieros

d)

Covarianza

4.

Es una extensión de la regresión lineal simple, por lo que es fundamental comprender esta última.

a)

Covarianzas poblacional

b)

Coeficientes parciales estandarizados

c)

Modelos lineales múltiples

d)

Regresión Lineal Múltiple

5.

Pueden emplearse para predecir el valor de la variable dependiente o para evaluar la influencia

a)

Covarianzas poblacional

b)

Correlación

c)

Modelos de regresión múltiple

d)

Bootsrapping

6.

Ocurre cuando un predictor está linealmente relacionado con uno o varios de los otros predictores del modelo o cuando es la combinación lineal de otros predictores

a)

Covarianza muestral

b)

Colinialidad

c)

Spearman

d)

Multicolinialidad

7.

solo si el coeficiente de correlación simple o múltiple entre algunas de las variables independientes es 1

a)

Estadistica

b)

Regresión Multiple

c)

Colinialidad

d)

Multicolinialidad

8.

Se trata de dos parámetros que vienen a cuantificar lo mismo

a)

Tolerancia (TOL) y Factor de Inflación de la Varianza (VIF)

b)

Estimador y Muestra

c)

Multicolinialidad y colinialidad

d)

Homocedasticidad

9.

Si en alguno de los modelos el (a)   R2 es alto, estaría señalando a una posible colinialidad.

10.

Cuando se intenta establecer relaciones causa-efecto, la (a)   puede llevar a conclusiones muy erróneas, haciendo creer que una variable es la causa cuando en realidad es otra la que está influenciando sobre ese predictor

11.

Este término hace referencia a que el mejor modelo es aquel capaz de explicar con mayor precisión la variabilidad observada en la variable respuesta empleando el menor número de predictores

a)

NMétodo de Jackknife

b)

Relación lineal

c)

Parsimonia

d)

Población

12.

Los residuos se deben distribuir de forma normal con media cero. Para comprobarlo se recurre a histogramas, a los cuantiles normales o a test de hipótesis de normalidad.

a)

Parsimonia

b)

Variabilidad

c)

Independencia

d)

Distribución normal de los residuos

13.

Si la varianza es constante, se distribuyen de forma aleatoria manteniendo una misma dispersión y sin ningún patrón específico.

a)

Homocedasticidad

b)

Covarianza

c)

Correlacion

d)

Independencia

14.

La varianza de los residuos debe de ser constante en todo el rango de observaciones

a)

Correlacion

b)

Vector

c)

Independencia

d)

Homocedasticidad

15.

Una distribución cónica es un claro identificador de falta de

(a)  

16.

Se recomienda representar los residuos ordenados acorde al tiempo de registro de las observaciones, si existe un cierto patrón hay indicios de autocorrelación

a)

Independencia

b)

Correlacion

c)

Colinialidad

d)

Variable

17.

Los valores de cada observación son independientes de los otros, esto es especialmente importante de comprobar cuando se trabaja con mediciones temporales

a)

Variable

b)

Correlacion

c)

Independencia

d)

Muestra

18.

Es importante identificar observaciones que sean atípicas o que puedan estar influenciando al modelo

a)

Valores atípicos

b)

Tamaño de la muestra

c)

Correlacion

d)

Homocedasticidad

19.

La forma más fácil de detectarlas es a través de los residuos

a)

Independencia

b)

Variable

c)

Valores atípicos

d)

Homocedasticidad

20.

Recomiendan que el número de observaciones sea como mínimo entre 10 y 20 veces el número de predictores del modelo

a)

Tamaño de la muestra

b)

Variable

c)

Correlacion

d)

Conjunto

21.

Al igual que ocurre en los modelos lineales simples, R2 (a)   es un cuantificador de la bondad de ajuste del modelo.

22.

Basándose en el criterio del analista, se introducen unos predictores determinados en un orden determinado.

a)

Dirección forward

b)

Método jerárquico

c)

Método paso a paso (stepwise)

d)

Método de entrada forzada

23.

Se introducen todos los predictores simultáneamente

a)

Método jerárquico

b)

Método paso a paso

c)

Método de Jackknife

d)

Método de entrada forzada

24.

Emplea criterios matemáticos para decidir qué predictores contribuyen significativamente al modelo y en qué orden se introducen

a)

Método paso a paso

b)

método de Jackknife

c)

Dirección backward

d)

Método jerárquico

25.

A partir de este se generan todos los posibles modelos introduciendo una sola variable de entre las disponibles. Aquella variable que mejore en mayor medida el modelo se selecciona.

a)

Dirección backward

b)

p-value

c)

Doble o mixto

d)

Dirección forward

26.

Se trata de una combinación de la selección forward y backward. Se inicia igual que el forward pero tras cada nueva incorporación se realiza un test de extracción de predictores no útiles como en el backward.

a)

Dirección backward

b)

Doble o mixto

c)

Dirección forward

d)

Modelos gráficos Gaussianos

27.

En R la función _____________ permite encontrar el mejor modelo basado en AIC utilizando cualquiera de las 3 variantes del método paso a paso

a)

step()

b)

R

c)

AIC

d)

SSE

28.

Es de suma importancia en múltiples aplicaciones estadísticas, y por tanto, de gran importancia en muchos campos del conocimiento, como en economía

a)

Estimación de las matrices de covarianzas poblacional

b)

El método paso a paso

c)

Mercados financieros

d)

AIC

29.

Requiere una estimación de la matriz de precisión

a)

El estadístico 2 T de Hotelling

b)

Análisis Factorial

c)

Valor de correlación

d)

Modelos gráficos Gaussianos

30.

El estimador más habitual que se suele tomar cuando la población de partida sigue una _____________

a)

Distribución normal

b)

Insesgado

c)

Análisis multivariante

d)

Estudios sobre el clima

31.

Cuando el número de observaciones n supera ampliamente a la dimensión poblacional p , es

a)

covarianzas

b)

Un estimador

c)

La matriz de covarianza muestral S

d)

Independencia

32.

cuando el número de observaciones n supera al número de variables p

a)

Mercados financieros

b)

Covarianza muestral

c)

Calor de correlación

d)

Máxima verosimilitud

33.

Está basada en el estimador de máxima verosimilitud de 

 Σ\Sigma  

a)

Esquema 

b)

Paso a Paso

c)

Independencia

d)

Covarianza muestral

34.

Aquí n es el número de observaciones en un instante, y p el número de estaciones de observación

a)

AIC

b)

Estudios sobre el clima

c)

SSE

d)

Mercados financieros

35.

La estimación de la matriz de covarianzas de alta dimensión es una parte fundamental de las carteras de valores (portfolio selection), minimización de riesgos (risk managament) y del estudio del precio de los activos (asset pricing)

a)

Buscadores de Internet

b)

Mercados financieros.

c)

Stepwise

d)

Estudios genéticos

36.

Es otro ejemplo más, de matrices donde se utilizan enormes cantidades de datos

a)

Estudios en biología

b)

Estudios genéticos

c)

Buscadores de Internet

d)

Jackknife

37.

Está basado en las medidas de las distancias relativas a la correlación muestral

a)

Estudios en biología

b)

Estudios sobre el cáncer

c)

Análisis funcional de datos

d)

Estudios genéticos

38.

Cada dato es una curva y normalmente de alta dimensión.

a)

Estudios sobre el cáncer

b)

Análisis funcional de datos

c)

Buscadores de Internet

d)

Dirección forward

39.

Es el estimador natural de la matriz de covarianzas.

a)

Johnson and Wichern

b)

Máxima verosimilitud

c)

Matriz de covarianzas

d)

Matriz de covarianzas muestral

40.

Ver que la densidad conjunta depende del conjunto de observaciones n x , x ,..., x 1 2 , sólo a través de la media muestral

a)

Estimador bien condicionado

b)

Estimador suficiente

c)

Estadístico 2 T de Hotelling

d)

Johnson and Wichern, 2007

41.

El hecho de que X X Xn , ,..., representan una muestra aleatoria de una población normal multivariante de vector de medias  y matriz de covarianzas  determina completamente las distribuciones muestrales de X y S .

a)

Dirección forward

b)

Estimador bien condicionado

c)

COCIENTE n/p

d)

Distribución de S

42.

Son métodos estadísticos que estudian la relación lineal existente entre dos variables

a)

casi-colinialidad o multicolinialidad

b)

La correlación lineal y la regresión lineal simple

c)

Parsimonia e Independencia

d)

cociente y autovalor

43.

Cuantifica como de relacionadas están dos variables

a)

Colinialidad

b)

LMS

c)

Cociente

d)

La correlación

44.

Consiste en generar una ecuación (modelo) que, basándose en la relación existente entre ambas variables, permita predecir el valor de una a partir de la otr

a)

Multicolinialidad

b)

Correlación

c)

Regresión Lineal

d)

Colinialidad

45.

Mide únicamente la relación entre ambas sin considerar dependencias

a)

Colinialidad

b)

Asociación nula

c)

Cálculo de la correlación entre dos variables

d)

Regresión lineal

46.

Indica el grado de variación conjunta de dos variables aleatorias

a)

Colinialidad

b)

Cociente

c)

Covarianza

d)

independencia

47.

Se estandariza la covarianza, generando lo que se conoce como

a)

Correlación de Spearman

b)

Correlación de Kendall

c)

Correlación de Pearson

d)

Coeficientes de correlación

48.

Funciona bien con variables cuantitativas que tienen una distribución normal.

a)

Correlación Lineal

b)

Correlación de Pearson

c)

Correlación de Spearman

d)

Correlación de Kendall

49.

Se emplea cuando los datos son ordinales, de intervalo, o bien cuando no se satisface la condición de normalidad para variables continuas y los datos se pueden transformar a rangos

a)

Correlación de Pearson

b)

correlación de Kendall

c)

Correlación de Spearman

d)

p-value

50.

Se emplea cuando se dispone de pocos datos y muchos de ellos ocupan la misma posición en el rango, es decir, cuando hay muchas ligaduras

a)

Correlación de Spearman

b)

Coeficiente de Pearson

c)

Normalidad

d)

Correlación de Kendall

51.

El test paramétrico de significancia estadística empleado para el coeficiente de correlación es el

a)

cociente

b)

t-test

c)

Spearman

d)

colinialidad

52.

Se interpreta como la cantidad de varianza de YY explicada por XX

a)

Regresión lineal múltiple

b)

Cociente

c)

Coeficiente de Pearson

d)

Coeficiente de determinación

53.

Es la covarianza estandarizada, y su ecuación difiere dependiendo de si se aplica a una muestra

a)

Coeficiente de determinación

b)

Regresión lineal múltiple

c)

Coeficiente de Pearson

d)

Parsimonia

54.

Ambas variables se tienen que distribuir de forma normal

a)

Distribución normal

b)

Cociente

c)

Normalidad

d)

Regresion Lineal

55.

La varianza de YY debe ser constante a lo largo de la variable XX

a)

Coeficiente de Spearman

b)

Coeficiente de Pearson

c)

Homocedasticidad

d)

Coeficiente de Kendall

56.

Trabaja con rangos, por lo que requiere que las variables cuya relación se quiere estudiar sean ordinales o que se puedan transformar en rangos.

a)

Coeficiente Pearson

b)

Coeficiente Tau de Kendall

c)

Coeficiente Spearman

d)

Correlación de Pearson

57.

Permite aumentar la robustez de la correlación de Pearson

a)

Jackknife correlation - método de Jackknife

b)

Coeficiente de Pearson

c)

Coeficiente de Spearman

d)

Kendall

58.

Consiste en calcular todos los posibles coeficientes de correlación entre dos variables si se excluye cada vez una de las observaciones

a)

Jackknife correlation

b)

No autocorrelación

c)

Distribución normal

d)

Tamaño de la muestra