wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

REVISÃO DE CIÊNCIA DE DADOS

Total questions: 77

Worksheet time: 1hrs 3mins

Name
Class
Date
1.

Quem é o GRANDE protagonista da ciência de dados?

a)

Juliette do BBB

b)

a Internet

c)

o dado que gera informação para produção de conhecimento

d)

o poder de processamento e memória

2.

Onde estão os dados da ciência de dados?

a)

em small data

b)

na big data

c)

abertos na Web e distribuídos

d)

em big e small data

e)

na indústria de petróleo

3.

Objetivo da ciência de dados:

a)

big e small data

b)

fazer os algoritmos ficarem mais inteligentes e aprenderem com base em padrões

c)

gerar aplicações tecnológicas

d)

melhorar a tomada de decisão com base em insights obtidos a partir de dados muito volumosos

4.

ciclo do data science:

a)

implementação, teste, operacionalização, manutenção

b)

extração, transformação e visualização

c)

engenharia, coleta, machine learning, visualização

d)

coleta, engenharia de dados, mineração, visualização

5.

O Haddop, utilizado em tecnologias de Big Data e Blockchain, pode ser definido como:

a)

Uma estrutura de software open source para armazenar dados e executar aplicações em clusters de hardwares comuns.

b)

Um livro-razão compartilhado e imutável que facilita o processo de registro de transações e o rastreamento de ativos em uma rede empresarial.

c)

São dados com maior variedade que chegam em volumes crescentes e com velocidade cada vez maior.

d)

Um método de análise de dados que automatiza a construção de modelos analíticos.

e)

Um processo de encontrar anomalias, padrões e correlações em grandes conjuntos de dados para prever resultados

6.

A Big Data é definida como a análise e interpretação de grandes volumes de dados, que contém também uma grande variedade de formatação e tem como característica um conjunto 5 V’s, que são:

a)

velocidade, veracidade, volume, variedade e verdade.

b)

valor, volume, veracidade, variedade e vida.

c)

volume, velocidade, variedade, veracidade e valor.

d)

venda, viabilidade, verdade, volume e venda.

e)

viabilidade, verdade, volume, valor e várzea.

7.

Em se tratando de um grande volume de dados como os encontrados em Data Warehouses, pode-se definer como menor granularidade, ou granularidade fina, quando há:

a)

Maior detalhamento (maior sumarização) dos dados.

b)

Menor detalhamento (menor sumarização) dos dados.

c)

Maior detalhamento (menor sumarização) dos dados.

d)

Menor detalhamento (maior sumarização) dos dados.

e)

Mesmo detalhamento (menor sumarização) dos dados.

8.

O termo Ciência de dados iniciou-se na década de 1960, quando surgiu a necessidade do armazenamento em massa. Essa ciência natural trata de obter conhecimento e informação, de forma sistemática, a fim que esse conhecimento possa ser normalizado e organizado. A Ciência de dados trata de estudar o dado em seu ciclo de vida: da produção ao seu descarte, onde a etapa de conhecimento representa:

a)

Os fatos coletados e armazenados para uso posterior.

b)

Os dados após terem sido analisados e que possuam algum

significado.

c)

A melhor decisão a ser tomada com tudo isso.

d)

A informação interpretada e aplicada com uma finalidade.

e)

As soluções para os problemas apresentados.

9.

Dentre um dos 5V's do Big Data, a Variedade é um dos grandes desafios, pois há uma grande dificuldade em se padronizar os dados para uso otimizado.O Big Data escalona a variedade de informações das seguintes formas:

a)

Dados aleatórios, ramdômicos e acumulados

b)

Dados estruturados, semi-estruturados e não estruturados.

c)

Dados probabilísticos, amorfos uniformes.

d)

Dados puros, impuros e intermediários.

e)

Dados analógicos, digitais e híbridos

10.

O armazenamento de dados apresenta uma série de premissas que devem ser atendidas, dentre as quais NÃO faz parte:

a)

Segurança

b)

Integridade

c)

Concorrência

d)

Otimização de espaço.

e)

Causalidade

11.

Não é um exemplo típico de aplicação de Mineração de Dados:

a)

Prever se clientes de uma empresa vão migrar para um concorrente.

b)

Checar se o cálculo da folha de pagamento está correto.

c)

Detectar fraudes em transferências bancárias.

d)

Tentar reduzir a evasão escolar.

12.

Em uma tarefa de classificação, a classe é um atributo especial que queremos prever ou descrever.

a)

Verdadeira

b)

Falsa

13.

O agrupamento é um tipo de tarefa de Mineração de Dados...

a)

Supervisionada

b)

Não Supervisionada

c)

Aprendizagem por Reforço

14.

Prever a altura de bebês a partir de sua altura aos dois anos de idade. Qual tarefa de Mineração de Dados é essa?

a)

Classificação

b)

Agrupamento

c)

Regras de Associação

d)

Regressão

15.

Seu cliente quer potencializar as vendas em seu e-commerce e lhe contrata para tentar ofertar novos produtos aos clientes à medida que eles compram. Que tipo de tarefa de Mineração de Dados é esta:

a)

Classificação

b)

Agrupamento

c)

Regras de Associação

d)

Regressão

16.

Analisando dados coletados de algas marinhas desconhecidas, buscando categoriza-lo segundo atributos em comum. Qual tarefa de mineração de dados é esta?

a)

Classificação

b)

Regressão

c)

Agrupamento

d)

Aprendizado por Reforço

17.

O conceito de informação pode ser definido, principalmente, como:

a)

Dados simples.

b)

O conjunto de todas as informações da empresa.

c)

Os dados do cliente e do concorrente dele.

d)

O tratamento e organização dos dados.

18.

Uma informação é um dado significativo, útil e muito relevante para a empresa e para a tomada de decisões. Ela deve ser definida:

a)

Por quem vai usá-la.

b)

Pelo mercado.

c)

Pelo gestor.

d)

Pelo marketing.

19.

Unir conceitos de Sistemas de Informação e Tecnologia da Informação pressupõe:

a)

A possibilidade de aprender com dados e informações do seu sistema.

b)

Uma ação do concorrente.

c)

Uma ação de marketing conjunta.

d)

Uma competição de vendas de um determinado produto.

20.

Os processos de negócios também podem ser chamados como:

a)

Processos gerais.

b)

Processos informacionais.

c)

Processos organizacionais.

d)

Processos métricos.

21.

O OLAP é uma ferramenta bastante utilizada em Data Mining, que envolve a criação de Data Marts especialmente configurados para permitir análises multidimensionais de dados, como forma de encontrar regras e padrões.

Podemos dizer que a afirmativa acima é:

a)

Verdadeira

b)

Falsa

22.

A afirmativa: "Há uma ligação bastante intima entre o Business Intelligence e Data Mining pois ambos os processos se alimentam mutualmente."


Esta afirmativa está:

a)

Correta

b)

Falsa

23.

Complete a afirmativa:


______________ é um banco de dados especializado cujo objetivo é unificar e organizar (normatizar) todos os dados disponíveis a uma organização.


A lacuna deve ser corretamente completada com a palavra:

a)

Data Mining

b)

ETL

c)

Data Warehouse

d)

Data Marts

24.

As 3 partes que as regras e padrões significativos do Data Mining são:

a)

Processo de negócio, pequena massa de dados e regras e padrões significativos.

b)

Grande massa de dados, pequena massa de dados e regras e padrões significativos.

c)

Grande massa de dados, processo de negócio e regras e padrões significativos.

d)

Grande massa de dados, pequena massa de dados e processo de negócio.

25.

É um repositório de dados específicos, um subconjunto dos dados mantidos no Data Warehouse. Esta afirmativa é relacionada ao:

a)

Data Mart.

b)

OLAP.

c)

Data Mining.

d)

ETL.

26.

A aplicação do ________ soluciona o problema de síntese, análise e consolidação de dados, pois é o processamento analítico online dos dados. Tem capacidade de visualizações das informações a partir de muitas perspectivas diferentes, enquanto mantém uma estrutura de dados adequada e eficiente.

a)

OLAP

b)

OLTP

c)

ALLPP

d)

DATA FULL

27.

É um termo usado por fornecedores de hardware e software e consultores de tecnologia da informação para descrever a infraestrutura para armazenamento, integração, elaboração de relatórios e análise de dados que vêm do ambiente empresarial.

a)

Big Data

b)

Business Intelligence

c)

Data Warehouse

d)

E-business

28.

Conjuntos de dados com volumes tão grandes que estão além da capacidade que um SGBD relacional típico tem para capturar, armazenar e analisar. São dados normalmente são não estruturados.

a)

Data Warehouse

b)

Data Mining

c)

Big Data

d)

Sistema Gerenciador de Banco de Dados

29.

O __________, possibilita armazenar grandes volumes de dados coletados dos sistemas transacionais. São as chamadas séries históricas que possibilitam uma melhor análise de eventos passados, oferecendo suporte às tomadas de decisões presentes e a previsão de eventos futuros.

a)

ETL

b)

DataWarehouse

c)

Data Analytics

d)

Data Visualization

30.

Pode ser considerado um subconjunto do Data WareHouse, ou seja, um datawarehouse departamental.

a)

Data Part

b)

Data Fine

c)

Data Mart

d)

Smart Data

31.

O __________, explora grandes quantidade de dados procurando padrões consistentes, como regras de associação ou sequencias temporais, para detectar relacionamentos sistemáticos entre variáveis, detectando assim novos subconjuntos de dados.

a)

Data Mart

b)

Big Data

c)

Machine Learning

d)

Data Mining

32.

Um neurônio artificial é composto por: entradas, pesos, função soma e função de ativação

a)

Verdadeiro

b)

Falso

33.

Nas redes neurais do tipo feed forward, não é necessário utilizar o algoritmo backpropagation para atualização dos pesos

a)

Verdadeiro

b)

Falso

34.

No aprendizado não supervisionado a entrada inclui as soluções desejadas.

a)

Verdadeiro

b)

Falso

35.

A técnica de clustering busca criar sistemas para detectar instâncias similares sem que seja preciso informar rótulos de cada instância de treino

a)

Verdadeiro

b)

Falso

36.

A redução de dimensionalidade busca simplificar os dados sem perder muita informação, juntando características correlacionadas

a)

Verdadeiro

b)

Falso

37.

Nessa técnica, o sistema é treinado para aprender um modelo capaz de prever um valor numérico dadas algumas características. Qual é essa técnica?

a)

Clustering.

b)

Regressão

c)

Redução de dimensionalidade

d)

Classificação

e)

Detecção de anomalias

38.

Quais dos seguintes atributos humanos a IA consegue imitar?

a)

Tomada de decisões baseada em experiências anteriores

b)

Compreender a linguagem escrita e falada

c)

Pensamento crítico para comportamento moral, ético e humano

d)

Reconhecer eventos anormais

39.

Quais das alternativas a seguir são cargas de trabalho comuns da IA?

a)

Aprendizado de máquina

b)

Blockchain

c)

Pesquisa visual computacional

d)

Processamento em lotes

40.

Uma concessionária de automóveis deseja usar os dados históricos de vendas de carros para treinar um modelo de machine learning. O modelo deve prever o preço de um carro seminovo com base na marca, no modelo, no tamanho do motor e na quilometragem. O revendedor deve usar o machine learning automatizado para criar qual tipo de modelo de machine learning?

a)

classificação

b)

Regressão

c)

Previsão de série temporal

41.

Um banco deseja usar registros históricos de repagamento de empréstimos para categorizar aplicações de empréstimo como de baixo risco ou alto risco com base em características como o valor do empréstimo, a renda do tomador e o período do empréstimo. O banco deve usar machine learning automatizado para criar qual tipo de modelo de machine learning?

a)

classificação

b)

Regressão

c)

Previsão de série temporal

42.

Você usa um pipeline do designer do Azure Machine Learning para treinar e testar um modelo de classificação binária. Você examina as métricas de desempenho do modelo em um módulo Avaliar Modelo e observe que ele tem uma pontuação AUC de 0,3. O que é possível concluir sobre o modelo?

a)

O modelo pode explicar 30% da variância entre os rótulos reais e os previstos.

b)

O modelo prevê com precisão 70% dos casos de teste.

c)

O modelo tem um desempenho pior do que a adivinhação aleatória.

43.

Você usa o designer do Azure Machine Learning para criar um pipeline de treinamento para um modelo de clustering. Agora, você quer usar o modelo em um pipeline de inferência. Qual módulo você deve usar para fazer inferências de previsões de cluster do modelo?

a)

Pontuar Modelo

b)

Atribuir dados a clusters

c)

Treinar Modelo de Clustering

44.

Dado o histórico de idades e alturas das crianças, você quer prever a altura das crianças em função da sua idade.

a)

Aprendizado Supervisionado

b)

Aprendizado Não Supervisionado

45.

Examinar um grande conjunto de e-mails que são identificados como spam, para descobrir se existem sub-tipos de e-mails spam.

a)

Aprendizado Supervisionado

b)

Aprendizado Não Supervisionado

46.

Dado um conjunto de dados genéticos (DNA) de uma pessoa, prever as chances de ele/ela desenvolver diabetes ao longo dos próximos 10 anos.

a)

Aprendizado Supervisionado

b)

Aprendizado Não Supervisionado

47.

Examinar as estatísticas de dois times de futebol, e prever qual equipe vai ganhar o jogo de amanhã (dado um conjunto de dados históricos das vitórias / perdas para ser aprendido).

a)

Aprendizado Supervisionado

b)

Aprendizado Não Supervisionado

48.

Através de uma coleção de 1000 textos escritos sobre a economia do Brasil, encontrar uma maneira de agrupar automaticamente estes textos que são de alguma forma "similares" ou "relacionados".

a)

Aprendizado Supervisionado

b)

Aprendizado Não Supervisionado

49.

A Inteligência Aritificial (IA) é uma tecnologia que ainda não está presente no nosso dia a dia

a)

Verdadeiro

b)

Falso

50.

A Inteligência Aritificial (IA) é a combinação de algoritmos projetados para criar máquinas que tenham as mesmas capacidades que o ser humano

a)

Verdadeiro

b)

Falso

51.

Dos conceitos abaixo quais são aqueles que fazem parte das principais aplicações da IA. Selecione a opção que considera correta

a)

Assistentes pessoais virtuais

b)

Saúde

c)

Agrícolas

d)

Todas as opções

52.

O pressuposto inicial geral na criação da IA foi o de tornar as vidas humanas mais fáceis e o de melhorar a nossa qualidade de vida.

Contudo, e porque a IA não resolve todos os nossos problemas, selecione as opções que considera serem uma desvantagem da IA

a)

Altos custos

b)

Redução de erros

c)

Aumento do volume de produção

d)

Desemprego

e)

Manutenção exigente

53.

As tarefas de aprendizado de máquina são tipicamente divididas

conforme os sinais de entrada e as respostas do aprendizado

(ZUBELLI, 2017). Marque a opção que apresenta essas tarefas corretamente.

a)

classificação, Por incremento,

agrupamento.

b)

Por incremento, regressão,

agrupamento.

c)

classificação, regressão,

agrupamento.

d)

classificação, regressão,

Não incremental.

54.

Os sistemas de aprendizado ___________ buscam aprender

construindo representações simbólicas de um conceito, por meio da

análise de exemplos e contraexemplos dele. As representações

simbólicas estão tipicamente na forma de alguma expressão lógica,

árvore de decisão, regras ou rede semântica. Qual das alternativas preenche corretamente a lacuna?

a)

Baseado em exemplos.

b)

Simbólico.

c)

Estatístico.

d)

Genético.

55.

Os sistemas de aprendizado de máquina apresentam características

peculiares, que possibilitam uma classificação não exclusiva desses

sistemas em função da linguagem de descrição, do modo de

aprendizado, do paradigma de aprendizado, das formas e da tarefa

de aprendizado (STANGE, 2011). Qual das alternativas apresenta um modo de aprendizado de máquina:

a)

Classificação.

b)

Agrupamento.

c)

Regressão.

d)

Por reforço.

56.

Agrupar fotos de animais similares em clusters, sem ter o

conhecimento prévio de qual animal está sendo apresentado. Qual modo de aprendizado pode ser aplicado neste exemplo?

a)

Agrupamento.

b)

Regressão.

c)

Reforço.

d)

Classificação.

57.

Os sistemas de Machine learning, em português conhecidos como sis-

tema de aprendizagem automática ou sistemas de aprendizado de

máquina, podem ajudar a descobrir padrões, realizar determinadas

tarefas através da generalização de casos e na utilização de dados.

Os algoritmos de aprendizado de máquina têm um modo de

aprendizado que depende de um especialista externo para avalizar

seus resultados. Assinale a alternativa CORRETA que contenha

esse modo:

a)

Aprendizado por reforço.

b)

Aprendizado supervisionado.

c)

Aprendizado não supervisionado.

d)

Aprendizado por inteligência.

58.

No aprendizado supervisionado, são

apresentados exemplos do que é desejado como entrada e saída, de

modo que o objetivo é aprender uma regra que mapeia a entrada na

saída.

a)

Certo.

b)

Errado.

59.

é o treinamento de modelos de aprendizado de máquina para tomar uma sequência de decisões. O agente aprende a atingir uma meta em um ambiente incerto e potencialmente complexo. Estamos falando de:

a)

Aprendizado por associação.

b)

Aprendizado supervisionado.

c)

Aprendizado por regressão.

d)

Aprendizado por reforço.

60.

Os sistemas de Aprendizado de Máquina podem ser classificados de acordo com

a quantidade e o tipo de supervisão que recebem durante o treinamento. Existem

cinco categorias principais de aprendizado: supervisionado, não supervisionado,

semissupervisionado, sem reforço e por reforço.

a)

Certo.

b)

Errado.

61.

No Aprendizado Não-Supervisionado, destacam-se duas técnicas:

a)

Agrupamento e Associação.

b)

Associação e classificação.

c)

Regressão e classificação.

d)

Regressão e Agrupamento.

62.

Acerca dos conceitos de mineração de dados, aprendizado de máquina e bigdata, julgue o próximo item. A análise de classificação é uma tarefa que consiste em agrupar um conjunto de objetos de tal forma que estes, juntos no mesmo grupo, sejam mais semelhantes entre si que em outros grupos.

a)

CERTO.

b)

ERRADO.

63.

É um modelo matemático de inteligência artificial

que simula o comportamento do cérebro humano, tendo um papel

importante na história e na atualidade do desenvolvimento de

algoritmos inteligentes. Esta afirmação refere-se a:

a)

Machine Learn.

b)

Redes Neurais.

c)

Big Data.

d)

Data Mining

64.

Os algoritmos não incrementais são frequentemente aplicados a fluxos

de dados ou big data , abordando problemas de disponibilidade de

dados e escassez de recursos, respectivamente.

a)

Certo.

b)

Errado.

65.

No método de classificação para mineração de dados, a filiação dos objetos é obtida por meio de um processo não supervisionado de aprendizado, em que somente as variáveis de entrada são apresentadas para o algoritmo.

a)

Certo.

b)

Errado.

66.

Estimar um modelo que utilize a idade e os anos de

escolaridade de um indivíduo não-observado anteriormente para

tentar prever seu salário. Utiliza-se como base desse modelo: idades,

anos de escolaridades e salários de diversos indivíduos já observados

anteriormente. Este exemplo pode ser aplicado em qual modo de aprendizado?

a)

Associação

b)

Classificação.

c)

Regressão.

d)

Agrupamento.

67.

Esse tipo de sistema de aprendizado é denominado lazy (preguiçoso)

e necessita manter os exemplos na memória para classificar novos

exemplos, em oposição aos sistemas eager (gulosos), que utilizam os

exemplos para induzir o modelo, descartando-os logo após. A qual sistema de aprendizado a assertiva refere-se:

a)

Conexionista.

b)

Baseado em exemplos.

c)

Simbólico.

d)

Estaistico.

68.

O aprendizado supervisionado é baseado no aprendizado incremental e

classificação. O humano fornece um banco de dados e ensina a

máquina a reconhecer o que é uma bicicleta, por exemplo, entre

padrões e semelhanças.

a)

Certo.

b)

Errado.

69.

Os algoritmos de Machine learning têm seu aprendizado baseado em dados

históricos e diversas aplicações: agricultura de precisão, reconhecimento

de imagem, classificação de textos, desenvolvimento de chatbots. Torna-se

difícil um setor do novo modelo tecnológico que não utilize suas técnicas.

Sobre Machine learning, assinale a alternativa CORRETA que contenha as

tarefas de aprendizado:

a)

Classificação, revolução, agrupamento e associação.

b)

Categorização, regressão, análise e dissociação.

c)

Classificação, regressão, agrupamento e dissociação.

d)

Classificação, regressão, agrupamento e associação.

70.

São benefícios do aprendizado de máquina, exceto:

a)

com a utilização do machine learning, podemos fornecer uma experiência do usuário valiosa, com a personalização de resultados, por exemplo.

b)

além de gerar economia com possíveis desperdícios de recursos na produção, também há um aprimoramento na mão de obra para ser utilizada;

c)

para diversas áreas, além de existirem soluções prontas para serem utilizadas em determinado problema, também há a prevenção de riscos, podendo antecipar uma perda antes mesmo dela ocorrer.

d)

tarefas repetitivas para nós, seres humanos, podem ser adaptadas para serem feitas de forma automática por meio de robôs, eliminando qualquer possibilidade de falhas;

71.

As grandes empresas têm tudo a ver com a segmentação e personalização dos seus produtos. Fazem-no analisando as características particulares das pessoas e partilhando programas para as atrair. Infelizmente, algumas empresas são mal sucedidas nos seus esforços de vendas e marketing. Os algoritmos de ___________ podem agrupar indivíduos com características semelhantes e analisar se eles irão comprar o seu produto. Qual das alternativas preenche a lacuna corretamente?

a)

Regressão linear.

b)

Agrupamento.

c)

Incremento.

d)

Regressão estatística.

72.

aprendizado não supervisionado é a forma menos utilizada pelas

empresas. Isso porque a máquina começa a analisar, sozinha, os

dados e a identificar os padrões — aprendendo a separar o que é

uma lata de uma garrafa, por exemplo. Como é a máquina

aprendendo por si só conceitos que nunca viu antes, o processo é

mais demorado e, portanto, não tão popular.

a)

Certo.

b)

Errado.

73.

/

Os algoritmos de Machine Learning (ML) são baseados em diferentes conceitos matemáticos que influenciam na escolha de determinado algoritmo

para resolver um problema. Cada algoritmo faz parte de um tipo de ML (supervisionado, não supervisionado ou por reforço). Sobre as tarefas de

Machine Learning e seus modos de aprendizado, classifique V para as sentenças verdadeiras e F para as falsas:

( ) Classificação é uma tarefa supervisionada.

( ) Regressão é uma tarefa não supervisionada.

( ) Agrupamento é uma tarefa supervisionada.

( ) Regressão é uma tarefa supervisionada.

a)

V - F - F - F.

b)

V - F - F - V.

c)

F - V - F - F.

d)

V - V - V - V.

74.

Um desenvolvedor de uma instituição bancária foi designado para tentar usar técnicas de aprendizado de máquina para, dado o saldo diário durante um ano de um cliente, classificá-lo como BOM ou MAU candidato a receber um cartão de crédito VIP. Para isso, a única informação que pode usar — e que ele recebeu — é um conjunto de treinamento com 50.000 clientes pré- classificados pelos seus gerentes, contendo 365 campos com os saldos diários e um campo com o número 1, caso o cliente fosse um BOM candidato, ou o número 0 (zero), caso fosse um MAU candidato. Essas respostas são consideradas corretas. Considerando as práticas tradicionais de aprendizado de máquina, o desenvolvedor deve escolher um algoritmo:

a)

Por reforço.

b)

Supervisionado.

c)

Não supervisionado.

d)

Genético.

75.

Uma tarefa comum não supervisionada é o aprendizado de regras de associação, cujo objetivo é se aprofundar em grandes quantidades de dados e classificar atributos atributos.

a)

Certo.

b)

Errado.

76.

Robôs podem substituir os humanos em algumas funções.

a)

Verdadeiro. Alguns empregos serão extintos e outros irão surgir.

b)

Falso. Os humanos são insubstituíveis, inclusive nos trabalhos braçais.

77.

A Netflix o Spotify são tipos de Inteligência Artificial?

a)

Sim. Eles possuem um sistema de recomendação conforme o gosto das pessoas.

b)

Não. Eles não são capazes de saber sobre as preferências das pessoas.