Font size
WorksheetsREVISÃO DE CIÊNCIA DE DADOS
Total questions: 77
Worksheet time: 1hrs 3mins
Quem é o GRANDE protagonista da ciência de dados?
Juliette do BBB
a Internet
o dado que gera informação para produção de conhecimento
o poder de processamento e memória
Onde estão os dados da ciência de dados?
em small data
na big data
abertos na Web e distribuídos
em big e small data
na indústria de petróleo
Objetivo da ciência de dados:
big e small data
fazer os algoritmos ficarem mais inteligentes e aprenderem com base em padrões
gerar aplicações tecnológicas
melhorar a tomada de decisão com base em insights obtidos a partir de dados muito volumosos
ciclo do data science:
implementação, teste, operacionalização, manutenção
extração, transformação e visualização
engenharia, coleta, machine learning, visualização
coleta, engenharia de dados, mineração, visualização
O Haddop, utilizado em tecnologias de Big Data e Blockchain, pode ser definido como:
Uma estrutura de software open source para armazenar dados e executar aplicações em clusters de hardwares comuns.
Um livro-razão compartilhado e imutável que facilita o processo de registro de transações e o rastreamento de ativos em uma rede empresarial.
São dados com maior variedade que chegam em volumes crescentes e com velocidade cada vez maior.
Um método de análise de dados que automatiza a construção de modelos analíticos.
Um processo de encontrar anomalias, padrões e correlações em grandes conjuntos de dados para prever resultados
A Big Data é definida como a análise e interpretação de grandes volumes de dados, que contém também uma grande variedade de formatação e tem como característica um conjunto 5 V’s, que são:
velocidade, veracidade, volume, variedade e verdade.
valor, volume, veracidade, variedade e vida.
volume, velocidade, variedade, veracidade e valor.
venda, viabilidade, verdade, volume e venda.
viabilidade, verdade, volume, valor e várzea.
Em se tratando de um grande volume de dados como os encontrados em Data Warehouses, pode-se definer como menor granularidade, ou granularidade fina, quando há:
Maior detalhamento (maior sumarização) dos dados.
Menor detalhamento (menor sumarização) dos dados.
Maior detalhamento (menor sumarização) dos dados.
Menor detalhamento (maior sumarização) dos dados.
Mesmo detalhamento (menor sumarização) dos dados.
O termo Ciência de dados iniciou-se na década de 1960, quando surgiu a necessidade do armazenamento em massa. Essa ciência natural trata de obter conhecimento e informação, de forma sistemática, a fim que esse conhecimento possa ser normalizado e organizado. A Ciência de dados trata de estudar o dado em seu ciclo de vida: da produção ao seu descarte, onde a etapa de conhecimento representa:
Os fatos coletados e armazenados para uso posterior.
Os dados após terem sido analisados e que possuam algum
significado.
A melhor decisão a ser tomada com tudo isso.
A informação interpretada e aplicada com uma finalidade.
As soluções para os problemas apresentados.
Dentre um dos 5V's do Big Data, a Variedade é um dos grandes desafios, pois há uma grande dificuldade em se padronizar os dados para uso otimizado.O Big Data escalona a variedade de informações das seguintes formas:
Dados aleatórios, ramdômicos e acumulados
Dados estruturados, semi-estruturados e não estruturados.
Dados probabilísticos, amorfos uniformes.
Dados puros, impuros e intermediários.
Dados analógicos, digitais e híbridos
O armazenamento de dados apresenta uma série de premissas que devem ser atendidas, dentre as quais NÃO faz parte:
Segurança
Integridade
Concorrência
Otimização de espaço.
Causalidade
Não é um exemplo típico de aplicação de Mineração de Dados:
Prever se clientes de uma empresa vão migrar para um concorrente.
Checar se o cálculo da folha de pagamento está correto.
Detectar fraudes em transferências bancárias.
Tentar reduzir a evasão escolar.
Em uma tarefa de classificação, a classe é um atributo especial que queremos prever ou descrever.
Verdadeira
Falsa
O agrupamento é um tipo de tarefa de Mineração de Dados...
Supervisionada
Não Supervisionada
Aprendizagem por Reforço
Prever a altura de bebês a partir de sua altura aos dois anos de idade. Qual tarefa de Mineração de Dados é essa?
Classificação
Agrupamento
Regras de Associação
Regressão
Seu cliente quer potencializar as vendas em seu e-commerce e lhe contrata para tentar ofertar novos produtos aos clientes à medida que eles compram. Que tipo de tarefa de Mineração de Dados é esta:
Classificação
Agrupamento
Regras de Associação
Regressão
Analisando dados coletados de algas marinhas desconhecidas, buscando categoriza-lo segundo atributos em comum. Qual tarefa de mineração de dados é esta?
Classificação
Regressão
Agrupamento
Aprendizado por Reforço
O conceito de informação pode ser definido, principalmente, como:
Dados simples.
O conjunto de todas as informações da empresa.
Os dados do cliente e do concorrente dele.
O tratamento e organização dos dados.
Uma informação é um dado significativo, útil e muito relevante para a empresa e para a tomada de decisões. Ela deve ser definida:
Por quem vai usá-la.
Pelo mercado.
Pelo gestor.
Pelo marketing.
Unir conceitos de Sistemas de Informação e Tecnologia da Informação pressupõe:
A possibilidade de aprender com dados e informações do seu sistema.
Uma ação do concorrente.
Uma ação de marketing conjunta.
Uma competição de vendas de um determinado produto.
Os processos de negócios também podem ser chamados como:
Processos gerais.
Processos informacionais.
Processos organizacionais.
Processos métricos.
O OLAP é uma ferramenta bastante utilizada em Data Mining, que envolve a criação de Data Marts especialmente configurados para permitir análises multidimensionais de dados, como forma de encontrar regras e padrões.
Podemos dizer que a afirmativa acima é:
Verdadeira
Falsa
A afirmativa: "Há uma ligação bastante intima entre o Business Intelligence e Data Mining pois ambos os processos se alimentam mutualmente."
Esta afirmativa está:
Correta
Falsa
Complete a afirmativa:
______________ é um banco de dados especializado cujo objetivo é unificar e organizar (normatizar) todos os dados disponíveis a uma organização.
A lacuna deve ser corretamente completada com a palavra:
Data Mining
ETL
Data Warehouse
Data Marts
As 3 partes que as regras e padrões significativos do Data Mining são:
Processo de negócio, pequena massa de dados e regras e padrões significativos.
Grande massa de dados, pequena massa de dados e regras e padrões significativos.
Grande massa de dados, processo de negócio e regras e padrões significativos.
Grande massa de dados, pequena massa de dados e processo de negócio.
É um repositório de dados específicos, um subconjunto dos dados mantidos no Data Warehouse. Esta afirmativa é relacionada ao:
Data Mart.
OLAP.
Data Mining.
ETL.
A aplicação do ________ soluciona o problema de síntese, análise e consolidação de dados, pois é o processamento analítico online dos dados. Tem capacidade de visualizações das informações a partir de muitas perspectivas diferentes, enquanto mantém uma estrutura de dados adequada e eficiente.
OLAP
OLTP
ALLPP
DATA FULL
É um termo usado por fornecedores de hardware e software e consultores de tecnologia da informação para descrever a infraestrutura para armazenamento, integração, elaboração de relatórios e análise de dados que vêm do ambiente empresarial.
Big Data
Business Intelligence
Data Warehouse
E-business
Conjuntos de dados com volumes tão grandes que estão além da capacidade que um SGBD relacional típico tem para capturar, armazenar e analisar. São dados normalmente são não estruturados.
Data Warehouse
Data Mining
Big Data
Sistema Gerenciador de Banco de Dados
O __________, possibilita armazenar grandes volumes de dados coletados dos sistemas transacionais. São as chamadas séries históricas que possibilitam uma melhor análise de eventos passados, oferecendo suporte às tomadas de decisões presentes e a previsão de eventos futuros.
ETL
DataWarehouse
Data Analytics
Data Visualization
Pode ser considerado um subconjunto do Data WareHouse, ou seja, um datawarehouse departamental.
Data Part
Data Fine
Data Mart
Smart Data
O __________, explora grandes quantidade de dados procurando padrões consistentes, como regras de associação ou sequencias temporais, para detectar relacionamentos sistemáticos entre variáveis, detectando assim novos subconjuntos de dados.
Data Mart
Big Data
Machine Learning
Data Mining
Um neurônio artificial é composto por: entradas, pesos, função soma e função de ativação
Verdadeiro
Falso
Nas redes neurais do tipo feed forward, não é necessário utilizar o algoritmo backpropagation para atualização dos pesos
Verdadeiro
Falso
No aprendizado não supervisionado a entrada inclui as soluções desejadas.
Verdadeiro
Falso
A técnica de clustering busca criar sistemas para detectar instâncias similares sem que seja preciso informar rótulos de cada instância de treino
Verdadeiro
Falso
A redução de dimensionalidade busca simplificar os dados sem perder muita informação, juntando características correlacionadas
Verdadeiro
Falso
Nessa técnica, o sistema é treinado para aprender um modelo capaz de prever um valor numérico dadas algumas características. Qual é essa técnica?
Clustering.
Regressão
Redução de dimensionalidade
Classificação
Detecção de anomalias
Quais dos seguintes atributos humanos a IA consegue imitar?
Tomada de decisões baseada em experiências anteriores
Compreender a linguagem escrita e falada
Pensamento crítico para comportamento moral, ético e humano
Reconhecer eventos anormais
Quais das alternativas a seguir são cargas de trabalho comuns da IA?
Aprendizado de máquina
Blockchain
Pesquisa visual computacional
Processamento em lotes
Uma concessionária de automóveis deseja usar os dados históricos de vendas de carros para treinar um modelo de machine learning. O modelo deve prever o preço de um carro seminovo com base na marca, no modelo, no tamanho do motor e na quilometragem. O revendedor deve usar o machine learning automatizado para criar qual tipo de modelo de machine learning?
classificação
Regressão
Previsão de série temporal
Um banco deseja usar registros históricos de repagamento de empréstimos para categorizar aplicações de empréstimo como de baixo risco ou alto risco com base em características como o valor do empréstimo, a renda do tomador e o período do empréstimo. O banco deve usar machine learning automatizado para criar qual tipo de modelo de machine learning?
classificação
Regressão
Previsão de série temporal
Você usa um pipeline do designer do Azure Machine Learning para treinar e testar um modelo de classificação binária. Você examina as métricas de desempenho do modelo em um módulo Avaliar Modelo e observe que ele tem uma pontuação AUC de 0,3. O que é possível concluir sobre o modelo?
O modelo pode explicar 30% da variância entre os rótulos reais e os previstos.
O modelo prevê com precisão 70% dos casos de teste.
O modelo tem um desempenho pior do que a adivinhação aleatória.
Você usa o designer do Azure Machine Learning para criar um pipeline de treinamento para um modelo de clustering. Agora, você quer usar o modelo em um pipeline de inferência. Qual módulo você deve usar para fazer inferências de previsões de cluster do modelo?
Pontuar Modelo
Atribuir dados a clusters
Treinar Modelo de Clustering
Dado o histórico de idades e alturas das crianças, você quer prever a altura das crianças em função da sua idade.
Aprendizado Supervisionado
Aprendizado Não Supervisionado
Examinar um grande conjunto de e-mails que são identificados como spam, para descobrir se existem sub-tipos de e-mails spam.
Aprendizado Supervisionado
Aprendizado Não Supervisionado
Dado um conjunto de dados genéticos (DNA) de uma pessoa, prever as chances de ele/ela desenvolver diabetes ao longo dos próximos 10 anos.
Aprendizado Supervisionado
Aprendizado Não Supervisionado
Examinar as estatísticas de dois times de futebol, e prever qual equipe vai ganhar o jogo de amanhã (dado um conjunto de dados históricos das vitórias / perdas para ser aprendido).
Aprendizado Supervisionado
Aprendizado Não Supervisionado
Através de uma coleção de 1000 textos escritos sobre a economia do Brasil, encontrar uma maneira de agrupar automaticamente estes textos que são de alguma forma "similares" ou "relacionados".
Aprendizado Supervisionado
Aprendizado Não Supervisionado
A Inteligência Aritificial (IA) é uma tecnologia que ainda não está presente no nosso dia a dia
Verdadeiro
Falso
A Inteligência Aritificial (IA) é a combinação de algoritmos projetados para criar máquinas que tenham as mesmas capacidades que o ser humano
Verdadeiro
Falso
Dos conceitos abaixo quais são aqueles que fazem parte das principais aplicações da IA. Selecione a opção que considera correta
Assistentes pessoais virtuais
Saúde
Agrícolas
Todas as opções
O pressuposto inicial geral na criação da IA foi o de tornar as vidas humanas mais fáceis e o de melhorar a nossa qualidade de vida.
Contudo, e porque a IA não resolve todos os nossos problemas, selecione as opções que considera serem uma desvantagem da IA
Altos custos
Redução de erros
Aumento do volume de produção
Desemprego
Manutenção exigente
As tarefas de aprendizado de máquina são tipicamente divididas
conforme os sinais de entrada e as respostas do aprendizado
(ZUBELLI, 2017). Marque a opção que apresenta essas tarefas corretamente.
classificação, Por incremento,
agrupamento.
Por incremento, regressão,
agrupamento.
classificação, regressão,
agrupamento.
classificação, regressão,
Não incremental.
Os sistemas de aprendizado ___________ buscam aprender
construindo representações simbólicas de um conceito, por meio da
análise de exemplos e contraexemplos dele. As representações
simbólicas estão tipicamente na forma de alguma expressão lógica,
árvore de decisão, regras ou rede semântica. Qual das alternativas preenche corretamente a lacuna?
Baseado em exemplos.
Simbólico.
Estatístico.
Genético.
Os sistemas de aprendizado de máquina apresentam características
peculiares, que possibilitam uma classificação não exclusiva desses
sistemas em função da linguagem de descrição, do modo de
aprendizado, do paradigma de aprendizado, das formas e da tarefa
de aprendizado (STANGE, 2011). Qual das alternativas apresenta um modo de aprendizado de máquina:
Classificação.
Agrupamento.
Regressão.
Por reforço.
Agrupar fotos de animais similares em clusters, sem ter o
conhecimento prévio de qual animal está sendo apresentado. Qual modo de aprendizado pode ser aplicado neste exemplo?
Agrupamento.
Regressão.
Reforço.
Classificação.
Os sistemas de Machine learning, em português conhecidos como sis-
tema de aprendizagem automática ou sistemas de aprendizado de
máquina, podem ajudar a descobrir padrões, realizar determinadas
tarefas através da generalização de casos e na utilização de dados.
Os algoritmos de aprendizado de máquina têm um modo de
aprendizado que depende de um especialista externo para avalizar
seus resultados. Assinale a alternativa CORRETA que contenha
esse modo:
Aprendizado por reforço.
Aprendizado supervisionado.
Aprendizado não supervisionado.
Aprendizado por inteligência.
No aprendizado supervisionado, são
apresentados exemplos do que é desejado como entrada e saída, de
modo que o objetivo é aprender uma regra que mapeia a entrada na
saída.
Certo.
Errado.
é o treinamento de modelos de aprendizado de máquina para tomar uma sequência de decisões. O agente aprende a atingir uma meta em um ambiente incerto e potencialmente complexo. Estamos falando de:
Aprendizado por associação.
Aprendizado supervisionado.
Aprendizado por regressão.
Aprendizado por reforço.
Os sistemas de Aprendizado de Máquina podem ser classificados de acordo com
a quantidade e o tipo de supervisão que recebem durante o treinamento. Existem
cinco categorias principais de aprendizado: supervisionado, não supervisionado,
semissupervisionado, sem reforço e por reforço.
Certo.
Errado.
No Aprendizado Não-Supervisionado, destacam-se duas técnicas:
Agrupamento e Associação.
Associação e classificação.
Regressão e classificação.
Regressão e Agrupamento.
Acerca dos conceitos de mineração de dados, aprendizado de máquina e bigdata, julgue o próximo item. A análise de classificação é uma tarefa que consiste em agrupar um conjunto de objetos de tal forma que estes, juntos no mesmo grupo, sejam mais semelhantes entre si que em outros grupos.
CERTO.
ERRADO.
É um modelo matemático de inteligência artificial
que simula o comportamento do cérebro humano, tendo um papel
importante na história e na atualidade do desenvolvimento de
algoritmos inteligentes. Esta afirmação refere-se a:
Machine Learn.
Redes Neurais.
Big Data.
Data Mining
Os algoritmos não incrementais são frequentemente aplicados a fluxos
de dados ou big data , abordando problemas de disponibilidade de
dados e escassez de recursos, respectivamente.
Certo.
Errado.
No método de classificação para mineração de dados, a filiação dos objetos é obtida por meio de um processo não supervisionado de aprendizado, em que somente as variáveis de entrada são apresentadas para o algoritmo.
Certo.
Errado.
Estimar um modelo que utilize a idade e os anos de
escolaridade de um indivíduo não-observado anteriormente para
tentar prever seu salário. Utiliza-se como base desse modelo: idades,
anos de escolaridades e salários de diversos indivíduos já observados
anteriormente. Este exemplo pode ser aplicado em qual modo de aprendizado?
Associação
Classificação.
Regressão.
Agrupamento.
Esse tipo de sistema de aprendizado é denominado lazy (preguiçoso)
e necessita manter os exemplos na memória para classificar novos
exemplos, em oposição aos sistemas eager (gulosos), que utilizam os
exemplos para induzir o modelo, descartando-os logo após. A qual sistema de aprendizado a assertiva refere-se:
Conexionista.
Baseado em exemplos.
Simbólico.
Estaistico.
O aprendizado supervisionado é baseado no aprendizado incremental e
classificação. O humano fornece um banco de dados e ensina a
máquina a reconhecer o que é uma bicicleta, por exemplo, entre
padrões e semelhanças.
Certo.
Errado.
Os algoritmos de Machine learning têm seu aprendizado baseado em dados
históricos e diversas aplicações: agricultura de precisão, reconhecimento
de imagem, classificação de textos, desenvolvimento de chatbots. Torna-se
difícil um setor do novo modelo tecnológico que não utilize suas técnicas.
Sobre Machine learning, assinale a alternativa CORRETA que contenha as
tarefas de aprendizado:
Classificação, revolução, agrupamento e associação.
Categorização, regressão, análise e dissociação.
Classificação, regressão, agrupamento e dissociação.
Classificação, regressão, agrupamento e associação.
São benefícios do aprendizado de máquina, exceto:
com a utilização do machine learning, podemos fornecer uma experiência do usuário valiosa, com a personalização de resultados, por exemplo.
além de gerar economia com possíveis desperdícios de recursos na produção, também há um aprimoramento na mão de obra para ser utilizada;
para diversas áreas, além de existirem soluções prontas para serem utilizadas em determinado problema, também há a prevenção de riscos, podendo antecipar uma perda antes mesmo dela ocorrer.
tarefas repetitivas para nós, seres humanos, podem ser adaptadas para serem feitas de forma automática por meio de robôs, eliminando qualquer possibilidade de falhas;
As grandes empresas têm tudo a ver com a segmentação e personalização dos seus produtos. Fazem-no analisando as características particulares das pessoas e partilhando programas para as atrair. Infelizmente, algumas empresas são mal sucedidas nos seus esforços de vendas e marketing. Os algoritmos de ___________ podem agrupar indivíduos com características semelhantes e analisar se eles irão comprar o seu produto. Qual das alternativas preenche a lacuna corretamente?
Regressão linear.
Agrupamento.
Incremento.
Regressão estatística.
aprendizado não supervisionado é a forma menos utilizada pelas
empresas. Isso porque a máquina começa a analisar, sozinha, os
dados e a identificar os padrões — aprendendo a separar o que é
uma lata de uma garrafa, por exemplo. Como é a máquina
aprendendo por si só conceitos que nunca viu antes, o processo é
mais demorado e, portanto, não tão popular.
Certo.
Errado.
/
Os algoritmos de Machine Learning (ML) são baseados em diferentes conceitos matemáticos que influenciam na escolha de determinado algoritmo
para resolver um problema. Cada algoritmo faz parte de um tipo de ML (supervisionado, não supervisionado ou por reforço). Sobre as tarefas de
Machine Learning e seus modos de aprendizado, classifique V para as sentenças verdadeiras e F para as falsas:
( ) Classificação é uma tarefa supervisionada.
( ) Regressão é uma tarefa não supervisionada.
( ) Agrupamento é uma tarefa supervisionada.
( ) Regressão é uma tarefa supervisionada.
V - F - F - F.
V - F - F - V.
F - V - F - F.
V - V - V - V.
Um desenvolvedor de uma instituição bancária foi designado para tentar usar técnicas de aprendizado de máquina para, dado o saldo diário durante um ano de um cliente, classificá-lo como BOM ou MAU candidato a receber um cartão de crédito VIP. Para isso, a única informação que pode usar — e que ele recebeu — é um conjunto de treinamento com 50.000 clientes pré- classificados pelos seus gerentes, contendo 365 campos com os saldos diários e um campo com o número 1, caso o cliente fosse um BOM candidato, ou o número 0 (zero), caso fosse um MAU candidato. Essas respostas são consideradas corretas. Considerando as práticas tradicionais de aprendizado de máquina, o desenvolvedor deve escolher um algoritmo:
Por reforço.
Supervisionado.
Não supervisionado.
Genético.
Uma tarefa comum não supervisionada é o aprendizado de regras de associação, cujo objetivo é se aprofundar em grandes quantidades de dados e classificar atributos atributos.
Certo.
Errado.
Robôs podem substituir os humanos em algumas funções.
Verdadeiro. Alguns empregos serão extintos e outros irão surgir.
Falso. Os humanos são insubstituíveis, inclusive nos trabalhos braçais.
A Netflix o Spotify são tipos de Inteligência Artificial?
Sim. Eles possuem um sistema de recomendação conforme o gosto das pessoas.
Não. Eles não são capazes de saber sobre as preferências das pessoas.
