NEW
Font size
WorksheetsCiência de Dados
Total questions: 10
Worksheet time: 10mins
O Haddop, utilizado em tecnologias de Big Data e Blockchain, pode ser definido como:
Uma estrutura de software open source para armazenar dados e executar aplicações em clusters de hardwares comuns.
Um livro-razão compartilhado e imutável que facilita o processo de registro de transações e o rastreamento de ativos em uma rede empresarial.
São dados com maior variedade que chegam em volumes crescentes e com velocidade cada vez maior.
Um método de análise de dados que automatiza a construção de modelos analíticos.
Um processo de encontrar anomalias, padrões e correlações em grandes conjuntos de dados para prever resultados
A Big Data é definida como a análise e interpretação de grandes volumes de dados, que contém também uma grande variedade de formatação e tem como característica um conjunto 5 V’s, que são:
velocidade, veracidade, volume, variedade e verdade.
valor, volume, veracidade, variedade e vida.
volume, velocidade, variedade, veracidade e valor.
venda, viabilidade, verdade, volume e venda.
viabilidade, verdade, volume, valor e várzea.
O modelo de programação MapRecuce para grandes volumes de dados é baseado no:
Processamento distribuído, que permite dividir o processamento entre vários computadores operando em
cluster.
Habilidade de aprender sem ser explicitamente programado.
Conjunto de arquivos relacionados entre si com registros sobre pessoas, lugares ou coisas.
Banco de dados que fornece um mecanismo para armazenamento e recuperação de dados que são modelados de formas diferentes das relações tabulares usadas nos bancos de dados relacionais.
Modelo matemático usado para representar programas de computadores ou circuitos lógicos.
Em se tratando de um grande volume de dados como os encontrados em Data Warehouses, pode-se definer como menor granularidade, ou granularidade fina, quando há:
Maior detalhamento (maior sumarização) dos dados.
Menor detalhamento (menor sumarização) dos dados.
Maior detalhamento (menor sumarização) dos dados.
Menor detalhamento (maior sumarização) dos dados.
Mesmo detalhamento (menor sumarização) dos dados.
O termo Ciência de dados iniciou-se na década de 1960, quando surgiu a necessidade do armazenamento em massa. Essa ciência natural trata de obter conhecimento e informação, de forma sistemática, a fim que esse conhecimento possa ser normalizado e organizado. A Ciência de dados trata de estudar o dado em seu ciclo de vida: da produção ao seu descarte, onde a etapa de conhecimento representa:
Os fatos coletados e armazenados para uso posterior.
Os dados após terem sido analisados e que possuam algum
significado.
A melhor decisão a ser tomada com tudo isso.
A informação interpretada e aplicada com uma finalidade.
As soluções para os problemas apresentados.
Dentre um dos 5V's do Big Data, a Variedade é um dos grandes desafios, pois há uma grande dificuldade em se padronizar os dados para uso otimizado.O Big Data escalona a variedade de informações das seguintes formas:
Dados aleatórios, ramdômicos e acumulados
Dados estruturados, semi-estruturados e não estruturados.
Dados probabilísticos, amorfos uniformes.
Dados puros, impuros e intermediários.
Dados analógicos, digitais e híbridos
O armazenamento de dados apresenta uma série de premissas que devem ser atendidas, dentre as quais NÃO faz parte:
Segurança
Integridade
Concorrência
Otimização de espaço.
Causalidade
O processo de ETL geralmente envolve:
Modelo matemático usado para representar programas de computadores ou circuitos lógicos.
Integração dos dados em uma empresa, permitindo que esses dados sejam trocados com fornecedores, clientes, parceiros, etc.
Uma abstração que une códigos comuns entre vários projetos de software provendo uma funcionalidade genérica.
Estudo de reconhecimento de padrões e da teoria do aprendizado computacional em inteligência artificial.
Modelo de programação desenhado para processar grandes volumes de dados em paralelo, dividindo o trabalho em um conjunto de tarefas independentes.
Em termos de armazenamento analítico de dados, o termo "grão" é definido como:
O menor nível da busca em profundidade, definido de acordo com o buscador.
O maior nível de abstração de um dado, definido de acordo com o formato de armazenamento.
O maior nível de utilidade, definido de acordo com a usabilidade.
O menor nível da busca, definido de acordo com a necessidade empregada.
O menor nível da informação, definido de acordo com as necessidades elencadas no início do projeto
O termo "datafication" em Big Data, significa basicamente:
Uma abstração que une códigos comuns entre vários projetos de software provendo uma funcionalidade genérica.
O registro eletrônico de um fenômeno qualquer em que os dados podem ser registrados.
Um modelo de programação desenhado para processar grandes volumes de dados em paralelo, dividindo o trabalho em um conjunto de tarefas independentes.
O estudo de reconhecimento de padrões e da teoria do aprendizado computacional em inteligência artificial.
Uma classe definida de banco de dados que fornecem um mecanismo para armazenamento e recuperação de dados que são modelados de formas diferentes das relações tabulares usadas nos bancos de dados relacionais.
