Font size
WorksheetsQuiz - Spark Hadoop e Big Data
Total questions: 60
Worksheet time: 34mins
Qual exemplo representa melhor dado NÃO ESTRUTURADO?
Uma planilha de clientes organizada por colunas
Um vídeo armazenado em uma pasta sem padrão de nome
Um JSON com informações de produtos
Um banco de dados relacional
Qual característica define melhor os dados SEMI-ESTRUTURADOS?
Não possuem nenhuma organização
São rígidos como tabelas de banco de dados
Têm alguma estrutura, mas ainda flexível (ex.: JSON, XML)
São apenas arquivos de áudio e vídeo
No processo ETL, a última etapa é (a) .
No ELT, a transformação dos dados ocorre:
Antes de carregar no destino
No momento da extração
Após carregar os dados brutos no destino
Não ocorre transformação
Qual vantagem do ELT em relação ao ETL?
Transformação antes do carregamento
Maior flexibilidade e uso do poder da nuvem
Não precisa de Data Lake
Não necessita de governança
Qual benefício é típico da virtualização?
Rodar várias VMs em um único servidor físico
Containers mais leves e rápidos
Processamento em memória RAM
Armazenar dados brutos em um Data Lake
Na contenerização, um dos principais benefícios é:
Alto consumo de recursos
Portabilidade entre ambientes
Dependência de hardware físico
Transformações mais rápidas em ETL
Qual a principal limitação do MapReduce no Hadoop?
Processamento apenas em memória
Exige containers
Ler e gravar em disco a cada etapa
Não suporta dados distribuídos
O Apache Spark é mais rápido que o Hadoop porque:
Executa tudo em SSDs
Processa dados em memória RAM
Usa apenas Data Lakes
Elimina a etapa de shuffle
O que é shuffle no Spark?
Compressão de dados
Redistribuição de dados entre nós do cluster
Armazenamento em memória RAM
Otimização de containers
O que pode causar Data Skew em um cluster?
Chaves com muitos dados concentrados em poucos nós
Excesso de memória RAM
Uso de containers leves
Transformações no ELT
No Data Lake, os dados geralmente são armazenados:
Estruturados e modelados para consulta
Brutos e sem transformação prévia
Em tabelas estrela/snowflake
Exclusivamente em bancos relacionais
Qual risco está associado a um Data Lake sem governança?
Alta velocidade de consulta
Virar um Data Swamp
Segurança integrada
Uso obrigatório de SQL
Uma vantagem do Data Warehouse em relação ao Data Lake é:
Suporte nativo a transações ACID
Armazenamento de dados brutos
Escalabilidade infinita
Necessidade menor de modelagem
O serviço da AWS que permite armazenar objetos é o (a) .
O serviço da AWS que consulta dados diretamente no S3 com SQL é o (a) .
O Delta Lake adiciona quais recursos a Data Lakes?
Apenas compressão de dados
Transações ACID e confiabilidade
Armazenamento em HDD
Substitui totalmente o Spark
O Delta Lake é uma camada de:
Processamento em lote
Armazenamento confiável sobre Data Lakes
Virtualização de hardware
Execução de containers
No HDFS, qual o objetivo da replicação dos blocos de dados?
Economizar espaço em disco
Garantir tolerância a falhas
Aumentar a velocidade de rede
Reduzir o uso de memória RAM
Qual é o papel do NameNode no HDFS?
Armazenar blocos de dados
Processar dados em paralelo
Gerenciar metadados e localização dos blocos
Executar consultas SQL
Na fase Map do MapReduce, o que acontece?
Os dados são replicados entre DataNodes
Os splits de entrada são convertidos em pares (chave, valor)
Os pares são agregados em um resultado final
Os resultados são salvos no HDFS
Qual etapa do MapReduce agrupa pares de mesma chave antes de enviar ao Reduce?
Input Split
Map
Shuffle and Sort
Output
O Hive surgiu no Facebook para resolver qual problema?
Dificuldade em armazenar vídeos em grande escala
Analistas não conseguiam acessar dados facilmente via MapReduce
Falta de suporte a containers
Necessidade de processar dados em tempo real
Qual é a principal linguagem usada no Hive?
HiveQL
SQL tradicional
MapReduce Script
Java
Qual característica define o Hive como Schema-on-Read?
Os dados precisam ser estruturados antes de gravar
A estrutura é aplicada apenas no momento da leitura
Transforma dados brutos automaticamente
É usado apenas em bancos relacionais
O Hive é mais adequado para:
Consultas interativas em milissegundos
Processamento em tempo real
Processamento em lote de grandes volumes de dados
Gerenciamento de containers
Qual é a principal função do Docker Compose?
Orquestrar clusters em produção
Gerar consultas SQL distribuídas
Padronizar ambientes de desenvolvimento com containers
Substituir o Kubernetes em escala
Qual cenário é mais adequado para o uso do Docker Compose?
Ambiente de produção com auto-escalonamento
Ambiente de desenvolvimento e testes
Clusters massivos em Big Data
Consultas SQL em Data Lakes
Quem é considerado o 'Pai do Data Warehouse'?
Ralph Kimball
Bill Inmon
Jeff Bezos
Martin Fowler
Na abordagem de Bill Inmon (Top-Down), os dados são:
Modelados de forma dimensional
Normalizados em 3FN antes da análise
Primeiro organizados em Data Marts
Não seguem nenhuma regra de modelagem
Qual é o foco principal da metodologia Inmon?
Facilidade de implementação rápida
Consistência e governança com uma única fonte de verdade
Flexibilidade para diferentes áreas da empresa
Redundância de dados proposital
Quem é considerado o 'Pai dos Data Marts'?
Bill Inmon
Ralph Kimball
Elon Musk
Larry Page
Na metodologia Kimball (Bottom-Up), a modelagem utilizada é:
3FN normalizada
Modelo dimensional com fatos e dimensões
Modelo relacional tradicional
Schema-on-Read
Uma desvantagem da metodologia Kimball é:
Perda da ideia de uma única fonte de verdade
Baixa performance em consultas
Necessidade de profissionais altamente especializados
Complexidade na integração de dados
Um Data Lake é caracterizado por:
Armazenar apenas dados estruturados
Usar Schema-on-Write
Armazenar dados brutos em sua forma original
Exigir sempre modelagem dimensional
O Data Lakehouse combina:
Banco relacional + MongoDB
Benefícios de Data Lake e Data Warehouse
ETL e ELT
OLTP e OLAP
Uma das vantagens do Data Lakehouse em relação ao Data Lake tradicional é:
Não permite transações ACID
Suporte a transações ACID
Não pode armazenar dados não estruturados
Menor flexibilidade
Na arquitetura de medalhão, a camada Bronze contém:
Dados limpos e dentro dos padrões de conformidade
Dados prontos para análise de negócio
Dados brutos vindos das fontes de origem
Modelos estrela Kimball
Na arquitetura de medalhão, a camada Silver é responsável por:
Organizar dados de negócio em modelo estrela
Limpar, conformar e integrar os dados
Armazenar dados brutos sem tratamento
Armazenar apenas logs e metadados
Na arquitetura de medalhão, a camada Gold é voltada para:
Armazenar dados de sensores IoT
Relatórios e análises de negócio otimizadas
Captura de dados históricos
Execução de queries ad-hoc
Dos '3Vs' do Big Data, (a) se refere à diversidade de formatos e tipos de dados.
O termo 'Volume' em Big Data está relacionado a:
Quantidade de dados gerados
Diversidade de fontes
Rapidez de processamento
Consistência dos dados
A 'Velocidade' no contexto de Big Data refere-se a:
Crescimento anual de dados
Tamanho de armazenamento
Tipos diferentes de dados
Rapidez com que os dados são gerados e processados
Um exemplo típico de 'Variedade' em Big Data seria:
Muitos terabytes de logs
Alta disponibilidade
Processamento em tempo real
Dados estruturados e não estruturados
O '3V' do Big Data que está diretamente ligado a streams de dados em tempo real é (a) .
No contexto de transações ACID, o 'A' significa (a) .
Em ACID, a 'Consistência' garante que:
Todos os usuários vejam os mesmos dados ao mesmo tempo
As transações sejam independentes
As transações sejam sempre rápidas
Os dados estejam sempre dentro das regras e restrições
A propriedade 'Isolamento' em ACID garante que:
As transações sejam executadas uma de cada vez
A execução seja instantânea
O banco esteja sempre disponível
Uma transação não interfira em outra
O 'D' em ACID significa (a) .
Qual exemplo demonstra a 'Atomicidade'?
Ou todas as operações de uma transação acontecem, ou nenhuma acontece
Os dados são replicados em vários servidores
Os dados são salvos rapidamente
As consultas são paralelizadas
O comando que lê um arquivo JSON chamado `dados.json` em um DataFrame Spark é (a) .
Para salvar o DataFrame `df` no diretório `saida/` em formato Parquet sobrescrevendo dados existentes, deve-se usar: (a) .
O comando que conta o número de registros em um DataFrame chamado "df" é (a) .
Qual comando cria uma tabela temporária chamada 'clientes' a partir de um DataFrame df?
(a)
Como contar o número de registros da tabela 'clientes' usando Spark SQL?
spark.sql("SELECT COUNT(*) FROM clientes")
spark.sql("SELECT COUNT() FROM clientes")
spark.sql("SELECT COUNT(1) FROM clientes")
df.count()
Como filtrar clientes com idade maior que 30 usando Spark SQL?
spark.sql("SELECT * FROM clientes WHERE idade > 30")
spark.sql("SELECT * FROM clientes FILTER idade > 30")
spark.sql("SELECT * FROM clientes HAVING idade > 30")
df.filter("idade > 30")
