wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Quiz - Spark Hadoop e Big Data

Total questions: 60

Worksheet time: 34mins

Name
Class
Date
1.

Qual exemplo representa melhor dado NÃO ESTRUTURADO?

a)

Uma planilha de clientes organizada por colunas

b)

Um vídeo armazenado em uma pasta sem padrão de nome

c)

Um JSON com informações de produtos

d)

Um banco de dados relacional

2.

Qual característica define melhor os dados SEMI-ESTRUTURADOS?

a)

Não possuem nenhuma organização

b)

São rígidos como tabelas de banco de dados

c)

Têm alguma estrutura, mas ainda flexível (ex.: JSON, XML)

d)

São apenas arquivos de áudio e vídeo

3.

No processo ETL, a última etapa é (a)   .

4.

No ELT, a transformação dos dados ocorre:

a)

Antes de carregar no destino

b)

No momento da extração

c)

Após carregar os dados brutos no destino

d)

Não ocorre transformação

5.

Qual vantagem do ELT em relação ao ETL?

a)

Transformação antes do carregamento

b)

Maior flexibilidade e uso do poder da nuvem

c)

Não precisa de Data Lake

d)

Não necessita de governança

6.

Qual benefício é típico da virtualização?

a)

Rodar várias VMs em um único servidor físico

b)

Containers mais leves e rápidos

c)

Processamento em memória RAM

d)

Armazenar dados brutos em um Data Lake

7.

Na contenerização, um dos principais benefícios é:

a)

Alto consumo de recursos

b)

Portabilidade entre ambientes

c)

Dependência de hardware físico

d)

Transformações mais rápidas em ETL

8.

Qual a principal limitação do MapReduce no Hadoop?

a)

Processamento apenas em memória

b)

Exige containers

c)

Ler e gravar em disco a cada etapa

d)

Não suporta dados distribuídos

9.

O Apache Spark é mais rápido que o Hadoop porque:

a)

Executa tudo em SSDs

b)

Processa dados em memória RAM

c)

Usa apenas Data Lakes

d)

Elimina a etapa de shuffle

10.

O que é shuffle no Spark?

a)

Compressão de dados

b)

Redistribuição de dados entre nós do cluster

c)

Armazenamento em memória RAM

d)

Otimização de containers

11.

O que pode causar Data Skew em um cluster?

a)

Chaves com muitos dados concentrados em poucos nós

b)

Excesso de memória RAM

c)

Uso de containers leves

d)

Transformações no ELT

12.

No Data Lake, os dados geralmente são armazenados:

a)

Estruturados e modelados para consulta

b)

Brutos e sem transformação prévia

c)

Em tabelas estrela/snowflake

d)

Exclusivamente em bancos relacionais

13.

Qual risco está associado a um Data Lake sem governança?

a)

Alta velocidade de consulta

b)

Virar um Data Swamp

c)

Segurança integrada

d)

Uso obrigatório de SQL

14.

Uma vantagem do Data Warehouse em relação ao Data Lake é:

a)

Suporte nativo a transações ACID

b)

Armazenamento de dados brutos

c)

Escalabilidade infinita

d)

Necessidade menor de modelagem

15.

O serviço da AWS que permite armazenar objetos é o (a)   .

16.

O serviço da AWS que consulta dados diretamente no S3 com SQL é o (a)   .

17.

O Delta Lake adiciona quais recursos a Data Lakes?

a)

Apenas compressão de dados

b)

Transações ACID e confiabilidade

c)

Armazenamento em HDD

d)

Substitui totalmente o Spark

18.

O Delta Lake é uma camada de:

a)

Processamento em lote

b)

Armazenamento confiável sobre Data Lakes

c)

Virtualização de hardware

d)

Execução de containers

19.

No HDFS, qual o objetivo da replicação dos blocos de dados?

a)

Economizar espaço em disco

b)

Garantir tolerância a falhas

c)

Aumentar a velocidade de rede

d)

Reduzir o uso de memória RAM

20.

Qual é o papel do NameNode no HDFS?

a)

Armazenar blocos de dados

b)

Processar dados em paralelo

c)

Gerenciar metadados e localização dos blocos

d)

Executar consultas SQL

21.

Na fase Map do MapReduce, o que acontece?

a)

Os dados são replicados entre DataNodes

b)

Os splits de entrada são convertidos em pares (chave, valor)

c)

Os pares são agregados em um resultado final

d)

Os resultados são salvos no HDFS

22.

Qual etapa do MapReduce agrupa pares de mesma chave antes de enviar ao Reduce?

a)

Input Split

b)

Map

c)

Shuffle and Sort

d)

Output

23.

O Hive surgiu no Facebook para resolver qual problema?

a)

Dificuldade em armazenar vídeos em grande escala

b)

Analistas não conseguiam acessar dados facilmente via MapReduce

c)

Falta de suporte a containers

d)

Necessidade de processar dados em tempo real

24.

Qual é a principal linguagem usada no Hive?

a)

HiveQL

b)

SQL tradicional

c)

MapReduce Script

d)

Java

25.

Qual característica define o Hive como Schema-on-Read?

a)

Os dados precisam ser estruturados antes de gravar

b)

A estrutura é aplicada apenas no momento da leitura

c)

Transforma dados brutos automaticamente

d)

É usado apenas em bancos relacionais

26.

O Hive é mais adequado para:

a)

Consultas interativas em milissegundos

b)

Processamento em tempo real

c)

Processamento em lote de grandes volumes de dados

d)

Gerenciamento de containers

27.

Qual é a principal função do Docker Compose?

a)

Orquestrar clusters em produção

b)

Gerar consultas SQL distribuídas

c)

Padronizar ambientes de desenvolvimento com containers

d)

Substituir o Kubernetes em escala

28.

Qual cenário é mais adequado para o uso do Docker Compose?

a)

Ambiente de produção com auto-escalonamento

b)

Ambiente de desenvolvimento e testes

c)

Clusters massivos em Big Data

d)

Consultas SQL em Data Lakes

29.

Quem é considerado o 'Pai do Data Warehouse'?

a)

Ralph Kimball

b)

Bill Inmon

c)

Jeff Bezos

d)

Martin Fowler

30.

Na abordagem de Bill Inmon (Top-Down), os dados são:

a)

Modelados de forma dimensional

b)

Normalizados em 3FN antes da análise

c)

Primeiro organizados em Data Marts

d)

Não seguem nenhuma regra de modelagem

31.

Qual é o foco principal da metodologia Inmon?

a)

Facilidade de implementação rápida

b)

Consistência e governança com uma única fonte de verdade

c)

Flexibilidade para diferentes áreas da empresa

d)

Redundância de dados proposital

32.

Quem é considerado o 'Pai dos Data Marts'?

a)

Bill Inmon

b)

Ralph Kimball

c)

Elon Musk

d)

Larry Page

33.

Na metodologia Kimball (Bottom-Up), a modelagem utilizada é:

a)

3FN normalizada

b)

Modelo dimensional com fatos e dimensões

c)

Modelo relacional tradicional

d)

Schema-on-Read

34.

Uma desvantagem da metodologia Kimball é:

a)

Perda da ideia de uma única fonte de verdade

b)

Baixa performance em consultas

c)

Necessidade de profissionais altamente especializados

d)

Complexidade na integração de dados

35.

Um Data Lake é caracterizado por:

a)

Armazenar apenas dados estruturados

b)

Usar Schema-on-Write

c)

Armazenar dados brutos em sua forma original

d)

Exigir sempre modelagem dimensional

36.

O Data Lakehouse combina:

a)

Banco relacional + MongoDB

b)

Benefícios de Data Lake e Data Warehouse

c)

ETL e ELT

d)

OLTP e OLAP

37.

Uma das vantagens do Data Lakehouse em relação ao Data Lake tradicional é:

a)

Não permite transações ACID

b)

Suporte a transações ACID

c)

Não pode armazenar dados não estruturados

d)

Menor flexibilidade

38.

Na arquitetura de medalhão, a camada Bronze contém:

a)

Dados limpos e dentro dos padrões de conformidade

b)

Dados prontos para análise de negócio

c)

Dados brutos vindos das fontes de origem

d)

Modelos estrela Kimball

39.

Na arquitetura de medalhão, a camada Silver é responsável por:

a)

Organizar dados de negócio em modelo estrela

b)

Limpar, conformar e integrar os dados

c)

Armazenar dados brutos sem tratamento

d)

Armazenar apenas logs e metadados

40.

Na arquitetura de medalhão, a camada Gold é voltada para:

a)

Armazenar dados de sensores IoT

b)

Relatórios e análises de negócio otimizadas

c)

Captura de dados históricos

d)

Execução de queries ad-hoc

41.

Dos '3Vs' do Big Data, (a)   se refere à diversidade de formatos e tipos de dados.

42.

O termo 'Volume' em Big Data está relacionado a:

a)

Quantidade de dados gerados

b)

Diversidade de fontes

c)

Rapidez de processamento

d)

Consistência dos dados

43.

A 'Velocidade' no contexto de Big Data refere-se a:

a)

Crescimento anual de dados

b)

Tamanho de armazenamento

c)

Tipos diferentes de dados

d)

Rapidez com que os dados são gerados e processados

44.

Um exemplo típico de 'Variedade' em Big Data seria:

a)

Muitos terabytes de logs

b)

Alta disponibilidade

c)

Processamento em tempo real

d)

Dados estruturados e não estruturados

45.

O '3V' do Big Data que está diretamente ligado a streams de dados em tempo real é (a)   .

46.

No contexto de transações ACID, o 'A' significa (a)   .

47.

Em ACID, a 'Consistência' garante que:

a)

Todos os usuários vejam os mesmos dados ao mesmo tempo

b)

As transações sejam independentes

c)

As transações sejam sempre rápidas

d)

Os dados estejam sempre dentro das regras e restrições

48.

A propriedade 'Isolamento' em ACID garante que:

a)

As transações sejam executadas uma de cada vez

b)

A execução seja instantânea

c)

O banco esteja sempre disponível

d)

Uma transação não interfira em outra

49.

O 'D' em ACID significa (a)   .

50.

Qual exemplo demonstra a 'Atomicidade'?

a)

Ou todas as operações de uma transação acontecem, ou nenhuma acontece

b)

Os dados são replicados em vários servidores

c)

Os dados são salvos rapidamente

d)

As consultas são paralelizadas

51.

O comando que lê um arquivo JSON chamado `dados.json` em um DataFrame Spark é (a)   .

52.
Como ler um CSV chamado `clientes.csv` com cabeçalho e delimitador `;`?
a)
spark.read.csv("clientes.csv")
b)
spark.read.csv("clientes.csv", header=True, sep=";")
c)
spark.read.option("header", "true").option("delimiter", ";").csv("clientes.csv")
d)
spark.read.format("csv").option("header","true").option("sep",";").load("clientes.csv")
e)
Todas as anteriores estão corretas
53.

Para salvar o DataFrame `df` no diretório `saida/` em formato Parquet sobrescrevendo dados existentes, deve-se usar: (a)   .

54.
Qual comando retorna apenas clientes com idade maior que 30?
a)
df.filter("idade > 30")
b)
df.where(df["idade"] > 30)
c)
df.select("idade > 30")
d)
df.filter(df.idade > 30)
e)
Todas as anteriores
55.

O comando que conta o número de registros em um DataFrame chamado "df" é (a)   .

56.
Como ordenar o DataFrame pela coluna `idade` em ordem decrescente?
a)
df.orderBy("idade", ascending=False)
b)
df.sort(df["idade"].desc())
c)
df.sort("idade", False)
d)
df.orderBy(df.idade.desc())
e)
Todas as anteriores
57.
Como criar uma nova coluna `ano_nascimento` subtraindo `idade` de 2025?
a)
df.withColumn("ano_nascimento", 2025 - df["idade"])
b)
df.withColumn("ano_nascimento", 2025 - col("idade"))
c)
df.addColumn("ano_nascimento", 2025 - col("idade"))
d)
df.withColumn("ano_nascimento", F.lit(2025) - col("idade"))
e)
Todas as anteriores
58.

Qual comando cria uma tabela temporária chamada 'clientes' a partir de um DataFrame df?

(a)  

59.

Como contar o número de registros da tabela 'clientes' usando Spark SQL?

a)

spark.sql("SELECT COUNT(*) FROM clientes")

b)

spark.sql("SELECT COUNT() FROM clientes")

c)

spark.sql("SELECT COUNT(1) FROM clientes")

d)

df.count()

60.

Como filtrar clientes com idade maior que 30 usando Spark SQL?

a)

spark.sql("SELECT * FROM clientes WHERE idade > 30")

b)

spark.sql("SELECT * FROM clientes FILTER idade > 30")

c)

spark.sql("SELECT * FROM clientes HAVING idade > 30")

d)

df.filter("idade > 30")