wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

[PDM] RecSys Parquet

Total questions: 10

Worksheet time: 8mins

Name
Class
Date
1.
Abaixo segue uma lista de formatos de arquivos. Qual delas possui APENAS arquivos binários?
a)
PARQUET, AVRO, XML
b)
AVRO, PARQUET, ORC
c)
JSON, XML, ORC
d)
CSV, JSON, ORC
e)
PARQUET, JSON, XML
2.
A Matriz de Utilidade, conceito central em Sistemas de Recomendação, é frequentemente esparsa. O que isso significa na prática?
a)
Que a maioria dos usuários avaliou a maioria dos itens.
b)
Que a matriz contém muitos valores negativos.
c)
Que os dados são perfeitamente balanceados e distribuídos.
d)
Que a grande maioria das células da matriz está vazia, pois um usuário típico avaliou apenas uma pequena fração dos itens disponíveis.
e)
Que os valores das avaliações (ratings) são todos muito baixos.
3.
O formato de arquivo "Parquet" é muito utilizado em aplicações que envolvam dados massivos, dadas suas características que propiciam vantagens tanto no armazenamento quanto na leitura desses dados. Qual a forma de armazenamento utilizada no Parquet?
a)
Por registro (raw format)
b)
Disco sólido (solid disk)
c)
Colunar (columnar data format)
d)
Por disco (disk format)
4.
Qual das seguintes situações descreve melhor o problema de 'cold start' em sistemas de recomendação?
a)
O sistema tem dificuldade em recomendar itens para usuários com gostos muito peculiares.
b)
O sistema fica lento quando a matriz de utilidade se torna muito grande e esparsa.
c)
O sistema tem dificuldade em gerar recomendações para novos usuários ou novos itens por falta de dados de interação.
d)
O sistema recomenda apenas itens populares, ignorando os itens de cauda longa.
e)
As preferências de um usuário mudam ao longo do tempo, tornando as recomendações antigas irrelevantes.
5.
Qual das seguintes afirmações melhor descreve a principal diferença entre a Filtragem Colaborativa (Collaborative Filtering) e a Filtragem Baseada em Conteúdo (Content-Based Filtering) em sistemas de recomendação?
a)
A Filtragem Colaborativa analisa o conteúdo dos itens, enquanto a Baseada em Conteúdo analisa o comportamento do usuário.
b)
A Filtragem Colaborativa baseia-se na similaridade entre usuários ou itens a partir de suas interações, enquanto a Baseada em Conteúdo utiliza as características intrínsecas dos itens para fazer recomendações.
c)
Ambas as abordagens utilizam exclusivamente a matriz de utilidade para encontrar novos itens, mas com algoritmos diferentes.
d)
A Filtragem Baseada em Conteúdo é mais eficaz para resolver o problema de 'cold start' com novos itens do que a Filtragem Colaborativa.
e)
A Filtragem Colaborativa requer um processo pesado de extração de features dos itens, enquanto a Baseada em Conteúdo não.
6.
Qual formato de arquivo é caracterizado por armazenar dados em colunas em vez de linhas, sendo otimizado para consultas analíticas e compressão de dados em ambientes de Big Data?
a)
JSON
b)
CSV
c)
Avro
d)
XML
e)
Parquet
7.
Sobre efeito "cold start" em um sistema de recomendação, é correto afirmar que:
a)
É um problema característico exclusivamente dos sistemas de recomendação "Colaborative Filtering".
b)
Se caracteriza na entrada de novos usuários em um sistema de recomendação "Content Based"
c)
Ocorre quando o sistema não possui informações a respeito das preferências de um usuário.
d)
Ocorre quando o sistema não possui informações a respeito de um novo item.
e)
Nenhuma das alternativas estão corretas.
8.
Como se denomina o modo de processamento que posterga a atividade de consumo dos dados até o momento que efetivamente seja necessário, obtendo assim vantagem em não alocar recursos de forma desnecessária.
a)
Lazy
b)
Eager
c)
Moderate
d)
Naive
e)
Fast
9.
Qual é a principal desvantagem de usar um formato de arquivo colunar como o ORC em comparação com um formato de texto como o CSV?
a)
Ele ocupa mais espaço de armazenamento devido aos metadados.
b)
É mais lento para consultas que selecionam todas as colunas de um registro.
c)
Os dados não são legíveis por humanos sem o uso de ferramentas específicas.
d)
Não suporta a evolução de schema, tornando difícil adicionar novas colunas.
e)
Possui menor compatibilidade com ecossistemas de Big Data como Spark e Hadoop.
10.
Por que um sistema de recomendação baseado no conteúdo pode recomendar para usuários com gostos peculiares?
a)
Porque leva em conta a similaridade entre usuários.
b)
Porque não requer dados sobre outros usuários.
c)
Porque trabalha com itens não populares.
d)
Porque é capaz de explorar a capacidade de julgamento dos usuários.