Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Big Data

Total questions: 61

Worksheet time: 31mins

Name
Class
Date
1.

Что такое большие данные (Big Data)?

a)

A) Небольшие структурированные таблицы

b)

B) Наборы данных, характеризующиеся большим объемом, скоростью и разнообразием

c)

C) Архивные данные

d)

D) Только числовые данные

2.

Что такое технологический стек Big Data?

a)

A) Один язык программирования

b)

B) Набор технологий для хранения, обработки и анализа больших данных

c)

C) Операционная система

d)

D) Тип базы данных

3.

Что такое хранилище данных?

a)

A) Файл на компьютере

b)

B) Система для централизованного хранения и анализа данных

c)

C) Текстовый редактор

d)

D) Архив логов

4.

4. Что такое Hadoop?

a)

A) Язык программирования

b)

B) СУБД

c)

C) Фреймворк для распределенного хранения и обработки данных

d)

D) Операционная система

5.

Что такое HDFS?

a)

A) СУБД

b)

B) Распределенная файловая система Hadoop

c)

C) Язык запросов

d)

D) Протокол передачи данных

6.

Что такое потоковая обработка данных?

a)

A) Обработка данных раз в месяц

b)

B) Обработка данных в реальном времени

c)

C) Архивирование данных

d)

D) Ручной анализ

7.

Что такое Apache Kafka?

a)

A) База данных

b)

B) Язык программирования

c)

C) Платформа для распределенной передачи сообщений

d)

D) Веб-сервер

8.

Основные свойства Big Data:

a)

A) Табличность, простота

b)

B) Volume, Velocity, Variety

c)

C) Только объем

d)

D) Безопасность и доступность

9.

Компоненты стека Big Data

a)

A) Word, Excel

b)

B) Hadoop, Spark, Kafka, Hive

c)

C) Photoshop, Illustrator

d)

D) Windows, Linux

10.

Типы хранилищ данных:

a)

A) Только реляционные

b)

B) Data Warehouse и Data Lake

c)

C) Только файлы

d)

D) Только NoSQL

11.

Компоненты Hadoop:

a)

A) Spark, Kafka

b)

B) HDFS, YARN, MapReduce

c)

C) MySQL, PostgreSQL

d)

D) Linux, Windows

12.

Этапы MapReduce:

a)

A) Load → Save

b)

B) Map → Shuffle → Reduce

c)

C) Read → Write

d)

D) Input → Output

13.

Компоненты Apache Spark:

a)

A) HDFS, YARN

b)

B) Spark Core, SQL, Streaming, MLlib

c)

C) Kafka, Zookeeper

d)

D) Hive, Pig

14.

Типы потоковой обработки:

a)

A) Только пакетная

b)

B) Event-driven и micro-batch

c)

C) Только офлайн

d)

D) Архивная

15.

Элементы Kafka:

a)

A) Таблицы

b)

B) Producer, Broker, Consumer, Topic

c)

C) Map, Reduce

d)

D) Executor, Driver

16.

Функции Hive:

a)

A) Потоковая обработка

b)

B) SQL-подобные запросы к данным в Hadoop

c)

C) Передача сообщений

d)

D) Машинное обучение

17.

Операции Pig Latin:

a)

A) SELECT, INSERT

b)

B) LOAD, FILTER, GROUP, FOREACH

c)

C) MAP, REDUCE

d)

D) SEND, RECEIVE

18.

Способы обработки реального времени:

a)

A) Пакетная

b)

B) Ручная

c)

C) Потоковая

d)

D) Архивная

19.

Методы машинного обучения в Big Data:

a)

A) Только ручной анализ

b)

B) Классификация, кластеризация, регрессия

c)

C) Архивация

d)

D) Шифрование

20.

Угрозы безопасности Big Data:

a)

A) Переполнение памяти

b)

B) Утечки данных и несанкционированный доступ

c)

C) Медленная сеть

d)

D) Ошибки пользователя

21.

Что такое MapReduce?

a)

A) СУБД

b)

B) Модель распределенной обработки данных

c)

C) Язык запросов

d)

D) Файловая система

22.

Что такое RDD?

a)

A) Таблица

b)

B) Распределенная неизменяемая коллекция данных в Spark

c)

C) Файл

d)

D) Поток сообщений

23.

Что такое Spark Streaming?

a)

A) Архив данных

b)

B) Модуль Spark для потоковой обработки

c)

C) СУБД

d)

D) Брокер сообщений

24.

Что такое Kafka topic?

a)

A) Сервер

b)

B) Категория для хранения сообщений

c)

C) Пользователь

d)

D) Процесс

25.

Что такое Hive?

a)

A) Брокер сообщений

b)

B) Система аналитических запросов поверх Hadoop

c)

C) Язык программирования

d)

D) СУБД реального времени

26.

Что такое Apache Pig?

a)

A) СУБД

b)

B) Инструмент для анализа данных на Hadoop

c)

C) Файловая система

d)

D) Очередь сообщений

27.

Что такое оптимизация данных?

a)

A) Удаление данных

b)

B) Повышение производительности обработки

c)

C) Архивирование

d)

D) Сжатие файлов

28.

Разница Data Warehouse и Data Lake:

a)

A) Нет разницы

b)

B) DW — структурированные данные, DL — любые данные

c)

C) DL быстрее

d)

D) DW дешевле

29.

Распределенное хранение в HDFS означает:

a)

A) Хранение в одном месте

b)

B) Хранение данных на нескольких узлах

c)

C) Только в облаке

d)

D) В оперативной памяти

30.

Параллельность MapReduce:

a)

A) Один процесс

b)

B) Выполнение задач на разных узлах одновременно

c)

C) Ручное управление

d)

D) Последовательная обработка

31.

В чём заключается параллельность MapReduce?

a)

Выполнение одной задачи последовательно

b)

B) Использование одного сервера

c)

C) Одновременная обработка данных на нескольких узлах

d)

D) Ручное распределение задач

32.

Какова роль driver и executors в Spark?

a)

Executors управляют приложением

b)

Driver хранит данные

c)

Driver и executors не связаны

d)

Driver управляет задачами, executors выполняют вычисления

33.

В чём отличие потоковой обработки от пакетной?

a)

Пакетная быстрее

b)

Потоковая работает только с файлами

c)

Потоковая требует ручного запуска

d)

Потоковая обрабатывает данные в реальном времени

34.

Какую гарантию доставки сообщений поддерживает Kafka?

a)

Только at most once

b)

Без гарантий доставки

c)

Только exactly once

d)

At least once и exactly once

35.

Основное преимущество Hive:

a)

Высокая скорость транзакций

b)

Потоковая обработка

c)

SQL-подобные запросы к данным в Hadoop

d)

Работа только с малыми данными

36.

Почему безопасность Big Data важна?

a)

Из-за высокой стоимости серверов

b)

Для защиты конфиденциальных и корпоративных данных

c)

Для ускорения вычислений

d)

Только для государственных систем

37.

Какой пример является классической задачей MapReduce?

a)

Подсчёт количества слов в тексте

b)

Хранение файлов

c)

Анализ потокового видео

d)

Передача сообщений

38.

Как создаётся RDD в Spark?

a)

CREATE RDD

b)

LOAD DATA

c)

sc.parallelize(коллекция)

d)

SELECT *

39.

Как выглядит корректный Hive-запрос?

a)

map(data)

b)

print table

c)

send message

d)

SELECT * FROM users;

40.

Пример корректной команды Pig Latin:

a)

INSERT INTO table

b)

A = LOAD 'data';

c)

SELECT ALL

d)

LOAD FILE

41.

Какой параметр используется в конфигурации Kafka producer?

a)

fs.defaultFS

b)

executor.memory

c)

yarn.resourcemanager

d)

bootstrap.servers

42.

Пример использования Spark Streaming:

a)

Создание отчёта раз в месяц

b)

Архивирование логов

c)

Обработка данных из Kafka в реальном времени

d)

Работа с Excel

43.

Как можно оптимизировать хранение данных в HDFS?

a)

Уменьшить размер блоков

b)

Отключить репликацию

c)

Использовать сжатие данных

d)

Использовать только один DataNode

44.

Какой метод улучшает производительность MapReduce?

a)

Увеличение входных файлов

b)

Удаление Reduce-фазы

c)

Отключение shuffle

d)

Использование combiner

45.

Корректная архитектура Spark-приложения:

a)

Один сервер и база данных

b)

Producer и Consumer

c)

Driver, Cluster Manager, Executors

d)

Master и Slave без управления

46.

Какие методы применяются для защиты Hadoop?

a)

Архивация данных

b)

Сжатие файлов

c)

Репликация блоков

d)

Kerberos, ACL, шифрование

47.

Как оптимизировать работу Hive?

a)

Использовать только CSV

b)

Уменьшить количество данных

c)

Партиционирование и бакетирование

d)

Ручная обработка

48.

Как повышается отказоустойчивость Kafka?

a)

Использованием одного брокера

b)

Уменьшением количества сообщений

c)

Очисткой логов

d)

Репликацией партиций

49.

Что помогает оптимизировать real-time обработку?

a)

Kafka и Spark Streaming

b)

Архивирование

c)

Использование SQL-отчётов

d)

Пакетная обработка

50.

Какая архитектура используется в Hadoop?

a)

Клиент–клиент

b)

Peer-to-peer

c)

Монолитная

d)

Master–Slave

51.

Корректный жизненный цикл MapReduce:

a)

Read → Write

b)

Split → Map → Shuffle → Reduce → Output

c)

Create → Delete

d)

Load → Save

52.

Из каких компонентов состоит HDFS?

a)

Producer и Consumer

b)

Driver и Executor

c)

Broker и Topic

d)

NameNode и DataNode

53.

Основные элементы архитектуры Spark:

a)

Только executors

b)

Broker и сервер

c)

Driver, Executors, Cluster Manager

d)

Master и Worker без управления

54.

Как Spark Streaming обрабатывает данные?

a)

Только последовательно

b)

Только офлайн

c)

Непрерывным SQL-запросом

d)

В виде микропакетов

55.

Основная функция Apache Kafka:

a)

Хранение таблиц

b)

Выполнение SQL-запросов

c)

Передача сообщений между системами

d)

Хранение файлов

56.

Где применяется машинное обучение в Big Data?

a)

Анализ, прогнозирование, рекомендации

b)

Для удаления данных

c)

Для шифрования

d)

Только для резервного копирования

57.

Что включает безопасность больших данных?

a)

Только пароли

b)

Аутентификацию, авторизацию, шифрование

c)

Репликацию

d)

Индексацию

58.

Основная проблема оптимизации Big Data:

a)

Малый объём данных

b)

Простота обработки

c)

Высокая ресурсоёмкость и задержки

d)

Отсутствие инструментов

59.

Как распределённые вычисления влияют на обработку данных?

a)

Замедляют процесс

b)

Увеличивают ошибки

c)

Делают анализ невозможным

d)

Ускоряют обработку больших объёмов данных

60.

Главное преимущество Spark по сравнению с MapReduce:

a)

Меньший размер кода

b)

Обработка данных в памяти

c)

Простота установки

d)

Отсутствие памяти

61.

Основная перспектива развития Big Data:

a)

Отказ от аналитики

b)

Снижение интереса

c)

Рост интеграции с ИИ и машинным обучением

d)

Использование только архивов