Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

ХОБД 2

Total questions: 98

Worksheet time: 49mins

Name
Class
Date
1.

Почему Spark быстрее MapReduce?

a)

Выполняет вычисления в оперативной памяти (In-Memory Computing)

b)

Не использует HDFS

c)

Работает на одном сервере

d)

Не требует Reduce

e)

Использует только Java

2.

Что является основной функцией JobTracker в старых версиях Hadoop?

a)

Координация выполнения задач Map и Reduce

b)

Управление хранилищем данных

c)

Анализ логов

d)

Сжатие файлов

e)

Мониторинг пользователей

3.

Какое свойство MapReduce обеспечивает масштабируемость?

a)

Возможность добавления новых узлов без изменения логики программы

b)

Централизованное управление

c)

Использование одной машины

d)

Отсутствие репликации

e)

Механизм блокировок

4.

Какой главный вывод можно сделать о MapReduce?

a)

Это фундаментальная технология, заложившая основу современных систем Big Data

b)

Это язык запросов SQL

c)

Это формат хранения данных

d)

Это интерфейс для визуализации

e)

Это система резервного копирования

5.

Когда был разработан фреймворк Apache Spark?

a)

В 2009 году в Калифорнийском университете в Беркли

b)

В 2003 году в MIT

c)

В 2012 году компанией Google

d)

В 2008 году в Amazon Lab

e)

В 2010 году корпорацией Oracle

6.

Какая основная цель создания Apache Spark?

a)

Обеспечить быструю и гибкую обработку данных в оперативной памяти

b)

Хранить данные в SQL-таблицах

c)

Заменить HDFS

d)

Ускорить работу браузеров

e)

Снизить нагрузку на CPU

7.

Какое основное ограничение имел MapReduce?

a)

Необходимость записи и чтения промежуточных данных на диск

b)

Отсутствие распределённости

c)

Невозможность пакетной обработки

d)

Ошибки в алгоритмах Reduce

e)

Неиспользование памяти

8.

Почему MapReduce неэффективен для итеративных алгоритмов?

a)

Из-за постоянных операций Disk I/O между итерациями

b)

Из-за недостатка памяти

c)

Из-за высокой нагрузки на CPU

d)

Из-за синтаксических ошибок

e)

Из-за отсутствия кластеров

9.

Какой тип обработки не поддерживает MapReduce?

a)

Потоковую обработку данных

b)

Пакетную обработку

c)

SQL-запросы

d)

Параллельную сортировку

e)

Архивацию данных

10.

Что представляет собой Apache Spark?

a)

Фреймворк для быстрой обработки больших данных в оперативной памяти

b)

База данных

c)

Язык программирования

d)

Система хранения файлов

e)

Графическая среда анализа

11.

Какие компоненты входят в архитектуру Spark?

a)

Driver, Cluster Manager и Executors

b)

Mapper, Reducer и Scheduler

c)

Master, Slave и Coordinator

d)

DataNode и NameNode

e)

SQL, ML и Stream модули

12.

Что делает Driver Program в Spark?

a)

Управляет выполнением задач и планирует их на кластер

b)

Хранит данные в HDFS

c)

Выполняет функции Map и Reduce

d)

Только собирает статистику

e)

Работает как бэкап

13.

За что отвечает Cluster Manager в Spark?

a)

За распределение ресурсов CPU и памяти между приложениями

b)

За распределение данных по узлам

c)

За хранение RDD

d)

За создание SQL-таблиц

14.

Какую роль выполняют Executors?

a)

Выполняют задачи, назначенные Driver-ом, и хранят кэшированные результаты

b)

Координируют другие кластеры

c)

Запускают Spark Session

d)

Управляют ресурсами

e)

Формируют RDD

15.

Что означает RDD в Apache Spark?

a)

Resilient Distributed Dataset — устойчивый распределённый набор данных

b)

Random Data Distribution

c)

Replicated Data Driver

d)

Reduced Data Document

e)

Real Data Dump

16.

Что делает Spark RDD Resilient (устойчивым)?

a)

Возможность восстановления данных с помощью Lineage

b)

Автоматическое шифрование

c)

Репликация каждого блока

d)

Хранение в SQL

e)

Использование GPU

17.

Что означает свойство Immutable у RDD?

a)

Данные нельзя изменить после создания RDD

b)

Данные можно редактировать вручную

c)

Данные удаляются при каждой операции

d)

Данные автоматически перезаписываются

e)

Данные сохраняются только локально

18.

Что такое Lineage в Spark?

a)

История преобразований, которая позволяет восстановить RDD

b)

Имя драйвера приложения

c)

Реплика блоков HDFS

d)

Путь к файлам Hadoop

e)

Таблица логов

19.

Как RDD распределяются в кластерной среде?

a)

Делятся на партиции, распределяемые по узлам

b)

Сохраняются только на одном сервере

c)

Хранятся в SQL-таблице

d)

Реплицируются вручную

e)

Сохраняются в журналах

20.

Что такое DataFrame в Spark?

a)

Таблица данных с именованными столбцами и определённой схемой

b)

Одномерный массив чисел

c)

Кэш-файл RDD

d)

Промежуточная метка

e)

Конфигурационный файл

21.

Чем DataFrame отличается от RDD?

a)

DataFrame имеет схему и оптимизируется Catalyst Optimizer

b)

DataFrame хранит данные без структуры

c)

RDD поддерживает SQL-запросы

d)

DataFrame не поддерживает Spark SQL

e)

DataFrame изменяемый

22.

Что такое Catalyst Optimizer?

a)

Механизм оптимизации выполнения SQL-операций в Spark

b)

Алгоритм сортировки RDD

c)

Система логирования

d)

Планировщик задач YARN

e)

Модуль потоковой обработки

23.

Для каких языков предназначен Dataset API?

a)

Для Scala и Java

b)

Только Python

c)

Для SQL и R

d)

Для JavaScript

e)

Для Go и Rust

24.

В чём преимущество Dataset по сравнению с DataFrame?

a)

Типобезопасность (Type Safety) и проверка ошибок на этапе компиляции

b)

Хранение только числовых данных

c)

Быстрее выполняет I/O

d)

Использует GPU

e)

Поддерживает только SQL

25.

Почему Spark быстрее MapReduce?

a)

Данные хранятся в оперативной памяти, а не на диске

b)

Использует HDFS только для Reduce

c)

Работает на одном сервере

d)

Использует дополнительные компиляторы

e)

Имеет меньше партиций

26.

Что такое Spark Session?

a)

Главная точка входа в приложение Spark для работы с RDD, DataFrame и SQL

b)

Модуль потоковой обработки

c)

Планировщик задач

d)

Резервная копия Driver-а

27.

Что позволяет объединить Spark на одной платформе?

a)

Пакетную, потоковую обработку, машинное обучение и SQL-анализ

b)

Только визуализацию

c)

Только пакетную обработку

d)

Только файловое хранение

e)

Только работу с графами

28.

Какой компонент Spark отвечает за управление ресурсами?

a)

Cluster Manager

b)

Driver Program

c)

Spark Session

d)

Executor

e)

RDD Manager

29.

Какой главный вывод о Spark в сравнении с MapReduce?

a)

Spark устранил зависимость от дискового I/O и стал универсальной платформой для аналитики

b)

Spark работает только с файлами CSV

c)

MapReduce быстрее

d)

Spark не поддерживает кластеризацию

e)

Spark использует только SQL

30.

Что является основным преимуществом Apache Spark по сравнению с другими фреймворками?

a)

Унифицированная архитектура для пакетной, потоковой и аналитической обработки

b)

Работа только с неструктурированными данными

c)

Поддержка исключительно SQL-запросов

d)

Требует отдельный кластер для каждого модуля

e)

Не поддерживает машинное обучение

31.

Какой модуль Spark используется для работы со структурированными данными?

a)

Spark SQL

b)

Spark Core

c)

Spark Streaming

d)

GraphX

e)

MLLib

32.

Какой основной API является центральным в Spark SQL?

a)

DataFrame/Dataset

b)

RDD

c)

JSON API

d)

Table API

e)

JDBC API

33.

Какой оптимизатор используется в Spark SQL для ускорения выполнения запросов?

a)

Catalyst Optimizer

b)

Logical Planner

c)

Spark Query Executor

d)

MapReduce Engine

e)

SQL Booster

34.

Что делает Catalyst Optimizer на этапе анализа?

a)

Разрешает имена столбцов и таблиц

b)

Выполняет агрегацию

c)

Реплицирует данные

d)

Создаёт Spark Context

e)

Делит данные на партиции

35.

Какой формат данных поддерживает Spark SQL?

a)

JSON, Parquet, CSV, JDBC

b)

Только XML

c)

Только бинарные файлы

d)

Только TXT

36.

Для чего лучше всего подходит Spark SQL?

a)

Для ETL-процессов и интерактивного анализа данных

b)

Для визуализации графов

c)

Для потоковой обработки

d)

Для анализа изображений

e)

Для ручного ввода данных

37.

Что представляет собой Spark Streaming?

a)

Модуль для обработки данных в реальном времени на основе микропакетов

b)

Средство визуализации данных

c)

API для SQL-запросов

d)

Компонент для машинного обучения

e)

Средство хранения данных

38.

Какой механизм использует Spark Streaming?

a)

Micro-Batching

b)

Batch Join

c)

Lazy Evaluation

d)

MapReduce

e)

Dynamic Query

39.

Что является основным недостатком Spark Streaming?

a)

Нулевая задержка недостижима из-за микропакетной архитектуры

b)

Отсутствие отказоустойчивости

c)

Не поддерживает JSON

d)

Работает только в локальном режиме

e)

Не имеет SQL-интерфейса

40.

Чем Structured Streaming отличается от Spark Streaming?

a)

Использует ту же модель DataFrame для непрерывной обработки

b)

Работает только с файлами

c)

Не поддерживает SQL-запросы

d)

Требует ручного управления потоками

e)

Не поддерживает Kafka

41.

Что обеспечивает End-to-End Fault Tolerance в Structured Streaming?

a)

Обработка каждого элемента данных ровно один раз (exactly-once)

b)

Репликация узлов

c)

Проверка контрольных сумм

d)

Очистка кэша

e)

Многоуровневая буферизация

42.

Что делает параметр Trigger в Structured Streaming?

a)

Определяет, как часто обновляются результаты потока

b)

Указывает на тип данных

c)

Настраивает уровень параллелизма

d)

Определяет формат вывода данных

43.

Какие источники данных поддерживает Structured Streaming?

a)

Kafka, Kinesis, TCP-сокеты

b)

Только CSV

c)

Только JSON

d)

SQL Server

e)

Google Sheets

44.

Что представляет собой MLlib?

a)

Библиотека машинного обучения для Spark

b)

База данных

c)

Средство визуализации

d)

Модуль потоковой обработки

e)

SQL-парсер

45.

Какое преимущество имеет MLlib перед другими ML-библиотеками?

a)

Масштабируемость и распределенная обработка данных

b)

Только локальная обработка

c)

Только поддержка Python

d)

Отсутствие интеграции с SQL

e)

Использование GPU

46.

Какие типы алгоритмов включает MLlib?

a)

Классификация, регрессия, кластеризация, совместная фильтрация

b)

Сжатие, шифрование, хэширование

c)

Сортировка и агрегация

d)

Только кластеризация

e)

Текстовый анализ

47.

Что делает модуль Feature Engineering в MLlib?

a)

Извлекает признаки и формирует входные данные для моделей

b)

Сжимает данные

c)

Фильтрует потоки

d)

Оптимизирует SQL-запросы

e)

Создает визуализацию

48.

Что представляет собой GraphX?

a)

API для графовых вычислений в Spark

b)

Библиотека машинного обучения

c)

Средство ETL

d)

Среда для SQL-запросов

49.

Из каких структур данных состоит GraphX?

a)

Из вершин и рёбер (графовая модель)

b)

Из DataFrame и SQL

c)

Из таблиц и колонок

d)

Из JSON и Parquet

e)

Из потоков и микробатчей

50.

Какой алгоритм реализован в GraphX для оценки важности вершин?

a)

PageRank

b)

Decision Tree

c)

Linear Regression

d)

Random Forest

e)

Gradient Boosting

51.

Какой алгоритм GraphX используется для поиска кратчайшего пути?

a)

Shortest Path

b)

Longest Path

c)

K-Means

d)

Collaborative Filtering

e)

PCA

52.

Для каких задач чаще всего используется GraphX?

a)

Анализ социальных сетей и связей

b)

Хранение файлов

c)

Потоковая аналитика

d)

Визуализация данных

e)

Кэширование данных

53.

Какой модуль Spark используется для объединения данных из разных источников?

a)

Spark SQL

b)

GraphX

c)

MLlib

d)

Spark Core

e)

Structured Streaming

54.

Какой общий вывод можно сделать об экосистеме Spark?

a)

Spark — единая платформа для пакетной, потоковой, графовой и ML-аналитики

b)

Spark предназначен только для SQL

c)

Spark не поддерживает масштабирование

d)

Spark заменяет Hadoop полностью

e)

Spark ограничен только ETL

55.

Что является основной задачей инструментов интеграции данных в Big Data?

a)

Перемещение и синхронизация данных между источниками и системами хранения

b)

Создание пользовательских интерфейсов

c)

Анализ изображений

d)

Настройка сетей

e)

Хранение резервных копий

56.

Что представляет собой Apache Kafka?

a)

Распределённая платформа для публикации, подписки и обработки потоков данных

b)

Средство визуализации данных

c)

SQL-база данных

d)

Среда для машинного обучения

e)

Система хранения HDFS

57.

Какой тип доставки данных поддерживает Apache Kafka?

a)

Потоковую (Streaming) и пакетную (Batch)

b)

Только пакетную

c)

Только ручную

d)

Только архивную

e)

Только синхронную

58.

Кто является основными участниками в архитектуре Kafka?

a)

Producer, Consumer, Broker

b)

Sender, Receiver, Handler

c)

Reader, Writer, Collector

d)

Publisher, Subscriber, Listener

e)

Mapper, Reducer, Executor

59.

Что такое Topic в Kafka?

a)

Категория потока сообщений, где хранятся записи определённого типа

b)

Локальный файл

c)

Имя кластера

d)

Таблица SQL

e)

Поток в Spark

60.

Что означает Partition в контексте Kafka?

a)

Раздел топика, обеспечивающий параллельную обработку и масштабирование

b)

Архив старых сообщений

c)

Таблица с метаданными

d)

Резервная копия данных

e)

Фильтр сообщений

61.

Какую роль играет Offset в Kafka?

a)

Указывает позицию сообщения в разделе

b)

Определяет тип топика

c)

Устанавливает количество брокеров

d)

Хранит пароли

e)

Указывает размер буфера

62.

Что обеспечивает отказоустойчивость Kafka?

a)

Репликация данных между брокерами

b)

Использование SSD

c)

Архивирование сообщений

d)

Фильтрация по времени

e)

Разделение логов

63.

Как долго Kafka может хранить сообщения?

a)

В течение заданного периода (например, 7 дней)

b)

Только до завершения транзакции

c)

Постоянно без ограничений

d)

Только один день

e)

Пока не закончится память

64.

Что такое Apache NiFi?

a)

Платформа для визуального проектирования и управления потоками данных

b)

Модуль машинного обучения

c)

Средство построения SQL-запросов

d)

Графическая оболочка Spark

e)

API для REST-запросов

65.

Что такое FlowFile в NiFi?

a)

Единица данных с содержимым и атрибутами, проходящая через конвейер

b)

SQL-таблица

c)

Файл настроек

d)

Поток Kafka

e)

Список брокеров

66.

Из чего состоит FlowFile?

a)

Из содержимого и набора атрибутов

b)

Из пар ключ-значение

c)

Из одной строки текста

d)

Только из метаданных

e)

Только из данных

67.

Что делает Processor в Apache NiFi?

a)

Выполняет операции чтения, преобразования или записи данных

b)

Управляет пользователями

c)

Настраивает брокеры

d)

Хранит логи

e)

Отправляет уведомления

68.

Для чего используется Connection в NiFi?

a)

Для передачи данных между процессорами

b)

Для хранения данных

c)

Для настройки доступа

d)

Для мониторинга CPU

e)

Для кэширования файлов

69.

Что обеспечивает Data Provenance в NiFi?

a)

Отслеживание и аудит всех изменений данных

b)

Сжатие данных

c)

Шифрование сообщений

d)

Контроль пользователей

e)

Репликацию файлов

70.

Какое преимущество даёт визуальный интерфейс NiFi?

a)

Упрощает проектирование и управление потоками данных

b)

Создаёт SQL-запросы

c)

Выполняет машинное обучение

d)

Анализирует графы

e)

Хранит данные в JSON

71.

Что делает механизм Backpressure в NiFi?

a)

Регулирует поток данных, чтобы избежать перегрузки системы

b)

Увеличивает скорость потока

c)

Фильтрует данные

d)

Удаляет старые записи

e)

Создаёт копии файлов

72.

Что означает ETL?

a)

Extract, Transform, Load

b)

Execute, Transfer, Link

c)

Extend, Translate, Learn

d)

Expand, Track, List

e)

Edit, Transfer, Launch

73.

Что делает стадия Extract в ETL?

a)

Извлекает данные из исходных источников

b)

Сжимает данные

c)

Анализирует данные

d)

Архивирует файлы

e)

Объединяет таблицы

74.

Что делает стадия Transform в ETL?

a)

Преобразует, очищает и нормализует данные

b)

Загружает данные в хранилище

c)

Архивирует файлы

d)

Делит данные на блоки

e)

Выполняет SQL-запросы

75.

Что делает стадия Load в ETL?

a)

Загружает обработанные данные в целевое хранилище

b)

Удаляет старые данные

c)

Проверяет целостность

d)

Реплицирует записи

e)

Извлекает данные из API

76.

Чем ELT отличается от ETL?

a)

Трансформация выполняется после загрузки данных

b)

Трансформация выполняется до извлечения

c)

ELT не поддерживает большие данные

d)

ELT требует ручного ввода

e)

ELT не использует Spark

77.

Почему ELT эффективнее для Big Data?

a)

Использует распределённые вычислительные системы, такие как Spark

b)

Работает только с малыми данными

c)

Не сохраняет исходные данные

d)

Не использует параллельные операции

e)

Требует ручного преобразования

78.

Что делает Apache Spark в ELT?

a)

Выполняет распределённое преобразование данных в хранилище

b)

Хранит данные в HDFS

c)

Генерирует визуализации

d)

Контролирует пользователей

e)

Удаляет исходные данные

79.

Какой главный вывод лекции?

a)

Kafka, NiFi и ELT образуют основу современной интеграции данных в Big Data

b)

Только Kafka используется в Big Data

c)

ETL полностью заменён SQL

d)

NiFi не применяется для потоков данных

e)

ELT используется только для резервного копирования

80.

Какова основная цель анализа больших данных?

a)

Извлечение знаний и закономерностей для принятия решений

b)

Архивирование информации

c)

Сжатие данных

d)

Хранение файлов в облаке

e)

Визуализация без анализа

81.

Сколько основных типов аналитики выделяется в анализе больших данных?

a)

Четыре

b)

Три

c)

Пять

d)

Два

e)

Шесть

82.

Что изучает дескриптивная аналитика?

a)

Что произошло в прошлом

b)

Почему это произошло

c)

Что произойдет

d)

Как действовать

e)

Как оптимизировать процесс

83.

Какова цель диагностической аналитики?

a)

Определить причины произошедших событий

b)

Прогнозировать будущее

c)

Создавать визуализации

d)

Хранить данные

e)

Настроить модели

84.

Какова основная цель предиктивной аналитики?

a)

Прогнозировать, что вероятно произойдет

b)

Описать исторические данные

c)

Найти ошибки

d)

Удалить шум

e)

Проанализировать прошлое

85.

Какой тип аналитики предлагает решения для оптимизации будущих действий?

a)

Предписывающая (Prescriptive)

b)

Дескриптивная

c)

Диагностическая

d)

Предиктивная

e)

Регрессионная

86.

Какой инструмент используется в Spark для реализации машинного обучения?

a)

MLlib

b)

Spark SQL

c)

DataFrames

d)

RDDs

87.

Что такое Spark MLlib?

a)

MLlib

b)

Hive

c)

Kafka

d)

NiFi

e)

MapReduce

88.

Что означает термин "Pipeline" в Spark MLlib?

a)

Конвейер, связывающий этапы обработки и обучения модели

b)

Поток данных из Kafka

c)

Система хранения данных

d)

Инструмент для ETL

e)

Таблица SQL

89.

Из каких компонентов состоит ML Pipeline?

a)

Transformers и Estimators

b)

Tables и Rows

c)

Input и Output

d)

Keys и Values

e)

Blocks и Records

90.

Что делает Estimator в MLlib?

a)

Обучается на данных и создает Transformer

b)

Сохраняет результаты в HDFS

c)

Отображает графики

d)

Сжимает данные

e)

Удаляет выбросы

91.

Что делает Transformer в MLlib?

a)

Преобразует DataFrame и применяет модель к новым данным

b)

Обучает модель

c)

Выполняет SQL-запрос

d)

Настраивает кластер

e)

Разбивает данные на блоки

92.

Какой тип задач решает классификация?

a)

Определение категориального класса для входных данных

b)

Прогнозирование числового значения

c)

Группировка данных

93.

Какой алгоритм используется для бинарной классификации в MLlib?

a)

Логистическая регрессия

b)

Линейная регрессия

c)

K-Means

d)

PCA

e)

Random Projection

94.

Какие алгоритмы применяются как к классификации, так и к регрессии?

a)

Деревья решений

b)

K-Means

c)

DBSCAN

d)

Naive Bayes

e)

SVM

95.

Что делает алгоритм линейной регрессии?

a)

Предсказывает числовые значения на основе линейных зависимостей

b)

Делит данные на группы

c)

Определяет категорию

d)

Удаляет шум

e)

Измеряет расстояния

96.

Какой тип задачи решает кластеризация?

a)

Обнаружение скрытых групп и структур в данных

b)

Прогнозирование категорий

c)

Оптимизация маршрутов

d)

Хранение файлов

e)

Обработка транзакций

97.

Какой алгоритм чаще всего используется для кластеризации?

a)

K-Means

b)

Random Forest

c)

Logistic Regression

d)

Decision Tree

e)

Linear Regression

98.

Что означает "распределённое обучение" в Spark MLlib?

a)

Обучение моделей с распределением вычислений по узлам кластера

b)

Локальная обработка

c)

Только потоковая обработка

d)

Визуализация моделей

e)

Создание таблиц