WorksheetsBig Data
Total questions: 61
Worksheet time: 31mins
Что такое большие данные (Big Data)?
A) Небольшие структурированные таблицы
B) Наборы данных, характеризующиеся большим объемом, скоростью и разнообразием
C) Архивные данные
D) Только числовые данные
Что такое технологический стек Big Data?
A) Один язык программирования
B) Набор технологий для хранения, обработки и анализа больших данных
C) Операционная система
D) Тип базы данных
Что такое хранилище данных?
A) Файл на компьютере
B) Система для централизованного хранения и анализа данных
C) Текстовый редактор
D) Архив логов
4. Что такое Hadoop?
A) Язык программирования
B) СУБД
C) Фреймворк для распределенного хранения и обработки данных
D) Операционная система
Что такое HDFS?
A) СУБД
B) Распределенная файловая система Hadoop
C) Язык запросов
D) Протокол передачи данных
Что такое потоковая обработка данных?
A) Обработка данных раз в месяц
B) Обработка данных в реальном времени
C) Архивирование данных
D) Ручной анализ
Что такое Apache Kafka?
A) База данных
B) Язык программирования
C) Платформа для распределенной передачи сообщений
D) Веб-сервер
Основные свойства Big Data:
A) Табличность, простота
B) Volume, Velocity, Variety
C) Только объем
D) Безопасность и доступность
Компоненты стека Big Data
A) Word, Excel
B) Hadoop, Spark, Kafka, Hive
C) Photoshop, Illustrator
D) Windows, Linux
Типы хранилищ данных:
A) Только реляционные
B) Data Warehouse и Data Lake
C) Только файлы
D) Только NoSQL
Компоненты Hadoop:
A) Spark, Kafka
B) HDFS, YARN, MapReduce
C) MySQL, PostgreSQL
D) Linux, Windows
Этапы MapReduce:
A) Load → Save
B) Map → Shuffle → Reduce
C) Read → Write
D) Input → Output
Компоненты Apache Spark:
A) HDFS, YARN
B) Spark Core, SQL, Streaming, MLlib
C) Kafka, Zookeeper
D) Hive, Pig
Типы потоковой обработки:
A) Только пакетная
B) Event-driven и micro-batch
C) Только офлайн
D) Архивная
Элементы Kafka:
A) Таблицы
B) Producer, Broker, Consumer, Topic
C) Map, Reduce
D) Executor, Driver
Функции Hive:
A) Потоковая обработка
B) SQL-подобные запросы к данным в Hadoop
C) Передача сообщений
D) Машинное обучение
Операции Pig Latin:
A) SELECT, INSERT
B) LOAD, FILTER, GROUP, FOREACH
C) MAP, REDUCE
D) SEND, RECEIVE
Способы обработки реального времени:
A) Пакетная
B) Ручная
C) Потоковая
D) Архивная
Методы машинного обучения в Big Data:
A) Только ручной анализ
B) Классификация, кластеризация, регрессия
C) Архивация
D) Шифрование
Угрозы безопасности Big Data:
A) Переполнение памяти
B) Утечки данных и несанкционированный доступ
C) Медленная сеть
D) Ошибки пользователя
Что такое MapReduce?
A) СУБД
B) Модель распределенной обработки данных
C) Язык запросов
D) Файловая система
Что такое RDD?
A) Таблица
B) Распределенная неизменяемая коллекция данных в Spark
C) Файл
D) Поток сообщений
Что такое Spark Streaming?
A) Архив данных
B) Модуль Spark для потоковой обработки
C) СУБД
D) Брокер сообщений
Что такое Kafka topic?
A) Сервер
B) Категория для хранения сообщений
C) Пользователь
D) Процесс
Что такое Hive?
A) Брокер сообщений
B) Система аналитических запросов поверх Hadoop
C) Язык программирования
D) СУБД реального времени
Что такое Apache Pig?
A) СУБД
B) Инструмент для анализа данных на Hadoop
C) Файловая система
D) Очередь сообщений
Что такое оптимизация данных?
A) Удаление данных
B) Повышение производительности обработки
C) Архивирование
D) Сжатие файлов
Разница Data Warehouse и Data Lake:
A) Нет разницы
B) DW — структурированные данные, DL — любые данные
C) DL быстрее
D) DW дешевле
Распределенное хранение в HDFS означает:
A) Хранение в одном месте
B) Хранение данных на нескольких узлах
C) Только в облаке
D) В оперативной памяти
Параллельность MapReduce:
A) Один процесс
B) Выполнение задач на разных узлах одновременно
C) Ручное управление
D) Последовательная обработка
В чём заключается параллельность MapReduce?
Выполнение одной задачи последовательно
B) Использование одного сервера
C) Одновременная обработка данных на нескольких узлах
D) Ручное распределение задач
Какова роль driver и executors в Spark?
Executors управляют приложением
Driver хранит данные
Driver и executors не связаны
Driver управляет задачами, executors выполняют вычисления
В чём отличие потоковой обработки от пакетной?
Пакетная быстрее
Потоковая работает только с файлами
Потоковая требует ручного запуска
Потоковая обрабатывает данные в реальном времени
Какую гарантию доставки сообщений поддерживает Kafka?
Только at most once
Без гарантий доставки
Только exactly once
At least once и exactly once
Основное преимущество Hive:
Высокая скорость транзакций
Потоковая обработка
SQL-подобные запросы к данным в Hadoop
Работа только с малыми данными
Почему безопасность Big Data важна?
Из-за высокой стоимости серверов
Для защиты конфиденциальных и корпоративных данных
Для ускорения вычислений
Только для государственных систем
Какой пример является классической задачей MapReduce?
Подсчёт количества слов в тексте
Хранение файлов
Анализ потокового видео
Передача сообщений
Как создаётся RDD в Spark?
CREATE RDD
LOAD DATA
sc.parallelize(коллекция)
SELECT *
Как выглядит корректный Hive-запрос?
map(data)
print table
send message
SELECT * FROM users;
Пример корректной команды Pig Latin:
INSERT INTO table
A = LOAD 'data';
SELECT ALL
LOAD FILE
Какой параметр используется в конфигурации Kafka producer?
fs.defaultFS
executor.memory
yarn.resourcemanager
bootstrap.servers
Пример использования Spark Streaming:
Создание отчёта раз в месяц
Архивирование логов
Обработка данных из Kafka в реальном времени
Работа с Excel
Как можно оптимизировать хранение данных в HDFS?
Уменьшить размер блоков
Отключить репликацию
Использовать сжатие данных
Использовать только один DataNode
Какой метод улучшает производительность MapReduce?
Увеличение входных файлов
Удаление Reduce-фазы
Отключение shuffle
Использование combiner
Корректная архитектура Spark-приложения:
Один сервер и база данных
Producer и Consumer
Driver, Cluster Manager, Executors
Master и Slave без управления
Какие методы применяются для защиты Hadoop?
Архивация данных
Сжатие файлов
Репликация блоков
Kerberos, ACL, шифрование
Как оптимизировать работу Hive?
Использовать только CSV
Уменьшить количество данных
Партиционирование и бакетирование
Ручная обработка
Как повышается отказоустойчивость Kafka?
Использованием одного брокера
Уменьшением количества сообщений
Очисткой логов
Репликацией партиций
Что помогает оптимизировать real-time обработку?
Kafka и Spark Streaming
Архивирование
Использование SQL-отчётов
Пакетная обработка
Какая архитектура используется в Hadoop?
Клиент–клиент
Peer-to-peer
Монолитная
Master–Slave
Корректный жизненный цикл MapReduce:
Read → Write
Split → Map → Shuffle → Reduce → Output
Create → Delete
Load → Save
Из каких компонентов состоит HDFS?
Producer и Consumer
Driver и Executor
Broker и Topic
NameNode и DataNode
Основные элементы архитектуры Spark:
Только executors
Broker и сервер
Driver, Executors, Cluster Manager
Master и Worker без управления
Как Spark Streaming обрабатывает данные?
Только последовательно
Только офлайн
Непрерывным SQL-запросом
В виде микропакетов
Основная функция Apache Kafka:
Хранение таблиц
Выполнение SQL-запросов
Передача сообщений между системами
Хранение файлов
Где применяется машинное обучение в Big Data?
Анализ, прогнозирование, рекомендации
Для удаления данных
Для шифрования
Только для резервного копирования
Что включает безопасность больших данных?
Только пароли
Аутентификацию, авторизацию, шифрование
Репликацию
Индексацию
Основная проблема оптимизации Big Data:
Малый объём данных
Простота обработки
Высокая ресурсоёмкость и задержки
Отсутствие инструментов
Как распределённые вычисления влияют на обработку данных?
Замедляют процесс
Увеличивают ошибки
Делают анализ невозможным
Ускоряют обработку больших объёмов данных
Главное преимущество Spark по сравнению с MapReduce:
Меньший размер кода
Обработка данных в памяти
Простота установки
Отсутствие памяти
Основная перспектива развития Big Data:
Отказ от аналитики
Снижение интереса
Рост интеграции с ИИ и машинным обучением
Использование только архивов
