WorksheetsХОБД 2
Total questions: 98
Worksheet time: 49mins
Почему Spark быстрее MapReduce?
Выполняет вычисления в оперативной памяти (In-Memory Computing)
Не использует HDFS
Работает на одном сервере
Не требует Reduce
Использует только Java
Что является основной функцией JobTracker в старых версиях Hadoop?
Координация выполнения задач Map и Reduce
Управление хранилищем данных
Анализ логов
Сжатие файлов
Мониторинг пользователей
Какое свойство MapReduce обеспечивает масштабируемость?
Возможность добавления новых узлов без изменения логики программы
Централизованное управление
Использование одной машины
Отсутствие репликации
Механизм блокировок
Какой главный вывод можно сделать о MapReduce?
Это фундаментальная технология, заложившая основу современных систем Big Data
Это язык запросов SQL
Это формат хранения данных
Это интерфейс для визуализации
Это система резервного копирования
Когда был разработан фреймворк Apache Spark?
В 2009 году в Калифорнийском университете в Беркли
В 2003 году в MIT
В 2012 году компанией Google
В 2008 году в Amazon Lab
В 2010 году корпорацией Oracle
Какая основная цель создания Apache Spark?
Обеспечить быструю и гибкую обработку данных в оперативной памяти
Хранить данные в SQL-таблицах
Заменить HDFS
Ускорить работу браузеров
Снизить нагрузку на CPU
Какое основное ограничение имел MapReduce?
Необходимость записи и чтения промежуточных данных на диск
Отсутствие распределённости
Невозможность пакетной обработки
Ошибки в алгоритмах Reduce
Неиспользование памяти
Почему MapReduce неэффективен для итеративных алгоритмов?
Из-за постоянных операций Disk I/O между итерациями
Из-за недостатка памяти
Из-за высокой нагрузки на CPU
Из-за синтаксических ошибок
Из-за отсутствия кластеров
Какой тип обработки не поддерживает MapReduce?
Потоковую обработку данных
Пакетную обработку
SQL-запросы
Параллельную сортировку
Архивацию данных
Что представляет собой Apache Spark?
Фреймворк для быстрой обработки больших данных в оперативной памяти
База данных
Язык программирования
Система хранения файлов
Графическая среда анализа
Какие компоненты входят в архитектуру Spark?
Driver, Cluster Manager и Executors
Mapper, Reducer и Scheduler
Master, Slave и Coordinator
DataNode и NameNode
SQL, ML и Stream модули
Что делает Driver Program в Spark?
Управляет выполнением задач и планирует их на кластер
Хранит данные в HDFS
Выполняет функции Map и Reduce
Только собирает статистику
Работает как бэкап
За что отвечает Cluster Manager в Spark?
За распределение ресурсов CPU и памяти между приложениями
За распределение данных по узлам
За хранение RDD
За создание SQL-таблиц
Какую роль выполняют Executors?
Выполняют задачи, назначенные Driver-ом, и хранят кэшированные результаты
Координируют другие кластеры
Запускают Spark Session
Управляют ресурсами
Формируют RDD
Что означает RDD в Apache Spark?
Resilient Distributed Dataset — устойчивый распределённый набор данных
Random Data Distribution
Replicated Data Driver
Reduced Data Document
Real Data Dump
Что делает Spark RDD Resilient (устойчивым)?
Возможность восстановления данных с помощью Lineage
Автоматическое шифрование
Репликация каждого блока
Хранение в SQL
Использование GPU
Что означает свойство Immutable у RDD?
Данные нельзя изменить после создания RDD
Данные можно редактировать вручную
Данные удаляются при каждой операции
Данные автоматически перезаписываются
Данные сохраняются только локально
Что такое Lineage в Spark?
История преобразований, которая позволяет восстановить RDD
Имя драйвера приложения
Реплика блоков HDFS
Путь к файлам Hadoop
Таблица логов
Как RDD распределяются в кластерной среде?
Делятся на партиции, распределяемые по узлам
Сохраняются только на одном сервере
Хранятся в SQL-таблице
Реплицируются вручную
Сохраняются в журналах
Что такое DataFrame в Spark?
Таблица данных с именованными столбцами и определённой схемой
Одномерный массив чисел
Кэш-файл RDD
Промежуточная метка
Конфигурационный файл
Чем DataFrame отличается от RDD?
DataFrame имеет схему и оптимизируется Catalyst Optimizer
DataFrame хранит данные без структуры
RDD поддерживает SQL-запросы
DataFrame не поддерживает Spark SQL
DataFrame изменяемый
Что такое Catalyst Optimizer?
Механизм оптимизации выполнения SQL-операций в Spark
Алгоритм сортировки RDD
Система логирования
Планировщик задач YARN
Модуль потоковой обработки
Для каких языков предназначен Dataset API?
Для Scala и Java
Только Python
Для SQL и R
Для JavaScript
Для Go и Rust
В чём преимущество Dataset по сравнению с DataFrame?
Типобезопасность (Type Safety) и проверка ошибок на этапе компиляции
Хранение только числовых данных
Быстрее выполняет I/O
Использует GPU
Поддерживает только SQL
Почему Spark быстрее MapReduce?
Данные хранятся в оперативной памяти, а не на диске
Использует HDFS только для Reduce
Работает на одном сервере
Использует дополнительные компиляторы
Имеет меньше партиций
Что такое Spark Session?
Главная точка входа в приложение Spark для работы с RDD, DataFrame и SQL
Модуль потоковой обработки
Планировщик задач
Резервная копия Driver-а
Что позволяет объединить Spark на одной платформе?
Пакетную, потоковую обработку, машинное обучение и SQL-анализ
Только визуализацию
Только пакетную обработку
Только файловое хранение
Только работу с графами
Какой компонент Spark отвечает за управление ресурсами?
Cluster Manager
Driver Program
Spark Session
Executor
RDD Manager
Какой главный вывод о Spark в сравнении с MapReduce?
Spark устранил зависимость от дискового I/O и стал универсальной платформой для аналитики
Spark работает только с файлами CSV
MapReduce быстрее
Spark не поддерживает кластеризацию
Spark использует только SQL
Что является основным преимуществом Apache Spark по сравнению с другими фреймворками?
Унифицированная архитектура для пакетной, потоковой и аналитической обработки
Работа только с неструктурированными данными
Поддержка исключительно SQL-запросов
Требует отдельный кластер для каждого модуля
Не поддерживает машинное обучение
Какой модуль Spark используется для работы со структурированными данными?
Spark SQL
Spark Core
Spark Streaming
GraphX
MLLib
Какой основной API является центральным в Spark SQL?
DataFrame/Dataset
RDD
JSON API
Table API
JDBC API
Какой оптимизатор используется в Spark SQL для ускорения выполнения запросов?
Catalyst Optimizer
Logical Planner
Spark Query Executor
MapReduce Engine
SQL Booster
Что делает Catalyst Optimizer на этапе анализа?
Разрешает имена столбцов и таблиц
Выполняет агрегацию
Реплицирует данные
Создаёт Spark Context
Делит данные на партиции
Какой формат данных поддерживает Spark SQL?
JSON, Parquet, CSV, JDBC
Только XML
Только бинарные файлы
Только TXT
Для чего лучше всего подходит Spark SQL?
Для ETL-процессов и интерактивного анализа данных
Для визуализации графов
Для потоковой обработки
Для анализа изображений
Для ручного ввода данных
Что представляет собой Spark Streaming?
Модуль для обработки данных в реальном времени на основе микропакетов
Средство визуализации данных
API для SQL-запросов
Компонент для машинного обучения
Средство хранения данных
Какой механизм использует Spark Streaming?
Micro-Batching
Batch Join
Lazy Evaluation
MapReduce
Dynamic Query
Что является основным недостатком Spark Streaming?
Нулевая задержка недостижима из-за микропакетной архитектуры
Отсутствие отказоустойчивости
Не поддерживает JSON
Работает только в локальном режиме
Не имеет SQL-интерфейса
Чем Structured Streaming отличается от Spark Streaming?
Использует ту же модель DataFrame для непрерывной обработки
Работает только с файлами
Не поддерживает SQL-запросы
Требует ручного управления потоками
Не поддерживает Kafka
Что обеспечивает End-to-End Fault Tolerance в Structured Streaming?
Обработка каждого элемента данных ровно один раз (exactly-once)
Репликация узлов
Проверка контрольных сумм
Очистка кэша
Многоуровневая буферизация
Что делает параметр Trigger в Structured Streaming?
Определяет, как часто обновляются результаты потока
Указывает на тип данных
Настраивает уровень параллелизма
Определяет формат вывода данных
Какие источники данных поддерживает Structured Streaming?
Kafka, Kinesis, TCP-сокеты
Только CSV
Только JSON
SQL Server
Google Sheets
Что представляет собой MLlib?
Библиотека машинного обучения для Spark
База данных
Средство визуализации
Модуль потоковой обработки
SQL-парсер
Какое преимущество имеет MLlib перед другими ML-библиотеками?
Масштабируемость и распределенная обработка данных
Только локальная обработка
Только поддержка Python
Отсутствие интеграции с SQL
Использование GPU
Какие типы алгоритмов включает MLlib?
Классификация, регрессия, кластеризация, совместная фильтрация
Сжатие, шифрование, хэширование
Сортировка и агрегация
Только кластеризация
Текстовый анализ
Что делает модуль Feature Engineering в MLlib?
Извлекает признаки и формирует входные данные для моделей
Сжимает данные
Фильтрует потоки
Оптимизирует SQL-запросы
Создает визуализацию
Что представляет собой GraphX?
API для графовых вычислений в Spark
Библиотека машинного обучения
Средство ETL
Среда для SQL-запросов
Из каких структур данных состоит GraphX?
Из вершин и рёбер (графовая модель)
Из DataFrame и SQL
Из таблиц и колонок
Из JSON и Parquet
Из потоков и микробатчей
Какой алгоритм реализован в GraphX для оценки важности вершин?
PageRank
Decision Tree
Linear Regression
Random Forest
Gradient Boosting
Какой алгоритм GraphX используется для поиска кратчайшего пути?
Shortest Path
Longest Path
K-Means
Collaborative Filtering
PCA
Для каких задач чаще всего используется GraphX?
Анализ социальных сетей и связей
Хранение файлов
Потоковая аналитика
Визуализация данных
Кэширование данных
Какой модуль Spark используется для объединения данных из разных источников?
Spark SQL
GraphX
MLlib
Spark Core
Structured Streaming
Какой общий вывод можно сделать об экосистеме Spark?
Spark — единая платформа для пакетной, потоковой, графовой и ML-аналитики
Spark предназначен только для SQL
Spark не поддерживает масштабирование
Spark заменяет Hadoop полностью
Spark ограничен только ETL
Что является основной задачей инструментов интеграции данных в Big Data?
Перемещение и синхронизация данных между источниками и системами хранения
Создание пользовательских интерфейсов
Анализ изображений
Настройка сетей
Хранение резервных копий
Что представляет собой Apache Kafka?
Распределённая платформа для публикации, подписки и обработки потоков данных
Средство визуализации данных
SQL-база данных
Среда для машинного обучения
Система хранения HDFS
Какой тип доставки данных поддерживает Apache Kafka?
Потоковую (Streaming) и пакетную (Batch)
Только пакетную
Только ручную
Только архивную
Только синхронную
Кто является основными участниками в архитектуре Kafka?
Producer, Consumer, Broker
Sender, Receiver, Handler
Reader, Writer, Collector
Publisher, Subscriber, Listener
Mapper, Reducer, Executor
Что такое Topic в Kafka?
Категория потока сообщений, где хранятся записи определённого типа
Локальный файл
Имя кластера
Таблица SQL
Поток в Spark
Что означает Partition в контексте Kafka?
Раздел топика, обеспечивающий параллельную обработку и масштабирование
Архив старых сообщений
Таблица с метаданными
Резервная копия данных
Фильтр сообщений
Какую роль играет Offset в Kafka?
Указывает позицию сообщения в разделе
Определяет тип топика
Устанавливает количество брокеров
Хранит пароли
Указывает размер буфера
Что обеспечивает отказоустойчивость Kafka?
Репликация данных между брокерами
Использование SSD
Архивирование сообщений
Фильтрация по времени
Разделение логов
Как долго Kafka может хранить сообщения?
В течение заданного периода (например, 7 дней)
Только до завершения транзакции
Постоянно без ограничений
Только один день
Пока не закончится память
Что такое Apache NiFi?
Платформа для визуального проектирования и управления потоками данных
Модуль машинного обучения
Средство построения SQL-запросов
Графическая оболочка Spark
API для REST-запросов
Что такое FlowFile в NiFi?
Единица данных с содержимым и атрибутами, проходящая через конвейер
SQL-таблица
Файл настроек
Поток Kafka
Список брокеров
Из чего состоит FlowFile?
Из содержимого и набора атрибутов
Из пар ключ-значение
Из одной строки текста
Только из метаданных
Только из данных
Что делает Processor в Apache NiFi?
Выполняет операции чтения, преобразования или записи данных
Управляет пользователями
Настраивает брокеры
Хранит логи
Отправляет уведомления
Для чего используется Connection в NiFi?
Для передачи данных между процессорами
Для хранения данных
Для настройки доступа
Для мониторинга CPU
Для кэширования файлов
Что обеспечивает Data Provenance в NiFi?
Отслеживание и аудит всех изменений данных
Сжатие данных
Шифрование сообщений
Контроль пользователей
Репликацию файлов
Какое преимущество даёт визуальный интерфейс NiFi?
Упрощает проектирование и управление потоками данных
Создаёт SQL-запросы
Выполняет машинное обучение
Анализирует графы
Хранит данные в JSON
Что делает механизм Backpressure в NiFi?
Регулирует поток данных, чтобы избежать перегрузки системы
Увеличивает скорость потока
Фильтрует данные
Удаляет старые записи
Создаёт копии файлов
Что означает ETL?
Extract, Transform, Load
Execute, Transfer, Link
Extend, Translate, Learn
Expand, Track, List
Edit, Transfer, Launch
Что делает стадия Extract в ETL?
Извлекает данные из исходных источников
Сжимает данные
Анализирует данные
Архивирует файлы
Объединяет таблицы
Что делает стадия Transform в ETL?
Преобразует, очищает и нормализует данные
Загружает данные в хранилище
Архивирует файлы
Делит данные на блоки
Выполняет SQL-запросы
Что делает стадия Load в ETL?
Загружает обработанные данные в целевое хранилище
Удаляет старые данные
Проверяет целостность
Реплицирует записи
Извлекает данные из API
Чем ELT отличается от ETL?
Трансформация выполняется после загрузки данных
Трансформация выполняется до извлечения
ELT не поддерживает большие данные
ELT требует ручного ввода
ELT не использует Spark
Почему ELT эффективнее для Big Data?
Использует распределённые вычислительные системы, такие как Spark
Работает только с малыми данными
Не сохраняет исходные данные
Не использует параллельные операции
Требует ручного преобразования
Что делает Apache Spark в ELT?
Выполняет распределённое преобразование данных в хранилище
Хранит данные в HDFS
Генерирует визуализации
Контролирует пользователей
Удаляет исходные данные
Какой главный вывод лекции?
Kafka, NiFi и ELT образуют основу современной интеграции данных в Big Data
Только Kafka используется в Big Data
ETL полностью заменён SQL
NiFi не применяется для потоков данных
ELT используется только для резервного копирования
Какова основная цель анализа больших данных?
Извлечение знаний и закономерностей для принятия решений
Архивирование информации
Сжатие данных
Хранение файлов в облаке
Визуализация без анализа
Сколько основных типов аналитики выделяется в анализе больших данных?
Четыре
Три
Пять
Два
Шесть
Что изучает дескриптивная аналитика?
Что произошло в прошлом
Почему это произошло
Что произойдет
Как действовать
Как оптимизировать процесс
Какова цель диагностической аналитики?
Определить причины произошедших событий
Прогнозировать будущее
Создавать визуализации
Хранить данные
Настроить модели
Какова основная цель предиктивной аналитики?
Прогнозировать, что вероятно произойдет
Описать исторические данные
Найти ошибки
Удалить шум
Проанализировать прошлое
Какой тип аналитики предлагает решения для оптимизации будущих действий?
Предписывающая (Prescriptive)
Дескриптивная
Диагностическая
Предиктивная
Регрессионная
Какой инструмент используется в Spark для реализации машинного обучения?
MLlib
Spark SQL
DataFrames
RDDs
Что такое Spark MLlib?
MLlib
Hive
Kafka
NiFi
MapReduce
Что означает термин "Pipeline" в Spark MLlib?
Конвейер, связывающий этапы обработки и обучения модели
Поток данных из Kafka
Система хранения данных
Инструмент для ETL
Таблица SQL
Из каких компонентов состоит ML Pipeline?
Transformers и Estimators
Tables и Rows
Input и Output
Keys и Values
Blocks и Records
Что делает Estimator в MLlib?
Обучается на данных и создает Transformer
Сохраняет результаты в HDFS
Отображает графики
Сжимает данные
Удаляет выбросы
Что делает Transformer в MLlib?
Преобразует DataFrame и применяет модель к новым данным
Обучает модель
Выполняет SQL-запрос
Настраивает кластер
Разбивает данные на блоки
Какой тип задач решает классификация?
Определение категориального класса для входных данных
Прогнозирование числового значения
Группировка данных
Какой алгоритм используется для бинарной классификации в MLlib?
Логистическая регрессия
Линейная регрессия
K-Means
PCA
Random Projection
Какие алгоритмы применяются как к классификации, так и к регрессии?
Деревья решений
K-Means
DBSCAN
Naive Bayes
SVM
Что делает алгоритм линейной регрессии?
Предсказывает числовые значения на основе линейных зависимостей
Делит данные на группы
Определяет категорию
Удаляет шум
Измеряет расстояния
Какой тип задачи решает кластеризация?
Обнаружение скрытых групп и структур в данных
Прогнозирование категорий
Оптимизация маршрутов
Хранение файлов
Обработка транзакций
Какой алгоритм чаще всего используется для кластеризации?
K-Means
Random Forest
Logistic Regression
Decision Tree
Linear Regression
Что означает "распределённое обучение" в Spark MLlib?
Обучение моделей с распределением вычислений по узлам кластера
Локальная обработка
Только потоковая обработка
Визуализация моделей
Создание таблиц
