Font size
WorksheetsХОБД 1
Total questions: 97
Worksheet time: 49mins
Что означает термин Big Data?
Совокупность огромных, быстро поступающих и разнообразных данных, требующих новых методов обработки
Малые объемы структурированных данных
Только числовые данные из таблиц
Программа для анализа данных
Тип файловой системы
Какие три характеристики составляют классическую модель Big Data?
Volume, Velocity, Variety
Value, Verification, Visualization
Vector, Volume, Vision
Validity, Value, Verification
Volume, Variance, View
Что обозначает характеристика Volume в модели 5V?
Объем данных, измеряемый в тера-, пета- и эксабайтах
Скорость поступления данных
Надежность и качество информации
Ценность данных для бизнеса
Формат хранения данных
Какая характеристика модели 5V отвечает за скорость обработки данных?
Velocity
Variety
Volume
Veracity
Value
Что означает Variety в контексте Big Data?
Разнообразие форматов данных
Объем хранимых данных
Ценность данных
Скорость передачи информации
Качество анализа
К какой категории данных относятся JSON и XML файлы?
Полуструктурированные данные
Структурированные данные
Неструктурированные данные
Транзакционные данные
Социальные данные
Какой тип данных включает изображения, видео и текстовые документы?
Неструктурированные данные
Структурированные данные
Полуструктурированные данные
Транзакционные данные
Социальные данные
Что означает Veracity в модели 5V?
Надежность и точность данных
Скорость обработки данных
Количество источников данных
Тип данных
Сложность модели
Какое «V» отражает ценность данных для бизнеса?
Value
Volume
Veracity
Variety
Velocity
Какие три основные группы источников Big Data выделяются?
Социальные, машинно-генерируемые, транзакционные
Географические, биологические, экономические
Сетевые, аудио, визуальные
Коммерческие, научные, государственные
Публичные, частные, смешанные
Примером социальных данных являются:
Социальные сети, блоги и форумы
Финансовые отчеты
GPS-координаты
Сенсорные показания
Журналы транзакций
К машинно-генерируемым данным относятся:
Данные IoT-сенсоров, GPS и серверные логи
Комментарии пользователей
Финансовые операции
Данные из CRM
Электронные письма
Что относится к транзакционным данным?
Записи о покупках, остатки на складе, операции e-commerce
Посты в соцсетях
Температура с датчиков
Серверные логи
Какая проблема связана с масштабированием Big Data?
Ограничения традиционных СУБД
Отсутствие текстовых данных
Невозможность хранения малых объемов
Избыточное дублирование информации
Сложность визуализации
Какая технология решает проблему масштабирования Big Data?
Распределенные файловые системы (HDFS) и параллельные вычисления (Spark, MapReduce)
Excel и Access
HTML и CSS
VPN и Firewall
GPS и RFID
Какой пример из IT-индустрии иллюстрирует использование Spark для анализа данных?
Netflix анализирует поведение пользователей с помощью кластеров Spark
Google использует Spark для поиска
Facebook применяет Spark для загрузки видео
Amazon использует Spark для доставки товаров
IBM применяет Spark в Word
Что делает Google в области Big Data аналитики?
Персонализирует результаты поиска и рекламы
Производит только железо
Создает антивирусные программы
Проводит социологические опросы
Использует Big Data только для хранения файлов
Какая проблема относится к управленческому аспекту Big Data?
Безопасность и конфиденциальность данных
Скорость обработки информации
Типизация данных
Формат хранения
Дублирование записей
Что является примером управленческой возможности Big Data?
Принятие решений на основе данных (Data-Driven Decisions)
Увеличение числа пользователей
Повышение скорости интернета
Сокращение сотрудников
Оптимизация рекламы без аналитики
Какое новое направление появилось благодаря Big Data?
Профессии Data Scientist и Data Engineer
Бухгалтерия и аудит
PR и маркетинг
Редактура и журналистика
Тестирование UI
Что является ключевой целью работы с Big Data?
Извлечение ценности и принятие решений на основе данных
Архивирование старых файлов
Увеличение скорости интернета
Создание баз данных без анализа
Хранение структурированных таблиц
Что является примером аналитической проблемы Big Data?
Объединение данных разного типа и точности
Отсутствие памяти
Медленный интернет
Необходимость ручного ввода
Сложность регистрации
Какой пример из IT иллюстрирует использование Big Data для рекламы?
Meta (Facebook) анализирует поведенческие данные для таргетинга рекламы
Netflix хранит фильмы
Spotify транслирует музыку
Twitter пишет новости
Microsoft создает операционные системы
Какая технология чаще всего используется для хранения Big Data?
HDFS (Hadoop Distributed File System)
SQL Server
Excel
PowerPoint
Access
Какой основной вывод можно сделать из концепции Big Data?
Big Data — это новая парадигма, изменившая подход к работе с информацией
Big Data — это просто большие таблицы
Big Data используется только в финансах
Big Data не требует новых технологий
Big Data — это тип аппаратного обеспечения
Что представляет собой Apache Hadoop?
Платформа с открытым исходным кодом для масштабируемой и отказоустойчивой обработки больших данных
Программа для работы с базами данных
Операционная система Linux
Средство визуализации данных
Язык программирования
Какие три основных компонента входят в экосистему Hadoop?
HDFS, YARN, MapReduce
Spark, Hive, Pig
SQL, Python, Java
MongoDB, Kafka, Airflow
Data Lake, Data Mart, Data Hub
Для чего используется HDFS?
Для распределенного хранения больших файлов на множестве серверов
Для анализа данных в реальном времени
Для управления ресурсами кластера
Для построения графиков и диаграмм
Для резервного копирования
Что хранит NameNode в архитектуре HDFS?
Метаданные о файлах и их расположении на узлах
Сами данные
Резервные копии данных
Конфигурационные файлы сети
Логи выполнения задач
Как называется рабочий узел в HDFS, где хранятся блоки данных?
DataNode
NameNode
ResourceManager
NodeManager
MasterNode
Какой размер блока данных чаще всего используется в HDFS?
128 МБ или 256 МБ
1 МБ
10 ГБ
512 КБ
64 МБ
Репликация (replication) в HDFS — это:
процесс копирования данных между узлами для обеспечения отказоустойчивости
процесс удаления устаревших данных из файловой системы
процесс сжатия данных для экономии места
процесс шифрования данных для безопасности
Какая роль у YARN в экосистеме Hadoop?
Управление вычислительными ресурсами и распределением задач
Хранение данных в распределенном виде
Очистка данных перед анализом
Генерация отчетов
Управление пользователями
Какую функцию выполняет ResourceManager в YARN?
Отслеживает и распределяет ресурсы кластера
Управляет метаданными файлов
Обрабатывает задачи MapReduce
Хранит резервные копии данных
Управляет сетевыми настройками
Какой компонент YARN работает на каждом узле кластера и контролирует выполнение задач?
NodeManager
ResourceManager
DataNode
NameNode
MasterNode
Что представляет собой модель MapReduce?
Парадигма обработки данных, разделяющая задачу на фазы Map и Reduce
Алгоритм машинного обучения
Система визуализации
Метод оптимизации памяти
Модель управления ресурсами
Какая основная функция фазы Map?
Обработка входных данных и генерация пар <Ключ, Значение>
Агрегация результатов
Сортировка и фильтрация
Хранение файлов
Создание копий данных
Что делает фаза Reduce в модели MapReduce?
Агрегирует промежуточные значения по одинаковым ключам
Разделяет данные на блоки
Какое преимущество даёт парадигма MapReduce?
Возможность параллельной обработки больших объёмов данных
Работа только с малыми файлами
Автоматическое удаление ошибок
Централизованное хранение данных
Использование одной машины
Что такое Data Lake?
Централизованное хранилище, где данные любого типа сохраняются в исходном виде
Традиционное хранилище данных с жёсткой схемой
Инструмент визуализации
Система управления ресурсами
Сервис резервного копирования
Чем Data Lake отличается от Data Warehouse?
Data Lake использует Schema-on-Read, а Data Warehouse — Schema-on-Write
Data Lake хранит только структурированные данные
Data Warehouse не требует схемы
Data Lake используется только в банках
Data Warehouse создан для видеоаналитики
Что означает принцип Schema-on-Read?
Схема применяется к данным только во время анализа
Схема задается при записи данных
Данные удаляются после чтения
Все данные сжимаются при чтении
Схема создается вручную
Почему Data Lake более гибкий, чем Data Warehouse?
Позволяет хранить данные без заранее заданной схемы
Работает только с числовыми данными
Использует один тип базы данных
Не поддерживает неструктурированные данные
Требует строгого контроля доступа
Что делает Hadoop отказоустойчивым?
Репликация данных на разных узлах кластера
Централизованная база данных
Работа только на одном сервере
Ручное резервное копирование
Использование SSD-дисков
Почему Hadoop считается масштабируемым решением?
Можно добавлять новые узлы без остановки системы
Работает только на одном сервере
Требует дорогого оборудования
Не поддерживает большие объемы данных
Ограничен количеством файлов
Какую роль играет YARN при запуске приложений Hadoop?
Управляет распределением ресурсов и контролирует выполнение задач
Хранит исходные данные
Формирует отчеты
Устанавливает Hadoop
Контролирует блоки данных
Какой элемент Hadoop отвечает за хранение метаданных?
NameNode
DataNode
NodeManager
ResourceManager
Reducer
Какое преимущество дает архитектура Data Lake для аналитики?
Возможность хранить и анализировать данные любого типа
Только числовой анализ
Только текстовые данные
Только структурированные данные
Только данные в реальном времени
Что является ключевым выводом лекции о Hadoop?
Hadoop — основа инфраструктуры Big Data, обеспечивающая хранение и обработку данных
Hadoop — это язык программирования
Hadoop используется только в банках
Hadoop заменил все СУБД
Hadoop — система визуализации
Какие компании первыми внедрили Hadoop?
Facebook, Yahoo, Netflix
Microsoft, Oracle, SAP
Intel, Cisco, IBM
Apple, Dell, HP
Google, Amazon, TikTok
Что означает аббревиатура NoSQL?
Not Only SQL — не только SQL
Non Structured Query Language
New Object System Query Logic
Non Secure Query Level
Numeric SQL Layer
Какова основная цель систем NoSQL?
Горизонтальное масштабирование и высокая скорость работы с неструктурированными данными
Замена всех реляционных СУБД
Минимизация использования памяти
Создание резервных копий
Работа только с таблицами
Какая теорема объясняет ограничения распределённых систем хранения данных?
CAP-теорема
ACID-модель
BASE-принцип
MapReduce
ER-модель
Кто сформулировал CAP-теорему?
Эрик Брюэр
Ларри Пейдж
Джефф Дин
Тим Бернерс-Ли
Билл Джой
Какие три свойства описывает CAP-теорема?
Согласованность (Consistency), Доступность (Availability), Устойчивость к разделению (Partition Tolerance)
Скорость, Масштабируемость, Точность
Конфиденциальность, Производительность, Репликация
Надёжность, Эффективность, Локализация
Верификация, Стабильность, Интеграция
Что означает свойство Consistency (Согласованность)?
Все клиенты видят одни и те же данные одновременно
Система отвечает даже при сбое узлов
Данные сохраняются навсегда
Каждая транзакция выполняется за одно и то же время
Данные автоматически архивируются
Что означает свойство Availability (Доступность)?
Каждый запрос получает ответ, даже при сбоях узлов
Все данные мгновенно синхронизируются
Данные доступны только в одном узле
Ошибки не обрабатываются
Система прекращает работу при сбое
Что означает свойство Partition Tolerance (Устойчивость к разделению)?
Система продолжает работать даже при разрыве связи между узлами
Данные не реплицируются
Система временно недоступна
Все узлы должны быть связаны постоянно
Ошибки приводят к остановке
Какой тип систем выбирает Consistency и Partition Tolerance (CP)?
Система жертвует доступностью, обеспечивая согласованность данных
Система при сбое продолжает работать с устаревшими данными
Система полностью прекращает работу
Система сохраняет только кэшированные данные
Система отключает репликацию
Какой тип систем выбирает Availability и Partition Tolerance (AP)?
Система обеспечивает доступность даже при временной потере согласованности
Система не отвечает при сбое сети
Система теряет данные
Система требует централизованного управления
Система не поддерживает репликацию
Примером CP-системы является:
HBase
Cassandra
Couchbase
MongoDB
Neo4j
Примером AP-системы является:
Cassandra
Redis
PostgreSQL
HBase
Oracle
Почему традиционные RDBMS не подходят для Big Data?
Из-за вертикального масштабирования и жесткой схемы данных
Потому что они используют только графовые структуры данных.
Потому что они предназначены только для обработки изображений.
Потому что они не поддерживают транзакции.
Какой тип NoSQL баз использует пары Ключ–Значение?
Key-Value Store
Document Store
Column-Family Store
Graph Database
Object-Oriented Database
Примером Key-Value базы является:
Redis
Cassandra
MongoDB
Neo4j
MySQL
Для чего чаще всего используются Key-Value базы?
Кэширование и хранение сессий
Хранение графов
Обработка транзакций
Аналитика больших данных
Управление контентом
Какой формат данных используют документные базы?
JSON или BSON
CSV
XML
TXT
EXE
Примером документной базы данных является:
MongoDB
Redis
Oracle
Neo4j
HBase
В чем преимущество документных баз данных?
Гибкая схема хранения, позволяющая различную структуру документов
Обязательное наличие одинаковых полей
Только числовые данные
Строгие транзакции
Почему реляционные базы данных могут быть неэффективны для некоторых задач?
Из-за вертикального масштабирования и жесткой схемы данных
Из-за отсутствия интерфейса
Из-за высокой стоимости лицензий
Из-за невозможности подключения пользователей
Из-за отсутствия SQL-запросов
Что представляет собой колоночная база данных?
База, где данные группируются по семействам колонок
Таблица, где все данные в одной строке
Модель, основанная на графах
Хранилище JSON-документов
Архив файлов
Примером колоночной базы является:
Apache Cassandra
MongoDB
Redis
MySQL
Neo4j
Что означает понятие "гибкая схема" в NoSQL базах?
Возможность хранения документов с разным набором полей
Строгая таблица с фиксированными типами данных
Только числовые поля
Статическая структура
Централизованное управление
Для чего применяются графовые базы данных?
Для анализа связей между объектами (узлы и ребра)
Для хранения изображений
Для кеширования сессий
Для транзакций в банках
Для текстового поиска
Пример графовой базы данных:
Neo4j
MongoDB
Cassandra
Redis
HBase
Какой основной вывод можно сделать о NoSQL базах данных?
Они дополняют реляционные базы, обеспечивая гибкость и масштабируемость
Полностью заменяют SQL
Используются только в банках
Требуют жёсткой схемы
Не поддерживают большие данные
Что такое MapReduce?
Модель программирования и фреймворк для обработки больших наборов данных в распределенном кластере
База данных для хранения больших объемов данных
Язык программирования
Система визуализации данных
Среда виртуализации
Кто разработал оригинальную концепцию MapReduce?
Компания Google
Microsoft
Oracle
IBM
Какая организация адаптировала MapReduce как open-source фреймворк?
Apache
Amazon
Red Hat
Cloudera
Cisco
Основная идея MapReduce заключается в том, чтобы:
Разделить задачу на множество независимых подзадач, выполняемых параллельно
Обрабатывать данные только на одном сервере
Хранить данные в облаке
Делить задачи по времени, а не по объему
Обрабатывать только текстовые данные
Какие две основные фазы включает MapReduce?
Map и Reduce
Shuffle и Sort
Write и Read
Split и Merge
Input и Output
Что делает функция Map?
Обрабатывает входные данные и генерирует пары <Ключ, Значение>
Группирует данные по ключу
Сохраняет результаты в HDFS
Агрегирует данные
Удаляет дубликаты
Что делает функция Reduce?
Выполняет агрегацию или свертку значений с одинаковыми ключами
Сортирует входные данные
Генерирует пары ключ-значение
Выполняет фильтрацию данных
Разбивает файлы на части
Что происходит на этапе Shuffle?
Промежуточные пары <Ключ, Значение> передаются по сети к нужным узлам Reduce
Данные копируются на локальный диск
Данные сортируются по алфавиту
Создаются резервные копии
Данные объединяются в один файл
Какова роль этапа Sort в MapReduce?
Группировка и сортировка значений по ключам перед фазой Reduce
Сжатие данных
Сохранение результатов
Репликация данных
Очистка невалидных записей
Где обычно хранятся входные данные MapReduce?
В HDFS
В SQL-базе данных
В оперативной памяти
В облачном хранилище AWS
В локальной файловой системе
Как называются логические части входных данных, которые обрабатывает функция Map?
Input Splits
Data Chunks
Reducer Blocks
Task Nodes
Query Sets
Что обеспечивает отказоустойчивость в MapReduce?
Автоматический перезапуск задач YARN при сбое узлов
Ручное резервное копирование
Использование SSD-дисков
Сжатие данных
Запуск одной копии задачи
Что делает компонент ResourceManager в YARN?
Распределяет ресурсы между задачами и управляет их выполнением
Управляет метаданными файлов
Обрабатывает задачи MapReduce
Хранит резервные копии данных
Какая функция выполняется NodeManager в YARN?
Запускает Map и Reduce задачи на рабочих узлах
Координирует работу всего кластера
Проверяет корректность данных
Сортирует промежуточные результаты
Контролирует состояние сети
Что такое Fault Tolerance в контексте Hadoop?
Способность системы продолжать работу при отказе узлов
Уменьшение размера файлов
Ускорение обработки
Оптимизация кода
Увеличение памяти
Почему MapReduce неэффективен для итерационных алгоритмов?
Каждая итерация требует чтения и записи данных на диск
Не поддерживает параллельность
Нет функции Reduce
Нет поддержки Java
Не обрабатывает большие данные
Почему MapReduce не подходит для потоковой обработки данных?
Он ориентирован на пакетную обработку и высокие задержки между фазами
Не поддерживает файловую систему
Не имеет интерфейса
Требует ручного ввода данных
Использует SQL-запросы
Что является результатом работы функции Reduce?
Конечный набор агрегированных данных, записанных в HDFS
Исходный набор данных
Сырые промежуточные данные
Несортированные значения
Набор временных файлов
В чем заключается главное ограничение MapReduce по производительности?
Обязательная запись промежуточных данных на диск
Невозможность параллельной обработки
Нехватка памяти
Отсутствие интерфейса
Какой тип задач MapReduce решает лучше всего?
Массовая пакетная обработка больших объемов статических данных
Потоковая обработка
Интерактивная аналитика
Визуализация данных
Реальное моделирование
Что заменило MapReduce во многих современных проектах Big Data?
Apache Spark
Apache Kafka
PostgreSQL
Amazon S3
Oracle DataGuard
