wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

ХОБД 1

Total questions: 97

Worksheet time: 49mins

Name
Class
Date
1.

Что означает термин Big Data?

a)

Совокупность огромных, быстро поступающих и разнообразных данных, требующих новых методов обработки

b)

Малые объемы структурированных данных

c)

Только числовые данные из таблиц

d)

Программа для анализа данных

e)

Тип файловой системы

2.

Какие три характеристики составляют классическую модель Big Data?

a)

Volume, Velocity, Variety

b)

Value, Verification, Visualization

c)

Vector, Volume, Vision

d)

Validity, Value, Verification

e)

Volume, Variance, View

3.

Что обозначает характеристика Volume в модели 5V?

a)

Объем данных, измеряемый в тера-, пета- и эксабайтах

b)

Скорость поступления данных

c)

Надежность и качество информации

d)

Ценность данных для бизнеса

e)

Формат хранения данных

4.

Какая характеристика модели 5V отвечает за скорость обработки данных?

a)

Velocity

b)

Variety

c)

Volume

d)

Veracity

e)

Value

5.

Что означает Variety в контексте Big Data?

a)

Разнообразие форматов данных

b)

Объем хранимых данных

c)

Ценность данных

d)

Скорость передачи информации

e)

Качество анализа

6.

К какой категории данных относятся JSON и XML файлы?

a)

Полуструктурированные данные

b)

Структурированные данные

c)

Неструктурированные данные

d)

Транзакционные данные

e)

Социальные данные

7.

Какой тип данных включает изображения, видео и текстовые документы?

a)

Неструктурированные данные

b)

Структурированные данные

c)

Полуструктурированные данные

d)

Транзакционные данные

e)

Социальные данные

8.

Что означает Veracity в модели 5V?

a)

Надежность и точность данных

b)

Скорость обработки данных

c)

Количество источников данных

d)

Тип данных

e)

Сложность модели

9.

Какое «V» отражает ценность данных для бизнеса?

a)

Value

b)

Volume

c)

Veracity

d)

Variety

e)

Velocity

10.

Какие три основные группы источников Big Data выделяются?

a)

Социальные, машинно-генерируемые, транзакционные

b)

Географические, биологические, экономические

c)

Сетевые, аудио, визуальные

d)

Коммерческие, научные, государственные

e)

Публичные, частные, смешанные

11.

Примером социальных данных являются:

a)

Социальные сети, блоги и форумы

b)

Финансовые отчеты

c)

GPS-координаты

d)

Сенсорные показания

e)

Журналы транзакций

12.

К машинно-генерируемым данным относятся:

a)

Данные IoT-сенсоров, GPS и серверные логи

b)

Комментарии пользователей

c)

Финансовые операции

d)

Данные из CRM

e)

Электронные письма

13.

Что относится к транзакционным данным?

a)

Записи о покупках, остатки на складе, операции e-commerce

b)

Посты в соцсетях

c)

Температура с датчиков

d)

Серверные логи

14.

Какая проблема связана с масштабированием Big Data?

a)

Ограничения традиционных СУБД

b)

Отсутствие текстовых данных

c)

Невозможность хранения малых объемов

d)

Избыточное дублирование информации

e)

Сложность визуализации

15.

Какая технология решает проблему масштабирования Big Data?

a)

Распределенные файловые системы (HDFS) и параллельные вычисления (Spark, MapReduce)

b)

Excel и Access

c)

HTML и CSS

d)

VPN и Firewall

e)

GPS и RFID

16.

Какой пример из IT-индустрии иллюстрирует использование Spark для анализа данных?

a)

Netflix анализирует поведение пользователей с помощью кластеров Spark

b)

Google использует Spark для поиска

c)

Facebook применяет Spark для загрузки видео

d)

Amazon использует Spark для доставки товаров

e)

IBM применяет Spark в Word

17.

Что делает Google в области Big Data аналитики?

a)

Персонализирует результаты поиска и рекламы

b)

Производит только железо

c)

Создает антивирусные программы

d)

Проводит социологические опросы

e)

Использует Big Data только для хранения файлов

18.

Какая проблема относится к управленческому аспекту Big Data?

a)

Безопасность и конфиденциальность данных

b)

Скорость обработки информации

c)

Типизация данных

d)

Формат хранения

e)

Дублирование записей

19.

Что является примером управленческой возможности Big Data?

a)

Принятие решений на основе данных (Data-Driven Decisions)

b)

Увеличение числа пользователей

c)

Повышение скорости интернета

d)

Сокращение сотрудников

e)

Оптимизация рекламы без аналитики

20.

Какое новое направление появилось благодаря Big Data?

a)

Профессии Data Scientist и Data Engineer

b)

Бухгалтерия и аудит

c)

PR и маркетинг

d)

Редактура и журналистика

e)

Тестирование UI

21.

Что является ключевой целью работы с Big Data?

a)

Извлечение ценности и принятие решений на основе данных

b)

Архивирование старых файлов

c)

Увеличение скорости интернета

d)

Создание баз данных без анализа

e)

Хранение структурированных таблиц

22.

Что является примером аналитической проблемы Big Data?

a)

Объединение данных разного типа и точности

b)

Отсутствие памяти

c)

Медленный интернет

d)

Необходимость ручного ввода

e)

Сложность регистрации

23.

Какой пример из IT иллюстрирует использование Big Data для рекламы?

a)

Meta (Facebook) анализирует поведенческие данные для таргетинга рекламы

b)

Netflix хранит фильмы

c)

Spotify транслирует музыку

d)

Twitter пишет новости

e)

Microsoft создает операционные системы

24.

Какая технология чаще всего используется для хранения Big Data?

a)

HDFS (Hadoop Distributed File System)

b)

SQL Server

c)

Excel

d)

PowerPoint

e)

Access

25.

Какой основной вывод можно сделать из концепции Big Data?

a)

Big Data — это новая парадигма, изменившая подход к работе с информацией

b)

Big Data — это просто большие таблицы

c)

Big Data используется только в финансах

d)

Big Data не требует новых технологий

e)

Big Data — это тип аппаратного обеспечения

26.

Что представляет собой Apache Hadoop?

a)

Платформа с открытым исходным кодом для масштабируемой и отказоустойчивой обработки больших данных

b)

Программа для работы с базами данных

c)

Операционная система Linux

d)

Средство визуализации данных

e)

Язык программирования

27.

Какие три основных компонента входят в экосистему Hadoop?

a)

HDFS, YARN, MapReduce

b)

Spark, Hive, Pig

c)

SQL, Python, Java

d)

MongoDB, Kafka, Airflow

e)

Data Lake, Data Mart, Data Hub

28.

Для чего используется HDFS?

a)

Для распределенного хранения больших файлов на множестве серверов

b)

Для анализа данных в реальном времени

c)

Для управления ресурсами кластера

d)

Для построения графиков и диаграмм

e)

Для резервного копирования

29.

Что хранит NameNode в архитектуре HDFS?

a)

Метаданные о файлах и их расположении на узлах

b)

Сами данные

c)

Резервные копии данных

d)

Конфигурационные файлы сети

e)

Логи выполнения задач

30.

Как называется рабочий узел в HDFS, где хранятся блоки данных?

a)

DataNode

b)

NameNode

c)

ResourceManager

d)

NodeManager

e)

MasterNode

31.

Какой размер блока данных чаще всего используется в HDFS?

a)

128 МБ или 256 МБ

b)

1 МБ

c)

10 ГБ

d)

512 КБ

e)

64 МБ

32.

Репликация (replication) в HDFS — это:

a)

процесс копирования данных между узлами для обеспечения отказоустойчивости

b)

процесс удаления устаревших данных из файловой системы

c)

процесс сжатия данных для экономии места

d)

процесс шифрования данных для безопасности

33.

Какая роль у YARN в экосистеме Hadoop?

a)

Управление вычислительными ресурсами и распределением задач

b)

Хранение данных в распределенном виде

c)

Очистка данных перед анализом

d)

Генерация отчетов

e)

Управление пользователями

34.

Какую функцию выполняет ResourceManager в YARN?

a)

Отслеживает и распределяет ресурсы кластера

b)

Управляет метаданными файлов

c)

Обрабатывает задачи MapReduce

d)

Хранит резервные копии данных

e)

Управляет сетевыми настройками

35.

Какой компонент YARN работает на каждом узле кластера и контролирует выполнение задач?

a)

NodeManager

b)

ResourceManager

c)

DataNode

d)

NameNode

e)

MasterNode

36.

Что представляет собой модель MapReduce?

a)

Парадигма обработки данных, разделяющая задачу на фазы Map и Reduce

b)

Алгоритм машинного обучения

c)

Система визуализации

d)

Метод оптимизации памяти

e)

Модель управления ресурсами

37.

Какая основная функция фазы Map?

a)

Обработка входных данных и генерация пар <Ключ, Значение>

b)

Агрегация результатов

c)

Сортировка и фильтрация

d)

Хранение файлов

e)

Создание копий данных

38.

Что делает фаза Reduce в модели MapReduce?

a)

Агрегирует промежуточные значения по одинаковым ключам

b)

Разделяет данные на блоки

39.

Какое преимущество даёт парадигма MapReduce?

a)

Возможность параллельной обработки больших объёмов данных

b)

Работа только с малыми файлами

c)

Автоматическое удаление ошибок

d)

Централизованное хранение данных

e)

Использование одной машины

40.

Что такое Data Lake?

a)

Централизованное хранилище, где данные любого типа сохраняются в исходном виде

b)

Традиционное хранилище данных с жёсткой схемой

c)

Инструмент визуализации

d)

Система управления ресурсами

e)

Сервис резервного копирования

41.

Чем Data Lake отличается от Data Warehouse?

a)

Data Lake использует Schema-on-Read, а Data Warehouse — Schema-on-Write

b)

Data Lake хранит только структурированные данные

c)

Data Warehouse не требует схемы

d)

Data Lake используется только в банках

e)

Data Warehouse создан для видеоаналитики

42.

Что означает принцип Schema-on-Read?

a)

Схема применяется к данным только во время анализа

b)

Схема задается при записи данных

c)

Данные удаляются после чтения

d)

Все данные сжимаются при чтении

e)

Схема создается вручную

43.

Почему Data Lake более гибкий, чем Data Warehouse?

a)

Позволяет хранить данные без заранее заданной схемы

b)

Работает только с числовыми данными

c)

Использует один тип базы данных

d)

Не поддерживает неструктурированные данные

e)

Требует строгого контроля доступа

44.

Что делает Hadoop отказоустойчивым?

a)

Репликация данных на разных узлах кластера

b)

Централизованная база данных

c)

Работа только на одном сервере

d)

Ручное резервное копирование

e)

Использование SSD-дисков

45.

Почему Hadoop считается масштабируемым решением?

a)

Можно добавлять новые узлы без остановки системы

b)

Работает только на одном сервере

c)

Требует дорогого оборудования

d)

Не поддерживает большие объемы данных

e)

Ограничен количеством файлов

46.

Какую роль играет YARN при запуске приложений Hadoop?

a)

Управляет распределением ресурсов и контролирует выполнение задач

b)

Хранит исходные данные

c)

Формирует отчеты

d)

Устанавливает Hadoop

e)

Контролирует блоки данных

47.

Какой элемент Hadoop отвечает за хранение метаданных?

a)

NameNode

b)

DataNode

c)

NodeManager

d)

ResourceManager

e)

Reducer

48.

Какое преимущество дает архитектура Data Lake для аналитики?

a)

Возможность хранить и анализировать данные любого типа

b)

Только числовой анализ

c)

Только текстовые данные

d)

Только структурированные данные

e)

Только данные в реальном времени

49.

Что является ключевым выводом лекции о Hadoop?

a)

Hadoop — основа инфраструктуры Big Data, обеспечивающая хранение и обработку данных

b)

Hadoop — это язык программирования

c)

Hadoop используется только в банках

d)

Hadoop заменил все СУБД

e)

Hadoop — система визуализации

50.

Какие компании первыми внедрили Hadoop?

a)

Facebook, Yahoo, Netflix

b)

Microsoft, Oracle, SAP

c)

Intel, Cisco, IBM

d)

Apple, Dell, HP

e)

Google, Amazon, TikTok

51.

Что означает аббревиатура NoSQL?

a)

Not Only SQL — не только SQL

b)

Non Structured Query Language

c)

New Object System Query Logic

d)

Non Secure Query Level

e)

Numeric SQL Layer

52.

Какова основная цель систем NoSQL?

a)

Горизонтальное масштабирование и высокая скорость работы с неструктурированными данными

b)

Замена всех реляционных СУБД

c)

Минимизация использования памяти

d)

Создание резервных копий

e)

Работа только с таблицами

53.

Какая теорема объясняет ограничения распределённых систем хранения данных?

a)

CAP-теорема

b)

ACID-модель

c)

BASE-принцип

d)

MapReduce

e)

ER-модель

54.

Кто сформулировал CAP-теорему?

a)

Эрик Брюэр

b)

Ларри Пейдж

c)

Джефф Дин

d)

Тим Бернерс-Ли

e)

Билл Джой

55.

Какие три свойства описывает CAP-теорема?

a)

Согласованность (Consistency), Доступность (Availability), Устойчивость к разделению (Partition Tolerance)

b)

Скорость, Масштабируемость, Точность

c)

Конфиденциальность, Производительность, Репликация

d)

Надёжность, Эффективность, Локализация

e)

Верификация, Стабильность, Интеграция

56.

Что означает свойство Consistency (Согласованность)?

a)

Все клиенты видят одни и те же данные одновременно

b)

Система отвечает даже при сбое узлов

c)

Данные сохраняются навсегда

d)

Каждая транзакция выполняется за одно и то же время

e)

Данные автоматически архивируются

57.

Что означает свойство Availability (Доступность)?

a)

Каждый запрос получает ответ, даже при сбоях узлов

b)

Все данные мгновенно синхронизируются

c)

Данные доступны только в одном узле

d)

Ошибки не обрабатываются

e)

Система прекращает работу при сбое

58.

Что означает свойство Partition Tolerance (Устойчивость к разделению)?

a)

Система продолжает работать даже при разрыве связи между узлами

b)

Данные не реплицируются

c)

Система временно недоступна

d)

Все узлы должны быть связаны постоянно

e)

Ошибки приводят к остановке

59.

Какой тип систем выбирает Consistency и Partition Tolerance (CP)?

a)

Система жертвует доступностью, обеспечивая согласованность данных

b)

Система при сбое продолжает работать с устаревшими данными

c)

Система полностью прекращает работу

d)

Система сохраняет только кэшированные данные

e)

Система отключает репликацию

60.

Какой тип систем выбирает Availability и Partition Tolerance (AP)?

a)

Система обеспечивает доступность даже при временной потере согласованности

b)

Система не отвечает при сбое сети

c)

Система теряет данные

d)

Система требует централизованного управления

e)

Система не поддерживает репликацию

61.

Примером CP-системы является:

a)

HBase

b)

Cassandra

c)

Couchbase

d)

MongoDB

e)

Neo4j

62.

Примером AP-системы является:

a)

Cassandra

b)

Redis

c)

PostgreSQL

d)

HBase

e)

Oracle

63.

Почему традиционные RDBMS не подходят для Big Data?

a)

Из-за вертикального масштабирования и жесткой схемы данных

b)

Потому что они используют только графовые структуры данных.

c)

Потому что они предназначены только для обработки изображений.

d)

Потому что они не поддерживают транзакции.

64.

Какой тип NoSQL баз использует пары Ключ–Значение?

a)

Key-Value Store

b)

Document Store

c)

Column-Family Store

d)

Graph Database

e)

Object-Oriented Database

65.

Примером Key-Value базы является:

a)

Redis

b)

Cassandra

c)

MongoDB

d)

Neo4j

e)

MySQL

66.

Для чего чаще всего используются Key-Value базы?

a)

Кэширование и хранение сессий

b)

Хранение графов

c)

Обработка транзакций

d)

Аналитика больших данных

e)

Управление контентом

67.

Какой формат данных используют документные базы?

a)

JSON или BSON

b)

CSV

c)

XML

d)

TXT

e)

EXE

68.

Примером документной базы данных является:

a)

MongoDB

b)

Redis

c)

Oracle

d)

Neo4j

e)

HBase

69.

В чем преимущество документных баз данных?

a)

Гибкая схема хранения, позволяющая различную структуру документов

b)

Обязательное наличие одинаковых полей

c)

Только числовые данные

d)

Строгие транзакции

70.

Почему реляционные базы данных могут быть неэффективны для некоторых задач?

a)

Из-за вертикального масштабирования и жесткой схемы данных

b)

Из-за отсутствия интерфейса

c)

Из-за высокой стоимости лицензий

d)

Из-за невозможности подключения пользователей

e)

Из-за отсутствия SQL-запросов

71.

Что представляет собой колоночная база данных?

a)

База, где данные группируются по семействам колонок

b)

Таблица, где все данные в одной строке

c)

Модель, основанная на графах

d)

Хранилище JSON-документов

e)

Архив файлов

72.

Примером колоночной базы является:

a)

Apache Cassandra

b)

MongoDB

c)

Redis

d)

MySQL

e)

Neo4j

73.

Что означает понятие "гибкая схема" в NoSQL базах?

a)

Возможность хранения документов с разным набором полей

b)

Строгая таблица с фиксированными типами данных

c)

Только числовые поля

d)

Статическая структура

e)

Централизованное управление

74.

Для чего применяются графовые базы данных?

a)

Для анализа связей между объектами (узлы и ребра)

b)

Для хранения изображений

c)

Для кеширования сессий

d)

Для транзакций в банках

e)

Для текстового поиска

75.

Пример графовой базы данных:

a)

Neo4j

b)

MongoDB

c)

Cassandra

d)

Redis

e)

HBase

76.

Какой основной вывод можно сделать о NoSQL базах данных?

a)

Они дополняют реляционные базы, обеспечивая гибкость и масштабируемость

b)

Полностью заменяют SQL

c)

Используются только в банках

d)

Требуют жёсткой схемы

e)

Не поддерживают большие данные

77.

Что такое MapReduce?

a)

Модель программирования и фреймворк для обработки больших наборов данных в распределенном кластере

b)

База данных для хранения больших объемов данных

c)

Язык программирования

d)

Система визуализации данных

e)

Среда виртуализации

78.

Кто разработал оригинальную концепцию MapReduce?

a)

Компания Google

b)

Microsoft

c)

Facebook

d)

Oracle

e)

IBM

79.

Какая организация адаптировала MapReduce как open-source фреймворк?

a)

Apache

b)

Amazon

c)

Red Hat

d)

Cloudera

e)

Cisco

80.

Основная идея MapReduce заключается в том, чтобы:

a)

Разделить задачу на множество независимых подзадач, выполняемых параллельно

b)

Обрабатывать данные только на одном сервере

c)

Хранить данные в облаке

d)

Делить задачи по времени, а не по объему

e)

Обрабатывать только текстовые данные

81.

Какие две основные фазы включает MapReduce?

a)

Map и Reduce

b)

Shuffle и Sort

c)

Write и Read

d)

Split и Merge

e)

Input и Output

82.

Что делает функция Map?

a)

Обрабатывает входные данные и генерирует пары <Ключ, Значение>

b)

Группирует данные по ключу

c)

Сохраняет результаты в HDFS

d)

Агрегирует данные

e)

Удаляет дубликаты

83.

Что делает функция Reduce?

a)

Выполняет агрегацию или свертку значений с одинаковыми ключами

b)

Сортирует входные данные

c)

Генерирует пары ключ-значение

d)

Выполняет фильтрацию данных

e)

Разбивает файлы на части

84.

Что происходит на этапе Shuffle?

a)

Промежуточные пары <Ключ, Значение> передаются по сети к нужным узлам Reduce

b)

Данные копируются на локальный диск

c)

Данные сортируются по алфавиту

d)

Создаются резервные копии

e)

Данные объединяются в один файл

85.

Какова роль этапа Sort в MapReduce?

a)

Группировка и сортировка значений по ключам перед фазой Reduce

b)

Сжатие данных

c)

Сохранение результатов

d)

Репликация данных

e)

Очистка невалидных записей

86.

Где обычно хранятся входные данные MapReduce?

a)

В HDFS

b)

В SQL-базе данных

c)

В оперативной памяти

d)

В облачном хранилище AWS

e)

В локальной файловой системе

87.

Как называются логические части входных данных, которые обрабатывает функция Map?

a)

Input Splits

b)

Data Chunks

c)

Reducer Blocks

d)

Task Nodes

e)

Query Sets

88.

Что обеспечивает отказоустойчивость в MapReduce?

a)

Автоматический перезапуск задач YARN при сбое узлов

b)

Ручное резервное копирование

c)

Использование SSD-дисков

d)

Сжатие данных

e)

Запуск одной копии задачи

89.

Что делает компонент ResourceManager в YARN?

a)

Распределяет ресурсы между задачами и управляет их выполнением

b)

Управляет метаданными файлов

c)

Обрабатывает задачи MapReduce

d)

Хранит резервные копии данных

90.

Какая функция выполняется NodeManager в YARN?

a)

Запускает Map и Reduce задачи на рабочих узлах

b)

Координирует работу всего кластера

c)

Проверяет корректность данных

d)

Сортирует промежуточные результаты

e)

Контролирует состояние сети

91.

Что такое Fault Tolerance в контексте Hadoop?

a)

Способность системы продолжать работу при отказе узлов

b)

Уменьшение размера файлов

c)

Ускорение обработки

d)

Оптимизация кода

e)

Увеличение памяти

92.

Почему MapReduce неэффективен для итерационных алгоритмов?

a)

Каждая итерация требует чтения и записи данных на диск

b)

Не поддерживает параллельность

c)

Нет функции Reduce

d)

Нет поддержки Java

e)

Не обрабатывает большие данные

93.

Почему MapReduce не подходит для потоковой обработки данных?

a)

Он ориентирован на пакетную обработку и высокие задержки между фазами

b)

Не поддерживает файловую систему

c)

Не имеет интерфейса

d)

Требует ручного ввода данных

e)

Использует SQL-запросы

94.

Что является результатом работы функции Reduce?

a)

Конечный набор агрегированных данных, записанных в HDFS

b)

Исходный набор данных

c)

Сырые промежуточные данные

d)

Несортированные значения

e)

Набор временных файлов

95.

В чем заключается главное ограничение MapReduce по производительности?

a)

Обязательная запись промежуточных данных на диск

b)

Невозможность параллельной обработки

c)

Нехватка памяти

d)

Отсутствие интерфейса

96.

Какой тип задач MapReduce решает лучше всего?

a)

Массовая пакетная обработка больших объемов статических данных

b)

Потоковая обработка

c)

Интерактивная аналитика

d)

Визуализация данных

e)

Реальное моделирование

97.

Что заменило MapReduce во многих современных проектах Big Data?

a)

Apache Spark

b)

Apache Kafka

c)

PostgreSQL

d)

Amazon S3

e)

Oracle DataGuard