Font size
S
M
L
XL
WorksheetsОНС1
Total questions: 217
Worksheet time: 2hrs 49mins
Name
Class
Date
1.
Какой ученый впервые предложил концепцию искусственного нейрона?
a)
Уоррен Маккалок и Уолтер Питтс.
b)
Джон фон Нейман.
c)
Франк Розенблатт.
d)
Алан Тьюринг.
e)
Джеффри Хинтон.
2.
Какой исторический этап нейронных сетей называют «зимой ИИ»?
a)
Период, когда финансирование исследований в области ИИ резко сократилось.
b)
Время, когда начали активно разрабатывать глубокие сети.
c)
Эра появления первых обучающих алгоритмов.
d)
Период успеха сверточных сетей.
e)
Время появления первых рекуррентных сетей.
3.
Какой алгоритм сыграл ключевую роль в возрождении нейронных сетей в 1980-х?
a)
Backpropagation (обратное распространение ошибки).
b)
Dropout.
c)
Gradient Boosting.
d)
Support Vector Machines (SVM).
e)
Random Forest.
4.
Какую задачу решал персептрон Франка Розенблатта?
a)
Классификацию изображений.
b)
Предсказание временных рядов.
c)
Обнаружение спама.
d)
Распознавание рукописных символов.
e)
Определение эмоций в тексте.
5.
Почему персептрон оказался ограниченным в решении задач?
a)
Не мог решать задачи, которые не линейно разделимы.
b)
Требовал слишком большого объема вычислительных ресурсов.
c)
Подходил только для работы с изображениями.
d)
Не мог обрабатывать входные данные с пропусками.
e)
Использовал устаревшие функции активации.
6.
Что является основным компонентом персептрона?
a)
Весовые коэффициенты.
b)
Глубокие слои.
c)
Сверточные фильтры.
d)
Рекуррентные связи.
e)
Batch Normalization.
7.
Как персептрон определяет выходное значение?
a)
Через пороговую функцию активации.
b)
С помощью функции softmax.
c)
С использованием рекурсии.
d)
Через вероятностное распределение.
e)
Посредством pooling.
8.
Что произойдет, если линейно неразделимую задачу пытаться решить персептроном?
a)
Обучение не завершится успешно.
b)
Персептрон автоматически подберет решение.
c)
Весовые коэффициенты станут отрицательными.
d)
Модель будет обучаться быстрее, но менее точно.
e)
Ошибки будут уменьшаться, но медленно.
9.
Какая задача продемонстрировала ограничение персептрона?
a)
XOR.
b)
AND.
c)
OR.
d)
NOT.
e)
NAND.
10.
Чем отличается многослойный персептрон от классического?
a)
Возможностью решать нелинейно разделимые задачи.
b)
Использованием только одной функции активации.
c)
Отсутствием скрытых слоев.
d)
Отказом от пороговой функции активации.
e)
Упрощением вычислений.
11.
Какая задача чаще всего решается с помощью сверточных нейронных сетей?
a)
Обработка изображений.
b)
Анализ временных рядов.
c)
Перевод текста.
d)
Генерация речи.
e)
Анализ графов.
12.
Что такое сверточный слой в CNN?
a)
Слой, который извлекает признаки из входных данных с помощью фильтров.
b)
Слой, который уменьшает размерность данных.
c)
Финальный слой сети, вычисляющий метки.
d)
Слой, использующий рекуррентные связи.
e)
Слой, отвечающий за нормализацию данных.
13.
Как называется операция, используемая для уменьшения размера признаков?
a)
Pooling (объединение).
b)
Normalization (нормализация).
c)
Convolution (свертка).
d)
Upsampling (увеличение разрешения).
e)
Backpropagation (обратное распространение).
14.
Что происходит при использовании функции активации ReLU в CNN?
a)
Отрицательные значения заменяются на ноль.
b)
Вычисляется логарифм входных значений.
c)
Все значения нормализуются к диапазону [0, 1].
d)
Значения масштабируются до заданного предела.
e)
Выполняется усреднение всех значений слоя.
15.
Чем отличаются цветовые входные данные от градаций серого в CNN?
a)
Цветовые изображения имеют несколько каналов (например, RGB).
b)
Цветовые данные содержат больше информации, чем серые.
c)
Цветовые изображения всегда занимают меньше памяти.
d)
Градации серого требуют больше вычислительных ресурсов.
e)
Градации серого включают информацию о контрасте.
16.
Какой из перечисленных элементов отвечает за выделение признаков в CNN?
a)
Сверточные слои.
b)
Полносвязные слои.
c)
Функции активации.
d)
Dropout.
e)
Batch Normalization.
17.
Какую функцию выполняет слой Max Pooling в сверточной сети?
a)
Уменьшает размер карты признаков, выбирая максимальное значение из области.
b)
Вычисляет среднее значение признаков.
c)
Уменьшает размер изображений за счет усреднения.
d)
Ускоряет обратное распространение.
e)
Преобразует данные в латентное представление.
18.
Что происходит при увеличении размера ядра свертки?
a)
Область, охватываемая фильтром, становится больше.
b)
Количество параметров уменьшается.
c)
Глубина выходных данных уменьшается.
d)
Время обучения сокращается.
e)
Точность сети снижается.
19.
Чем отличается stride от padding?
a)
Stride определяет шаг фильтра, а padding добавляет границы вокруг данных.
b)
Padding увеличивает размер ядра, а stride уменьшает его.
c)
Padding используется для нормализации, а stride - для активации.
d)
Stride отвечает за нормализацию выходных данных.
e)
Padding задает число каналов карты признаков.
20.
Какое преимущество дает использование глобального усреднения (Global Average Pooling)?
a)
Уменьшает количество параметров перед полносвязным слоем.
b)
Увеличивает разрешение входного изображения.
c)
Исключает необходимость активационных функций.
d)
Заменяет сверточные слои на полносвязные.
e)
Ускоряет выполнение прямого прохода.
21.
Какую задачу решает архитектура AlexNet?
a)
Классификация изображений.
b)
Генерация текста.
c)
Анализ временных рядов.
d)
Перевод речи.
e)
Сегментация изображений.
22.
Какая архитектура использует остаточные соединения (residual connections)?
a)
ResNet.
b)
LeNet.
c)
VGG.
d)
MobileNet.
e)
DenseNet.
23.
Что такое «слой выпрямления» (Flatten)?
a)
Преобразует многомерные данные в одномерный вектор.
b)
Уменьшает размер карты признаков.
c)
Применяется для нормализации входных данных.
d)
Соединяет выходы всех фильтров.
e)
Ускоряет обработку полносвязными слоями.
24.
Чем отличается LeNet от современных архитектур CNN?
a)
Использует простые структуры и работает с низким разрешением изображений.
b)
Применяет рекуррентные связи.
c)
Использует остаточные соединения.
d)
Работает только с цветными изображениями.
e)
Не включает полносвязные слои.
25.
Какая архитектура разработана специально для мобильных устройств?
a)
MobileNet.
b)
ResNet.
c)
AlexNet.
d)
DenseNet.
e)
VGG.
26.
Что происходит, если в CNN не используется padding?
a)
Размер выходной карты признаков уменьшается.
b)
Увеличивается точность сети.
c)
Вычислительная сложность снижается.
d)
Увеличивается количество параметров сети.
e)
Улучшается качество обучения.
27.
Как функция Dropout улучшает обучение сети?
a)
Исключает случайные нейроны из обучения, предотвращая переобучение.
b)
Ускоряет процесс обучения.
c)
Уменьшает количество параметров.
d)
Нормализует входные данные.
e)
Снижает градиенты для активации.
28.
Какое преимущество дает Batch Normalization в CNN?
a)
Ускоряет сходимость сети за счет нормализации входных данных каждого слоя.
b)
Снижает вычислительную сложность.
c)
Уменьшает потребление памяти.
d)
Исключает градиентное затухание.
e)
Автоматически подбирает оптимальные параметры обучения.
29.
Какое значение имеет шаг смещения фильтра (stride) в процессе свертки?
a)
Определяет размер шага фильтра при обработке данных.
b)
Уменьшает градиентный спуск.
c)
Усредняет значения признаков.
d)
Преобразует каналы изображения.
e)
Увеличивает размер карты признаков.
30.
Что произойдет при увеличении количества фильтров в сверточном слое?
a)
Увеличится объем извлекаемых признаков.
b)
Уменьшится количество параметров.
c)
Потребуется меньше памяти для хранения модели.
d)
Ускорится выполнение сети.
e)
Уменьшится размер карты признаков.
31.
Как влияет увеличение количества слоев в CNN?
a)
Улучшается способность извлекать более сложные признаки.
b)
Уменьшается вероятность переобучения.
c)
Сокращается время обучения.
d)
Увеличивается вероятность потери градиентов.
e)
Снижается точность сети.
32.
Что происходит при использовании слишком больших фильтров?
a)
Потенциально теряется локальная информация.
b)
Увеличивается точность сети.
c)
Ускоряется обратное распространение ошибки.
d)
Уменьшается размер карты признаков.
e)
Увеличивается объем памяти, необходимой для обучения.
33.
Какой эффект оказывает слишком маленький шаг фильтра (stride)?
a)
Увеличивается объем выходных данных.
b)
Уменьшается количество вычислений.
c)
Увеличивается скорость обучения.
d)
Снижается объем извлекаемых признаков.
e)
Улучшается стабильность обучения.
34.
Какое значение имеет использование функции активации ReLU?
a)
Улучшает обучение за счет устранения линейности в сети.
b)
Обеспечивает регуляризацию сети.
c)
Увеличивает вычислительные затраты.
d)
Уменьшает размерность данных.
e)
Исключает вероятность переобучения.
35.
Что лучше использовать для обработки полноцветных изображений в CNN?
a)
Несколько каналов, например RGB.
b)
Одноканальные входы.
c)
Преобразование изображения в черно-белое.
d)
Исключение одного из цветовых каналов.
e)
Нормализация только одного канала.
36.
Чем RNN отличаются от традиционных полносвязных сетей?
a)
Возможностью сохранять информацию о предыдущих шагах.
b)
Применением только к статическим данным.
c)
Использованием фиксированного размера входов.
d)
Исключением скрытых слоев.
e)
Ускоренным временем обучения.
37.
Какой тип задач наиболее часто решается с помощью RNN?
a)
Анализ последовательностей.
b)
Обработка изображений.
c)
Классификация точечных данных.
d)
Сжатие данных.
e)
Генерация случайных чисел.
38.
Что является основной проблемой обучения RNN?
a)
Затухающие или взрывающиеся градиенты.
b)
Слишком большое количество слоев.
c)
Отсутствие алгоритма обратного распространения ошибки.
d)
Невозможность обработки больших данных.
e)
Сложность интеграции с другими архитектурами.
39.
Чем отличаются LSTM от обычных RNN?
a)
Наличием механизмов контроля долгосрочной памяти.
b)
Использованием линейных функций активации.
c)
Уменьшенным количеством параметров.
d)
Отсутствием градиентов.
e)
Упрощенным процессом обучения.
40.
Что из перечисленного относится к рекуррентному блоку GRU?
a)
Объединение состояния памяти и выхода.
b)
Использование нескольких временных окон.
c)
Упрощенный процесс нормализации.
d)
Постоянное изменение архитектуры.
e)
Генерация случайных значений в каждом цикле.
41.
Почему в стандартных RNN возникает проблема затухающих градиентов?
a)
Из-за многократного перемножения малых значений весов.
b)
Из-за отсутствия нормализации данных.
c)
Из-за использования больших шагов обучения.
d)
Из-за малого количества нейронов в слоях.
e)
Из-за одновременной обработки всех элементов последовательности.
42.
Что происходит, если градиенты «взрываются» в RNN?
a)
Обучение становится нестабильным из-за слишком больших значений весов.
b)
Скорость обучения увеличивается.
c)
Сеть начинает переобучаться.
d)
Градиенты становятся равными нулю.
e)
Ошибки на тестовых данных снижаются.
43.
Как RNN обрабатывает последовательные данные?
a)
Передает скрытое состояние из предыдущего шага на следующий.
b)
Обрабатывает каждый элемент независимо.
c)
Использует сверточные фильтры.
d)
Комбинирует входы через полносвязный слой.
e)
Уменьшает размер входных данных через pooling.
44.
Почему RNN не могут эффективно обрабатывать длинные зависимости?
a)
Из-за затухающих градиентов.
b)
Из-за увеличения количества весов с ростом длины последовательности.
c)
Из-за отсутствия механизма нормализации.
d)
Из-за использования фиксированной длины выходного вектора.
e)
Из-за чрезмерного упрощения функций активации.
45.
Как LSTM и GRU решают проблему затухающих градиентов?
a)
Используют специальные механизмы управления памятью, такие как забывающие и обновляющие гейты.
b)
Уменьшают количество параметров сети.
c)
Используют менее сложные функции активации.
d)
Исключают скрытые состояния.
e)
Увеличивают размер градиентов на каждом шаге.
46.
Чем GRU проще LSTM?
a)
Использует меньше гейтов, объединяя забывающий и обновляющий гейт.
b)
Исключает скрытые состояния.
c)
Заменяет сигмоидные функции на линейные.
d)
Обрабатывает только короткие зависимости.
e)
Не поддерживает двунаправленную обработку.
47.
Какие состояния используются в LSTM?
a)
Скрытое состояние (hidden state) и состояние памяти (cell state).
b)
Только скрытое состояние.
c)
Входное состояние и выходное состояние.
d)
Текущее состояние и следующее состояние.
e)
Глобальное и локальное состояние.
48.
Какой гейт отвечает за обновление информации в LSTM?
a)
Input gate (входной гейт).
b)
Forget gate (гейт забывания).
c)
Output gate (выходной гейт).
d)
Reset gate (гейт сброса).
e)
Update gate (гейт обновления).
49.
Что происходит, если значение гейта забывания в LSTM равно 1?
a)
Состояние памяти передается без изменений.
b)
Текущая информация полностью стирается.
c)
Скрытое состояние обнуляется.
d)
Состояние памяти умножается на ноль.
e)
Весовые параметры пересчитываются.
50.
Для чего используется двунаправленная RNN (Bi-RNN)?
a)
Для учета как предыдущего, так и следующего контекста.
b)
Для ускорения обучения.
c)
Для уменьшения сложности модели.
d)
Для работы с неоднородными данными.
e)
Для улучшения работы с длинными зависимостями.
51.
Для какой задачи чаще всего используются RNN?
a)
Обработка последовательностей, таких как текст или временные ряды.
b)
Классификация изображений.
c)
Генерация случайных чисел.
d)
Оптимизация гиперпараметров.
e)
Сегментация изображений.
52.
Какой алгоритм часто используется для генерации текста с помощью RNN?
a)
Sequence-to-Sequence.
b)
ResNet.
c)
Reinforcement Learning.
d)
GAN.
e)
Convolutional Encoder.
53.
Как LSTM помогает в анализе временных рядов?
a)
Учитывает долгосрочные зависимости между данными.
b)
Уменьшает объем вычислений.
c)
Исключает влияние предыдущих шагов.
d)
Ускоряет выполнение предсказаний.
e)
Заменяет градиентный спуск.
54.
Какая архитектура часто используется для перевода текста?
a)
Sequence-to-Sequence с механизмом внимания (Attention).
b)
GAN.
c)
Fully Connected RNN.
d)
VGG.
e)
Max-Pooling RNN.
55.
Как обучить RNN на задаче предсказания следующего элемента в последовательности?
a)
Использовать каждый токен последовательности как вход и выход, сдвинутый на один шаг.
b)
Пропустить все предыдущие элементы.
c)
Обучить сеть на случайных данных.
d)
Использовать только последний элемент.
e)
Применить жесткую регуляризацию.
56.
Что из перечисленного помогает ускорить обучение RNN?
a)
Truncated Backpropagation Through Time (усеченное обратное распространение ошибки).
b)
Использование больших партий данных.
c)
Исключение функций активации.
d)
Увеличение количества параметров.
e)
Использование только коротких последовательностей.
57.
Что происходит при использовании больших шагов обучения для RNN?
a)
Обучение становится нестабильным.
b)
Увеличивается точность сети.
c)
Сеть быстрее обрабатывает данные.
d)
Уменьшается вероятность переобучения.
e)
Сеть теряет способность запоминать контекст.
58.
Как влияет использование большого размера скрытого слоя на производительность RNN?
a)
Увеличивает способность сети запоминать сложные зависимости.
b)
Ускоряет обучение.
c)
Уменьшает объем вычислений.
d)
Приводит к затуханию градиентов.
e)
Исключает ошибки в тестовых данных.
59.
Какой из методов регуляризации лучше всего подходит для RNN?
a)
Dropout, примененный только к рекуррентным соединениям.
b)
Batch Normalization.
c)
Уменьшение количества слоев.
d)
Увеличение количества эпох обучения.
e)
Исключение скрытого состояния.
60.
Что из перечисленного уменьшает проблему взрывающихся градиентов в RNN?
a)
Gradient Clipping (ограничение градиентов).
b)
Увеличение числа рекуррентных связей.
c)
Использование больших партий данных.
d)
Применение линейных функций активации.
e)
Исключение состояния памяти.
61.
Что такое Self-Attention в контексте машинного обучения?
a)
Механизм, позволяющий модели учитывать связь между всеми частями входной последовательности.
b)
Метод для уменьшения размерности данных.
c)
Алгоритм для выбора наиболее важной функции модели.
d)
Техника для ускорения обучения сверточных нейронных сетей.
e)
Подход для генерации случайных весов в нейронной сети.
62.
Как вычисляется внимание (attention score) в механизме Self-Attention?
a)
Через скалярное произведение векторов запроса (query) и ключа (key).
b)
Через сумму векторов запроса и значения (value).
c)
С помощью произведения матрицы весов и вектора значений.
d)
С использованием сверточных операций.
e)
Посредством рекуррентного обновления скрытых состояний.
63.
Какова роль softmax-функции в механизме Self-Attention?
a)
Нормализует веса внимания, превращая их в вероятности.
b)
Уменьшает размерность векторов значений.
c)
Выбирает наиболее важные элементы последовательности.
d)
Применяется для регуляризации.
e)
Обучает параметры модели на этапе предобучения.
64.
Что происходит после вычисления весов внимания в Self-Attention?
a)
Эти веса используются для взвешивания векторов значений.
b)
Веса нормализуются с помощью функции ReLU.
c)
Веса умножаются на ключи, чтобы получить финальный результат.
d)
Все веса отбрасываются, кроме максимального.
e)
Вектора запросов обновляются через матричное умножение.
65.
Какие три матрицы используются в Self-Attention?
a)
Матрицы ключей (keys), запросов (queries) и значений (values).
b)
Матрицы входных данных, скрытых состояний и выходных значений.
c)
Матрицы веса, смещения и активации.
d)
Матрицы сверточных фильтров, значений и нормализации.
e)
Матрицы запросов, нормализации и регуляризации.
66.
Зачем используется механизм Multi-Head Attention в архитектуре Transformer?
a)
Для того чтобы модель могла одновременно учитывать разные аспекты входных данных.
b)
Чтобы уменьшить вычислительную сложность Self-Attention.
c)
Для добавления рекуррентных связей в модель.
d)
Для уменьшения количества обучаемых параметров.
e)
Чтобы заменить линейные преобразования нелинейными.
67.
Как Self-Attention решает проблему фиксированной длины векторов, характерную для RNN?
a)
Учитывает всю последовательность независимо от ее длины.
b)
Использует только первые и последние элементы последовательности.
c)
Резко уменьшает размерность входных данных.
d)
Ограничивает длину входных данных с помощью маскирования.
e)
Вводит рекуррентные связи между соседними элементами.
68.
В чем заключается вычислительная сложность Self-Attention?
a)
Она растет квадратично относительно длины последовательности.
b)
Она остается постоянной независимо от длины входных данных.
c)
Она линейна по отношению к числу параметров модели.
d)
Она растет экспоненциально с длиной последовательности.
e)
Она пропорциональна числу обучаемых слоев.
69.
Почему в Self-Attention важна операция маскирования?
a)
Чтобы предотвратить утечку информации о будущих шагах в авторегрессионных задачах.
b)
Для нормализации входных данных перед обучением.
c)
Чтобы уменьшить размерность входных векторов.
d)
Для снижения вычислительной сложности.
e)
Для улучшения работы softmax-функции.
70.
Какой компонент Self-Attention отвечает за масштабирование внимания?
a)
Деление скалярного произведения запросов и ключей на корень из их размерности.
b)
Добавление смещения к матрице значений.
c)
Умножение ключей на значения.
d)
Применение softmax к результату взвешивания.
e)
Уменьшение числа голов в Multi-Head Attention.
71.
Какой ключевой компонент трансформеров позволяет обрабатывать последовательности параллельно?
a)
Механизм Self-Attention.
b)
Рекуррентные связи.
c)
Конкатенация данных.
d)
Pooling.
e)
Функция Softmax.
72.
Что является основным недостатком рекуррентных сетей, который устраняется трансформерами?
a)
Невозможность параллельной обработки данных.
b)
Ограниченная способность к обучению.
c)
Сложность вычисления градиентов.
d)
Низкая точность в задачах классификации.
e)
Использование сложных функций активации.
73.
Что такое механизм Self-Attention?
a)
Механизм, который оценивает важность элементов последовательности относительно друг друга.
b)
Алгоритм уменьшения размерности данных.
c)
Метод регуляризации при обучении.
d)
Метод преобразования входных данных в латентное пространство.
e)
Функция для выбора наиболее важного входа.
74.
Какую роль играет матрица Query в трансформерах?
a)
Определяет, на что обращать внимание в последовательности.
b)
Преобразует входные данные в латентное пространство.
c)
Вычисляет значения Softmax.
d)
Создает выходные значения сети.
e)
Нормализует выходные данные.
75.
Что является результатом применения механизма Multi-Head Attention?
a)
Учет разных аспектов входной последовательности.
b)
Ускорение вычислений.
c)
Уменьшение объема памяти.
d)
Исключение необходимости обучения весов.
e)
Прямое уменьшение числа параметров модели.
76.
Что из перечисленного происходит в блоке энкодера трансформера?
a)
Преобразование входной последовательности в латентное представление.
b)
Генерация выходной последовательности.
c)
Расчет весов обратного распространения ошибки.
d)
Уменьшение размерности выходных данных.
e)
Прямое преобразование входа в выход.
77.
Какую задачу решает механизм Masked Attention в декодере?
a)
Предотвращает утечку информации о будущих токенах.
b)
Обеспечивает нормализацию данных.
c)
Ускоряет обучение модели.
d)
Снижает вычислительную сложность.
e)
Улучшает прогноз на длинных последовательностях.
78.
Что представляет собой выход декодера трансформера?
a)
Последовательность предсказанных токенов.
b)
Вектор с вероятностями классов.
c)
Окончательный результат классификации.
d)
Латентное представление входных данных.
e)
Упрощенная версия входной последовательности.
79.
Какой метод чаще всего используется для предобучения моделей на основе трансформеров?
a)
Маскирование входных токенов (Masked Language Modeling).
b)
Классификация входных данных.
c)
Уменьшение размерности последовательности.
d)
Создание собственных данных.
e)
Ускоренное обучение за счет уменьшения количества слоев.
80.
Что является основной метрикой при обучении трансформеров на задаче машинного перевода?
a)
BLEU (Bilingual Evaluation Understudy).
b)
MAE (Mean Absolute Error).
c)
MSE (Mean Squared Error).
d)
ROC-AUC.
e)
Perplexity.
81.
Какой принцип обучения используется в модели BERT?
a)
Маскирование токенов (Masked Language Modeling).
b)
Классификация текста.
c)
Генерация последовательностей.
d)
Снижение размерности данных.
e)
Предсказание временных рядов.
82.
Какую задачу выполняет Next Sentence Prediction (NSP) в BERT?
a)
Определяет логическую связанность двух предложений.
b)
Определяет самые важные слова в предложении.
c)
Генерирует следующее слово в последовательности.
d)
Создает латентное представление текста.
e)
Уменьшает размер выходного вектора.
83.
Чем отличается BERT от GPT?
a)
BERT обрабатывает текст в двух направлениях, а GPT - только слева направо.
b)
GPT использует более глубокую архитектуру.
c)
BERT предназначен для генерации текста, а GPT - для классификации.
d)
GPT основан на маскировании токенов.
e)
BERT работает только с рекуррентными сетями.
84.
Как называется предварительно обученная версия BERT для работы с длинными текстами?
a)
Longformer.
b)
RoBERTa.
c)
ALBERT.
d)
DistilBERT.
e)
XLNet.
85.
Какой вид токенизации используется в BERT?
a)
WordPiece.
b)
Byte Pair Encoding (BPE).
c)
SentencePiece.
d)
TF-IDF.
e)
One-Hot Encoding.
86.
Чем ALBERT отличается от BERT?
a)
Уменьшением количества параметров за счет факторизации матриц.
b)
Использованием более глубоких слоев.
c)
Генерацией текста вместо анализа.
d)
Исключением маскированных токенов.
e)
Применением рекуррентных связей.
87.
Какая задача решается с помощью модели RoBERTa?
a)
Повышение производительности BERT за счет использования большего объема данных и улучшенного обучения.
b)
Генерация текста на естественном языке.
c)
Сжатие текста.
d)
Ускорение обработки длинных текстов.
e)
Обучение без использования маскировки.
88.
Как XLNet справляется с ограничениями BERT?
a)
Использует пермутационное обучение вместо маскирования.
b)
Увеличивает длину последовательности.
c)
Заменяет трансформеры рекуррентными слоями.
d)
Исключает NSP (Next Sentence Prediction).
e)
Применяет сверточные фильтры для обработки текста.
89.
Чем DistilBERT отличается от оригинального BERT?
a)
Это упрощенная и менее тяжелая версия BERT.
b)
Использует большее количество параметров.
c)
Включает слои сверточных сетей.
d)
Полностью исключает использование attention.
e)
Применяет только однонаправленный анализ текста.
90.
Какая задача решается с использованием моделей на основе BERT в поисковых системах?
a)
Улучшение понимания запроса и текста страницы.
b)
Классификация изображений.
c)
Обработка временных рядов.
d)
Создание новых запросов для пользователя.
e)
Генерация случайных данных.
91.
Какой механизм attention используется в трансформерах?
a)
Self-Attention.
b)
Global Attention.
c)
Local Attention.
d)
Cross-Attention.
e)
Hierarchical Attention.
92.
Какую задачу решает механизм Multi-Head Attention?
a)
Учет различных аспектов связи между токенами.
b)
Уменьшение вычислительной сложности сети.
c)
Сохранение памяти при обработке текста.
d)
Генерация новых слов в тексте.
e)
Ускорение вычислений на CPU.
93.
Как используется позиционная информация в трансформерах?
a)
Добавляется к входным токенам через позиционные векторы.
b)
Хранится в скрытом состоянии сети.
c)
Учитывается с помощью дополнительных attention-гейтов.
d)
Преобразуется в скрытое пространство через нормализацию.
e)
Исключается из входных данных.
94.
Как называется способ нормализации данных в BERT?
a)
Layer Normalization.
b)
Batch Normalization.
c)
Weight Normalization.
d)
Instance Normalization.
e)
Dropout.
95.
Какую роль выполняет функция Softmax в механизме Attention?
a)
Превращает оценки внимания в вероятностные веса.
b)
Генерирует выходные значения для токенов.
c)
Нормализует выходы между слоями.
d)
Уменьшает размерность входных данных.
e)
Ускоряет обучение.
96.
Как модели на основе трансформеров справляются с обработкой длинных последовательностей?
a)
Используют sparse attention и сокращают количество вычислений.
b)
Уменьшают размер embedding.
c)
Исключают маскировку токенов.
d)
Применяют сверточные слои для агрегации информации.
e)
Увеличивают количество слоев нормализации.
97.
Какой механизм в Longformer помогает справляться с длинными текстами?
a)
Sliding Window Attention.
b)
Bidirectional RNN.
c)
Global Context Embedding.
d)
Attention Dropout.
e)
Truncated Backpropagation.
98.
Как уменьшить время обучения трансформера?
a)
Использовать предварительно обученные модели.
b)
Исключить слои нормализации.
c)
Уменьшить количество attention-голов.
d)
Применять исключительно маскирование.
e)
Отказаться от NSP задачи.
99.
Как решается проблема переобучения в трансформерах?
a)
Использованием Dropout и регуляризации.
b)
Увеличением длины последовательностей.
c)
Исключением маскированных токенов.
d)
Применением большего количества attention-гейтов.
e)
Сокращением данных для обучения.
100.
Какую роль играет Fine-Tuning в обучении BERT?
a)
Адаптирует предварительно обученную модель для специфических задач.
b)
Заменяет этап предобучения.
c)
Исключает использование attention.
d)
Ускоряет процесс генерации данных.
e)
Применяется только для задач классификации.
101.
Упрощенное отражение работы биологической сети, состоящей из нейронов, соединенных между собой дендридами и аксонами:
a)
персептрон
b)
нейросуперкомпьютер
c)
синапс
d)
аксон
e)
дентрид
102.
Какое название соответствует полносвязной нейронной сети прямого распространения?
a)
Многослойный персептрон
b)
Рекуррентный перцептрон
c)
Сверточный персептрон
d)
Резонансный нейрон
e)
Сигмоидальный дендрит
103.
Какую функцию выполняет нейрон в биологических и искусственных нейронных сетях, работая как сумматор входных сигналов?
a)
суммирование
b)
связывание
c)
объединение
d)
агрегация
e)
дизъюнкция
104.
Какой нейрон в нейронной сети пропускает сумму своих входных сигналов через функцию активации?
a)
Сигмоидный нейрон
b)
Тангенс-гиперболический нейрон
c)
Линейный нейрон
d)
Рекуррентный нейрон
e)
Реляционный нейрон
105.
Что характеризует выбор функций активации в концепции персептрона, они являются:
a)
Пороговыми
b)
Линейными
c)
Экспоненциальными
d)
Сигмоидными
e)
Гиперболическими
106.
Какая функция в языке программирования Python используется для вычисления скалярного произведения двух векторов?
a)
dot()
b)
dot_product()
c)
scalar_multiply()
d)
vector_dot()
e)
multiply_dot()
107.
Входом персептрона являются:
a)
вектор, состоящий из вещественных чисел
b)
значения 0 и 1
c)
вектор, состоящий из нулей и единиц
d)
вся вещественная ось
e)
матрица случайных чисел.
108.
К преимуществам нейронных сетей относят:
a)
Все вышеперечисленное.
b)
Устойчивость к шумам во входных данных.
c)
Решение задач при неизвестных закономерностях.
d)
Адаптирование к изменениям окружающей среды.
e)
Увеличение производительности вычислений.
109.
Персептрон представляет собой.
a)
Однослойную или многослойную нейронную сеть.
b)
Однослойную нейронную сеть.
c)
Многослойную нейронную сеть.
d)
Нейронный генератор.
e)
Сверточную нейронную сеть.
110.
Существенным недостатком нейронных сетей является:
a)
Неспособность к экстраполяции.
b)
Способность к обучению.
c)
Неспособность к интерполяции.
d)
Дискретность вывода.
e)
Исключительная устойчивость к шумам.
111.
Однослойный персептрон решает задачи:
a)
классификации и аппроксимации функций
b)
распознавания образов
c)
сжатия данных
d)
обучения с подкреплением
e)
обработки естественного языка
112.
Что называется обучающей выборкой для обучения персептрона?
a)
набор пар входов и выходов, используемых при обучении
b)
набор входных векторов, для которых заранее известны значения аппроксимируемой функции
c)
набор выходных векторов, являющихся точными значениями аппроксимируемой функции
d)
последовательность случайных чисел
e)
координаты точек на плоскости
113.
Подаем на вход персептрона вектор a. В каком случае весовые значения нужно уменьшать?
a)
если на выходе 1, а нужно 0
b)
если на выходе 0, а нужно 1
c)
если сигнал персептрона не совпадает с нужным ответом
d)
всегда, когда на выходе 1
e)
если сигнал персептрона совпадает с нужным ответом
114.
Какой должна быть активационная функция, для того чтобы возможно было применять алгоритм обратного распространения?
a)
всюду дифференцируемой
b)
непрерывной
c)
сжимающей
d)
разжимающей
e)
монотонной
115.
Скрытым слоем обобщенного многослойного персептрона называется:
a)
слой, не являющийся ни входным, ни выходным
b)
все слои являются скрытыми
c)
не производящий вычислений
d)
слой, состоящий из элементов, которые только принимают входную информацию и распространяют ее по сети
e)
слой, отвечающий за генерацию случайных шумов
116.
Искусственный нейрон
a)
является моделью биологического нейрона
b)
имитирует все возможные функции биологического нейрона
c)
по своей функциональности превосходит биологический нейрон
d)
представляет собой совершенно новый вид нейрона
e)
применяется исключительно для обработки звуковых сигналов
117.
Какие нейронные сети характеризуются отсутствием памяти?
a)
без обратных связей
b)
однослойные
c)
многослойные
d)
с обратными связями
e)
рекуррентные
118.
Вопрос о выборе шага при применении процедуры обучения решается следующим образом:
a)
веса и порог следует изменять на 1
b)
веса и порог следует изменять на число, меньше или равно 1
c)
веса и порог следует изменять на целое число
d)
веса и порог следует изменять на число, больше 1
e)
шаг не влияет на процесс обучения
119.
Обучающей парой называется пара векторов,...
a)
первый из которых является входным вектором, а второй – соответствующим ему выходным вектором
b)
которые должна выдавать обученная нейронная сеть
c)
которые подаются на вход сети во время алгоритма обучения
d)
первый из которых является выходным вектором, а второй – соответствующим ему входным вектором
e)
произвольные векторы без связи между ними
120.
Если до начала процедуры обучения по алгоритму обратного распространения все весовые значения сети сделать равными, то
a)
сеть, скорее всего, не обучится
b)
процесс обучения будет замедлен
c)
процесс обучения будет ускорен
d)
процесс обучения будет таким же, как и в других случаях
e)
процесс обучения будет более точным
121.
В алгоритме обучения с учителем сравнение реального выхода с желаемым происходит:
a)
на выходе каждого слоя системы
b)
только на выходе системы
c)
только на выходе первого слоя системы
d)
на входе каждого слоя системы
e)
только в середине обучения
122.
Какие из перечисленных ниже шагов в алгоритме обратного распространения являются шагами «прохода вперед»?
a)
вычислить выход сети; выбрать очередную обучающую пару из обучающего множества; подать входной вектор на вход сети
b)
подкорректировать веса сети так, чтобы минимизировать ошибку
c)
повторять шаги для каждого вектора обучающего множества до тех пор, пока ошибка на всем множестве не достигнет приемлемого уровня
d)
вычислить разность между выходом сети и требуемым выходом (целевым вектором обучающей пары)
e)
вычислить производные по весам
123.
Сигналом ошибки данного выходного нейрона называется:
a)
разность между выходом нейрона и его целевым значением
b)
производная активационной функции
c)
величина OUT для нейрона, подающего сигнал на данный выходной нейрон
d)
произведение веса и входного сигнала
e)
квадратичная функция потерь
124.
Если два образца сильно похожи, то:
a)
они могут вызывать перекрестные ассоциации
b)
они могут объединиться в один образец
c)
они могут нарушать устойчивость сети
d)
они могут быть использованы для улучшения обучения
e)
они могут вызывать иллюзии восприятия
125.
Детерминистским методом обучения называется:
a)
метод, использующий последовательную коррекцию весов, зависящую от объективных значений сети
b)
метод, выполняющий псевдослучайные изменения весовых значений
c)
детерминированный метод обучения с учителем
d)
детерминированный метод обучения без учителя
e)
метод, полностью игнорирующий входные сигналы
126.
Сложная дифференцируемая функция, задающая отображение из исходного признакового пространства в пространство ответов, все параметры которой могут настраиваться одновременно и взаимосвязанно называется:
a)
Искусственная нейронная сеть
b)
Дерево решений
c)
Функция правдоподобия
d)
Синапс нейрона
e)
Регуляризация
127.
Заполните пропуск: … представляет собой элемент, который вычисляет выходной сигнал
a)
Нейрон
b)
Дендрит нейрона
c)
Вес нейрона
d)
Синапс нейрона
e)
Функция активации
128.
Какой тип нейронных сетей является частным случаем слоистых сетей?
a)
Сверточные сети
b)
Рекуррентные сети
c)
Монотонные сети
d)
Цветные сети Петри
e)
Машины Больцмана
129.
Если сеть Хопфилда нашла среди запомненных ею образцов, образец, соответствующий данному входному вектору, то сеть должна:
a)
остановиться в этом образце
b)
выдать на выходе заданный входной вектор
c)
выдать на выходе единицу
d)
вернуть случайный образец из памяти
e)
начать обучение на найденном образце
130.
Входная звезда Гроссберга используется для:
a)
распознавании определенного образа
b)
классификации образов
c)
сбора информации о сходных образах
d)
определения яркости входного сигнала
e)
поиска максимальной активации в слое
131.
Модификация алгоритма обучения нейросети методом «чувства справедливости» заключается в:
a)
занижении весовых значений тех нейронов, которые очень часто «побеждают»
b)
блокировании нейронов, которые очень часто побеждают
c)
повышении весовых значений тех нейронов, которые очень редко «побеждают»
d)
увеличении шага обучения для побеждающих нейронов
e)
случайном изменении весов в зависимости от количества побед
132.
В алгоритме обучения Кохонена обучению подвергаются:
a)
синоптические связи всех нейронов, чье расстояние до входного вектора меньше заданного порога
b)
все синоптические связи
c)
синоптические связи только «победившего» нейрона
d)
случайно выбранные синоптические связи
e)
синоптические связи тех нейронов, чье расстояние до входного вектора больше заданного порога
133.
Паралич сети может наступить, когда:
a)
весовые значения становятся очень большими
b)
размер шага становится очень большой
c)
размер шага становится очень маленький
d)
весовые значения становятся очень маленькими
e)
изменяются только некоторые весовые значения
134.
Механизм контрольной кросс-проверки заключается в:
a)
резервировании части обучающих пар и использовании их для независимого контроля процесса обучения
b)
циклическом использовании множества обучающих пар
c)
разделении множества обучающих пар на две части для поочередного запуска алгоритма обратного распространения то на одной, то на другой части
d)
использовании случайно выбранных образцов для обучения
e)
подстройке весов после каждой итерации обучения
135.
Чтобы избежать паралича сети, необходимо:
a)
уменьшить размер шага
b)
увеличить размер шага
c)
увеличить весовые значения
d)
уменьшить весовые значения
e)
изменить функцию активации
136.
Если области связи нейронов имеют постоянный размер во всех слоях, то:
a)
может потребоваться большое количество слоев для перекрытия всего входного поля
b)
области связи могут настолько сильно друг друга перекрывать, что многие нейроны выходного слоя будут иметь одинаковую реакцию
c)
могут возникнуть «дыры» в перекрытии областями связи, что может привести к «неопознанным» образам
d)
размер областей связи не влияет на распознавание образов
e)
можно использовать меньше слоев, чтобы уменьшить вычислительную сложность
137.
При стохастическом методе обучения изменения весовых значений сохраняются, …
a)
если они уменьшают целевую функцию
b)
если они увеличивают целевую функцию
c)
в любом случае
d)
если они не влияют на целевую функцию
e)
если они приводят к переобучению
138.
Сети прямого распространения — это:
a)
сети, у которых нет памяти, и сети, у которых нет соединений, идущих от выходов некоторого слоя к входам предшествующего слоя
b)
сети, у которых есть память
c)
сети, имеющие много слоев
d)
сети, использующие обратные связи
e)
сети, способные обрабатывать последовательные данные
139.
Какой метод используется для обучения модели в Keras?
a)
fit()
b)
evaluate()
c)
predict()
d)
compile()
e)
train()
140.
Какие два основных типа моделей доступны в Keras?
a)
Sequential и класс Model
b)
Dense и Convolutional
c)
LSTM и GRU
d)
Входные и выходные модели
e)
Embedding и Recurrent
141.
Техника обучения нейросети, которая использует множество слоев для решения сложных проблем (например, распознавания речи) с помощью шаблонов, называется:
a)
Глубокое обучение
b)
Обучение с учителем
c)
Обучение без учителя
d)
Перцептрон Розенблатта
e)
Сверточное обучение
142.
Слой Dense реализует операцию: output = activation(dot(input, kernel) + bias) где kernel – это:
a)
матрица слоя весов
b)
вектор смещения, созданный слоем
c)
функция активации
d)
шаг обучения
e)
размер батча
143.
Слой Dense реализует операцию: output = activation(dot(input, kernel) + bias) где bias – это:
a)
вектор смещения, созданный слоем
b)
матрица слоя весов
c)
функция активации
d)
шаг обучения
e)
размер батча
144.
Нейронная сеть, которая имеет специальную архитектуру, которая позволяет ей максимально эффективно распознавать образы называется:
a)
Кохонена
b)
Сверточная
c)
Рекуррентная
d)
Розенблатта
e)
Перцептрон
145.
Впервые использовать сверточные нейронные сети предложил:
a)
Ян Лекун
b)
Кохонен
c)
Розенблатт
d)
Минковский
e)
Крижевский
146.
В чем основное преимущество модели ResNet по сравнению с другими моделями?
a)
За счет skip-connections удается избежать проблемы затухающего градиента, что помогает сделать нейронную сеть достаточно глубокой, чтобы хорошо справляться с поставленными задачами
b)
В данной модели используется batch-нормализация, что позволяет модели лучше обучаться
c)
В модели в качестве функций активации используются гиперболические тангенсы
d)
В модели применяются dropout-cлои, которые помогают бороться с переобучением
e)
В модели в качестве функций активации используются сигмоиды
147.
Какие две основные трудности появляются при переходе от задачи локализации к задаче детекции?
a)
В задаче детекции мы заранее не знаем, сколько объектов на самом деле расположено на изображении. Соответственно, мы не можем просто поставить полносвязный слой с определенным количеством параметров на выходе сети: нужны более сложные техники
b)
В задаче детекции мы не можем использовать сверточные слои, так как могут работать с признаками только для одного объекта
c)
Для каждого обнаруженного объекта зачастую приходится еще решать задачу классификации, что усложняет работу сети
d)
Для оценки задачи детекции не подходит метрика качества IoU.
e)
Нужно использовать более сложные способы для оценки результатов работы модели
148.
Выберите верные утверждения про адверсальные атаки на нейронные сети:
a)
Атаки black box легче обнаружить по сравнению с атаками white box, так как при атаке black box необходимо сделать большое количество запросов к модели, что легко отследить владельцу модели
b)
За счет доступа к градиенту моделей атаки black box работают намного эффективнее по сравнению с атаками white box
c)
Дообучение модели на атакованных данных с корректными метками помогает защититься только от атак white box
d)
Атаки white box, как правило, требуют меньше вычислительных ресурсов, чем атаки black box
e)
Использование отдельной модели, которая пытается определить, подается обычное или измененное изображение.
149.
Сеть какого типа лучше использовать для прогнозирования временных рядов?
a)
Рекуррентную
b)
Сверточную
c)
ART MAP
d)
Импульсную
e)
MLP
150.
Применим ли алгоритм обратного распространения ошибки к обучению рекуррентных персептронных сетей?
a)
применим с учетом зависимости сигналов от их значений в предыдущие моменты времени
b)
неприменим
c)
применим без изменений
d)
применим с использованием градиентного спуска
e)
неприменим из-за отсутствия обратных связей
151.
Какие из этих метрик используют для оценки генерации текстов?
a)
BLEU, ROUGE, METEOR
b)
F-score
c)
NUBIA
d)
Accuracy
e)
ROC-AUC
152.
На какие задачи обучается BERT?
a)
Предсказание следующего предложения
b)
Предсказание скрытого слова
c)
Предсказание следующего слова
d)
Перевод
e)
Понимание тональности текста
153.
В чем недостатки RNN?
a)
RNN не могут отслеживать долгосрочные зависимости
b)
Обучение занимает много времени
c)
Плохо параллелятся на несколько видеокарт
d)
Сложны в реализации
e)
Низкая точность предсказания
154.
Каковы преимущества Attention?
a)
Multi-head attention позволяет обращать внимание на разные аспекты
b)
Легко реализовать
c)
Можно распределить на несколько видеокарт
d)
Скорость обучения быстрее, чем RNN
e)
Приводит к переобучению модели
155.
В какой из моделей впервые была представлена архитектура «трансформер»?
a)
GPT
b)
GloVe
c)
BERT
d)
ULMFit
e)
ELMo
156.
Трансформер обращает внимание на самое важное слово в предложении:
a)
Центральное
b)
Входное
c)
Следующее
d)
Последнее
e)
Рандомное
157.
Какая из моделей не является авторегрессионной?
a)
BERT
b)
GPT
c)
TransformerXL
d)
XLNet
e)
ELMo
158.
Ряд основных направлений использования методов искусственного интеллекта:
a)
Верны все перечисленные
b)
Прием и распознавание изображений
c)
Мониторинг и прогнозирование
d)
Распознавание образов и классификация
e)
Создание интеллектуальных информационных систем
159.
Традиционное творчество - это техническая или программная система, способная решать хранящиеся в памяти задачи, относящиеся к определенной предметной области...
a)
Интеллектуальная система
b)
Логическая система расчета
c)
Рефлекторная система
d)
Адаптивная система
e)
Экспертная система
160.
В 1949 году физиолог, нейропсихолог, который хотел, чтобы закон стал отправной точкой для изучения нейронных сетей?
a)
Дональд Олдинг Хебб
b)
Мак Каллох
c)
Дж. Хопфилд
d)
Джон фон Нейман
e)
Фрэнк Розенблатт
161.
Человеческий мозг состоит приблизительно из … нейронов.
a)
86 млрд.
b)
50 млрд.
c)
45 млрд.
d)
80 млрд.
e)
100 млрд.
162.
Группа алгоритмов, способных обучаться на примерах, извлечении невидимых законов из базы данных и взаимосвязи простых процессорных систем.
a)
Нейронная сеть
b)
Система с коммутативной способностью
c)
Биологический нейрон
d)
Индуктивная система
e)
Экспертная система
163.
Структуры, влияющие на силу импульса для соединения аксона и дендрита...
a)
синапсы
b)
тело нейрона
c)
аксоны
d)
дендриты
e)
движение пульса
164.
Выходная импульсная мощность
a)
H1output = factivation (H1input)
b)
y = f(x)=f( 1 1+ 2 2+ 3 3)
c)
H1input= (I1 * W1)+(I2 * W2)
d)
x= 1 1+ 2 2+ 3 3
e)
H1input = (I1 * W1) + 1 1+ 2 2
165.
Когда возникла система искусственного интеллекта как научное направление, связанное с машинным моделированием интеллектуальной функции человека?
a)
в 50-х годах ХХ века
b)
в 60-х годах ХХ века
c)
в 80-х годах ХХ века
d)
в 90-е годы XIX века
e)
в 50-х годах XIX века
166.
Из скольких этапов состоит работа нейросети?
a)
3
b)
2
c)
4
d)
6
e)
5
167.
Процессы в науке и технологии, которые решат проблему компьютерного образования в будущем
a)
Машинное обучение
b)
Машина Тьюринга
c)
Линии Кохонена
d)
Коннекционизм
e)
Компьютер
168.
Не относится к широкому спектру приложений машинного обучения.
a)
сеть радиальных базисных функций
b)
медицинский диагноз
c)
приложения в экономики
d)
робототехника
e)
техническая экспертиза фонда
169.
Задачей создания доверительной области (квантовой оценки) является:
a)
область минимального объема с очень плавной границей с заданной долей пробы
b)
группировка объектов в кластеры с использованием данных о сходстве связей
c)
в классе линейных реконструкций наиболее популярным примером является метод главных компонент
d)
необходимо найти такие признаки и такие признаки наиболее распространенных признаков в описании предметов
e)
это сигмоидальная форма или тип однонаправленной сети
170.
Задачей кластеризации является:
a)
группировка объектов в кластеры с использованием данных о сходстве связей
b)
сигналы, поступающие от слоя нейронов
c)
область наименьшего объема с очень гладкой границей с долей пробы
d)
самый популярный компонентный метод в классе линейных реконструкций
e)
группирует объекты в классы, используя данные о непохожести ссылок
171.
В современных моделях нейронов пороговая функция заменена нелинейной функцией, называемой передаточной функцией или функцией активации нейрона.
a)
y = f(x) = f(1/(1 + exp(-S)))
b)
M = {a1, a2,…, an}
c)
x= 1 1+ 2 2+ 3 3
d)
M = {x | x : = f }
e)
y = f(x)=f( 1 1+ 2 2+ 3 3)
172.
В каком году Джон фон Нейман полностью разработал архитектуру нейронной сети, отличающуюся от нейронной сети персептрона.
a)
1955 г.
b)
1957 г.
c)
1965 г.
d)
1928 г.
e)
1931 г.
173.
Предположим, что P(x) — это некоторое свойство, которому удовлетворяют или не удовлетворяют элементы множества A. Итак, как записать множество M, состоящее из всех элементов множества A, удовлетворяющих свойству P?
a)
M = {x | P(x)}
b)
M = {х: х – P(x)}
c)
M = {x | x: = P(x)}
d)
M = {х: х}
e)
M = {x | P(x) = 1}
174.
Процедура генерации - это
a)
метод получения элементов набора из ранее полученных элементов или объектов
b)
метод, который может представлять только конечные множества со списком
c)
метод вычитания из последних полученных элементов
d)
метод, указывающий на принадлежность элемента множеству, если выполняется условие для элемента множества, в противном случае - нет
e)
метод, который может представлять только начальные множества со списком
175.
Если все элементы множества A находятся в множестве B, то множество A называется ... множества B.
a)
подмножеством
b)
внешним набором
c)
пустым набором
d)
набором рангов
e)
подпространством
176.
Множество всех подмножеств A -
a)
универсальный набор
b)
конечное множество
c)
подпространство
d)
линейная комбинация
e)
пустой набор
177.
Множество, состоящее из элементов, принадлежащих хотя бы одному из множеств A и B
a)
Сочетание комплектов А и В
b)
Пересечение множеств A и B
c)
Разница между наборами А и Б
d)
Сумма множеств А и В
e)
Декартово произведение множеств A и B
178.
Множество всех возможных элементов, которые можно рассмотреть, называется ... и обозначается U.
a)
универсальный набор
b)
набор рангов
c)
конечное множество
d)
подмножество
e)
пустой набор
179.
Объединение взаимных разностей множеств А и В называется....
a)
кольцевое соединение
b)
слияние
c)
различия
d)
перекресток
e)
актуальность
180.
Нейронные сети, которые используют сигналы для прямого распространения или передачи (от одного нейрона к другому) от одного слоя к другому.
a)
персептрон
b)
доход
c)
Восток
d)
скрытый
e)
сигмоидальный
181.
Сигмоидальная форма или тип однонаправленной сети
a)
Многослойный персептрон
b)
сигмоидальная функция
c)
Входные сигналы
d)
Линии Кохонена
e)
Сеть ЖБА
182.
Приближённый метод -
a)
это научный метод, который заменяет объекты в их первоначальном виде, в некотором смысле, в упрощенном виде
b)
представляет собой нейронную сеть прямого распространения сигнала с промежуточным (скрытым) слоем симметричных нейронов
c)
особый тип машинной памяти, используемый в очень быстрых поисковых приложениях
d)
задача, требующая разделения объектов на непересекающиеся подмножества, называемые кластерами, причем каждый кластер состоит из одинаковых объектов
e)
сигмоидальный тип или тип однонаправленной сети
183.
Выполняет роль функции активации нейронов
a)
сигмоидальная функция
b)
многослойный персептрон
c)
сеть радиальных базисных функций
d)
алгоритм обратного распространения ошибки
e)
линейная функция
184.
Основные задачи сетей Кохонена
a)
Классификация (классификация), предсказание, кластеризация
b)
Кластеризация, Ассоциативная память
c)
Сжатие информации, Прогнозирование
d)
Ассоциативная память, Сжатие информации
e)
Оптимизация, сжатие информации
185.
Основные задачи рекуррентных нейронных сетей
a)
Предсказание, Ассоциативная память, Сжатие информации
b)
Оптимизация, классификация,
c)
Классификация (Классификация), Кластеризация
d)
Сжатие информации, Классификация, Прогнозирование
e)
Ассоциативная память, кластеризация
186.
Для алгоритма обратного распространения функция должна быть везде
a)
дифференцируемой
b)
логистической
c)
функцией сжатия
d)
кластеризацией
e)
сигмоидальной
187.
На нижнем уровне иерархии находится входной слой сенсорных элементов, задачей которого является только передача входной информации по сети...
a)
прием и выдача
b)
распространение и выпуск
c)
принять и скрыть
d)
обработка и вывод
e)
прятать и распространять
188.
Мозг состоит из множества...
a)
из взаимосвязанных нейронов
b)
от ячейки с двумя соединениями
c)
из молекул, не связанных связями
d)
от протонов, связанных связями
e)
из элементов с соединениями
189.
Нейрон имеет разветвленную входную структуру...
a)
информационный (дендриты), ядро и разветвленный выход (аксон).
b)
интеграции (синапсы), ядро и разветвленный вывод (аксон).
c)
информационный (дендриты), атомный и разветвленный вход (аксон).
d)
информационные (дендриты), ядро и кольцевой выход (аксон).
e)
фрагменты, атом и разветвленная запись (xon).
190.
Аксоны клеток связаны с дендритами других клеток с помощью...
a)
синапсы
b)
сигналы
c)
ядра
d)
оболочки
e)
персонал
191.
Нейрон активируется, если...
a)
суммарный уровень сигналов от дендритов к его ядру превышает определенный уровень (порог активации).
b)
сигнал идет от аксонов.
c)
вибрируют синапсы.
d)
общий уровень сигналов взаимно погашен.
e)
волна приходит извне.
192.
Нейроны...
a)
специальные ячейки, способные передавать электрохимические сигналы.
b)
специальные ячейки, способные подавлять электрохимические сигналы.
c)
специальные клетки, способные передавать химические сигналы.
d)
специальные ячейки, способные передавать электрические сигналы.
e)
специальные клетки, способные передавать механические сигналы.
193.
Искусственная нейронная сеть обычно обучается...
a)
с учителем
b)
без учителя
c)
с помощью
d)
независимо
e)
с экраном
194.
Нейронная сеть
a)
с помощью математических моделей пытается создать машины с искусственным интеллектом, выполняющие функции человеческого мозга
b)
увеличивает работу человеческого мозга, чтобы создавать машины с искусственным интеллектом посредством искусственных моделей
c)
воспроизводит работу человеческого мозга с помощью компьютера
d)
увеличивает производительность компьютера с помощью человеческого мозга
e)
увеличивает активность мозга с помощью химических моделей
195.
На основе какого критерия можно классифицировать нейронные сети?
a)
Верны все перечисленные
b)
Архитектура сети
c)
Тип функции активации
d)
Процент ошибки
e)
Скорость обучения
196.
В сетях прямого распространения все коммуникации направлены на...
a)
строго от входных нейронов к выходным
b)
строго от выходных нейронов к входным нейронам
c)
от входных нейронов к выходным и наоборот
d)
от внешних нейронов к внутренним нейронам
e)
от нейрона к нейрону
197.
Простой персептрон был изобретен ...
a)
Ф. Розенблатт
b)
Л. Зайд
c)
Б. Страуструп
d)
Л. Торвальдс
e)
Л. Заде
198.
«Победитель» - нейрон Кохонена:
a)
с максимальным значением -NET.
b)
с минимальным значением -NET.
c)
с минимальным значением OUT.
d)
с максимальным значением OUT.
e)
со средним значением OUT.
199.
Синапс - это...
a)
связь между двумя нейронами
b)
который принимает информацию, простой расчет для него
c)
входной слой, принимающий информацию
d)
возможность прогнозировать шаг
e)
распределение данных по параметрам
200.
Нейрон - это...
a)
вычислительный блок, принимающий информацию, производящий над ней простые вычисления и пересылающий ее
b)
часть, которая генерирует информацию и простой расчет для нее
c)
входной слой, принимающий информацию
d)
возможность прогнозировать шаг
e)
распределение данных по параметрам
201.
Каждый нейрон имеет 2 основных параметра:
a)
input (входные данные) и output (выходные данные)
b)
синапс, аксон.
c)
вывоз, транспортировка.
d)
умение прогнозировать, формулировать.
e)
параметры, функции
202.
Ассоциативная память - это...
a)
особый тип машинной памяти.
b)
часть, которая генерирует информацию и простой расчет для нее.
c)
входной слой, принимающий информацию.
d)
возможность прогнозировать шаг.
e)
распределение данных по параметрам
203.
Ассоциативная память используется...
a)
очень быстрый поиск приложений
b)
та часть, которая формирует информацию и в простом расчете к ней.
c)
во входном слое, который получает информацию.
d)
в умении прогнозировать шаг.
e)
распределение данных по параметрам
204.
Сжатие информации - ...
a)
алгоритмическое сжатие информации для уменьшения получаемого объема.
b)
часть, которая генерирует информацию и простой расчет для нее.
c)
входной слой, принимающий информацию.
d)
возможность прогнозировать шаг.
e)
распределение данных по параметрам
205.
Сжатие информации используется...
a)
для эффективного использования устройств хранения и передачи данных
b)
часть, которая генерирует информацию и для простых вычислений на ней
c)
для входного слоя, который получает информацию
d)
для предсказания высоты тона
e)
разбивать данные по параметрам
206.
Предсказание - это...
a)
оценка возможных путей развития на основе накопленного опыта и текущих прогнозов.
b)
часть, которая генерирует информацию и простой расчет для нее.
c)
входной слой, принимающий информацию.
d)
возможность прогнозировать шаг.
e)
распределение данных по параметрам.
207.
Оптимизация - ...
a)
найти наилучшее решение задачи при заданных условиях и ограничениях.
b)
часть, которая генерирует информацию и простой расчет для нее.
c)
входной слой, принимающий информацию.
d)
возможность прогнозировать шаг.
e)
распределение данных по параметрам.
208.
Какая система не является эвристической поисковой системой:
a)
Нервная система
b)
Роботизированные системы
c)
Системы распознавания
d)
Игровые системы
e)
Системы связи
209.
Интеллект различается по трем направлениям. Назови их.
a)
Философский, биологический, психологический.
b)
Биологические, социологические, технические.
c)
Психологический, технический, философский.
d)
Технические, философские, биологические.
e)
Философский, биологический, технический.
210.
Два направления искусственного интеллекта...
a)
биологический, лингвистический
b)
психологический, прагматический
c)
бионический, прагматичный
d)
биологические, психологические
e)
прагматичный, научный
211.
Общее название группы алгоритмов, которые могут учиться на примерах, извлекая невидимые шаблоны из базы данных.
a)
Нейронные сети
b)
Экспертные системы
c)
Диагностика
d)
Информационная система
e)
Искусственный интеллект
212.
Компьютерные технологии способны решать широкий круг задач, работая по принципу строения и функции нейронов человеческого мозга:
a)
Нейронная сеть
b)
Эксперт
c)
Диагностика
d)
Информационная
e)
Искусственность
213.
Какие существуют типы нейронных сетей?
a)
Биологический нейрон и искусственный нейрон
b)
Экспертный нейрон и диагностический нейрон
c)
Искусственный нейрон и диагностический нейрон
d)
Биологический нейрон и экспертный нейрон
e)
Все ответы правильные
214.
Дендрит...
a)
принимает нейронные импульсы.
b)
дает нейронный импульс.
c)
образования, влияющие на силу импульса.
d)
нейрон переходит в возбужденное состояние.
e)
масса синапсов меняется со временем.
215.
Аксон...
a)
дает нейронный импульс.
b)
принимает нейронные импульсы.
c)
образования, влияющие на силу импульса.
d)
нейрон переходит в возбужденное состояние.
e)
масса синапсов меняется со временем.
216.
Способность мозга решать интеллектуальные задачи путем приобретения, запоминания и целенаправленного изменения знаний в процессе обучения через опыт и адаптации к различным ситуациям - это
a)
Интеллект
b)
Образование
c)
Алгоритм
d)
Система
e)
Модель
217.
Результатом познания действительности, которая отражается в сознании человека в виде идей, понятий, суждений и теорий, проверенных практикой и подтвержденных логикой, является
a)
Образование
b)
Алгоритм
c)
Система
d)
Модель
e)
Интеллект
Reset
