wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Основи штучних нейронних мереж ОКС

Total questions: 100

Worksheet time: 50mins

Name
Class
Date
1.
Хто вважається "батьками" першої математичної моделі штучного нейрона (1943 рік)?
a)
Ілон Маск та Сем Альтман
b)
Воррен Мак-Каллок та Волтер Піттс
c)
Френк Розенблатт та Марвін Мінський
d)
Алан Тюрінг та Джон фон Нейман
2.
Що таке Тест Тюрінга?
a)
Тест на знання мови Python
b)
Перевірка, чи може машина мислити так, щоб людина не відрізнила її від іншої людини
c)
Тест на швидкість обчислення градієнтів
d)
Екзамен для отримання водійських прав автопілотом
3.
Який термін описує здатність системи виконувати творчі функції, які зазвичай вважаються прерогативою людини?
a)
Штучний інтелект
b)
Штучна дурість
c)
Великі дані
d)
Хмарні обчислення
4.
Як пов'язані AI (ШІ), ML (Машинне навчання) та DL (Глибоке навчання)?
a)
Це три назви однієї й тієї ж технології
b)
DL — це частина ML, а ML — це частина AI
c)
AI — це частина DL, а DL — це частина ML
d)
Вони ніяк не пов'язані, це конкуруючі фірми
5.
Який нейрокомп'ютер представив Френк Розенблатт у 1960 році?
a)
HAL 9000
b)
Skynet-Beta
c)
Марк-1
d)
Deep Blue
6.
Яку книгу написали Мінський та Пейперт у 1969 році, що трохи "охолодила" запал до нейромереж?
a)
"Чому нейромережі — це круто"
b)
"Персептрони"
c)
"Глибоке навчання для чайників"
d)
"Як підкорити світ за допомогою ШІ"
7.
Що є основною відмінністю між звичайним алгоритмом та нейромережею?
a)
Нейромережа споживає більше електрики
b)
Звичайний алгоритм має чітку інструкцію, а нейромережа навчається на даних
c)
Нейромережа завжди помиляється
d)
Алгоритми пишуть люди, а нейромережі — роботи
8.
Яка головна перевага нейронних мереж перед жорсткими алгоритмами?
a)
Вони вміють варити каву
b)
Адаптивність та здатність до узагальнення
c)
Вони працюють без комп'ютера
d)
Їм не потрібні дані
9.
Що таке "Зима штучного інтелекту"?
a)
Період, коли сервери перегріваються і їх виносять на сніг
b)
Період спаду інтересу та фінансування досліджень ШІ
c)
Назва нового блокбастера
d)
Сезон знижок на відеокарти
10.
Який елемент біологічного нейрона відповідає за передачу сигналу до інших клітин (вихід)?
a)
Дендрит
b)
Сома
c)
Аксон
d)
Мітохондрія
11.
Що в штучному нейроні виконує роль синапсів (місць з'єднання), які посилюють або послаблюють сигнал?
a)
Вагові коефіцієнти (ваги)
b)
Функції активації
c)
Вхідні дані
d)
Зміщення (bias)
12.
З чого складається "net" (зважена сума) у штучному нейроні?
a)
Сума всіх входів
b)
Сума добутків вхідних сигналів на їхні ваги
c)
Добуток всіх входів
d)
Випадкове число, яке генерує процесор
13.
Навіщо нейрону потрібне зміщення (bias)?
a)
Щоб зсувати графік функції активації, дозволяючи активуватися навіть при нульових входах
b)
Для краси
c)
Щоб заплутати студента
d)
Це помилка в коді, його не повинно бути
14.
Яка головна задача функції активації?
a)
Нагрівати процесор
b)
Додати нелінійність у модель та вирішити, чи "вистрелить" нейрон
c)
Просто помножити все на 2
d)
Зберігати дані
15.
Якщо біологічний нейрон працює за принципом "все або нічого", то штучний нейрон...
a)
Працює тільки у вихідні
b)
Може видавати неперервні значення (наприклад, 0.75)
c)
Теж завжди видає тільки 0 або 1
d)
Видає випадкові числа
16.
Скільки входів може мати штучний нейрон?
a)
Тільки один
b)
Тільки два
c)
Стільки, скільки ми запрограмуємо (n входів)
d)
Не більше 10
17.
Чим штучний нейрон кардинально відрізняється від біологічного?
a)
Він не помирає і не потребує їжі
b)
Він розумніший
c)
Він складається з білка
d)
Нічим, це точна копія
18.
З яких трьох типів елементів складався класичний персептрон Розенблатта?
a)
Вхід, Вихід, Каса
b)
S (сенсори), A (асоціативні), R (реагуючі)
c)
X, Y, Z
d)
Нейрони, протони, електрони
19.
Яку головну задачу може вирішувати простий персептрон?
a)
Писати вірші
b)
Лінійна класифікація (розділення даних прямою лінією)
c)
Генерація відео
d)
Психоаналіз
20.
Що стверджує теорема збіжності персептрона?
a)
Персептрон ніколи не навчиться
b)
Якщо рішення існує, персептрон знайде його за скінченний час
c)
Персептрон завжди зіб'ється зі шляху
d)
Персептрон навчиться миттєво
21.
Яке правило використовується для навчання найпростішого персептрона (правило Хебба)?
a)
Якщо помилився — збільшуй ваги активних входів, якщо ні — не чіпай (або навпаки при хибному спрацьовуванні)
b)
Якщо помилився — видаляй нейромережу
c)
Міняй ваги випадковим чином
d)
Питай у ChatGPT
22.
Яку лінію будує персептрон для розділення двох класів на площині?
a)
Параболу
b)
Пряму лінію
c)
Коло
d)
Синусоїду
23.
Якщо вага зв'язку додатна, то цей зв'язок є...
a)
Гальмівним
b)
Збудливим
c)
Нейтральним
d)
Депресивним
24.
Що станеться з простим персептроном, якщо дані не є лінійно роздільними?
a)
Він просто втомиться
b)
Він буде вічно коливатися і не знайде ідеального рішення
c)
Він вибухне
d)
Він намалює криву лінію
25.
Функція активації "Одиничний стрибок" (Step function) видає:
a)
Будь-яке число
b)
Тільки 0 або 1
c)
Тільки -1 або 1
d)
Тільки 42
26.
Яку логічну операцію НЕ міг вирішити одношаровий персептрон, що викликало критику Мінського?
a)
AND (І)
b)
OR (АБО)
c)
XOR (Виключне АБО)
d)
NOT (НІ)
27.
Чому XOR є проблемою для одного нейрона?
a)
Бо нейрон не любить літеру X
b)
Бо точки (0,0) і (1,1) не можна відділити однією прямою від (0,1) і (1,0)
c)
Бо це занадто складно для комп'ютера 60-х
d)
Бо для цього потрібно 3 входи
28.
Що вирішило проблему XOR?
a)
Додавання прихованих шарів (Multilayer Perceptron)
b)
Збільшення яскравості монітора
c)
Видалення функції активації
d)
Магія
29.
Як називається шар, який знаходиться між вхідним та вихідним?
a)
Секретний шар
b)
Прихований шар (Hidden layer)
c)
Загублений шар
d)
Шар-привид
30.
Що робить вхідний шар (Input Layer)?
a)
Думає
b)
Просто передає дані далі без змін
c)
Множить все на нуль
d)
Видає результат класифікації
31.
Що означає термін "повнозв'язна мережа" (Dense/Fully Connected)?
a)
Всі нейрони з'єднані в одне велике коло
b)
Кожен нейрон одного шару з'єднаний з кожним нейроном наступного шару
c)
Мережа підключена до інтернету
d)
Всі ваги дорівнюють одиниці
32.
Що таке "пряме поширення" (Forward Propagation)?
a)
Рух сигналу від входу до виходу для отримання передбачення
b)
Рух помилки від виходу до входу
c)
Процес встановлення Windows
d)
Копіювання файлів на флешку
33.
Що дозволяють робити глибокі мережі (Deep Learning) на відміну від неглибоких?
a)
Витрачати більше грошей на відеокарти
b)
Будувати ієрархію ознак (від ліній до фігур і об'єктів)
c)
Працювати повільніше
d)
Нічого, це просто маркетинг
34.
Скільки нейронів у вихідному шарі для бінарної класифікації (так/ні)?
a)
1
b)
2
c)
10
d)
0
35.
Що показує функція втрат?
a)
Скільки часу витрачено на навчання
b)
Наскільки сильно помиляється мережа (різниця між прогнозом і фактом)
c)
Скільки нейронів "померло"
d)
Вартість електроенергії
36.
Яка мета навчання нейромережі в контексті функції втрат?
a)
Зробити її максимальною
b)
Зробити її нульовою або мінімальною
c)
Зробити її від'ємною
d)
Залишити її без змін
37.
Яку функцію втрат найчастіше використовують для задач регресії (передбачення числа)?
a)
MSE (Середньоквадратична помилка)
b)
Cross-Entropy
c)
Accuracy
d)
Random Forest
38.
Чому в MSE помилку підносять до квадрату?
a)
Щоб ускладнити життя студентам
b)
Щоб помилка завжди була додатною і сильніше штрафувати за великі промахи
c)
Тому що комп'ютери люблять квадрати
d)
Це помилка в формулі
39.
Яку функцію втрат використовують для задач класифікації (наприклад, кіт чи собака)?
a)
MAE
b)
Cross-Entropy (Перехресна ентропія)
c)
MSE
d)
Sinus
40.
Що таке MAE?
a)
Середня абсолютна помилка (модуль різниці)
b)
Максимальна активна енергія
c)
Метод аналізу емоцій
d)
Головний архітектор енкодера
41.
Якщо loss = 0, це означає, що...
a)
Мережа зламалася
b)
Мережа ідеально вгадала всі приклади (або перенавчилася)
c)
Мережа нічого не знає
d)
Забули увімкнути живлення
42.
Візуалізація функції втрат для двох ваг нагадує:
a)
Пряму лінію
b)
Ландшафт з горами та долинами (поверхня помилок)
c)
Чорний квадрат Малевича
d)
Хмару точок
43.
Що таке градієнт?
a)
Це кольоровий перехід у Photoshop
b)
Вектор, що вказує напрямок найшвидшого зростання функції
c)
Скалярна величина помилки
d)
Ім'я першого програміста
44.
Куди ми маємо рухатися по поверхні помилок, щоб навчити мережу?
a)
Вгору, до зірок
b)
В напрямку антиградієнта (проти градієнта), вниз у "долину"
c)
Вліво
d)
Стояти на місці
45.
Що таке Learning Rate (швидкість навчання)?
a)
Швидкість інтернету в лабораторії
b)
Розмір кроку, який ми робимо при оновленні ваг
c)
Кількість лекцій, які студент вивчив за ніч
d)
Кількість нейронів у шарі
46.
Що станеться, якщо Learning Rate занадто великий?
a)
Ми навчимося миттєво
b)
Ми можемо "перестрибнути" мінімум і розхитати систему
c)
Нічого страшного
d)
Комп'ютер зависне
47.
Що станеться, якщо Learning Rate занадто малий?
a)
Навчання буде йти дуже довго, як черепаха
b)
Мережа перенавчиться
c)
Мережа забуде все, що знала
d)
Градієнт зникне
48.
Який тип градієнтного спуску оновлює ваги після кожного окремого прикладу?
a)
Batch Gradient Descent
b)
Stochastic Gradient Descent (SGD)
c)
Mini-batch Gradient Descent
d)
Lazy Descent
49.
Який тип градієнтного спуску є "золотою серединою" і використовується найчастіше?
a)
Оновлення раз на рік
b)
Mini-batch Gradient Descent (оновлення порціями)
c)
Batch Gradient Descent
d)
Random Descent
50.
Глобальний мінімум - це:
a)
Найменша можлива помилка на всій поверхні
b)
Будь-яка яма на графіку
c)
Мінімальна зарплата програміста
d)
Локальна яма, з якої не вибратися
51.
Для чого потрібен алгоритм Backpropagation?
a)
Щоб передбачати майбутнє
b)
Щоб ефективно обчислити градієнти для всіх ваг у мережі
c)
Щоб повернути час назад
d)
Щоб створити архітектуру мережі
52.
Яке математичне правило лежить в основі Backpropagation?
a)
Теорема Піфагора
b)
Ланцюгове правило диференціювання (Chain Rule)
c)
Правило буравчика
d)
Закон Ома
53.
У якому напрямку поширюється помилка при Backpropagation?
a)
Від входу до виходу
b)
Від виходу до входу (назад)
c)
Випадково
d)
З центру до країв
54.
Хто "винен" у помилці мережі?
a)
Тільки останній нейрон
b)
Всі нейрони, і Backprop розподіляє цю "провину" (градієнт) між ними
c)
Розробник
d)
Користувач
55.
Що ми робимо після того, як обчислили градієнти за допомогою Backprop?
a)
Йдемо пити каву
b)
Оновлюємо ваги за допомогою оптимізатора
c)
Видаляємо ваги
d)
Міняємо вхідні дані
56.
Чи є Backpropagation алгоритмом навчання?
a)
Так, це єдиний алгоритм
b)
Ні, це метод обчислення градієнтів, який використовується оптимізаторами
c)
Це назва нейромережі
d)
Це вірус
57.
Чому не можна просто порахувати похідну для кожної ваги окремо, трохи змінивши її?
a)
Можна, але це буде неймовірно довго для мільйонів ваг
b)
Це заборонено законом
c)
Це неможливо математично
d)
Комп'ютери не вміють віднімати
58.
Що таке "кешування" в контексті прямого проходу для Backprop?
a)
Збереження картинок у браузері
b)
Збереження проміжних значень активацій, бо вони потрібні для формул зворотного проходу
c)
Очищення пам'яті
d)
Запис результатів на диск
59.
Що таке "Епоха" (Epoch)?
a)
Період в історії
b)
Один повний прохід через весь навчальний набір даних
c)
Один крок оновлення ваг
d)
100 років навчання
60.
Що таке "Батч" (Batch)?
a)
Набір команд Windows
b)
Пакет (група) прикладів, які обробляються за один раз перед оновленням ваг
c)
Весь датасет
d)
Один приклад
61.
Що таке "Ітерація"?
a)
Повторення одного й того ж слова
b)
Одне оновлення параметрів моделі (обробка одного батча)
c)
Те саме, що й епоха
d)
Те саме, що й навчання
62.
Якщо у нас 1000 картинок, а розмір батча 100. Скільки ітерацій в одній епосі?
a)
100
b)
10
c)
1000
d)
1
63.
Навіщо ми перемішуємо (Shuffle) дані перед кожною епохою?
a)
Щоб заплутати мережу
b)
Щоб мережа не запам'ятовувала порядок прикладів і вчилася стабільніше
c)
Це не обов'язково
d)
Щоб було веселіше
64.
На які три частини зазвичай ділять дані?
a)
Початок, Середина, Кінець
b)
Train (Навчання), Validation (Валідація), Test (Тест)
c)
Хороші, Погані, Злі
d)
Текст, Картинки, Відео
65.
Навіщо потрібен валідаційний набір (Validation Set)?
a)
Для оновлення ваг
b)
Для налаштування гіперпараметрів та перевірки під час навчання (щоб не підглядати в тест)
c)
Він не потрібен
d)
Для фінальної перевірки замовником
66.
Коли ми використовуємо тестовий набір (Test Set)?
a)
Кожного ранку
b)
Тільки один раз в самому кінці, щоб чесно оцінити модель
c)
Замість навчального
d)
Для підбору Learning Rate
67.
Псевдокод навчання виглядає як:
a)
Forward -> Loss -> Backward -> Update
b)
Backward -> Loss -> Forward -> Update
c)
Loss -> Update -> Forward
d)
Update -> Update -> Update
68.
Що таке "Узагальнення" (Generalization)?
a)
Здатність моделі говорити загальними фразами
b)
Здатність моделі добре працювати на нових, не бачених раніше даних
c)
Здатність моделі запам'ятати тренувальні дані
d)
Узагальнення всіх ваг в одну
69.
Симптоми перенавчання (Overfitting):
a)
Помилка на Train висока, на Validation висока
b)
Помилка на Train низька, а на Validation висока (велика різниця)
c)
Помилка скрізь низька
d)
Мережа відмовляється працювати
70.
Симптоми недонавчання (Underfitting):
a)
Модель погано працює і на тренувальних, і на валідаційних даних
b)
Модель ідеально працює
c)
Модель працює тільки на нових даних
d)
Комп'ютер вимикається
71.
Аналогія перенавчання в житті:
a)
Студент зрозумів суть предмету
b)
Студент зазубрив відповіді на білети, але не може вирішити нову задачу
c)
Студент не відкривав підручник
d)
Студент прийшов на перездачу
72.
Що таке Dropout?
a)
Виключення студента з університету
b)
Метод регуляризації, де випадково "вимикають" нейрони під час навчання
c)
Втрата інтернет-з'єднання
d)
Видалення поганих даних
73.
Як працює Data Augmentation (аугментація даних)?
a)
Ми купуємо нові дані
b)
Ми штучно збільшуємо датасет, повертаючи/зсуваючи картинки, щоб зменшити перенавчання
c)
Ми видаляємо половину даних
d)
Ми стискаємо дані в архів
74.
Що таке Early Stopping (рання зупинка)?
a)
Зупинити навчання, коли помилка на валідації перестала падати
b)
Піти додому раніше з роботи
c)
Зупинити навчання, коли помилка на Train стала нуль
d)
Зупинити, коли набридне
75.
Регуляризація L1 та L2 (Weight Decay) робить:
a)
Ваги максимально великими
b)
Додає "штраф" за великі ваги, змушуючи модель бути простішою
c)
Видаляє шари мережі
d)
Прискорює навчання в 10 разів
76.
Чому лінійна функція активації (або її відсутність) — це погано для глибоких мереж?
a)
Бо це не модно
b)
Бо вся мережа перетворюється на одну велику лінійну регресію, скільки шарів не додай
c)
Бо вона не диференціюється
d)
Бо вона споживає багато пам'яті
77.
Яка основна проблема функції Sigmoid?
a)
Вона занадто проста
b)
Проблема зникаючого градієнта (Vanishing Gradient) на краях
c)
Вона видає від'ємні числа
d)
Вона не має похідної
78.
У якому діапазоні видає значення Sigmoid?
a)
(0, 1)
b)
(-1, 1)
c)
(0, нескінченність)
d)
(-нескінченність, +нескінченність)
79.
У якому діапазоні видає значення Tanh (гіперболічний тангенс)?
a)
(0, 1)
b)
(-1, 1)
c)
(0, 100)
d)
Тільки позитивні
80.
Яка функція активації є стандартом "де-факто" для прихованих шарів сьогодні?
a)
Sigmoid
b)
ReLU (Rectified Linear Unit)
c)
Step function
d)
Linear
81.
Як виглядає формула ReLU?
a)
y = x
b)
y = max(0, x)
c)
y = 1/x
d)
y = sin(x)
82.
Що таке проблема "мертвих нейронів" (Dying ReLU)?
a)
Коли нейрони фізично згорають
b)
Коли нейрон завжди видає 0 і градієнт теж 0, тому він перестає навчатися
c)
Коли нейрони втомлюються
d)
Це назва рок-гурту
83.
Яка варіація ReLU вирішує проблему мертвих нейронів, пропускаючи невеликий мінус?
a)
Dead ReLU
b)
Leaky ReLU
c)
Sigmoid
d)
Strict ReLU
84.
Яку функцію активації ставлять на вихідний шар для багатокласової класифікації (щоб сума ймовірностей була 1)?
a)
ReLU
b)
Softmax
c)
Sigmoid
d)
Tanh
85.
Чому звичайні повнозв'язні мережі (MLP) погані для картинок?
a)
Вони не розрізняють кольори
b)
Втрачається просторова структура пікселів і виходить забагато ваг
c)
Вони не люблять котиків
d)
Вони занадто швидкі
86.
Що є основним будівельним блоком CNN?
a)
Цегла
b)
Згортковий шар (Convolutional Layer)
c)
Рекурентний шар
d)
Табличний шар
87.
Що робить фільтр (ядро) у згортці?
a)
Видаляє віруси
b)
Ковзає по зображенню і шукає ознаки (лінії, кути)
c)
Робить зображення чорно-білим
d)
Зменшує розмір файлу
88.
Що таке "Feature Map" (Карта ознак)?
a)
Карта доріг
b)
Результат застосування фільтра до зображення
c)
Список налаштувань мережі
d)
Вхідне зображення
89.
Навіщо потрібен шар Pooling (Підвибірка)?
a)
Щоб збільшити зображення
b)
Щоб зменшити розмірність, кількість параметрів і зробити мережу стійкою до зсувів
c)
Щоб розмити зображення
d)
Щоб додати кольору
90.
Як працює Max Pooling?
a)
Вибирає середнє значення
b)
Вибирає максимальне значення з віконця (наприклад, 2x2)
c)
Вибирає мінімальне значення
d)
Вибирає випадкове значення
91.
Що робить шар Flatten перед подачею на повнозв'язний шар?
a)
Робить картинку плоскою (2D)
b)
Розгортає багатовимірну матрицю в один довгий вектор (1D)
c)
Видаляє всі дані
d)
Стискає дані в архів
92.
Що "бачать" перші шари CNN?
a)
Цілі об'єкти (котів, собак)
b)
Прості примітиви: лінії, грані, кольорові плями
c)
Тільки шум
d)
Текст
93.
Що таке "Спільне використання ваг" (Parameter Sharing) в CNN?
a)
Всі нейрони мають одну вагу
b)
Один і той самий фільтр використовується для всього зображення (шукаємо одну ознаку скрізь)
c)
Ми позичаємо ваги у сусідів
d)
Це коли дві мережі ділять одну відеокарту
94.
Де зазвичай знаходиться повнозв'язний шар у архітектурі CNN?
a)
На самому початку
b)
В кінці, для фінальної класифікації
c)
Між кожним згортковим шаром
d)
Його там немає
95.
CNN були натхненні:
a)
Будовою зорової кори тварин/людей (локальні поля сприйняття)
b)
Будовою слухового апарату
c)
Архітектурою фон Неймана
d)
Грою в тетріс
96.
Що таке "чорна скринька" в контексті нейромереж?
a)
Пристрій для запису аварій
b)
Проблема інтерпретації: ми знаємо вхід і вихід, але важко пояснити, ЧОМУ мережа так вирішила
c)
Корпус комп'ютера
d)
Секретна технологія
97.
Яка головна проблема глибоких мереж з Sigmoid активацією?
a)
Вони занадто точні
b)
Зникаючий градієнт (мережі перестають вчитися)
c)
Занадто швидке навчання
d)
Вони споживають мало пам'яті
98.
Для чого використовують GPU (відеокарти) в навчанні?
a)
Щоб грати в ігри поки мережа вчиться
b)
Для ефективного паралельного виконання матричних операцій
c)
Щоб було гарно
d)
CPU не вміє множити числа
99.
Якщо ваша модель показує точність 99% на Train і 50% на Test, у вас:
a)
Геніальна модель
b)
Жорстке перенавчання (Overfitting)
c)
Недонавчання
d)
Помилка в коді
100.
Найважливіший інгредієнт для успіху нейронної мережі це:
a)
Найдорожчий комп'ютер
b)
Якісні та чисті дані (Data)
c)
Найскладніший код
d)
Кава для програміста