wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

intro to ML bgu

Total questions: 125

Worksheet time: 1hrs 3mins

Name
Class
Date
1.

Occam's razor

a)

the simplest explanation is usally the correct one

b)

the simplest explanation is usally the wrongone

2.

K fold use to

a)

create train/test split

b)

ignore train/test split

3.

which one is the true confusion matrix ?

a)

predict

TP | FP

actual ______

FN | TN

b)

predict

FN | FP

actual ______

TP | TN

4.

Overfitting

a)

means that it learns the training set too well – it overfits to the training set such that it performs poorly on the test set.

b)

when model is too simple, both training and test errors are large

5.

Underfitting

a)

means that it learns the training set too well – it overfits to the training set such that it performs poorly on the test set.

b)

when model is too simple, both training and test errors are large

6.

Bias

a)

is a learner’s tendency to consistently learn the same wrong thing.

b)

s the tendency to learn random things irrespective of the real signal.

7.

Variance

a)

is a learner’s tendency to consistently learn the same wrong thing.

b)

is the tendency to learn random things irrespective of the real signal.

8.

top right

top left

down right

doen left

a)

low variance - high bias

high variance - high bias

low variance - low bias

high variance - low bias

b)

low variance - high bias

high variance - low bias

low variance - low bias

high variance - high bias

9.

what is Regularization and how it use?

a)

Fighting Overfitting

Early Stopping • Inject Randomness • Ensemble Methods

b)

Loving Overfitting

Never Stopping • avoid Randomness • Ensemble Methods

10.

• AdaBoost (Freund & Schapire, 1996)

• Gradient Boosted Trees (Friedman, 1999)

• Stochastic gradient boosted distributed

decision trees (Ye et al., 2009)

are ____ methods

a)

Iterative Methods

b)

Non-Iterative Methods

11.

• Random decision forests (Ho, 1995)

• Bagging (Bootstrap aggregating) (Breiman,

1996)

• Random Subspace Decision Forest (Ho, 1998)

are ____ methods

a)

Iterative Methods

b)

Non-Iterative Methods

12.

Name The Activation functions

a)

Sigmoid

b)

ELU

c)

tanh

d)

ReLU

13.

Name The Activation functions

a)

Sigmoid

b)

ELU

c)

tanh

d)

ReLU

14.

Name The Activation functions

a)

Sigmoid

b)

ELU

c)

tanh

d)

ReLU

15.

what are the benfits of fat+short NN vs thin+tall NN

a)

fat+short NN can run in parallel faster

b)

thin+tall NN can run in parallel faster

c)

no benefits

d)

none of the answer

16.

Data set is imbalanced, what can we do to train the model better ?

a)

Undersampling

b)

Oversampling

c)

Oversampling

and Undersampling

d)

Oversampling

xor Undersampling

17.

Correlation does not imply Causation

a)

true

b)

false

18.

The Rashomon Effect - in decision trees , if the training set is

perturbed only slightly

a)

we can get a tree quite different

from the original but with almost the same test set error.

b)

we will get the same tree difference on the test set error.

19.

Generative vs. Discriminative

a)

create data vs label data

b)

both label data

c)

label data vs create data

d)

both create data

20.

why using log(p) and not p itself?

a)

easier to calculate joint prob

b)

based on Rule of succession

c)

Laplace Correction

21.

In Naive Bayes, we are unable to make prediction if a new

category is observer in test phase. how can we overcome this problem?

a)

smoothing probs

b)

Adding a minimal prob

c)

create "unknown"

category

22.

Gradient Descent

is

a)

Analytic

b)

Iterative

23.

Newton Method

is

a)

Analytic

b)

Iterative

24.

MAE and MSE are like

a)

Ridge & Lasso

b)

Lasso & Ridge

25.

Elastic Net is combination of

a)

Ridge & Lasso

b)

random forest and bagging

c)

random forest and boosting

d)

Relu anf Tanh

26.

Shrinkage means

a)

Taking the weights of the model in partial

b)

Taking all the weights of the mode

27.

Missingness in training sample in CART can be Handled by

a)

split the instance into pieces

b)

instance to randon path

c)

Dynamic programming

d)

no way

28.

using only classification error as split condition cant hurt the

a)

classification error

b)

InfoGain

c)

run time

d)

storage

29.

Naive bayes is

a)

Weak Learner

b)

Strong Learner

30.

Derive strong learner from weak learners

a)

boosting

b)

bagging

c)

both

d)

none

31.

Bagging

a)

Each model receives equal weight

b)

Each model receives diffrent weight

32.

when we use LOOVC (one out)

a)

report the mean

error on the test set

b)

small train set

c)

max mse

d)

max mae

33.

True positive rate (TPR) / Sensitivity / recall

a)

P(Test is positive, patient has disease)

TP/(TP+FN)

b)

P(Test is negative patient does not have disease)

TN/(TN+FP)

c)

𝑇𝑃/(𝑇𝑃 + 𝐹𝑃)

34.

True negative rate (TNR), Specificity

a)

P(Test is positive, patient has disease)

TP/(TP+FN)

b)

P(Test is negative patient does not have disease)

TN/(TN+FP)

c)

𝑇𝑃/(𝑇𝑃 + 𝐹𝑃)

35.

preicsion

a)

P(Test is positive, patient has disease)

TP/(TP+FN)

b)

P(Test is negative patient does not have disease)

TN/(TN+FP)

c)

𝑇𝑃/(𝑇𝑃 + 𝐹𝑃)

36.

when to use to use P-R and not ROC curve ?

a)

class imbalance

ROC present prefect picture wehn data imbalance

b)

class balance

ROC present prefect picture wehn data balance

c)

never

d)

always

37.

what is the opposite approach to Single Linkage clustering

a)

Average Linkage clustering

b)

Max Linkage clustering

c)

KNN Linkage clustering

d)

Turn dendrogram clustering

38.

ברנדום פורסט , גודל האנסמבל תמיד שווה למספר האיטרציות שנקבע ע"י המשתמש

a)

נכון

b)

לא נכון

39.

באגינג ורנדום פורסם ניתנים למיקבול בקוד

a)

נכון

b)

לא נכון

40.

הגדלת כמות הנוירונים בשכבת הביניים ברשת נוירונים תלת מימדית לרוב תגדיל את טעות השונות

a)

נכון

b)

לא נכון

41.

הגדלת כמות הנוירונים בשכבת הביניים ברשת נוירונים תלת מימדית לרוב תגדיל את הדיוק על קבוצת הלימוד

a)

נכון

b)

לא נכון

42.

אדה - בוסט מקטין את ההטייה ואת השונות

a)

נכון

b)

לא נכון

43.

באגינג מקטין את ההטייה ואת השונות

a)

נכון

b)

לא נכון

44.

בהינתן פונקציה בני משתנים , אם קיימת נקודת אופטימום הרי ששיטת ניוטון תמצא אותה באיטרציה אחת

a)

נכון

b)

לא נכון

45.

ברשת אוטו - אינקודר תמיד היה ניתן לשחזר בדיוק למידע המקורי

a)

נכון

b)

לא נכון

46.

לפי "אין ארוחות חינם" אין אלגוריתם אחד שמנצח את כל האחרים לכל בעיה

a)

נכון

b)

לא נכון

47.

KKT

אם התנאי מתקיים עבור בעיה ריבועית , דבר זה מייצג תנאי מספק לפתרון אופטימלי גלובלי

a)

נכון

b)

לא נכון

48.

ברשת נוירונים כשמשתמשים

SGD ב

epoch ב

יחיד הוא עובר על חלקים אקראיים

בdata

a)

לא נכון

b)

נכון

49.

האם נגדיל את

max depth

באלגוריתם

RF

אז הסיכוי ל

overfitting

יגדל

a)

לא נכון

b)

נכון

50.

אם נגדיל את

learning rate

באלגוריתם

gradient boosting tree

אז הסיכוי ל

Overfitting

יגדל

a)

לא נכון

b)

נכון

51.

One hot encoding

הופך משתנה קטגוריאלי למשתנים בינאריים

a)

לא נכון

b)

נכון

52.

CNN לרוב רשת

LeNet מסוג

מדויקת יותר מרשת עמוקה רגילה לצורך זיהוי ספרות.

a)

לא נכון

b)

נכון

53.

פונקציית האקטיבציה מסוג

tanh

אינה סובלת מהבעיה של

Vanishing Gradient

a)

לא נכון

b)

נכון

54.

האלגוריתם AdaGrad

אינו מתאים למקרים שבהם נדרשים כמות גדולה של איטרציות.

a)

לא נכון

b)

נכון

55.

אם מדד ה-AUC

של מודל A

גבוה יותר מזה של מודל B

, אזי בהכרח הדיוק של מודל A

גבוה מזה של מודל B.

a)

לא נכון

b)

נכון

56.

באלגוריתמים מסוג

AdaBoost וGBM

רמת הדיוק על קבוצת הבדיקה עשויה להמשיך ולהשתפר גם כאשר רמת הדיוק על קבוצת הלימוד הגיעה ל100%.

a)

נכון

b)

לא נכון

57.

לכל x

קטן מ0 תוצאת פונקציית

RELU

תחזיר ערך קטן יותר מאשר

sigmoid

a)

נכון

b)

לא נכון

58.

השימוש בכלל השרשרת נועד לאפשר "גילגול" אחורה של הגרדיאט גם ברשתות עמוקות.

a)

נכון

b)

לא נכון

59.

גם ב xgboost וגם ב ANN

יש משתנה שמשמש ל regulation.

(למדא)

טענה: אם נגדיל אותו אז ה

variance יקטן

bias ויגדל.

a)

נכון

b)

לא נכון

60.

אם פלט של נוירון היה -0.2 אפשר להגיד בוודאות שפונקצית האקטיבציה שלו לא הייתה

Sigmoid

a)

נכון

b)

לא נכון

61.

בצומת בעץ יש 80 מופעים עם תיוג 1 ו-20 מופעים עם תיוג 0. מה האנטרופיה

a)

(-20/100)*log (80/100)

+

(-80/100)*log (20/100)

b)

(-20/100)*log (20/100)

+

(-80/100)*log (80/100)

62.

GBM

עובד רק עם עצים

a)

נכון

b)

לא נכון

63.

 שיטת נראות מקסימלית סוברת שיש לאמוד את הפרמטרים במודל כך שההסתברות לקבל את קבוצת הלימוד תהיה מקסימלית. 

a)

נכון

b)

לא נכון

64.

במודל Naive Bayes

מניחים כי ערכי תכונות הקלט בלתי תלויים אחד בשני.

a)

נכון

b)

לא נכון

65.

פתרון נומרי אינו נדרש לקבלת המקדמים ברגרסיה לינארית פשוטה.

a)

נכון

b)

לא נכון

66.

בשיטת המורד התלול כיוון החיפוש הוא תמיד כיוון ירידה.

a)

נכון

b)

לא נכון

67.

הגדלת מרכיב ה-

Cost בשיטת

SVM

יגדיל את המשקל שאנו נותנים לטעיות של המודל ובכך יקטין את כמות הטעיות של המודל על קבוצת הלימוד

(training error)

אבל הדבר לא בהכרח יקטין את הטעויות על קבוצת הבדיקה

(test error).

a)

נכון

b)

לא נכון

68.

השימוש ב-

Kernel

נדרש בעיקר כדי לפתור בעיות סיווג לא לינאריות

a)

נכון

b)

לא נכון

69.

הסיבה ל-

log likelihood

בשיטת הנראות המקסימלית היא הימנעות מ-

underflow.

a)

נכון

b)

לא נכון

70.

ככל שעץ החלטה יותר עמוק אז השגיאה על האימון קטנה

a)

נכון

b)

לא נכון

71.

בעץ, כדי לדעת את ההסתברות לתצפית להיות ב

class

נבצע

pruning.

a)

נכון

b)

לא נכון

72.

לרוב עומק עץ ב-

gradient boosting

הינו עמוק יותר מעומק עץ ב

random forest.

a)

נכון

b)

לא נכון

73.

מה הם המרכיבים המגדירים למידה חישובית?

a)

א. משימה לביצוע (T)

b)

ב. מדד לביצוע (P)

c)

ג. ניסיון נצבר (E)

d)

ד. כל התשובות נכונות

74.

על פי מודל 4 השכבות, איזה מהמשפטים הבאים אינו נכון

a)

א. כל יישום יכול להשתמש במספר משימות למידה שונות

b)

ב. כל מודל למידה ממומש על יד אלגוריתם אחד בלבד

c)

ג. ישנם מודלים שיכולים לשמש למשימות למידה שונות 

75.

שאלת ה-

XOR

מדגימה מצב שבו קריטריון הפיצול המבוסס על

Information Gain

אינו יכול למדוד את  תרומתה של תכונה למודל כולו

a)

נכון

b)

לא נכון

76.

אם אנו מעוניינים לקבל הערכת הסתברות לכל

Class

ולא רק את החלטת סיווג, אזי רצוי לא לגזום את העץ. 

a)

נכון

b)

לא נכון

77.

בעץ החלטה אם השתמשנו בתכונה מסוימת לפיצול בשורש לא ניתן להשתמש בתכונה זו לפיצול נוסף בעץ.

a)

נכון

b)

לא נכון

78.

קריטריון Gain Ratio אינו מיועד לטפל בתכונות נומינליות בעלות מספר רב של ערכים אפשריים 

a)

true

b)

false

79.

שיטת

Shrinkage

מאפשרת להימנע מ-

Over fitting

a)

true

b)

false

80.

טענה: כל פונק' בוליאנית עם משתני קלט בינאריים ניתנת לייצוג באמצעות רשת נוירונים מתאימה.

a)

true

b)

false

81.

לפניך רשת עם משתני קלט שיכולים לקבל משתנים בינאריים

(X1,X2).

איזו מהפונק' הבינאריות הבאות הרשת יכולה לקרב?

a)

or

b)

and

c)

xor

d)

nor

82.

הקלט לשכבת

Convolution

היא תמונה בגודל

32X32X3

. 3Xמפעילים 5 פילטרים בגודל 3

עם Stribe=3 ו- Pad=2.

מהו גודל הפלט?

a)

א. 10*12*5 = 600

b)

ב. 12*12*5 = 720

c)

ג. 10*10*5 = 500

83.

באלגוריתם מסוג

AdaBoost

רמת הדיוק על קבוצת הבדיקה עשויה להמשיך ולהשתפר גם כאשר רמת הדיוק על קבוצת הלימוד הגיעה ל- 100%.

a)

true

b)

false

84.

אם מדד ה-

AUC

של מודל

A

גבוה מזה של מודל

B

, אזי בהכרח הדיוק

(Accuracy)

של מודל A

גבוה מזה של מודל

B

a)

true

b)

false

85.

לצורך דילול יער של עצים, רצוי לדלל עצים עם קורלציה נמוכה עם תכונת המטרה ו/או עצים אחרים.

a)

true

b)

false

86.

מודל

RNN

מאפשר בין היתר ללמוד מודל המקבל כקלט רצף של ערכים ופולט ערך בודד

a)

true

b)

false

87.

כלל האצבע לפיו מספר הנוירונים בשכבת הביניים שווה לממוצע האלגברי של מספר הנוירונים בשכבת הקלט והפלט אינו מתאים למודל

AutoEncoder

a)

true

b)

false

88.

לצורך בניית מודל

Stacked Autoencoders

כל התצפיות חייבות לכלול את ערך תכונת המטרה.   

a)

true

b)

false

89.

במודל

SVM

עם פונקציית

Kernel

  יש צורך לדעת את הפונקציה המופרשת לתרגום התצפיות מהמרחב המקורי למרחב החדש.   

a)

נכון

b)

לא נכון

90.

ההבדל בין

Ensemble 

ל- Mixtures of Experts

, הוא שב-

Ensemble

המסווגים נוצרו מאותו אלגוריתם בסיס וב-

MoE

אין בהכרח הדבר כך

a)

לא נכון

b)

נכון

91.

לרוב כדי להגיע לאותה רמת דיוק, מספר העצים הנדרש ב-

RandomForest

נמוך ממספר העצים הנדרש בשיטת

Gradient Boosted Tree.   

a)

נכון

b)

לא נכון

92.

מודל

CNN

מיועד אך ורק לסיווג תמונות.    

a)

נכון

b)

לא נכון

93.

זמן הריצה הנדרש כדי ללמוד עץ בודד על פי אלגוריתם

C4.5

גדול יותר מזמן הריצה הנדרש לצורך לימוד

RandomForest

עם עץ בודד

a)

נכון

b)

לא נכון

94.

בשיטת המורד התלול כיוון החיפוש הוא תמיד כיוון ירידה

a)

נכון

b)

לא נכון

95.

שיטת ניוטון טובה להתכנסות לאזור המינימום גם כאשר נקודת ההתחלה אינה קרובה לנקודת האופטימום

a)

נכון

b)

לא נכון

96.

רגרסיה לוגיסטית מתאימה לפתרון בעיות סיווג בינאריות ובעיות

Multi-class

a)

נכון

b)

לא נכון

97.

שיטת

Shrinkage

מאפשרת להימנע מ

-Over fitting

a)

נכון

b)

לא נכון

98.

בגישת

SVM

הסרת תצפיות שאינן

support vectors

מתוך קבוצת הלימוד לא תשפיע אף פעם על המודל שהתקבל    

a)

נכון

b)

לא נכון

99.

באלגוריתם מסוג

AdaBoost

רמת הדיוק על קבוצת הבדיקה עשויה להמשיך ולהשתפר גם כאשר רמת הדיוק על קבוצת הלימוד הגיעה ל- 100%.

a)

לא נכון

b)

נכון

100.

ניתן לפתור בצורה טובה את בעיית

Rating Prediction

במערכת המלצה על ידי אימון רשת עמוקה עם שכבת

Embedding

של

User_ID ו-Item_ID.

a)

לא נכון

b)

נכון

101.

לצורך דילול יער של עצים, רצוי לדלל עצים עם קורלציה נמוכה עם תכונת המטרה ו/או עצים אחרים

a)

לא נכון

b)

נכון

102.

מודל

RNN

מאפשר בין היתר ללמוד מודל המקבל כקלט רצף של ערכים ופולט ערך בודד.

a)

לא נכון

b)

נכון

103.

1.         כלל האצבע לפיו מספר הנוירונים בשכבת הביניים שווה לממוצע האלגברי של מספר הנוירונים בשכבת הקלט והפלט אינו מתאים למודל

AutoEncoder

a)

לא נכון

b)

נכון

104.

לצורך בניית מודל

Stacked Autoencoders

כל התצפיות חייבות לכלול את ערך תכונת המטרה

a)

לא נכון

b)

נכון

105.

במודל

Naive Bayes

מניחים כי ערכי תכונות הקלט בלתי תלויים אחד בשני

a)

נכון

b)

לא נכון

106.

kernel

משמש כפונקציית דמיון בין 2 תצפיות.

a)

נכון

b)

לא נכון

107.

בעץ החלטה לבעיות רגרסיה לנתונים רועשים עם חריגים

(outliers),

בעת ביצוע הסיווג עדיף להשתמש בחציון ולא בממוצע.

a)

נכון

b)

לא נכון

108.

לרוב עומק עץ ב

- gradient boosting

הינו עמוק יותר מעומק עץ ב

random forest.

a)

נכון

b)

לא נכון

109.

שימוש ב

Lasso

נועד על מנת למנוע

overfitting

a)

נכון

b)

לא נכון

110.

נוירון בודד -

perceptron

יכול לפתור כל פונקציה בולאנית.

a)

נכון

b)

לא נכון

111.

בבעיה בינארית לא מאוזנת

(imbalanced)

, מודל פשטני שמחזיר תמיד

Majority voting

יקבל ערך

AUC

גבוה

a)

לא נכון

b)

נכון

112.

יש צורך לסווג תמונה

x

לשני

Class-ים:

A ו-B

שההסתברויות האפריוריות שלהם בהתאמה

P(A)=0.4, P(B)=0.6 .

ההסתברות לקבלת ה-x

הנ"ל בהינתן A

היא 0.7 ואילו ההסתברות לקבלת ה-

x

הנ"ל בהינתן

B

היא 0.3. לפי שיטת

Naïve Bayes,

ה-Class

שיש לבחור כדי להביא למינימום את תוחלת הטעות הוא

B.

a)

נכון

b)

לא נכון

113.

זמן הלימוד הנדרש להפעלת הפרוצדורה

LOOCV  Leave-one-out Cross Validation-

על טבלה עם 100 דוגמאות ארוך לפחות פי 10 מזמן הלימוד הפרוצדורה

CV-10Folds

על אותה טבלה.

a)

נכון

b)

לא נכון

114.

ללא תלות בסוג המסווג שנבנה, תמיד קיימת אפשרות למצוא בשיטות אנליטיות פתרון מדויק למשתני המסווג.

a)

נכון

b)

לא נכון

115.

האלגוריתם הבסיסי

SVM

מיועד לפתרון בעיות בינאריות בלבד

a)

נכון

b)

לא נכון

116.

אחד היתרונות של אלגוריתם

Bagging

על אלגוריתם

AdaBoost

הוא ש-

Bagging

ניתן לביצוע מקבילי ללא כל שינוי בקוד, כך שכל מסווג נבנה במעבד אחר/מחשב אחר

a)

נכון

b)

לא נכון

117.

האלגוריתם

AdaBoost

שהוצג בכתה מיועד לפתרון בעיות בינאריות בלבד.

a)

נכון

b)

לא נכון

118.

הגדלת מספר הנוירונים בשכבה המוסתרת של רשת נוירונים תלת-שכבתית לרוב תקטין את מרכיב טעות ה-

bias

a)

נכון

b)

לא נכון

119.

הגדלת מספר הנוירונים בשכבה המוסתרת של רשת נוירונים תלת-שכבתית לרוב תגדיל את הדיוק על קבוצת הבדיקה

a)

נכון

b)

לא נכון

120.

הקטנת טעות

Bias

תביא בהכרח להגדלת טעות

Variance

a)

נכון

b)

לא נכון

121.

נתונה הפונקציה

f(x1,x2)=2x12+3x1+5x22+6x1x2

אזי אם קיימת נקודת אופטימום הרי ששיטת ניוטון תמצא בהכרח את הפתרון המדויק תוך אטרציה אחת ללא תלות בנקודה שממנה מתחילים בחיפוש.

a)

נכון

b)

לא נכון

122.

כל רשת נוירונים רב שכבתית ניתנת לתיאור באמצעות רשת תלת-שכבתית

a)

לא נכון

b)

נכון

123.

באלגוריתם

SVM,

הייצוג הדואלי נועד לאפשר שימוש ב-

Kernel

ללא ידיעת מפורשת של פונקצית ההמרה.

a)

לא נכון

b)

נכון

124.

על פי התער של

Occam,

אם לשני מודלים יש את אותה הטעות על קבוצת הלימוד, אזי יש להעדיף את המודל הפשוט יותר.

a)

לא נכון

b)

נכון

125.

קיום תנאי

KKT

עבור בעיה שאינה ריבועית, מייצגת את התנאי הכרחי לפתרון אופטימלי גלובלי.

a)

לא נכון

b)

נכון