Font size
Worksheetsintro to ML bgu
Total questions: 125
Worksheet time: 1hrs 3mins
Occam's razor
the simplest explanation is usally the correct one
the simplest explanation is usally the wrongone
K fold use to
create train/test split
ignore train/test split
which one is the true confusion matrix ?
predict
TP | FP
actual ______
FN | TN
predict
FN | FP
actual ______
TP | TN
Overfitting
means that it learns the training set too well – it overfits to the training set such that it performs poorly on the test set.
when model is too simple, both training and test errors are large
Underfitting
means that it learns the training set too well – it overfits to the training set such that it performs poorly on the test set.
when model is too simple, both training and test errors are large
Bias
is a learner’s tendency to consistently learn the same wrong thing.
s the tendency to learn random things irrespective of the real signal.
Variance
is a learner’s tendency to consistently learn the same wrong thing.
is the tendency to learn random things irrespective of the real signal.
top right
top left
down right
doen left
low variance - high bias
high variance - high bias
low variance - low bias
high variance - low bias
low variance - high bias
high variance - low bias
low variance - low bias
high variance - high bias
what is Regularization and how it use?
Fighting Overfitting
Early Stopping • Inject Randomness • Ensemble Methods
Loving Overfitting
Never Stopping • avoid Randomness • Ensemble Methods
• AdaBoost (Freund & Schapire, 1996)
• Gradient Boosted Trees (Friedman, 1999)
• Stochastic gradient boosted distributed
decision trees (Ye et al., 2009)
are ____ methods
Iterative Methods
Non-Iterative Methods
• Random decision forests (Ho, 1995)
• Bagging (Bootstrap aggregating) (Breiman,
1996)
• Random Subspace Decision Forest (Ho, 1998)
are ____ methods
Iterative Methods
Non-Iterative Methods
Name The Activation functions
Sigmoid
ELU
tanh
ReLU
Name The Activation functions
Sigmoid
ELU
tanh
ReLU
Name The Activation functions
Sigmoid
ELU
tanh
ReLU
what are the benfits of fat+short NN vs thin+tall NN
fat+short NN can run in parallel faster
thin+tall NN can run in parallel faster
no benefits
none of the answer
Data set is imbalanced, what can we do to train the model better ?
Undersampling
Oversampling
Oversampling
and Undersampling
Oversampling
xor Undersampling
Correlation does not imply Causation
true
false
The Rashomon Effect - in decision trees , if the training set is
perturbed only slightly
we can get a tree quite different
from the original but with almost the same test set error.
we will get the same tree difference on the test set error.
Generative vs. Discriminative
create data vs label data
both label data
label data vs create data
both create data
why using log(p) and not p itself?
easier to calculate joint prob
based on Rule of succession
Laplace Correction
In Naive Bayes, we are unable to make prediction if a new
category is observer in test phase. how can we overcome this problem?
smoothing probs
Adding a minimal prob
create "unknown"
category
Gradient Descent
is
Analytic
Iterative
Newton Method
is
Analytic
Iterative
MAE and MSE are like
Ridge & Lasso
Lasso & Ridge
Elastic Net is combination of
Ridge & Lasso
random forest and bagging
random forest and boosting
Relu anf Tanh
Shrinkage means
Taking the weights of the model in partial
Taking all the weights of the mode
Missingness in training sample in CART can be Handled by
split the instance into pieces
instance to randon path
Dynamic programming
no way
using only classification error as split condition cant hurt the
classification error
InfoGain
run time
storage
Naive bayes is
Weak Learner
Strong Learner
Derive strong learner from weak learners
boosting
bagging
both
none
Bagging
Each model receives equal weight
Each model receives diffrent weight
when we use LOOVC (one out)
report the mean
error on the test set
small train set
max mse
max mae
True positive rate (TPR) / Sensitivity / recall
P(Test is positive, patient has disease)
TP/(TP+FN)
P(Test is negative patient does not have disease)
TN/(TN+FP)
𝑇𝑃/(𝑇𝑃 + 𝐹𝑃)
True negative rate (TNR), Specificity
P(Test is positive, patient has disease)
TP/(TP+FN)
P(Test is negative patient does not have disease)
TN/(TN+FP)
𝑇𝑃/(𝑇𝑃 + 𝐹𝑃)
preicsion
P(Test is positive, patient has disease)
TP/(TP+FN)
P(Test is negative patient does not have disease)
TN/(TN+FP)
𝑇𝑃/(𝑇𝑃 + 𝐹𝑃)
when to use to use P-R and not ROC curve ?
class imbalance
ROC present prefect picture wehn data imbalance
class balance
ROC present prefect picture wehn data balance
never
always
what is the opposite approach to Single Linkage clustering
Average Linkage clustering
Max Linkage clustering
KNN Linkage clustering
Turn dendrogram clustering
ברנדום פורסט , גודל האנסמבל תמיד שווה למספר האיטרציות שנקבע ע"י המשתמש
נכון
לא נכון
באגינג ורנדום פורסם ניתנים למיקבול בקוד
נכון
לא נכון
הגדלת כמות הנוירונים בשכבת הביניים ברשת נוירונים תלת מימדית לרוב תגדיל את טעות השונות
נכון
לא נכון
הגדלת כמות הנוירונים בשכבת הביניים ברשת נוירונים תלת מימדית לרוב תגדיל את הדיוק על קבוצת הלימוד
נכון
לא נכון
אדה - בוסט מקטין את ההטייה ואת השונות
נכון
לא נכון
באגינג מקטין את ההטייה ואת השונות
נכון
לא נכון
בהינתן פונקציה בני משתנים , אם קיימת נקודת אופטימום הרי ששיטת ניוטון תמצא אותה באיטרציה אחת
נכון
לא נכון
ברשת אוטו - אינקודר תמיד היה ניתן לשחזר בדיוק למידע המקורי
נכון
לא נכון
לפי "אין ארוחות חינם" אין אלגוריתם אחד שמנצח את כל האחרים לכל בעיה
נכון
לא נכון
KKT
אם התנאי מתקיים עבור בעיה ריבועית , דבר זה מייצג תנאי מספק לפתרון אופטימלי גלובלי
נכון
לא נכון
ברשת נוירונים כשמשתמשים
SGD ב
epoch ב
יחיד הוא עובר על חלקים אקראיים
בdata
לא נכון
נכון
האם נגדיל את
max depth
באלגוריתם
RF
אז הסיכוי ל
overfitting
יגדל
לא נכון
נכון
אם נגדיל את
learning rate
באלגוריתם
gradient boosting tree
אז הסיכוי ל
Overfitting
יגדל
לא נכון
נכון
One hot encoding
הופך משתנה קטגוריאלי למשתנים בינאריים
לא נכון
נכון
CNN לרוב רשת
LeNet מסוג
מדויקת יותר מרשת עמוקה רגילה לצורך זיהוי ספרות.
לא נכון
נכון
פונקציית האקטיבציה מסוג
tanh
אינה סובלת מהבעיה של
Vanishing Gradient
לא נכון
נכון
האלגוריתם AdaGrad
אינו מתאים למקרים שבהם נדרשים כמות גדולה של איטרציות.
לא נכון
נכון
אם מדד ה-AUC
של מודל A
גבוה יותר מזה של מודל B
, אזי בהכרח הדיוק של מודל A
גבוה מזה של מודל B.
לא נכון
נכון
באלגוריתמים מסוג
AdaBoost וGBM
רמת הדיוק על קבוצת הבדיקה עשויה להמשיך ולהשתפר גם כאשר רמת הדיוק על קבוצת הלימוד הגיעה ל100%.
נכון
לא נכון
לכל x
קטן מ0 תוצאת פונקציית
RELU
תחזיר ערך קטן יותר מאשר
sigmoid
נכון
לא נכון
השימוש בכלל השרשרת נועד לאפשר "גילגול" אחורה של הגרדיאט גם ברשתות עמוקות.
נכון
לא נכון
גם ב xgboost וגם ב ANN
יש משתנה שמשמש ל regulation.
(למדא)
טענה: אם נגדיל אותו אז ה
variance יקטן
bias ויגדל.
נכון
לא נכון
אם פלט של נוירון היה -0.2 אפשר להגיד בוודאות שפונקצית האקטיבציה שלו לא הייתה
Sigmoid
נכון
לא נכון
בצומת בעץ יש 80 מופעים עם תיוג 1 ו-20 מופעים עם תיוג 0. מה האנטרופיה
(-20/100)*log (80/100)
+
(-80/100)*log (20/100)
(-20/100)*log (20/100)
+
(-80/100)*log (80/100)
GBM
עובד רק עם עצים
נכון
לא נכון
שיטת נראות מקסימלית סוברת שיש לאמוד את הפרמטרים במודל כך שההסתברות לקבל את קבוצת הלימוד תהיה מקסימלית.
נכון
לא נכון
במודל Naive Bayes
מניחים כי ערכי תכונות הקלט בלתי תלויים אחד בשני.
נכון
לא נכון
פתרון נומרי אינו נדרש לקבלת המקדמים ברגרסיה לינארית פשוטה.
נכון
לא נכון
בשיטת המורד התלול כיוון החיפוש הוא תמיד כיוון ירידה.
נכון
לא נכון
הגדלת מרכיב ה-
Cost בשיטת
SVM
יגדיל את המשקל שאנו נותנים לטעיות של המודל ובכך יקטין את כמות הטעיות של המודל על קבוצת הלימוד
(training error)
אבל הדבר לא בהכרח יקטין את הטעויות על קבוצת הבדיקה
(test error).
נכון
לא נכון
השימוש ב-
Kernel
נדרש בעיקר כדי לפתור בעיות סיווג לא לינאריות
נכון
לא נכון
הסיבה ל-
log likelihood
בשיטת הנראות המקסימלית היא הימנעות מ-
underflow.
נכון
לא נכון
ככל שעץ החלטה יותר עמוק אז השגיאה על האימון קטנה
נכון
לא נכון
בעץ, כדי לדעת את ההסתברות לתצפית להיות ב
class
נבצע
pruning.
נכון
לא נכון
לרוב עומק עץ ב-
gradient boosting
הינו עמוק יותר מעומק עץ ב
random forest.
נכון
לא נכון
מה הם המרכיבים המגדירים למידה חישובית?
א. משימה לביצוע (T)
ב. מדד לביצוע (P)
ג. ניסיון נצבר (E)
ד. כל התשובות נכונות
על פי מודל 4 השכבות, איזה מהמשפטים הבאים אינו נכון
א. כל יישום יכול להשתמש במספר משימות למידה שונות
ב. כל מודל למידה ממומש על יד אלגוריתם אחד בלבד
ג. ישנם מודלים שיכולים לשמש למשימות למידה שונות
שאלת ה-
XOR
מדגימה מצב שבו קריטריון הפיצול המבוסס על
Information Gain
אינו יכול למדוד את תרומתה של תכונה למודל כולו
נכון
לא נכון
אם אנו מעוניינים לקבל הערכת הסתברות לכל
Class
ולא רק את החלטת סיווג, אזי רצוי לא לגזום את העץ.
נכון
לא נכון
בעץ החלטה אם השתמשנו בתכונה מסוימת לפיצול בשורש לא ניתן להשתמש בתכונה זו לפיצול נוסף בעץ.
נכון
לא נכון
קריטריון Gain Ratio אינו מיועד לטפל בתכונות נומינליות בעלות מספר רב של ערכים אפשריים
true
false
שיטת
Shrinkage
מאפשרת להימנע מ-
Over fitting
true
false
טענה: כל פונק' בוליאנית עם משתני קלט בינאריים ניתנת לייצוג באמצעות רשת נוירונים מתאימה.
true
false
לפניך רשת עם משתני קלט שיכולים לקבל משתנים בינאריים
(X1,X2).
איזו מהפונק' הבינאריות הבאות הרשת יכולה לקרב?
or
and
xor
nor
הקלט לשכבת
Convolution
היא תמונה בגודל
32X32X3
. 3Xמפעילים 5 פילטרים בגודל 3
עם Stribe=3 ו- Pad=2.
מהו גודל הפלט?
א. 10*12*5 = 600
ב. 12*12*5 = 720
ג. 10*10*5 = 500
באלגוריתם מסוג
AdaBoost
רמת הדיוק על קבוצת הבדיקה עשויה להמשיך ולהשתפר גם כאשר רמת הדיוק על קבוצת הלימוד הגיעה ל- 100%.
true
false
אם מדד ה-
AUC
של מודל
A
גבוה מזה של מודל
B
, אזי בהכרח הדיוק
(Accuracy)
של מודל A
גבוה מזה של מודל
B
true
false
לצורך דילול יער של עצים, רצוי לדלל עצים עם קורלציה נמוכה עם תכונת המטרה ו/או עצים אחרים.
true
false
מודל
RNN
מאפשר בין היתר ללמוד מודל המקבל כקלט רצף של ערכים ופולט ערך בודד
true
false
כלל האצבע לפיו מספר הנוירונים בשכבת הביניים שווה לממוצע האלגברי של מספר הנוירונים בשכבת הקלט והפלט אינו מתאים למודל
AutoEncoder
true
false
לצורך בניית מודל
Stacked Autoencoders
כל התצפיות חייבות לכלול את ערך תכונת המטרה.
true
false
במודל
SVM
עם פונקציית
Kernel
יש צורך לדעת את הפונקציה המופרשת לתרגום התצפיות מהמרחב המקורי למרחב החדש.
נכון
לא נכון
ההבדל בין
Ensemble
ל- Mixtures of Experts
, הוא שב-
Ensemble
המסווגים נוצרו מאותו אלגוריתם בסיס וב-
MoE
אין בהכרח הדבר כך
לא נכון
נכון
לרוב כדי להגיע לאותה רמת דיוק, מספר העצים הנדרש ב-
RandomForest
נמוך ממספר העצים הנדרש בשיטת
Gradient Boosted Tree.
נכון
לא נכון
מודל
CNN
מיועד אך ורק לסיווג תמונות.
נכון
לא נכון
זמן הריצה הנדרש כדי ללמוד עץ בודד על פי אלגוריתם
C4.5
גדול יותר מזמן הריצה הנדרש לצורך לימוד
RandomForest
עם עץ בודד
נכון
לא נכון
בשיטת המורד התלול כיוון החיפוש הוא תמיד כיוון ירידה
נכון
לא נכון
שיטת ניוטון טובה להתכנסות לאזור המינימום גם כאשר נקודת ההתחלה אינה קרובה לנקודת האופטימום
נכון
לא נכון
רגרסיה לוגיסטית מתאימה לפתרון בעיות סיווג בינאריות ובעיות
Multi-class
נכון
לא נכון
שיטת
Shrinkage
מאפשרת להימנע מ
-Over fitting
נכון
לא נכון
בגישת
SVM
הסרת תצפיות שאינן
support vectors
מתוך קבוצת הלימוד לא תשפיע אף פעם על המודל שהתקבל
נכון
לא נכון
באלגוריתם מסוג
AdaBoost
רמת הדיוק על קבוצת הבדיקה עשויה להמשיך ולהשתפר גם כאשר רמת הדיוק על קבוצת הלימוד הגיעה ל- 100%.
לא נכון
נכון
ניתן לפתור בצורה טובה את בעיית
Rating Prediction
במערכת המלצה על ידי אימון רשת עמוקה עם שכבת
Embedding
של
User_ID ו-Item_ID.
לא נכון
נכון
לצורך דילול יער של עצים, רצוי לדלל עצים עם קורלציה נמוכה עם תכונת המטרה ו/או עצים אחרים
לא נכון
נכון
מודל
RNN
מאפשר בין היתר ללמוד מודל המקבל כקלט רצף של ערכים ופולט ערך בודד.
לא נכון
נכון
1. כלל האצבע לפיו מספר הנוירונים בשכבת הביניים שווה לממוצע האלגברי של מספר הנוירונים בשכבת הקלט והפלט אינו מתאים למודל
AutoEncoder
לא נכון
נכון
לצורך בניית מודל
Stacked Autoencoders
כל התצפיות חייבות לכלול את ערך תכונת המטרה
לא נכון
נכון
במודל
Naive Bayes
מניחים כי ערכי תכונות הקלט בלתי תלויים אחד בשני
נכון
לא נכון
kernel
משמש כפונקציית דמיון בין 2 תצפיות.
נכון
לא נכון
בעץ החלטה לבעיות רגרסיה לנתונים רועשים עם חריגים
(outliers),
בעת ביצוע הסיווג עדיף להשתמש בחציון ולא בממוצע.
נכון
לא נכון
לרוב עומק עץ ב
- gradient boosting
הינו עמוק יותר מעומק עץ ב
random forest.
נכון
לא נכון
שימוש ב
Lasso
נועד על מנת למנוע
overfitting
נכון
לא נכון
נוירון בודד -
perceptron
יכול לפתור כל פונקציה בולאנית.
נכון
לא נכון
בבעיה בינארית לא מאוזנת
(imbalanced)
, מודל פשטני שמחזיר תמיד
Majority voting
יקבל ערך
AUC
גבוה
לא נכון
נכון
יש צורך לסווג תמונה
x
לשני
Class-ים:
A ו-B
שההסתברויות האפריוריות שלהם בהתאמה
P(A)=0.4, P(B)=0.6 .
ההסתברות לקבלת ה-x
הנ"ל בהינתן A
היא 0.7 ואילו ההסתברות לקבלת ה-
x
הנ"ל בהינתן
B
היא 0.3. לפי שיטת
Naïve Bayes,
ה-Class
שיש לבחור כדי להביא למינימום את תוחלת הטעות הוא
B.
נכון
לא נכון
זמן הלימוד הנדרש להפעלת הפרוצדורה
LOOCV Leave-one-out Cross Validation-
על טבלה עם 100 דוגמאות ארוך לפחות פי 10 מזמן הלימוד הפרוצדורה
CV-10Folds
על אותה טבלה.
נכון
לא נכון
ללא תלות בסוג המסווג שנבנה, תמיד קיימת אפשרות למצוא בשיטות אנליטיות פתרון מדויק למשתני המסווג.
נכון
לא נכון
האלגוריתם הבסיסי
SVM
מיועד לפתרון בעיות בינאריות בלבד
נכון
לא נכון
אחד היתרונות של אלגוריתם
Bagging
על אלגוריתם
AdaBoost
הוא ש-
Bagging
ניתן לביצוע מקבילי ללא כל שינוי בקוד, כך שכל מסווג נבנה במעבד אחר/מחשב אחר
נכון
לא נכון
האלגוריתם
AdaBoost
שהוצג בכתה מיועד לפתרון בעיות בינאריות בלבד.
נכון
לא נכון
הגדלת מספר הנוירונים בשכבה המוסתרת של רשת נוירונים תלת-שכבתית לרוב תקטין את מרכיב טעות ה-
bias
נכון
לא נכון
הגדלת מספר הנוירונים בשכבה המוסתרת של רשת נוירונים תלת-שכבתית לרוב תגדיל את הדיוק על קבוצת הבדיקה
נכון
לא נכון
הקטנת טעות
Bias
תביא בהכרח להגדלת טעות
Variance
נכון
לא נכון
נתונה הפונקציה
f(x1,x2)=2x12+3x1+5x22+6x1x2
אזי אם קיימת נקודת אופטימום הרי ששיטת ניוטון תמצא בהכרח את הפתרון המדויק תוך אטרציה אחת ללא תלות בנקודה שממנה מתחילים בחיפוש.
נכון
לא נכון
כל רשת נוירונים רב שכבתית ניתנת לתיאור באמצעות רשת תלת-שכבתית
לא נכון
נכון
באלגוריתם
SVM,
הייצוג הדואלי נועד לאפשר שימוש ב-
Kernel
ללא ידיעת מפורשת של פונקצית ההמרה.
לא נכון
נכון
על פי התער של
Occam,
אם לשני מודלים יש את אותה הטעות על קבוצת הלימוד, אזי יש להעדיף את המודל הפשוט יותר.
לא נכון
נכון
קיום תנאי
KKT
עבור בעיה שאינה ריבועית, מייצגת את התנאי הכרחי לפתרון אופטימלי גלובלי.
לא נכון
נכון
