wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

deep learning

Total questions: 106

Worksheet time: 59mins

Name
Class
Date
1.

היתרון המרכזי של למידה עמוקה על למידת מכונה קלאסית הוא

a)

קלות המימוש

b)

הייתרון של שיפור המודלים בהינתן ידע

c)

יכול להשתפר גם אחרי כמויות גדולות של דאטה

d)

אין, תמיד כדאי לקחת
XGBoost

2.

החסרון הראשי של למידה עמוקה על למידת מכונה קלאסית הוא

a)

קלות המימוש

b)

הייתרון של שיפור המודלים בהינתן ידע

c)

יכול להשתפר גם אחרי כמויות גדולות של דאטה

d)

תהליך עיבוד הדאטה קשה יותר לקראת רשת נוירונים

3.

למה משמשת פונקציית ה
sigmoid

a)

פיזור הסתבוריות המימוש בשכבה האחרונה על גבי הקלאסים

b)

חיזוי איכותיני במשימות רגרסיה

c)

מגוון שימושים כולל ברגרסיה לוגיסטית

d)

אף אחת מהתשובות איננה נכונה

4.

מדוע משתמשים ב
GDS

על פונקצית ה

cost?

a)

אין סיבה

b)

מאפשר לנו לכנס את פוקנציית הלוס שלנו אל עבר האפס

c)

מאפשר לנו בחירת פיצ'רים טובה יותר על סט האימון

d)

מאפשר לנו בחירת פיצ'רים טובה יותר על סט המבחן

5.

למה משתמשים ב
GDS

על פונקצית ה

cost?

a)

אין סיבה

b)

מאפשר לנו לכנס את פוקנציית הלוס שלנו אל עבר האפס

c)

מעדכנים את המשקולות על הקשתות באמצעות חישובים על הלוסט

d)

מעדכנים את ההטיות באמצעות חישובים על הלוסט

6.

למה משתמשים ב
GDS

על פונקצית ה

cost?

a)

אין סיבה

b)

מאפשר לנו לכנס את פוקנציית הלוס שלנו אל עבר האפס

c)

מעדכנים את המשקולות על הקשתות באמצעות חישובים על הלוסט

d)

מעדכנים את ההטיות באמצעות חישובים על הלוסט

7.

מדוע שימוש בוקטורים נכון יותר בחישובים לרשתות נוירונים

a)

חוסכים את החישוב בתוך לולאות
ומייעלות זמן ריצה

b)

שלל חבילות קוד תומכות בזה כבר

c)

כפל מטריצות יותר מדויק למחשב

d)

תמיכה של
GPU

8.

מה הם מימדי השכבה אמצעית

a)

W1:[4,3]

B1:[4,1]

A1:[4,1]

b)

W1:[4,1]

B1:[4,1]

A1:[4,1]

c)

W1:[4,3]

B1:[4,3]

A1:[4,3]

d)

W1:[4,3]

B1:[4,1]

A1:[4,5]

9.

עדכון המשקולות ברשת קורה מהסוף להתחלה

a)

נכון

b)

לא נכון

10.

מדוע לא משתמשים בפונקציית סיגמוייד באמצע הרשת

a)

להימנע מבעיית

exploding gradient

b)

להימנע מבעיית

vanishing gradient

c)

להימנע מבעיית

zero-sum gradient

d)

אין סיבה שלא

11.

מה מהבאים מייצג את

relu

a)

b)
c)

12.

מדוע חשוב שהפונקציות ההפעלה יהיו לא לינאריות

a)

כדי לגוון

b)

יהפוך רשת שלמה לשכבה אחת

c)

הנגזרת לא תהיה משמעותית מה שיגרור לעדכון לא איכותני

d)

ניתן להשתמש בפונקציות לינאריות

13.

הטיה היא

a)

התוחלת בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה

b)

השונות בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה

c)

ההתפלגות בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה

d)

הפער בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה

14.

את תהליך הרגלוציה אנו מפעילים בדרך כלל על

a)

W

b)

b

c)

W + b

15.

L2 פונקציית הרגולציה
עוזרת במצבים ש

a)

נרצה לחזק ערכים גדולים ולהחליש ערכים קטנים

b)

נרצה להחליש ערכים גדולים ולחזק ערכים קטנים

c)

נרצה להחליש ערכים גדולים ולהחליש ערכים קטנים

d)

נרצה לחזק ערכים גדולים ולחזק ערכים קטנים

16.

L1 פונקציית הרגולציה
עוזרת במצבים ש

a)

רוצים לקיים סוג של בחירת פיצ'רים

b)

רוצים לאפס פיצ'רים לא חשובים

c)

רוצים לקחת פיצ'רים חשובים בחשבון

d)

כל התשובות נכונות

17.

הוספת רעש לדגימות רנדומליות עוזר למונע

a)

טעויות דיוק

b)

התאמת יתר

c)

חוסר התאמה

d)

הוספת רעש אינה יכול לעזור

18.

מהו

clipping labels

a)

בבעיית סיווג בינארית - משנים את ערך המטרה בפלוס מינוס אפסילון

b)

בבעיית סיווג בינארית - משנים את ערך המטרה כפול או חלקי אפסילון

c)

שיטת רגולציה לבעיות רגרסיה

d)

שיטת רגולציה

19.

אוגמנטציה של נתונים הוא

a)

שינוי הנתונים עם שמירה על מהותם

b)

שימור הנתונים עם שמירה על מהותם

c)

שינוי הנתונים עם שינוי של מהותם

d)

שימור הנתונים עם שינוי על מהותם

20.

the exploding gradient can be explained by which calculation

a)

1.5^x

b)

0.5^x

c)

1^x

d)

none of them

21.

:סמן את הנכון עבור מומנטום אופטימייזר
במקום להשתמש בשיפוע כדי לשנות את מיקום המשקל, השתמש בו בפועל כדי לשנות את המהירות

a)

נכון

b)

לא נכון

22.

כל אחד מהקווים מייצג אופטימייזר שונה

a)

SGD-אדום
RMSPROP-ירוק

ADAM-סגול

MOMENTUM-כחול

b)

SGD-ירוק
RMSPROP-אדום

ADAM-סגול

MOMENTUM-כחול

c)

SGD-אדום
RMSPROP-ירוק

ADAM-כחול

MOMENTUM-סגול

d)

SGD-אדום
RMSPROP-סגול

ADAM-ירוק

MOMENTUM-כחול

23.

?ממה מגן עלינו נרמול באטצ'ים

a)

רובסטיות של דאטה

b)

אפקט כדור שלג

c)

חוסר בגיוון הנתונים

d)

חוסר תאימות בין השכבות

24.

נרצה להפעיל פילטר 3על3 על מטריצה של 6על6 כאשר הפעלנו פאדינג והפכנו אותה ל8על8
הגודל שלה יהיה

a)

6*6

b)

9*9

c)

11*11

d)

8*8

25.

עומק פילטר בשכבות קונבולוציה תמיד יהיה

a)

שווה לעומק הקלט

b)

שונה לעומק הקלט

c)

שווה לעומק הפלט

d)

שונה לעומק הפלט

26.

בהינתן תמונה דו מימדית בגדול 32על32 נפעיל פילטר 5על5 עם גודל צעד 1
גודל הפלט יהיה

a)

32+2051+1\frac{32+2\cdot0-5}{1}+1

b)

32+20+5+132+2\cdot0+5+1

c)

28+205+128+2\cdot0-5+1

27.

residual blocks
בא לעזור לנו במצב

a)

ששכבה ראשונית יוצרת יותר נזק מתועלת

b)

ששכבה ראשונית צריכה לשמר על המשקולות שלה לאחר האתחול

c)

ששכבה מבין האחרונות יוצרת יותר נזק מתועלת

d)

ששכבה מבין האחרונות צריכה לשמר על המשקולות שלה לאחר האתחול

28.

?למה יכול לשמש 1*1 פילטר

a)

הורדת ממדיות

b)

העלאת ממדיות

c)

מיצוע ממדיות

d)

שיפור איכות התמונה

29.

inception network
הוא מצב שבו מפעילים פילטרים שונים על ממדי עומק שונים של התמונה

a)

לא נכון

b)

נכון

30.

לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,𝐶1,𝐶2,𝐶3,P_C,b_x,b_y,b_h,b_w,𝐶_1,𝐶_2,𝐶_3,
מה מסמן PC

a)

pointer counter

b)

ההסתברות האם מופיע אובייקט בתמונה

c)

ההסתברות האם מופיע אובייקט בתמונה מקלאס C

d)

האם ריבוע זה הוא אמצע התמנוה

31.

לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,𝐶1,𝐶2,𝐶3,P_C,b_x,b_y,b_h,b_w,𝐶_1,𝐶_2,𝐶_3,
מסמן bx,by

a)

pointer counter

b)

ההסתברות האם מופיע אובייקט בתמונה

c)

ההסתברות האם מופיע אובייקט בתמונה מקלאס C

d)

קורדינטות אמצע האובייקט שבפיקסל

32.

לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,𝐶1,𝐶2,𝐶3,P_C,b_x,b_y,b_h,b_w,𝐶_1,𝐶_2,𝐶_3,
מסמן bh,bw

a)

גובה ורוחב האובייקט

b)

ההסתברות האם מופיע אובייקט בתמונה

c)

ההסתברות האם מופיע אובייקט בתמונה מקלאס C

d)

קורדינטות אמצע האובייקט שבפיקסל

33.

לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,𝐶1,𝐶2,𝐶3,P_C,b_x,b_y,b_h,b_w,𝐶_1,𝐶_2,𝐶_3,
מסמןC1,C2,C3

a)

גובה ורוחב האובייקט

b)

ההסתברות האם מופיע אובייקט בתמונה

c)

ההסתברות האם מופיע אובייקט בתמונה מקלאס C

d)

קורדינטות אמצע האובייקט שבפיקסל

34.

IOU

משמש לחיתוך בין אוסף ריבועים שיש בתוכם תמונה כדי למצוא את הריבוע שתופס בצורה הטובה ביותר את האובייקט ברצוי

a)

לא נכון

b)

נכון

35.

הטריק ב-
Neural style transfer

הוא

a)

מישקול פונקציית ההפסד בין הפלט לכל אחד מהקלטים

b)

מישקול פונקציית ההפסד בין הקלט לכל אחד מהפלטים

c)

איתחול טוב של הרשת לפי רשת מאומנת אחרת

d)

מדובר ברשת פשטנית למציאת דמיון בין תמונות

36.

למה רשת בנויה שכבות צפופות פחות עדיף על רשת מבוססת
RNN
עבור בעיה מסוימת

a)

נרצה למדל קשרים בין הפלטים

b)

נרצה למדל קשרים בין הקלטים

37.

חשיבות של מילה בתחילת המשפט עבור כלל משמעות המשפט
יכול לגרום להתמודדות עם בעיית

a)

vanishing gradient

b)

exploding gradient

38.

מה מטרתו של כל שער ב
GRU

a)

Update gate – איזה מהמשקולות לנתוני העבר אפשר לעדכן

Reset gate – איזה מנתוני העבר ניתן לשכוח

b)

Update gate – איזה מנתוני העבר ניתן לשכוח

Reset gate – איזה מהמשקולות לנתוני העבר אפשר לעדכן

39.

מה נכנס לשער העדכון ברכיב
GRU

a)

זיכרון העבר

b)

הקלט הנוכחי

c)

אף אחד מהם

d)

שניהם

40.

בנוסף על שער העדכון , לשער הזכרון יש גם

a)

מקדם שכחה

b)

מקדם חיזוק

c)

יכולת כפל

d)

יכולת חיבור

41.

כמה יש שערים יש ל
GRU AND LSTM
בהתאמה

a)

2
3

b)

3
3

c)

2
1

d)

1
2

42.

איזו פונקציה מופעלת בשער השכחה ברכיב
LSTM

a)

softmax

b)

relu

c)

leaky relu

d)

tanh

43.

בשער הקלט של רכיב
LSTM
מופעלות שתי הפונקציות הבאות

a)

softmax
tanh

b)

softmax
relu

c)

relu
tanh

d)

leaky relu
tanh

44.

סדר הפעולות בשער הפלט הוא

a)

softmax
tanh
multiple

b)

softmax
relu
tanh

c)


relu
softmax
tanh

d)

softmax
tanh
relu

45.

LSTM Variants – Peephole Connections

a)

משלב את האינפוט משער הקונטקסט בכל אחד מהשערים הפנימיים ובכך גורם תמיד לקחת אותו בחשבון

b)

מוחק את האינפוט משער הקונטקסט בכל אחד מהשערים הפנימיים ובכך גורם תמיד להתעלמות ממנו

c)

משלב את האינפוט משער הקונטקסט בחלק אחד מהשערים הפנימיים ובכך גורם תמיד לקחת אותו בחשבון

46.

LSTM Variants – Coupling the Input and Forget Gates

a)

משלב את שער השכחה עם שער האינפוט ובכך נותן את היכולת לא לשכוח משהו אם שמת משהו אחר במקום

b)

משלב את שער הפלט עם שער האינפוט ובכך נותן את היכולת לא לשכוח משהו אם שמת משהו אחר במקום

c)

משלב את שער הפלט עם שער הקונטקסט ובכך נותן את היכולת לא לשכוח משהו אם שמת משהו אחר במקום

47.

מה האתגר ביצירת אמבדינג למילים

a)

צימוד קונטקסט ראוי למילה יכולה לגרור לכמות מידע אסטרונומית

b)

צימוד קונטקסט לא ראוי למילה יכולה לגרור לכמות מידע אסטרונומית

c)

השגת הדאטה

d)

אין צורך ליצור אמבדינג, יש שכבות מאומנות באינטרנט ניתנות להורדה

48.

ההבדל בין שתי הגישות ליצירת ווקטור לייצוג פסקה

Doc2Vec

a)

PV-DM
למידת ייצוג הפסקה מתוך שימוש שלה כקונטקסט

b)

PV-DM
למידת ייצוג הפסקה מתוך שימוש שלה כמשתנה מטרה

c)

PV-DBOW
למידת ייצוג הפסקה כקלט כאשר המטרה לחזות את הסתברות הופעת המילים בה

d)

PV-DBOW
למידת ייצוג הפסקה כקלט כאשר המטרה לחזות את רצף הופעת המילים בה

49.

Autoregressive Generative Models
ליצירת תמונות פעול בשיטה הבאה

a)

פיקסל אחר פיקסל

b)

frame after frame

c)

פריים בהינתן פיקסל

d)

פיקסל בהינתן פריים

50.

pixelCNN
חוזה עבור כל פיקסל

a)

את הערך שלו

b)

את ערך ה
-RGB
שלו

c)

את ערך ה
-RGB
שלו לפי הקונטקסט שלו

d)

את ערך ה
-RGB
שלו לפי הקונטקסט שלו ומאפשר מקבול

51.

ההבדל בין
AE
לבין
VAE

a)

הראשון חוזה ערך והשני חוזה התפלגות לערך

b)

הראשון חוזה התפלגות לערך והשני חוזה ערך

c)

הראשון חוזה התפלגות של ערך והשני חוזה הסתברות לערך

52.

משתנה המטרה ב-
VAE
הוא

a)

התפלגות המטרה מתוך דגימה

b)

דגימה מתוך התפלגות המטרה

53.

פונקציית ההפסד ברשת
VAE

a)

הפער בין תוחלת התפלגות עבור ה-batch
תוחלת ההתפלגות הרצויה

b)

הפער בין ערך התפלגות עבור המשתנה
לבין ערך המטרה שיצא

c)

הפער בין התחזית
לבין ערך המטרה שיצא

54.

האתגרים ביצירת
GAN

a)

אין ערך משתנה ברור לג'נרטור

b)

האימון הוא קשה

c)

אין התכנסות

d)

נוטה לחוות התאמת יתר

55.

mode collapse

הוא מצב שבו

a)

מודל הסיווג טוב מידי

b)

מודל הג'ינרוט טוב מידי

c)

שני המודלים לא מתכנסים

d)

שני המודלים מתכנסים

56.

mode collapse

כדי לצאת ממצב כזה ניתן להשתמש ב

a)

one vs all in D side

b)

one vs all in G side

c)

mini batch acception

d)

learning less the D side

57.

ניתן לקביל את
Generative Multi-Adversarial Networks

לאלגוריתם

a)

רנדום פורסט

b)

עץ החלטה

c)

SVM

d)

אף אחד

58.

BEGAN
הוא שילוב של

a)

GAN

b)

AE

c)

BE

d)

הנפצה

59.

בארכיטקטורה מסוג
BiGAN
רכיב המסווג מקבל 4 אינפוטים

a)

קלט ופלט של ה-
AE
עבור הדאטה האמיתי והמונפץ

b)

3 סוגי רעש
ווקטור אמבדינג לאיחודים

c)

תמונה של סטודנטים, סרטון של רקדן, מוזיקה וכמות פריימים

d)

שקר וכזב

60.

כיצד נעשה
The reparameterization trick
ברשתות
VAE

a)

מנתקים את שלב הדגימה מהמודל ומוסיפים אפסילון לשלב זה

b)

לשלב הדגימה מוסיפים אפסילון

c)

גורמים להפלגות להיות שכבה מחוברת בתוך המודל

d)

חוזרים לייצוג ליטנטי רגיל ולא מייצרים הסתברות

61.

מה הצעת המאמר
“Attention is all you need”

a)

לנטוש את רשתות
RNN
ולעברו לרשתות
Dense

b)

לתגבר את רשתות ה-
DENSE
בשכבת
attention

c)

RNN
מתאימות לכל בעיה

d)

RNN
אינן מתאימות לכל בעיה

62.

נרצה להפעיל טרנספורמר על חיפוש באתר יוטיוב
מה הערכים שיכנסו אליו

a)

Q-השאילתא
K-טקסט על הסרטון
V-ההמלצות המתאימות

b)

Q-השאילתא
K-המילים בשאילתא
V-טקסט על הסרטון

c)

Q-טקסט על הסרטון
K-השאילתא
V-ההמלצות המתאימות

63.

מה השוני בין ראש לראש ב-
Multi-Head Attention

a)

משתנה המטרה

b)

האינפוטים

c)

המשקולות המאותחלות

d)

המשקולות בסיום

64.

מה השלב הראשון במקודד של הטרמנספורמר

a)

embadding

b)

split to KQV

c)

linear

d)

Scaled Dot-Product Attention

65.

Positional Encoding
כולל שימוש ב

a)

קוסינוס לטוקנים הזוגיים

b)

סינוס לטוקנים הזוגיים

c)

סינוס לטוקנים האי-זוגיים

d)

קוסינוס לטוקנים האי-זוגיים

66.

Second-order proximity

a)

הסיכוי שאני מכיר מישהו

b)

הסיכוי שאני מכיר חבר שלי

c)

הסיכוי שאני מכיר מישהו שחולק איתי שכונה אך אין ביננו קשר ישיר

d)

הסיכוי שאינני מכיר מישהו שחולק איתי שכונה אך אין ביננו קשר ישיר

67.

אלגוריתם
Large-scale Information Network Embedding (LINE)
מוציא שני ייצוגים לקודקוד עבור
Second order proximity

a)

ייצוג לקודוקוד אל מול עצמו

b)

ייצוג לקודקוד אל מול הקונטקסט שלו

c)

ייצוג לקונטקסט שלו
אל מולו

d)

האלגוריתם מוציא ייצוג אחד

68.

first order proximity & Second order proximity
נקראים באלגרותים
node2vec

a)

Homophily

&
Structural similarity

b)

first order proximity & Second order proximity

c)

major order proximity & minor order proximity

69.

ציין איזה מהגרפיים ייצג

את המושגים הבאים בסדר הנכון

a)

Homophily

Structural similarity

b)

Structural similarity

Homophily

70.

באלוגירתם
node2vec
מתקיימת הליכה רנדומלית, למה זו צריכה 2 פרמטרים נוספים
P & Q

a)

אחד לחזרה למקורות ואחד ליציאה למקורות חדשים

b)

להחלטת כיוון הפניה ימינה או שמאלה

c)

אחד לכיוון הצעד ואחד לכמות התעדים במהלך

71.

tdGraphEmbed
משליך גישות מקבילות לאיזה עולם על גרפים

a)

NLP

b)

זיהוי חריגות

c)

חיפוש בגרפים

72.

לפי אלגוריתם
tdGraphEmbed
כל הליכה מקודקוד מהווה ... וכל רצף הליכות מהווה ...

a)

מילה
משפט

b)

משפט
פסקה

c)

תו
מילה

73.

SelectiveNet
מכיל שתי רשתות

a)

קבלה וסיווג

b)

סיווג וסיווג משני

c)

קבלה ודחיה

74.

כיצד פתרו את בעיית ה"לקחת רק בעיות קלות לפתירה" במודל
SelectiveNet

a)

שער
auxiliary
שמכריח את הרשת להתאמן על הכל

b)

מכריחים את מודל החיזוי לחזות גם אם מודל הבחירה אמר שלא

c)

מתעלמים ממודל הבחירה אחת לכמה פעמים

d)

אין דרך

75.

Background - Monte Carlo Dropout

a)

שיטה בה מכניסים דגימה לכמה מופעים של אותה רשת עם אחוז דרופאאוט שונה

b)

שיטה בה מכניסים דגימה כמה פעמים לאותה רשת ועושים מסקינג לחלקים בדגימה

c)

שיטה בה מכניסים דגימה לכמה מופעים של אותה רשת עם אחוז דרופאאוט שונה
ועושים מסקינג לחלקים בדגימה

76.

Quality Driven Method (QD)

a)

מודל שמטרתו לחזות אינטרוול

b)

מודל שמטרתו לחזות אינטרוול ומשתנה מטרה עם ערך רציף

c)

מודל שמטרתו לחזות אינטרוול ומשתנה מטרה עם ערך בדיד

d)

מודל שמטרתו לחזות משתנה מטרה בדיד

77.

PIVEN
מחזיק שלושה ראשי פלט

a)

חסם עליון

b)

חסם תחתון

c)

משתנה מטרה

d)

גודל האינטרוול

78.

פונקציית ההפסד מחושבת לפי שני מדדים באלגוריתם
PIVEN

PICP & MPIW

a)

PICP (PI coverage probability) - how many points were captured by the PI?

MPIW (Mean PI width) - what is the width of the generated PI?

b)

PICP (PI coverage probability) - what is the width of the generated PI?

MPIW (Mean PI width) - how many points were captured by the PI?

79.

בלמידה מבוססת חיזוקים

מה ההבדל בין
value function
לבין
q-function

a)

הראשונה נותנת ערך לכל מצב והשניה נותנת ערך לכל צימוד מצב ופעולה

b)

הראשונה נותנת ערך לכל מצב ופעולה והשניה נותנת ערך לכל צימוד מצב

c)

שתיהן נותנות ערך למצב על סמך מדיניות שונות

80.

What does the Bellman equation in reinforcement learning relate to?

a)

Expected future rewards and the value of a state or state-action pair.

b)

Immediate rewards and the transition probabilities of an MDP.

c)

Discount factors and the policy of an agent.

d)

The Markov Decision Process and the optimal policy.

81.

Policy Evaluation means

a)

•explore the current value function/q-function to assess the quality of the current policy.

b)

• test actions different than those recommended by the policy and see if they yield improvement

c)

both

d)

None

82.

כיצד נתן לבצע שיפור מדיניות בצורה מקבילית

a)

שינוי מדיניות עבור מצב אחד

b)

שימור מצב המדיניות עבור כל שאר המצבים האחרים

c)

שינוי מצב המדיניות עבור כל הערכים יחד

d)

אין דרך לעשות זאת

83.

Model-Based vs. Model Free Methods

a)

כל המשתנים ידועים לנו
VS
חלק מהמשתנים ידועים לנו

b)

חלק מהמשתנים ידועים לנו
VS
כל המשתנים ידועים לנו

c)

בשני המצבים הכל ידוע והרשות נתונה

d)

בשני המצביםלא הכל ידוע והרשות נתונה

84.

example to off policy method can be

a)

loading old policy and use it as is

b)

watching you as a small kid your big bro play Vgames and try mimic him

c)

you as big bro play Vgames and your small bro try mimic you

85.

Importance Sampling for Off-Policy Methods

a)

the relative probability of the trajectory for the target and behavior policies

b)

the relative probability of the behavior for the target and trajectory policies

86.

Importance Sampling for Off-Policy Methods - monte carlo:
Let us assume that b is ____ (so we can sample multiple trajectories) and π is ____

a)

stochastic
deterministic

b)

deterministic

stochastic

c)

stochastic
stochastic

d)

deterministic
deterministic

87.

One-Step Temporal Difference

a)

בודק מה קורה צעד אחד קדימה מבחינת פונקציית ערך של המצב הבא

b)

בודק מה קורה צעד אחד קדימה מבחינת פונקציית
Q
של המצב הבא

88.

ההבדל בין אלגוריתם
SARSA
לבין
TD-0

a)

הסתכלות על פונקציית
V
מול
Q

b)

הסתכלות על פונקציית
Q
מול
V

c)

אין הבדל, מדובר באותו אלגוריתם

89.

SARSA
פועלת בשונה מאללגוריתם
Q-LEARNING
בכך ש

a)

לוקחת צעד לפי אפסילון גרידי

b)

לוקחת צעד לפי מקסימום
Q

c)

לוקחת צעד לפי מקסימום
V

90.

מהם היתרונות של השימוש ב
vectorization-
בהכפלת מטריצות 


a)

א. ניתן להשתמש בגראדיינט ישירות בלי backpropagation 

b)

ניתן להאיץ את תהליך האימון ע"י ניתוח batch שלם בבת אחת ללא שימוש בלולאות 

c)

הייצוג הוקטורי הוא יעיל יותר ומאפשר לנו לנתח batches גדולים יותר ביעילות

d)

אין יתרונות מעשיים, זו שיטה שמאפשרת לייצג את תהליכי ה forward/backward propagation- באופן 

מובן יותר 

91.

הסבר כיצד השימוש ב
teacher forcing-
יכול להאיץ את האימון של .
auto regressive models
ניתן להשתמש 

ברשת
PixelCNN

a)

שימוש בתוצאות האמת למקבל ולקבל את התחזית העתידית
באיכות גובהה יותר

b)

שימוש בתוצאות האמת למקבל את האימון

c)

שימוש ברשתות לא מאומנות לחזוי תמונה על סמך תמונה רועשת

92.

אילו מההצהרות הבאות נכונות עבור ארכיטקטורת
Generative Adversarial Network (GAN) 


a)

פונקציית ההפסד של שני הרכיבים לוקחת בחשבון את הביצעוים של שני הרכיבים

b)

תרחיש בו רכיב
G
משפר את תוצאותיו בעוד
D
איננו משנה הוא מצב הגיוני

c)

מצב בו רכיב
D
מגיע לדיוק מושלם עוזר לרכיב השני להשתפר מהר

d)

בכל תרחיש אפשר רכיב
G
תמיד יקבל רעש רנדומלי

93.

אלגוריתם ה
sliding window-
. הבסיסי לזיהוי עצמים משתמש במספר שכבות
האלגוריתם אפקטיבי אך איטי. כיצד נוכל לשפר את יעילותו:

a)

להחליף את שכבות ה max pool-
בשכבות
average pool

b)

להחליף את השכבות ה-
fully connected
ב
1x1 convolutions

c)

 ע"י שמירת ערכי הביניים שחושבו על ידי פילטרים ב sliding windows-
חופפים ניתן להימנע מחישוב חוזר של ערכים

d)

להקטין את גודל ה sliding window- וע"י כך להקטין את מספר החישובים

94.

אתם מאמנים רשת נוירונים עמוקה. לאחר מספר
epochs ה
loss function- מפסיקה לרדת
. אילו מהפעולות 

הבאות עשויות לסייע בפתרון הבעיה:

a)

הקטנת ה
learning rate-

b)

הגדלת ה
learning rate-

c)

הקטנת ה
mini-batch

d)

הגדלת ה
mini-batch

95.

על מנת למדל תלויות ארוכות טווח ב
GRU

a)

שער ה
reset-
צריך להיות פעיל מאוד

b)

שער ה
reset-
צריך להיות פעיל לא מאוד

c)

שער ה
update-
צריך להיות פעיל לא מאוד

d)

שער ה
update-
צריך להיות פעיל מאוד

96.

מדוע שכבת האניקוד צריכה להיות קטנה יותר משכבת הקלט
ב
AE

a)

לייצר תלות בין משתני הקלט

b)

אחרת הרשת תחזיר בדיוק את הקלט

c)

אין סיבה, זה תלוי מקרה

97.

ב
variational learning-
אנו מסתמכים על ה
.variational bound-
אילו מההצהרות הבאות נכונה לגביו

a)

מיועד להגביל את מספר הדגימות אותן יש לייצר באמצעות Monte Carlo sampling

b)

מיועד להגביל את ההבדל בין ה modeled distribution- להתפלגות האמיתית

c)

מגביל את מספר ה latent variables- שמשמשים למידול ההתפלגות האמיתית

d)

הוא מודל ל approximate density-
של
ההתפלגות האמיתית

98.

מדוע להוסיף
batchnorm

a)

להימנע ממקרי גדור שלג

b)

מקטין רעש בדאטה

c)

מאפשר תלות גדולה יותר בין השכבות

99.

auto regressive models

a)

הם ניתנים להפעלה רק בדומיינים בהם לנתונים יש סדר "טבעי"

b)

הם ניתנים להפעלה גם בדומיינים בהם אין לנתונים סדר טבעי, אך יש לקבוע סדר שרירותי כלשהו 

c)

הם ניתנים להפעלה רק בדומיינים בהם ניתן להגדיר
explicit density function

d)

השימוש ב
teacher forcing- הוא נחוץ תמיד באלגוריתמים מסוג זה

100.

האם הוספת
L2 norm regularization
יכולה לסייע בפתרון בעיית ה
vanishing gradient

a)

כן, היא תמיד תשאיר משקל לכל אחת מהקשתות ברשת

b)

לא, היא תשאף לאפס משקולות קטנים

c)

היא תשאף לאזן בין המשקולות גם במחיר של פגיעה בתוצאות

101.

כאשר משתמשים בארכיטקטורת
encoder-decoder
עם
Attention Models
לצורך
machine translation

a)

בשלב ה­
decoder ,
מודל ה­
attention
מאפשר להתמקד במספר אזורים של הקלט בו זמנית

b)

בשלב ה­
encode,
מודל ה­
attention
מאפשר להתמקד במספר אזורים של הקלט בו זמנית

c)

בכל שלב ב-
AE
מודל ה­
attention
מאפשר להתמקד במספר אזורים של הקלט בו זמנית

102.

היותה של רשת
PixelCNN
אלגוריתם
auto regressive
מתבטאת ע"י

a)

ההפעלה הסדרתית של כל שכבות ה­ convolution
עבור כל פיקסל לפני המעבר לפיקסל הבא

b)

הן המעבר הסדרתי על כל פיקסל והן ע"י ההפעלה הסדרתית על כל צבע

c)

היכולת למקבל את תהליך האימון ע"י שימוש ב­
teacher forcing

d)

היכולת של הרשת ליצור מודל של פונקציות ההתפלגות של ערכי הפיקסלים השונים בתמונה.

103.

סטודנט בקורס למידה עמוקה הציע את הפונקציה הבאה
max(0.2z,2z)
כתחליף לפונקציות ה­
activation

a)

אסור

b)

מותר

c)

תלוי מקרה

104.

מטרתה של רגולריזציה הינה ­

a)

. trading increased bias for reduced variance

b)

. trading increased variance for reduced bias

105.

 negative sampling
יש צורך לוודא שהמילה ה"חיובית" לא תבחר בטעות כ"שלילית".

a)

TRUE

b)

FALSE

106.

neural style transfer

a)

בעת חישוב רכיב ה­
style ,
משתמשים במטריצת המחשבת את הקורלציה בין ההפעלות של הפילטרים 

השונים ב­
hidden layer
נתונה.

b)

בעת חישוב רכיב ה­
cost
משתמשים לרוב ברשת

c)

בעת חישוב רכיב ה­
cost
משתמשים לרוב בנוסחא

d)

בעת חישוב רכיב ה­
style ,
משתמשים במטריצת המחשבת את הקורלציה בין ההפעלות של הפילטרים 

השונים ב­
output layer
נתונה.