Font size
Worksheetsdeep learning
Total questions: 106
Worksheet time: 59mins
היתרון המרכזי של למידה עמוקה על למידת מכונה קלאסית הוא
קלות המימוש
הייתרון של שיפור המודלים בהינתן ידע
יכול להשתפר גם אחרי כמויות גדולות של דאטה
אין, תמיד כדאי לקחת
XGBoost
החסרון הראשי של למידה עמוקה על למידת מכונה קלאסית הוא
קלות המימוש
הייתרון של שיפור המודלים בהינתן ידע
יכול להשתפר גם אחרי כמויות גדולות של דאטה
תהליך עיבוד הדאטה קשה יותר לקראת רשת נוירונים
למה משמשת פונקציית ה
sigmoid
פיזור הסתבוריות המימוש בשכבה האחרונה על גבי הקלאסים
חיזוי איכותיני במשימות רגרסיה
מגוון שימושים כולל ברגרסיה לוגיסטית
אף אחת מהתשובות איננה נכונה
מדוע משתמשים ב
GDS
על פונקצית ה
cost?
אין סיבה
מאפשר לנו לכנס את פוקנציית הלוס שלנו אל עבר האפס
מאפשר לנו בחירת פיצ'רים טובה יותר על סט האימון
מאפשר לנו בחירת פיצ'רים טובה יותר על סט המבחן
למה משתמשים ב
GDS
על פונקצית ה
cost?
אין סיבה
מאפשר לנו לכנס את פוקנציית הלוס שלנו אל עבר האפס
מעדכנים את המשקולות על הקשתות באמצעות חישובים על הלוסט
מעדכנים את ההטיות באמצעות חישובים על הלוסט
למה משתמשים ב
GDS
על פונקצית ה
cost?
אין סיבה
מאפשר לנו לכנס את פוקנציית הלוס שלנו אל עבר האפס
מעדכנים את המשקולות על הקשתות באמצעות חישובים על הלוסט
מעדכנים את ההטיות באמצעות חישובים על הלוסט
מדוע שימוש בוקטורים נכון יותר בחישובים לרשתות נוירונים
חוסכים את החישוב בתוך לולאות
ומייעלות זמן ריצה
שלל חבילות קוד תומכות בזה כבר
כפל מטריצות יותר מדויק למחשב
תמיכה של
GPU
מה הם מימדי השכבה אמצעית
W1:[4,3]
B1:[4,1]
A1:[4,1]
W1:[4,1]
B1:[4,1]
A1:[4,1]
W1:[4,3]
B1:[4,3]
A1:[4,3]
W1:[4,3]
B1:[4,1]
A1:[4,5]
עדכון המשקולות ברשת קורה מהסוף להתחלה
נכון
לא נכון
מדוע לא משתמשים בפונקציית סיגמוייד באמצע הרשת
להימנע מבעיית
exploding gradient
להימנע מבעיית
vanishing gradient
להימנע מבעיית
zero-sum gradient
אין סיבה שלא
מה מהבאים מייצג את
relu
מדוע חשוב שהפונקציות ההפעלה יהיו לא לינאריות
כדי לגוון
יהפוך רשת שלמה לשכבה אחת
הנגזרת לא תהיה משמעותית מה שיגרור לעדכון לא איכותני
ניתן להשתמש בפונקציות לינאריות
הטיה היא
התוחלת בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה
השונות בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה
ההתפלגות בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה
הפער בין חיזוי על הדגימה לבין ערך משתנה המטרה על הדגימה
את תהליך הרגלוציה אנו מפעילים בדרך כלל על
W
b
W + b
L2 פונקציית הרגולציה
עוזרת במצבים ש
נרצה לחזק ערכים גדולים ולהחליש ערכים קטנים
נרצה להחליש ערכים גדולים ולחזק ערכים קטנים
נרצה להחליש ערכים גדולים ולהחליש ערכים קטנים
נרצה לחזק ערכים גדולים ולחזק ערכים קטנים
L1 פונקציית הרגולציה
עוזרת במצבים ש
רוצים לקיים סוג של בחירת פיצ'רים
רוצים לאפס פיצ'רים לא חשובים
רוצים לקחת פיצ'רים חשובים בחשבון
כל התשובות נכונות
הוספת רעש לדגימות רנדומליות עוזר למונע
טעויות דיוק
התאמת יתר
חוסר התאמה
הוספת רעש אינה יכול לעזור
מהו
clipping labels
בבעיית סיווג בינארית - משנים את ערך המטרה בפלוס מינוס אפסילון
בבעיית סיווג בינארית - משנים את ערך המטרה כפול או חלקי אפסילון
שיטת רגולציה לבעיות רגרסיה
שיטת רגולציה
אוגמנטציה של נתונים הוא
שינוי הנתונים עם שמירה על מהותם
שימור הנתונים עם שמירה על מהותם
שינוי הנתונים עם שינוי של מהותם
שימור הנתונים עם שינוי על מהותם
the exploding gradient can be explained by which calculation
1.5^x
0.5^x
1^x
none of them
:סמן את הנכון עבור מומנטום אופטימייזר
במקום להשתמש בשיפוע כדי לשנות את מיקום המשקל, השתמש בו בפועל כדי לשנות את המהירות
נכון
לא נכון
כל אחד מהקווים מייצג אופטימייזר שונה
SGD-אדום
RMSPROP-ירוק
ADAM-סגול
MOMENTUM-כחול
SGD-ירוק
RMSPROP-אדום
ADAM-סגול
MOMENTUM-כחול
SGD-אדום
RMSPROP-ירוק
ADAM-כחול
MOMENTUM-סגול
SGD-אדום
RMSPROP-סגול
ADAM-ירוק
MOMENTUM-כחול
?ממה מגן עלינו נרמול באטצ'ים
רובסטיות של דאטה
אפקט כדור שלג
חוסר בגיוון הנתונים
חוסר תאימות בין השכבות
נרצה להפעיל פילטר 3על3 על מטריצה של 6על6 כאשר הפעלנו פאדינג והפכנו אותה ל8על8
הגודל שלה יהיה
6*6
9*9
11*11
8*8
עומק פילטר בשכבות קונבולוציה תמיד יהיה
שווה לעומק הקלט
שונה לעומק הקלט
שווה לעומק הפלט
שונה לעומק הפלט
בהינתן תמונה דו מימדית בגדול 32על32 נפעיל פילטר 5על5 עם גודל צעד 1
גודל הפלט יהיה
132+2⋅0−5+1
32+2⋅0+5+1
28+2⋅0−5+1
residual blocks
בא לעזור לנו במצב
ששכבה ראשונית יוצרת יותר נזק מתועלת
ששכבה ראשונית צריכה לשמר על המשקולות שלה לאחר האתחול
ששכבה מבין האחרונות יוצרת יותר נזק מתועלת
ששכבה מבין האחרונות צריכה לשמר על המשקולות שלה לאחר האתחול
?למה יכול לשמש 1*1 פילטר
הורדת ממדיות
העלאת ממדיות
מיצוע ממדיות
שיפור איכות התמונה
inception network
הוא מצב שבו מפעילים פילטרים שונים על ממדי עומק שונים של התמונה
לא נכון
נכון
לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,C1,C2,C3,
מה מסמן PC
pointer counter
ההסתברות האם מופיע אובייקט בתמונה
ההסתברות האם מופיע אובייקט בתמונה מקלאס C
האם ריבוע זה הוא אמצע התמנוה
לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,C1,C2,C3,
מסמן bx,by
pointer counter
ההסתברות האם מופיע אובייקט בתמונה
ההסתברות האם מופיע אובייקט בתמונה מקלאס C
קורדינטות אמצע האובייקט שבפיקסל
לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,C1,C2,C3,
מסמן bh,bw
גובה ורוחב האובייקט
ההסתברות האם מופיע אובייקט בתמונה
ההסתברות האם מופיע אובייקט בתמונה מקלאס C
קורדינטות אמצע האובייקט שבפיקסל
לאלגוריתם
YOLO
פלט בצורה הבא
PC,bx,by,bh,bw,C1,C2,C3,
מסמןC1,C2,C3
גובה ורוחב האובייקט
ההסתברות האם מופיע אובייקט בתמונה
ההסתברות האם מופיע אובייקט בתמונה מקלאס C
קורדינטות אמצע האובייקט שבפיקסל
IOU
משמש לחיתוך בין אוסף ריבועים שיש בתוכם תמונה כדי למצוא את הריבוע שתופס בצורה הטובה ביותר את האובייקט ברצוי
לא נכון
נכון
הטריק ב-
Neural style transfer
הוא
מישקול פונקציית ההפסד בין הפלט לכל אחד מהקלטים
מישקול פונקציית ההפסד בין הקלט לכל אחד מהפלטים
איתחול טוב של הרשת לפי רשת מאומנת אחרת
מדובר ברשת פשטנית למציאת דמיון בין תמונות
למה רשת בנויה שכבות צפופות פחות עדיף על רשת מבוססת
RNN
עבור בעיה מסוימת
נרצה למדל קשרים בין הפלטים
נרצה למדל קשרים בין הקלטים
חשיבות של מילה בתחילת המשפט עבור כלל משמעות המשפט
יכול לגרום להתמודדות עם בעיית
vanishing gradient
exploding gradient
מה מטרתו של כל שער ב
GRU
•Update gate – איזה מהמשקולות לנתוני העבר אפשר לעדכן
•Reset gate – איזה מנתוני העבר ניתן לשכוח
•Update gate – איזה מנתוני העבר ניתן לשכוח
•Reset gate – איזה מהמשקולות לנתוני העבר אפשר לעדכן
מה נכנס לשער העדכון ברכיב
GRU
זיכרון העבר
הקלט הנוכחי
אף אחד מהם
שניהם
בנוסף על שער העדכון , לשער הזכרון יש גם
מקדם שכחה
מקדם חיזוק
יכולת כפל
יכולת חיבור
כמה יש שערים יש ל
GRU AND LSTM
בהתאמה
2
3
3
3
2
1
1
2
איזו פונקציה מופעלת בשער השכחה ברכיב
LSTM
softmax
relu
leaky relu
tanh
בשער הקלט של רכיב
LSTM
מופעלות שתי הפונקציות הבאות
softmax
tanh
softmax
relu
relu
tanh
leaky relu
tanh
סדר הפעולות בשער הפלט הוא
softmax
tanh
multiple
softmax
relu
tanh
relu
softmax
tanh
softmax
tanh
relu
LSTM Variants – Peephole Connections
משלב את האינפוט משער הקונטקסט בכל אחד מהשערים הפנימיים ובכך גורם תמיד לקחת אותו בחשבון
מוחק את האינפוט משער הקונטקסט בכל אחד מהשערים הפנימיים ובכך גורם תמיד להתעלמות ממנו
משלב את האינפוט משער הקונטקסט בחלק אחד מהשערים הפנימיים ובכך גורם תמיד לקחת אותו בחשבון
LSTM Variants – Coupling the Input and Forget Gates
משלב את שער השכחה עם שער האינפוט ובכך נותן את היכולת לא לשכוח משהו אם שמת משהו אחר במקום
משלב את שער הפלט עם שער האינפוט ובכך נותן את היכולת לא לשכוח משהו אם שמת משהו אחר במקום
משלב את שער הפלט עם שער הקונטקסט ובכך נותן את היכולת לא לשכוח משהו אם שמת משהו אחר במקום
מה האתגר ביצירת אמבדינג למילים
צימוד קונטקסט ראוי למילה יכולה לגרור לכמות מידע אסטרונומית
צימוד קונטקסט לא ראוי למילה יכולה לגרור לכמות מידע אסטרונומית
השגת הדאטה
אין צורך ליצור אמבדינג, יש שכבות מאומנות באינטרנט ניתנות להורדה
ההבדל בין שתי הגישות ליצירת ווקטור לייצוג פסקה
Doc2Vec
PV-DM
למידת ייצוג הפסקה מתוך שימוש שלה כקונטקסט
PV-DM
למידת ייצוג הפסקה מתוך שימוש שלה כמשתנה מטרה
PV-DBOW
למידת ייצוג הפסקה כקלט כאשר המטרה לחזות את הסתברות הופעת המילים בה
PV-DBOW
למידת ייצוג הפסקה כקלט כאשר המטרה לחזות את רצף הופעת המילים בה
Autoregressive Generative Models
ליצירת תמונות פעול בשיטה הבאה
פיקסל אחר פיקסל
frame after frame
פריים בהינתן פיקסל
פיקסל בהינתן פריים
pixelCNN
חוזה עבור כל פיקסל
את הערך שלו
את ערך ה
-RGB
שלו
את ערך ה
-RGB
שלו לפי הקונטקסט שלו
את ערך ה
-RGB
שלו לפי הקונטקסט שלו ומאפשר מקבול
ההבדל בין
AE
לבין
VAE
הראשון חוזה ערך והשני חוזה התפלגות לערך
הראשון חוזה התפלגות לערך והשני חוזה ערך
הראשון חוזה התפלגות של ערך והשני חוזה הסתברות לערך
משתנה המטרה ב-
VAE
הוא
התפלגות המטרה מתוך דגימה
דגימה מתוך התפלגות המטרה
פונקציית ההפסד ברשת
VAE
הפער בין תוחלת התפלגות עבור ה-batch
תוחלת ההתפלגות הרצויה
הפער בין ערך התפלגות עבור המשתנה
לבין ערך המטרה שיצא
הפער בין התחזית
לבין ערך המטרה שיצא
האתגרים ביצירת
GAN
אין ערך משתנה ברור לג'נרטור
האימון הוא קשה
אין התכנסות
נוטה לחוות התאמת יתר
mode collapse
הוא מצב שבו
מודל הסיווג טוב מידי
מודל הג'ינרוט טוב מידי
שני המודלים לא מתכנסים
שני המודלים מתכנסים
mode collapse
כדי לצאת ממצב כזה ניתן להשתמש ב
one vs all in D side
one vs all in G side
mini batch acception
learning less the D side
ניתן לקביל את
Generative Multi-Adversarial Networks
לאלגוריתם
רנדום פורסט
עץ החלטה
SVM
אף אחד
BEGAN
הוא שילוב של
GAN
AE
BE
הנפצה
בארכיטקטורה מסוג
BiGAN
רכיב המסווג מקבל 4 אינפוטים
קלט ופלט של ה-
AE
עבור הדאטה האמיתי והמונפץ
3 סוגי רעש
ווקטור אמבדינג לאיחודים
תמונה של סטודנטים, סרטון של רקדן, מוזיקה וכמות פריימים
שקר וכזב
כיצד נעשה
The reparameterization trick
ברשתות
VAE
מנתקים את שלב הדגימה מהמודל ומוסיפים אפסילון לשלב זה
לשלב הדגימה מוסיפים אפסילון
גורמים להפלגות להיות שכבה מחוברת בתוך המודל
חוזרים לייצוג ליטנטי רגיל ולא מייצרים הסתברות
מה הצעת המאמר
“Attention is all you need”
לנטוש את רשתות
RNN
ולעברו לרשתות
Dense
לתגבר את רשתות ה-
DENSE
בשכבת
attention
RNN
מתאימות לכל בעיה
RNN
אינן מתאימות לכל בעיה
נרצה להפעיל טרנספורמר על חיפוש באתר יוטיוב
מה הערכים שיכנסו אליו
Q-השאילתא
K-טקסט על הסרטון
V-ההמלצות המתאימות
Q-השאילתא
K-המילים בשאילתא
V-טקסט על הסרטון
Q-טקסט על הסרטון
K-השאילתא
V-ההמלצות המתאימות
מה השוני בין ראש לראש ב-
Multi-Head Attention
משתנה המטרה
האינפוטים
המשקולות המאותחלות
המשקולות בסיום
מה השלב הראשון במקודד של הטרמנספורמר
embadding
split to KQV
linear
Scaled Dot-Product Attention
Positional Encoding
כולל שימוש ב
קוסינוס לטוקנים הזוגיים
סינוס לטוקנים הזוגיים
סינוס לטוקנים האי-זוגיים
קוסינוס לטוקנים האי-זוגיים
Second-order proximity
הסיכוי שאני מכיר מישהו
הסיכוי שאני מכיר חבר שלי
הסיכוי שאני מכיר מישהו שחולק איתי שכונה אך אין ביננו קשר ישיר
הסיכוי שאינני מכיר מישהו שחולק איתי שכונה אך אין ביננו קשר ישיר
אלגוריתם
Large-scale Information Network Embedding (LINE)
מוציא שני ייצוגים לקודקוד עבור
Second order proximity
ייצוג לקודוקוד אל מול עצמו
ייצוג לקודקוד אל מול הקונטקסט שלו
ייצוג לקונטקסט שלו
אל מולו
האלגוריתם מוציא ייצוג אחד
first order proximity & Second order proximity
נקראים באלגרותים
node2vec
Homophily
&
Structural similarity
first order proximity & Second order proximity
major order proximity & minor order proximity
ציין איזה מהגרפיים ייצג
את המושגים הבאים בסדר הנכון
Homophily
Structural similarity
Structural similarity
Homophily
באלוגירתם
node2vec
מתקיימת הליכה רנדומלית, למה זו צריכה 2 פרמטרים נוספים
P & Q
אחד לחזרה למקורות ואחד ליציאה למקורות חדשים
להחלטת כיוון הפניה ימינה או שמאלה
אחד לכיוון הצעד ואחד לכמות התעדים במהלך
tdGraphEmbed
משליך גישות מקבילות לאיזה עולם על גרפים
NLP
זיהוי חריגות
חיפוש בגרפים
לפי אלגוריתם
tdGraphEmbed
כל הליכה מקודקוד מהווה ... וכל רצף הליכות מהווה ...
מילה
משפט
משפט
פסקה
תו
מילה
SelectiveNet
מכיל שתי רשתות
קבלה וסיווג
סיווג וסיווג משני
קבלה ודחיה
כיצד פתרו את בעיית ה"לקחת רק בעיות קלות לפתירה" במודל
SelectiveNet
שער
auxiliary
שמכריח את הרשת להתאמן על הכל
מכריחים את מודל החיזוי לחזות גם אם מודל הבחירה אמר שלא
מתעלמים ממודל הבחירה אחת לכמה פעמים
אין דרך
Background - Monte Carlo Dropout
שיטה בה מכניסים דגימה לכמה מופעים של אותה רשת עם אחוז דרופאאוט שונה
שיטה בה מכניסים דגימה כמה פעמים לאותה רשת ועושים מסקינג לחלקים בדגימה
שיטה בה מכניסים דגימה לכמה מופעים של אותה רשת עם אחוז דרופאאוט שונה
ועושים מסקינג לחלקים בדגימה
Quality Driven Method (QD)
מודל שמטרתו לחזות אינטרוול
מודל שמטרתו לחזות אינטרוול ומשתנה מטרה עם ערך רציף
מודל שמטרתו לחזות אינטרוול ומשתנה מטרה עם ערך בדיד
מודל שמטרתו לחזות משתנה מטרה בדיד
PIVEN
מחזיק שלושה ראשי פלט
חסם עליון
חסם תחתון
משתנה מטרה
גודל האינטרוול
פונקציית ההפסד מחושבת לפי שני מדדים באלגוריתם
PIVEN
PICP & MPIW
○PICP (PI coverage probability) - how many points were captured by the PI?
○MPIW (Mean PI width) - what is the width of the generated PI?
○PICP (PI coverage probability) - what is the width of the generated PI?
○MPIW (Mean PI width) - how many points were captured by the PI?
בלמידה מבוססת חיזוקים
מה ההבדל בין
value function
לבין
q-function
הראשונה נותנת ערך לכל מצב והשניה נותנת ערך לכל צימוד מצב ופעולה
הראשונה נותנת ערך לכל מצב ופעולה והשניה נותנת ערך לכל צימוד מצב
שתיהן נותנות ערך למצב על סמך מדיניות שונות
What does the Bellman equation in reinforcement learning relate to?
Expected future rewards and the value of a state or state-action pair.
Immediate rewards and the transition probabilities of an MDP.
Discount factors and the policy of an agent.
The Markov Decision Process and the optimal policy.
Policy Evaluation means
•explore the current value function/q-function to assess the quality of the current policy.
• test actions different than those recommended by the policy and see if they yield improvement
both
None
כיצד נתן לבצע שיפור מדיניות בצורה מקבילית
שינוי מדיניות עבור מצב אחד
שימור מצב המדיניות עבור כל שאר המצבים האחרים
שינוי מצב המדיניות עבור כל הערכים יחד
אין דרך לעשות זאת
Model-Based vs. Model Free Methods
כל המשתנים ידועים לנו
VS
חלק מהמשתנים ידועים לנו
חלק מהמשתנים ידועים לנו
VS
כל המשתנים ידועים לנו
בשני המצבים הכל ידוע והרשות נתונה
בשני המצביםלא הכל ידוע והרשות נתונה
example to off policy method can be
loading old policy and use it as is
watching you as a small kid your big bro play Vgames and try mimic him
you as big bro play Vgames and your small bro try mimic you
Importance Sampling for Off-Policy Methods
the relative probability of the trajectory for the target and behavior policies
the relative probability of the behavior for the target and trajectory policies
Importance Sampling for Off-Policy Methods - monte carlo:
Let us assume that b is ____ (so we can sample multiple trajectories) and π is ____
stochastic
deterministic
deterministic
stochastic
stochastic
stochastic
deterministic
deterministic
One-Step Temporal Difference
בודק מה קורה צעד אחד קדימה מבחינת פונקציית ערך של המצב הבא
בודק מה קורה צעד אחד קדימה מבחינת פונקציית
Q
של המצב הבא
ההבדל בין אלגוריתם
SARSA
לבין
TD-0
הסתכלות על פונקציית
V
מול
Q
הסתכלות על פונקציית
Q
מול
V
אין הבדל, מדובר באותו אלגוריתם
SARSA
פועלת בשונה מאללגוריתם
Q-LEARNING
בכך ש
לוקחת צעד לפי אפסילון גרידי
לוקחת צעד לפי מקסימום
Q
לוקחת צעד לפי מקסימום
V
מהם היתרונות של השימוש ב
vectorization-
בהכפלת מטריצות
א. ניתן להשתמש בגראדיינט ישירות בלי backpropagation
ניתן להאיץ את תהליך האימון ע"י ניתוח batch שלם בבת אחת ללא שימוש בלולאות
הייצוג הוקטורי הוא יעיל יותר ומאפשר לנו לנתח batches גדולים יותר ביעילות
אין יתרונות מעשיים, זו שיטה שמאפשרת לייצג את תהליכי ה forward/backward propagation- באופן
מובן יותר
הסבר כיצד השימוש ב
teacher forcing-
יכול להאיץ את האימון של .
auto regressive models
ניתן להשתמש
ברשת
PixelCNN
שימוש בתוצאות האמת למקבל ולקבל את התחזית העתידית
באיכות גובהה יותר
שימוש בתוצאות האמת למקבל את האימון
שימוש ברשתות לא מאומנות לחזוי תמונה על סמך תמונה רועשת
אילו מההצהרות הבאות נכונות עבור ארכיטקטורת
Generative Adversarial Network (GAN)
פונקציית ההפסד של שני הרכיבים לוקחת בחשבון את הביצעוים של שני הרכיבים
תרחיש בו רכיב
G
משפר את תוצאותיו בעוד
D
איננו משנה הוא מצב הגיוני
מצב בו רכיב
D
מגיע לדיוק מושלם עוזר לרכיב השני להשתפר מהר
בכל תרחיש אפשר רכיב
G
תמיד יקבל רעש רנדומלי
אלגוריתם ה
sliding window-
. הבסיסי לזיהוי עצמים משתמש במספר שכבות
האלגוריתם אפקטיבי אך איטי. כיצד נוכל לשפר את יעילותו:
להחליף את שכבות ה max pool-
בשכבות
average pool
להחליף את השכבות ה-
fully connected
ב
1x1 convolutions
ע"י שמירת ערכי הביניים שחושבו על ידי פילטרים ב sliding windows-
חופפים ניתן להימנע מחישוב חוזר של ערכים
להקטין את גודל ה sliding window- וע"י כך להקטין את מספר החישובים
אתם מאמנים רשת נוירונים עמוקה. לאחר מספר
epochs ה
loss function- מפסיקה לרדת
. אילו מהפעולות
הבאות עשויות לסייע בפתרון הבעיה:
הקטנת ה
learning rate-
הגדלת ה
learning rate-
הקטנת ה
mini-batch
הגדלת ה
mini-batch
על מנת למדל תלויות ארוכות טווח ב
GRU
שער ה
reset-
צריך להיות פעיל מאוד
שער ה
reset-
צריך להיות פעיל לא מאוד
שער ה
update-
צריך להיות פעיל לא מאוד
שער ה
update-
צריך להיות פעיל מאוד
מדוע שכבת האניקוד צריכה להיות קטנה יותר משכבת הקלט
ב
AE
לייצר תלות בין משתני הקלט
אחרת הרשת תחזיר בדיוק את הקלט
אין סיבה, זה תלוי מקרה
ב
variational learning-
אנו מסתמכים על ה
.variational bound-
אילו מההצהרות הבאות נכונה לגביו
מיועד להגביל את מספר הדגימות אותן יש לייצר באמצעות Monte Carlo sampling
מיועד להגביל את ההבדל בין ה modeled distribution- להתפלגות האמיתית
מגביל את מספר ה latent variables- שמשמשים למידול ההתפלגות האמיתית
הוא מודל ל approximate density-
של
ההתפלגות האמיתית
מדוע להוסיף
batchnorm
להימנע ממקרי גדור שלג
מקטין רעש בדאטה
מאפשר תלות גדולה יותר בין השכבות
auto regressive models
הם ניתנים להפעלה רק בדומיינים בהם לנתונים יש סדר "טבעי"
הם ניתנים להפעלה גם בדומיינים בהם אין לנתונים סדר טבעי, אך יש לקבוע סדר שרירותי כלשהו
הם ניתנים להפעלה רק בדומיינים בהם ניתן להגדיר
explicit density function
השימוש ב
teacher forcing- הוא נחוץ תמיד באלגוריתמים מסוג זה
האם הוספת
L2 norm regularization
יכולה לסייע בפתרון בעיית ה
vanishing gradient
כן, היא תמיד תשאיר משקל לכל אחת מהקשתות ברשת
לא, היא תשאף לאפס משקולות קטנים
היא תשאף לאזן בין המשקולות גם במחיר של פגיעה בתוצאות
כאשר משתמשים בארכיטקטורת
encoder-decoder
עם
Attention Models
לצורך
machine translation
בשלב ה
decoder ,
מודל ה
attention
מאפשר להתמקד במספר אזורים של הקלט בו זמנית
בשלב ה
encode,
מודל ה
attention
מאפשר להתמקד במספר אזורים של הקלט בו זמנית
בכל שלב ב-
AE
מודל ה
attention
מאפשר להתמקד במספר אזורים של הקלט בו זמנית
היותה של רשת
PixelCNN
אלגוריתם
auto regressive
מתבטאת ע"י
ההפעלה הסדרתית של כל שכבות ה convolution
עבור כל פיקסל לפני המעבר לפיקסל הבא
הן המעבר הסדרתי על כל פיקסל והן ע"י ההפעלה הסדרתית על כל צבע
היכולת למקבל את תהליך האימון ע"י שימוש ב
teacher forcing
היכולת של הרשת ליצור מודל של פונקציות ההתפלגות של ערכי הפיקסלים השונים בתמונה.
סטודנט בקורס למידה עמוקה הציע את הפונקציה הבאה
max(0.2z,2z)
כתחליף לפונקציות ה
activation
אסור
מותר
תלוי מקרה
מטרתה של רגולריזציה הינה
. trading increased bias for reduced variance
. trading increased variance for reduced bias
negative sampling
יש צורך לוודא שהמילה ה"חיובית" לא תבחר בטעות כ"שלילית".
TRUE
FALSE
neural style transfer
בעת חישוב רכיב ה
style ,
משתמשים במטריצת המחשבת את הקורלציה בין ההפעלות של הפילטרים
השונים ב
hidden layer
נתונה.
בעת חישוב רכיב ה
cost
משתמשים לרוב ברשת
בעת חישוב רכיב ה
cost
משתמשים לרוב בנוסחא
בעת חישוב רכיב ה
style ,
משתמשים במטריצת המחשבת את הקורלציה בין ההפעלות של הפילטרים
השונים ב
output layer
נתונה.
