Skip to content

Latest commit

 

History

History
31 lines (20 loc) · 2.41 KB

File metadata and controls

31 lines (20 loc) · 2.41 KB

אימון מודל Skip-Gram

משימת מעבדה מתוך AI for Beginners Curriculum.

משימה

במעבדה זו, אנו מאתגרים אותך לאמן מודל Word2Vec באמצעות טכניקת Skip-Gram. אמן רשת עם הטמעה (embedding) כדי לחזות מילים שכנות בחלון Skip-Gram ברוחב $N$ טוקנים. ניתן להשתמש ב-קוד מהשיעור הזה ולבצע בו שינויים קלים.

מאגר הנתונים

אתה מוזמן להשתמש בכל ספר שתרצה. ניתן למצוא הרבה טקסטים חינמיים ב-Project Gutenberg, לדוגמה, הנה קישור ישיר ל-Alice's Adventures in Wonderland מאת לואיס קרול. לחלופין, ניתן להשתמש במחזות של שייקספיר, אותם ניתן להשיג באמצעות הקוד הבא:

path_to_file = tf.keras.utils.get_file(
   'shakespeare.txt', 
   'https://storage.googleapis.com/download.tensorflow.org/data/shakespeare.txt')
text = open(path_to_file, 'rb').read().decode(encoding='utf-8')

חקור!

אם יש לך זמן ואתה רוצה להעמיק בנושא, נסה לחקור כמה דברים:

  • כיצד גודל ההטמעה משפיע על התוצאות?
  • כיצד סגנונות טקסט שונים משפיעים על התוצאה?
  • קח כמה סוגים שונים מאוד של מילים והסינונימים שלהן, השג את הייצוגים הווקטוריים שלהן, יישם PCA כדי לצמצם את הממדים ל-2, ושרטט אותן במרחב דו-ממדי. האם אתה רואה דפוסים כלשהם?

כתב ויתור:
מסמך זה תורגם באמצעות שירות תרגום מבוסס AI Co-op Translator. למרות שאנו שואפים לדיוק, יש לקחת בחשבון שתרגומים אוטומטיים עשויים להכיל שגיאות או אי דיוקים. המסמך המקורי בשפתו המקורית צריך להיחשב כמקור סמכותי. עבור מידע קריטי, מומלץ להשתמש בתרגום מקצועי על ידי אדם. איננו נושאים באחריות לאי הבנות או לפרשנויות שגויות הנובעות משימוש בתרגום זה.