Εργαστηριακή Άσκηση από το AI for Beginners Curriculum.
Σε αυτή την άσκηση, σας προκαλούμε να εκπαιδεύσετε ένα μοντέλο Word2Vec χρησιμοποιώντας την τεχνική Skip-Gram. Εκπαιδεύστε ένα δίκτυο με ενσωμάτωση (embedding) για να προβλέπει γειτονικές λέξεις σε ένα παράθυρο Skip-Gram πλάτους
Μπορείτε να χρησιμοποιήσετε οποιοδήποτε βιβλίο. Μπορείτε να βρείτε πολλά δωρεάν κείμενα στο Project Gutenberg, για παράδειγμα, εδώ είναι ένας άμεσος σύνδεσμος για το Οι Περιπέτειες της Αλίκης στη Χώρα των Θαυμάτων) του Lewis Carroll. Εναλλακτικά, μπορείτε να χρησιμοποιήσετε τα έργα του Σαίξπηρ, τα οποία μπορείτε να αποκτήσετε χρησιμοποιώντας τον παρακάτω κώδικα:
path_to_file = tf.keras.utils.get_file(
'shakespeare.txt',
'https://storage.googleapis.com/download.tensorflow.org/data/shakespeare.txt')
text = open(path_to_file, 'rb').read().decode(encoding='utf-8')Αν έχετε χρόνο και θέλετε να εμβαθύνετε στο θέμα, δοκιμάστε να εξερευνήσετε διάφορα πράγματα:
- Πώς επηρεάζει το μέγεθος της ενσωμάτωσης (embedding size) τα αποτελέσματα;
- Πώς επηρεάζουν διαφορετικά στυλ κειμένου το αποτέλεσμα;
- Πάρτε αρκετές πολύ διαφορετικές λέξεις και τα συνώνυμά τους, αποκτήστε τις διανυσματικές τους αναπαραστάσεις, εφαρμόστε PCA για να μειώσετε τις διαστάσεις σε 2 και σχεδιάστε τις σε δισδιάστατο χώρο. Βλέπετε κάποια μοτίβα;
Αποποίηση Ευθύνης:
Αυτό το έγγραφο έχει μεταφραστεί χρησιμοποιώντας την υπηρεσία αυτόματης μετάφρασης Co-op Translator. Παρόλο που καταβάλλουμε προσπάθειες για ακρίβεια, παρακαλούμε να έχετε υπόψη ότι οι αυτόματες μεταφράσεις ενδέχεται να περιέχουν σφάλματα ή ανακρίβειες. Το πρωτότυπο έγγραφο στη μητρική του γλώσσα θα πρέπει να θεωρείται η αυθεντική πηγή. Για κρίσιμες πληροφορίες, συνιστάται επαγγελματική ανθρώπινη μετάφραση. Δεν φέρουμε ευθύνη για τυχόν παρεξηγήσεις ή εσφαλμένες ερμηνείες που προκύπτουν από τη χρήση αυτής της μετάφρασης.