Οπισθοδιάδοση σε Νευρωνικό Δίκτυο: Αλγόριθμος ML & Παράδειγμα
⚡ Έξυπνη Σύνοψη
Η οπισθοδιάδοση (backpropagation) είναι ο βασικός αλγόριθμος εκπαίδευσης ενός νευρωνικού δικτύου, ο οποίος βελτιστοποιεί κάθε βάρος από το σφάλμα που μετρήθηκε στην προηγούμενη εποχή, έτσι ώστε το μοντέλο να γενικεύει καλύτερα σε μη γνωστά δεδομένα, ένα επίπεδο κάθε φορά.
Τι είναι ένα τεχνητό νευρωνικό δίκτυο;
Ένα τεχνητό νευρωνικό δίκτυο είναι μια ομάδα συνδεδεμένων μονάδων εισόδου/εξόδου όπου κάθε σύνδεση φέρει ένα βάρος. Σας βοηθά να δημιουργήσετε προγνωστικά μοντέλα από μεγάλες βάσεις δεδομένων και ο σχεδιασμός δανείζεται το λεξιλόγιό του από το ανθρώπινο νευρικό σύστημα. Δίκτυα αυτού του είδους υποστηρίζουν την κατανόηση εικόνων, τη μηχανική μάθηση, την ομιλία μέσω υπολογιστή και πολλές άλλες εργασίες αναγνώρισης μοτίβων.
Η οπισθοδιάδοση είναι ο αλγόριθμος που αποφασίζει ποια θα πρέπει να είναι αυτά τα βάρη, επομένως οι δύο ιδέες είναι καλύτερο να διαβάζονται μαζί.
Τι είναι η backpropagation;
Η οπισθοδιάδοση (backpropagation) είναι η ουσία της εκπαίδευσης νευρωνικών δικτύων. Είναι η μέθοδος λεπτής ρύθμισης των βαρών ενός νευρωνικού δικτύου με βάση το ποσοστό σφάλματος που ελήφθη στην προηγούμενη εποχή (δηλαδή, επανάληψη). Η σωστή ρύθμιση των βαρών σάς επιτρέπει να μειώσετε τα ποσοστά σφάλματος και να κάνετε το μοντέλο αξιόπιστο αυξάνοντας τη γενίκευσή του.
Η αντίστροφη διάδοση στο νευρωνικό δίκτυο είναι μια σύντομη μορφή για την «προς τα πίσω διάδοση σφαλμάτων». Είναι μια τυπική μέθοδος εκπαίδευσης τεχνητών νευρωνικών δικτύων. Αυτή η μέθοδος βοηθά στον υπολογισμό της κλίσης μιας συνάρτησης απώλειας σε σχέση με όλα τα βάρη στο δίκτυο.
Δύο όροι συχνά συγχέονται. Μόνο οπισθοδιάδοση υπολογίζει η κλίση. ένας βελτιστοποιητής όπως η κλίση κατάβασης είναι αυτό που στην πραγματικότητα αλλαγές τα βάρη χρησιμοποιώντας αυτήν την κλίση. Σχεδόν κάθε σύγχρονο πλαίσιο εκτελεί αυτόματα οπισθοδιάδοση μέσω της μηχανής αυτόματης διαφοράς.
Πώς λειτουργεί ο αλγόριθμος backpropagation
Ο αλγόριθμος αντίστροφης διάδοσης σε νευρωνικά δίκτυα υπολογίζει την κλίση της συνάρτησης απώλειας για ένα μόνο βάρος μέσω του κανόνα αλυσίδας. Υπολογίζει αποτελεσματικά ένα επίπεδο κάθε φορά, σε αντίθεση με έναν απλό άμεσο υπολογισμό. Υπολογίζει την κλίση, αλλά δεν ορίζει πώς χρησιμοποιείται η κλίση. Γενικεύει τον υπολογισμό στον κανόνα δέλτα.
Ο κανόνας της αλυσίδας είναι αυτός που το καθιστά αποτελεσματικό. Η επίδραση ενός πρώιμου βάρους στην τελική απώλεια είναι ένα γινόμενο των τοπικών παραγώγων κατά μήκος της διαδρομής προς την έξοδο, επομένως ο αλγόριθμος αποθηκεύει προσωρινά το ενδιάμεσο αποτέλεσμα κάθε επιπέδου κατά την επιστροφή και το επαναχρησιμοποιεί για κάθε βάρος στο από κάτω επίπεδο αντί να υπολογίζει ξανά ολόκληρο το δίκτυο ανά βάρος.
Σκεφτείτε το ακόλουθο παράδειγμα διαγράμματος νευρωνικού δικτύου οπισθοδιάδοσης για να το κατανοήσετε. Το σχήμα tracένα πλήρες πέρασμα: οι είσοδοι εισέρχονται στα αριστερά, οι ενεργοποιήσεις μετακινούνται προς τα εμπρός μέσω του κρυφού επιπέδου προς την έξοδο και το μετρούμενο σφάλμα στη συνέχεια ταξιδεύει πίσω κατά μήκος των ίδιων συνδέσεων για να διορθώσει τα βάρη.
- Οι είσοδοι X, φτάνουν μέσω της προσυνδεδεμένης διαδρομής
- Η είσοδος μοντελοποιείται χρησιμοποιώντας πραγματικά βάρη W. Τα βάρη επιλέγονται συνήθως τυχαία.
- Υπολογίστε την έξοδο για κάθε νευρώνα από το επίπεδο εισόδου, στα κρυφά επίπεδα, στο επίπεδο εξόδου.
- Υπολογίστε το σφάλμα στις εξόδους:
ErrorB= Actual Output – Desired Output
- Επιστρέψτε από το επίπεδο εξόδου στο κρυφό στρώμα για να προσαρμόσετε τα βάρη έτσι ώστε να μειωθεί το σφάλμα.
- Συνεχίστε να επαναλαμβάνετε τη διαδικασία μέχρι να επιτευχθεί το επιθυμητό αποτέλεσμα.
Πολλά σχολικά βιβλία γράφουν την ίδια ποσότητα με επιθυμητό μείον πραγματικόΚαι οι δύο συμβάσεις λειτουργούν, επειδή το πρόσημο απορροφάται όταν ο βελτιστοποιητής υποδιαιρείται.tracts η κλίση, υπό την προϋπόθεση ότι διατηρείτε μία σύμβαση σε όλο το δίκτυο.
Στην πράξη, το σφάλμα σπάνια είναι ένα απλό υποκείμενο σφάλμα.tracΜια συνάρτηση απώλειας, όπως το μέσο τετραγωνικό σφάλμα για την παλινδρόμηση ή η διασταυρούμενη εντροπία για την ταξινόμηση, μετατρέπει τις διαφορές ανά έξοδο στον μοναδικό αριθμό του οποίου την αντίστροφη διάδοση κλίσης υπολογίζει στην πραγματικότητα.
Γιατί χρειαζόμαστε backpropagation;
Τα πιο σημαντικά πλεονεκτήματα της Backpropagation είναι:
- Η οπίσθια διάδοση είναι γρήγορη, απλή και εύκολη στον προγραμματισμό
- Δεν προσθέτει νέες δικές του παραμέτρους. Η ρύθμιση που κάνετε ανήκει στον βελτιστοποιητή και στο δίκτυο, κυρίως ο ρυθμός εκμάθησης και ο αριθμός των εισόδων.
- Είναι μια ευέλικτη μέθοδος καθώς δεν απαιτεί προηγούμενη γνώση για το δίκτυο
- Είναι μια τυπική μέθοδος που γενικά λειτουργεί καλά
- Δεν χρειάζεται καμία ειδική αναφορά στα χαρακτηριστικά της λειτουργίας για εκμάθηση.
Με απλά λόγια, χωρίς έναν αποτελεσματικό τρόπο για την απόκτηση διαβαθμίσεων, η εκπαίδευση οποιουδήποτε βαθύτερου επιπέδου από ένα μόνο επίπεδο θα ήταν υπολογιστικά μη πρακτική.
Τι είναι ένα δίκτυο προώθησης τροφοδοσίας;
Ένα νευρωνικό δίκτυο τροφοδοσίας είναι ένα τεχνητό νευρωνικό δίκτυο όπου οι κόμβοι δεν σχηματίζουν ποτέ έναν κύκλο. Αυτό το είδος νευρωνικού δικτύου έχει ένα στρώμα εισόδου, κρυφά στρώματα και ένα στρώμα εξόδου. Είναι ο πρώτος και απλούστερος τύπος τεχνητού νευρωνικού δικτύου.
Η διάκριση έχει σημασία εδώ επειδή το εμπρόσθιο πέρασμα της οπισθοδιάδοσης είναι ακριβώς ένα εμπρόσθιο πέρασμα· μόνο που η διόρθωση σφάλματος εκτελείται προς την αντίθετη κατεύθυνση.
Τύποι Δικτύων Οπίσθιας Διάδοσης
Δύο τύποι δικτύων backpropagation είναι:
- Στατική αντίστροφη διάδοση
- Επαναλαμβανόμενη οπίσθια διάδοση
Στατική αντίστροφη διάδοση
Είναι ένα είδος δικτύου οπισθοδιάδοσης που παράγει έναν χάρτηping μιας στατικής εισόδου για στατική έξοδο. Είναι χρήσιμο για την επίλυση ζητημάτων στατικής ταξινόμησης, όπως η οπτική αναγνώριση χαρακτήρων.
Επαναλαμβανόμενη οπίσθια διάδοση
Επαναλαμβανόμενη ανάδρομη διάδοση σε εξόρυξη δεδομένων τροφοδοτείται προς τα εμπρός μέχρι να επιτευχθεί μια σταθερή τιμή. Μετά από αυτό, το σφάλμα υπολογίζεται και διαδίδεται προς τα πίσω.
Η κύρια διαφορά μεταξύ των δύο αυτών μεθόδων είναι ότι ο χάρτηςping είναι ταχεία στην στατική ανάστροφη διάδοση, ενώ είναι μη στατική στην επαναλαμβανόμενη ανάστροφη διάδοση. Ο παρακάτω πίνακας παρουσιάζει τα δύο στοιχεία δίπλα-δίπλα.
| Κριτήριο | Στατική αντίστροφη διάδοση | Επαναλαμβανόμενη ανάδρομη διάδοση |
|---|---|---|
| ΧΑΡΤΗΣ | Στατική είσοδος σε στατική έξοδο | Μη στατικό· το δίκτυο σταθεροποιείται πριν χρησιμοποιηθεί το σφάλμα |
| Ταχύτητα | Ταχεία, ένα πέρασμα ανά δείγμα | Αργότερα, η ενεργοποίηση επαναλαμβάνεται μέχρι να σταθεροποιηθεί |
| Σχήμα δικτύου | Προώθηση, χωρίς κύκλους | Περιέχει συνδέσεις ανατροφοδότησης |
| Τυπική χρήση | Οπτική αναγνώριση χαρακτήρων, ταξινόμηση σταθερού μεγέθους | Προβλήματα των οποίων η έξοδος εξαρτάται από μια σταθερή εσωτερική κατάσταση |
Ιστορία της οπίσθιας διάδοσης
- Το 1961, η βασική έννοια της συνεχούς ανάδρομης διάδοσης προέκυψε στο πλαίσιο της θεωρίας ελέγχου από τους J. Kelly, Henry Arthur και E. Bryson.
- Το 1969, οι Bryson και Ho έδωσαν μια μέθοδο δυναμικής βελτιστοποίησης συστημάτων πολλαπλών σταδίων.
- Το 1970, ο Seppo Linnainmaa δημοσίευσε την αντίστροφη λειτουργία της αυτόματης διαφοροποίησης, την υπολογιστική μέθοδο στην οποία βασίζεται η σύγχρονη οπισθοδιάδοση.
- Το 1974, ο Werbos δήλωσε τη δυνατότητα εφαρμογής αυτής της αρχής σε ένα τεχνητό νευρωνικό δίκτυο.
- Το 1982, ο Hopfield έφερε την ιδέα του για ένα νευρωνικό δίκτυο.
- Το 1986, με την προσπάθεια των David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams, η backpropagation κέρδισε την αναγνώριση.
- Το 1989, ο Yann LeCun και οι συνεργάτες του εκπαίδευσαν ένα συνελικτικό δίκτυο με οπισθοδιάδοση για την ανάγνωση χειρόγραφων ψηφίων, μια από τις πρώτες πρακτικές χρήσεις σε μεγάλη κλίμακα.
- Το 1993, ο Wan ήταν το πρώτο άτομο που κέρδισε έναν διεθνή διαγωνισμό αναγνώρισης προτύπων με τη βοήθεια της μεθόδου backpropagation.
- Το 2006, η εργασία του Hinton πάνω στα δίκτυα βαθιών πεποιθήσεων και την προεκπαίδευση ανά επίπεδο αναζωπύρωσε το ενδιαφέρον για την εκπαίδευση δικτύων βαθιών πεποιθήσεων, το οποίο είχε σταματήσει λόγω των εξαφανιζόμενων κλίσεων.
- Το 2010, οι Xavier Glorot και Yoshua Bengio ανέλυσαν γιατί τα βαθιά δίκτυα ήταν δύσκολο να εκπαιδευτούν και εισήγαγαν βελτιωμένη αρχικοποίηση βαρών, η οποία μαζί με τις ενεργοποιήσεις ReLU κατέστησε πρακτική την βαθιά οπισθοδιάδοση.
- Το 2012, η AlexNet (Krizhevsky, Sutskever και Hinton) κέρδισε τον διαγωνισμό ImageNet χρησιμοποιώντας backpropagation με επιτάχυνση GPU, πυροδοτώντας την άνθηση της σύγχρονης βαθιάς μάθησης.
- Το 2014, εισήχθη ο βελτιστοποιητής Adam (Kingma και Ba) και γρήγορα έγινε η προεπιλεγμένη παραλλαγή κλίσης-καθόδου που χρησιμοποιείται με backpropagation.
- Το 2015, η ομαλοποίηση παρτίδων και τα υπολειμματικά δίκτυα (ResNet) έλυσαν προβλήματα ροής κλίσης σε πολύ βαθιά δίκτυα, επιτρέποντας την αντίστροφη διάδοση μέσω εκατοντάδων στρώσεων.
- Το 2015-2017, οι TensorFlow και PyTorΤο ch έκανε την αυτόματη διαφοροποίηση μια τυπική λειτουργία λογισμικού, επομένως οι διαβαθμίσεις δεν χρειαζόταν πλέον να παράγονται χειροκίνητα.
- Το 2017, εισήχθη η αρχιτεκτονική Transformer και εκπαιδεύεται από άκρο σε άκρο με backpropagation, όπως και τα μεγάλα γλωσσικά μοντέλα που βασίζονται σε αυτήν.
- Το 2019, οι Bengio, Hinton και LeCun έλαβαν το βραβείο ACM AM Turing για την εργασία τους σε βαθιά νευρωνικά δίκτυα.
- Το 2020, η εργασία με τίτλο «Backpropagation and the Brain» (Lillicrap, Santoro, Marris, Akerman και Hinton) υποστήριξε ότι ο εγκέφαλος μπορεί να προσεγγίσει τη μάθηση που μοιάζει με την backpropagation, ανοίγοντας ξανά τη συζήτηση για τη βιολογική πιθανολογία.
- Το 2022, ο Hinton πρότεινε τον αλγόριθμο Forward-Forward, μια μέθοδο εκπαίδευσης που αποφεύγει εντελώς το πέρασμα προς τα πίσω.
- Το 2024, οι John Hopfield και Geoffrey Hinton τιμήθηκαν με το βραβείο Νόμπελ Φυσικής για τις θεμελιώδεις ανακαλύψεις τους που επέτρεψαν τη μηχανική μάθηση με τεχνητά νευρωνικά δίκτυα.
- Το 2025, οι μέθοδοι forward-forward επεκτάθηκαν σε συνελικτικά δίκτυα, δείχνοντας ότι η εκπαίδευση χωρίς backpropagation θα μπορούσε να λειτουργήσει σε εργασίες ταξινόμησης εικόνων.
- Από το 2026, η οπισθοδιάδοση παραμένει ο τυπικός αλγόριθμος εκπαίδευσης για σχεδόν όλα τα μοντέλα βαθιάς μάθησης, ενώ η έρευνα συνεχίζεται σε μεθόδους μάθησης χωρίς διαβάθμιση, τοπικές και παράλληλες μεθόδους μάθησης που μειώνουν τη μνήμη και το υπολογιστικό κόστος.
Βασικά σημεία οπίσθιας διάδοσης
- Απλοποιεί τη δομή του δικτύου αφαιρώντας τους σταθμισμένους συνδέσμους που έχουν τη μικρότερη επίδραση στο εκπαιδευμένο δίκτυο.
- Πρέπει να μελετήσετε μια ομάδα τιμών εισόδου και ενεργοποίησης για να αναπτύξετε τη σχέση μεταξύ των επιπέδων εισόδου και των κρυφών μονάδων.
- Βοηθά στην αξιολόγηση του αντίκτυπου που έχει μια δεδομένη μεταβλητή εισόδου σε μια έξοδο δικτύου. Η γνώση που αποκτάται από αυτή την ανάλυση θα πρέπει να αντιπροσωπεύεται σε κανόνες.
- Η οπίσθια διάδοση είναι ιδιαίτερα χρήσιμη για βαθιά νευρωνικά δίκτυα που εργάζονται σε έργα επιρρεπή σε σφάλματα, όπως η αναγνώριση εικόνας ή ομιλίας.
- Η οπισθοδιάδοση εκμεταλλεύεται τους κανόνες αλυσίδας και ισχύος, γεγονός που της επιτρέπει να λειτουργεί με οποιονδήποτε αριθμό εξόδων.
καλυτερα Practice for Backpropagation
Η αντίστροφη διάδοση σε νευρωνικό δίκτυο μπορεί να εξηγηθεί με τη βοήθεια της αναλογίας «Δαντέλα παπουτσιού». Οι ενημερώσεις βάρους συμπεριφέρονται όπως η τάση σε μια δαντέλα: πολύ λίγη και τίποτα δεν συγκρατείται, πολύ μεγάλη και κάτι σπάει.
| Ένταση δαντέλας | Τι σημαίνει κατά τη διάρκεια της προπόνησης |
|---|---|
| Πολύ μικρή ένταση | Δεν είναι αρκετά περιοριστικό και πολύ χαλαρό — το μοντέλο δεν ταιριάζει απόλυτα |
| Υπερβολική ένταση | Υπερβολικός περιορισμός (υπερπροπόνηση)· υπερβολική καθυστέρηση (σχετικά αργή διαδικασία)· υψηλότερη πιθανότητα σπασίματος |
| Τραβώντας τη μία κορδέλα περισσότερο από την άλλη | Δυσφορία (προκατάληψη) — ένα μέρος του δικτύου κυριαρχεί στην προσαρμογή |
Δύο πρακτικές συνήθειες προκύπτουν από την αναλογία: κλιμακώστε τις εισόδους πριν από την προπόνηση, ώστε κανένα μεμονωμένο χαρακτηριστικό να μην τραβάει περισσότερο από τα υπόλοιπα, και παρακολουθήστε την απώλεια επικύρωσης, ώστε να απελευθερωθεί η ένταση πριν ξεκινήσει η υπερβολική προπόνηση.
Μειονεκτήματα της χρήσης Backpropagation
- Η πραγματική απόδοση της backpropagation σε ένα συγκεκριμένο πρόβλημα εξαρτάται από τα δεδομένα εισόδου.
- Ο αλγόριθμος διάδοσης προς τα πίσω στην εξόρυξη δεδομένων μπορεί να είναι αρκετά ευαίσθητος σε θορυβώδη δεδομένα
- Σε μια μίνι-παρτίδα, η οπισθοδιάδοση θα πρέπει να υλοποιηθεί με μια προσέγγιση βασισμένη σε πίνακες.ping πάνω από ένα παράδειγμα κάθε φορά είναι σημαντικά πιο αργή.
- Σε βαθιά δίκτυα, ο επαναλαμβανόμενος πολλαπλασιασμός μικρών παραγώγων μπορεί να συρρικνώσει τις κλίσεις προς το μηδέν, επομένως τα πρώτα στρώματα μαθαίνουν ελάχιστα — το πρόβλημα της μηδενικής κλίσης που περιγράφεται στο Google Μάθημα Crash Machine Machine.
Τίποτα από αυτά δεν αποκλείει τη μέθοδο. Αυτοί είναι οι λόγοι για τους οποίους οι επαγγελματίες καταφεύγουν σε ενεργοποιήσεις ReLU, ομαλοποίηση και προσεκτικά χρονοδιαγράμματα ρυθμού μάθησης όταν μεταβαίνουν από ένα ρηχό δίκτυο σε ένα βαθιά μάθηση μοντέλο.

