Επισκόπηση
Ένα έργο εξόρυξης δεδομένων που επιτίθεται σε ανισόρροπο σύνολο εταιρικής πτώχευσης (στόχος X65): ειλικρινής προεπεξεργασία, εμπειρική επιλογή μοντέλων και εξήγηση του αποτελέσματος.
Τι έφτιαξα
Προεπεξεργασία με διαμόρφωση: αφαίρεση διπλοτύπων, αποκοπή/συμπλήρωση NaN, αποκοπή χαρακτηριστικών με συσχέτιση Kendall στο 0,999, φιλτράρισμα ακραίων τιμών, εύρωστη κανονικοποίηση, πολυωνυμικά χαρακτηριστικά, PCA και SelectKBest. Για την ανισορροπία, υπερδειγματοληψία SMOTE με ισορροπημένα βάρη κλάσεων.
Το κερδισμένο μοντέλο είναι HistGradientBoostingClassifier (ισορροπημένα βάρη, max_iter=200, max_depth=20, l2_regularization=0.2) ρυθμισμένο με GridSearchCV και αξιολογημένο με επαναλαμβανόμενη k-fold cross-validation. Το permutation_importance κατατάσσει τα χαρακτηριστικά, και μια ανάλυση top-10 δείχνει πώς διατηρείται η απόδοση όσο μικραίνει το σύνολο χαρακτηριστικών.
Τεχνικά highlights
- Συστηματική προεπεξεργασία με τεκμηριωμένες αποφάσεις για κάθε βήμα
- Εμπειρική επιλογή μοντέλων με επαναλαμβανόμενη cross-validation
- Κατάταξη χαρακτηριστικών και ανάλυση αφαίρεσης top-10
- Διαδρομή
regression.pyμε γραμμικές βασικές γραμμές για σύγκριση
Αποτέλεσμα
Ένα υπερασπίσιμο μοντέλο με μετρημένη απόδοση και ιστορία εξηγησιμότητας.