KXκωνσταντίνος.χαφής
Μηχανική Μάθηση & AIΠρωτότυπο2026

Ταξινόμηση Ενεργών Κέντρων Πρωτεϊνών

PythonBiopythonKerasTensorFlowscikit-learn

Επισκόπηση

Ποια αμινοξικά κατάλοιπα αποτελούν το ενεργό κέντρο μιας πρωτεΐνης; Κλασικά, η απάντηση απαιτεί δομική ανάλυση. Αυτό το έργο φτιάχνει σύνολο δεδομένων σε επίπεδο καταλοίπων από πραγματικές δομές και εκπαιδεύει νευρωνικό δίκτυο για αυτόματη ταξινόμηση.

Τι έφτιαξα

Ένα pipeline τεσσάρων σταδίων. Πρώτον, ερώτημα UniProt εξάγει ανθρώπινες πρωτεΐνες με σχολιασμένα ενεργά κέντρα και επιλέγει τη συνδεδεμένη δομή PDB με την καλύτερη ανάλυση. Έπειτα, δομές mmCIF κατεβαίνουν παράλληλα. Ένας εξαγωγέας χαρακτηριστικών υπολογίζει περιγραφές με επίκεντρο το κατάλοιπο: one-hot ταυτότητα αμινοξέος, αριθμός γειτόνων σε ακτίνα, μέσος όρος και τυπική απόκλιση αποστάσεων γειτόνων, και επιφανειακή προσβασιμότητα μέσω του αλγορίθμου Shrake–Rupley.

Ο ταξινομητής είναι πυκνό feed-forward νευρωνικό δίκτυο Keras, εκπαιδευμένο σε στρωματοποιημένο διαχωρισμό με στάθμιση κλάσεων για ανισορροπία, early stopping και παρακολούθηση AUPRC — τη σωστή μετρική για σπάνια θετικά. Τα logs TensorBoard και το ιστορικό εκπαίδευσης αποθηκεύονται μαζί με το μοντέλο.

Τεχνικά highlights

Αποτέλεσμα

Πλήρες, αναπαράξιμο ML pipeline από δημόσια δεδομένα έως εκπαιδευμένο ταξινομητή καταλοίπων.