Επισκόπηση
Μια διερεύνηση τοπικών, κβαντισμένων μοντέλων με εντολές — χωρίς κλήσεις API, όλα τρέχουν στη μηχανή. Μοντέλα: Llama-3.2-3B-Instruct και aya-expanse-8b ως αρχεία GGUF από το Hugging Face Hub.
Τι έφτιαξα
Ένα CLI με τέσσερις λειτουργίες: απλές ερωτήσεις/απαντήσεις, σύνολα ποικίλων ερωτήσεων, εναλλακτικές απαντήσεις σε διαφορετικές ρυθμίσεις temperature/top-p, και ανάλυση ομοιότητας ενσωματώσεων ως μπόνους άσκηση. Οι προτροπές δοκιμάστηκαν δίγλωσσα (αγγλικά και ελληνικά) για να διερευνηθεί πώς τα μοντέλα με εντολές διαχειρίζονται την εναλλαγή γλωσσών, και μια προαιρετική σημαία --log αποθηκεύει κάθε απάντηση για έλεγχο.
Τεχνικά highlights
- Ροή εργασίας κβάντισης GGUF (Q4_K_M) με llama-cpp-python
- Ελεγχόμενη διερεύνηση παραμέτρων δειγματοληψίας
- Ανάλυση ομοιότητας ενσωματώσεων με συνημίτονο
- Δίγλωσση αξιολόγηση προτροπών
Αποτέλεσμα
Πρακτική γνώση εκτέλεσης και δοκιμής ανοιχτών μοντέλων τοπικά.