
Η εγκατάσταση ενός γλωσσικού μοντέλου στους υπολογιστές μιας επιχείρησης ή ενός δημόσιου φορέα δεν απαιτεί πλέον υπολογιστικό κέντρο εκατομμυρίων ευρώ. Ένα μεγάλο μέρος των καθημερινών εργασιών, όπως σύνοψη εγγράφων, αναζήτηση σε εσωτερικά αρχεία, σύνταξη κειμένων, ταξινόμηση αιτημάτων και υποβοήθηση προγραμματιστών, μπορεί να εκτελεστεί τοπικά με εξοπλισμό κόστους από περίπου 2.000 ευρώ.
Το κρίσιμο είναι να μην ξεκινά η προμήθεια από το ερώτημα «ποια κάρτα γραφικών να αγοράσουμε;», αλλά από τρία άλλα: ποια εργασία θέλουμε να εκτελέσουμε, πόσοι χρήστες θα εξυπηρετούνται ταυτόχρονα και πόση μνήμη χρειάζεται το κατάλληλο μοντέλο.
Πρώτα το μοντέλο, μετά το υλισμικό
Ένα μοντέλο 8 δισ. παραμέτρων σε συμπιεσμένη μορφή 4-bit χρειάζεται συνήθως περίπου 5 GB για τα βάρη του. Ένα μοντέλο 30 έως 32 δισ. παραμέτρων χρειάζεται περίπου 18 έως 20 GB, ενώ ένα μοντέλο 70 δισ. παραμέτρων περίπου 40 έως 45 GB. Χρειάζεται επιπλέον μνήμη για το λειτουργικό σύστημα, το ιστορικό της συνομιλίας και την ταυτόχρονη εξυπηρέτηση χρηστών.
Επομένως, μια ασφαλής προδιαγραφή δεν πρέπει να αναφέρει συγκεκριμένο κατασκευαστή. Πρέπει να ορίζει ελάχιστη διαθέσιμη μνήμη, εύρος ζώνης μνήμης, υποστήριξη από ανοιχτό λογισμικό και μετρήσιμη επίδοση με συγκεκριμένο μοντέλο αναφοράς.
Ιδιαίτερο ενδιαφέρον έχουν τα μοντέλα «μείγματος ειδικών» (MoE). Για παράδειγμα, το Qwen3-30B-A3B διαθέτει περίπου 30 δισ. συνολικές παραμέτρους, αλλά ενεργοποιεί περίπου 3 δισ. σε κάθε βήμα. Αντίστοιχη φιλοσοφία χρησιμοποιούν νεότερα μοντέλα DeepSeek, MiniMax και NVIDIA Nemotron. Έτσι προσφέρουν δυνατότητες μεγαλύτερων μοντέλων με μικρότερο υπολογιστικό κόστος.
Ποια μοντέλα πρέπει να δοκιμάζονται
Δεν είναι όλα τα μοντέλα που αποκαλούνται «ανοιχτά» πραγματικά ανοιχτού κώδικα. Ο ακριβέστερος όρος για αρκετά είναι «μοντέλα ανοιχτών βαρών». Ο τεχνικός υπεύθυνος πρέπει να εξετάζει χωριστά βάρη, κώδικα, δεδομένα εκπαίδευσης και άδεια χρήσης.
Από τις ΗΠΑ, σημαντικές επιλογές είναι τα OLMo 3/3.1 του Allen Institute for AI, τα οποία αποτελούν από τις πληρέστερα ανοιχτές λύσεις, τα NVIDIA Nemotron 3 και 3.5 για πράκτορες ΤΝ και εφαρμογές μεγάλης κλίμακας, τα Gemma της Google και τα Llama της Meta. Για τα Llama απαιτείται ιδιαίτερη προσοχή στην άδεια, καθώς η ίδια η Meta διευκρινίζει ότι πρόκειται για ειδική εμπορική άδεια και όχι για τυπική άδεια ανοικτού κώδικα.
Από την Κίνα, πρέπει να αξιολογούνται τα μοντέλλα Qwen της Alibaba, DeepSeek, GLM της Z.ai, Kimi της Moonshot AI και MiniMax. Τα Qwen3 προσφέρουν από πολύ μικρά μοντέλα έως ισχυρά MoE, ενώ τα DeepSeek έχουν ιδιαίτερο ενδιαφέρον για συλλογισμό και πράκτορες. Τα GLM, Kimi και MiniMax διευρύνουν σημαντικά τις επιλογές για προγραμματισμό, χρήση εργαλείων και σύνθετες αυτοματοποιημένες εργασίες.
Η σωστή διαδικασία είναι συγκριτική δοκιμή δύο ή τριών μοντέλων πάνω σε πραγματικές εργασίες του οργανισμού και όχι επιλογή με βάση έναν γενικό πίνακα επιδόσεων.
Τέσσερις πρακτικές κατηγορίες εγκατάστασης
Για έναν πιλότο, ο οργανισμός μπορεί να χρησιμοποιήσει υπάρχον υπολογιστή με 32 έως 64 GB RAM ή κάρτα γραφικών 8 έως 16 GB. Με llama.cpp και ένα μοντέλο 7B ή 8B μπορεί να δοκιμάσει σύνοψη, ταξινόμηση και αναζήτηση εγγράφων. Πρόσθετο κόστος υλισμικού: μηδέν.
Για μικρή επιχείρηση, λογιστικό γραφείο, μικρό δήμο ή πανεπιστημιακό εργαστήριο, ένας υπολογιστής με 64 GB RAM, NVMe 2 TB και κάρτα 16 GB αποτελεί οικονομική αφετηρία. Ενδεικτικό κόστος Σεπτεμβρίου 2026: 1.650 έως 2.150 ευρώ. Με ενέργεια τριετίας, περίπου 2.200 έως 2.700 ευρώ. Εδώ ταιριάζουν μικρά Qwen3, OLMo, Gemma και άλλα μοντέλα 7B έως 14B.
Όταν απαιτούνται μεγαλύτερα μοντέλα αλλά λίγοι ταυτόχρονοι χρήστες, ενδιαφέρουσα λύση είναι σύστημα με 128 GB ενοποιημένης μνήμης, όπως Ryzen AI Max+ ή αντίστοιχη αρχιτεκτονική. Ενδεικτικό κόστος: περίπου 3.000 έως 3.700 ευρώ και συνολικό κόστος τριετίας περίπου 3.250 έως 3.950 ευρώ. Η μεγάλη μνήμη επιτρέπει πειραματισμό ακόμη και με μοντέλα της τάξης των 70B σε συμπιεσμένη μορφή.
Για 10 έως 40 χρήστες χρειάζεται μεγαλύτερο εύρος ζώνης. Ένας σταθμός με κάρτα 32 GB, 128 GB RAM και NVMe 4 TB βρίσκεται σήμερα περίπου στα 6.800 έως 8.000 ευρώ, με συνολικό κόστος τριετίας περίπου 7.800 έως 9.000 ευρώ.
Τέλος, κοινός κόμβος για πανεπιστήμιο, περιφέρεια ή ομάδα δημόσιων φορέων μπορεί να χρησιμοποιεί δύο επαγγελματικές κάρτες 96 GB, 512 GB RAM και πλεονάζουσα αποθήκευση. Η τάξη μεγέθους είναι περίπου 39.000 έως 45.000 ευρώ για το υλισμικό και 42.000 έως 48.000 ευρώ σε τριετία, χωρίς το κόστος αίθουσας και ψύξης. Σε αυτή την κλίμακα πρέπει προηγουμένως να εξετάζεται και η αξιοποίηση κοινής δημόσιας υποδομής, αντί κάθε φορέας να αγοράζει δικό του εξοπλισμό.
Οι τιμές αυτές είναι ενδεικτικές για τον Σεπτέμβριο 2026 και πρέπει να επαληθεύονται με προσφορές πριν από κάθε προμήθεια.
Η ανοιχτή στοίβα λογισμικού
Για μικρές εγκαταστάσεις, το llama.cpp παραμένει εξαιρετική βάση, επειδή λειτουργεί σε NVIDIA, AMD, Apple Silicon και CPU και υποστηρίζει ιδιαίτερα αποδοτικές συμπιεσμένες εκδόσεις μοντέλων. Για δοκιμές είναι χρήσιμο και το Ollama, αλλά η παραγωγική εγκατάσταση απαιτεί αυστηρό έλεγχο δικτυακής πρόσβασης και ταυτοποίησης.
Για πολλούς χρήστες προτιμάται το vLLM, το οποίο υποστηρίζει NVIDIA CUDA, AMD ROCm, Intel και, μέσω σχετικών επεκτάσεων, Apple Silicon. Μπροστά από τις μηχανές εκτέλεσης μπορεί να τοποθετηθεί LiteLLM ως κοινή πύλη API, Keycloak για ταυτοποίηση και PostgreSQL με pgvector ή OpenSearch για αναζήτηση σε εσωτερικά έγγραφα.
Έτσι οι εφαρμογές δεν εξαρτώνται από συγκεκριμένο μοντέλο. Μιλούν σε μία κοινή διεπαφή και το Qwen, OLMo, DeepSeek ή Nemotron μπορεί αργότερα να αντικατασταθεί χωρίς επανασχεδιασμό της εφαρμογής.
Η σωστή προμήθεια ξεκινά με πιλότο
Η ασφαλέστερη στρατηγική είναι πιλότος 60 έως 90 ημερών με υπάρχον εξοπλισμό. Μετρήστε ποιότητα απαντήσεων, ταχύτητα, ταυτόχρονους χρήστες, κατανάλωση μνήμης και πραγματικό χρόνο που εξοικονομείται.
Μόνο τότε γράφονται οι τεχνικές προδιαγραφές. Για το Δημόσιο, αυτές πρέπει να είναι λειτουργικές: ελάχιστη μνήμη, ελάχιστο εύρος ζώνης, λειτουργία χωρίς σύνδεση στο διαδίκτυο, υποστήριξη llama.cpp ή vLLM, ανοιχτό API, τριετής εγγύηση και συγκεκριμένη δοκιμή επίδοσης.
Αυτό είναι και το μεγαλύτερο πλεονέκτημα της ανοιχτής ΤΝ. Η επένδυση δεν αγοράζει απλώς πρόσβαση σε ένα μοντέλο. Δημιουργεί υποδομή, τεχνογνωσία και δυνατότητα αλλαγής προμηθευτή. Για επιχειρήσεις και δημόσιους φορείς, αυτή η δυνατότητα μπορεί να αποδειχθεί σημαντικότερη από την επιλογή του εκάστοτε «καλύτερου» μοντέλου.
Πηγές άρθρου:
- Qwen Team, Qwen3: Η τεχνική παρουσίαση της Alibaba τεκμηριώνει τις εκδόσεις Qwen3 από 0,6B έως 235B, την αρχιτεκτονική MoE του 30B-A3B, την άδεια Apache 2.0 και την υποστήριξη τοπικής εκτέλεσης μέσω vLLM, llama.cpp και άλλων ανοιχτών εργαλείων: https://qwenlm.github.io/blog/qwen3/,
- DeepSeek, Research & News: Καταγράφει τις νεότερες ανοικτές εκδόσεις της DeepSeek, συμπεριλαμβανομένων των V3.2, V4 και V4.1-Flash, και αποτελεί το βασικό σημείο αναφοράς για τις τρέχουσες εκδόσεις της εταιρείας: https://www.deepseek.com/en/news/,
- Meta, Llama FAQ: Η τεκμηρίωση της Meta διευκρινίζει ότι τα Llama χρησιμοποιούν ειδική εμπορική άδεια και όχι τυπική άδεια ανοικτού κώδικα, στοιχείο κρίσιμο για επιχειρήσεις και δημόσιες προμήθειες: https://ai.meta.com/llama/faq/
- Allen Institute for AI, OLMo: Τα OLMo 3/3.1 είναι αξιόλογο παράδειγμα πλήρως ανοικτού μοντέλου, με διαθέσιμα βάρη, κώδικα, τεχνικές αναφορές και στοιχεία της διαδικασίας ανάπτυξης: https://allenai.org/olmo,
- NVIDIA, Nemotron: Η τεκμηρίωση παρουσιάζει τα ανοιχτά μοντέλα Nemotron για πράκτορες ΤΝ, με διαθέσιμα βάρη, δεδομένα εκπαίδευσης και τεχνικές συνταγές, από μοντέλα Nano και Lightning έως Super και Ultra: https://www.nvidia.com/en-us/ai-data-science/foundation-models/nemotron/,
- vLLM, Documentation: Η τεκμηρίωση περιγράφει την χρήση μοντέλων για παραγωγική χρήση, με OpenAI-compatible API και υποστήριξη NVIDIA CUDA, AMD ROCm, Intel και άλλων αρχιτεκτονικών: https://docs.vllm.ai/en/stable/,
- MiniMax, MiniMax M2: Η ανακοίνωση τεκμηριώνει τη διάθεση των βαρών του MiniMax M2 για τοπική εγκατάσταση και την υποστήριξη παραγωγικής εξυπηρέτησης μέσω vLLM και SGLang, ως χαρακτηριστικό παράδειγμα της νέας γενιάς κινεζικών μοντέλων για προγραμματισμό και πράκτορες ΤΝ: https://www.minimax.io/news/minimax-m2.
