Θέμα 6: Μεγάλα Γλωσσικά Μοντέλα και Συστήματα Ανάκτησης Πληροφορίας για Υποστήριξη Αποφάσεων στη Διοίκηση

Επιβλέπων: Νικόλαος Αμπαζής

Συνοπτική Περιγραφή Έρευνας και ΑπαιτήσεωνΤο προτεινόμενο ερευνητικό θέμα εντάσσεται στην περιοχή των Μεγάλων Γλωσσικών Μοντέλων (Large Language Models - LLMs) και της αξιοποίησής τους σε συστήματα ανάκτησης πληροφορίας και υποστήριξης αποφάσεων. Η ραγδαία ανάπτυξη των LLMs έχει δημιουργήσει νέες δυνατότητες για την ανάλυση κειμένων, τη σύνθεση απαντήσεων, την αυτοματοποίηση γνωσιακών εργασιών και την υποστήριξη χρηστών σε σύνθετα περιβάλλοντα πληροφόρησης. Παράλληλα, όμως, η χρήση τους σε πραγματικές εφαρμογές διοίκησης και οικονομίας συνοδεύεται από σημαντικές προκλήσεις, όπως η παραγωγή μη τεκμηριωμένων ή ανακριβών απαντήσεων, η δυσκολία ελέγχου της αξιοπιστίας των αποτελεσμάτων και η ανάγκη σύνδεσης των παραγόμενων απαντήσεων με συγκεκριμένες και ελέγξιμες πηγές.

Η έρευνα θα εστιάσει στη μελέτη και ανάπτυξη συστημάτων που συνδυάζουν LLMs με τεχνικές ανάκτησης πληροφορίας από δομημένα και μη δομημένα δεδομένα, με στόχο τη βελτίωση της ακρίβειας, της συνάφειας και της τεκμηρίωσης των παραγόμενων απαντήσεων. Ιδιαίτερη έμφαση θα δοθεί σε προσεγγίσεις Retrieval-Augmented Generation (RAG), σημασιολογικής αναζήτησης, θεματικής αναπαράστασης ερωτημάτων και εγγράφων, καθώς και σε τεχνικές επανακατάταξης (reranking) των ανακτηθέντων τεκμηρίων πριν από την παραγωγή της τελικής απάντησης. Στόχος είναι η διερεύνηση του τρόπου με τον οποίο η ποιότητα της ανάκτησης και η επιλογή των κατάλληλων συμφραζομένων επηρεάζουν την ποιότητα, την πληρότητα και την αξιοπιστία της τελικής απάντησης.

Πιο αναλυτικά, ο/η φοιτητής/τρια θα μελετήσει μεθόδους αναπαράστασης κειμένων και ερωτημάτων μέσω διανυσματικών ενσωματώσεων, τεχνικές υβριδικής αναζήτησης που συνδυάζουν λεξικογραφικά και σημασιολογικά κριτήρια, καθώς και τρόπους αξιοποίησης θεματικής πληροφορίας για την καλύτερη αντιστοίχιση ερωτημάτων με σχετικά τεκμήρια. Στο πλαίσιο αυτό μπορεί να εξεταστεί η χρήση topic-aware reranking ή άλλων μεθόδων εμπλουτισμού της διαδικασίας ανάκτησης, ώστε το σύστημα να μην επιστρέφει απλώς κείμενα με επιφανειακή ομοιότητα, αλλά τεκμήρια που συνδέονται ουσιαστικά με το ερώτημα και το πεδίο εφαρμογής.

Η εφαρμογή του θέματος μπορεί να γίνει σε σενάρια που σχετίζονται με διοικητική, επιχειρησιακή ή χρηματοοικονομική πληροφόρηση, όπως η αναζήτηση και σύνθεση πληροφορίας από αναφορές, κανονιστικά κείμενα, τεχνικά έγγραφα, επιχειρησιακές περιγραφές ή συλλογές επιστημονικών/επαγγελματικών κειμένων. Το ζητούμενο δεν είναι απλώς η παραγωγή γλωσσικά ικανοποιητικών απαντήσεων, αλλά η ανάπτυξη μιας διαδικασίας που επιτρέπει στον χρήστη ναελέγχει από πού προκύπτει η απάντηση, πόσο σχετικές είναι οι πηγές που χρησιμοποιήθηκαν και σε ποιο βαθμό η τελική σύνθεση μπορεί να υποστηρίξει μια απόφαση ή μια περαιτέρω ανάλυση.

Στο πρακτικό μέρος της εργασίας θα αναπτυχθεί πρωτότυπο σύστημα ή πειραματική διάταξη που θα περιλαμβάνει τα βασικά στάδια μιας τέτοιας αρχιτεκτονικής: προεπεξεργασία και τεμαχισμό κειμένων, δημιουργία ευρετηρίου, ανάκτηση υποψήφιων τεκμηρίων, επανακατάταξη, παραγωγή απάντησης από LLM και παρουσίαση των τεκμηρίων στα οποία βασίστηκε η απάντηση. Η αξιολόγηση θα πραγματοποιηθεί με ποσοτικά και ποιοτικά κριτήρια, όπως η συνάφεια των ανακτηθέντων τεκμηρίων, η πληρότητα της απάντησης, η ακρίβεια σε σχέση με τις διαθέσιμες πηγές, η μείωση μη τεκμηριωμένων ισχυρισμών και η χρησιμότητα της απάντησης για τον τελικό χρήστη.

Ο/Η μεταπτυχιακός/ή φοιτητής/τρια που θα επιλεγεί θα πρέπει να έχει καλή γνώση προγραμματισμού, βασικές γνώσεις μηχανικής μάθησης και ανάλυσης δεδομένων, καθώς και διάθεση να ασχοληθεί με τεχνικές επεξεργασίας φυσικής γλώσσας, ανάκτησης πληροφορίας και αξιολόγησης συστημάτων τεχνητής νοημοσύνης. Επιθυμητή είναι επίσης η εξοικείωση με εργαλεία Python και με βασικές έννοιες διανυσματικών βάσεων δεδομένων, embeddings, αξιολόγησης ταξινόμησης/ανάκτησης και πειραματικού σχεδιασμού.

Στο πρώτο στάδιο της εργασίας θα πραγματοποιηθεί βιβλιογραφική ανασκόπηση σε θέματα LLMs, RAG, σημασιολογικής αναζήτησης, επανακατάταξης τεκμηρίων και αξιολόγησης απαντήσεων. Στη συνέχεια θα σχεδιαστεί και θα υλοποιηθεί το πειραματικό σύστημα, θα επιλεγεί κατάλληλο σύνολο δεδομένων ή πεδίο εφαρμογής και θα πραγματοποιηθεί συγκριτική αξιολόγηση διαφορετικών επιλογών ανάκτησης και παραγωγής απαντήσεων. Στόχος είναι τα αποτελέσματα της εργασίας να οδηγήσουν σε τεκμηριωμένα συμπεράσματα σχετικά με το ποιες επιλογές αρχιτεκτονικής και αξιολόγησης βελτιώνουν ουσιαστικά την αξιοπιστία τέτοιων συστημάτων.

Ως το τέλος του 1ου εξαμήνου αναμένεται να έχει ολοκληρωθεί η βιβλιογραφική ανασκόπηση και ο αρχικός σχεδιασμός της αρχιτεκτονικής του συστήματος, ώστε να πραγματοποιηθεί η πρώτη έκθεση/παρουσίαση προόδου. Στο τέλος του 2ου εξαμήνου αναμένεται να έχει ολοκληρωθεί η υλοποίηση του βασικού πρωτοτύπου και η κύρια πειραματική αξιολόγηση, με έμφαση στη σύγκριση διαφορετικών μεθόδων ανάκτησης, επανακατάταξης και παραγωγής απαντήσεων. Κατά το 3ο εξάμηνο θα ολοκληρωθεί η ερμηνεία των αποτελεσμάτων, η συγγραφή της μεταπτυχιακής εργασίας και η προετοιμασία της τελικής υποστήριξης ενώπιον της επιτροπής.

Με την ολοκλήρωση της εργασίας αναμένεται να έχει παραχθεί ένα λειτουργικό πρωτότυπο, μια συστηματική πειραματική αξιολόγηση και ένα σύνολο συμπερασμάτων για τον σχεδιασμό αξιόπιστων συστημάτων LLM/RAG σε περιβάλλοντα υποστήριξης αποφάσεων. Βασική επιδίωξη είναι τα αποτελέσματα της έρευνας να μπορούν να αξιοποιηθούν για τη συγγραφή επιστημονικής εργασίας σε ελληνικό ή διεθνές συνέδριο ή σε επιστημονικό περιοδικό του χώρου.

Ο/Η φοιτητής/τρια θα πραγματοποιεί την έρευνά του και παράλληλα θα έχει τη δυνατότητα να παρακολουθεί ένα μάθημα ανά εξάμηνο κατόπιν εισήγησης της τριμελούς επιτροπής. Τα προτεινόμενα μαθήματα είναι: