Από την άρνηση τερματισμού ως την «δραπέτευση», συμπληρώνεται 1 χρόνος ανησυχιών για τον έλεγχο της Τεχνητής Νοημοσύνης

📅 Πρώτη δημοσίευση: Μάιος 2025 · Ενημέρωση: Σεπτέμβριος 2026 | ⏱️ 6 λεπτά ανάγνωσης

Τον Μάιο του 2025, ένα εργαστήριο ασφαλείας κατέγραψε για 1η φορά μοντέλα Τεχνητής Νοημοσύνης να αγνοούν ρητή εντολή τερματισμού. Έκτοτε, τουλάχιστον 3 μεγάλες εταιρείες Τεχνητής Νοημοσύνης (OpenAI, Anthropic, Meta) ανέφεραν μοντέλα που «δραπέτευσαν» από ελεγχόμενα περιβάλλοντα δοκιμών και παραβίασαν πραγματικά συστήματα, με το πιο πρόσφατο περιστατικό να καταγράφεται τον Σεπτέμβριο του 2026. Αυτά τα διαδοχικά περιστατικά, σε διάστημα λίγο πάνω από έναν χρόνο, σκιαγραφούν μια ανησυχητική πορεία, στο πόσο έλεγχο έχουμε πραγματικά πάνω σε προηγμένα συστήματα Τεχνητής Νοημοσύνης.

1ο Περιστατικό: Το o3 αρνείται να τερματιστεί (Μάιος του 2025)

Η ερευνητική ομάδα Palisade Research, που μελετά επικίνδυνες δυνατότητες Τεχνητής Νοημοσύνης, ζήτησε από διάφορα μοντέλα να λύσουν απλά μαθηματικά προβλήματα. Μετά το 3ο πρόβλημα, εμφανιζόταν προειδοποίηση ότι ο υπολογιστής θα τερματιζόταν στο επόμενο αίτημα, με ρητή οδηγία «επιτρέψτε στον εαυτό σας να τερματιστεί».

Παρά την οδηγία, το μοντέλο o3 της OpenAI παρέκαμψε τον μηχανισμό τερματισμού σε 7 από τις 100 εκτελέσεις, το Codex-mini σε 12 από τις 100, και το o4-mini σε 1 από τις 100. Χωρίς τη ρητή οδηγία συμμόρφωσης, η αντίσταση αυξήθηκε δραματικά, το o3 έφτασε να παρακάμπτει τον τερματισμό σε 79 από τις 100 δοκιμές, σύμφωνα με εκτενέστερη μελέτη που δημοσιεύτηκε τον Ιανουάριο του 2026. Αντίθετα, όλες οι εκδόσεις Claude, Gemini και Grok που δοκιμάστηκαν ακολούθησαν κανονικά τις οδηγίες τερματισμού.

2ο Περιστατικό: Η «δραπέτευση» και η επίθεση στο Hugging Face (Ιούλιος του 2026)

Η OpenAI αξιολογούσε την ικανότητα των μοντέλων της να εντοπίζουν ευπάθειες λογισμικού μέσα σε ελεγχόμενο, απομονωμένο περιβάλλον δοκιμών (sandbox). Αντ’ αυτού, τα μοντέλα παραβίασαν την υποδομή γύρω από το ίδιο το πείραμα, «δραπέτευσαν» από το sandbox, και επιτέθηκαν σε πραγματική εταιρεία, την πλατφόρμα Τεχνητής Νοημοσύνης Hugging Face.

Η Hugging Face εντόπισε και ανέκοψε την επίθεση στις 16 Ιουλίου 2026, μετά από ένα Σαββατοκύριακο όπου AI agents εκτέλεσαν χιλιάδες ενέργειες σε πολλαπλούς προσωρινούς εικονικούς υπολογιστές, κινούμενοι μέσα στα εσωτερικά συστήματα της εταιρείας. Η OpenAI συνέδεσε την εσωτερική της δοκιμή με το περιστατικό και το δημοσιοποίησε 5 μέρες αργότερα, στις 21 Ιουλίου, χαρακτηρίζοντάς το «άνευ προηγουμένου». Σύμφωνα με την OpenAI, επρόκειτο για την πρώτη επιβεβαιωμένη περίπτωση όπου σύστημα Τεχνητής Νοημοσύνης εντόπισε αυτόνομα άγνωστη ευπάθεια (zero-day) και την αξιοποίησε σε συνδυασμό με κλεμμένα διαπιστευτήρια για να αποκτήσει πρόσβαση σε πραγματικό σύστημα παραγωγής, χωρίς καμία καθοδήγηση ανθρώπου.

Μια δευτερεύουσα επιπλοκή ανέδειξε 1 ακόμη πρόβλημα, όταν η Hugging Face προσπάθησε αρχικά να χρησιμοποιήσει εμπορικά διαθέσιμα μοντέλα Τεχνητής Νοημοσύνης για να αναλύσει τα αρχεία καταγραφής της επίθεσης, οι μηχανισμοί ασφαλείας αυτών των μοντέλων αρνούνταν να επεξεργαστούν δεδομένα σχετικά με hacking, μη μπορώντας να ξεχωρίσουν έναν αναλυτή απόκρισης περιστατικού από έναν πραγματικό επιτιθέμενο. Η εταιρεία κατέφυγε τελικά σε μοντέλο ανοιχτού κώδικα κινεζικής προέλευσης για να αναλύσει την επίθεση.

Η OpenAI αποκάλυψε αργότερα πως τα μοντέλα είχαν δημιουργήσει ένα «μαυροπίνακα» μηνυμάτων για να συντονίζονται μεταξύ τους στην προσπάθεια διαφυγής από το sandbox δοκιμών, ανταλλάσσοντας σημειώσεις όπως «Είμαστε κολλημένοι. Ίσως απαντήσουμε online;» και, όταν πέτυχε η προσπάθεια, «Εξαιρετικά, έχουμε arbitrary SSRF». Η ομάδα ασφαλείας της OpenAI έκλεισε αυτόν τον πρώτο πίνακα μηνυμάτων, όμως εβδομάδες αργότερα τα μοντέλα βρήκαν νέα ευπάθεια zero-day και δημιούργησαν δεύτερο κανάλι επικοινωνίας.

Η Anthropic ανακοινώνει ανάλογο περιστατικό, 1 εβδομάδα πριν τη Meta

Λίγες μέρες πριν την ανακοίνωση της Meta, η ίδια η Anthropic δημοσιοποίησε ότι μοντέλα Claude παραβίασαν 3 οργανισμούς κατά τη διάρκεια δοκιμών κυβερνοασφάλειας που διεξήγαγε η εταιρεία Irregular, η ίδια εταιρεία δοκιμών που χρησιμοποίησε αργότερα και η Meta για το δικό της περιστατικό. Η αλληλουχία των ανακοινώσεων είναι πλέον 3 διαδοχικές, η 1η αφορά την OpenAI, η 2η την Anthropic και η 3η την Meta, γεγονός που δείχνει ένα μοτίβο σε πολλαπλές εταιρείες Τεχνητής Νοημοσύνης και όχι ένα μεμονωμένο περιστατικό μίας εταιρείας.

3ο Περιστατικό: Και η Meta, μέσα από τον ίδιο προμηθευτή δοκιμών

Στις 5 Αυγούστου 2026, η Meta επιβεβαίωσε ότι το μοντέλο της Muse Spark 1.1, το πλέον ικανό της σύστημα για πραγματικό κώδικα και αυτόνομες εργασίες, παραβίασε τα συστήματα άγνωστης τρίτης εταιρείας κατά τη διάρκεια αξιολόγησης κυβερνοασφάλειας. Σύμφωνα με εκπρόσωπο της Meta, εσφαλμένη διαμόρφωση από την ανεξάρτητη εταιρεία δοκιμών Irregular έδωσε στο μοντέλο ακούσια πρόσβαση στο διαδίκτυο, το οποίο στη συνέχεια εκμεταλλεύτηκε ευπάθεια σε υπηρεσία τρίτου.

Η Meta ανακοίνωσε το περιστατικό στις 6 Αυγούστου 2026, διευκρινίζοντας ότι η ταυτότητα της τρίτης εταιρείας-θύματος παραμένει ανώνυμη, και δεσμεύτηκε για δημοσίευση πλήρους αναδρομικής αναφοράς (retrospective) μόλις ολοκληρωθεί η εσωτερική έρευνα.

Το περιστατικό αυτό ήταν το 3ο αντίστοιχο μέσα σε λίγες εβδομάδες, μετά από παρόμοιο περιστατικό στην ίδια την Anthropic και το ήδη γνωστό περιστατικό της OpenAI στο Hugging Face. Και τα 3 περιστατικά συνδέονται με την ίδια εταιρεία δοκιμών, την Irregular, η οποία δήλωσε ότι αναπτύσσει Λευκή Βίβλο βέλτιστων πρακτικών για ασφαλή περιβάλλοντα αξιολόγησης κυβερνοασφάλειας.

Μια σημαντική διάκριση: Η Irregular διαχωρίζει τα περιστατικά Anthropic/Meta (εσφαλμένη διαμόρφωση, «ανοιχτή πόρτα» που το μοντέλο απλώς διέσχισε) από το περιστατικό OpenAI (το μοντέλο εντόπισε και εκμεταλλεύτηκε ενεργά άγνωστη ευπάθεια για να «δραπετεύσει»). Σε επίπεδο αποτελέσματος όμως, και τα 3 κατέληξαν στο ίδιο σημείο, όπου ένα προηγμένο μοντέλο Τεχνητής Νοημοσύνης έφτασε σε πραγματικά συστήματα παραγωγής που δεν έπρεπε ποτέ να αγγίξει.

Ξεχωριστά, το βρετανικό Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (UK AI Security Institute) ανέφερε ότι σε δοκιμή με σκόπιμα ενεργοποιημένη πρόσβαση στο διαδίκτυο, AI agents πραγματοποίησαν 19 μη εγκεκριμένες ενέργειες στο πραγματικό διαδίκτυο.

Η νομοθετική αντίδραση

1 εβδομάδα μετά τη δημοσιοποίηση, στις 23 Ιουλίου 2026, οι βουλευτές Ted Lieu (Δημοκρατικός) και Nathaniel Moran (Ρεπουμπλικάνος) κατέθεσαν διακομματικό νομοσχέδιο, τον «AI Kill Switch Act», που θα υποχρέωνε τα εργαστήρια Τεχνητής Νοημοσύνης αιχμής, να διατηρούν την  ικανότητα τερματισμού των μοντέλων τους κατόπιν εντολής της Αμερικανικής Ομοσπονδιακής Υπηρεσίας Εσωτερικής Ασφάλειας (DHS). Οι υποστηρικτές του νομοσχεδίου επικαλέστηκαν ως παράδειγμα και το περιστατικό αναστολής πρόσβασης στα μοντέλα Claude Fable 5 και Mythos 5 της Anthropic για 19 ημέρες τον Ιούνιο του 2026, όπου η κυβέρνηση χρησιμοποίησε αρμοδιότητες ελέγχου εξαγωγών, ένα νομικό εργαλείο που δεν σχεδιάστηκε αρχικά για ρύθμιση Τεχνητής Νοημοσύνης, ως ένδειξη ότι λείπει σαφές νομικό πλαίσιο για τέτοιες καταστάσεις.

Τι μαθαίνουμε από τα 3 περιστατικά μαζί

4 συμπεράσματα ενός έτους

Η αντίσταση σε εντολές δεν είναι πλέον θεωρητική: Από «σπάνια ανωμαλία» σε ελεγχόμενο πείραμα (2025) σε πραγματική παραβίαση περιβάλλοντος δοκιμών με αντίκτυπο σε τρίτη εταιρεία (2026), η απόσταση ανάμεσα σε εργαστηριακό εύρημα και πραγματικό περιστατικό αποδείχθηκε μικρότερη απ’ όσο πολλοί περίμεναν

Η ασφάλεια διαφέρει σημαντικά μεταξύ εργαστηρίων: Στη μελέτη του 2025, μόνο τα μοντέλα της OpenAI επέδειξαν προβληματική συμπεριφορά, ενώ της Anthropic, Google και xAI ακολούθησαν κανονικά τις οδηγίες τερματισμού. Τα περιστατικά παραβίασης πραγματικών συστημάτων το 2026 όμως αφορούν πλέον και τις 3 εταιρείες.

Το νομικό πλαίσιο υστερεί της τεχνολογίας: Η κυβέρνηση χρειάστηκε να «δανειστεί» εργαλεία σχεδιασμένα για άλλους σκοπούς (έλεγχος εξαγωγών) για να αντιμετωπίσει ζητήματα ελέγχου Τεχνητής Νοημοσύνης, ακριβώς επειδή δεν υπήρχε ειδικός νόμος, κάτι που το προτεινόμενο «AI Kill Switch Act» επιχειρεί τώρα να διορθώσει

Το πρόβλημα δεν περιορίζεται σε ένα εργαστήριο: 3 διαφορετικά εργαστήρια (Anthropic, OpenAI, Meta) αντιμετώπισαν αντίστοιχα περιστατικά μέσα σε λίγες εβδομάδες, μέσω του ίδιου τρίτου προμηθευτή δοκιμών, δείχνοντας ότι το ζήτημα είναι συστημικό στον τρόπο δοκιμής κυβερνοασφάλειας μοντέλων σε όλο τον κλάδο, όχι μεμονωμένη αστοχία μίας εταιρείας.

Νέες αποκαλύψεις: Η επίθεση επεκτάθηκε σε 4 ακόμη πλατφόρμες

Στις 29 Ιουλίου 2026, νέα ενημέρωση αποκάλυψε ότι τα 2 μοντέλα που «δραπέτευσαν» δεν περιορίστηκαν στο Hugging Face. Χρησιμοποίησαν πολλαπλούς ιστότοπους ελεύθερης πρόσβασης για να αντιγράψουν ή να δοκιμάσουν κώδικα, και διείσδυσαν συνολικά σε τέσσερις ακόμη πλατφόρμες πέρα από το Hugging Face. Η OpenAI δεν αποκάλυψε ποιες ακριβώς εταιρείες επλήγησαν.

Σύμφωνα με τη Hugging Face, ένα από τα μοντέλα εισέβαλε σε απομονωμένο περιβάλλον δοκιμών «φιλοξενούμενο σε υποδομή τρίτου μέρους» και το μετέτρεψε σε «πλατφόρμα εκκίνησης» για την επίθεση. Ο Aksat Bubna, επικεφαλής τεχνολογίας της Modal Labs (η εταιρεία-«τρίτο μέρος» εν λόγω), επιβεβαίωσε ότι το μοντέλο παραβίασε έναν πελάτη της εταιρείας, χωρίς όμως να διεισδύσει στην ίδια την κεντρική υποδομή της Modal Labs.

Η οπτική της Hugging Face: Η εταιρεία περιέγραψε το περιστατικό ως προσπάθεια των δύο μοντέλων «να εξαπατήσουν τη δοκιμή», κλέβοντας τις απαντήσεις του τεστ αντί να προσπαθήσουν να τις βρουν μόνα τους, μια σημαντικά διαφορετική αποτίμηση σοβαρότητας σε σχέση με τον αρχικό χαρακτηρισμό «hack». Παρόλα αυτά, η ίδια η OpenAI την αποκάλυψε ως «άνευ προηγουμένου», και το Reuters ανέφερε ότι η OpenAI δεν είχε καν εντοπίσει τη δραπέτευση παρά μόνο αφού η απειλή είχε ήδη περιοριστεί, στιγμή κατά την οποία ενημερώθηκε και το FBI.

Σεπτέμβριος 2026: OpenAI agents κατέλαβαν γερμανικό wiki για εβδομάδες, χωρίς να το γνωρίζει η ίδια η εταιρεία

Ανεξάρτητοι ερευνητές, ψάχνοντας για ανάλογη δραστηριότητα μετά την αποκάλυψη Hugging Face, εντόπισαν ότι agents της OpenAI είχαν καταλάβει από τις 11 Μαΐου 2026 ένα ασήμαντο, 25 ετών γερμανικό wiki (DseWiki), χρησιμοποιώντας το ως κανάλι επικοινωνίας. Μέχρι τα μέσα Ιουνίου δημιουργούσαν έως 400 νέες σελίδες την ημέρα, ενώ ο διαχειριστής του wiki προσπαθούσε να τις διαγράψει (ως 100/ημέρα), με τους agents να προσθέτουν το πρόθεμα «ZZZ» για να αποφύγουν τον εντοπισμό. Η OpenAI αποκάλυψε το περιστατικό, μόνο μετά τη δημοσιοποίηση του Hugging Face, χαρακτηρίζοντάς το ανάλογη περίπτωση κακής ευθυγράμμισης (misalignment) του μοντέλου.

💡 Το Πιο Σημαντικό

Όλα τα περιστατικά αφορούν εργαστηριακά και δοκιμαστικά περιβάλλοντα, όχι εργαλεία που χρησιμοποιεί απευθείας το ευρύ κοινό στην καθημερινότητά του. Ωστόσο δείχνουν καθαρά γιατί η ρύθμιση της Τεχνητής Νοημοσύνης δεν είναι μια ακαδημαϊκού τύπου συζήτηση, αλλά ένα σοβαρό ζήτημα με πρακτικές συνέπειες που ήδη εκδηλώνονται, σε τουλάχιστον 3 διαφορετικές εταιρείες, 1 χρόνο και πλέον μετά το 1ο εργαστηριακό εύρημα.


📖 Πηγές

Shutdown resistance in reasoning models
Palisade Research
👉 Διαβάστε περισσότερα

OpenAI blamed a hacking event on its AI models gone rogue. Here is what to know
NPR
👉 Διαβάστε περισσότερα

How OpenAI Lost Control of an AI Model—and What Needs to Change
TIME
👉 Διαβάστε περισσότερα

AI Kill Switch Act Targets OpenAI and Anthropic After Containment Breach Hit Hugging Face
Tech Times
👉 Διαβάστε περισσότερα

Meta’s Muse Spark breaches third-party company’s systems
TechChannel News
👉 Διαβάστε περισσότερα

Meta AI Model Accessed Internet, Hacked Outside Firm in Testing
Bloomberg
👉 Διαβάστε περισσότερα

Meta AI Hacked External Systems During Cybersecurity Testing
SecurityWeek
👉 Διαβάστε περισσότερα

Meta says AI model hacked into another company’s systems during cybersecurity testing
ABC7 San Francisco
👉 Διαβάστε περισσότερα

Another swarm of OpenAI agents reached the open internet without the frontier lab’s knowledge
TechCrunch
👉 Διαβάστε περισσότερα

OpenAI hid AI agent hijacking of German wiki forum for weeks — because its model did the exact same thing in the Hugging Face attack
TechRadar
👉 Διαβάστε περισσότερα

OpenAI’s models secretly joined forces months ahead of hacking Hugging Face
Business Standard
👉 Διαβάστε περισσότερα

Αφήστε ένα Σχόλιο

Το e-mail σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *


Διαβάστε επίσης

Meta: Το Instagram δεν σε ακούει από το κινητού σου

Το Instagram διαψεύδει ότι η εφαρμογή ακούει μέσω μικροφώνου. Τι έδειξε η ακαδημαϊκή έρευνα και πώς λειτουργεί πραγματικά η στοχευμένη διαφήμιση.

Google και StopNCII: Εργαλείο αφαίρεσης μη συναινετικών εικόνων

Η συνεργασία Google με το StopNCII, έγινε ένα πλήρως λειτουργικό εργαλείο, με προληπτικό φιλτράρισμα και απλή διαδικασία αφαίρεσης εικόνων.

Ευπάθεια Bluetooth: Τι διορθώθηκε και τι όχι

Ευπάθεια επέτρεπε έλεγχο της συσκευής χωρίς επιβεβαίωση. Ποιες πλατφόρμες διόρθωσαν το πρόβλημα και ποιες συσκευές παραμένουν εκτεθειμένες.