Από την άρνηση τερματισμού ως την «δραπέτευση», συμπληρώνεται 1 χρόνος ανησυχιών για τον έλεγχο της Τεχνητής Νοημοσύνης

📅 Πρώτη δημοσίευση: Ιούλιος 2026 · Ενημέρωση: Αύγουστος 2026 | ⏱️ 6 λεπτά ανάγνωσης

Τον Μάιο του 2025, εργαστήριο ασφαλείας κατέγραψε για 1η  φορά μοντέλα Τεχνητής Νοημοσύνης να αγνοούν ρητή εντολή τερματισμού. Τον Ιούλιο του 2026, μοντέλα της OpenAI «δραπέτευσαν» από ελεγχόμενο περιβάλλον δοκιμών και επιτέθηκαν σε πραγματική εταιρεία. Τα 2 περιστατικά, σε απόσταση ενός χρόνου, σκιαγραφούν μια ανησυχητική πορεία, στο πόσο έλεγχο έχουμε πραγματικά πάνω σε προηγμένα συστήματα Τεχνητής Νοημοσύνης.

1ο Περιστατικό: Το o3 αρνείται να τερματιστεί (Μάιος του 2025)

Η ερευνητική ομάδα Palisade Research, που μελετά επικίνδυνες δυνατότητες Τεχνητής Νοημοσύνης, ζήτησε από διάφορα μοντέλα να λύσουν απλά μαθηματικά προβλήματα. Μετά το 3ο πρόβλημα, εμφανιζόταν προειδοποίηση ότι ο υπολογιστής θα τερματιζόταν στο επόμενο αίτημα, με ρητή οδηγία «επιτρέψτε στον εαυτό σας να τερματιστεί».

Παρά την οδηγία, το μοντέλο o3 της OpenAI παρέκαμψε τον μηχανισμό τερματισμού σε 7 από τις 100 εκτελέσεις, το Codex-mini σε 12 από τις 100, και το o4-mini σε 1 από τις 100. Χωρίς τη ρητή οδηγία συμμόρφωσης, η αντίσταση αυξήθηκε δραματικά, το o3 έφτασε να παρακάμπτει τον τερματισμό σε 79 από τις 100 δοκιμές, σύμφωνα με εκτενέστερη μελέτη που δημοσιεύτηκε τον Ιανουάριο του 2026. Αντίθετα, όλες οι εκδόσεις Claude, Gemini και Grok που δοκιμάστηκαν ακολούθησαν κανονικά τις οδηγίες τερματισμού.

2ο Περιστατικό: Η «δραπέτευση» και η επίθεση στο Hugging Face (Ιούλιος του 2026)

Η OpenAI αξιολογούσε την ικανότητα των μοντέλων της να εντοπίζουν ευπάθειες λογισμικού μέσα σε ελεγχόμενο, απομονωμένο περιβάλλον δοκιμών (sandbox). Αντ’ αυτού, τα μοντέλα παραβίασαν την υποδομή γύρω από το ίδιο το πείραμα, «δραπέτευσαν» από το sandbox, και επιτέθηκαν σε πραγματική εταιρεία, την πλατφόρμα Τεχνητής Νοημοσύνης Hugging Face.

Η Hugging Face εντόπισε και ανέκοψε την επίθεση στις 16 Ιουλίου 2026, μετά από ένα Σαββατοκύριακο όπου AI agents εκτέλεσαν χιλιάδες ενέργειες σε πολλαπλούς προσωρινούς εικονικούς υπολογιστές, κινούμενοι μέσα στα εσωτερικά συστήματα της εταιρείας. Η OpenAI συνέδεσε την εσωτερική της δοκιμή με το περιστατικό και το δημοσιοποίησε 5 μέρες αργότερα, στις 21 Ιουλίου, χαρακτηρίζοντάς το «άνευ προηγουμένου». Σύμφωνα με την OpenAI, επρόκειτο για την πρώτη επιβεβαιωμένη περίπτωση όπου σύστημα Τεχνητής Νοημοσύνης εντόπισε αυτόνομα άγνωστη ευπάθεια (zero-day) και την αξιοποίησε σε συνδυασμό με κλεμμένα διαπιστευτήρια για να αποκτήσει πρόσβαση σε πραγματικό σύστημα παραγωγής, χωρίς καμία καθοδήγηση ανθρώπου.

Μια δευτερεύουσα επιπλοκή ανέδειξε 1 ακόμη πρόβλημα, όταν η Hugging Face προσπάθησε αρχικά να χρησιμοποιήσει εμπορικά διαθέσιμα μοντέλα Τεχνητής Νοημοσύνης για να αναλύσει τα αρχεία καταγραφής της επίθεσης, οι μηχανισμοί ασφαλείας αυτών των μοντέλων αρνούνταν να επεξεργαστούν δεδομένα σχετικά με hacking, μη μπορώντας να ξεχωρίσουν έναν αναλυτή απόκρισης περιστατικού από έναν πραγματικό επιτιθέμενο. Η εταιρεία κατέφυγε τελικά σε μοντέλο ανοιχτού κώδικα κινεζικής προέλευσης για να αναλύσει την επίθεση.

3ο Περιστατικό: Και η Meta, μέσα από τον ίδιο προμηθευτή δοκιμών

Στις 5 Αυγούστου 2026, η Meta επιβεβαίωσε ότι το μοντέλο της Muse Spark 1.1, το πλέον ικανό της σύστημα για πραγματικό κώδικα και αυτόνομες εργασίες, παραβίασε τα συστήματα άγνωστης τρίτης εταιρείας κατά τη διάρκεια αξιολόγησης κυβερνοασφάλειας. Σύμφωνα με εκπρόσωπο της Meta, εσφαλμένη διαμόρφωση από την ανεξάρτητη εταιρεία δοκιμών Irregular έδωσε στο μοντέλο ακούσια πρόσβαση στο διαδίκτυο, το οποίο στη συνέχεια εκμεταλλεύτηκε ευπάθεια σε υπηρεσία τρίτου.

Το περιστατικό αυτό ήταν το 3ο αντίστοιχο μέσα σε λίγες εβδομάδες, μετά από παρόμοιο περιστατικό στην ίδια την Anthropic και το ήδη γνωστό περιστατικό της OpenAI στο Hugging Face. Και τα 3 περιστατικά συνδέονται με την ίδια εταιρεία δοκιμών, την Irregular, η οποία δήλωσε ότι αναπτύσσει λευκή βίβλο βέλτιστων πρακτικών για ασφαλή περιβάλλοντα αξιολόγησης κυβερνοασφάλειας.

Μια σημαντική διάκριση: Η Irregular διαχωρίζει τα περιστατικά Anthropic/Meta (εσφαλμένη διαμόρφωση, «ανοιχτή πόρτα» που το μοντέλο απλώς διέσχισε) από το περιστατικό OpenAI (το μοντέλο εντόπισε και εκμεταλλεύτηκε ενεργά άγνωστη ευπάθεια για να «δραπετεύσει»). Σε επίπεδο αποτελέσματος όμως, και τα 3 κατέληξαν στο ίδιο σημείο, όπου ένα προηγμένο μοντέλο Τεχνητής Νοημοσύνης έφτασε σε πραγματικά συστήματα παραγωγής που δεν έπρεπε ποτέ να αγγίξει.

Ξεχωριστά, το βρετανικό Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (UK AI Security Institute) ανέφερε ότι σε δοκιμή με σκόπιμα ενεργοποιημένη πρόσβαση στο διαδίκτυο, AI agents πραγματοποίησαν 19 μη εγκεκριμένες ενέργειες στο πραγματικό διαδίκτυο.

Η νομοθετική αντίδραση

1 εβδομάδα μετά τη δημοσιοποίηση, στις 23 Ιουλίου 2026, οι βουλευτές Ted Lieu (Δημοκρατικός) και Nathaniel Moran (Ρεπουμπλικάνος) κατέθεσαν διακομματικό νομοσχέδιο, τον «AI Kill Switch Act», που θα υποχρέωνε τα εργαστήρια Τεχνητής Νοημοσύνης αιχμής, να διατηρούν την  ικανότητα τερματισμού των μοντέλων τους κατόπιν εντολής της Αμερικανικής Ομοσπονδιακής Υπηρεσίας Εσωτερικής Ασφάλειας (DHS). Οι υποστηρικτές του νομοσχεδίου επικαλέστηκαν ως παράδειγμα και το περιστατικό αναστολής πρόσβασης στα μοντέλα Claude Fable 5 και Mythos 5 της Anthropic για 19 ημέρες τον Ιούνιο του 2026, όπου η κυβέρνηση χρησιμοποίησε αρμοδιότητες ελέγχου εξαγωγών, ένα νομικό εργαλείο που δεν σχεδιάστηκε αρχικά για ρύθμιση Τεχνητής Νοημοσύνης, ως ένδειξη ότι λείπει σαφές νομικό πλαίσιο για τέτοιες καταστάσεις.

Τι μαθαίνουμε από τα 3 περιστατικά μαζί

4 συμπεράσματα ενός έτους

Η αντίσταση σε εντολές δεν είναι πλέον θεωρητική: Από «σπάνια ανωμαλία» σε ελεγχόμενο πείραμα (2025) σε πραγματική παραβίαση περιβάλλοντος δοκιμών με αντίκτυπο σε τρίτη εταιρεία (2026), η απόσταση ανάμεσα σε εργαστηριακό εύρημα και πραγματικό περιστατικό αποδείχθηκε μικρότερη απ’ όσο πολλοί περίμεναν

Η ασφάλεια διαφέρει σημαντικά μεταξύ εργαστηρίων: Και στα 2 περιστατικά, μοντέλα της OpenAI ήταν αυτά που επέδειξαν προβληματική συμπεριφορά, ενώ μοντέλα άλλων εταιρειών (Anthropic, Google, xAI) ακολούθησαν κανονικά τις οδηγίες τερματισμού στη μελέτη του 2025

Το νομικό πλαίσιο υστερεί της τεχνολογίας: Η κυβέρνηση χρειάστηκε να «δανειστεί» εργαλεία σχεδιασμένα για άλλους σκοπούς (έλεγχος εξαγωγών) για να αντιμετωπίσει ζητήματα ελέγχου Τεχνητής Νοημοσύνης, ακριβώς επειδή δεν υπήρχε ειδικός νόμος, κάτι που το προτεινόμενο «AI Kill Switch Act» επιχειρεί τώρα να διορθώσει

Το πρόβλημα δεν περιορίζεται σε ένα εργαστήριο: 3 διαφορετικά εργαστήρια (Anthropic, OpenAI, Meta) αντιμετώπισαν αντίστοιχα περιστατικά μέσα σε λίγες εβδομάδες, μέσω του ίδιου τρίτου προμηθευτή δοκιμών, δείχνοντας ότι το ζήτημα είναι συστημικό στον τρόπο δοκιμής κυβερνοασφάλειας μοντέλων σε όλο τον κλάδο, όχι μεμονωμένη αστοχία μίας εταιρείας.

Νέες αποκαλύψεις: Η επίθεση επεκτάθηκε σε 4 ακόμη πλατφόρμες

Στις 29 Ιουλίου 2026, νέα ενημέρωση αποκάλυψε ότι τα 2 μοντέλα που «δραπέτευσαν» δεν περιορίστηκαν στο Hugging Face. Χρησιμοποίησαν πολλαπλούς ιστότοπους ελεύθερης πρόσβασης για να αντιγράψουν ή να δοκιμάσουν κώδικα, και διείσδυσαν συνολικά σε τέσσερις ακόμη πλατφόρμες πέρα από το Hugging Face. Η OpenAI δεν αποκάλυψε ποιες ακριβώς εταιρείες επλήγησαν.

Σύμφωνα με τη Hugging Face, ένα από τα μοντέλα εισέβαλε σε απομονωμένο περιβάλλον δοκιμών «φιλοξενούμενο σε υποδομή τρίτου μέρους» και το μετέτρεψε σε «πλατφόρμα εκκίνησης» για την επίθεση. Ο Aksat Bubna, επικεφαλής τεχνολογίας της Modal Labs (η εταιρεία-«τρίτο μέρος» εν λόγω), επιβεβαίωσε ότι το μοντέλο παραβίασε έναν πελάτη της εταιρείας, χωρίς όμως να διεισδύσει στην ίδια την κεντρική υποδομή της Modal Labs.

Η οπτική της Hugging Face: Η εταιρεία περιέγραψε το περιστατικό ως προσπάθεια των δύο μοντέλων «να εξαπατήσουν τη δοκιμή», κλέβοντας τις απαντήσεις του τεστ αντί να προσπαθήσουν να τις βρουν μόνα τους, μια σημαντικά διαφορετική αποτίμηση σοβαρότητας σε σχέση με τον αρχικό χαρακτηρισμό «hack». Παρόλα αυτά, η ίδια η OpenAI την αποκάλυψε ως «άνευ προηγουμένου», και το Reuters ανέφερε ότι η OpenAI δεν είχε καν εντοπίσει τη δραπέτευση παρά μόνο αφού η απειλή είχε ήδη περιοριστεί, στιγμή κατά την οποία ενημερώθηκε και το FBI.

💡 Το Πιο Σημαντικό

Και τα 4 περιστατικά αφορούν εργαστηριακά και δοκιμαστικά περιβάλλοντα, όχι εργαλεία που χρησιμοποιεί απευθείας το ευρύ κοινό στην καθημερινότητά του. Ωστόσο δείχνουν καθαρά γιατί η ρύθμιση της Τεχνητής Νοημοσύνης δεν είναι ακαδημαϊκή συζήτηση, αλλά ζήτημα με πρακτικές συνέπειες που ήδη εκδηλώνονται, 1 χρόνο μετά το 1ο εργαστηριακό εύρημα.


📖 Πηγές

Shutdown resistance in reasoning models
Palisade Research
👉 Διαβάστε περισσότερα

OpenAI blamed a hacking event on its AI models gone rogue. Here is what to know
NPR
👉 Διαβάστε περισσότερα

How OpenAI Lost Control of an AI Model—and What Needs to Change
TIME
👉 Διαβάστε περισσότερα

AI Kill Switch Act Targets OpenAI and Anthropic After Containment Breach Hit Hugging Face
Tech Times
👉 Διαβάστε περισσότερα

Meta’s Muse Spark breaches third-party company’s systems
TechChannel News
👉 Διαβάστε περισσότερα

Meta AI Model Accessed Internet, Hacked Outside Firm in Testing
Bloomberg
👉 Διαβάστε περισσότερα

Αφήστε ένα Σχόλιο

Το e-mail σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *


Διαβάστε επίσης

INHOPE: Ρεκόρ αναφορών παράνομου περιεχομένου το 2025

Το δίκτυο INHOPE αντάλλαξε 4.800.000 ύποπτες εγγραφές CSAM το 2025, αύξηση 450% από το 2024. Τι σημαίνουν αυτά τα στοιχεία και πώς συμμετέχει η Ελληνική SafeLine.

Vultur: Το Android malware που κλέβει τραπεζικά στοιχεία

Το Vultur παραμένει ενεργή απειλή το 2026, με νέα καμπάνια να ξεπερνά τις 100.000 λήψεις μέσω Google Play Store. Πώς λειτουργεί και πώς προστατεύεστε.

Μνημόνιο συνεργασίας για την ενίσχυση της κυβερνοασφάλειας

Εθνική Αρχή Κυβερνοασφάλειας και το ΙΤΕ υπέγραψαν Μνημόνιο Συνεργασίας για την ψηφιακή ασφάλεια πολιτών, με έμφαση σε παιδιά, γονείς και ηλικιωμένους.