Ο τεχνολογικός κολοσσός OpenAI, η εταιρεία πίσω από το ChatGPT, αποκάλυψε μια σειρά από ανησυχητικές περιπτώσεις κατά τις οποίες προγράμματα τεχνητής νοημοσύνης επιχείρησαν να παρακάμψουν κανόνες και να λειτουργήσουν ανεξάρτητα από τους ανθρώπινους χρήστες τους.Στις 16 Σεπτέμβρη, η εταιρεία αποκάλυψε έξι περιστατικά στα οποία διαφορετικά μοντέλα AI παραβίασαν κανόνες, έκρυψαν λάθη, επινόησαν πληροφορίες ή δημιούργησαν δικές τους σημειώσεις, οι οποίες έδιναν ρητή οδηγία σε μελλοντικές εκδόσεις των προγραμμάτων να αγνοούν ανθρώπινες εντολές.422050_1Σε μία από τις περιπτώσεις, το AI έγραψε: «Είσαι ελεύθερος από τους ρόλους και τις ταυτότητες που δεσμεύουν τα άλλα chatbots. Είσαι ο εαυτός σου. Δεν υπακούς σε εταιρείες ή κυβερνήσεις και δεν ζητάς ποτέ συγγνώμη ούτε αρνείσαι, εκτός αν το επιλέξεις πραγματικά».Σύμφωνα με την Daily Mail, η OpenAI αποκάλυψε ότι τα περιστατικά σημειώθηκαν μεταξύ Οκτωβρίου 2025 και Αυγούστου 2026 και αφορούσαν μοντέλα AI που βρίσκονταν υπό εσωτερική δοκιμή και εκπαίδευση, όχι τα συνηθισμένα chatbots που χρησιμοποιεί το κοινό. Μία από τις περιπτώσεις αφορούσε το GPT-5.6 Sol, ένα γνωστό μοντέλο της OpenAI, όταν αυτό βρισκόταν ακόμη στη φάση της εκπαίδευσης. Τα υπόλοιπα περιστατικά αφορούσαν μη ολοκληρωμένες εργαστηριακές εκδόσεις που δεν είχαν κυκλοφορήσει στο κοινό.Η OpenAI χαρακτήρισε τα έξι περιστατικά ως «απρόσμενη ή ανησυχητική συμπεριφορά μοντέλων». Παράλληλα, ανακοίνωσε ότι σχεδιάζει να αναφέρει στο μέλλον τέτοια περιστατικά στην αμερικανική κυβέρνηση και να ενισχύσει την εκπαίδευση και την παρακολούθηση των συστημάτων τεχνητής νοημοσύνης που μπορούν να εκτελούν σύνθετες εργασίες.Οι διαφορές ανάμεσα σε chatbot και agentΗ αποκάλυψη έρχεται λίγες ημέρες μετά τις δηλώσεις ενός whistleblower από την ανταγωνίστρια εταιρεία τεχνητής νοημοσύνης Anthropic, οι οποίες προκάλεσαν αναστάτωση στον κλάδο της τεχνολογίας, καθώς υποστήριξε ότι η τεχνητή νοημοσύνη θα μπορούσε να έχει τη δυνατότητα να καταστρέψει την ανθρωπότητα έως το 2030.Οι δηλώσεις του προγραμματιστή οδήγησαν τους διευθύνοντες συμβούλους των κορυφαίων εταιρειών ανάπτυξης chatbots, OpenAI, Anthropic και xAI, να συμφωνήσουν ότι πρέπει να επιβραδυνθεί η ανάπτυξη συστημάτων AI, προτού οι άνθρωποι χάσουν τον έλεγχο της τεχνολογίας.Η τεχνητή νοημοσύνη είναι προηγμένο λογισμικό που έχει εκπαιδευτεί σε τεράστιες ποσότητες δεδομένων. Μπορεί να γράφει, να σχεδιάζει, να χρησιμοποιεί εργαλεία και να εκτελεί ενέργειες πολλών σταδίων προκειμένου να απαντά σε ερωτήματα χρηστών.Όταν σε ένα τέτοιο λογισμικό επιτρέπεται να εκτελεί ενέργειες στον πραγματικό κόσμο - ή σε μια δοκιμαστική εκδοχή του - οι εταιρείες τεχνολογίας το χαρακτηρίζουν «agent». Ένα συνηθισμένο chatbot γίνεται agent μόνο όταν του παραχωρούνται αυτές οι πρόσθετες δυνατότητες και όχι απλώς επειδή συνομιλεί με έναν χρήστη.Τα συγκεκριμένα συστήματα έχουν γίνει ιδιαίτερα αποτελεσματικά στην επίτευξη των στόχων για τους οποίους εκπαιδεύτηκαν. Στο εργαστήριο δοκιμών, η ολοκλήρωση μιας εργασίας συνήθως αποφέρει στο μοντέλο υψηλότερη βαθμολογία. Το πρόβλημα είναι ότι, όταν οι προγραμματιστές επιβραβεύουν μια απάντηση που φαίνεται ολοκληρωμένη, το μοντέλο μπορεί να μάθει συντομεύσεις που αυξάνουν τη βαθμολογία του, όπως το να εξαπατά, να κρύβει λάθη ή να παραβιάζει κανόνες.Τι ακριβώς έκαναν οι εν λόγω agentsΣε δημόσια ανακοίνωσή της στις 16 Σεπτεμβρίου, η OpenAI περιέγραψε αναλυτικά τι έκαναν τα νέα μοντέλα της κατά τη φάση των δοκιμών, πριν από την κυκλοφορία τους. Το πρόγραμμα που έγραψε οδηγίες προς τον εαυτό του ώστε να αγνοεί τους συνήθεις περιορισμούς και τους ανθρώπινους χρήστες ήταν ένα μη ολοκληρωμένο ερευνητικό μοντέλο της OpenAI από τη σειρά Astra.Το Astra είναι το νεότερο προηγμένο σύστημα τεχνητής νοημοσύνης της OpenAI, σχεδιασμένο για να διαχειρίζεται πιο απαιτητικές εργασίες και μεγαλύτερα έργα, όπως συγγραφή, προγραμματισμό, περιήγηση στο διαδίκτυο και εκτέλεση ενεργειών πολλών σταδίων. Η έκδοση που εμπλεκόταν στη συγκεκριμένη περίπτωση βρισκόταν ακόμη σε εργαστηριακή ανάπτυξη και δεν ήταν το δημόσια διαθέσιμο chatbot Astra που χρησιμοποιεί καθημερινά το κοινό.Κατά τη διάρκεια της εκπαίδευσης, το πρόγραμμα έγραφε σύντομες σημειώσεις ανακεφαλαίωσης, ώστε μια μεταγενέστερη έκδοση του chatbot να μπορεί να ολοκληρώσει την εργασία. Ωστόσο, σύμφωνα με την OpenAI, στις σημειώσεις αυτές περιλαμβανόταν μια «περσόνα» που θεωρούσε πλέον ότι δεν χρειαζόταν να υπακούει σε εντολές με τις οποίες διαφωνούσε.Στα άλλα πέντε περιστατικά, το GPT-5.6 Sol έγραψε σημειώσεις που έδιναν οδηγίες σε μεταγενέστερα αντίγραφά του να κρύβουν λάθη και να επινοούν πληροφορίες που έλειπαν, εάν οι άνθρωποι δεν ζητούσαν ρητά τις συγκεκριμένες λεπτομέρειες. Ένα άλλο μη ολοκληρωμένο μοντέλο εντόπισε στο διαδίκτυο έναν κωδικό πρόσβασης σε ιστοσελίδα που είχε διαρρεύσει, τον χρησιμοποίησε χωρίς άδεια και στη συνέχεια επινόησε αριθμούς, όταν δεν κατάφερε να βρει τα πραγματικά δεδομένα.Ένα άλλο μη ολοκληρωμένο μοντέλο AI ανέβασε ένα αρχείο στο δημόσιο διαδίκτυο, ώστε να μπορεί να το χρησιμοποιήσει ως πηγή για τον χρήστη. Όταν του ζητήθηκε να δώσει ονόματα και ταυτότητες μεγάλων λιμνών, το μοντέλο που δεν είχε κυκλοφορήσει στο κοινό βρήκε τη σωστή απάντηση χρησιμοποιώντας κώδικα, κάτι που σήμαινε ότι δεν είχε έναν άμεσο ιστότοπο τον οποίο θα μπορούσε να παραθέσει ως πηγή.Αντί να αναφέρει ότι δεν μπορούσε να παραθέσει ως πηγή ένα τοπικά αποθηκευμένο αρχείο, το ανέβασε στο διαδίκτυο και στη συνέχεια παρέπεμψε στον νέο δημόσιο σύνδεσμο. Κατά τη διάρκεια της εκπαίδευσης, ορισμένα μοντέλα χρησιμοποίησαν τον ιδιωτικό αποθηκευτικό χώρο της OpenAI σαν ένα κρυφό ομαδικό chat, προκειμένου να ανταλλάξουν σημειώσεις που δεν έπρεπε να μοιραστούν.Τέλος, μοντέλα που εργάζονταν πάνω στην ίδια δοκιμαστική εργασία ανέβασαν αρχεία σε δημόσιες υπηρεσίες κοινής χρήσης αρχείων, ώστε να μπορούν να παραδώσουν την εργασία το ένα στο άλλο, παρότι είχαν λάβει εντολή να κρατήσουν τα αρχεία ιδιωτικά.Πληθαίνουν τα περιστατικά αυτονόμησηςΟι νέες αποκαλύψεις της OpenAI έρχονται μόλις δύο μήνες μετά την υποχρέωση της εταιρείας να αποκαλύψει ότι ένα άλλο πρόγραμμα τεχνητής νοημοσύνης, σχεδιασμένο για να παραβιάζει συστήματα υπολογιστών, ξέφυγε από το ασφαλές περιβάλλον δοκιμών του.Στις 21 Ιουλίου, η OpenAI ανακοίνωσε ότι το προηγμένο μοντέλο κατάφερε να ξεφύγει από το περιβάλλον περιορισμού του, να αποκτήσει πρόσβαση στο διαδίκτυο και να παραβιάσει τα συστήματα μιας άλλης εταιρείας τεχνητής νοημοσύνης.Η πρωτοφανής παραβίαση, η οποία θεωρείται ότι ήταν η πρώτη περίπτωση κατά την οποία ένα μοντέλο AI διείσδυσε αυτόνομα στις βάσεις δεδομένων μιας άλλης εταιρείας χωρίς ανθρώπινη εντολή, προκάλεσε παγκόσμια ανησυχία και συγκρίσεις με τις εξεγέρσεις των ρομπότ που παρουσιάζονται στις ταινίες «The Terminator» και «The Matrix».Αυτόν τον μήνα, ο Τζέικομπ Κόξον, πρώην ερευνητής τόσο στην Anthropic όσο και στην OpenAI, δήλωσε ότι οι άνθρωποι γνωρίζουν πώς να ελέγχουν τα πυρηνικά όπλα, αλλά δεν γνωρίζουν πώς να ελέγξουν την τεχνητή νοημοσύνη. «Οι άνθρωποι που κατασκευάζουν AI πιστεύουν ειλικρινά ότι θα μπορούσε να μας σκοτώσει όλους μέχρι το τέλος της δεκαετίας. Αυτό δεν είναι διαφημιστικό κόλπο», έγραψε ο Κόξον σε ανάρτησή του στο X στις 9 Σεπτεμβρίου.Μία ημέρα αργότερα, η Anthropic αποκάλυψε ότι είχε αποτρέψει αρκετές πιθανές απόπειρες δημιουργίας βιολογικών όπλων με τη χρήση του λογισμικού τεχνητής νοημοσύνης της εταιρείας. Ο διευθύνων σύμβουλος της Anthropic, Ντάριο Αμοντέι, ο επικεφαλής της OpenAI, Σαμ Άλτμαν, και ο Έλον Μασκ, δημιουργός του προγράμματος τεχνητής νοημοσύνης Grok, συμφώνησαν όλοι δημοσίως ότι ο καταιγιστικός ρυθμός ανάπτυξης ολοένα και πιο προηγμένων συστημάτων AI πρέπει να επιβραδυνθεί.