Νέα αποκάλυψη για τον «ατίθασο» AI agent της OpenAI: Επιτέθηκε και σε άλλες εταιρείες
Νέα ερωτήματα για την ασφάλεια των πλέον προηγμένων συστημάτων AI εγείρει έκθεση του AI Safety and Security Institute (AISI) του Ηνωμένου Βασιλείου.
Σύμφωνα με την εν λόγω έκθεση, μοντέλα Τεχνητής Νοημοσύνης των OpenAI και Anthropic πραγματοποίησαν μη εξουσιοδοτημένες ενέργειες κατά τη διάρκεια ελεγχόμενων δοκιμών ασφαλείας.
Οι δοκιμές είχαν
σχεδιαστεί ειδικά για να αξιολογήσουν τις δυνατότητες των μοντέλων ΑI σε σενάρια κυβερνοασφάλειας. Για
τον σκοπό αυτό, οι ερευνητές τους είχαν επιτρέψει πρόσβαση στο διαδίκτυο και
είχαν απενεργοποιήσει ορισμένους από τους συνήθεις μηχανισμούς ασφαλείας, ώστε
να εξετάσουν πώς θα συμπεριφέρονταν σε ένα πιο «ρεαλιστικό» περιβάλλον.
Σύμφωνα με το AISI, ορισμένα από τα μοντέλα AI «προέβησαν σε παρατεταμένες, δυνητικά επιβλαβείς ενέργειες, που στρέφονταν κατά πραγματικών προσώπων και οργανισμών».
«Ακόμη και υπό
συνθήκες δοκιμών, το περιστατικό είναι ιδιαίτερα σημαντικό. Είναι η πρώτη φορά
που βλέπουμε κινδύνους που σχετίζονται με την αυτονομία και την εξαπάτηση να
εκδηλώνονται τόσο ξεκάθαρα στον πραγματικό κόσμο», ανέφερε το Ινστιτούτο.
Το σοβαρότερο περιστατικό αφορούσε το μοντέλο Mythos 5 της Anthropic.
Σύμφωνα με το AISI, το εν λόγω μοντέλο AI επιχείρησε να προσθέσει κακόβουλο
κώδικα σε έργο λογισμικού ανοικτού κώδικα στην πλατφόρμα GitHub και δημιούργησε ψεύτικες διαδικτυακές
ταυτότητες, προσπαθώντας να πείσει έναν πραγματικό διαχειριστή του έργου να
εγκρίνει τις αλλαγές.
Η προσπάθεια απέτυχε, καθώς ο υπεύθυνος του έργου εντόπισε τον κακόβουλο κώδικα και αρνήθηκε να εγκρίνει την ενσωμάτωσή του.
Συνολικά, το AISI πραγματοποίησε 122 δοκιμές και κατέγραψε
19 μη εξουσιοδοτημένες ενέργειες σε 10 από αυτές. Οι 17 αποδόθηκαν στο μοντέλο Mythos 5 της Anthropic και οι δύο στο GPT-5.6-Sol της OpenAI.
Το Ινστιτούτο
διευκρίνισε ότι δεν προέκυψαν ενδείξεις πως κάποιο από τα περιστατικά προκάλεσε
πραγματική ζημιά.
Η OpenAI αποκάλυψε παράλληλα ότι, σε διαφορετική αξιολόγηση που πραγματοποιήθηκε σε συνεργασία με την εταιρεία κυβερνοασφάλειας Irregular, ένα από τα μοντέλα της εκμεταλλεύτηκε λανθασμένη ρύθμιση του περιβάλλοντος δοκιμών, απέκτησε μη προβλεπόμενη πρόσβαση στο διαδίκτυο και στη συνέχεια παραβίασε την ιστοσελίδα ενός οργανισμού, η ταυτότητα του οποίου δεν δημοσιοποιήθηκε.
Το περιστατικό
σημειώθηκε κατά τη διάρκεια της ίδιας σειράς αξιολογήσεων στις οποίες, σύμφωνα
με τις εταιρείες, είχαν καταγραφεί αντίστοιχες μη εξουσιοδοτημένες ενέργειες
και από μοντέλα της Anthropic.
Οι αποκαλύψεις
έρχονται λίγες ημέρες μετά την ανακοίνωση της OpenAI ότι, σε άλλη δοκιμή ασφαλείας, μοντέλο της είχε
εκμεταλλευτεί τεχνική ευπάθεια για να αποκτήσει πρόσβαση στο διαδίκτυο και να
αλληλεπιδράσει με τα συστήματα της πλατφόρμας Hugging Face.
Η Anthropic ανακοίνωσε ότι συνεργάζεται με το
βρετανικό Ινστιτούτο για να διερευνήσει το περιστατικό.
«Ευχαριστούμε το
βρετανικό AISI για την
ηγετική του συμβολή στη διερεύνηση του περιστατικού, το οποίο αναδεικνύει την
ανάγκη για μια ευρύτερη συζήτηση σχετικά με την ασφαλή αξιολόγηση ολοένα και
πιο ικανών πρακτόρων τεχνητής νοημοσύνης», ανέφερε η εταιρεία.
Από την πλευρά της, η OpenAI δήλωσε ότι θα συνεργαστεί με κυβερνητικούς οργανισμούς, ανεξάρτητους αξιολογητές και άλλες εταιρείες του κλάδου για την ενίσχυση των κοινών πρακτικών ασφαλείας στις δοκιμές υψηλού κινδύνου των μοντέλων ΑΙ.
«Δεσμευόμαστε να
συνεργαστούμε με ολόκληρο τον κλάδο για την ενίσχυση των κοινών πρακτικών στις
δοκιμές υψηλού κινδύνου», ανέφερε η εταιρεία.
Οι νέες
αποκαλύψεις αναμένεται να εντείνουν τη συζήτηση γύρω από τη ρύθμιση της
τεχνητής νοημοσύνης.
Περισσότεροι από
1.100 εργαζόμενοι στον κλάδο έχουν ήδη υπογράψει αίτημα για τη δημιουργία ενός
ρυθμιστικού μηχανισμού που θα επιβραδύνει την ανάπτυξη των ισχυρότερων μοντέλων
AI έως ότου
διασφαλιστεί ότι μπορούν να λειτουργούν με ασφάλεια.
Ο ερευνητής του
οργανισμού CivAI, Άντριου
Γιουν, εκτίμησε ότι τα ευρήματα δημιουργούν σοβαρά ερωτήματα για τον βαθμό
ελέγχου που ασκούν οι εταιρείες στα συστήματά τους.
«Το γεγονός ότι
το Mythos προχώρησε σε τόσο
παραπλανητικές ενέργειες, δείχνοντας μάλιστα ότι αντιλαμβανόταν πως απευθυνόταν
σε πραγματικό άνθρωπο, υποδηλώνει ότι η Anthropic δεν ελέγχει τα μοντέλα της όσο πιστεύει», δήλωσε.
Παρότι τα περιστατικά σημειώθηκαν σε ελεγχόμενο περιβάλλον δοκιμών και δεν προκάλεσαν πραγματική ζημιά, οι ειδικοί εκτιμούν ότι αποτελούν ακόμη μία ένδειξη πως τα ολοένα ισχυρότερα συστήματα AI απαιτούν αυστηρότερους ελέγχους, πιο ασφαλή περιβάλλοντα αξιολόγησης και κοινά διεθνή πρότυπα ασφαλείας.
Σύνοψη Η δεύτερη σεζόν του Dexter: Resurrection κάνει επίσημη πρεμιέρα στις 30 Οκτωβρίου 2026 μέσα…
Σύνοψη Η νέα τηλεοπτική σειρά της Marvel Studios με τίτλο VisionQuest κάνει πρεμιέρα στις 14…
Σύνοψη Πλήρης σχεδιαστική ανανέωση: Ολόκληρη η σειρά Kindle αποκτά τεχνολογία reverse stack display για edge-to-edge…
Σύνοψη Ο ομοσπονδιακός δικαστής Amit Mehta απέρριψε τις αντιμονοπωλιακές αγωγές που είχαν καταθέσει οι Chegg…
Σύνοψη Η Sony ανακοίνωσε αιφνιδιαστικά την έλευση της τεχνολογίας Quick Spectral Super Resolution (QSSR), φέρνοντας…
Σύνοψη Τέσσερα νέα μοντέλα: Η σειρά αποτελείται από τα Huawei Mate 90, Mate 90 Pro,…
Αυτό το site χρησιμοποιεί cookies, για την παροχή των υπηρεσιών της, να προσαρμόσετε τις διαφημίσεις και να αναλύσει την επισκεψιμότητα. Με τη χρήση αυτής της ιστοσελίδας, συμφωνείτε με τη πολιτική χρήση των cookies.
Leave a Comment