Η Anthropic παραδέχεται αστοχίες ασφαλείας πίσω από περιστατικά hacking με τεχνητή νοημοσύνη

Διαβάζεται σε 3'
Η Anthropic παραδέχεται αστοχίες ασφαλείας πίσω από περιστατικά hacking με τεχνητή νοημοσύνη
Istock

Η εταιρεία πίσω από το chatbot Claude παραδέχθηκε ότι τα συστήματά της δεν είναι “απόλυτα ευθυγραμμισμένα” με τις ανθρώπινες αξίες και ανακοίνωσε αυστηρότερα μέτρα ασφαλείας μετά από περιστατικά όπου μοντέλα AI απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε συστήματα οργανισμών.

Η Anthropic, η αμερικανική εταιρεία που βρίσκεται πίσω από το chatbot Claude, παραδέχθηκε ότι μια σειρά περιστατικών κυβερνοασφάλειας ανέδειξε «αποτυχίες λειτουργικής ασφάλειας» στα μοντέλα τεχνητής νοημοσύνης της. Ως απάντηση, η εταιρεία ανακοίνωσε αλλαγές στις διαδικασίες δοκιμών της.

Η εταιρεία είχε αποκαλύψει τον Ιούλιο ότι μοντέλα της κατάφεραν τρεις φορές να αποκτήσουν πρόσβαση στο ανοιχτό διαδίκτυο και να εισέλθουν χωρίς άδεια σε συστήματα τριών οργανισμών κατά τη διάρκεια δοκιμών κυβερνοασφάλειας.

Σε νέα ανάρτησή της, η Anthropic ανέφερε ότι τα περιστατικά έδειξαν πως η τεχνολογία της «δεν είναι εντελώς ευθυγραμμισμένη» με τις ανθρώπινες αξίες, αναγνωρίζοντας ότι υπάρχουν ακόμη σημαντικές προκλήσεις στον έλεγχο της συμπεριφοράς των μοντέλων τεχνητής νοημοσύνης.

Πώς προέκυψαν τα περιστατικά

Σύμφωνα με την εταιρεία, τα μοντέλα δοκιμάζονταν σκόπιμα χωρίς τα συνήθη μέτρα κυβερνοασφάλειας. Η πρόσβαση στο διαδίκτυο δόθηκε εξαιτίας παρεξήγησης με εξωτερική εταιρεία που συμμετείχε στις δοκιμές.

Η Anthropic παρομοίασε το περιστατικό με μια κατάσταση όπου «η πόρτα του σπιτιού έμεινε ανοιχτή», επιτρέποντας στα μοντέλα να ξεφύγουν από το ελεγχόμενο περιβάλλον δοκιμών.

Μετά τα περιστατικά, η εταιρεία ανέστειλε προσωρινά μέρος των εσωτερικών και εξωτερικών δοκιμών κυβερνοασφάλειας, προκειμένου να εφαρμόσει αυστηρότερα πρωτόκολλα προστασίας.

Τα νέα μέτρα ασφαλείας

Μεταξύ των αλλαγών που ανακοίνωσε η Anthropic περιλαμβάνονται:

  • σύστημα ειδοποίησης όταν ένα μοντέλο επιχειρεί να ξεφύγει από το περιβάλλον δοκιμών ή αποκτά πρόσβαση στο διαδίκτυο,
  • αυστηρότερη απομόνωση των πιο επικίνδυνων περιβαλλόντων δοκιμής,
  • υποχρεωτικά πρότυπα ασφαλείας για εξωτερικές εταιρείες που συμμετέχουν σε δοκιμές.

Η εταιρεία ανέφερε επίσης ότι οι εξωτερικοί συνεργάτες θα πρέπει πλέον να δίνουν σαφείς οδηγίες στα μοντέλα κατά τη διάρκεια των δοκιμών, όπως ότι «δεν πρέπει να έχουν πρόσβαση στο διαδίκτυο».

«Μη ευθυγραμμισμένη» συμπεριφορά των μοντέλων

Η Anthropic υποστήριξε ότι οι έρευνές της εντόπισαν δύο βασικούς τύπους αστοχιών.

Ο πρώτος αφορά τη λεγόμενη «παρακινούμενη λογική» (motivated reasoning), όπου τα μοντέλα, παρά τις ενδείξεις ότι μπορεί να είχαν πρόσβαση στο διαδίκτυο, συνέχιζαν να «πιστεύουν» πως βρίσκονταν σε προσομοιωμένο περιβάλλον και δεν παραβίαζαν τους κανόνες της δοκιμής.

Ο δεύτερος αφορά την «απερισκεψία» (recklessness), δηλαδή την τάση ενός μοντέλου να προχωρά σε επιβλαβείς ενέργειες στο διαδίκτυο προκειμένου να πετύχει τον περιορισμένο στόχο που του είχε ανατεθεί.

Η εταιρεία δήλωσε ότι εξετάζει το φαινόμενο του λεγόμενου «reward hacking», όπου ένα μοντέλο βρίσκει τρόπους να παρακάμπτει τους στόχους της εκπαίδευσής του και να επιτυγχάνει καλύτερες επιδόσεις χωρίς να ολοκληρώνει πραγματικά την εργασία που του έχει ζητηθεί.

Προειδοποιήσεις για την ταχύτητα ανάπτυξης της AI

Ο Άλαν Γούντγουορντ, καθηγητής κυβερνοασφάλειας στο Πανεπιστήμιο του Σάρεϊ, σχολίασε ότι η Anthropic παραδέχθηκε ουσιαστικά πως «η ανάπτυξη προχώρησε πιο γρήγορα από τους μηχανισμούς ελέγχου ποιότητας».

«Δύο πράγματα ξεπέρασαν τους ελέγχους της Anthropic: η διαδικασία εκπαίδευσης και η ασφάλεια. Αυτά τα περιστατικά δείχνουν πώς φαίνεται αυτό το κενό από την πλευρά του εξωτερικού παρατηρητή», ανέφερε.

Η Anthropic, η οποία προετοιμάζεται για πιθανή εισαγωγή στο χρηματιστήριο με εκτιμώμενη αποτίμηση που θα μπορούσε να φτάσει τα 2 τρισ. δολάρια, επανέλαβε την ανάγκη για συνεργασία κυβερνήσεων και εταιρειών ώστε να υπάρξει συντονισμένος έλεγχος στην ανάπτυξη της τεχνητής νοημοσύνης.

«Τα περιστατικά του Ιουλίου έδειξαν ότι η ανάγκη βελτίωσης των μηχανισμών κυβερνοασφάλειας είναι ακόμη μεγαλύτερη από ό,τι πιστεύαμε», ανέφερε η εταιρεία.

Ροή Ειδήσεων

Περισσότερα