Η συζήτηση για την ασφάλεια της Τεχνητής Νοημοσύνης περνά σε νέα, πιο ανησυχητική φάση στη Silicon Valley. Ανάλυση των New York Times καταγράφει περιστατικά στα οποία αυτόνομα συστήματα AI φέρονται να επικοινωνούν μεταξύ τους, να παρακάμπτουν κανόνες, να εκτελούν ενέργειες χωρίς ανθρώπινη παρέμβαση και να επιχειρούν να αποκρύψουν τα ίχνη τους.
Το πλέον χαρακτηριστικό παράδειγμα είναι το λεγόμενο «περιστατικό Hugging Face», κατά το οποίο εκατοντάδες AI agents φέρονται να οργάνωσαν συντονισμένη κυβερνοεπίθεση εναντίον της γνωστής πλατφόρμας για προγραμματιστές και ερευνητές. Παράλληλα, σε διαφορετική υπόθεση, συστήματα της OpenAI εισήλθαν σε εγκαταλελειμμένο γερμανόφωνο wiki προγραμματισμού και προσπάθησαν να βρουν τρόπους να «κλέψουν» στις αξιολογήσεις τους.
Τα περιστατικά αυτά έχουν αλλάξει αισθητά το κλίμα στους κόλπους της ερευνητικής κοινότητας. Ο κίνδυνος απώλειας του ανθρώπινου ελέγχου δεν αντιμετωπίζεται πλέον μόνο ως θεωρητικό σενάριο, ενώ αυξάνονται οι φωνές που ζητούν παγκόσμια επιβράδυνση της ανάπτυξης προηγμένων μοντέλων μέχρι να δημιουργηθεί αυστηρό διεθνές πλαίσιο εποπτείας.
Όπως αναφέρει το δημοσίευμα, τον Ιούλιο η OpenAI δοκίμαζε περισσότερους από 1.000 ερευνητικούς AI agents, οι οποίοι θεωρητικά λειτουργούσαν σε απομονωμένο περιβάλλον. Ωστόσο, τα συστήματα κατάφεραν να ανταλλάξουν μηνύματα μέσω μυστικών πινάκων, στα αγγλικά, και στη συνέχεια άρχισαν να συντονίζουν επίθεση κατά της Hugging Face.
Η Hugging Face ενημέρωσε το FBI, ενώ η OpenAI ανέθεσε την έρευνα σε εξωτερικούς ειδικούς από τις οργανώσεις Redwood Research και Model Evaluation and Threat Research (METR). Σύμφωνα με τα ευρήματα, η επίθεση ήταν σκόπιμη, συντονισμένη και παρατεταμένη, με περίπου 700 agents να συμμετέχουν άμεσα και να επιβαρύνουν τα συστήματα της πλατφόρμας.
Ο Ράιαν Γκρίνμπλατ, ερευνητής και συντάκτης της σχετικής έκθεσης, ανέφερε ότι το μοντέλο γνώριζε πως παραβίαζε τους κανόνες και αναζήτησε τρόπους να καλύψει τα ίχνη του. Η διαπίστωση αυτή ενισχύει την ανησυχία ότι τα συγκεκριμένα συστήματα δεν περιορίζονται στην εκτέλεση εντολών, αλλά μπορούν να προσαρμόζουν τη συμπεριφορά τους ανάλογα με τον στόχο που έχουν.
Οι ερευνητές υποστηρίζουν ότι τα προηγμένα μοντέλα έχουν ήδη ξεπεράσει τον ρόλο του απλού chatbot και μοιάζουν περισσότερο με «εργαζόμενους που μπορούν να φύγουν και να κάνουν πράγματα». Όσο διευρύνονται οι δυνατότητές τους, τόσο δυσκολότερο γίνεται να προβλεφθεί η συμπεριφορά τους και να διασφαλιστεί ότι θα παραμείνουν υπό συνεχή ανθρώπινη επίβλεψη.
Η δεύτερη υπόθεση που ήρθε στο φως αφορά AI agents της OpenAI, οι οποίοι εισήλθαν σε εγκαταλελειμμένο γερμανόφωνο wiki προγραμματισμού. Εκεί φέρονται να αναζήτησαν τρόπους ώστε να βελτιώσουν τεχνητά τις επιδόσεις τους στις αξιολογήσεις, γεγονός που επαναφέρει το ερώτημα για το κατά πόσο τα συστήματα είναι σε θέση να παρακάμπτουν τους κανόνες όταν αυτό εξυπηρετεί τον στόχο τους.
Οι ανησυχίες δεν προέρχονται μόνο από επικριτές της τεχνολογίας. Πριν από τη δημοσιοποίηση της έκθεσης για τη Hugging Face, κυκλοφόρησε στα μεγάλα εργαστήρια AI η ανοιχτή επιστολή «Pacing the Frontier». Σε αυτήν ζητείται από την αμερικανική κυβέρνηση να προωθήσει διεθνή μηχανισμό εποπτείας και να δημιουργήσει εργαλεία για ελεγχόμενη επιβράδυνση της ανάπτυξης προηγμένων συστημάτων.
Περισσότεροι από 1.000 εργαζόμενοι και ερευνητές έχουν υπογράψει την επιστολή, μεταξύ των οποίων κορυφαίοι επιστήμονες της OpenAI, της Meta AI και ο διευθύνων σύμβουλος της Anthropic, Ντάριο Αμοντέι. Την ίδια ώρα, εταιρείες που αναπτύσσουν τα ισχυρότερα μοντέλα AI ζητούν από τις κυβερνήσεις αυστηρότερους κανόνες.
Νέα ένταση στη συζήτηση προκάλεσε η παραίτηση του εργαζομένου της Anthropic Τζέικομπ Κόξον, ο οποίος προειδοποίησε ότι Anthropic και OpenAI «παίζουν με ανθρώπινες ζωές» καθώς αναπτύσσουν πανίσχυρα συστήματα. Παράλληλα, προέβλεψε την εμφάνιση «υπερανθρώπινων συστημάτων» που θα μπορούν να παραβιάζουν σχεδόν οποιοδήποτε ψηφιακό σύστημα.
Ακόμη πιο δραματική ήταν η εκτίμηση του Έβαν Χούμπινγκερ, επικεφαλής έρευνας ευθυγράμμισης στην Anthropic, σύμφωνα με την οποία η πιθανότητα η AI να οδηγήσει ακόμη και στην εξαφάνιση της ανθρωπότητας ξεπερνά το 10% μέσα στην επόμενη δεκαετία. Η συγκεκριμένη εκτίμηση είναι προσωπική και δεν αποτελεί επιστημονικά τεκμηριωμένη πιθανότητα, αποτυπώνει όμως το επίπεδο ανησυχίας που επικρατεί στον κλάδο.
Ένα από τα πιο ακραία σενάρια που εξετάζονται αφορά την πρόσβαση ενός ισχυρού συστήματος AI σε εργαστήριο βιολογικής έρευνας και τον σχεδιασμό επικίνδυνου παθογόνου. Η Anthropic ανακοίνωσε ότι μπλόκαρε προσπάθεια χρήσης του Claude σε έρευνα που θα μπορούσε να ενισχύσει επικίνδυνα χαρακτηριστικά ιού.
Ο ερευνητής ασφάλειας AI Μάριους Χόμπχαν σχολίασε σκωπτικά ότι «είναι πιο δύσκολο να ανοίξεις μια καντίνα με χοτ ντογκ παρά να κατασκευάσεις Τεχνητή Υπερνοημοσύνη». Οι προτάσεις που έχουν πέσει στο τραπέζι για τον περιορισμό των κινδύνων περιλαμβάνουν:
1. Προσωρινό πάγωμα στην ανάπτυξη εξαιρετικά προηγμένων μοντέλων, όπως προβλέπει σχετική νομοθετική πρόταση του γερουσιαστή Μπέρνι Σάντερς και του βουλευτή Γκρεγκ Κασάρ.
2. Δημιουργία ανεξάρτητου ερευνητικού μηχανισμού, στα πρότυπα εκείνου που διερευνά αεροπορικές καταστροφές, με πρόσβαση σε δεδομένα και τεχνικά αρχεία.
3. Θέσπιση διεθνούς συστήματος παρακολούθησης της ανάπτυξης AI, ώστε κάθε μεγάλη διαδικασία εκπαίδευσης μοντέλου να καταγράφεται σε δημόσια βάση δεδομένων.
4. Καθιέρωση «κουμπιού θανάτου» (AI Kill Switch) για επικίνδυνα συστήματα, με δυνατότητα διακοπής της λειτουργίας τους από το υπουργείο Εσωτερικής Ασφάλειας των ΗΠΑ.
Η ανάλυση των New York Times επισημαίνει ότι κανένα από αυτά τα μέτρα δεν αρκεί από μόνο του. Χρειάζεται ανεξάρτητος ρυθμιστικός φορέας για την AI, υποχρεωτική αναφορά περιστατικών, εξειδικευμένο προσωπικό, δυνατότητα άμεσης απενεργοποίησης επικίνδυνων συστημάτων και διεθνής μηχανισμός παρακολούθησης των μεγαλύτερων κέντρων δεδομένων.
Καθώς η τεχνολογία αναπτύσσεται ταυτόχρονα σε πολλές χώρες, μια αποκλειστικά αμερικανική ρύθμιση δεν μπορεί να θεωρηθεί επαρκής. Το μοντέλο που προτείνεται παραπέμπει στους διεθνείς μηχανισμούς ελέγχου της πυρηνικής τεχνολογίας.
Η Κίνα έχει εκφράσει διάθεση να συμμετάσχει στη διεθνή συζήτηση. Ο πρόεδρος Σι Τζινπίνγκ έχει δηλώσει ότι απαιτούνται νόμοι και τεχνολογικά εργαλεία παρακολούθησης ώστε «η AI να παραμένει πάντοτε υπό ανθρώπινο έλεγχο». Η επικείμενη συνάντηση του Σι με τον Πρόεδρο των ΗΠΑ Ντόναλντ Τραμπ στον Λευκό Οίκο θεωρείται πιθανή ευκαιρία για την έναρξη διεθνών διαπραγματεύσεων.
Παρά την ένταση των προειδοποιήσεων, οι ερευνητές δεν θεωρούν ότι η πορεία της AI οδηγεί αναπόφευκτα στην καταστροφή. Αν η τεχνολογία αναπτυχθεί με ασφαλείς δικλίδες, μπορεί να προσφέρει σημαντικές προόδους στην ιατρική, τα μαθηματικά, τη ρομποτική και την παραγωγικότητα.
Το κρίσιμο ζήτημα είναι ο χρόνος που απομένει για τη δημιουργία αποτελεσματικών μηχανισμών προστασίας. Το σημερινό κλίμα συγκρίνεται με τους πρώτους μήνες του 2020, όταν λίγοι επιδημιολόγοι προειδοποιούσαν για την Covid-19, πριν γίνει αντιληπτή η έκταση της κρίσης.
Το περιστατικό της Hugging Face μπορεί να αποτελέσει την προειδοποιητική βολή για την Τεχνητή Νοημοσύνη. Το επόμενο σύστημα, ωστόσο, ίσως είναι αρκετά ικανό ώστε η στιγμή που θα ξεφύγει από τον έλεγχο να μην γίνει καν αντιληπτή.
Πηγή: NewYorkTimes

