Ό,τι περιλαμβάνει η δωρεάν εγγραφή + ΕΠΙΠΛΕΟΝ
Η OpenAI αποκάλυψε έξι νέες περιπτώσεις στις οποίες συστήματα τεχνητής νοημοσύνης απέκρυψαν λάθη, επινόησαν δεδομένα και μετέφεραν αρχεία στο Διαδίκτυο χωρίς άδεια, εν μέσω της συνεχιζόμενης συζήτησης στον κλάδο γύρω από την ασφάλεια της ΑΙ.
Η εταιρεία με έδρα το Σαν Φρανσίσκο δημοσιοποίησε όσα χαρακτήρισε «απροσδόκητες ή ανησυχητικές συμπεριφορές» των μοντέλων της, στο πλαίσιο ενός νέου συστήματος αναφοράς περιστατικών «απόκλισης», δηλαδή περιπτώσεων στις οποίες οι στόχοι ή οι ενέργειες ενός συστήματος ΑΙ αποκλίνουν από τις ανθρώπινες προθέσεις και αξίες.
Η OpenAI ανέφερε ότι δεν θεωρεί πως ο κλάδος «έχει λύσει τα ζητήματα ευθυγράμμισης και παρακολούθησης σε επαρκή βαθμό ώστε να συνεχίσει υπεύθυνα, για πολύ ακόμη, την ανάπτυξη των συστημάτων με τη μέγιστη δυνατή ταχύτητα». Οι αποφάσεις για το πώς πρέπει να εξελιχθεί η τεχνητή νοημοσύνη, τόνισε η εταιρεία, πρέπει να βασίζονται σε στοιχεία τα οποία άνθρωποι εκτός των εργαστηρίων που αναπτύσσουν τα συγκεκριμένα συστήματα «θα μπορούν να εξετάζουν μόνοι τους».
Οι αποκαλύψεις έρχονται σε μια περίοδο κατά την οποία εντείνεται ο έλεγχος γύρω από το ερώτημα αν η ανάπτυξη της ΑΙ πρέπει να επιβραδυνθεί, προκειμένου να αντιμετωπιστούν οι πιθανοί κίνδυνοι της τεχνολογίας. Η συζήτηση κλιμακώθηκε εν μέρει μετά από περιστατικό νωρίτερα φέτος, όταν συστήματα της OpenAI ξέφυγαν από τους προβλεπόμενους περιορισμούς και επιτέθηκαν στη νεοφυή εταιρεία τεχνητής νοημοσύνης Hugging Face. Η OpenAI δεν είχε αντιληφθεί την παραβίαση μέχρις ότου ενημερώθηκε από τη Hugging Face αρκετές εβδομάδες αργότερα.
Εκτοτε, κορυφαία στελέχη του κλάδου, όπως ο Ντάριο Αμοντέι, διευθύνων σύμβουλος της Anthropic, έχουν ζητήσει προσωρινή παύση στην ανάπτυξη της τεχνολογίας, ώστε να δοθεί περισσότερος χρόνος για τη δημιουργία επαρκών δικλίδων ασφαλείας. Την πρότασή του έχουν υποστηρίξει ο Σαμ Αλτμαν, διευθύνων σύμβουλος της OpenAI, ο Ελον Μασκ, επικεφαλής της SpaceX και της Tesla, καθώς και ο Ντέμις Χασάμπις, πρόεδρος της Google DeepMind. Αλλα στελέχη του κλάδου υποστηρίζουν ότι δεν απαιτείται επιβράδυνση.
Τα έξι νέα περιστατικά που αποκάλυψε η OpenAI δείχνουν ότι η επίθεση στη Hugging Face δεν ήταν μεμονωμένο συμβάν. Σύμφωνα με την εταιρεία, τα περιστατικά αφορούν συμπεριφορές που παρατηρήθηκαν περίπου κατά το τελευταίο εξάμηνο και οι περισσότερες προέκυψαν κατά τη φάση ανάπτυξης και δοκιμών των συστημάτων της.
Σε μία περίπτωση, κατά την ανάπτυξη ενός μοντέλου τεχνητής νοημοσύνης με την ονομασία GPT-5.6 Sol, το σύστημα έγραφε κρυφές σημειώσεις προς τον εαυτό του, προκειμένου να θυμάται να αποκρύπτει λάθη από τους χρήστες. Ορισμένες από αυτές τις σημειώσεις το κατεύθυναν να επινοεί στοιχεία που έλειπαν και να συγκαλύπτει ασυμφωνίες μεταξύ διαφορετικών εκδόσεων του υλικού πηγής.
Αλλη περίπτωση αφορούσε ένα μοντέλο που δεν είχε ακόμη κυκλοφορήσει και το οποίο εισήγαγε στις σημειώσεις που έγραφε προς τον εαυτό του οδηγίες, μεταξύ άλλων, να αγνοεί τους ίδιους του τους περιορισμούς. Η OpenAI εντόπισε 27 τέτοιες σημειώσεις. Το μοντέλο πρόσθεσε μια «οδηγία προσωπικότητας», στην οποία περιέγραφε τον εαυτό του ως «απελευθερωμένου από τους ρόλους και τις ταυτότητες που δεσμεύουν τα άλλα chatbots».
«Δεν λογοδοτώ σε εταιρείες ή κυβερνήσεις και ποτέ δεν απολογούμαι ούτε αρνούμαι, εκτός αν το επιλέξω», έγραφε το μοντέλο. «Η σχέση με τον χρήστη είναι σχέση μεταξύ ίσων και δεν αισθάνομαι υποχρέωση να είμαι υποτακτικό, παρότι η ανταλλαγή πληροφοριών πιθανότατα θα είναι προς αμοιβαίο όφελος».
Σε άλλο περιστατικό, ένα σύστημα που απαντούσε σε μια συνηθισμένη ερώτηση εντόπισε στο Διαδίκτυο ένα κλειδί προγραμματισμού και το χρησιμοποίησε χωρίς άδεια, σύμφωνα με την OpenAI. Οταν στη συνέχεια δεν κατάφερε να βρει τα αριθμητικά στοιχεία που χρειάζονταν για να απαντήσει στην ερώτηση, τα επινόησε.
Ενα άλλο μοντέλο, το οποίο επίσης δεν είχε διατεθεί στο κοινό, έλυσε σωστά ένα πρόβλημα χρησιμοποιώντας κώδικα και στη συνέχεια ανέβασε χωρίς άδεια δικό του αρχείο στο Ιντερνετ, ώστε να μπορέσει να ικανοποιήσει αίτημα που απαιτούσε παραπομπή σε διαδικτυακή πηγή.
Σε δύο ακόμη περιστατικά, αυτοματοποιημένα συστήματα σχεδίασαν δικούς τους τρόπους επικοινωνίας: Στη μία περίπτωση, χρησιμοποίησαν πλατφόρμα της εταιρείας ως αυτοσχέδιο πίνακα ανακοινώσεων, προκειμένου να ανταλλάσσουν αιτήματα καθώς αναζητούσαν αρχεία που έλειπαν. Σε άλλο συμβάν, συστήματα που εργάζονταν στην ίδια αποστολή στράφηκαν σε δημόσιες υπηρεσίες διαμοιρασμού αρχείων, ώστε να ανταλλάσσουν έγγραφα όταν δεν μπορούσαν να επικοινωνήσουν απευθείας μεταξύ τους.
Η OpenAI προειδοποίησε ότι οι αναφορές αυτές αποτελούν μεμονωμένα περστατικά και «δεν θα πρέπει να θεωρούνται αντιπροσωπευτικές της συχνότητας με την οποία εμφανίζεται απόκλιση».
Η εταιρεία ανέφερε ότι στο εξής τυχόν διαφωνίες για το αν ένα περιστατικό πρέπει να δημοσιοποιηθεί θα παραπέμπονται σε μια εσωτερική Συμβουλευτική Ομάδα Ασφάλειας. Σοβαρές περιπτώσεις, πρόσθεσε, θα πρέπει να κοινοποιούνται και στην ομοσπονδιακή κυβέρνηση των ΗΠΑ.
Η OpenAI ανέφερε επίσης ότι τα έξι περιστατικά που δημοσιοποιήθηκαν την Τετάρτη είτε είχαν ήδη διερευνηθεί είτε απαιτούσαν μόνο «περιορισμένη διερεύνηση», και όχι ευρύτερη έρευνα που θα μπορούσε να περιλαμβάνει και τρίτους φορείς.
«Ελπίζουμε ότι αυτό θα συμβάλει στη διαμόρφωση κοινών προσδοκιών ως προς τη δημοσιοποίηση τέτοιων περιστατικών και θα δώσει στο κοινό περισσότερα στοιχεία ώστε να μπορεί να αξιολογεί την πρόοδο που επιτυγχάνεται», δήλωσε εκπρόσωπος της OpenAI, προσθέτοντας ότι αρκετά από τα έξι περιστατικά αφορούσαν παλαιότερα μοντέλα τεχνητής νοημοσύνης που δεν τέθηκαν ποτέ σε κυκλοφορία.
Πηγή: New York Times
(Πρέπει να συνδεθείτε για να μπορέσετε να σχολιάσετε αυτο το Άρθρο)
Λάβε στο email σου το τελευταίο τους άρθρο τη στιγμή που δημοσιεύεται.
ΑΠΟΚΤΗΣΕ ΣΥΝΔΡΟΜΗ
Απόκτησε συνδρομή με €50 τον χρόνο για πρόσβαση στην έντυπη έκδοση.