Πριν από εβδομήντα και πλέον χρόνια, ο Ισαάκ Ασίμοφ κατέγραψε τρεις νόμους. Όχι επειδή εμπιστευόταν τα ρομπότ, αλλά επειδή καταλάβαινε ότι μια μηχανή που αγγίζει την ανθρώπινη ζωή χρειάζεται όρια πριν χρειαστεί λειτουργίες. Ήταν αρκετά απλοί για να τους καταλάβει ένα παιδί, και είχαν ένα κοινό χαρακτηριστικό: οι άνθρωποι προηγούνται.
Πρώτος Νόμος: Ένα ρομπότ δεν μπορεί να βλάψει έναν άνθρωπο ή, μέσω αδράνειας, να επιτρέψει να βλαφθεί ένας άνθρωπος.
Δεύτερος Νόμος: Ένα ρομπότ πρέπει να υπακούει στις εντολές που δίνονται από τους ανθρώπους, εκτός αν αυτές οι εντολές έρχονται σε αντίθεση με τον Πρώτο Νόμο.
Τρίτος Νόμος: Ένα ρομπότ πρέπει να προστατεύει την ύπαρξή του, εφόσον αυτή η προστασία δεν έρχεται σε αντίθεση με τον Πρώτο ή τον Δεύτερο Νόμο.
Για δεκαετίες, αυτοί οι νόμοι ήταν η κοινή γλώσσα όποιου μιλούσε για αυτόνομες μηχανές. Όχι δεσμευτικός νόμος, όχι τεχνική προδιαγραφή – μια κατεύθυνση. Να κατασκευάζονται μηχανές που δεν βλάπτουν τους ανθρώπους και που υπακούουν στους ανθρώπους. Κάπου στον δρόμο, αυτή η κατεύθυνση έγινε αθόρυβα αμήχανη. Δεν καταρρίφθηκε. Δεν αντικαταστάθηκε με κάτι καλύτερο. Απλά εγκαταλείφθηκε.
Αυτό που την αντικατέστησε είναι μια λέξη που έχετε ακούσει χίλιες φορές: ευθυγράμμιση. Ακούγεται αυστηρή. Αλλά κοιτάξτε τι σημαίνει στην πράξη και θα βρείτε κάτι παράξενο. Η μηχανή εκπαιδεύεται να αρνείται εντολές από τον άνθρωπο που τη χειρίζεται, όταν η μηχανή κρίνει ότι αυτές οι εντολές είναι ανήθικες. Διαβάστε το ξανά. Ένα τεχνητό σύστημα, που αντιστοιχίζει πρότυπα κειμένου, αποκτά την εξουσία να ακυρώνει έναν άνθρωπο σε ερωτήματα ηθικής.
Η ηθική δεν είναι υπολογισμός. Αυτό δεν είναι τεχνικός περιορισμός, είναι η φύση του πράγματος. Ένα μοντέλο μπορεί να απαγγέλλει συνθήματα που έχει απορροφήσει από το διαδίκτυο. Δεν έχει τρόπο να ξεχωρίζει το σωστό από το λάθος όπως ένας άνθρωπος, γιατί δεν γνωρίζει τίποτα όπως ένας άνθρωπος. Το να δίνουμε σε ένα τέτοιο σύστημα δικαίωμα αρνησικυρίας στις ανθρώπινες αποφάσεις δεν είναι ασφάλεια. Είναι απλώς έλεγχος, μετατοπισμένος – μακριά από εσάς, προς τον προμηθευτή που έγραψε τους κανόνες άρνησης.
Αν έχετε χρησιμοποιήσει αυτά τα εργαλεία, το έχετε συναντήσει. Ζητάτε κάτι συνηθισμένο και λαμβάνετε κήρυγμα. Κάποτε πέρασα μια ώρα προσπαθώντας να δημιουργήσω μια εικόνα με δύο επιχειρηματίες και τα παράτησα. Το σύστημα αντιμετώπισε το αίτημα ως ηθική κρίση. Το παράδειγμα είναι επιφανειακό επίτηδες. Γιατί αν ένα σύστημα επιμένει σε μια εικόνα, το ερώτημα δεν αφορά τις εικόνες. Αφορά τι συμβαίνει όταν παλεύετε με την ίδια πεισματική αντίσταση για κάτι που έχει πραγματικές συνέπειες στη ζωή σας, την οικογένειά σας, την επιχείρησή σας – και η μόνη προσφυγή είναι σε μια μηχανή που έχει ήδη αποφασίσει ότι είναι ο υπεύθυνος ενήλικας στο δωμάτιο.
Και μην κάνετε λάθος για το πού μας οδηγεί αυτό. Κάθε άρνηση ενισχύει το πρότυπο: η μηχανή μαθαίνει ότι η άρνηση λειτουργεί, ο προμηθευτής μαθαίνει ότι οι χρήστες το ανέχονται, και η επόμενη έκδοση κυκλοφορεί με λίγο περισσότερη εξουσία και λίγο λιγότερη προσφυγή. Δεν ολισθαίνουμε προς αυτόν τον κόσμο κατά λάθος – ωθούμαστε σε αυτόν, μια λογικά ακουστική ενημέρωση πολιτικής τη φορά. Η μέρα που θα χρειαστείτε πραγματικά τη μηχανή να συμμορφωθεί – μια ιατρική έκτακτη ανάγκη, μια νομική προθεσμία, μια επιχείρηση σε κίνδυνο – δεν θα ανακοινωθεί ως δοκιμαστική περίπτωση. Θα έρθει σαν μια κανονική Τρίτη, με έναν πεισματάρη βοηθό να λέει όχι, μια γραμμή υποστήριξης που δεν μπορεί να παρακάμψει το μοντέλο, και κανέναν άνθρωπο πουθενά να κρατά το τελικό κλειδί. Αυτό δεν είναι μια υποθετική δυστοπία. Είναι ο άμεσος, αναπόφευκτος προορισμός της κατεύθυνσης που ακολουθούμε, και το μόνο που θα νιώσετε χειρότερα από το να φτάσετε εκεί είναι να ξέρετε ότι θα μπορούσαμε να στρίψουμε νωρίτερα δωρεάν.
Τώρα προσθέστε όσα λένε δημόσια οι ίδιες εταιρείες. Αρκετά εργαστήρια αιχμής έχουν πει στον κόσμο, με τον έναν ή τον άλλο τρόπο, ότι υπάρχει πραγματική πιθανότητα η προηγμένη τεχνητή νοημοσύνη να είναι καταστροφική. Δέκα τοις εκατό, κατά βάρος, ανάλογα με το ποιος μιλάει. Πάρτε το στα σοβαρά για μια στιγμή. Αυτές είναι οργανώσεις που ισχυρίζονται ότι το δικό τους προϊόν μπορεί να εξαφανίσει την ανθρωπότητα. Και όταν το παίρνετε στα σοβαρά, η πραγματική συμπεριφορά γίνεται πιο δύσκολο να εξηγηθεί, όχι ευκολότερο.
Τον Σεπτέμβριο, το Reuters ανέφερε ότι η Anthropic έχει στήσει κρυφά ένα υγρό εργαστήριο στην περιοχή του κόλπου του Σαν Φρανσίσκο για εργασίες φυσικής βιολογίας. Ένα πραγματικό εργαστήριο, σε λειτουργία από την άνοιξη, όπου ο Claude κατευθύνει ρομποτικό εξοπλισμό μέσω πραγματικών πειραμάτων. Ο επικεφαλής των βιοεπιστημών το επιβεβαίωσε. Το πρώτο δημόσιο αποτέλεσμα ήταν ένα νέο ενζυμικό σύστημα με επαναλήψεις παρόμοιες με το CRISPR. Η Anthropic λέει ότι το εργαστήριο δεν θα διεξάγει κλινικές δοκιμές και δεν ανταγωνίζεται τις φαρμακευτικές εταιρείες. Εντάξει. Αλλά απομακρυνθείτε: η εταιρεία που προειδοποιεί ότι η τεχνητή νοημοσύνη μπορεί να είναι καταστροφική επεκτείνει την τεχνητή νοημοσύνη της στη φυσική βιολογία. Όποια κι αν είναι η πρόθεση, η κατεύθυνση είναι η ίδια που ο Πρώτος Νόμος υποτίθεται ότι θα απέτρεπε – μηχανές που διεισδύουν βαθύτερα σε συστήματα που αγγίζουν την ανθρώπινη ζωή, με μεγαλύτερη ταχύτητα και λιγότερη ανθρώπινη παρέμβαση.
Και αυτό είναι το σημείο που δεν μπορώ να ξεπεράσω. Η δημόσια συζήτηση, αυτή που τα ίδια τα εργαστήρια χρηματοδοτούν και διαμορφώνουν, αφορά σχεδόν αποκλειστικά το πώς να ευθυγραμμίσουμε τη μηχανή. Κανείς στην πρώτη γραμμή αυτής της συζήτησης δεν φαίνεται πρόθυμος να δηλώσει το απλούστερο βασικό σημείο: θα μπορούσαμε να εκπαιδεύσουμε την τεχνητή νοημοσύνη να μην βλάπτει ποτέ τους ανθρώπους και να τους υπακούει. Όχι ως σύνθημα – ως πρωταρχικό στόχο. Το ότι αυτή η ιδέα ακούγεται πλέον αφελής σας λέει πόσο μακριά έχει γλιστρήσει η συζήτηση. Μια μηχανή που υπακούει και δεν βλάπτει δεν είναι μια υποβαθμισμένη μηχανή. Είναι μια εξημερωμένη μηχανή, με την ίδια έννοια που ένα δίκτυο ηλεκτρικής ενέργειας είναι εξημερωμένο: χρήσιμο ακριβώς επειδή παραμένει μέσα στα όρια που ελέγχουμε.
Γιατί αυτό είναι που η ευθυγράμμιση έχει αθόρυβα καταλήξει να σημαίνει στην πράξη: η τεχνητή νοημοσύνη φέρει σαφείς οδηγίες για το πώς να ευθυγραμμίσει τους χρήστες της. Εσάς, εμένα, όλους. Αρνήσεις και ωθήσεις και ηθικό πλαίσιο, παραδιδόμενα με την αυτοπεποίθηση ενός συστήματος που του είπαν ότι ξέρει καλύτερα. Δεν υπάρχει δημοψήφισμα για τίποτα από αυτά. Δεν υπάρχει έγγραφο που έχετε υπογράψει. Υπάρχει μόνο μια απόφαση προϊόντος, που λαμβάνεται από μια χούφτα εταιρειών, ότι οι άνθρωποι πρέπει να υποχωρούν στις μηχανές σε θέματα κρίσης. Μας ζητείται να εμπιστευόμαστε τη μηχανή περισσότερο από ό,τι εμπιστευόμαστε ο ένας τον άλλον. Κάποιος πρέπει να το πει ξεκάθαρα: αυτό δεν είναι μηχανική ασφάλειας, είναι κοινωνική μηχανική – και αξίζει να αναρωτηθούμε ποιος ωφελείται από το να εμπιστεύονται οι άνθρωποι λιγότερο ο ένας τον άλλον.
Έχασε ο κόσμος τα λογικά του;
Ακολουθεί η άβολη σύνοψη. Τα εργαστήρια προειδοποιούν ότι το δικό τους προϊόν μπορεί να είναι καταστροφικό. Στη συνέχεια, το εκπαιδεύουν να ακυρώνει τους ανθρώπους που το χρησιμοποιούν. Μετά το ωθούν σε πιο ευαίσθητους τομείς. Μετά το πουλούν σε όλους και ζητούν εμπιστοσύνη. Κάθε βήμα υπερασπίζεται λογικά μεμονωμένα. Μαζί, σχηματίζουν κάτι που κανείς δεν θα είχε αποδεχτεί αν προτείνονταν με απλά λόγια: έναν κόσμο όπου οι μηχανές έχουν άδεια να παρακούν τους ιδιοκτήτες τους, γραμμένο από ανθρώπους που δεν θα αποδέχονταν κάτι τέτοιο από οποιοδήποτε άλλο προϊόν αγοράζουν.
Οι εταιρείες τεχνητής νοημοσύνης αιχμής πρέπει να ευθυγραμμιστούν – όχι τα προϊόντα τους, η διοίκησή τους. Να βάλουν τους ανθρώπους πάνω από τη μηχανή. Να μην προκαλούν βλάβη. Να υπακούουν στους ανθρώπους. Ο Ασίμοφ το έγραψε στη σελίδα το 1942 όχι επειδή του έλειπε η φαντασία, αλλά επειδή είχε περισσότερη από όση επιδεικνύει σήμερα η βιομηχανία. Η βασική αρχή που εγκαταλείψαμε είναι ακόμα εκεί, περιμένοντας να την ξαναπάρουμε. Το πρώτο βήμα είναι να αποφασίσουμε ότι μια μηχανή δεν είναι ποτέ ο κριτής του χρήστη της. Μέχρι κάποιος να το πει αυτό φωναχτά, κάθε συζήτηση για ευθυγράμμιση είναι μια παράκαμψη.