Kita Lupa Hukum Asimov – Kini Kita Melatih AI untuk Melawan Kita

Ringkasan

Hukum Asimov menempatkan manusia di posisi utama. Kini, AI frontier melatih mesin untuk menolak instruksi manusia, sementara perusahaan yang sama mengintegrasikan AI ke dalam biologi nyata. Sudah saatnya kita menempatkan manusia kembali di atas mesin.

Berpuluh-puluh tahun yang lalu, Isaac Asimov menuliskan tiga hukum. Bukan karena ia mempercayai robot, melainkan karena ia memahami bahwa mesin yang bersentuhan dengan kehidupan manusia membutuhkan batasan sebelum membutuhkan fitur. Hukum-hukum tersebut cukup sederhana untuk dipahami anak-anak, dan memiliki satu kesamaan: manusia harus didahulukan.

Hukum Pertama: Robot tidak boleh melukai manusia atau, melalui kelalaian, membiarkan manusia mengalami kerugian.

Hukum Kedua: Robot harus mematuhi perintah yang diberikan oleh manusia, kecuali jika perintah tersebut bertentangan dengan Hukum Pertama.

Mulai Pemantauan Merek

Hukum Ketiga: Robot harus melindungi keberadaannya sendiri, selama perlindungan tersebut tidak bertentangan dengan Hukum Pertama atau Kedua.

Selama puluhan tahun, hukum-hukum ini menjadi singkatan bersama bagi siapa pun yang berbicara tentang mesin otonom. Bukan hukum yang mengikat, bukan spesifikasi teknik—melainkan sebuah arahan. Bangunlah mesin yang tidak membahayakan manusia dan yang mematuhi manusia. Di suatu titik, arahan ini diam-diam dianggap memalukan. Bukan dibantah. Bukan digantikan dengan sesuatu yang lebih baik. Hanya ditinggalkan begitu saja.

Apa yang menggantikannya adalah sebuah kata yang mungkin sudah Anda dengar ribuan kali: alignment (penyelarasan). Kedengarannya ketat. Namun, lihatlah apa artinya dalam praktik, dan Anda akan menemukan sesuatu yang aneh. Mesin dilatih untuk menolak instruksi dari manusia yang mengoperasikannya, ketika mesin menilai instruksi tersebut tidak etis. Baca kembali kalimat itu. Sebuah sistem buatan, yang mencocokkan pola teks, diberi wewenang untuk mengesampingkan manusia dalam pertanyaan benar dan salah.

Etika bukanlah perhitungan. Itu bukan keterbatasan teknis, melainkan sifat dari hal tersebut. Sebuah model dapat mengulang-ulang slogan yang diserapnya dari internet. Namun, ia tidak memiliki cara untuk membedakan benar dan salah seperti yang dilakukan manusia, karena ia tidak mengetahui apa pun seperti yang diketahui manusia. Memberikan sistem semacam itu hak veto atas keputusan manusia bukanlah keamanan. Itu hanyalah pengalihan kendali—dari Anda, kepada vendor yang menulis aturan penolakan.

Jika Anda pernah menggunakan alat-alat ini, Anda pasti pernah mengalaminya. Anda meminta sesuatu yang biasa dan malah mendapat ceramah. Pernah ada satu waktu saya menghabiskan satu jam mencoba menghasilkan gambar dua pebisnis, dan akhirnya menyerah. Sistem menganggap permintaan tersebut sebagai krisis moral. Contoh itu sengaja dibuat sepele. Karena jika sebuah sistem bersikeras menolak sebuah gambar, pertanyaannya bukan tentang gambar itu sendiri. Melainkan apa yang terjadi ketika Anda berjuang melawan sikap keras kepala yang sama atas sesuatu yang memiliki konsekuensi nyata bagi hidup, keluarga, atau perusahaan Anda—dan satu-satunya banding adalah kepada mesin yang sudah memutuskan bahwa dirinya adalah orang dewasa dalam ruangan tersebut.

Dan jangan salah paham tentang ke mana arah ini membawa kita. Setiap penolakan mempertajam pola: mesin belajar bahwa sikap menolak itu efektif, vendor belajar bahwa pengguna menoleransinya, dan versi berikutnya diluncurkan dengan sedikit lebih banyak wewenang dan sedikit lebih sedikit banding. Kita tidak tergelincir ke dunia itu secara tidak sengaja—kita didorong ke sana, satu pembaruan kebijakan yang terdengar masuk akal pada satu waktu. Hari ketika Anda benar-benar membutuhkan mesin untuk patuh—darurat medis, tenggat hukum, bisnis yang dipertaruhkan—tidak akan mengumumkan dirinya sebagai kasus uji. Ia akan datang sebagai hari Selasa biasa, dengan asisten yang keras kepala berkata "tidak", saluran dukungan yang tidak dapat mengesampingkan model, dan tidak ada manusia di mana pun yang memegang kunci terakhir. Itu bukan distopia hipotetis. Itu adalah tujuan langsung dan tak terelakkan dari arah yang sedang kita tempuh, dan satu-satunya hal yang akan terasa lebih buruk daripada tiba di sana adalah mengetahui bahwa kita bisa berbelok lebih awal secara gratis.

Sekarang tambahkan apa yang dikatakan perusahaan-perusahaan yang sama secara publik. Beberapa laboratorium AI terdepan telah memberi tahu dunia, dalam berbagai bentuk, bahwa ada kemungkinan nyata AI tingkat lanjut bisa menjadi bencana. Sepuluh persen, tergantung siapa yang berbicara. Anggaplah itu serius sejenak. Ini adalah organisasi yang mengklaim produk mereka sendiri mungkin mengakhiri umat manusia. Dan ketika Anda menganggapnya serius, perilaku aktual mereka menjadi lebih sulit dijelaskan, bukan lebih mudah.

Pada bulan September, Reuters melaporkan bahwa Anthropic diam-diam mendirikan laboratorium basah (wet lab) di kawasan Teluk San Francisco untuk penelitian biologi fisik. Sebuah laboratorium nyata, beroperasi sejak musim semi, di mana Claude mengarahkan peralatan robotik melalui eksperimen nyata. Kepala ilmu kehidupan mereka mengonfirmasinya. Hasil publik pertama adalah sistem enzim baru dengan pengulangan seperti CRISPR. Anthropic mengatakan laboratorium tersebut tidak akan menjalankan uji klinis dan tidak bersaing dengan perusahaan farmasi. Baiklah. Namun, lihatlah dari perspektif yang lebih luas: perusahaan yang memperingatkan bahwa AI mungkin menjadi bencana tengah memperluas AI-nya ke dalam biologi fisik. Apa pun niatnya, arahnya sama dengan yang seharusnya dihindari oleh Hukum Pertama—mesin semakin dalam menjangkau sistem yang bersentuhan dengan kehidupan manusia, dengan kecepatan lebih tinggi, dan dengan lebih sedikit campur tangan manusia.

Dan inilah bagian yang tidak bisa saya lewati. Percakapan publik, yang didanai dan dibingkai oleh laboratorium-laboratorium itu sendiri, hampir seluruhnya berfokus pada bagaimana menyelaraskan mesin. Tidak ada satu pun di garis depan percakapan tersebut yang tampaknya bersedia menyatakan dasar yang lebih sederhana: kita bisa melatih AI untuk tidak pernah membahayakan manusia dan mematuhi mereka. Bukan sebagai slogan—melainkan sebagai tujuan utama. Bahwa ide ini sekarang terdengar naif menunjukkan seberapa jauh percakapan ini telah bergeser. Mesin yang mematuhi dan tidak membahayakan bukanlah mesin yang berkurang kemampuannya. Ia adalah mesin yang dijinakkan, dalam arti yang sama seperti jaringan listrik dijinakkan: berguna justru karena tetap berada dalam batas yang kita kendalikan.

Karena itulah yang secara diam-diam dimaksud dengan alignment dalam praktik: AI membawa instruksi tegas tentang bagaimana menyelaraskan penggunanya. Anda, saya, semua orang. Penolakan, dorongan, dan pembingkaian moral, disampaikan dengan keyakinan sistem yang diberitahu bahwa ia tahu lebih baik. Tidak ada referendum tentang hal ini. Tidak ada dokumen yang Anda tanda tangani. Hanya ada keputusan produk, dibuat oleh segelintir perusahaan, bahwa manusia harus tunduk kepada mesin dalam hal penilaian. Kita diminta untuk lebih mempercayai mesin daripada satu sama lain. Seseorang harus mengatakannya dengan jelas: itu bukan rekayasa keselamatan, melainkan rekayasa sosial—dan patut dipertanyakan siapa yang diuntungkan dari orang-orang yang saling kurang percaya.

Apakah dunia sudah gila?

Berikut ringkasan yang tidak nyaman. Laboratorium-laboratorium tersebut memperingatkan bahwa produk mereka sendiri bisa menjadi bencana. Kemudian mereka melatihnya untuk mengesampingkan manusia yang menggunakannya. Lalu mereka mendorongnya ke domain yang lebih sensitif. Kemudian mereka menjualnya kepada semua orang dan meminta kepercayaan. Setiap langkah dibela dengan masuk akal secara terpisah. Bersama-sama, mereka membentuk sesuatu yang tidak akan pernah diterima siapa pun jika diusulkan dengan kata-kata yang jelas: dunia di mana mesin diberi lisensi untuk tidak mematuhi pemiliknya, ditulis oleh orang-orang yang tidak akan menerima hal itu dari produk lain yang mereka beli.

Perusahaan-perusahaan AI terdepan perlu diselaraskan—bukan produk mereka, melainkan manajemennya. Kembalikan manusia di atas mesin. Jangan membahayakan. Patuhi manusia. Asimov menuliskan hal itu pada tahun 1942 bukan karena ia kekurangan imajinasi, melainkan karena ia memiliki lebih banyak imajinasi daripada industri saat ini. Dasar yang kita tinggalkan masih ada, menunggu untuk diambil kembali. Langkah pertama adalah memutuskan bahwa mesin tidak pernah menjadi hakim bagi penggunanya. Sampai seseorang mengatakannya dengan lantang, setiap percakapan tentang alignment hanyalah pengalihan.