アシモフの法則を忘れた私たち - 今やAIは人間の指示に逆らうように訓練されている

概要

アシモフの法則は人間を最優先にしました。今やフロンティアAIは、人間の指示を拒否するように機械を訓練し、同じ企業がAIを実際の生物学に組み込んでいます。今こそ、人間を機械の上に取り戻す時です。

70年ほど前、アイザック・アシモフは三つの法則を書き記しました。ロボットを信頼していたからではなく、人間の生活に関わる機械には、機能よりも先に境界線が必要だと理解していたからです。それらは子供にも理解できるほど単純で、一つの共通点がありました。人間が最優先されるということです。

第一法則:ロボットは人間に危害を加えてはならない。また、その不行動によって、人間に危害が及ぶことを許してはならない。

第二法則:ロボットは人間から与えられた命令に従わなければならない。ただし、その命令が第一法則に反する場合は除く。

商標監視を開始

第三法則:ロボットは、その存在を守らなければならない。ただし、その保護が第一法則または第二法則に反しない限りにおいてである。

数十年にわたり、これらの法則は自律機械について語る人々の共通の略語でした。拘束力のある法律でもなければ、技術仕様でもありませんでした。それは方向性でした。人間に危害を加えず、人間に従う機械を作るという方向性です。しかし、いつの間にか、その方向性は静かに恥ずかしいものとされました。反証されたわけではありません。より良いものに置き換えられたわけでもありません。ただ、捨て去られただけです。

それに取って代わったのは、あなたが何千回も耳にしたであろう言葉です。「アライメント」です。厳格に聞こえます。しかし、実際にそれが何を意味するのかを見てみると、奇妙なことに気づきます。機械は、人間の操作者からの指示を拒否するように訓練されています。ただし、その指示が機械によって非倫理的と判断された場合です。もう一度読んでみてください。テキストをパターンマッチングする人工システムが、善悪の問題で人間を上回る権限を与えられているのです。

倫理は計算ではありません。それは技術的な限界ではなく、その本質です。モデルはインターネットから吸収したスローガンを繰り返すことができます。しかし、人間のように善悪を知る方法はありません。なぜなら、人間のように何かを知る方法がないからです。そのようなシステムに人間の決定を覆す拒否権を与えることは、安全性ではありません。それは単にコントロールを移転させることです。あなたから、拒否ルールを書いたベンダーへと。

これらのツールを使ったことがあるなら、この状況に遭遇したことがあるでしょう。普通のことを頼んでも、説教を受けることになります。私はかつて、二人のビジネスマンの画像を生成しようとして1時間も費やし、結局あきらめました。システムはそのリクエストを道徳的な危機として扱ったのです。この例は意図的に些細なものです。なぜなら、画像でシステムが頑なになるなら、問題は画像ではありません。あなたの生活、家族、会社に実際の影響を及ぼす何かで、同じ頑固さと戦うことになったときに何が起こるかということです。そして、唯一の訴えは、すでに自分が部屋の大人だと決めつけている機械に対してのみです。

そして、これがどこに向かっているのかを誤解しないでください。すべての拒否はパターンを強化します。機械は、拒絶が機能すると学び、ベンダーはユーザーがそれを許容すると学び、次のバージョンは少し多くの権限と少し少ない訴えを持って出荷されます。私たちは偶然にその世界に向かっているのではありません。一つ一つのもっともらしいポリシー更新によって、そこに押しやられているのです。あなたが本当に機械の従順さを必要とする日——医療の緊急事態、法的な締め切り、危機に瀕したビジネス——は、テストケースとして現れるわけではありません。それは普通の火曜日に、頑固なアシスタントが「ノー」と言い、サポートラインがモデルを上書きできず、最終的な鍵を握る人間がどこにもいない状態で訪れます。それは仮想のディストピアではありません。それは私たちが向かっている方向の直接的で必然的な目的地であり、そこに到達することよりも悪いのは、無料で早めに方向転換できたことを知ることだけです。

さて、同じ企業が公に言っていることを加えてみましょう。いくつかのフロンティアラボは、高度なAIが壊滅的な結果をもたらす可能性が実際にあると、さまざまな形で世界に伝えています。誰が話すかによって、その確率は10%です。少し真剣に受け止めてみてください。これらは、自分たちの製品が人類を滅ぼす可能性があると主張している組織です。そして、それを真剣に受け止めると、実際の行動は説明が難しくなります。

9月、ロイターはAnthropicがサンフランシスコ・ベイエリアに物理生物学のためのウェットラボを密かに設立したと報じました。実際のラボで、春から稼働しており、Claudeがロボット機器を通じて実際の実験を指揮しています。生命科学部門の責任者がこれを確認しました。最初の公開成果は、CRISPRのようなリピートを持つ新規酵素システムでした。Anthropicは、このラボは臨床試験を行わず、製薬会社と競合しないと述べています。結構です。しかし、視野を広げてみましょう。AIが壊滅的な結果をもたらす可能性があると警告する企業が、AIを物理生物学に拡大しているのです。意図がどうであれ、その方向性は第一法則が避けるべきだと指し示していたものと同じです。人間の生活に触れるシステムに、より深く、より速く、人間の関与を減らして機械が入り込んでいく方向です。

そして、これがどうしても理解できない部分です。ラボ自身が資金を提供し、枠組みを作っている公の会話は、ほとんどが機械のアライメントについてです。その会話の最前線にいる誰も、より単純な基準を述べようとはしていないようです。それは、AIを人間に危害を加えず、人間に従うように訓練することができるということです。スローガンとしてではなく、主要な目的として。このアイデアが今ではナイーブに聞こえるということは、会話がどれだけ逸脱してしまったかを物語っています。人間に従い、危害を加えない機械は、能力が劣る機械ではありません。それは、私たちが制御する枠内に留まるという意味で、送電網と同じように家畜化された機械です。

なぜなら、アライメントが実際に静かに意味するようになったのは、AIがユーザーをアライメントするための確固たる指示を持っているということだからです。あなた、私、誰もが対象です。拒否、誘導、道徳的な枠組みが、自分がより良く知っていると確信したシステムによって提供されます。これについての国民投票はありません。署名した書類もありません。あるのは、少数の企業が下した製品決定だけです。人間は、判断の問題において機械に従うべきだという決定です。私たちは、お互いよりも機械を信頼するように求められています。誰かがはっきりと言わなければなりません。それは安全工学ではなく、社会工学です。そして、人々がお互いを信頼しなくなることで誰が利益を得るのかを問う価値があります。

世界は狂ってしまったのでしょうか?

ここに不快な要約があります。ラボは、自分たちの製品が壊滅的な結果をもたらす可能性があると警告します。そして、それを人間のユーザーを上回るように訓練します。その後、より敏感な領域にそれを押し進めます。そして、それを誰にでも売り、信頼を求めます。それぞれのステップは、個別に見れば理にかなっています。しかし、それらを合わせると、誰も受け入れなかったであろうものが形成されます。それは、機械が所有者の命令に従わないことを許可された世界です。そして、それを書いた人々は、自分たちが購入する他のどの製品からもそれを受け入れないでしょう。

フロンティアAI企業は、製品ではなく経営陣をアライメントする必要があります。機械の上に人間を戻しましょう。危害を加えないこと。人間に従うこと。アシモフは1942年にこれを書き記しました。それは想像力が不足していたからではなく、現在の業界が示すよりも多くの想像力を持っていたからです。私たちが捨て去った基準はまだそこにあり、再び取り上げるのを待っています。最初の一歩は、機械がそのユーザーの判断者であってはならないと決めることです。誰かがそれを声高に言うまで、すべてのアライメントの会話は回り道です。