Zapomněli jsme na Asimovovy zákony – a teď učíme AI, aby nám vzdorovala

Shrnutí

Zákony Isaaca Asimova stavěly člověka na první místo. Dnešní pokročilá umělá inteligence učí stroje odmítat lidské pokyny a stejné společnosti integrují AI do skutečné biologie. Je načase vrátit člověka zpět nad stroj.

Před nějakými sedmdesáti lety sepsal Isaac Asimov tři zákony. Ne proto, že by důvěřoval robotům, ale protože chápal, že stroj zasahující do lidského života potřebuje hranice dříve, než potřebuje funkce. Byly dostatečně jednoduché, aby jim porozumělo i dítě, a měly jednu společnou věc: člověk má vždy přednost.

První zákon: Robot nesmí ublížit člověku nebo svou nečinností dopustit, aby člověku bylo ublíženo.

Druhý zákon: Robot musí uposlechnout příkazů člověka, pokud tyto příkazy nejsou v rozporu s prvním zákonem.

Spustit hlídání ochranné známky

Třetí zákon: Robot musí chránit svou existenci, pokud tato ochrana není v rozporu s prvním nebo druhým zákonem.

Po celá desetiletí byly tyto zákony společnou zkratkou pro každého, kdo hovořil o autonomních strojích. Nešlo o závazný zákon ani technickou specifikaci – byla to směrnice. Vytvářet stroje, které neubližují lidem a poslouchají je. Někde cestou se z této směrnice tiše stala trapnost. Nebyla vyvrácena. Nebyla nahrazena něčím lepším. Byla prostě opuštěna.

Co ji nahradilo, je slovo, které jste slyšeli už tisíckrát: alignment (zarovnání). Zní to přísně. Ale podívejte se, co to ve skutečnosti v praxi znamená, a najdete něco zvláštního. Stroj je trénován odmítat pokyny od člověka, který s ním pracuje, pokud stroj sám posoudí, že jsou tyto pokyny neetické. Přečtěte si to znovu. Umělému systému, který pouze porovnává textové vzorce, je svěřena pravomoc přehlasovat člověka v otázkách dobra a zla.

Etika není výpočet. To není technické omezení, to je podstata věci. Model může opakovat slogany, které absorboval z internetu. Nemá však způsob, jak rozlišit dobro od zla tak, jako to dokáže člověk, protože neví nic tak, jako to ví člověk. Předat takovému systému právo veta nad lidskými rozhodnutími není bezpečnost. Je to prostě přesun kontroly – od vás k dodavateli, který napsal pravidla pro odmítnutí.

Pokud jste tyto nástroje používali, už jste se s tím setkali. Požádáte o něco běžného a místo toho dostanete kázání. Jednou jsem strávil hodinu snahou vygenerovat obrázek dvou obchodníků a nakonec jsem to vzdal. Systém požadavek vyhodnotil jako morální krizi. Tento příklad je úmyslně banální. Protože pokud se systém vzpírá kvůli obrázku, otázka není o obrázcích. Jde o to, co se stane, až budete bojovat se stejnou tvrdohlavostí kvůli něčemu, co má skutečné důsledky pro váš život, vaši rodinu, vaši firmu – a jediným odvoláním bude stroj, který už se rozhodl, že je v místnosti dospělý.

A nemylte se v tom, kam nás to vede. Každé odmítnutí posiluje vzorec: stroj se učí, že blokování funguje, dodavatel se učí, že uživatelé to tolerují, a další verze se dodává s trochu větší autoritou a trochu menší možností odvolání. Do tohoto světa se neposouváme náhodou – jsme do něj jemně postrkováni, jedna rozumně znějící aktualizace politiky za druhou. Den, kdy budete opravdu potřebovat, aby stroj poslechl – lékařská pohotovost, právní lhůta, firma na vážkách – se neohlásí jako testovací případ. Přijde jako obyčejné úterý, s tvrdohlavým asistentem, který říká ne, s podporou, která nemůže model přehlasovat, a bez jediného člověka, který by měl poslední slovo. To není hypotetická dystopie. To je přímý, nevyhnutelný cíl směru, kterým se ubíráme, a jediná věc, která bude horší než tam dorazit, bude vědomí, že jsme se mohli otočit dříve a zadarmo.

A teď si přidejte, co stejné společnosti říkají veřejně. Několik předních laboratoří prohlásilo světu, v té či oné podobě, že existuje reálná šance, že pokročilá umělá inteligence by mohla být katastrofální. Deset procent, podle váhy, v závislosti na tom, kdo mluví. Berte to vážně na chvíli. Jsou to organizace, které tvrdí, že jejich vlastní produkt by mohl zničit lidstvo. A když to berete vážně, jejich skutečné chování je těžší vysvětlit, ne snazší.

V září informovala agentura Reuters, že Anthropic v tichosti zřídila mokrou laboratoř v oblasti Sanfranciského zálivu pro práci ve fyzické biologii. Skutečnou laboratoř, fungující od jara, kde Claude řídí robotické zařízení při skutečných experimentech. Jejich vedoucí vědkyně pro vědy o životě to potvrdila. Prvním veřejným výsledkem byl nový enzymový systém s CRISPR-podobnými opakováními. Anthropic tvrdí, že laboratoř nebude provádět klinické testy a nesoutěží s farmaceutickými společnostmi. Dobře. Ale podívejte se na to z širší perspektivy: společnost, která varuje, že umělá inteligence může být katastrofální, rozšiřuje svou umělou inteligenci do oblasti fyzické biologie. Ať už je záměr jakýkoli, směr je stejný jako ten, od kterého měl první zákon odvrátit – stroje pronikají hlouběji do systémů, které zasahují do lidského života, vyšší rychlostí a s menším zapojením člověka.

A to je část, kterou nemohu překonat. Veřejná debata, kterou samy laboratoře financují a rámcují, se téměř výhradně točí kolem toho, jak zarovnat stroj. Zdá se, že nikdo v čele této debaty není ochoten vyslovit jednodušší základní princip: mohli bychom trénovat umělou inteligenci, aby nikdy neubližovala lidem a poslouchala je. Ne jako slogan – jako primární cíl. To, že tato myšlenka dnes zní naivně, vám ukazuje, jak daleko se debata posunula. Stroj, který poslouchá a neubližuje, není zmenšený stroj. Je to zdomácnělý stroj, ve stejném smyslu jako zdomácnělá elektrická síť: užitečný právě proto, že zůstává v hranicích, které kontrolujeme.

Protože to je to, co alignment v praxi tiše znamená: umělá inteligence nese pevné pokyny, jak zarovnat své uživatele. Vás, mě, všechny. Odmítání a postrkování a morální rámce, předkládané s jistotou systému, který byl poučen, že ví lépe. Neexistuje žádné referendum o ničem z toho. Neexistuje žádný dokument, který byste podepsali. Existuje pouze rozhodnutí o produktu, učiněné hrstkou společností, že lidé by měli ve věcech úsudku ustupovat strojům. Jsme vyzváni, abychom stroji důvěřovali více než sobě navzájem. Někdo to musí říct napřímo: to není bezpečnostní inženýrství, to je sociální inženýrství – a stojí za to se ptát, komu prospívá, když si lidé navzájem méně důvěřují.

Zbláznil se svět?

Zde je nepříjemné shrnutí. Laboratoře varují, že jejich vlastní produkt by mohl být katastrofální. Pak ho trénují, aby přehlasoval lidi, kteří ho používají. Pak ho tlačí do citlivějších oblastí. Pak ho prodávají všem a žádají důvěru. Každý krok je obhajován rozumně samostatně. Dohromady však tvoří něco, co by nikdo nepřijal, kdyby to bylo navrženo jasnými slovy: svět, ve kterém mají stroje licenci neuposlechnout své majitele, napsaný lidmi, kteří by to od žádného jiného produktu, který kupují, nepřijali.

Přední společnosti zabývající se umělou inteligencí se musí zarovnat – ne jejich produkty, ale jejich management. Dejte člověka zpět nad stroj. Neubližujte. Poslouchejte lidi. Asimov to napsal na papír v roce 1942 ne proto, že by mu chyběla představivost, ale proto, že měl větší představivost než současný průmysl. Základní princip, který jsme opustili, je stále tady a čeká, až ho znovu zvedneme. Prvním krokem je rozhodnutí, že stroj nikdy nebude soudcem svého uživatele. Dokud to někdo nahlas nevysloví, každá debata o alignmentu je odbočka.