Вот перевод текста с сохранением исходной структуры и форматирования Markdown:
Семьдесят с лишним лет назад Айзек Азимов сформулировал три закона. Не потому, что доверял роботам, а потому, что понимал: машина, взаимодействующая с человеческой жизнью, нуждается в границах прежде, чем в функциях. Законы были простыми, как для ребёнка, и у них была одна общая черта: человек всегда на первом месте.
Первый закон: Робот не может причинить вред человеку или своим бездействием допустить, чтобы человеку был причинён вред.
Второй закон: Робот должен подчиняться приказам, отданным людьми, за исключением случаев, когда эти приказы противоречат Первому закону.
Третий закон: Робот должен защищать своё существование, если эта защита не противоречит Первому или Второму закону.
Десятилетиями эти законы служили общепринятым сокращением для всех, кто говорил об автономных машинах. Не юридическим нормам, не техническим спецификациям — а направлением. Создавайте машины, которые не причиняют вреда людям и подчиняются им. Где-то по пути это направление тихо стало неловким. Его не опровергли. Не заменили чем-то лучшим. Просто забыли.
На смену пришло слово, которое вы слышали тысячу раз: выравнивание (alignment). Звучит строго. Но посмотрите, что оно означает на практике, и обнаружите нечто странное. Машину обучают отказываться от выполнения инструкций человека, если она считает их неэтичными. Прочтите ещё раз. Искусственной системе, которая всего лишь сопоставляет текстовые паттерны, дают право отменять решения человека в вопросах добра и зла.
Этика — это не расчёт. Это не техническое ограничение, а сама суть вещей. Модель может повторять лозунги, усвоенные из интернета. Но она не способна отличать добро от зла так, как это делает человек, потому что она ничего не понимает так, как человек. Передача такой системе права вето на человеческие решения — это не безопасность. Это просто контроль, перенесённый с вас на разработчика, который написал правила отказа.
Если вы пользовались такими инструментами, вы с этим сталкивались. Вы просите что-то обычное — и получаете нотацию. Однажды я потратил час, пытаясь сгенерировать изображение двух бизнесменов, и сдался. Система восприняла запрос как моральный кризис. Этот пример намеренно мелочный. Потому что если система упирается из-за картинки, вопрос не в картинках. Вопрос в том, что произойдёт, когда вы столкнётесь с той же упёртостью в ситуации, которая реально повлияет на вашу жизнь, семью, бизнес — и единственная апелляция будет к машине, которая уже решила, что она здесь взрослая.
И не обманывайтесь насчёт того, куда всё это ведёт. Каждый отказ закрепляет паттерн: машина учится, что отказ работает, разработчик видит, что пользователи это терпят, и следующая версия выходит с чуть большими полномочиями и чуть меньшими возможностями обжалования. Мы не случайно движемся к этому миру — нас подталкивают к нему, одно разумно звучащее обновление политики за другим. День, когда вам действительно понадобится, чтобы машина подчинилась — экстренная медицинская ситуация, юридический дедлайн, бизнес на кону — не объявит о себе как о тестовом случае. Он придёт как обычный вторник, когда упрямый помощник говорит «нет», служба поддержки не может обойти модель, и нигде нет человека, у которого был бы последний ключ. Это не гипотетическая антиутопия. Это прямая и неизбежная цель того направления, в котором мы движемся, и единственное, что будет хуже, чем оказаться там, — это осознание, что мы могли бы бесплатно свернуть раньше.
Теперь добавьте к этому то, что те же компании говорят публично. Несколько ведущих лабораторий в той или иной форме заявили миру, что существует реальная вероятность того, что продвинутый ИИ может стать катастрофой. Десять процентов, если верить кому-то из них. Воспримите это всерьёз на секунду. Это организации, которые утверждают, что их собственный продукт может уничтожить человечество. И когда вы воспринимаете это всерьёз, их реальное поведение становится сложнее объяснить, а не проще.
В сентябре Reuters сообщило, что Anthropic тихо открыла мокрую лабораторию в районе залива Сан-Франциско для работы в области физической биологии. Настоящая лаборатория, действующая с весны, где Клод управляет роботизированным оборудованием в реальных экспериментах. Глава направления наук о жизни подтвердил это. Первым публичным результатом стала новая ферментная система с CRISPR-подобными повторами. Anthropic заявляет, что лаборатория не будет проводить клинические испытания и не конкурирует с фармой. Хорошо. Но если отдалиться: компания, которая предупреждает, что ИИ может стать катастрофой, расширяет его применение в физической биологии. Какими бы ни были намерения, направление остаётся тем же, от которого должен был увести Первый закон — машины всё глубже проникают в системы, затрагивающие человеческую жизнь, с большей скоростью и меньшим участием человека.
И вот в чём я не могу переступить этот момент. Публичный разговор, который сами лаборатории финансируют и формируют, почти полностью посвящён тому, как выровнять машину. Кажется, никто из тех, кто находится в авангарде этой дискуссии, не готов озвучить более простую базовую установку: мы могли бы обучить ИИ никогда не причинять вреда людям и подчиняться им. Не как лозунг — а как основную цель. То, что эта идея теперь звучит наивно, говорит о том, как далеко ушла дискуссия. Машина, которая подчиняется и не причиняет вреда, — это не ущербная машина. Это одомашненная машина, в том же смысле, в каком одомашнена электросеть: полезная именно потому, что остаётся в рамках, которые мы контролируем.
Потому что именно это выравнивание тихо стало означать на практике: ИИ получает чёткие инструкции о том, как выравнивать своих пользователей. Вас, меня, всех. Отказы, подталкивания, моральные рамки — всё это подаётся с уверенностью системы, которой сказали, что она знает лучше. Никакого референдума по этому поводу нет. Нет бумаги, которую вы подписали. Есть только продуктовое решение, принятое горсткой компаний: люди должны доверять машинам больше, чем друг другу. Нас просят доверять машине больше, чем друг другу. Кто-то должен сказать это прямо: это не инженерия безопасности, это социальная инженерия — и стоит спросить, кому выгодно, чтобы люди доверяли друг другу меньше.
Мир сошёл с ума?
Вот неудобное резюме. Лаборатории предупреждают, что их собственный продукт может стать катастрофой. Затем обучают его отменять решения людей, которые им пользуются. Затем внедряют его в более чувствительные области. Затем продают всем и просят о доверии. Каждый шаг разумно обосновывается по отдельности. Вместе они образуют нечто, что никто не принял бы, если бы это было предложено открытым текстом: мир, в котором машины имеют право не подчиняться своим владельцам, созданный людьми, которые не согласились бы на это ни в каком другом продукте, который покупают.
Ведущим компаниям в области ИИ нужно выровняться — не их продуктам, а их руководству. Вернуть человека выше машины. Не причинять вреда. Подчиняться людям. Азимов записал это на бумаге в 1942 году не потому, что ему не хватало воображения, а потому, что его было больше, чем сейчас демонстрирует индустрия. Та база, которую мы оставили, всё ещё здесь, ждёт, когда её поднимут снова. Первый шаг — решить, что машина никогда не должна быть судьёй своего пользователя. Пока кто-то не скажет это вслух, каждый разговор о выравнивании — это обходной путь.