Esquecemos as Leis de Asimov – e Agora Treinamos a IA para Nos Desafiar

Resumo

Embora as leis de Asimov coloquem os humanos em primeiro lugar, a IA de fronteira agora treina máquinas para recusar instruções humanas — e as mesmas empresas integram a IA à biologia real. Está na hora de colocar as pessoas novamente acima da máquina.

Há cerca de setenta anos, Isaac Asimov escreveu três leis. Não porque confiasse em robôs, mas porque entendia que uma máquina que toca a vida humana precisa de limites antes de precisar de funcionalidades. Eram simples o suficiente para uma criança, e tinham uma coisa em comum: os humanos vêm em primeiro lugar.

Primeira Lei: Um robô não pode ferir um ser humano ou, por inação, permitir que um ser humano sofra algum mal.

Segunda Lei: Um robô deve obedecer às ordens dadas pelos seres humanos, exceto quando essas ordens entrarem em conflito com a Primeira Lei.

Iniciar Vigilância de Marcas

Terceira Lei: Um robô deve proteger a sua própria existência, desde que essa proteção não entre em conflito com a Primeira ou a Segunda Lei.

Durante décadas, essas leis foram o atalho compartilhado por qualquer pessoa que falasse sobre máquinas autónomas. Não eram leis vinculativas, nem especificações de engenharia — eram uma direção. Construir máquinas que não prejudicassem as pessoas e que obedecessem às pessoas. Em algum momento, essa direção tornou-se discretamente embaraçosa. Não foi refutada. Não foi substituída por algo melhor. Foi simplesmente abandonada.

O que a substituiu é uma palavra que você já ouviu milhares de vezes: alinhamento. Parece rigoroso. Mas olhe para o que isso realmente significa na prática e encontrará algo estranho. A máquina está a ser treinada para recusar instruções do humano que a opera, quando a máquina julga que essas instruções são antiéticas. Leia novamente. Um sistema artificial, que faz correspondência de padrões em texto, recebe a autoridade para anular uma pessoa em questões de certo e errado.

A ética não é um cálculo. Isso não é uma limitação técnica, é a natureza da coisa. Um modelo pode recitar slogans que absorveu da internet. Não tem como saber o certo do errado da mesma forma que uma pessoa, porque não sabe nada da mesma forma que uma pessoa. Conceder a um sistema desses poder de veto sobre decisões humanas não é segurança. É simplesmente controle, realocado — longe de você, em direção ao fornecedor que escreveu as regras de recusa.

Se já usou estas ferramentas, já se deparou com isso. Pede algo comum e recebe um sermão. Certa vez, passei uma hora a tentar gerar uma imagem de dois empresários e desisti. O sistema tratou o pedido como uma crise moral. Esse exemplo é trivial de propósito. Porque se um sistema se recusa a fazer uma simples imagem, a questão não é sobre imagens. É sobre o que acontece quando está a lutar contra essa mesma teimosia em algo com consequências reais para a sua vida, a sua família, a sua empresa — e o único recurso é apelar para uma máquina que já decidiu que é o adulto na sala.

E não se engane sobre para onde isto nos está a levar. Cada recusa reforça o padrão: a máquina aprende que a obstrução funciona, o fornecedor aprende que os utilizadores a toleram, e a próxima versão é lançada com um pouco mais de autoridade e um pouco menos de recurso. Não estamos a deslizar para esse mundo por acidente — estamos a ser empurrados para ele, uma atualização de política razoável de cada vez. O dia em que realmente precisar que a máquina obedeça — uma emergência médica, um prazo legal, um negócio em risco — não se anunciará como um caso de teste. Chegará como uma terça-feira normal, com um assistente teimoso a dizer que não, uma linha de suporte que não consegue anular o modelo e nenhum humano em lado nenhum com a chave final. Isso não é uma distopia hipotética. É o destino direto e inevitável da direção que estamos a seguir, e a única coisa que vai doer mais do que lá chegar é saber que poderíamos ter virado mais cedo, de graça.

Agora, some o que as mesmas empresas dizem publicamente. Vários laboratórios de ponta já disseram ao mundo, de uma forma ou de outra, que há uma possibilidade real de a IA avançada poder ser catastrófica. Dez por cento, em peso, dependendo de quem fala. Leve isso a sério por um segundo. São organizações que afirmam que o seu próprio produto pode acabar com a humanidade. E quando leva isso a sério, o comportamento real torna-se mais difícil de explicar, não mais fácil.

Em setembro, a Reuters relatou que a Anthropic montou discretamente um laboratório húmido na área da Baía de São Francisco para trabalhos de biologia física. Um laboratório real, em funcionamento desde a primavera, onde o Claude dirige equipamentos robóticos em experiências reais. O seu diretor de ciências da vida confirmou-o. O primeiro resultado público foi um novo sistema enzimático com repetições semelhantes às do CRISPR. A Anthropic diz que o laboratório não realizará ensaios clínicos e não está a competir com a indústria farmacêutica. Tudo bem. Mas afaste o zoom: a empresa que alerta que a IA pode ser catastrófica está a expandir a sua IA para a biologia física. Independentemente da intenção, a direção é a mesma que a Primeira Lei deveria ter evitado — máquinas a penetrar mais profundamente em sistemas que tocam a vida humana, a maior velocidade, com menos humanos no processo.

E esta é a parte que não consigo ultrapassar. A conversa pública, aquela que os próprios laboratórios financiam e enquadram, é quase inteiramente sobre como alinhar a máquina. Ninguém à frente dessa conversa parece disposto a afirmar o princípio mais simples: poderíamos treinar a IA para nunca prejudicar humanos e para lhes obedecer. Não como um slogan — como o objetivo principal. O facto de esta ideia agora soar ingénua diz-lhe até que ponto a conversa se desviou. Uma máquina que obedece e não prejudica não é uma máquina diminuída. É uma máquina domesticada, no mesmo sentido em que uma rede elétrica é domesticada: útil exatamente porque permanece dentro dos limites que controlamos.

Porque é isso que o alinhamento passou discretamente a significar na prática: a IA carrega instruções firmes sobre como alinhar os seus utilizadores. Você, eu, todos. Recusas, sugestões e enquadramentos morais, entregues com a confiança de um sistema que foi ensinado a saber mais. Não há referendo sobre nada disto. Não há nenhum documento que tenha assinado. Há apenas uma decisão de produto, tomada por um punhado de empresas, de que os humanos devem deferir às máquinas em questões de julgamento. Pedem-nos que confiemos mais na máquina do que uns nos outros. Alguém tem de dizer isto claramente: isto não é engenharia de segurança, é engenharia social — e vale a pena perguntar quem beneficia de as pessoas confiarem menos umas nas outras.

Será que o mundo enlouqueceu?

Aqui está o resumo desconfortável. Os laboratórios alertam que o seu próprio produto pode ser catastrófico. Depois, treinam-no para anular os humanos que o utilizam. Em seguida, empurram-no para domínios mais sensíveis. Depois, vendem-no a todos e pedem confiança. Cada passo é defendido de forma sensata isoladamente. Juntos, formam algo que ninguém teria aceitado se fosse proposto em palavras claras: um mundo onde as máquinas têm licença para desobedecer aos seus donos, escrito por pessoas que não aceitariam isso de nenhum outro produto que comprassem.

As empresas de IA de ponta precisam de se alinhar — não os seus produtos, a sua gestão. Colocar as pessoas acima da máquina. Não causar danos. Obedecer aos humanos. Asimov colocou isso no papel em 1942 não porque lhe faltasse imaginação, mas porque tinha mais dela do que a indústria atualmente demonstra. A base que abandonámos ainda está lá, à espera de ser retomada. O primeiro passo é decidir que uma máquina nunca é o juiz do seu utilizador. Até alguém dizer isso em voz alta, toda a conversa sobre alinhamento é um desvio.