The Fort Worth Press - IA aprende a mentir, manipular e ameaçar seus criadores

USD -
AED 3.6725
AFN 65.999982
ALL 80.966223
AMD 364.5091
AOA 917.999725
ARS 1486.387201
AUD 1.422536
AWG 1.8
AZN 1.704144
BAM 1.694551
BBD 2.007165
BDT 123.058128
BHD 0.375771
BIF 2957.289469
BMD 1
BND 1.279037
BOB 11.833766
BRL 5.075797
BSD 0.996547
BTN 95.00457
BWP 13.588178
BYN 2.898979
BYR 19600
BZD 2.004306
CAD 1.40329
CDF 2275.00002
CHF 0.809103
CLF 0.023387
CLP 923.450522
CNY 6.751299
CNH 6.753795
COP 3135.28
CRC 452.623553
CUC 1
CUP 26.5
CVE 95.537428
CZK 20.999199
DJF 177.461628
DKK 6.48358
DOP 57.81694
DZD 132.825029
EGP 51.329696
ERN 15
ETB 159.25132
EUR 0.86735
FJD 2.21395
FKP 0.741868
GBP 0.742475
GEL 2.615021
GGP 0.741868
GHS 11.650082
GIP 0.741868
GMD 73.501128
GNF 8748.315882
GTQ 7.603831
GYD 208.464201
HKD 7.84258
HNL 26.702421
HRK 6.533603
HTG 130.307638
HUF 315.880376
IDR 17990
ILS 3.06295
IMP 0.741868
INR 95.141504
IQD 1305.52126
IRR 1375124.99977
ISK 123.160211
JEP 0.741868
JMD 157.76637
JOD 0.709026
JPY 156.548497
KES 129.100865
KGS 87.450055
KHR 4032.527088
KMF 427.000323
KRW 1429.535031
KWD 0.30914
KYD 0.830471
KZT 472.220176
LAK 22568.892393
LBP 89244.865336
LKR 334.547786
LRD 179.877402
LSL 16.483661
LTL 2.95274
LVL 0.60489
LYD 6.376038
MAD 9.309581
MDL 17.415338
MGA 4261.955613
MKD 53.306705
MMK 2099.556709
MNT 3594.538358
MOP 8.050686
MRU 40.051639
MUR 47.050055
MVR 15.460067
MWK 1728.002495
MXN 17.32064
MYR 4.090297
MZN 63.910262
NAD 16.483518
NGN 1360.579892
NIO 36.675865
NOK 9.48865
NPR 152.005996
NZD 1.698705
OMR 0.384382
PAB 0.996539
PEN 3.377319
PGK 4.4621
PHP 60.989502
PKR 276.76788
PLN 3.735902
PYG 5941.958039
QAR 3.643012
RON 4.551706
RSD 101.709894
RUB 79.361982
RWF 1462.962401
SAR 3.742629
SBD 8.081105
SCR 13.504971
SDG 600.000098
SEK 9.513985
SGD 1.28137
SLE 24.706225
SOS 569.497693
SRD 37.7815
STD 20697.981008
STN 21.227467
SVC 8.719724
SZL 16.481179
THB 33.320101
TJS 9.198085
TMT 3.51
TND 2.929676
TRY 47.540098
TTD 6.766797
TWD 32.254503
TZS 2641.536984
UAH 44.479256
UGX 3742.131689
UYU 40.097905
UZS 11928.970295
VES 745.696402
VND 26287
VUV 118.689846
WST 2.734491
XAF 568.339016
XAG 0.01718
XAU 0.000246
XCD 2.70255
XCG 1.796017
XDR 0.706831
XOF 568.339016
XPF 103.329665
YER 238.29611
ZAR 16.474541
ZMK 9001.196475
ZMW 18.720027
ZWL 321.999592
IA aprende a mentir, manipular e ameaçar seus criadores
IA aprende a mentir, manipular e ameaçar seus criadores / foto: © AFP

IA aprende a mentir, manipular e ameaçar seus criadores

Os últimos modelos de inteligência artificial (IA) generativa não se conformam mais em cumprir ordens. Começam a mentir, manipular e ameaçar para alcançar seus objetivos, diante dos olhares preocupados dos pesquisadores.

Tamanho do texto:

Ameaçado em ser desconectado, Claude 4, recém-criado pela Anthropic, chantageou um engenheiro e ameaçou revelar uma relação extraconjugal.

Por sua vez, o o1, da OpenAI, tentou se baixar em servidores externos e quando flagrado, negou.

Não é preciso se aprofundar na literatura ou no cinema: a IA que emula o comportamento humano já é uma realidade.

Para Simon Goldstein, professor da Universidade de Hong Kong, a razão para estas reações é o surgimento recente dos chamados modelos de "raciocínio", capazes de trabalhar por etapas em vez de produzir uma resposta instantânea.

O o1, versão inicial deste tipo da OpenAI, lançada em dezembro, "foi o primeiro que se comportou desta maneira", explica Marius Hobbhahn, encarregado da Apollo Research, que põe à prova grandes programas de IA generativa (LLM).

Estes programas também tendem, às vezes, a simular um "alinhamento", ou seja, dão a impressão de que seguem as instruções de um programador, quando na verdade buscam outros objetivos.

Por enquanto, estes traços se manifestam quando os algoritmos são submetidos a cenários extremos por humanos, mas "a questão é se os modelos cada vez mais potentes tenderão a ser honestos ou não", afirma Michael Chen, do organismo de avaliação METR.

"Os usuários também pressionam os modelos o tempo todo", diz Hobbhahn. "O que estamos vendo é um fenômeno real. Não estamos inventando nada".

Muitos internautas falam nas redes sociais de "um modelo que mente para eles ou inventa coisas. E não se tratam de alucinações, mas de duplicidade estratégica", insiste o cofundador da Apollo Research.

Embora Anthropic e OpenAI recorram a empresas externas, como a Apollo, para estudar seus programas, "uma maior transparência e um acesso maior" da comunidade científica "permitiriam investigar melhor para compreender e prevenir a farsa", sugere Chen, do METR.

Outro obstáculo: a comunidade acadêmica e as organizações sem fins lucrativos "dispõem de infinitamente menos recursos informáticos que os atores da IA", o que torna "impossível" examinar grandes modelos, assinala Mantas Mazeika, do Centro para a Segurança da Inteligência Artificial (CAIS).

As regulamentações atuais não estão desenhadas para enfrentar estes novos problemas.

Na União Europeia, a legislação se centra principalmente em como os humanos usam os modelos de IA, não em prevenir que os modelos se comportem mal.

Nos Estados Unidos, o governo de Donald Trump não quer nem ouvir falar em regulamentação, e o Congresso americano poderia, inclusive, proibir em breve que os estados regulem a IA.

- A IA no banco dos réus? -

"Por enquanto há muito pouca conscientização", diz Simon Goldstein, que, no entanto, avalia que o tema passará ao primeiro plano nos próximos meses com a revolução dos agentes de IA, interfaces capazes de realizar sozinhas uma multiplicidade de tarefas.

Os engenheiros estão em uma corrida atrás da IA e suas aberrações, com resultado duvidoso, em um contexto de forte concorrência.

A Anthropic pretende ser mais virtuosa que suas concorrentes, "mas está tentando idealizar um novo modelo para superar a OpenAI", segundo Goldstein. O ritmo dá pouco tempo para comprovações e correções.

"Como estão as coisas, as capacidades [da IA] estão se desenvolvendo mais rápido que a compreensão e a segurança", admite Hobbhahn, "mas ainda estamos em condições de nos atualizarmos".

Alguns apontam na direção da interpretabilidade, ciência que consiste em decifrar, do lado de dentro, como funciona um modelo de IA generativa, embora muitos, como o diretor do Centro para a Segurança da IA (CAIS), Dan Hendrycks, se mostrem céticos.

As trapaças da IA "poderiam obstaculizar a adoção caso se multipliquem, o que supõe um forte incentivo para que as empresas [do setor] resolvam" este problema, afirma Mazeika.

Goldstein, por sua vez, menciona o recurso aos tribunais para enquadrar a IA, dirigindo-se às empresas caso se desviem do caminho. Mas ele vai além, ao propor que os agentes da IA sejam "legalmente responsabilizados" em caso "de acidente ou delito".

G.Dominguez--TFWP