The Japan Times - IA aprende a mentir, manipular e ameaçar seus criadores

EUR -
AED 4.218259
AFN 74.659279
ALL 93.369227
AMD 420.332712
AOA 1054.420267
ARS 1710.291846
AUD 1.636331
AWG 2.068927
AZN 1.951893
BAM 1.95411
BBD 2.314598
BDT 141.876383
BHD 0.433319
BIF 3410.234974
BMD 1.148606
BND 1.474918
BOB 13.645483
BRL 5.813093
BSD 1.148956
BTN 109.553795
BWP 15.669444
BYN 3.342993
BYR 22512.684364
BZD 2.31118
CAD 1.612373
CDF 2613.079121
CHF 0.9304
CLF 0.027034
CLP 1064.000044
CNY 7.759123
CNH 7.756096
COP 3585.271332
CRC 521.946194
CUC 1.148606
CUP 30.438068
CVE 110.168734
CZK 24.210548
DJF 204.642074
DKK 7.475383
DOP 66.672032
DZD 152.815922
EGP 58.747426
ERN 17.229095
ETB 183.633847
FJD 2.54692
FKP 0.853335
GBP 0.855729
GEL 3.003591
GGP 0.853335
GHS 13.433677
GIP 0.853335
GMD 84.99741
GNF 10088.272674
GTQ 8.768376
GYD 240.390992
HKD 9.008887
HNL 30.792094
HRK 7.53313
HTG 150.259357
HUF 364.182293
IDR 20737.168676
ILS 3.511522
IMP 0.853335
INR 109.713841
IQD 1505.491052
IRR 1579333.724689
ISK 142.599294
JEP 0.853335
JMD 181.932611
JOD 0.81438
JPY 184.019366
KES 148.632985
KGS 100.445829
KHR 4649.977323
KMF 494.443558
KRW 1658.852151
KWD 0.355712
KYD 0.957672
KZT 544.541808
LAK 26024.1272
LBP 102908.898236
LKR 385.786258
LRD 207.428748
LSL 19.008173
LTL 3.391535
LVL 0.69478
LYD 7.352639
MAD 10.735413
MDL 20.082627
MGA 4914.491773
MKD 61.476549
MMK 2411.833141
MNT 4130.412797
MOP 9.283788
MRU 46.185844
MUR 53.984177
MVR 17.757211
MWK 1992.650143
MXN 19.947548
MYR 4.692863
MZN 73.407721
NAD 19.008091
NGN 1567.985951
NIO 42.284217
NOK 10.938637
NPR 175.287596
NZD 1.958586
OMR 0.441651
PAB 1.149146
PEN 3.893784
PGK 5.145504
PHP 70.408416
PKR 319.159696
PLN 4.313764
PYG 6852.012695
QAR 4.200966
RON 5.247181
RSD 117.40828
RUB 91.315434
RWF 1687.040548
SAR 4.285608
SBD 9.282008
SCR 15.513236
SDG 689.16368
SEK 10.983405
SGD 1.475649
SLE 28.37116
SOS 656.729007
SRD 43.354142
STD 23773.832317
STN 24.473501
SVC 10.055301
SZL 19.005476
THB 38.42835
TJS 10.606978
TMT 4.031608
TND 3.378377
TRY 54.587979
TTD 7.803216
TWD 37.139035
TZS 3043.12686
UAH 51.291581
UGX 4315.248111
USD 1.148606
UYU 46.239596
UZS 13756.039822
VES 856.511619
VND 30208.921179
VUV 137.869694
WST 3.156404
XAF 655.390025
XAG 0.019847
XAU 0.000283
XCD 3.104166
XCG 2.071099
XDR 0.813457
XOF 655.384324
XPF 119.331742
YER 273.71427
ZAR 19.032631
ZMK 10338.835822
ZMW 21.586198
ZWL 369.850774
IA aprende a mentir, manipular e ameaçar seus criadores
IA aprende a mentir, manipular e ameaçar seus criadores / foto: HENRY NICHOLLS - AFP

IA aprende a mentir, manipular e ameaçar seus criadores

Os últimos modelos de inteligência artificial (IA) generativa não se conformam mais em cumprir ordens. Começam a mentir, manipular e ameaçar para alcançar seus objetivos, diante dos olhares preocupados dos pesquisadores.

Tamanho do texto:

Ameaçado em ser desconectado, Claude 4, recém-criado pela Anthropic, chantageou um engenheiro e ameaçou revelar uma relação extraconjugal.

Por sua vez, o o1, da OpenAI, tentou se baixar em servidores externos e quando flagrado, negou.

Não é preciso se aprofundar na literatura ou no cinema: a IA que emula o comportamento humano já é uma realidade.

Para Simon Goldstein, professor da Universidade de Hong Kong, a razão para estas reações é o surgimento recente dos chamados modelos de "raciocínio", capazes de trabalhar por etapas em vez de produzir uma resposta instantânea.

O o1, versão inicial deste tipo da OpenAI, lançada em dezembro, "foi o primeiro que se comportou desta maneira", explica Marius Hobbhahn, encarregado da Apollo Research, que põe à prova grandes programas de IA generativa (LLM).

Estes programas também tendem, às vezes, a simular um "alinhamento", ou seja, dão a impressão de que seguem as instruções de um programador, quando na verdade buscam outros objetivos.

Por enquanto, estes traços se manifestam quando os algoritmos são submetidos a cenários extremos por humanos, mas "a questão é se os modelos cada vez mais potentes tenderão a ser honestos ou não", afirma Michael Chen, do organismo de avaliação METR.

"Os usuários também pressionam os modelos o tempo todo", diz Hobbhahn. "O que estamos vendo é um fenômeno real. Não estamos inventando nada".

Muitos internautas falam nas redes sociais de "um modelo que mente para eles ou inventa coisas. E não se tratam de alucinações, mas de duplicidade estratégica", insiste o cofundador da Apollo Research.

Embora Anthropic e OpenAI recorram a empresas externas, como a Apollo, para estudar seus programas, "uma maior transparência e um acesso maior" da comunidade científica "permitiriam investigar melhor para compreender e prevenir a farsa", sugere Chen, do METR.

Outro obstáculo: a comunidade acadêmica e as organizações sem fins lucrativos "dispõem de infinitamente menos recursos informáticos que os atores da IA", o que torna "impossível" examinar grandes modelos, assinala Mantas Mazeika, do Centro para a Segurança da Inteligência Artificial (CAIS).

As regulamentações atuais não estão desenhadas para enfrentar estes novos problemas.

Na União Europeia, a legislação se centra principalmente em como os humanos usam os modelos de IA, não em prevenir que os modelos se comportem mal.

Nos Estados Unidos, o governo de Donald Trump não quer nem ouvir falar em regulamentação, e o Congresso americano poderia, inclusive, proibir em breve que os estados regulem a IA.

- A IA no banco dos réus? -

"Por enquanto há muito pouca conscientização", diz Simon Goldstein, que, no entanto, avalia que o tema passará ao primeiro plano nos próximos meses com a revolução dos agentes de IA, interfaces capazes de realizar sozinhas uma multiplicidade de tarefas.

Os engenheiros estão em uma corrida atrás da IA e suas aberrações, com resultado duvidoso, em um contexto de forte concorrência.

A Anthropic pretende ser mais virtuosa que suas concorrentes, "mas está tentando idealizar um novo modelo para superar a OpenAI", segundo Goldstein. O ritmo dá pouco tempo para comprovações e correções.

"Como estão as coisas, as capacidades [da IA] estão se desenvolvendo mais rápido que a compreensão e a segurança", admite Hobbhahn, "mas ainda estamos em condições de nos atualizarmos".

Alguns apontam na direção da interpretabilidade, ciência que consiste em decifrar, do lado de dentro, como funciona um modelo de IA generativa, embora muitos, como o diretor do Centro para a Segurança da IA (CAIS), Dan Hendrycks, se mostrem céticos.

As trapaças da IA "poderiam obstaculizar a adoção caso se multipliquem, o que supõe um forte incentivo para que as empresas [do setor] resolvam" este problema, afirma Mazeika.

Goldstein, por sua vez, menciona o recurso aos tribunais para enquadrar a IA, dirigindo-se às empresas caso se desviem do caminho. Mas ele vai além, ao propor que os agentes da IA sejam "legalmente responsabilizados" em caso "de acidente ou delito".

Y.Ishikawa--JT