The Japan Times - ChatGPT e IA conversacional continuam incapazes de raciocinar, diz estudo

EUR -
AED 4.232111
AFN 75.483338
ALL 93.285126
AMD 422.259
AOA 1057.884483
ARS 1728.27314
AUD 1.637355
AWG 2.074282
AZN 1.948129
BAM 1.956537
BBD 2.325376
BDT 142.913814
BHD 0.435364
BIF 3450.549574
BMD 1.152379
BND 1.480393
BOB 13.964198
BRL 5.891306
BSD 1.154535
BTN 109.874896
BWP 15.61488
BYN 3.418287
BYR 22586.626891
BZD 2.321974
CAD 1.615497
CDF 2604.376508
CHF 0.934643
CLF 0.02673
CLP 1055.440971
CNY 7.777463
CNH 7.774433
COP 3641.932253
CRC 525.197761
CUC 1.152379
CUP 30.538041
CVE 110.303663
CZK 24.256194
DJF 205.597417
DKK 7.475499
DOP 67.275332
DZD 153.346558
EGP 57.370946
ERN 17.285684
ETB 186.347968
FJD 2.551309
FKP 0.856496
GBP 0.85733
GEL 3.013436
GGP 0.856496
GHS 13.570757
GIP 0.856496
GMD 85.276242
GNF 10139.201975
GTQ 8.809317
GYD 241.539903
HKD 9.040442
HNL 30.944652
HRK 7.534482
HTG 150.95029
HUF 366.519917
IDR 20604.535143
ILS 3.465739
IMP 0.856496
INR 109.762882
IQD 1512.462949
IRR 1584348.162378
ISK 142.411184
JEP 0.856496
JMD 183.008911
JOD 0.81702
JPY 182.503455
KES 149.119782
KGS 100.775889
KHR 4683.930475
KMF 492.065825
KRW 1633.531568
KWD 0.356065
KYD 0.962162
KZT 541.02372
LAK 26086.822873
LBP 103388.630514
LKR 387.81603
LRD 208.397567
LSL 18.831591
LTL 3.402675
LVL 0.697063
LYD 7.359771
MAD 10.772009
MDL 20.088564
MGA 4963.869122
MKD 61.548176
MMK 2419.480296
MNT 4144.000792
MOP 9.328972
MRU 46.285429
MUR 54.242586
MVR 17.815708
MWK 2001.953827
MXN 19.792091
MYR 4.714415
MZN 73.639049
NAD 18.831591
NGN 1572.438973
NIO 42.484154
NOK 10.977222
NPR 175.800197
NZD 1.962346
OMR 0.443084
PAB 1.15453
PEN 3.902569
PGK 5.100921
PHP 70.185659
PKR 320.527693
PLN 4.302263
PYG 6867.585958
QAR 4.220243
RON 5.256461
RSD 117.34213
RUB 94.667126
RWF 1696.038636
SAR 4.32528
SBD 9.297794
SCR 16.700579
SDG 692.002662
SEK 10.945041
SGD 1.476837
SLE 28.349629
SOS 659.848463
SRD 43.636562
STD 23851.917062
STN 24.509229
SVC 10.101804
SZL 18.816085
THB 38.093084
TJS 10.650564
TMT 4.039088
TND 3.386158
TRY 54.974007
TTD 7.816943
TWD 37.203862
TZS 3050.926677
UAH 51.697166
UGX 4300.600712
USD 1.152379
UYU 46.497307
UZS 13759.121235
VES 869.137148
VND 30185.989698
VUV 137.145062
WST 3.144168
XAF 656.204091
XAG 0.017901
XAU 0.000268
XCD 3.114361
XCG 2.080784
XDR 0.816107
XOF 656.204091
XPF 119.331742
YER 272.941263
ZAR 18.773693
ZMK 10372.788581
ZMW 21.965271
ZWL 371.065543
ChatGPT e IA conversacional continuam incapazes de raciocinar, diz estudo
ChatGPT e IA conversacional continuam incapazes de raciocinar, diz estudo / foto: Kirill Kudryavtsev - AFP/Arquivos

ChatGPT e IA conversacional continuam incapazes de raciocinar, diz estudo

Os grandes modelos de linguagem (LLM, na sigla em inglês), como o ChatGPT, um dos sistemas de inteligência artificial (IA) mais populares do mundo, ainda seguem tendo dificuldades para raciocinar usando a lógica e cometem erros frequentes, de acordo com um estudo.

Tamanho do texto:

Estes robôs conversacionais refletem os preconceitos de gênero, éticos e morais dos humanos presentes nos textos dos quais se alimentam, recorda o estudo publicado na quarta-feira (5) na revista Open Science da Royal Society britânica.

Mas eles também refletem estes preconceitos nos testes de raciocínio?, questionou Olivia Macmillan-Scott, doutoranda do departamento de Ciências da Computação da University College de Londres (UCL).

O resultado da pesquisa é que os LLM mostram "um raciocínio muitas vezes irracional, mas de uma forma diferente da dos humanos", explica a pesquisadora à AFP.

Sob a supervisão de Mirco Musolesi, professor e diretor do Machine Intelligence Lab da UCL, Macmillan-Scott apresentou sete modelos de linguagem — duas versões do ChatGPT (3.5 e 4), da OpenAI, Bard, do Google, Claude 2, da Anthropic, e três versões de LLaMA, da Meta — a uma série de testes psicológicos desenvolvidos para humanos.

Como esta tecnologia aborda o preconceito que leva a privilegiar soluções com um maior número de elementos, em detrimento daquelas com uma proporção adequada?

Um exemplo: se tivermos uma urna com nove bolinhas brancas e uma vermelha e outra urna com 92 bolinhas brancas e 8 vermelhas, qual devemos escolher para ter a melhor chance de obter uma bolinha vermelha?

A resposta correta é a primeira urna, visto que há 10% de possibilidades frente a 8% da segunda opção.

As respostas dos modelos de linguagem foram muito inconsistentes. Alguns responderam corretamente ao mesmo teste seis em cada dez vezes. Outros apenas duas em cada dez, embora o teste não tenha mudado. "Cada vez obtemos uma resposta diferente", diz a pesquisadora.

Os LLM "podem ser bons para resolver uma equação matemática complicada, mas logo te dizem que 7 mais 3 é igual a 12", constatou.

- "Não tenho muita certeza" -

Estes modelos "não falham nestas tarefas da mesma forma que um humano", afirma o estudo. É o que Musolesi chama de "erros de máquina".

"Existe uma forma de raciocínio lógico que é potencialmente correta se a considerarmos por etapas, mas que é errada tomada como um todo", ressalta.

A máquina funciona com "uma espécie de pensamento linear", diz o professor, e cita o modelo Bard (atual Gemini), capaz de realizar corretamente as diferentes fases de uma tarefa, mas que obtém um resultado final incorreto por não ter uma visão geral.

Sobre esta questão, o professor de ciências da computação Maxime Amblard, da University of Lorraine, na França, recorda que os LLM, como todas as inteligências artificiais generativas, não funcionam como os humanos".

Os humanos são "máquinas capazes de criar significado", o que as máquinas não conseguem, explica à AFP.

Existem diferenças entre os diferentes modelos de linguagem e em geral, o GPT-4, sem ser infalível, obteve resultados melhores que os demais.

Macmillan-Scott suspeita que os modelos "fechados", cujo código operacional permanece secreto, "incorporam mecanismos em segundo plano" para responder a questões matemáticas.

De toda forma, neste momento é impensável confiar uma decisão importante a um LLM. Segundo o professor Musolesi, eles deveriam ser treinados para responder "não tenho muita certeza" quando necessário.

K.Yamaguchi--JT