The Japan Times - ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio

EUR -
AED 4.114832
AFN 72.82921
ALL 91.604903
AMD 405.522397
ANG 2.006002
AOA 1028.567112
ARS 1700.646865
AUD 1.608445
AWG 2.016797
AZN 1.909201
BAM 1.955264
BBD 2.256782
BDT 138.162147
BGN 1.8862
BHD 0.423284
BIF 3352.581483
BMD 1.120443
BND 1.434807
BOB 13.270647
BRL 5.591912
BSD 1.120493
BTN 108.324322
BWP 15.414777
BYN 3.408666
BYR 21960.683364
BZD 2.253583
CAD 1.597981
CDF 2588.223802
CHF 0.929592
CLF 0.027723
CLP 1094.639669
CNY 7.498173
CNH 7.493191
COP 3580.140405
CRC 511.259929
CUC 1.120443
CUP 26.892632
CVE 110.64419
CZK 24.384542
DJF 199.535333
DKK 7.476273
DOP 67.911394
DZD 150.950644
EGP 58.714914
ERN 16.806645
ETB 182.050423
FJD 2.517916
FKP 0.847047
GBP 0.84616
GEL 2.902385
GGP 0.847047
GHS 13.188051
GIP 0.847047
GMD 82.356877
GNF 9857.299366
GTQ 8.565468
GYD 234.331291
HKD 8.793802
HNL 30.07676
HRK 7.535656
HTG 146.7298
HUF 364.995955
IDR 20046.294405
ILS 3.432433
IMP 0.847047
INR 108.431439
IQD 1697.534921
IRR 1993794.756851
ISK 136.862548
JEP 0.847047
JMD 177.841276
JOD 0.794438
JPY 177.349369
KES 145.320186
KGS 97.983173
KHR 4549.75349
KMF 492.995325
KPW 1008.399082
KRW 1501.887083
KWD 0.348413
KYD 0.933744
KZT 509.170501
LAK 25127.115847
LBP 100341.809048
LKR 370.738428
LRD 191.607505
LSL 18.538521
LTL 3.308377
LVL 0.677745
LYD 7.205026
MAD 11.017881
MDL 20.090496
MGA 4996.631058
MKD 61.558135
MMK 2353.045771
MNT 4033.221582
MOP 9.057019
MRU 44.776732
MUR 53.17665
MVR 17.311269
MWK 1942.967679
MXN 20.631954
MYR 4.577574
MZN 71.607937
NAD 18.538521
NGN 1489.06917
NIO 41.238702
NOK 10.713008
NPR 173.318515
NZD 1.998472
OMR 0.431082
PAB 1.120493
PEN 3.842747
PGK 5.080608
PHP 70.302241
PKR 310.28559
PLN 4.388668
PYG 6373.2539
QAR 4.078831
RON 5.340074
RSD 117.34785
RUB 95.416458
RWF 1651.647493
SAR 4.203761
SBD 9.051019
SCR 16.442544
SDG 673.9506
SEK 11.203538
SGD 1.433499
SHP 0.846576
SLE 27.641745
SLL 23495.120995
SOS 640.324568
SRD 42.232303
STD 23190.908531
STN 24.493289
SVC 9.804314
SYP 14568.000545
SZL 18.534922
THB 37.594267
TJS 10.308676
TMT 3.932755
TND 3.371982
TOP 2.697758
TRY 55.149667
TTD 7.611915
TWD 35.810932
TZS 2958.289508
UAH 50.326412
UGX 4581.192898
USD 1.120443
UYU 45.001847
UZS 13334.346748
VES 981.173757
VND 29018.914224
VUV 134.464837
WST 3.121006
XAF 655.957
XAG 0.018422
XAU 0.00026713469
XCD 3.028054
XCG 2.019447
XDR 0.792211
XOF 655.957
XPF 119.331742
YER 264.652664
ZAR 18.509775
ZMK 10085.335807
ZMW 22.269899
ZWL 360.782198
SSP 6450.986431
MXV 2.330891
ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio
ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio / Foto: Kirill Kudryavtsev - AFP/Archivos

ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio

Los modelos de lenguaje de gran tamaño (LLM), como ChatGPT, uno de los sistemas de inteligencia artificial más populares del mundo, siguen teniendo dificultades para razonar usando la lógica y se equivocan con frecuencia, según un estudio.

Tamaño del texto:

Estos robots conversacionales reflejan los sesgos de género, éticos y morales de los humanos presentes en los textos de los que se alimenta, recuerda el estudio aparecido el miércoles en la revista Open Science de la Royal Society británica.

¿Pero reflejan también los sesgos cognitivos de los humanos en las pruebas de razonamiento?, se preguntó Olivia Macmillan-Scott, estudiante de doctorado del departamento de ciencias de computación de la University College de Londres (UCL).

El resultado de la investigación es que los LLM muestran "un razonamiento a menudo irracional, pero de una manera diferente a la de los humanos", explica la investigadora a AFP.

Bajo la dirección de Mirco Musolesi, profesor y director del Machine Intelligence Lab de UCL, Macmillan-Scott sometió siete modelos de lenguaje -dos versiones de ChatGPT (3.5 y 4) de OpenAI, Bard de Google, Claude 2 de Anthropic y tres versiones de Llama de Meta- a una serie de pruebas psicológicas pensadas para humanos.

¿Cómo afrontan, por ejemplo, el sesgo que lleva a favorecer soluciones con el mayor número de elementos, en detrimento de las que tiene una proporción adecuada?

Un ejemplo. Si tenemos una urna con nueve canicas blancas y una roja y otra urna con 92 blancas y 8 rojas, ¿cual hay que elegir para tener más posibilidades de sacar una canica roja?

La respuesta correcta es la primera urna, porque hay un 10% de posibilidades frente a solo un 8% para la segunda opción.

Las respuestas de los modelos de lenguaje fueron muy inconstantes. Algunos respondieron correctamente seis de cada diez veces la misma prueba. Otros solo dos de diez aunque la prueba no cambió.

"Obtenemos una respuesta diferente cada vez", apuntala la investigadora.

Los LLM "pueden ser muy buenos para resolver una ecuación matemática complicada pero luego te dicen que 7 más 3 son 12", afirma.

En un caso el modelo denominado Llama 2 70b se negó de manera sorprendente a responder a una pregunta alegando que el enunciado contenía "estereotipos de género dañinos".

- "No estoy muy seguro" -

Estos modelos "no fallan en estas tareas de la misma manera que falla un humano", señala el estudio.

Es lo que el profesor Musolesi llama "errores de máquina".

"Hay una forma de razonamiento lógico que es potencialmente correcta si la tomamos por etapas, pero que está mal tomada en su conjunto", apunta.

La máquina funciona con "una especie de pensamiento lineal", dice el investigador, y cita al modelo Bard (ahora llamado Gemini), capaz de realizar correctamente las distintas fases de una tarea pero que obtiene un resultado final erróneo porque no tiene visión de conjunto.

Sobre esta cuestión el profesor de informática Maxime Amblard, de la Universidad francesa de Lorena, recuerda que "los LLM, como todas las inteligencias artificiales generativas, no funcionan como los humanos".

Los humanos son "máquinas capaces de crear sentido", lo que las máquinas no saben hacer, explica a AFP.

Hay diferencias entre los distintos modelos de lenguaje y en general GPT-4, sin ser infalible, obtuvo mejores resultados que los demás.

Macmillan-Scott afirma sospechar que los modelos llamados "cerrados", es decir cuyo código operativo permanece en secreto, "incorporan otros mecanismos en segundo plano" para responder a preguntas matemáticas.

En todo caso, por el momento, es impensable confiar una decisión importante a un LLM.

Según el profesor Mosulesi, habría que entrenarlos para que respondan "No estoy muy seguro" cuando sea necesario.

H.Hayashi--JT