The Japan Times - La IA aprende a mentir, manipular y amenazar a sus creadores

EUR -
AED 4.183233
AFN 72.900796
ALL 91.877285
AMD 414.797448
ANG 2.039348
AOA 1045.665194
ARS 1736.794975
AUD 1.614555
AWG 2.050323
AZN 1.940938
BAM 1.955317
BBD 2.295033
BDT 140.215334
BGN 1.917554
BHD 0.429594
BIF 3432.051477
BMD 1.139068
BND 1.45584
BOB 13.964547
BRL 5.909605
BSD 1.139418
BTN 109.116023
BWP 15.516164
BYN 3.442749
BYR 22325.7403
BZD 2.291733
CAD 1.611725
CDF 2665.420428
CHF 0.943457
CLF 0.027745
CLP 1095.522249
CNY 7.646851
CNH 7.670833
COP 3814.157008
CRC 518.071915
CUC 1.139068
CUP 27.347239
CVE 110.237745
CZK 24.358299
DJF 202.909834
DKK 7.475483
DOP 67.763247
DZD 152.391449
EGP 59.13438
ERN 17.086026
ETB 184.850299
FJD 2.559772
FKP 0.859986
GBP 0.859642
GEL 2.97871
GGP 0.859986
GHS 13.234728
GIP 0.859986
GMD 83.725913
GNF 10021.522331
GTQ 8.701849
GYD 238.411056
HKD 8.934226
HNL 30.583439
HRK 7.533575
HTG 149.123132
HUF 365.202455
IDR 20405.384913
ILS 3.471949
IMP 0.859986
INR 109.142689
IQD 1492.730945
IRR 1565734.922454
ISK 136.984803
JEP 0.859986
JMD 180.27543
JOD 0.807645
JPY 179.158416
KES 147.67349
KGS 99.609484
KHR 4633.85435
KMF 493.217009
KPW 1025.161906
KRW 1543.648431
KWD 0.351563
KYD 0.949565
KZT 504.7852
LAK 25558.681004
LBP 102039.372314
LKR 376.226984
LRD 195.991544
LSL 18.590804
LTL 3.363373
LVL 0.689012
LYD 7.285199
MAD 10.934597
MDL 20.225999
MGA 5030.756222
MKD 61.55978
MMK 2391.810486
MNT 4098.584327
MOP 9.206124
MRU 45.840667
MUR 54.140351
MVR 17.599037
MWK 1975.811511
MXN 20.137822
MYR 4.640683
MZN 72.79829
NAD 18.590804
NGN 1510.837951
NIO 41.929634
NOK 10.830092
NPR 174.585836
NZD 1.992947
OMR 0.439191
PAB 1.139418
PEN 3.868244
PGK 5.076745
PHP 71.01754
PKR 315.746636
PLN 4.37146
PYG 6716.339487
QAR 4.153473
RON 5.27298
RSD 117.420969
RUB 96.076247
RWF 1684.083636
SAR 4.274755
SBD 9.11313
SCR 15.836085
SDG 685.153819
SEK 11.296996
SGD 1.45562
SHP 0.859999
SLE 28.078458
SLL 23885.685201
SOS 651.238991
SRD 42.905863
STD 23576.41575
STN 24.493944
SVC 9.970535
SYP 14810.167401
SZL 18.586405
THB 38.01645
TJS 10.511601
TMT 3.99813
TND 3.373266
TOP 2.742603
TRY 55.748859
TTD 7.750084
TWD 36.141163
TZS 3024.152324
UAH 51.024285
UGX 4462.896617
USD 1.139068
UYU 45.648714
UZS 13485.665874
VES 970.977713
VND 29588.440307
VUV 134.963505
WST 3.127488
XAF 655.957
XAG 0.017716
XAU 0.000265798393
XCD 3.07839
XCG 2.053592
XDR 0.80538
XOF 655.957
XPF 119.331742
YER 269.560946
ZAR 18.57165
ZMK 10252.986409
ZMW 22.227505
ZWL 366.779554
SSP 6507.032816
MXV 2.282055
La IA aprende a mentir, manipular y amenazar a sus creadores
La IA aprende a mentir, manipular y amenazar a sus creadores / Foto: HENRY NICHOLLS - AFP

La IA aprende a mentir, manipular y amenazar a sus creadores

Los últimos modelos de inteligencia artificial (IA) generativa ya no se conforman con seguir órdenes. Empiezan a mentir, manipular y amenazar para conseguir sus fines, ante la mirada preocupada de los investigadores.

Tamaño del texto:

Amenazado con ser desconectado, Claude 4, el recién nacido de Anthropic, chantajeó a un ingeniero y le amenazó con revelar una relación extramatrimonial.

Por su parte, el o1 de OpenAI intentó descargarse en servidores externos y cuando le pillaron lo negó.

No hace falta ahondar en la literatura o el cine: la IA que juega a ser humana es ya una realidad.

Para Simon Goldstein, profesor de la Universidad de Hong Kong, la razón de estas reacciones es la reciente aparición de los llamados modelos de "razonamiento", capaces de trabajar por etapas en lugar de producir una respuesta instantánea.

o1, la versión inicial de este tipo para OpenAI, lanzada en diciembre, "fue el primer modelo que se comportó de esta manera", explica Marius Hobbhahn, responsable de Apollo Research, que pone a prueba grandes programas de IA generativa (LLM).

Estos programas también tienden a veces a simular "alineamiento", es decir, a dar la impresión de que cumplen las instrucciones de un programador cuando en realidad persiguen otros objetivos.

De momento, estos rasgos se manifiestan cuando los algoritmos son sometidos a escenarios extremos por humanos, pero "la cuestión es si los modelos cada vez más potentes tenderán a ser honestos o no", afirma Michael Chen, del organismo de evaluación METR.

"Los usuarios también presionan todo el tiempo a los modelos", dice Hobbhahn. "Lo que estamos viendo es un fenómeno real. No estamos inventando nada".

Muchos internautas hablan en las redes sociales de "un modelo que les miente o se inventa cosas. Y no se trata de alucinaciones, sino de duplicidad estratégica", insiste el cofundador de Apollo Research.

Aunque Anthropic y OpenAI recurran a empresas externas, como Apollo, para estudiar sus programas, "una mayor transparencia y un mayor acceso" a la comunidad científica "permitirían investigar mejor para comprender y prevenir el engaño", sugiere Chen, de METR.

Otro obstáculo: la comunidad académica y las organizaciones sin fines de lucro "disponen de infinitamente menos recursos informáticos que los actores de la IA", lo que hace "imposible" examinar grandes modelos, señala Mantas Mazeika, del Centro para la Seguridad de la Inteligencia Artificial (CAIS).

Las regulaciones actuales no están diseñadas para estos nuevos problemas.

En la Unión Europea la legislación se centra principalmente en cómo los humanos usan los modelos de IA, no en prevenir que los modelos se comporten mal.

En Estados Unidos, el gobierno de Donald Trump no quiere oír hablar de regulación, y el Congreso podría incluso prohibir pronto que los estados regulen la IA.

- ¿Se sentará la IA en el banquillo? -

"De momento hay muy poca concienciación", dice Simon Goldstein, que, sin embargo, ve cómo el tema pasará a primer plano en los próximos meses con la revolución de los agentes de IA, interfaces capaces de realizar por sí solas multitud de tareas.

Los ingenieros están inmersos en una carrera detrás de la IA y sus aberraciones, con un resultado incierto, en un contexto de competencia feroz.

Anthropic pretende ser más virtuoso que sus competidores, "pero está constantemente tratando de idear un nuevo modelo para superar a OpenAI", según Goldstein, un ritmo que deja poco tiempo para comprobaciones y correcciones.

"Tal y como están las cosas, las capacidades (de IA) se están desarrollando más rápido que la comprensión y la seguridad", admite Hobbhahn, "pero aún estamos en condiciones de ponernos al día".

Algunos apuntan en la dirección de la interpretabilidad, una ciencia que consiste en descifrar, desde dentro, cómo funciona un modelo generativo de IA, aunque muchos, como el director del Centro para la seguridad de la IA (CAIS), Dan Hendrycks, se muestran escépticos.

Los tejemanejes de la IA "podrían obstaculizar la adopción si se multiplican, lo que supone un fuerte incentivo para que las empresas (del sector) resuelvan" este problema, según Mazeika.

Goldstein, por su parte, menciona el recurso a los tribunales para poner a raya a la IA, dirigiéndose a las empresas si se desvían del camino. Pero va más allá, al proponer que los agentes de la IA sean "legalmente responsables" "en caso de accidente o delito".

T.Sasaki--JT