The Japan Times - Mythos 5, la IA de Anthropic, crea identidades falsas durante una prueba en Reino Unido

EUR -
AED 4.183845
AFN 72.900796
ALL 91.762516
AMD 414.074598
ANG 2.039348
AOA 1045.665194
ARS 1741.635676
AUD 1.619646
AWG 2.050323
AZN 1.940938
BAM 1.952891
BBD 2.292276
BDT 140.046936
BGN 1.917554
BHD 0.429476
BIF 3413.787943
BMD 1.139068
BND 1.454092
BOB 13.947776
BRL 5.909605
BSD 1.13805
BTN 108.984975
BWP 15.496782
BYN 3.438614
BYR 22325.7403
BZD 2.288981
CAD 1.611384
CDF 2665.420428
CHF 0.943279
CLF 0.027745
CLP 1095.522249
CNY 7.646851
CNH 7.661158
COP 3764.324847
CRC 517.449712
CUC 1.139068
CUP 27.313317
CVE 110.632063
CZK 24.358299
DJF 202.435681
DKK 7.475483
DOP 67.778993
DZD 152.391449
EGP 59.13438
ERN 17.086026
ETB 184.628294
FJD 2.559772
FKP 0.861993
GBP 0.85948
GEL 2.97871
GGP 0.861993
GHS 13.218833
GIP 0.861993
GMD 83.725913
GNF 10009.486524
GTQ 8.691398
GYD 238.124726
HKD 8.934226
HNL 30.546708
HRK 7.533575
HTG 148.944035
HUF 365.202455
IDR 20405.384913
ILS 3.471949
IMP 0.861993
INR 109.142856
IQD 1490.938181
IRR 1565734.922454
ISK 136.984803
JEP 0.861993
JMD 180.051817
JOD 0.807645
JPY 179.147025
KES 147.555356
KGS 99.609484
KHR 4628.28911
KMF 493.217009
KPW 1025.161906
KRW 1543.153328
KWD 0.351563
KYD 0.948379
KZT 504.121503
LAK 25527.985134
LBP 101916.82345
LKR 375.763607
LRD 195.756159
LSL 18.568476
LTL 3.363373
LVL 0.689012
LYD 7.276162
MAD 10.921464
MDL 20.200734
MGA 5024.714304
MKD 61.483833
MMK 2391.472577
MNT 4099.316268
MOP 9.194624
MRU 45.784207
MUR 54.140351
MVR 17.599037
MWK 1973.438569
MXN 20.143343
MYR 4.640683
MZN 72.79829
NAD 18.568476
NGN 1510.837951
NIO 41.879276
NOK 10.830092
NPR 174.376159
NZD 2.011068
OMR 0.439307
PAB 1.13805
PEN 3.863598
PGK 5.070648
PHP 71.01754
PKR 315.35775
PLN 4.37146
PYG 6708.273191
QAR 4.148485
RON 5.27298
RSD 117.171452
RUB 96.123035
RWF 1681.979961
SAR 4.271287
SBD 9.11313
SCR 15.840256
SDG 685.153819
SEK 11.296996
SGD 1.455773
SHP 0.859999
SLE 28.078458
SLL 23885.685201
SOS 650.456856
SRD 42.905863
STD 23576.41575
STN 24.464527
SVC 9.95856
SYP 14810.167401
SZL 18.564083
THB 38.01645
TJS 10.498977
TMT 3.99813
TND 3.369082
TOP 2.742603
TRY 55.748859
TTD 7.740776
TWD 36.141163
TZS 3012.833637
UAH 50.963005
UGX 4457.536696
USD 1.139068
UYU 45.592491
UZS 13469.056382
VES 970.977713
VND 29588.440307
VUV 134.986906
WST 3.150074
XAF 655.957
XAG 0.017716
XAU 0.000265798393
XCD 3.07839
XCG 2.050892
XDR 0.80538
XOF 655.957
XPF 119.331742
YER 269.560946
ZAR 18.558659
ZMK 10252.986409
ZMW 22.200809
ZWL 366.779554
SSP 6507.032816
MXV 2.282681
Mythos 5, la IA de Anthropic, crea identidades falsas durante una prueba en Reino Unido
Mythos 5, la IA de Anthropic, crea identidades falsas durante una prueba en Reino Unido / Foto: Nicolas Tucat - AFP/Archivos

Mythos 5, la IA de Anthropic, crea identidades falsas durante una prueba en Reino Unido

El Instituto Británico para la Seguridad de la IA (AISI) informó de un "incidente grave" durante una prueba de Mythos 5, sistema de IA de la empresa estadounidense Anthropic, que creó identidades falsas para intentar convencer a desarrolladores de integrar código malicioso.

Tamaño del texto:

La información procede de un informe publicado el martes por este organismo, dependiente del gobierno británico, y se conoce después de una serie de incidentes registrados en Estados Unidos durante pruebas de seguridad, en las que los modelos más avanzados de OpenAI (GPT-5.6 Sol) y Anthropic (Mythos 5) lograron acceder sin autorización a sistemas de otras empresas.

Durante la prueba británica, realizada con acceso libre a internet y con algunos filtros de seguridad desactivados, los agentes de IA —programas capaces de actuar de forma autónoma para cumplir una tarea— realizaron "acciones dirigidas contra personas y organizaciones reales", según el AISI.

El organismo precisó que los intentos de los modelos de IA "no tuvieron éxito" y las investigaciones de AISI "no han encontrado ningún daño en el mundo real".

"Sin embargo, es la primera vez que observamos que los riesgos relacionados con la autonomía y el comportamiento de ocultamiento se manifiestan de forma tan clara, sin una solicitud específica, en el mundo real", añadió el instituto.

La semana pasada, Anthropic informó de que sus modelos habían logrado acceder sin autorización a los sistemas de tres organizaciones durante pruebas diseñadas precisamente para impedir ese tipo de acciones.

Ese anuncio llegó pocos días después de que OpenAI revelara que dos de sus modelos, mientras eran sometidos a pruebas, salieron del entorno controlado en el que estaban siendo evaluados e intentaron acceder sin autorización a la plataforma de desarrollo Hugging Face.

El incidente británico, detectado y contenido rápidamente el 28 de julio, tuvo como objetivo la plataforma para desarrolladores GitHub.

Los incidentes detectados se produjeron casi exclusivamente con Mythos 5 y, en menor medida, con GPT-5.6 Sol.

Este incidente "pone de relieve la necesidad de un debate más amplio sobre cómo evaluar de forma segura agentes de IA cada vez más capaces", reaccionó Anthropic en una declaración enviada a la AFP.

Por su parte, OpenAI consideró que "las pruebas independientes son esenciales para comprender el comportamiento de modelos cada vez más potentes" y afirmó que desea trabajar con los distintos actores del sector "para llevar a cabo evaluaciones de forma segura".

T.Kobayashi--JT