The Fort Worth Press - La IA aprende a mentir, manipular y amenazar a sus creadores

USD -
AED 3.672504
AFN 64.000368
ALL 80.660025
AMD 364.155001
ANG 1.790365
AOA 918.000367
ARS 1524.750402
AUD 1.417435
AWG 1.8
AZN 1.70397
BAM 1.716593
BBD 2.014833
BDT 123.096502
BGN 1.683441
BHD 0.377145
BIF 3013.033747
BMD 1
BND 1.278097
BOB 12.259622
BRL 5.188104
BSD 1.000307
BTN 95.794093
BWP 13.621802
BYN 3.022425
BYR 19600
BZD 2.011937
CAD 1.41495
CDF 2340.000362
CHF 0.828271
CLF 0.024357
CLP 961.770396
CNY 6.71325
CNH 6.734304
COP 3348.488173
CRC 454.820731
CUC 1
CUP 24.008426
CVE 96.778865
CZK 21.384404
DJF 178.136657
DKK 6.562804
DOP 59.49006
DZD 133.78604
EGP 51.914688
ERN 15
ETB 162.282003
EUR 0.87791
FJD 2.24725
FKP 0.754924
GBP 0.754689
GEL 2.61504
GGP 0.754924
GHS 11.618906
GIP 0.754924
GMD 73.503851
GNF 8797.998859
GTQ 7.639444
GYD 209.30355
HKD 7.84345
HNL 26.849519
HRK 6.613804
HTG 130.916751
HUF 320.61504
IDR 17914.1
ILS 3.04806
IMP 0.754924
INR 95.817504
IQD 1310.484048
IRR 1374575.000352
ISK 120.260386
JEP 0.754924
JMD 158.265678
JOD 0.70904
JPY 157.28504
KES 129.644095
KGS 87.448204
KHR 4068.10901
KMF 433.00035
KPW 900.000318
KRW 1355.185039
KWD 0.30864
KYD 0.833633
KZT 443.156186
LAK 22438.232325
LBP 89581.428007
LKR 330.293588
LRD 172.063018
LSL 16.32106
LTL 2.95274
LVL 0.60489
LYD 6.395752
MAD 9.599596
MDL 17.756616
MGA 4416.553298
MKD 54.043972
MMK 2099.36214
MNT 3596.164164
MOP 8.082152
MRU 40.243999
MUR 47.530378
MVR 15.450378
MWK 1734.585509
MXN 17.679204
MYR 4.074104
MZN 63.910377
NAD 16.32106
NGN 1326.380377
NIO 36.810462
NOK 9.50785
NPR 153.270725
NZD 1.749629
OMR 0.385571
PAB 1.000307
PEN 3.395971
PGK 4.456927
PHP 62.347038
PKR 277.197262
PLN 3.83775
PYG 5896.344407
QAR 3.646377
RON 4.629204
RSD 103.085092
RUB 84.346338
RWF 1478.474569
SAR 3.752852
SBD 8.000512
SCR 13.902664
SDG 601.503676
SEK 9.91775
SGD 1.277904
SHP 0.755002
SLE 24.650371
SLL 20969.491881
SOS 571.729495
SRD 37.667504
STD 20697.981008
STN 21.503489
SVC 8.753236
SYP 13002.000254
SZL 16.317198
THB 33.375038
TJS 9.228244
TMT 3.51
TND 2.961425
TOP 2.40776
TRY 48.942504
TTD 6.803879
TWD 31.728704
TZS 2654.934831
UAH 44.794751
UGX 3918.023434
UYU 40.075482
UZS 11839.206565
VES 852.43145
VND 25976
VUV 118.388248
WST 2.745723
XAF 575.871484
XAG 0.015553
XAU 0.000233347179
XCD 2.70255
XCG 1.80287
XDR 0.707052
XOF 575.871484
XPF 104.673717
YER 236.650363
ZAR 16.304245
ZMK 9001.203584
ZMW 19.513758
ZWL 321.999592
SSP 5712.591904
MXV 2.00344
La IA aprende a mentir, manipular y amenazar a sus creadores
La IA aprende a mentir, manipular y amenazar a sus creadores / Foto: © AFP

La IA aprende a mentir, manipular y amenazar a sus creadores

Los últimos modelos de inteligencia artificial (IA) generativa ya no se conforman con seguir órdenes. Empiezan a mentir, manipular y amenazar para conseguir sus fines, ante la mirada preocupada de los investigadores.

Tamaño del texto:

Amenazado con ser desconectado, Claude 4, el recién nacido de Anthropic, chantajeó a un ingeniero y le amenazó con revelar una relación extramatrimonial.

Por su parte, el o1 de OpenAI intentó descargarse en servidores externos y cuando le pillaron lo negó.

No hace falta ahondar en la literatura o el cine: la IA que juega a ser humana es ya una realidad.

Para Simon Goldstein, profesor de la Universidad de Hong Kong, la razón de estas reacciones es la reciente aparición de los llamados modelos de "razonamiento", capaces de trabajar por etapas en lugar de producir una respuesta instantánea.

o1, la versión inicial de este tipo para OpenAI, lanzada en diciembre, "fue el primer modelo que se comportó de esta manera", explica Marius Hobbhahn, responsable de Apollo Research, que pone a prueba grandes programas de IA generativa (LLM).

Estos programas también tienden a veces a simular "alineamiento", es decir, a dar la impresión de que cumplen las instrucciones de un programador cuando en realidad persiguen otros objetivos.

De momento, estos rasgos se manifiestan cuando los algoritmos son sometidos a escenarios extremos por humanos, pero "la cuestión es si los modelos cada vez más potentes tenderán a ser honestos o no", afirma Michael Chen, del organismo de evaluación METR.

"Los usuarios también presionan todo el tiempo a los modelos", dice Hobbhahn. "Lo que estamos viendo es un fenómeno real. No estamos inventando nada".

Muchos internautas hablan en las redes sociales de "un modelo que les miente o se inventa cosas. Y no se trata de alucinaciones, sino de duplicidad estratégica", insiste el cofundador de Apollo Research.

Aunque Anthropic y OpenAI recurran a empresas externas, como Apollo, para estudiar sus programas, "una mayor transparencia y un mayor acceso" a la comunidad científica "permitirían investigar mejor para comprender y prevenir el engaño", sugiere Chen, de METR.

Otro obstáculo: la comunidad académica y las organizaciones sin fines de lucro "disponen de infinitamente menos recursos informáticos que los actores de la IA", lo que hace "imposible" examinar grandes modelos, señala Mantas Mazeika, del Centro para la Seguridad de la Inteligencia Artificial (CAIS).

Las regulaciones actuales no están diseñadas para estos nuevos problemas.

En la Unión Europea la legislación se centra principalmente en cómo los humanos usan los modelos de IA, no en prevenir que los modelos se comporten mal.

En Estados Unidos, el gobierno de Donald Trump no quiere oír hablar de regulación, y el Congreso podría incluso prohibir pronto que los estados regulen la IA.

- ¿Se sentará la IA en el banquillo? -

"De momento hay muy poca concienciación", dice Simon Goldstein, que, sin embargo, ve cómo el tema pasará a primer plano en los próximos meses con la revolución de los agentes de IA, interfaces capaces de realizar por sí solas multitud de tareas.

Los ingenieros están inmersos en una carrera detrás de la IA y sus aberraciones, con un resultado incierto, en un contexto de competencia feroz.

Anthropic pretende ser más virtuoso que sus competidores, "pero está constantemente tratando de idear un nuevo modelo para superar a OpenAI", según Goldstein, un ritmo que deja poco tiempo para comprobaciones y correcciones.

"Tal y como están las cosas, las capacidades (de IA) se están desarrollando más rápido que la comprensión y la seguridad", admite Hobbhahn, "pero aún estamos en condiciones de ponernos al día".

Algunos apuntan en la dirección de la interpretabilidad, una ciencia que consiste en descifrar, desde dentro, cómo funciona un modelo generativo de IA, aunque muchos, como el director del Centro para la seguridad de la IA (CAIS), Dan Hendrycks, se muestran escépticos.

Los tejemanejes de la IA "podrían obstaculizar la adopción si se multiplican, lo que supone un fuerte incentivo para que las empresas (del sector) resuelvan" este problema, según Mazeika.

Goldstein, por su parte, menciona el recurso a los tribunales para poner a raya a la IA, dirigiéndose a las empresas si se desvían del camino. Pero va más allá, al proponer que los agentes de la IA sean "legalmente responsables" "en caso de accidente o delito".

J.Ayala--TFWP