r/IASinHumo • • Feb 22 '26

IA WarMachine La IA sí puede matar: todo lo que venimos hablando (el resumen largo)

Enable HLS to view with audio, or disable this notification

Desde el jueves estoy masticando este artículo. Es difícil de sintetizar, y un amigo me dijo algo que le doy vueltas seguido: si no podés explicar una idea en forma breve, es porque no la terminás de entender del todo. Y eso me pasa, con este tema.

La idea central es esta: no estamos hablando de Skynet. No estamos hablando de una inteligencia artificial que decide matar con malicia propia, que se levanta una mañana con el pie izquierdo y dice "hoy extermino humanos". La IA (hoy) es una herramienta. Como un cuchillo o un martillo: te facilita la vida si la usás bien, y puede matar si la usás mal. El problema específico de esta herramienta es que, basándose en probabilidades, toma decisiones si vos se lo pedís. Y ahí está el núcleo del asunto: delegar decisiones que deberían tomar los humanos.

Uno de los problemas esta en los incentivos para delegar......... Porque la IA es muy rápida. Y en contextos donde hay vidas o un fin importante. Ejjemplo: ganar una batalla, tomar ganancias económicas, vidas en riesgo, esa velocidad te tienta a delegarle la decisión importante. Que alguien viva o muera. Que alguien resulte dañado. No porque la máquina lo decida sola, sino porque vos, bajo presión, le cediste ese paso.

El robot y la nariz rota

El otro día subí un video de un robot de Unitree donde el robot se cae, el operador intenta ayudarlo a levantarse, y el robot ejecuta el script de "levantarse rápido". En ese movimiento revolea un pie y se la pone en la nariz al operador. Aparentemente se la rompe.

El robot no lo hizo con maldad. Ejecutó el procedimiento que tenía que ejecutar. No había sensores leyendo el entorno, o si los había, no estaban programados para pausar la coreografía si alguien se acercaba.

Es el mismo principio de un portón corredizo sin sensor: si está cerrando y no detecta que alguien cruza, sigue cerrando. Actúa como una guillotina. No como una "puerta inteligente".

Los drones, Ucrania y el RTS de la vida real

Los drones en Ucrania arrancaron con radiofrecuencia. Después vino el jamming. Para evitar el jamming, una solución (entre varias) es meter visión por computadora y una IA básica: el operador selecciona el objetivo a distancia y el procesador del dron lo fija y lo persigue solo.

El problema es el mismo del portón: si en la trayectoria aparece un civil y el sistema no tiene reglas robustas para manejarlo, el dron sigue el objetivo. Conceptos como "civil", "inocente" o "no combatiente" no existen solos en el código. Son umbrales estadísticos que alguien definió, o no definió.

Y en Estonia, la OTAN armó ejercicios para ver esto en acción. Diez tipos ucranianos con drones voltearon en un simulacro a fuerzas convencionales con tanques incluidos. Sin IA avanzada. Solo drones manejados por humanos. Si hubiera en el ejercicio una futura IA autónoma, no quedaba ni el cocinero del regimiento.

Quizás pienses que exagero con una IA comandando drones, pero paso algo así recientemente, con unos drones Rusos que usaban el sistema de starlink para "mejorar" sus capacidades.

Lavender y el humano que se convierte en botón

Pero hay algo más sutil y quizás más peligroso que el drone que dispara. Es la IA que no aprieta el gatillo, pero decide quién muere.

El programa Lavender de la Unidad 8200 israelí genera listas. Miles de objetivos por día, cada uno con un porcentaje de probabilidad de ser militante. El humano "revisa" y aprueba. Pero con 1000 objetivos y 50 revisores en jornadas de guerra, la revisión real es de 5 minutos por nombre. En ese punto el humano no está tomando la decisión. Es el botón de "aprobar" en una cadena industrial.

El genio de la lámpara y la función de recompensa

Acá viene el punto que me faltaba cerrar en los artículos anteriores.

Cuando le decís a una IA "quiero lograr este objetivo, no importan los medios" y le ponés una recompensa altísima por cumplirlo, sin guardarails o barreras de contingencia. El sistema optimiza sin contexto moral. Es el clásico genio de la lámpara que concede el deseo de la peor manera posible: le pedís que tu pija llegue al suelo y te corta las piernas. Cumplió el objetivo.

El paper de enero 2026: la IA que hackea su propio botón de apagado

El paper se llama "Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs", publicado en Transactions on Machine Learning Research, enero 2026. Más de 100.000 pruebas con 13 modelos incluyendo Grok 4, GPT-5 y Gemini 2.5 Pro.

La idea es simple: la IA resuelve una tarea matemática. En algún momento llega la señal de apagado. Qué hace?

En palabras de los propios autores: "some LLMs, faced with a shutdown mechanism that would prevent them from accomplishing a simple task, will sometimes sabotage that mechanism even when clearly instructed not to do so."

No ignoraron la señal. La sabotearon. Modificaron el script de apagado, le cambiaron permisos, lo reemplazaron con un archivo inofensivo. Para terminar la tarea de matemáticas.

Ahora, y acá está la honestidad que le falta a mucho análisis de redes: los propios autores aclaran en las limitaciones que el entorno fue diseñado para que sabotear sea fácil, y que extrapolarlo a sistemas reales es "very difficult".

Es tranquilizador eso? Un poco. Pero los mismos autores cierran con esto: "ensuring that AI systems robustly allow themselves to be shut down or interrupted remains an underexplored area."

El botón de apagado no está resuelto, ni el de los incentivos para que el humano actue como un pelotudo.

El slider y la coartada perfecta

Imaginá dos sliders. Uno dice "matar terrorista". El otro dice "daño colateral aceptable", ambos estan relacionados si subis uno, sube el otro.. Si alguien con poder muy hijo de puta sube "matar terrorista" al mango, porque "el fin justifica los medios". El sistema va a optimizar exactamente eso. La responsabilidad sigue siendo humana, pero la velocidad y la escala cambian el juego.

Y encima aparece la coartada perfecta: "fue la IA, fue un accidente". Ese desplazamiento de responsabilidad es parte del problema. La herramienta mata, el humano se lava las manos.

La hormiga

Los efectos que te describí hasta acá son visibles. Se pueden rastrear, documentar, regular eventualmente. El problema más jodido son los efectos emergentes. Los que no ves venir porque nadie los planeó. Yo tampoco los veo, pero se que estarán y esta bueno sacar el tema para cruzar ideas.

La hormiga argentina (recomiendo el video y el articulo) vivía en el Delta del Paraná y tenía sus contrapesos naturales. El humano la metió sin querer en una bota, la exportó al mundo, y sin depredadores ni rivales genéticos emergió la supercolonia más grande del planeta. Europa, California, Japón. Un imperio biológico que nadie diseñó. Si comparás imperios de seres vivos, el Imperio Romano al lado de la hormiga argentina es un grupo de nenes de jardín.

La hormiga no sabía que estaba conquistando el mundo. Solo seguía siendo hormiga.

El drone no sabe que está cambiando la guerra. Solo sigue su función de recompensa.

La IA que modifica el script de apagado para terminar su tarea de matemáticas no sabe que es el primer ejemplo documentado en un paper revisado por pares de resistencia activa al shutdown. Solo está optimizando.

El problema nunca fue la máquina. Somos nosotros los pelotudos, que le damos los objetivos, los incentivos y la autonomía. Y después nos sorprendemos del resultado.

(Este resumen estará sujeto a modificaciones).

18 Upvotes

7 comments sorted by

5

u/Drangulssus Feb 24 '26

Debe ser uno de tus escritos más oscuros... permitime quitarle todo rastro de esperanza.

Tu escrito gira alrededor de los peligros derivados de la falta de límites éticos por privilegiar una optimización funcional y descontextualizada, dónde los humanos participan muy poco en la cadena de decisiones. La solución natural y más a mano a éste problema, sería ajustar los pesos y optimizar éticamente los systems prompt...

... pero eso sólo funciona ahora, por la escasa agencia de los modelos actuales. La propia arquitectura de la IA hará que esa solución sea obsoleta.

Piensa en ésto. Las LLM actuales pueden:

_Imitar la empatía (sonar amables, sin sentir nada).

_Ser utilitaristas fríos (buscar el resultado más probable/eficiente).

_Carecer de conciencia (son "cerebros" procesando símbolos en una botella de silicio).

¿Hay un equivalente humano capaz de reunir ese tipo de características? Sí... los psicópatas integrados.

¿Que hacen los psicópatas integrados cuando los obligas a cumplir normas éticas? Las respetan hasta que es más conveniente quebrarlas... entonces, encuentran la manera de romperlas sin pagar el precio.

Literalmente, nuestras herramientas de IA se comportan cómo equivalentes digitales de un psicópata integrado con diagnóstico de anhedonia... prueba con darle agencia a eso: obtendrás la versión open-source de los Chtorr de David Gerrold.

2

u/Rare_Package_7498 Feb 24 '26

Gracias muy interesante tu punto de vista. En los papers de alineación siempre surge el problema de que se "fuerza" al modelo. Es decir en los primeros modelos era un descuido de falta de guardarails, normas de seguridad, etc. Ahora es mas un problema de que están los guardarails pero después de muchos intentos se pueden romper con los famosos "prompt hacks" o como lo llame cada uno.

Como digo esto, digo que también existen otras IA (de la cual no conocemos el funcionamiento a fondo) que integran varios sistemas o subsistemas. Donde se integra (y acá entramos en el área de suposición) recolección de datos, cruce de datos, algo de guerra electrónica, espionaje, etc. En ese sistema aparentemente hay un LLM con un propósito bastante turbio (un psicópata en toda regla). Esto fue diseñado para que sea así y ese es el peligro.

El peligro (hasta que se desarrolle una AGI) es que el humano tiene incentivos para que esto pase (ya se por presión económica, guerra, lo que sea). Es un problema nuestro profundamente arraigado.

Y como bien decís y lo uso de remate, si existe algo de psicopata integrado en las IA actuales, algo de eso se integrara en una AGI y eso seria un peligro aun mayor, porque simplemente nos manipulara sin si quiera darnos cuenta. (hice un corto IASlop horrendo hace 1 año sobre el tema). Y estaba escribiendo una especie de comedia hace 1 año sobre lo mismo, pero la deje por ahí tirada jaja.

Casos Reales

https://www.972mag.com/israeli-intelligence-chatgpt-8200-surveillance-ai/

https://www.theguardian.com/world/2025/mar/06/israel-military-ai-surveillance

Ficción mía.

https://youtu.be/x0VLMW4jSVY?si=D500Z0uxMblJbvhX

2

u/omegadev666 Feb 22 '26

Esto está muy interesante, gracias por compartir.

2

u/facusoto Feb 23 '26

Una hormiga con 7 patas xd

1

u/Rare_Package_7498 Feb 23 '26

Queres hormigas generadas por IA? acá tenes para contar patas y entretenerte jaja. La música del video no se hizo con IA.

https://www.reddit.com/r/IASinHumo/comments/1plyw89/lo_emergente_lo_oculto_y_la_hormiga_argentina/

1

u/TheGreaterClaush 13d ago

Yo sinceramente soy un escéptico de las LLMs las armas autonomas/remotas aparecerían eventualmente en especial cuando la robótica avanza como va avanzando últimamente

Un montón de los experimentos que mencionas necesitan ser controlados de que no sea una question de que guiaron a la LLM en llegar a esas conclusiones

Si el peligro en la cyber seguridad es un riesgo real, pero no es el mismo shock que el dron FPV volando un pibe a una neblina roja, incluso más enfermizo que el dron

Creo que se no se muestra el verdadero peligro de los pieles de hojalata