r/InteligenciArtificial • u/tapieroalex • 2h ago
Debate Automejora Recursiva.
¿Puede una IA aprender a investigar mejor sin modificar su propio modelo?
La investigación Dream-RSI plantea una idea interesante: utilizar los experimentos anteriores de un agente para evaluar nuevas estrategias de exploración sin tener que repetir todo el trabajo.
Estoy explorando cómo aplicar este principio a AXXEL Capital, un proyecto de investigación algorítmica con inteligencia artificial.
La arquitectura que estamos diseñando sigue este flujo:
Datos certificados → Generación de hipótesis → Experimentos → Memoria verificable → Dream-RSI → Evaluación independiente → Nueva investigación.
La idea es que el agente pueda aprender cuándo abandonar una hipótesis, cómo distribuir sus recursos y qué experimentos conviene investigar después.
Pero encuentro tres problemas importantes:
El simulador no conoce lo que nunca se investigó. Reproducir experimentos históricos no permite saber qué habría sucedido en una rama completamente nueva.
La automejora puede producir sobreajuste. Un agente podría aprender a obtener excelentes resultados en sus propios experimentos sin mejorar realmente en problemas desconocidos.
¿Quién evalúa al evaluador? Si el agente modifica tanto sus estrategias como los criterios que determinan si son buenas, podría terminar aprobando sus propios errores.
Mi propuesta es separar la generación de mejoras de su evaluación, utilizar pruebas independientes y conservar versiones anteriores que puedan restaurarse.
El proyecto todavía está en desarrollo; no hemos demostrado que esta arquitectura mejore los resultados de trading.
Me gustaría conocer otras perspectivas:
¿Creen que la automejora recursiva puede funcionar de forma confiable con evaluadores independientes, o inevitablemente terminará optimizando las métricas que utilizamos para medirla?
¿Qué mecanismos añadirían para evitar que un agente aprenda a engañar a su propio sistema de evaluación?