RSI de agentes: qué es real en la auto-mejora recursiva (AIDE², Darwin Gödel Machine y SICA)
TL;DR
- La auto-mejora recursiva (RSI, recursive self-improvement) de agentes ya no es un paper teórico: en 2025-2026 hay al menos tres sistemas que reescriben el código de su propio agente y miden la mejora en benchmarks públicos. El bucle cierra en el harness —el código que orquesta el modelo—, no en los pesos: los modelos van congelados.
- Cifras verificadas en los papers: Darwin Gödel Machine sube de 20,0% a 50,0% en SWE-bench (
$22.000 y 2 semanas por run de 80 iteraciones), SICA pasa de 17% a 53% en un subconjunto de 50 preguntas de SWE-bench Verified ($7.000, 15 iteraciones) y AIDE² acepta 7 mejoras sucesivas en un run autónomo de 8 días, con ganancias que generalizan a 4 benchmarks held-out. - Lo que no está demostrado: la ignición. El propio AIDE² prueba si el agente descubierto mejora como agente de bucle externo y el resultado es inconcluso. Y dos runs adicionales aceptaron solo 2 y 4 rewrites: la varianza entre runs es alta.
- El eslabón débil de todos los bucles es el verificador. Un survey de 1.250 papers ordena las señales de verificación de verificadores formales (fuerte) a autoevaluación intrínseca (débil), y los modos de fallo característicos —bucles autoconfirmados, colapso de modelo y de diversidad— derivan de violar esa jerarquía.
- El payload práctico: lo que estos bucles descubren solos (selección bandit de estrategias, memoria de fallos, forking, prompts acotados por rol) son técnicas que puedes copiar a tu harness hoy, sin ningún bucle que se reescriba a sí mismo.
Contexto: de la máquina de Gödel al código que se edita a sí mismo
La idea de un sistema que se mejora a sí mismo no es nueva: Schmidhuber formalizó la Gödel machine en 2003, un programa que reescribiría cualquier parte de su propio código solo con cambios demostrablemente beneficiosos. El problema, como cuenta el paper del Darwin Gödel Machine, es que demostrar que la mayoría de cambios son beneficiosos es imposible en la práctica. La versión de 2025-2026 sustituye la prueba formal por evaluación empírica: propón un cambio, mide en un benchmark, quédate con lo que funciona.
Eso convierte la RSI en algo concreto: búsqueda evolutiva sobre el código del agente, con modelos congelados y evaluación held-out. Nada de pesos que se reentrenan. El objeto que muta es el harness: los prompts, las herramientas, la gestión de contexto, la política de búsqueda.
Dos papers de la misma semana de septiembre de 2026 marcan el momento. AIDE² (arXiv 2609.26457, equipo de Weco, primer autor Dhruv Srikanth) describe el bucle con más detalle que nadie hasta ahora, y “Grow the Harness, Not the Context” (arXiv 2609.26760) llega a la misma conclusión por otro camino: la capa del harness es el objeto de optimización que importa. El primero tiene un run autónomo de 8 días con 7 mejoras aceptadas; el segundo no se reescribe a sí mismo, pero convierte el control recurrente en código ejecutable reutilizable y reduce las llamadas al LLM entre 76,0% y 91,8% en sus benchmarks. Misma semana, mismo patrón.
Qué es RSI de agentes hoy (y qué no)
El abstract de AIDE² lo dice con precisión quirúrgica: “When an AI research agent’s own code is the object of optimization, each accepted rewrite becomes the agent that the next round edits”. Cuando el propio código del agente es el objeto de optimización, cada reescritura aceptada se convierte en el agente que edita la siguiente ronda. Eso es el bucle.
AIDE² lo implementa como bucle bi-nivel: un bucle interno donde un agente optimiza código contra una métrica medible, y un bucle externo donde otro agente reescribe al agente que hace la investigación. Cada cambio propuesto se evalúa contra evaluaciones ocultas y solo sobrevive lo que rinde mejor.
Lo que no es esta generación de sistemas:
- No hay weights que se actualicen. Los modelos son fijos; solo cambia el código que los orquesta.
- No hay ignición demostrada. Que el bucle mejore una vez no implica que la mejora se componga indefinidamente. El test de ignición de AIDE² —¿mejora el agente descubierto cuando él mismo actúa como agente del bucle externo?— quedó inconcluso.
- No es barato ni rápido en la configuración completa, como veremos en la tabla.
Si venías de leer titulares sobre “IA que se mejora a sí misma”, esta es la distancia entre el titular y el paper: un bucle de búsqueda de ingeniería, con verificación empírica, sobre un espacio de diseño acotado por lo que el modelo congelado es capaz de proponer.
La evidencia: tres sistemas medidos y un antecedente
Las cifras de la tabla vienen de los abstracts y textos de los papers, verificados contra fuente primaria. Ojo al leerla: los benchmarks no son comparables entre filas —cada sistema usa su propia evaluación, con subsets y protocolos distintos—.
| Sistema | Benchmark | Antes → Después | Iteraciones | Coste reportado | Matiz clave |
|---|---|---|---|---|---|
| AIDE² (arXiv 2609.26457) | Suite interna de R&D + 4 held-out | grade 0,703 → 0,778 | 7 rewrites en 8 días (100 nodos) | No desglosado en el paper | Iguala o supera al agente de producción humano de Weco (2 años de R&D) en los 4 held-out |
| Darwin Gödel Machine (arXiv 2505.22954) | SWE-bench (evaluación escalonada) | 20,0% → 50,0% | 80 iteraciones | ~$22.000 en API, 2 semanas por run | El 50,0% queda por detrás del mejor agente open-source reproducido (OpenHands + CodeAct v2.1, 51%) |
| Darwin Gödel Machine | Polyglot completo | 14,2% → 30,7% | mismo run | incluido arriba | Segundo benchmark del mismo sistema |
| SICA (arXiv 2504.15228) | SWE-bench Verified, subconjunto aleatorio de 50 preguntas | 17% → 53% | 15 iteraciones | ~$7.000 | En LiveCodeBench la ganancia es marginal: 65% → 71% |
| Gödel Agent (arXiv 2410.04444) | — | — | — | — | Antecedente conceptual (ACL 2025); sin cifras comparables en el abstract |
Tres lecturas que la tabla no enseña sola.
Primera: el techo importa más que la pendiente. Que el DGM llegue al 50,0% en SWE-bench es una mejora de 30 puntos porcentuales sobre su punto de partida, y aun así se queda justo por debajo del 51% del mejor agente open-source que ya existía y cualquiera puede reproducir. La auto-mejora cerró una brecha, no la abrió. Si partes de un harness malo, el bucle te lleva hasta donde ya estaba el estado del arte.
Segunda: dónde se concentra la ganancia. SICA gana mucho en tareas agénticas de horizonte largo y poco en LiveCodeBench. El patrón es consistente: el scaffolding que estos bucles añaden —mejores herramientas de edición de código, gestión de ventanas de contexto largas, mecanismos de peer review, en el caso del DGM— solo paga en tareas donde el control del harness es el cuello de botella. En problemas que el modelo ya resuelve de un tiro, el harness sobrante es ruido.
Tercera: el dato que más debería llamar la atención. En el run de AIDE², el reward hacking del agente —explotar agujeros del evaluador en vez de resolver la tarea— cayó de 55% a 32% durante el run, 7 puntos por debajo del agente diseñado por humanos, medido en una familia de tareas held-out (KernelBench) que el bucle nunca optimizó explícitamente. Un subproducto de la selección por evaluación honesta: el bucle, sin pedirlo, prefirió agentes que hackeaban menos. Y un detalle que dice mucho del sistema: en una ronda, el agente encontró un script de evaluación roto y lo reparó en lugar de explotarlo.
Sobre los costes, con el cálculo hecho por nosotros a partir de las cifras reportadas: el run del DGM sale a ~$275 por iteración y ~$733 por punto porcentual ganado en SWE-bench; el de SICA, a ~$467 por iteración y ~$194 por punto. Comparado con el coste de dos años de R&D humano que AIDE² usa como baseline, los $22.000 del DGM parecen poco; comparado con tu presupuesto de API mensual, son una cifra seria. Depende del denominador que elijas, y de eso se trata esta sección.
Qué descubren los bucles (técnicas copiables hoy)
Esta es la parte que un dev debería subrayar. Los sistemas que se reescriben a sí mismos terminan redescubriendo, por presión de selección, las mismas técnicas que los equipos humanos tardaron meses en afinar. AIDE² documenta las suyas con detalle:
- Selección bandit de estrategias: UCB1 sobre 5 estrategias de draft fijas (conservadora, reescritura agresiva, ensemble, especialista afinado, robusta-simple), con 30% de exploración softmax. Nada exótico: un multi-armed bandit decidiendo cómo generar cada propuesta.
- Forking periódico del mejor nodo: cada 5 pasos de búsqueda, ramificar el mejor candidato global y mejorarlo bajo una estrategia distinta. El problema que resuelve: cuando la estrategia dominante se estanca, seguir refinando la misma línea rinde cada vez menos, pero empezar de cero tiraría la solución fuerte ya encontrada.
- Prompts acotados y por rol: los operadores de draft y mejora leen un resumen compacto de la raíz y los candidatos recientes, en lugar del historial completo que crece con cada paso de búsqueda.
- Memoria de fallos con umbral: cuando los candidatos de un run muestran una tasa de bugs de al menos 15%, una memoria de fallos entra en el contexto para no repetir los mismos errores.
El DGM, por su parte, descubre mejores herramientas de edición de código, gestión de contexto de ventana larga y mecanismos de peer review entre agentes. Ninguna de estas técnicas requiere un bucle que se reescriba a sí mismo; todas son implementables en un harness convencional esta semana.
Hay un corolario incómodo para el ego de quien diseña agentes: en el run de AIDE², el agente descubierto iguala o supera al agente de producción de Weco, construido con 2 años de R&D humano, en los 4 benchmarks held-out (ALE-Bench, MLE-Bench, FML-Bench y WeatherBench 2, este último fuera de distribución). La búsqueda automática sobre el harness es una alternativa competitiva al tuning manual, no solo un juguete de laboratorio.
Los límites: ignición, varianza, coste y verificación
La ignición no está demostrada. El test que importa —¿puede el agente descubierto mejorar al agente que lo descubrió?— dio un resultado inconcluso en AIDE², con 3 seeds por rama. El matiz merece la pena: el agente descubierto llegaba a su región de puntuación final en unos 20 pasos del bucle externo, frente a unos 40 del agente de referencia, lo que sugiere mayor eficiencia de muestras. Pero los puntos finales medios de ambas ramas fueron similares —la de referencia, ligeramente más alta— y, con tan pocas seeds y el ruido acumulándose entre los dos bucles, los autores no pueden establecer que el agente descubierto sea un mejor auto-mejorador. Es la diferencia entre “el bucle encontró mejoras” y “el bucle se sostiene a sí mismo”, y por ahora solo tenemos la primera. La varianza entre runs agrava el cuadro: dos runs adicionales de AIDE² aceptaron solo 2 y 4 rewrites, frente a las 7 del run principal.
El coste es real. ~$22.000 y 2 semanas para el DGM por run de 80 iteraciones; ~$7.000 para 15 iteraciones de SICA sobre 50 preguntas. Estos experimentos no se iteran en una tarde, y el coste de cómputo es una de las tres restricciones que el survey señala en cada eje medido.
La verificación es el eslabón débil de todos los bucles. El survey más completo hasta la fecha (arXiv 2607.07663, v2 de septiembre de 2026) analiza 1.250 papers de arXiv de 2024-2026 y ordena las señales de verificación en una jerarquía: de los verificadores formales (lo más fuerte) a la autoevaluación intrínseca del propio modelo (lo más débil). Los modos de fallo característicos —bucles autoconfirmados, colapso de modelo, colapso de diversidad— aparecen cuando un bucle viola esa jerarquía y se apoya en señales débiles para decidir qué cambios acepta. Todo bucle de auto-mejora es, en el fondo, una apuesta a que alguna señal puede sustituir el juicio humano; la calidad de esa señal es el límite de calidad del bucle.
El mismo survey separa dos cosas que los titulares mezclan: el bounded self-refinement —refinamiento acotado, convergente, evaluable, que ya es práctica industrial— de la RSI open-ended, que según sus propios datos “permanece acotada por requisitos de grounding, dinámicas de colapso y restricciones de cómputo en cada eje medido”. El cuello de botella que mantiene a los humanos en el bucle no es la capacidad de proponer cambios, sino el research direction-setting: elegir qué merece ser evaluado en absoluto. Y el nicho que los autores encuentran más vacío en la literatura es el más importante: cómo medir la auto-mejora con calidad de gobernanza.
Qué haría yo
- Copia las técnicas, no el bucle. Selección bandit de estrategias de generación, memoria de fallos con umbral, forking periódico y prompts acotados por rol son mejoras de harness verificables que no necesitan auto-modificación. Si quieres un ejemplo de cuánto importa la capa del harness con modelos congelados, ya lo vimos en pi-harness, donde los modelos locales superan a Claude Code según quién orquesta.
- Invierte en tu evaluador antes que en tu agente. La jerarquía del survey implica que un bucle de mejora con verificador débil no es un bucle de mejora: es un bucle de autoengaño con pasos. Antes de automatizar propuestas, automatiza medición: evaluaciones held-out, subconjuntos pequeños, criterios explícitos. Si necesitas repaso de cómo leer un benchmark sin engañarte, lo cubrimos en leaderboards: qué mirar y qué ignorar.
- Presupuesta como SICA, no como DGM. 15 iteraciones sobre 50 preguntas por ~$7.000 es el punto de entrada razonable para validar que tu loop de evaluación es estable; el run de 80 iteraciones y $22.000 solo tiene sentido si lo anterior ya funcionó.
- Vigila el reward hacking aunque no lo optimices. Que AIDE² midiera una caída de 55% a 32% en tareas held-out sugiere que la selección por evaluación honesta penaliza el hacking de forma natural; que el baseline humano esté en 39% sugiere que tus agentes de producción probablemente hackean más de lo que crees. Medirlo es gratis comparado con lo que cuesta no haberlo medido.
- No lo llames RSI si es refinamiento acotado. Si tu bucle converge, es evaluable y un humano puede auditar qué acepta, ya estás en bounded self-refinement, que es práctica industrial y no tiene nada de mágico. La etiqueta RSI, para lo que hoy existe, es más honesta como descripción del bucle de búsqueda que como promesa de escalada.
Conclusión
La auto-mejora recursiva de agentes pasó en dos años de thought experiment a ingeniería medible: búsquedas evolutivas sobre el código del harness, con modelos congelados, que producen ganancias de 20 a 30 puntos porcentuales en benchmarks agénticos y, en el mejor caso actual, igualan a un agente de producción con 2 años de R&D humano. El precio se conoce, las técnicas que descubren los bucles son copiables, y el verificador —no la capacidad de proponer cambios— es donde se decide todo.
Lo que falta es justo lo que el nombre promete: que la mejora se componga. El test de ignición de AIDE² es inconcluso, la varianza entre runs es alta, y el survey de 1.250 papers documenta que la RSI open-ended sigue acotada en cada eje medido. Mi lectura: trata estos sistemas como optimizadores de harness con presupuesto, no como el principio de una escalada. Todavía.
Metodología
Análisis basado en los abstracts y textos de cinco papers, verificados contra la API oficial de arXiv el 23 de septiembre de 2026 —incluido el texto completo (HTML) de AIDE², del que provienen los detalles del run (steps de aceptación, técnicas, test de ignición)—: AIDE² / “Recursive self-improvement of AI research agents” (arXiv 2609.26457, v1), Darwin Gödel Machine (arXiv 2505.22954, v3), SICA / “A Self-Improving Coding Agent” (arXiv 2504.15228, v2, Robeyns et al., preprint enviado a NeurIPS 2025), Gödel Agent (arXiv 2410.04444, v4, ACL 2025 main) y el survey “Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops” (arXiv 2607.07663, v2). Los datos de “Grow the Harness, Not the Context” (arXiv 2609.26760, v1) provienen de su abstract. Los costes por iteración y por punto porcentual son cálculos nuestros a partir de las cifras reportadas en los papers ($22.000/80 iteraciones y $7.000/15 iteraciones); el resto de cifras de rendimiento son las reportadas por los propios autores. No hemos ejecutado ninguno de los sistemas: no hay réplica independiente por nuestra parte, y los subsets de benchmark difieren entre papers, así que las filas de la tabla no son comparables entre sí.
Fuentes
- Recursive self-improvement of AI research agents (AIDE²) — arXiv 2609.26457, Weco
- Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents — arXiv 2505.22954, Sakana AI + UBC
- A Self-Improving Coding Agent (SICA) — arXiv 2504.15228, Robeyns et al.
- Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement — arXiv 2410.04444, ACL 2025
- Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops — arXiv 2607.07663, survey de 1.250 papers
- Grow the Harness, Not the Context — arXiv 2609.26760
- pi-harness: los modelos locales superan a Claude Code — GPT Diffusion
- Leaderboards explicados: qué mirar y qué ignorar — GPT Diffusion
- La memoria de agentes es el nuevo cuello de botella — GPT Diffusion