AgentDiet: cómo reducir un 60% los tokens de tus coding agents sin perder calidad
[!IMPORTANT] Actualización (24 ago 2026). Revisitado cuatro meses después. El paper es ya camera-ready en los proceedings del FSE 2026 (DOI ACM) y sigue sin estar integrado en ninguna herramienta — pero la gestión nativa de contexto sí ha llegado a producción: auto-compact en Claude Code, compaction activada por defecto en OpenClaw, context editing en la API de Anthropic. Añadida la sección “Qué ha cambiado desde abril”, actualizados los modelos de referencia a los actuales y corregidos un par de gazapos del texto original.
TL;DR
- Los coding agents (Cursor, OpenClaw, Claude Code) acumulan contexto basura en cada iteración: errores corregidos, imports innecesarios, fragmentos descartados
- AgentDiet elimina automáticamente esas trayectorias redundantes antes de cada llamada al LLM
- Resultados: reducción de input tokens del 39.9-59.7% y del coste computacional total del 21.1-35.9%, sin pérdida de rendimiento
- Es un enfoque complementario a la compresión de prompts: actúa sobre lo que el agente ya hizo, no sobre lo que le pides
- Actualizado (ago 2026): compaction y context editing ya son nativos en Claude Code y OpenClaw, pero nadie integra aún la reducción por análisis de dependencias que propone el paper
Contexto
Si usas coding agents en tu día a día, ya sabes que la factura de API puede doler. Un agente que resuelve un bug en 8 iteraciones está enviando no solo tu prompt original, sino todo el contexto acumulado: los errores que corrigió, los imports que añadió y luego quitó, los fragmentos de código que probó y descartó. Eso se suma rápido.
El paper “Reducing Cost of LLM Agents with Trajectory Reduction” (aceptado en FSE 2026) cuantifica este problema y propone una solución elegante. La pregunta clave: ¿cuánto de ese contexto acumulado es realmente necesario para que el agente siga funcionando bien?
Spoiler: bastante menos de lo que piensas.
El problema: trayectorias infladas
Cuando un coding agent ejecuta una tarea, genera una secuencia de pasos (trayectoria). Cada paso incluye:
- El estado del código antes de la acción
- La acción tomada (editar fichero, ejecutar test, etc.)
- El resultado/feedback
El problema es que estas trayectorias contienen mucho “ruido”:
- Errores que ya se corrigieron en pasos posteriores
- Código que se añadió y luego se eliminó
- Información de debugging que ya no es relevante
- Output de tests fallidos que luego pasaron
Los autores encontraron que entre el 40% y el 60% de los tokens de input en cada llamada eran este tipo de información redundante. Y no estamos hablando de modelos baratos: cuando usas Claude Opus 5 o GPT-5.6 como backend, cada token cuenta.
Cómo funciona AgentDiet
El enfoque es sorprendentemente simple en su concepto:
- Análisis de dependencia: Después de cada paso del agente, AgentDiet analiza qué partes de la trayectoria anterior son necesarias para los pasos futuros
- Reducción de trayectoria: Elimina los pasos que no aportan información útil para la decisión actual
- Preservación de contexto crítico: Mantiene los pasos que contienen decisiones irreversibles, errores que afectan al contexto actual, o resultados de tests relevantes
La implementación se hace como un wrapper alrededor del agente, interceptando las llamadas al LLM y reduciendo el contexto antes de enviarlo. No requiere cambios en el modelo ni en el propio agente.
Los números
Los autores evaluaron AgentDiet en dos LLMs (uno open-source y uno comercial) y dos benchmarks de coding (SWE-Bench y HumanEval). Estos son los resultados:
| Métrica | Reducción |
|---|---|
| Input tokens | 39.9% - 59.7% |
| Coste computacional total | 21.1% - 35.9% |
| Tasa de éxito (resolución de tareas) | Sin cambio estadísticamente significativo |
La reducción de coste total es menor que la de tokens porque el agente sigue generando el mismo output (los tokens de output no cambian). Pero en términos de input tokens — que es lo que pagas cuando usas modelos frontier — la diferencia es brutal.
Para ponerlo en contexto: si tu coding agent cuesta $50/día en API calls, AgentDiet podría reducirlo a $20-30/día. A escala de un equipo de 10 developers, eso son $600-900/mes de ahorro.
Qué ha cambiado desde abril
Cuando cerré el artículo, la sección práctica decía “AgentDiet aún no está integrado en estas herramientas”. Revisado en agosto de 2026, el estado es a la vez decepcionante y esperanzador.
El paper se ha consolidado; la integración, no. La v2 de marzo de 2026 es el camera-ready publicado en los proceedings del FSE 2026 (DOI 10.1145/3797084) y el artefacto sigue disponible en Figshare. Sigue sin haber port de AgentDiet para Cursor, Claude Code u OpenClaw: no he encontrado integración nativa ni fork mantenido (búsqueda verificada en agosto — solo salen el paper, alphaXiv y el artefacto).
Pero la categoría ha llegado a producto. “No pagues por contexto muerto” dejó de ser una idea de paper en estos cuatro meses:
| Herramienta | Qué tiene hoy (ago 2026) | Mecanismo |
|---|---|---|
| Claude Code / API de Anthropic | Context editing (beta) + auto-compact, compaction en la API | Limpia tool calls/results stale al acercarse al límite y resume la conversación |
| OpenClaw | Auto-compaction activada por defecto + session pruning | Resume el historial antiguo; el pruning recorta el output de tools sin resumir |
| Cursor 3.7 (junio) | Context usage report en canvas | Diagnóstico: desglose interactivo de dónde van tus tokens (system prompt, tools, rules) |
La diferencia de mecanismo importa. Compaction y context editing son resumen: comprimen lo viejo cuando el límite aprieta, perdiendo detalle por diseño. AgentDiet es eliminación selectiva: análisis de dependencias que identifica qué pasos de la trayectoria son redundantes y los quita antes de cada llamada, conservando decisiones irreversibles y errores que siguen siendo relevantes. El paper sigue siendo la única cuantificación seria de cuánta trayectoria es ruido (40-60%) y la demostración de que se puede eliminar sin tocar el rendimiento.
Para el panorama completo de herramientas de ese periodo: qué cambió en las herramientas de coding AI a finales de julio.
¿Qué significa para ti?
Si usas coding agents (Cursor, Claude Code, OpenClaw)
Lo de abril seguía siendo cierto en agosto: AgentDiet no está integrado en ninguna de las tres. Lo que ha cambiado es que todas gestionan ya su propio contexto — Claude Code auto-compacta al acercarse al límite de ventana, OpenClaw trae la compaction activada por defecto, y Cursor al menos te enseña el desglose de dónde van los tokens. La mitigación manual sigue valiendo, ahora con mandos nativos:
- Reinicia la conversación cuando cambies de tarea (
/newen OpenClaw arranca sesión limpia sin compactar) - No dejes que el agente acumule contexto de bugs ya resueltos
- En OpenClaw, guía el resumen con
/compact Focus on <tema>y valora el session pruning si lo que te infla la factura es el output de tools
Si construyes agentes propios
El paper es directamente aplicable. El approach de reducción de trayectoria es relativamente sencillo de implementar como middleware. Los autores publicaron el artefacto en Figshare con el código.
Si estás diseñando la arquitectura de tu sistema multi-agente, el patrón de orquestación que elijas (router, pipeline o blackboard) determina cuánto state compartido acumula — y por tanto, cuánto puede optimizar AgentDiet.
Complementa, no reemplaza
AgentDiet no compite con técnicas como Pith (compresión de prompts) o el routing entre modelos. Son capas diferentes:
- Routing: elige el modelo adecuado para cada tarea
- Compresión de prompts: reduce lo que le pides
- AgentDiet: reduce lo que el agente ya hizo pero ya no necesitas
Combinadas, las tres pueden reducir costes un 70-80% (estimación optimista mía; el paper solo respalda su propia capa).
Metodología del paper
Para los que quieran profundizar:
- Benchmarks: SWE-Bench Verified y HumanEval
- Modelos: dos LLMs (uno open-source, uno comercial — los autores no revelan cuáles exactamente)
- Agente base: SWE-Agent, modificado con AgentDiet como wrapper
- Métricas: input tokens, coste computacional (FLOPs), tasa de resolución de tareas
- Paper: arxiv.org/abs/2509.23586 (v2, marzo 2026 — camera-ready del FSE 2026, DOI 10.1145/3797084)
- Aceptado en: FSE 2026 (ACM International Conference on the Foundations of Software Engineering)
Conclusión
AgentDiet es uno de esos papers que te hace decir “¿cómo no se nos ocurrió antes?”. El problema es obvio una vez que lo ves: los coding agents acumulan basura contextual como un trastero virtual. La solución es igual de obvia: limpia lo que no necesitas antes de cada llamada.
El ahorro del 40-60% en input tokens sin perder rendimiento es un resultado sólido. Si estás pagando por agents que iteran múltiples veces sobre código, esto debería interesarte. Y si estás construyendo agentes, deberías estar pensando en implementar algo similar.
El código está disponible. Los números son replicables. No hay excusa para seguir pagando por tokens basura.
Cuatro meses después, la industria ha adoptado la versión fácil del argumento — resumir lo viejo — y ha dejado fuera la parte interesante: eliminar solo lo analíticamente inútil. Cuando un harness integre análisis de dependencias real, el techo ya está medido: 40-60% de los input tokens.
Fuentes: AgentDiet paper (arXiv:2509.23586, v2), DOI ACM 10.1145/3797084, FSE 2026 acceptance, Artifact en Figshare, Anthropic: context editing (beta), Anthropic: compaction, OpenClaw: compaction, Cursor 3.7: context usage report. Verificación de agosto: búsqueda de integración de AgentDiet en Cursor/Claude Code/OpenClaw sin resultados.