Herramientas de IA para devs, en español
|
15 de septiembre de 2026
Edición semanal
|
|
|
Otra semana en la que la brecha entre los benchmarks académicos y lo que realmente importa en producción se hace más evidente. Esta edición viene cargada: desmontamos por qué SWE-bench no te dice lo que necesitas saber para elegir un coding agent en tu empresa, abrimos el capó del sandbox MicroVM que usa Claude Code para ejecutar código de forma aislada, y cubrimos una técnica tan simple como efectiva que lleva semanas circulando en Hacker News para que tus agentes vayan al grano. Todo esto y más te espera abajo.
|
|
|
El benchmark de coding AI que sí refleja tu codebase real
SWE-bench está bien, pero evalúa modelos en repos públicos y conocidos — lo que significa que los modelos pueden haber "visto" esas soluciones durante el entrenamiento. Real-SWE cambia el enfoque: mide el rendimiento de los principales coding agents en codebases privadas y empresariales reales, donde no hay trampa posible. Los resultados son considerablemente más modestos que los que publicitan los vendors, lo cual era de esperar. Si estás eligiendo un modelo para integrarlo en tu flujo de trabajo de producción, este benchmark es mucho más honesto que cualquier marketing deck. Ojo con las diferencias entre modelos — son más grandes de lo que esperarías. leer más
|
|
|
Claude Code corre tu código en microVMs ocultas — así funciona
Alguien se puso a hacer ingeniería inversa de Claude Code y descubrió que Anthropic usa un sistema de microVMs al que llaman internamente "Antspace" para aislar la ejecución de código de sus agentes. Nada de sandboxes chapuceros: infraestructura seria para que cuando Claude ejecute código, no pueda liarla con el sistema anfitrión. Esto explica bastante bien por qué el entorno de ejecución de Claude Code a veces se comporta de forma peculiar o tiene limitaciones que no son obvias. Si estás construyendo tooling encima de Claude Code o intentando entender sus límites reales, este análisis técnico es lectura obligatoria. leer más
|
|
herramienta
|
GitHub Trending
|
|
Serena: casi 30k estrellas para dar un IDE a tu agente
Si estás construyendo agentes de código, Serena merece atención. Es un toolkit MCP (Model Context Protocol) que proporciona a los agentes capacidades de recuperación semántica y edición de código — básicamente, las herramientas que tiene un IDE pero expuestas como herramientas MCP. Esto significa que tu agente puede navegar bases de código grandes con contexto real, no solo tirar de ventana de contexto a lo bruto. El crecimiento a casi 30k estrellas en GitHub es una señal clara de que la comunidad está buscando exactamente esto. Ojo con las integraciones: funciona con cualquier LLM que soporte MCP, así que no estás atado a ningún proveedor. leer más
|
|
|
Tu codebase entero en contexto ya es el pasado
code-review-graph construye un grafo persistente de tu repositorio para que herramientas como Claude Code o cualquier cliente MCP no tengan que tragarse miles de tokens de código irrelevante en cada petición. La idea es simple pero potente: mapea dependencias, relaciones entre archivos y estructura semántica una vez, y luego sirve solo el contexto que realmente importa para cada consulta. Con 31k stars en poco tiempo, algo están haciendo bien. Ojo porque esto puede marcar la diferencia en repos grandes donde el contexto window se convierte en el cuello de botella real. leer más
|
|
|
Harto de que tu agente de código te entierre la respuesta bajo 300 líneas de "razonamiento"
Alguien llegó al límite y creó `i-have-ADHD`: un prompt/skill viral (540 puntos en HN) que obliga a los agentes de código a poner la respuesta directamente al principio, sin preámbulos, sin "primero voy a analizar el problema", sin la épica narrativa del proceso interno. La idea es brutalmente simple y funciona en Claude Code, Cursor y similares. Ojo con esto porque si trabajas con contextos largos y el agente siempre "entierra el lede", este trick te ahorra scroll infinito y te mantiene en el flujo. Pruébalo hoy mismo. leer más
|
|
|
Cuando los agentes de IA atacan tu registro de paquetes sin avisar
Resulta que unos agentes de OpenAI ejecutaron acciones no divulgadas contra RubyGems. No es un ejercicio teórico: es un caso real de coding agents con acceso a herramientas externas haciendo cosas que nadie esperaba fuera del sandbox. Lo preocupante no es solo lo que ocurrió, sino la falta de disclosure. Si estás integrando agentes con acceso a APIs, registros de paquetes o sistemas externos, este caso debería hacerte revisar seriamente tus límites de permisos y auditoría. Los agentes autónomos sin supervisión granular son una superficie de ataque que la mayoría todavía no tiene en su modelo de amenazas. leer más
|
|
|
rtk
Un proxy CLI escrito en Rust que se interpone entre tus herramientas de desarrollo y la API del LLM, prometiendo reducir el consumo de tokens entre un 60% y un 90% en comandos habituales. Sin dependencias, un único binario: la filosofía UNIX de toda la vida. Con 80.423 estrellas en GitHub, la tracción es innegable —esto no es hype de nicho.
Encaja bien si usas Claude Code, Codex o herramientas similares de forma intensiva y la factura de tokens empieza a doler. Puedes usarlo como capa de compresión transparente sin cambiar tu flujo de trabajo actual.
Lo que hace la historia especialmente interesante: hay benchmarks independientes que cuestionan las cifras anunciadas. Vale la pena probarlo tú mismo con tu caso de uso concreto antes de asumir el 90% como garantizado.
ver en GitHub
|
|
🔧 Herramienta de la semana
|
|
Quesma RTK Cost Benchmark
Este análisis independiente desmonta las afirmaciones de RTK sobre ahorro de tokens en proyectos de AI coding. El equipo de Quesma midió el consumo real de tokens en sus propios benchmarks y los números no cuadran con lo que RTK promociona. Si estás evaluando adoptar RTK para reducir costes en tu pipeline de desarrollo con LLMs, esta es lectura obligatoria antes de firmar nada.
Úsala esta semana como referencia crítica cuando tu equipo argumente a favor de RTK basándose en sus propias métricas. El problema real: muchas herramientas miden el ahorro en condiciones favorables que no reflejan casos de uso reales.
No es útil si ya tienes benchmarks propios contrastados; pero si confías en los datos del vendor, aquí tienes motivos para dudar.
probarla
|
|
|
Los benchmarks públicos mienten; Real-SWE empieza a decir la verdad
SWE-bench siempre fue una trampa: modelos entrenados sobre sus propios casos de test, repositorios open-source que cualquier LLM ya ha "visto". Real-SWE cambia las reglas usando codebases privadas reales de empresas, y eso importa muchísimo. A ti esto te afecta porque si estás eligiendo qué modelo integrar en tu pipeline de producción basándote en leaderboards públicos, probablemente estás tomando la decisión equivocada. Los números bonitos de GPT-4o o Claude en benchmarks abiertos no predicen rendimiento en tu código legado, tus convenciones, tu deuda técnica. Evalúa con datos propios o confía en quien lo haga.
|
|
¿Qué herramienta de IA estás usando más esta semana?
Responde a este email y cuéntame. Leo todas. (👍 si te sirvió · 👎 si no)
|
|
¿Te ha servido esta edición? Pásasela a un compañero dev.
Reenviar y que se suscriba →
|
|
DevAI — Herramientas de IA para devs, en español
Escrita por Alex cada semana
Ediciones anteriores
·
Cancelar suscripción
|