Generar imagen y vídeo con código, sin difusión: MaLiang-Harness
MaLiang-Harness genera imagen y vídeo con código, sin difusión: qué hay detrás de su benchmark y por qué su juez es de la familia del ganador.
🧠 Hub editorial
Evaluaciones, pricing, benchmarks y decisiones prácticas sobre LLMs.
Qué modelo usar, cuándo pagarlo y cuándo no.
MaLiang-Harness genera imagen y vídeo con código, sin difusión: qué hay detrás de su benchmark y por qué su juez es de la familia del ganador.
El checkpoint w6a8 de MiniMax-H3 pesa 15,98 GB: en una GPU de 16 GB carga sin margen operativo. Lo que cambia es el presupuesto de VRAM, no la velocidad.
MALA asigna el cómputo post-score de la atención según su masa: 2.2× y 3.0× a 128K y −23.1% de FLOPs a 32K, según el paper. No es contexto subcuadrático.
El 550B de NVIDIA que se apunta el oro en IOI 2026: SFT de una época destilado de GLM-5.2 más test-time compute. La receta, desglosada y con letra pequeña.
El chunking agéntico de RAG paga porque el LLM reescribe el documento entero; D-RAC solo emite listas de IDs: −95,7% de tokens de salida y −77,8%/−85,6% de coste de chunking con la misma calidad de retrieval según sus autores. Analizamos el paper de Yellow.ai y qué transfieres mañana a tu pipeline.
Qwen-Image-2.1 trae generación de imágenes con transparencia nativa (VAE RGBA de 64 canales) y edición con hasta 10 referencias. Analizamos qué es verificado y qué es claim del vendor, y la trampa que el titular no cuenta: la v1 era Apache-2.0 y la 2.1 baja a una licencia research-only que exige acuerdo comercial aparte.
WROP mide permanencia de objetos y solidez en modelos de vídeo: examen de 300 preguntas, un 16B abierto tercero y un podio más blando de lo que parece.
PrismML recuantiza Qwen3.8-27B a pesos ternarios de 1.72 bits/peso: 5.95 GB con el 98.2% de la media FP16, según el vendor. Analizamos qué es verificado y qué es claim, y la trampa que el titular no cuenta: estos ficheros no corren en llama.cpp stock — el fork es obligatorio o te comes salida inservible sin ningún error.
NVIDIA unifica AR, difusión y self-speculation en una sola arquitectura de pesos abiertos: cambias el patrón de atención y eliges latencia, throughput o una vía media verificada por AR. Analizamos los números con letra pequeña y la ola paralela de decodificación especulativa con difusión de julio a septiembre de 2026.
Nex-N2.5 llega en tres variantes —mini 35B, Pro 397B, Max 1,6T— con free tier agéntico en OpenRouter y el primer post-training trillion-scale en pesos abiertos, hecho por un tercero sobre la base DeepSeek-V4-Pro. Qué puedes evaluar gratis de verdad, qué dice el config.json de Max y cómo medir un free tier de computer-use antes de meterlo en producción.
Astra empata técnicamente al frente del Intelligence Index de Artificial Analysis y trae una novedad de precio que cambia la cuenta: el contexto largo se cobra aparte. Calculamos escenarios reales con 1M de tokens y explicamos por qué comparar scores entre semanas es inválido.
Durante casi 48 horas, el framework oficial de entrenamiento de Alibaba listaba un Qwen3.8-35B-A3B que nadie había visto. Un commit del 16 de agosto lo borró silenciosamente y puso un 27B en su lugar. Qué dice la cadena de commits, por qué la comunidad tiene razón en desconfiar y cómo se filtran los modelos antes de anunciarse.
GLM-5.3 usa el mismo modelo base que GLM-5.2 y solo cambia el post-training: +50% en su benchmark interno, SOTA en CyberGym y 2.436 vulnerabilidades reales encontradas. Análisis de qué benchmarks creer, qué significa el salto en seguridad y a quién le conviene ya.
Los 712 comentarios del hilo de experiencia de r/LocalLLaMA destilados en guía práctica: qué quant descargar, qué velocidad real esperar por GPU, los sampling params que todo el mundo se saltó y si merece la pena migrar desde el Qwen 3.5 122B.
Qwen publicó Qwen3.8-27B el 14 de agosto: 27.780M de parámetros densos, multimodal, contexto nativo de 262K y Apache 2.0. Los números de coding agentic son un salto real sobre Qwen3.6-27B, pero todo viene de la propia Qwen y el salto de hardware para explotarlo es más grande de lo que sugieren los titulares.
Meta lanzó Muse Glimmer el 10 de agosto: 30B parámetros densos, licencia Apache 2.0, diseñado para agentes locales. Gana a Gemma 4 31B en la mayoría de benchmarks agénticos pero pierde con Qwen 3.6 27B en uso de terminal. Análisis con benchmarks verificados, números de hardware real y casos de uso.
Moonshot AI lanzó Kimi K3 el 16 de julio: 2.8T parámetros MoE, 1M de contexto, $3/$15 por millón de tokens y pesos abiertos. Cuarto en el Intelligence Index (57.1), primero en AutomationBench y Frontend Code Arena. Análisis con benchmarks verificados, pricing real y casos de uso.
Claude Opus 5 empata en inteligencia con Fable 5 (61 en el Intelligence Index) a mitad de precio. Lidera Frontier-Bench y GDPval-AA, pero su tasa de alucinación subió 14 puntos. Review con benchmarks verificados, pricing real y casos de uso.
Claude Fable 5 llega con una capacidad de razonamiento sin precedentes y una optimización de tokens brutal, pero su precio de $10/$50 obliga a ser quirúrgicos con su uso. ¿Vale la pena el salto desde Opus 4.8?
GPT-5.6 Sol redefine el SOTA en agentes de programación con un Coding Agent Index de 80. Analizamos su rendimiento, su nuevo modo Ultra y su comparativa con Claude Fable 5.
Sam Altman anuncia un recorte agresivo de precios para la familia GPT-5.6: Luna cae un 80% hasta $0.20/$1.20 por millón de tokens, Terra baja un 20% a $2/$12, y Sol estrena un modo Fast que duplica el precio por 2.5x velocidad. Análisis del impacto competitivo y qué significa para tu stack.
Análisis técnico de Claude Sonnet 5: benchmarks reales, pricing agresivo, y qué significa para desarrollo en producción. El nuevo Sonnet reduce la brecha con Opus a solo 6 puntos en SWE-Bench Pro.
Con GPT-5.6 bloqueado por controles de exportación de EE.UU. y Mythos restringido a empresas aprobadas, el EU AI Act entra en vigor en agosto. Análisis de qué modelos estarán disponibles en Europa, qué obligaciones impone la ley y qué pueden hacer los devs.
Claude Fable 5 lidera el S-Tier con score 60, pero cuesta $25/MTok output. DeepSeek V4 Pro y Qwen 3.5-Flash ofrecen el mismo razonamiento a 1/28 del precio. Análisis de rankings, atención en Reddit y precios reales.
Desde el 15 de junio de 2026, Anthropic separó el uso del Agent SDK en un pool de créditos propio, con costes de $20-$200 por usuario. Esto cambia el TCO de Claude Code y agentes en producción. Análisis del impacto real y estrategias de mitigación.
El leak de Claude.md en Apple Support no fue un accidente: fue un diagnóstico. Apple depende de Anthropic, Google y OpenAI porque aún no puede construir un frontier model propio. Para devs, esto redefine cómo se distribuye la IA en dispositivos.
Análisis en profundidad de Qwen 3 235B: el modelo MoE de 235B parámetros de Alibaba. Evaluamos rendimiento, benchmarks, precio, licencia Apache 2.0 y comparativa con GPT-5, Claude 4 y DeepSeek V4.
Llama 4 Scout ofrece 10M de contexto en un modelo open-weight de 17B parámetros activos. Especial para RAG y análisis de código, pero por debajo de Maverick y Gemma 4 en razonamiento puro. Rating 3.5/5.
Gemini 3.5 Pro y Flash aterrizan con recepción tibia: peor coding que la competencia, bugs de razonamiento básico y comparaciones desfavorables contra GPT-5.6 Sol y Mythos 5. Analizamos los datos detrás del sentimiento negativo.
Claude Opus 4.8 lidera los benchmarks de coding y agentes con precio constante. Fortalezas en honestidad, Dynamic Workflows y Fast Mode. Ideal para equipos técnicos en producción.
OpenAI lanza GPT-5.6 Sol, Terra y Luna, pero el gobierno de Trump exige aprobación individual previa para cada partner. Primer caso de una frontier model 'con freno de mano' para crear un proceso repetible de evaluación. La UE y el resto del mundo quedan en la lista de espera.
Análisis exhaustivo de lo que sabemos (y no sabemos) sobre GPT-6. Timeline, especificaciones rumoreadas, credibilidad de fuentes y estrategia para desarrolladores.
Dos modelos open-weight gratis en NIM con filosofía opuesta: MoE de 1T parámetros vs dense de 31B. Probamos cuál genera mejor contenido en español, cuál es más rápido, y cuándo conviene cada uno.
Anthropic lanzó Claude Fable 5, el primer modelo de la clase Mythos accesible al público general. 1M de contexto, 128K de output, safeguards inteligentes y un precio premium. Esto es lo que necesitas saber antes de migrar tu stack.
El gobierno de EE.UU. ordena desactivar Fable 5 y Mythos 5 para todos los usuarios bajo controles de exportación. Anthropic llama a la orden 'injusta'. Primer export control directo sobre modelos de IA, no sobre chips.
Claude 4 Sonnet a $3/MTok ofrece calidad frontier para coding y razonamiento. Buena relacion calidad-precio, pero lento y superado por Sonnet 4.6.
En Build 2026, Microsoft presentó su familia MAI de 7 modelos propios: razonamiento, coding, imagen, voz y transcripción. Analizamos specs, benchmarks, pricing y cuándo tiene sentido usarlos.
xAI completó el entrenamiento de Grok V9-Medium, un modelo de 1.5T parámetros entrenado con datos de Cursor que pretende competir con Claude Code y GitHub Copilot. Analizamos los datos disponibles, el roadmap y si merece la pena prestarle atención.
No existe un modelo que lo haga todo bien y barato. En 2026, la pregunta no es '¿qué modelo uso?', sino '¿qué modelo uso para esta tarea concreta?'. Framework de decisiones con precios reales de junio 2026.
Tres frontier models lanzados en ocho días. DeepSeek V4 Pro cuesta 9x menos que GPT-5.5 y compite en coding, Opus 4.7 domina en código complejo, y GPT-5.5 arrasa en tareas agénticas. Guía de routing por caso de uso con benchmarks reales.
Datos actualizados agosto 2026, tras V4-Pro-0813, GPT-5.6 Sol y Claude Opus 5. El landscape migró a benchmarks agenticos y DeepSeek cambió a pricing peak/off-peak: la brecha de precio con el frontier bajó de 29x a 6-13x. Tablas lado a lado, coste por punto y veredicto por caso de uso.
OpenAI apuesta por acceso controlado a miles de defenders con GPT-5.5-Cyber y el programa Trusted Access for Cyber. Anthropic cierra el grifo con Claude Mythos y Project Glasswing para 40 organizaciones. Mismas capacidades, estrategias opuestas. Aquí está el desglose técnico y qué significa para los devs.
Anthropic tiene un modelo capaz de encontrar vulnerabilidades zero-day mejor que casi cualquier humano, y ha decidido no publicarlo. Project Glasswing es el programa restringido que lo gestiona. Aquí está lo que sabemos, los datos del primer mes, y lo que implica para los devs.
DeepSeek V4 Pro iguala o supera a GPT-5.5 en coding algoritmico y razonamiento matematico, a 17x menos coste. El mejor modelo open-weight que existe.
Sonnet 4.6 cuesta 1/5 que Opus, rinde dentro de 1.2 puntos en SWE-bench y ahora tiene 1M de contexto sin recargo. Análisis de pricing, benchmarks y en qué tareas merece la pena pagar más.
Comparativa Gemma 4 vs Llama 4 actualizada a agosto 2026: Gemma 4 12B Unified trae multimodalidad encoder-free a laptops de 16GB, Muse Spark cierra la era open de Meta, Scout cae en síntesis de contexto. Specs, benchmarks, pricing y veredicto.
Tracker vivo sobre GPT-6 y el codename Spud. Qué pasó con los rumores, qué entregó OpenAI con GPT-5.5, y cuándo esperar el verdadero GPT-6.
Alibaba presentó Qwen3.7-Max como el primer modelo diseñado desde cero para la era de los agentes: 1M de contexto, ejecución autónoma de 35 horas, integración nativa con Claude Code y OpenClaw, y benchmarks que superan a Opus 4.6 en tareas agentic. Analizamos qué hay de marketing y qué hay de verdad.
Gemini 3.5 Flash supera a 3.1 Pro en benchmarks agentic y cuesta 40% menos. Pero el coste real por tarea puede ser 5x superior a Flash 3.0. Review con datos, no marketing.
Apple usa Claude internamente, integra agentes en Xcode, adopta MCP a nivel sistema y abrirá Siri a modelos de terceros. Esto es lo que significa para devs que construyen con IA.
Tribunales chinos han declarado ilegal despedir a trabajadores para sustituirlos por IA. Repaso a las sentencias, la comparativa con la UE y EEUU, y qué significa para devs que trabajan con empresas globales.
GLM-5.1 lidera coding y razonamiento complejo; Gemma 4 democratiza con Apache 2.0. Los modelos open-source ya no son curiosidades: son alternativas viables.
Klarna recontrató humanos tras reemplazar 700 agentes con IA. IBM despidió 8.000 empleados y tuvo que recontratar. Forrester dice que el 55% de empresas se arrepienten. Datos, casos reales y un framework para decidir qué automatizar sin quemar tu organización.
Precios DeepSeek V4 Pro (0813), Flash y el nuevo Flash-Vision-Exp (sep 2026: vision a precio Flash) bajo billing peak/off-peak. Comparativa con GPT-5.4, Claude Opus 5/Sonnet 5 y Gemini. Cálculos reales para coding, RAG, agentes, batch y workloads con imágenes.
Análisis técnico profundo de los dos modelos de seguridad más avanzados del mercado: GPT-5.5-Cyber de OpenAI y Claude Mythos de Anthropic. Capabilities, pricing y casos de uso real para desarrolladores.
Dos modelos open-weight de élite, filosofías opuestas. Mistral ofrece velocidad y multimodalidad; DeepSeek entrega inteligencia bruta y contexto masivo. ¿Cuál compensa en producción?
Cuatro modelos, cuatro filosofías. Gemini 3.5 Flash cambia el juego con velocidad y agenticidad. ¿Cuál usar para coding, agentes multimodales y presupuestos ajustados? Benchmarks reales, precios y casos de uso prácticos.
Los archivos CLAUDE.md filtrados en la app Apple Support revelan que Apple usa Claude Code internamente, tiene un LLM propio llamado Juno AI, y su estrategia de IA es más dependiente de terceros de lo que reconoce públicamente.
Google ha anunciado una inversión de hasta 40.000M$ en Anthropic. Pero el 75% está condicionado a hitos, y la parte que importa de verdad es el compute: 5 GW de TPU durante 5 años. Qué significa esto para los devs que usan Claude, la API, y el ecosistema LLM.
Google I/O 2026 trajo Gemini 3.5 Flash (4x más rápido que otros frontier), Antigravity 2.0 (platforma agent-first que reemplaza Gemini CLI), Gemini Omni (video desde cualquier input) y cambios en Search que afectan tu SEO. Guía práctica para devs con datos, pricing y migraciones.
Gemini 3.1 Pro logra 94.3% en GPQA Diamond (superando a Opus 4.7), 2M tokens de contexto y 80.6% en SWE-bench. Análisis con datos del Model Card oficial de Google DeepMind.
Gemini 2.5 Pro tiene 1M tokens de contexto, excelente multimodal y pricing agresivo. Pero su API es errática y los rate limits hieren su caso de uso principal. Review con datos reales.
Llama 4 Maverick es el modelo open-weight más capaz de Meta. MoE eficiente, buen español, y self-hosting real. Pero no llega al nivel de Opus 4.7 ni GPT-5 en razonamiento profundo.
Mistral Large 3 mejoró en coding y agentes, con Agents API nativo y pricing competitivo. Pero su razonamiento sigue por debajo de frontier y el español es su punto débil.
Comparativa práctica entre los dos modelos frontier de 2026: rendimiento en coding, razonamiento, costes y casos de uso reales. Con datos, no opiniones.
GPT-5.5 arrasa en tareas agénticas, Opus 4.7 domina en código y veracidad. Desglose con benchmarks reales, precios y una guía de routing por caso de uso.
Mistral lanza el Medium 3.5: 128B parámetros, licencia MIT y un 77.6% en SWE-bench. Analizamos si realmente puede sustituir a los modelos frontera en
Análisis exhaustivo de Grok 3 de xAI: benchmarks, pricing, metodología de evaluación y comparativa frente a GPT-4o, Claude Sonnet y Gemini. 1,250+ palabras con veredicto justificado.
DeepSeek R2 ofrece calidad frontier a precio de commodidad. No es perfecto, pero redefinió lo que esperamos de un modelo open-weight.
Frente a frente dos modelos open-weight de élite lanzados en abril 2026: Mistral Medium 3.5 (denso, rápido, multimodal) y DeepSeek V4 (MoE, 1M contexto, precio imbatible). Analizamos specs, benchmarks reales, pricing, disponibilidad en Europa y veredicto por caso de uso.
Modelos abiertos vs propietarios en 2026: rendimiento real, costes, privacidad, self-hosting y la decisión de cuál usar para cada caso.
DeepSeek V4-Pro y V4-Flash llegan con 1M de contexto, licencia MIT y benchmarks que compiten con GPT-5.4 y Claude Opus 4.6. Analizamos arquitectura,
No todos los benchmarks valen lo mismo. Guía práctica para leer leaderboards sin caer en marketing: qué mide cada uno, qué significa realmente y cuándo importa.
Claude 4 Opus es el mejor modelo de coding del mercado. Caro, pero si tu trabajo depende de escribir código, merece cada céntimo.
Cómo calcular, optimizar y reducir el coste de usar LLMs en producción: tokens, caching semántico, routing inteligente y qué proveedores convienen.
Todos los modelos que importan en 2026, clasificados por caso de uso, con datos reales de benchmarks, precios y disponibilidad.
GPT-5 sigue siendo el modelo más versátil del mercado. No es el mejor en nada, pero es excelente en casi todo. Review con datos reales.
Los modelos open-weight están a 3 puntos de Elo de la frontera. La guerra de precios ha empezado. Y el local first es viable. Qué significa todo esto.