🆕 Hallazgos clave de septiembre
Lo que cambió este mes en el ranking de valor calidad-precio en español (no superioridad absoluta). Los detalles completos están en el cheatsheet (12 páginas).
La versión cara dejó de comprar calidad — y ahora está medido dentro de la misma familia
GLM 5.3 saca 8,52 de calidad y cuesta US$7,02 por cada mil llamadas. Su versión Flash saca 8,51 y cuesta US$0,40. Una centésima de diferencia por casi dieciocho veces el precio, con el mismo proveedor y la misma familia — donde ya no vale la respuesta de que son modelos distintos.
8,52 vs 8,51 · 1/18 del precioEl primero en calidad cuesta 52 veces menos que Opus 4.8
Qwen 3.8 Flash queda primero en calidad promedio con 8,53, a US$0,75 por cada mil llamadas. Claude Opus 4.8 saca 8,48 y cuesta US$39. Siete de los diez mejores en calidad cuestan menos de US$3 por cada mil llamadas.
8,53 · US$0,75 / 1k llamadasEntre el primero y el último hay 1,27 puntos sobre 10
De los 99 modelos rankeados, el mejor saca 8,53 y el último 7,26. La calidad está apretada; el precio no. Por eso la pregunta útil dejó de ser cuál es el mejor modelo y pasó a ser cuánto estás pagando de más por la diferencia que te toca.
99 rankeados · spread 1,27⚠️ Esto NO reemplaza a HumanEval, MMLU o SWE-bench
Los benchmarks tradicionales miden cosas que importan a investigadores: olimpiadas de matemáticas, doctorados respondiendo en inglés, software engineering en repos grandes. Este cheatsheet es complemento, no sustituto.
Está diseñado para el emprendedor hispanohablante que necesita decidir HOY qué modelo usar para sus agentes, automatizaciones y contenido. Si te importa calidad y costo en español, latencia desde LATAM, y tool calling de verdad, este cheatsheet responde lo que los otros no miden.
Que incluye el cheatsheet
Top 10 ranking global + top 5 quality only
Score compuesto que pondera calidad (50%), costo (20%), tool calling (15%), velocidad (7.5%) y latencia (7.5%). Phi-4 como juez local: cero conflicto de interés con ningún proveedor.
⭐ Sección principalRecomendaciones por caso de uso
Stack agente recomendado por rol: contenido en español, coding, agentes con herramientas, razonamiento, NIAH (long-context). No todos sirven para todo — cada rol tiene su modelo óptimo.
Rankings por categoría
6 categorías evaluadas independientemente: Razonamiento, Coding, Contenido, Agentes, Multi-step (long-horizon) y NIAH-ES (aguja en pajar en español).
Precios y suscripciones
Pay-as-you-go + 4 suscripciones top: MiMo Xiaomi $14, MiniMax $19, Anthropic Pro $20, Ollama Cloud $30. Cuál conviene según tu volumen mensual de tokens.
Estrategia local por VRAM/RAM
Qué modelos elegir según tu hardware: 8GB / 16GB / 24-32GB / 48-64GB / 128GB / 256GB+. No es solo DGX Spark — funciona con cualquier setup local.
Mapa de proveedores
10 providers comparados: NVIDIA NIM, OpenRouter, Groq, MiniMax, Xiaomi, Ollama Cloud, OpenAI, Anthropic, Google, local. Latencia, disponibilidad y costos reales desde LATAM.
Qué lo hace diferente
Se actualiza cada mes
No es un PDF estático. Cada 1ro de mes se re-ejecutan los tests con los modelos más recientes y se publica un datasheet con la evolución. Recibes la nueva versión automáticamente.
Actualizado mensualMedido desde Chile, no Virginia
La latencia que ves es la que realmente tendrás en tu aplicación si operas en LATAM. Modelos chinos top que se ven en rankings (MiMo, DeepSeek) se evalúan también por latencia real desde Sudamérica.
Contexto realMetodología pública en GitHub
91 pruebas por modelo en 23 suites. Datos crudos versionados en git, scripts de scoring auditables, criterios documentados. Si no estás de acuerdo con un score, puedes reproducirlo.
Open source