Modelos Base Fundacionales (LLMs) para Inferencia Avanzada
Análisis empírico de modelos fundacionales. Capacidades de abstracción, retención en ventanas de contexto extremas y latencia en tareas de producción técnica.
La filosofía detrás de esta selección
Durante años, el acceso a inteligencia artificial de frontera fue un privilegio de quien podía pagar tarifas de varias decenas de dólares por millón de tokens. Eso ha cambiado de forma irreversible. La combinación de licencias Open Weights (MIT, en su mayoría) con una guerra de precios sin precedentes entre laboratorios chinos (DeepSeek, Xiaomi, Moonshot, Alibaba, Zhipu) ha hecho que el coste de inferencia de frontera caiga entre 30 y 100 veces en poco más de un año.
Esta auditoría no pretende coronar “el mejor modelo” en abstracto, sino identificar qué combinaciones de modelo, proveedor y plan de precios democratizan realmente el acceso a la IA: que un desarrollador independiente, una startup de dos personas o un equipo técnico con presupuesto ajustado puedan construir sistemas agénticos serios sin depender de la caridad de una ronda de financiación. Pesos abiertos que se pueden auto-hospedar, cachés de contexto que devoran el coste marginal, y créditos promocionales que merece la pena exprimir: ese es el criterio real de selección.
Estructura de Costes de Inferencia (Referencia Septiembre 2026)
La economía del token sigue definiendo la viabilidad comercial de los sistemas agénticos. Esta tabla recoge las tarifas oficiales por cada millón de tokens (USD) y los límites de contexto vigentes de las APIs de frontera más relevantes en relación calidad/precio:
| Modelo | Input / 1M (USD) | Output / 1M (USD) | Contexto | Licencia / Tipo |
|---|---|---|---|---|
| GLM-5.3-Flash (Z.ai) | 0.045 | 0.140 | 1M | MIT (Open Weights) |
| DeepSeek V4.1-Flash | 0.150* | 0.600* | 1M | MIT (Open Weights) |
| MiMo-V2.6-Flash | 0.140 | 0.280 | 1M | MIT (Open Weights) |
| MiMo-V2.6-Pro | 0.435 | 0.870 | 1M | MIT (Open Weights) |
| GLM-5.3 (completo) | 1.400 | 4.400 | 1.3M | MIT (Open Weights) |
| Cursor Composer 2.5 | 0.500 | 2.500 | — | Propietario |
| Cohere Command A | 2.500 | 10.000 | 256k | Propietario |
*DeepSeek V4.1-Flash aplica tarifa reducida en horas valle: 0.60 USD de salida off-peak y 0.003 USD en entrada cacheada (98% de descuento sobre el precio ordinario). Precio de GLM-5.3-Flash vía OpenRouter; la tarifa directa de Z.ai para GLM-5.3 completo es de 1.40/4.40 USD.
La noticia de septiembre: tres lanzamientos en dos semanas han reordenado el tablero. GLM-5.3-Flash (26 de agosto) ha roto el suelo del precio absoluto: 0.045 USD de entrada es el costo más bajo jamás visto en un modelo multimodal de pesos abiertos. DeepSeek V4.1-Flash (10 de septiembre) ha doblado su capacidad de salida hasta 384K tokens y ha añadido comprensión nativa de imágenes. Y MiMo-V2.6 (22 de septiembre) ha unificado de nuevo sus líneas Pro y base bajo una arquitectura omnimodal común. El detalle que define la temporada: DeepSeek ha redirigido las peticiones de su V4.1 Pro hacia Flash, señal de que su próximo movimiento de calibre pesado aún está por llegar.
GLM-5.3-Flash: El Nuevo Suelo de la Economía del Token
GLM-5.3-Flash es el primer modelo nativamente multimodal de la serie GLM-5 y el primer lanzamiento de peso abierto de la arquitectura glm5_next: un MoE de 320B de parámetros entrenado con un corpus multimodal de 30T tokens, con un mecanismo de atención híbrida dispersa y lineal diseñado específicamente para abaratar el servicio de contexto largo. Contexto de 1M de tokens (1.310.720 exactos vía OpenRouter).
Detrás hay dos historias que merecen ser contadas. La primera: durante semanas el modelo operó de forma anónima en los ránkings de la comunidad bajo el alias “Ox Alpha”, generando una cacería especulativa sobre su origen, hasta que Zhipu confirmó su autoría. La segunda: todo el entrenamiento e inferencia se ejecutó sobre un clúster de 100.000 chips chinos de producción nacional, una declaración de independencia geopolítica de calco y literatura frente a las restricciones de exportación occidentales.
Su hermano mayor, GLM-5.3 (14 de agosto), es el modelo de frontera diseñado como ingeniero de software autónomo para tareas de horizonte largo, con un salto del 50% en programación frente a su generación anterior. Flash hereda la arquitectura a una fracción del coste: 0.045 USD de entrada y 0.14 USD de salida por millón de tokens vía OpenRouter. Para referencia: es un 96% más barato que DeepSeek V4.1-Flash en salida.
GLM-5.3-Flash es el modelo que mejor me está funcionando ahora mismo, y no es una afirmación teórica: es lo que extraigo de mi propio uso diario de escritura de código, auditoría y tareas agénticas. El punto de inflexión ha sido Freebuff, el agente de coding gratuito (CLI y web) que financia su servicio con publicidad en lugar de suscripciones y que ofrece agentes sobre GLM, DeepSeek y GPT sin tarjeta de crédito. La combinación GLM-5.3-Flash + Freebuff es, hoy por hoy, la forma más barata de tener un agente de frontera trabajando: coste marginal cero para empezar y una calidad de ejecución que no he necesitado sustituir por alternativas de pago en mi flujo diario.
El caballo de batalla por defecto para 2026-2027: agentes de coding, flujos multimodales ligeros (imagen + texto), chat de propósito general y cualquier pipeline donde el coste marginal por token sea la variable crítica. Para sesiones de ingeniería de software de horizonte muy largo con presupuesto mayor, GLM-5.3 completo (1.40/4.40 USD) y su variante acelerada Prime (2.80/8.80 USD) cubren el rango superior.
DeepSeek V4.1-Flash: Visión Nativa y 384K de Salida
La familia V4 que redefinió la economía de la IA en abril evoluciona a V4.1-Flash: comprensión nativa de imágenes (por fin, en la línea Flash), mantenimiento del contexto de 1M y un salto brutal en la ventana de salida: 384K tokens de salida, el valor más alto del mercado abierto. Para sistemas agénticos que redactan documentos completos, refactorizaciones enteras o informes estructurados, la salida ampliada elimina una fricción de paginación que llevábamos años sufriendo.
La señal estratégica más interesante no es el modelo en sí, sino el movimiento alrededor: DeepSeek ha redirigido las solicitudes del modelo Pro hacia Flash con una nueva estructura de tarifas, y su registro de cambios no menciona un V5. Todo apunta a que el sucesor de calibre pesado (V4.1 Pro) llega después, y que este Flash es el terreno que prepara el terreno. Mientras tanto, el precio de ataque es el de siempre: 0.15 USD de entrada fuera de horas punta (0.003 USD cacheada) y 0.60 USD de salida off-peak.
Consideración crítica geopolítica y de privacidad: sigue vigente de la familia V4 — el uso de la API nativa implica el tránsito de datos por fronteras sensibles (inviable bajo GDPR estricto). La licencia MIT permite montar los pesos on-premise con vLLM o SGLang.
Pipelines agénticos de salida masiva (informes, documentación generada, refactors extensos que superan el límite de 128K de GLM-5.3-Flash), visión documental (parseo de capturas, diagramas y PDFs escaneados) y cualquier carga donde la tarifa off-peak de madrugada se pueda explotar con batch processing.
Xiaomi MiMo-V2.6: La Unificación Omnimodal
La corrección más importante de esta actualización: MiMo-V2.6 deshace la separación de V2.5 (donde la base era multimodal y Pro era un agéntico de texto puro). Ahora ambas variantes son nativamente omnimodales — texto, imagen, vídeo y audio en una sola arquitectura — con contexto de 1M de tokens.
MiMo-V2.6-Pro (0.435/0.870 USD, los mismos precios que su antecesor) es el flagship de razonamiento de Xiaomi: billón de parámetros, construido para proyectos complejos, tareas de horizonte largo, ciberseguridad e investigación. La tesis técnica del lanzamiento es la RSI (Recursive Self-Improvement) vía escalado de cómputo RL sobre tareas verificables: el modelo expande su frontera de capacidad mediante exploración y feedback continuo, en lugar de depender solo de corpus estáticos. La narrativa es ambiciosa; los benchmarks independientes confirman que mantiene el pulso con DeepSeek en ingeniería de software.
MiMo-V2.6-Flash (0.140/0.280 USD) hereda la omnimodalidad a precio de caballo de batalla transaccional. Xiaomi ha lanzado además una Batch API al 50% de la tarifa real-time para procesamiento asíncrono masivo sobre ambos modelos — la palanca de coste menos publicitada y más rentable para ETLs semánticas.
MiMo-V2.6-Pro para agentes de coding de sesiones ultra-prolongadas que requieran coherencia semántica implacable a lo largo de cientos de decisiones secuenciales (sigue siendo el más resistente a la degradación en tareas continuadas). MiMo-V2.6-Flash para flujos multimodales de volumen con presupuesto ajustado, y la Batch API para cualquier carga asíncrona no interactiva.
Cursor Composer 2.5: Restricción al Ecosistema
Composer 2.5, lanzado el 19 de mayo de 2026, no opera como un modelo fundacional con API de consumo genérico. Se trata del resultado de un fine-tuning masivo sobre Kimi K2.5 de Moonshot AI empleando telemetría de sesiones reales de desarrollo dentro del propio editor. El resultado iguala los benchmarks de Claude Opus 4.7 costando oficialmente diez veces menos en tokens de entrada y treinta veces menos en salida.
La limitación estructural es el vendor lock-in: su uso está restringido al IDE de Cursor. Al carecer de endpoints públicos, imposibilita el auto-hospedaje o su integración en arneses de agentes headless.
Recomendado exclusivamente si el flujo de trabajo ya reside íntegramente dentro de Cursor y la portabilidad a herramientas externas es prescindible. Para sistemas agénticos desacoplados, Kimi K2.5 vía API abierta representa la opción correcta.
Cohere y la Infraestructura RAG: Command A
El histórico Command R+ ha quedado reemplazado dentro de la arquitectura de Cohere por Command A, su línea generativa actual dotada de una ventana de contexto nativa de 256k. Mantiene su especialización de nicho corporativo alejándose de la competición generalista de DeepSeek, MiMo o Zhipu.
Su ventaja diferencial reside en la integración monolítica con Embed v4 (vectorización semántica multimodal) y Rerank 4 (reordenador semántico de baja latencia). Conjuntamente con Command A, configuran una de las infraestructuras RAG más resilientes para producción, con capacidades multilingües avanzadas en español y un nivel gratuito de 1.000 llamadas API mensuales.
Despliegue de portales de conocimiento corporativo, bases de datos vectoriales acopladas a Grafos o SQL, e indexación documental donde la trazabilidad estricta y citación de fuentes es prioritaria frente a la codificación generalista.
Eficiencia y Reducción del Coste Marginal de Inferencia
El plan Go de CommandCode se amortiza mediante su ratio de conversión interno. La suscripción base (1 USD/mes, que asciende a ~1,22 € tras aplicar IVA y tasas de procesamiento) confiere 10 USD en créditos de cómputo. Aplicado sobre DeepSeek V4.1-Flash con su tarifa off-peak de salida (0.60 USD), el retorno efectivo se dispara hasta las 17 sesiones de refactorización profunda por cada dólar de suscripción. La integración con MiMo-V2.6 aplica su multiplicador de descuento histórico. No obstante, nuestra evaluación empírica actual prioriza GLM-5.3-Flash vía OpenRouter o Freebuff: a 0.045/0.14 USD, el coste directo es tan bajo que el arbitraje de créditos deja de ser la variable crítica.
Todo despliegue inicial en DeepSeek recibe automáticamente 5 millones de tokens gratuitos sin vinculación de tarjeta de crédito (vigencia de 30 días, lo que equivale a un pool de ~8.40 USD sobre el modelo Flash para validación de prototipos).
Conseguir los 300 USD (261,42 EUR) de créditos para nuevos usuarios en Google Cloud sigue mereciendo la pena para acceder a los últimos modelos de Gemini, pero el proceso se ha vuelto asfixiante. La plataforma exige ahora la conversión explícita a una cuenta de facturación activa mediante un prepago: hace unos meses pedían 10 euros, pero recientemente han subido esa retención a 25 euros. Todo el flujo de configuración inicial para poder usar la API en herramientas como OpenCode es terriblemente burocrático, tedioso y lleno de trabas corporativas.
Al final compensa hasta cierto punto por probar los modelos de frontera, pero hay un problema: al ser muchísimo menos eficientes y más caros que las alternativas de pesos abiertos mencionadas arriba, el saldo vuela rápido y la experiencia resulta un poco decepcionante. Además, es bastante difícil encontrar en la interfaz el botón para solicitar el reembolso de esos 25 euros de prepago, aunque una vez lo encuentras, te devuelven el dinero íntegro y tú te quedas habiendo exprimido los modelos de frontera financiados puramente con sus propios créditos.