stack / mejores-modelos-ia

Modelos Base Fundacionales (LLMs) para Inferencia Avanzada

Análisis empírico de modelos fundacionales. Capacidades de abstracción, retención en ventanas de contexto extremas y latencia en tareas de producción técnica.

Categoría_Sistema Inteligencia Artificial

La filosofía detrás de esta selección

Durante años, el acceso a inteligencia artificial de frontera fue un privilegio de quien podía pagar tarifas de varias decenas de dólares por millón de tokens. Eso ha cambiado de forma irreversible. La combinación de licencias Open Weights (MIT, en su mayoría) con una guerra de precios sin precedentes entre laboratorios chinos (DeepSeek, Xiaomi, Moonshot, Alibaba, Zhipu) ha hecho que el coste de inferencia de frontera caiga entre 30 y 100 veces en poco más de un año.

Esta auditoría no pretende coronar “el mejor modelo” en abstracto, sino identificar qué combinaciones de modelo, proveedor y plan de precios democratizan realmente el acceso a la IA: que un desarrollador independiente, una startup de dos personas o un equipo técnico con presupuesto ajustado puedan construir sistemas agénticos serios sin depender de la caridad de una ronda de financiación. Pesos abiertos que se pueden auto-hospedar, cachés de contexto que devoran el coste marginal, y créditos promocionales que merece la pena exprimir: ese es el criterio real de selección.


Estructura de Costes de Inferencia (Referencia Septiembre 2026)

La economía del token sigue definiendo la viabilidad comercial de los sistemas agénticos. Esta tabla recoge las tarifas oficiales por cada millón de tokens (USD) y los límites de contexto vigentes de las APIs de frontera más relevantes en relación calidad/precio:

Tabla de Tarifas de APIs oficiales (Valores en USD)
ModeloInput / 1M (USD)Output / 1M (USD)ContextoLicencia / Tipo
GLM-5.3-Flash (Z.ai) 0.045 0.140 1M MIT (Open Weights)
DeepSeek V4.1-Flash 0.150* 0.600* 1M MIT (Open Weights)
MiMo-V2.6-Flash 0.140 0.280 1M MIT (Open Weights)
MiMo-V2.6-Pro 0.435 0.870 1M MIT (Open Weights)
GLM-5.3 (completo) 1.400 4.400 1.3M MIT (Open Weights)
Cursor Composer 2.5 0.500 2.500 — Propietario
Cohere Command A 2.500 10.000 256k Propietario

*DeepSeek V4.1-Flash aplica tarifa reducida en horas valle: 0.60 USD de salida off-peak y 0.003 USD en entrada cacheada (98% de descuento sobre el precio ordinario). Precio de GLM-5.3-Flash vía OpenRouter; la tarifa directa de Z.ai para GLM-5.3 completo es de 1.40/4.40 USD.

La noticia de septiembre: tres lanzamientos en dos semanas han reordenado el tablero. GLM-5.3-Flash (26 de agosto) ha roto el suelo del precio absoluto: 0.045 USD de entrada es el costo más bajo jamás visto en un modelo multimodal de pesos abiertos. DeepSeek V4.1-Flash (10 de septiembre) ha doblado su capacidad de salida hasta 384K tokens y ha añadido comprensión nativa de imágenes. Y MiMo-V2.6 (22 de septiembre) ha unificado de nuevo sus líneas Pro y base bajo una arquitectura omnimodal común. El detalle que define la temporada: DeepSeek ha redirigido las peticiones de su V4.1 Pro hacia Flash, señal de que su próximo movimiento de calibre pesado aún está por llegar.


GLM-5.3-Flash: El Nuevo Suelo de la Economía del Token

Zhipu AI (Z.ai) · MoE 320B · Licencia MIT · Lanzado 26 Agosto 2026
Open Weights Nativamente Multimodal 1M Context Precio Absurdo

GLM-5.3-Flash es el primer modelo nativamente multimodal de la serie GLM-5 y el primer lanzamiento de peso abierto de la arquitectura glm5_next: un MoE de 320B de parámetros entrenado con un corpus multimodal de 30T tokens, con un mecanismo de atención híbrida dispersa y lineal diseñado específicamente para abaratar el servicio de contexto largo. Contexto de 1M de tokens (1.310.720 exactos vía OpenRouter).

Detrás hay dos historias que merecen ser contadas. La primera: durante semanas el modelo operó de forma anónima en los ránkings de la comunidad bajo el alias “Ox Alpha”, generando una cacería especulativa sobre su origen, hasta que Zhipu confirmó su autoría. La segunda: todo el entrenamiento e inferencia se ejecutó sobre un clúster de 100.000 chips chinos de producción nacional, una declaración de independencia geopolítica de calco y literatura frente a las restricciones de exportación occidentales.

Su hermano mayor, GLM-5.3 (14 de agosto), es el modelo de frontera diseñado como ingeniero de software autónomo para tareas de horizonte largo, con un salto del 50% en programación frente a su generación anterior. Flash hereda la arquitectura a una fracción del coste: 0.045 USD de entrada y 0.14 USD de salida por millón de tokens vía OpenRouter. Para referencia: es un 96% más barato que DeepSeek V4.1-Flash en salida.

Arquitectura
MoE 320B · Atención híbrida dispersa + lineal
Entrenamiento
30T tokens multimodales · 100.000 chips chinos
Contexto
1M tokens (1.310.720 vía OpenRouter)
Precio (OpenRouter)
0.045 / 0.14 USD por millón de tokens
Nota de uso propio: mi daily driver actual

GLM-5.3-Flash es el modelo que mejor me está funcionando ahora mismo, y no es una afirmación teórica: es lo que extraigo de mi propio uso diario de escritura de código, auditoría y tareas agénticas. El punto de inflexión ha sido Freebuff, el agente de coding gratuito (CLI y web) que financia su servicio con publicidad en lugar de suscripciones y que ofrece agentes sobre GLM, DeepSeek y GPT sin tarjeta de crédito. La combinación GLM-5.3-Flash + Freebuff es, hoy por hoy, la forma más barata de tener un agente de frontera trabajando: coste marginal cero para empezar y una calidad de ejecución que no he necesitado sustituir por alternativas de pago en mi flujo diario.

Caso de uso óptimo

El caballo de batalla por defecto para 2026-2027: agentes de coding, flujos multimodales ligeros (imagen + texto), chat de propósito general y cualquier pipeline donde el coste marginal por token sea la variable crítica. Para sesiones de ingeniería de software de horizonte muy largo con presupuesto mayor, GLM-5.3 completo (1.40/4.40 USD) y su variante acelerada Prime (2.80/8.80 USD) cubren el rango superior.


DeepSeek V4.1-Flash: Visión Nativa y 384K de Salida

DeepSeek · MoE · Licencia MIT · Lanzado 10 Septiembre 2026
Open Weights Visión Nativa 384K Output 1M Context

La familia V4 que redefinió la economía de la IA en abril evoluciona a V4.1-Flash: comprensión nativa de imágenes (por fin, en la línea Flash), mantenimiento del contexto de 1M y un salto brutal en la ventana de salida: 384K tokens de salida, el valor más alto del mercado abierto. Para sistemas agénticos que redactan documentos completos, refactorizaciones enteras o informes estructurados, la salida ampliada elimina una fricción de paginación que llevábamos años sufriendo.

La señal estratégica más interesante no es el modelo en sí, sino el movimiento alrededor: DeepSeek ha redirigido las solicitudes del modelo Pro hacia Flash con una nueva estructura de tarifas, y su registro de cambios no menciona un V5. Todo apunta a que el sucesor de calibre pesado (V4.1 Pro) llega después, y que este Flash es el terreno que prepara el terreno. Mientras tanto, el precio de ataque es el de siempre: 0.15 USD de entrada fuera de horas punta (0.003 USD cacheada) y 0.60 USD de salida off-peak.

Consideración crítica geopolítica y de privacidad: sigue vigente de la familia V4 — el uso de la API nativa implica el tránsito de datos por fronteras sensibles (inviable bajo GDPR estricto). La licencia MIT permite montar los pesos on-premise con vLLM o SGLang.

Visión
Comprensión nativa de imágenes (novedad V4.1)
Ventana de salida
384K tokens (récord del mercado abierto)
Caché Hit
0.003 USD / millón de tokens (98% dcto.)
Señal estratégica
V4.1 Pro anunciado como siguiente lanzamiento
Caso de uso óptimo

Pipelines agénticos de salida masiva (informes, documentación generada, refactors extensos que superan el límite de 128K de GLM-5.3-Flash), visión documental (parseo de capturas, diagramas y PDFs escaneados) y cualquier carga donde la tarifa off-peak de madrugada se pueda explotar con batch processing.


Xiaomi MiMo-V2.6: La Unificación Omnimodal

Xiaomi · MoE Trillion-Param · Licencia MIT · Lanzado 22 Septiembre 2026
Open Weights Omni-Modal Pro RSI: RL Escalado

La corrección más importante de esta actualización: MiMo-V2.6 deshace la separación de V2.5 (donde la base era multimodal y Pro era un agéntico de texto puro). Ahora ambas variantes son nativamente omnimodales — texto, imagen, vídeo y audio en una sola arquitectura — con contexto de 1M de tokens.

MiMo-V2.6-Pro (0.435/0.870 USD, los mismos precios que su antecesor) es el flagship de razonamiento de Xiaomi: billón de parámetros, construido para proyectos complejos, tareas de horizonte largo, ciberseguridad e investigación. La tesis técnica del lanzamiento es la RSI (Recursive Self-Improvement) vía escalado de cómputo RL sobre tareas verificables: el modelo expande su frontera de capacidad mediante exploración y feedback continuo, en lugar de depender solo de corpus estáticos. La narrativa es ambiciosa; los benchmarks independientes confirman que mantiene el pulso con DeepSeek en ingeniería de software.

MiMo-V2.6-Flash (0.140/0.280 USD) hereda la omnimodalidad a precio de caballo de batalla transaccional. Xiaomi ha lanzado además una Batch API al 50% de la tarifa real-time para procesamiento asíncrono masivo sobre ambos modelos — la palanca de coste menos publicitada y más rentable para ETLs semánticas.

MiMo-V2.6-Pro
1T+ parámetros · Omni-modal (antes solo texto)
MiMo-V2.6-Flash
0.14 / 0.28 USD · Omnimodal + 1M contexto
Tesis de entrenamiento
RSI: escalado de RL sobre tareas verificables
Batch API
50% de la tarifa real-time (novedad)
Caso de uso óptimo

MiMo-V2.6-Pro para agentes de coding de sesiones ultra-prolongadas que requieran coherencia semántica implacable a lo largo de cientos de decisiones secuenciales (sigue siendo el más resistente a la degradación en tareas continuadas). MiMo-V2.6-Flash para flujos multimodales de volumen con presupuesto ajustado, y la Batch API para cualquier carga asíncrona no interactiva.


Cursor Composer 2.5: Restricción al Ecosistema

Cursor · Fine-tune sobre Kimi K2.5 · Ecosistema Cerrado
IDE Lock-in Propietario Moonshot AI

Composer 2.5, lanzado el 19 de mayo de 2026, no opera como un modelo fundacional con API de consumo genérico. Se trata del resultado de un fine-tuning masivo sobre Kimi K2.5 de Moonshot AI empleando telemetría de sesiones reales de desarrollo dentro del propio editor. El resultado iguala los benchmarks de Claude Opus 4.7 costando oficialmente diez veces menos en tokens de entrada y treinta veces menos en salida.

La limitación estructural es el vendor lock-in: su uso está restringido al IDE de Cursor. Al carecer de endpoints públicos, imposibilita el auto-hospedaje o su integración en arneses de agentes headless.

Modelo Base
Kimi K2.5 (Moonshot AI)
Coste de Input
0.50 USD / 1M tokens
Coste de Output
2.50 USD / 1M tokens
Disponibilidad API
No disponible (Cerrado en IDE)
Caso de uso óptimo

Recomendado exclusivamente si el flujo de trabajo ya reside íntegramente dentro de Cursor y la portabilidad a herramientas externas es prescindible. Para sistemas agénticos desacoplados, Kimi K2.5 vía API abierta representa la opción correcta.


Cohere y la Infraestructura RAG: Command A

Cohere · RAG Enterprise · Embed v4 + Rerank 4
Command A RAG Enterprise 256k Context

El histórico Command R+ ha quedado reemplazado dentro de la arquitectura de Cohere por Command A, su línea generativa actual dotada de una ventana de contexto nativa de 256k. Mantiene su especialización de nicho corporativo alejándose de la competición generalista de DeepSeek, MiMo o Zhipu.

Su ventaja diferencial reside en la integración monolítica con Embed v4 (vectorización semántica multimodal) y Rerank 4 (reordenador semántico de baja latencia). Conjuntamente con Command A, configuran una de las infraestructuras RAG más resilientes para producción, con capacidades multilingües avanzadas en español y un nivel gratuito de 1.000 llamadas API mensuales.

Modelo Principal
Command A
Ecosistema RAG
Embed v4 + Rerank 4
Contexto
256k tokens
Free Tier
1.000 llamadas API mensuales
Caso de uso óptimo

Despliegue de portales de conocimiento corporativo, bases de datos vectoriales acopladas a Grafos o SQL, e indexación documental donde la trazabilidad estricta y citación de fuentes es prioritaria frente a la codificación generalista.


Eficiencia y Reducción del Coste Marginal de Inferencia

Arbitraje de Costes vía CommandCode

El plan Go de CommandCode se amortiza mediante su ratio de conversión interno. La suscripción base (1 USD/mes, que asciende a ~1,22 € tras aplicar IVA y tasas de procesamiento) confiere 10 USD en créditos de cómputo. Aplicado sobre DeepSeek V4.1-Flash con su tarifa off-peak de salida (0.60 USD), el retorno efectivo se dispara hasta las 17 sesiones de refactorización profunda por cada dólar de suscripción. La integración con MiMo-V2.6 aplica su multiplicador de descuento histórico. No obstante, nuestra evaluación empírica actual prioriza GLM-5.3-Flash vía OpenRouter o Freebuff: a 0.045/0.14 USD, el coste directo es tan bajo que el arbitraje de créditos deja de ser la variable crítica.

Nivel Gratuito de DeepSeek

Todo despliegue inicial en DeepSeek recibe automáticamente 5 millones de tokens gratuitos sin vinculación de tarjeta de crédito (vigencia de 30 días, lo que equivale a un pool de ~8.40 USD sobre el modelo Flash para validación de prototipos).

Créditos gratuitos en Google Cloud (Gemini)

Conseguir los 300 USD (261,42 EUR) de créditos para nuevos usuarios en Google Cloud sigue mereciendo la pena para acceder a los últimos modelos de Gemini, pero el proceso se ha vuelto asfixiante. La plataforma exige ahora la conversión explícita a una cuenta de facturación activa mediante un prepago: hace unos meses pedían 10 euros, pero recientemente han subido esa retención a 25 euros. Todo el flujo de configuración inicial para poder usar la API en herramientas como OpenCode es terriblemente burocrático, tedioso y lleno de trabas corporativas.

Al final compensa hasta cierto punto por probar los modelos de frontera, pero hay un problema: al ser muchísimo menos eficientes y más caros que las alternativas de pesos abiertos mencionadas arriba, el saldo vuela rápido y la experiencia resulta un poco decepcionante. Además, es bastante difícil encontrar en la interfaz el botón para solicitar el reembolso de esos 25 euros de prepago, aunque una vez lo encuentras, te devuelven el dinero íntegro y tú te quedas habiendo exprimido los modelos de frontera financiados puramente con sus propios créditos.


Matriz de Selección de Modelos
GLM-5.3-Flash El daily driver de esta auditoría y el nuevo suelo de precio del mercado (0.045/0.14 USD). Agentes de coding, multimodal ligero y propósito general. Es el modelo que mejor me está funcionando ahora mismo, especialmente dentro de Freebuff.
DeepSeek V4.1-Flash Cuando necesites 384K de salida (documentos y refactors extensos), visión documental nativa o explotar la tarifa off-peak con batch processing. Su V4.1 Pro está por llegar.
MiMo-V2.6-Pro / Flash Pro para sesiones agénticas ultra-largas con coherencia implacable (el más resistente a la degradación continua). Flash para volumen multimodal barato. Batch API al 50% para cargas asíncronas.
GLM-5.3 / Prime El rango superior de Zhipu: ingeniería de software de horizonte largo cuando el presupuesto lo permite, y Prime cuando la latencia de salida es crítica.
Cursor Composer 2.5 Si ya trabajas dentro de Cursor como IDE y priorizas relación calidad-precio sobre portabilidad de la API.
Cohere Command A (+ Embed/Rerank) Core para arquitecturas RAG corporativas e indexación inteligente de documentos semánticos en español, no para coding general ni chat de propósito amplio.
¿Te sirvió este artículo?
Compártelo con alguien que también lo necesite.