Modelos Base Fundacionales (LLMs) para Inferencia Avanzada
Análisis empírico de modelos fundacionales. Capacidades de abstracción, retención en ventanas de contexto extremas y latencia en tareas de producción técnica.
La filosofía detrás de esta selección
Durante años, el acceso a inteligencia artificial de frontera fue un privilegio de quien podía pagar tarifas de varias decenas de dólares por millón de tokens. Eso ha cambiado de forma irreversible. La combinación de licencias Open Weights (MIT, en su mayoría) con una guerra de precios sin precedentes entre laboratorios chinos —DeepSeek, Xiaomi, Moonshot, Alibaba, Zhipu— ha hecho que el coste de inferencia de frontera caiga entre 30 y 100 veces en poco más de un año.
Esta auditoría no pretende coronar “el mejor modelo” en abstracto, sino identificar qué combinaciones de modelo, proveedor y plan de precios democratizan realmente el acceso a la IA: que un desarrollador independiente, una startup de dos personas o un equipo técnico con presupuesto ajustado puedan construir sistemas agénticos serios sin depender de la caridad de una ronda de financiación. Pesos abiertos que se pueden auto-hospedar, cachés de contexto que devoran el coste marginal, y créditos promocionales que merece la pena exprimir: ese es el criterio real de selección.
Estructura de Costes de Inferencia (Referencia Junio 2026)
La economía del token sigue definiendo la viabilidad comercial de los sistemas agénticos. Esta tabla recoge las tarifas oficiales por cada millón de tokens (USD) y los límites de contexto vigentes de las APIs de frontera más relevantes en relación calidad/precio:
| Modelo | Input / 1M (USD) | Output / 1M (USD) | Contexto | Licencia / Tipo |
|---|---|---|---|---|
| DeepSeek V4 Flash | 0.140 | 0.280 | 1M | MIT (Open Weights) |
| DeepSeek V4 Pro | 0.435 | 0.870 | 1M | MIT (Open Weights) |
| MiMo-V2.5 (base) | 0.140–0.400 | 0.280–2.000* | 1M | MIT (Open Weights) |
| MiMo-V2.5-Pro | 0.435 | 0.870 | 1M | MIT (Open Weights) |
| Cursor Composer 2.5 | 0.500 | 2.500 | — | Propietario |
| Cohere Command A | 2.500 | 10.000 | 256k | Propietario |
*El precio de MiMo-V2.5 base varía notablemente según el proveedor: 0.14/0.28 USD en OpenRouter frente a 0.40/2.00 USD en la API oficial de Xiaomi.
Nota sobre DeepSeek: el descuento del 75% sobre V4 Pro que aplicaba como promoción de lanzamiento se ha convertido en precio permanente según la propia DeepSeek. Hablamos de 0.435 USD / 0.870 USD por millón de tokens — una absoluta locura para un modelo de esta capacidad. La presión ha sido tal que MiMo V2.5 Pro ha bajado su tarifa para igualar exactamente este mismo precio y poder competir. Además, si miramos el benchmark de Artificial Analysis, ambos modelos están muy parejos, confirmando este coste como el nuevo suelo para la IA de élite.
DeepSeek V4 (Flash + Pro)
El lanzamiento de la familia DeepSeek V4 el 24 de abril de 2026 sigue siendo el evento de referencia en la economía de la IA en 2026. Un precio de 0.87 USD por millón de tokens de salida se ha consolidado como el estándar de entrada al rango de élite de codificación —entre 28 y 35 veces más barato que Claude Opus 4.8 o GPT-5.5 en el mismo concepto—, reduciendo de forma radical la barrera de adopción de automatización profunda.
La arquitectura MoE presenta dos variantes:
- V4 Flash: 284B de parámetros totales, 13B activos. A 0.14 USD / 0.28 USD por millón de tokens, es el caballo de batalla transaccional: flujos de datos rápidos, clasificación de logs, codificación intermedia. Anota 79,0% en SWE-bench Verified.
- V4 Pro: 1,6T de parámetros totales, 49B activos, contexto de 1M y 80,6% en SWE-bench Verified, empatando con Gemini 3.1 Pro entre los modelos de pesos abiertos.
Consideración crítica geopolítica y de privacidad: como laboratorio extranjero, el uso de la API nativa implica el tránsito de datos por fronteras sensibles (inviable bajo GDPR). La solución sigue siendo explotar la licencia MIT y montar los pesos on-premise con frameworks como vLLM o SGLang.
El truco del caché de contexto sigue siendo la palanca de ahorro más infravalorada: los hits de caché en V4 Flash cuestan apenas 0.0028 USD / millón de tokens frente a los 0.14 USD ordinarios (98% de descuento). Si estructuras de forma consistente los prefijos de tus prompts (system prompt estático, schemas de herramientas), una tasa de caché del 70%+ reduce el coste efectivo de forma drástica.
V4 Flash para agentes cíclicos de alto volumen (ETLs semánticas, summarización, clasificación). V4 Pro para desarrollo general y refactorizaciones arquitectónicas exigentes.
Xiaomi MiMo-V2.5 (Base + Pro)
Esta es la corrección más importante de la actualización: la separación de la familia MiMo-V2.5 en dos arquitecturas especializadas publicadas de forma concurrente, evitando la confusión sobre sus capacidades multimodales.
MiMo-V2.5 (base / “Omni”): modelo nativamente multimodal — procesa texto, imagen, audio y vídeo en una sola arquitectura, con 1M de tokens de contexto. Alcanza 87,7 en Video-MME (competitivo con Gemini 3 Pro) y ofrece rendimiento agéntico cercano a su hermano Pro a aproximadamente la mitad del coste.
MiMo-V2.5-Pro: el especialista agéntico puro, sin capacidades multimodales, optimizado para ingeniería de software compleja. Es un modelo MoE de 1,02 billones de parámetros (42B activos), con tarifa de 0.435 USD / 0.870 USD y arquitectura de atención híbrida (Sliding Window + Global Attention en ratio 6:1) para sostener coherencia en 1M de tokens. Su rasgo de “harness awareness” lo distingue del resto: en lugar de actuar como receptor estático de logs, el modelo poda y resume activamente el historial innecesario centrándose en el objetivo de la sesión, resolviendo el agotamiento de contexto en agentes de larga duración.
MiMo-V2.5-Pro-UltraSpeed: El 9 de junio de 2026 Xiaomi presentó, junto al motor TileRT, un modo acelerado capaz de superar los 1.000 tokens/segundo en un nodo estándar de 8 GPUs gracias a cuantización FP4 y decodificación especulativa DFlash. Es el mismo modelo base, pero iterando ~10 veces más rápido a costa de un multiplicador x3 en la tarifa API. Ideal para trading algorítmico o detección de fraude.
MiMo-V2.5 (base) para flujos de percepción multimodal. MiMo-V2.5-Pro para agentes de coding de sesiones ultra-prolongadas que requieran coherencia semántica implacable a lo largo de cientos de decisiones secuenciales (más resistente a la degradación que DeepSeek V4 Pro en tareas continuadas).
Cursor Composer 2.5: Restricción al Ecosistema
Composer 2.5, lanzado el 19 de mayo de 2026, no opera como un modelo fundacional con API de consumo genérico. Se trata del resultado de un fine-tuning masivo sobre Kimi K2.5 de Moonshot AI empleando telemetría de sesiones reales de desarrollo dentro del propio editor. El resultado iguala los benchmarks de Claude Opus 4.7 costando oficialmente diez veces menos en tokens de entrada y treinta veces menos en salida.
La limitación estructural es el vendor lock-in: su uso está restringido al IDE de Cursor. Al carecer de endpoints públicos, imposibilita el auto-hospedaje o su integración en arneses de agentes headless.
Recomendado exclusivamente si el flujo de trabajo ya reside íntegramente dentro de Cursor y la portabilidad a herramientas externas es prescindible. Para sistemas agénticos desacoplados, Kimi K2.5 vía API abierta representa la opción correcta.
Cohere y la Infraestructura RAG: Command A
El histórico Command R+ ha quedado reemplazado dentro de la arquitectura de Cohere por Command A, su línea generativa actual dotada de una ventana de contexto nativa de 256k. Mantiene su especialización de nicho corporativo alejándose de la competición generalista de DeepSeek o MiMo.
Su ventaja diferencial reside en la integración monolítica con Embed v4 (vectorización semántica multimodal) y Rerank 4 (reordenador semántico de baja latencia). Conjuntamente con Command A, configuran una de las infraestructuras RAG más resilientes para producción, con capacidades multilingües avanzadas en español y un nivel gratuito de 1.000 llamadas API mensuales.
Despliegue de portales de conocimiento corporativo, bases de datos vectoriales acopladas a Grafos o SQL, e indexación documental donde la trazabilidad estricta y citación de fuentes es prioritaria frente a la codificación generalista.
Eficiencia y Reducción del Coste Marginal de Inferencia
El plan Go de CommandCode se amortiza mediante su ratio de conversión interno. La suscripción base (1 USD/mes, que asciende a ~1,22 € tras aplicar IVA y tasas de procesamiento) confiere 10 USD en créditos de cómputo. Aplicado sobre DeepSeek V4 Pro, que goza de un descuento mayorista del 75%, el retorno efectivo se dispara hasta los 40 USD de inferencia nominal. La integración con MiMo-V2.5 aplica un multiplicador de descuento del 99%. No obstante, nuestra evaluación empírica indica que DeepSeek mantiene una mayor rentabilidad agregada por tarea en escenarios reales debido a un funcionamiento más agresivo en la retención del caché de contexto.
Todo despliegue inicial en DeepSeek recibe automáticamente 5 millones de tokens gratuitos sin vinculación de tarjeta de crédito (vigencia de 30 días, lo que equivale a un pool de ~8.40 USD sobre el modelo V4 Flash para validación de prototipos).
Conseguir los 300 USD (261,42 EUR) de créditos para nuevos usuarios en Google Cloud sigue mereciendo la pena para acceder a los últimos modelos de Gemini, pero el proceso se ha vuelto asfixiante. La plataforma exige ahora la conversión explícita a una cuenta de facturación activa mediante un prepago: hace unos meses pedían 10 euros, pero recientemente han subido esa retención a 25 euros. Todo el flujo de configuración inicial para poder usar la API en herramientas como OpenCode es terriblemente burocrático, tedioso y lleno de trabas corporativas.
Al final compensa hasta cierto punto por probar los modelos de frontera, pero hay un problema: al ser muchísimo menos eficientes y más caros que las alternativas de pesos abiertos mencionadas arriba, el saldo vuela rápido y la experiencia resulta un poco decepcionante. Además, es bastante difícil encontrar en la interfaz el botón para solicitar el reembolso de esos 25 euros de prepago, aunque una vez lo encuentras, te devuelven el dinero íntegro y tú te quedas habiendo exprimido los modelos de frontera financiados puramente con sus propios créditos.