ia

China acaba de lanzar el modelo IA open-source más grande del mundo y le ganó a Claude Fable 5 en código

ia · 8 min de lectura

China acaba de lanzar el modelo IA open-source más grande del mundo y le ganó a Claude Fable 5 en código

Moonshot AI soltó Kimi K3: 2.8 billones de parámetros, contexto de 1 millón de tokens y el puesto #1 en Frontend Code Arena. Los pesos completos son gratis el 27 de julio. Así de heavy.

China acaba de lanzar el modelo IA open-source más grande del mundo y le ganó a Claude Fable 5 en código

El 16 de julio, mientras la mayoría todavía estaba procesando el lanzamiento de GPT-5.6, Moonshot AI pegó en la mesa con Kimi K3: el modelo de inteligencia artificial con pesos abiertos más grande que ha existido. No es exageración. Son 2.8 billones de parámetros. El anterior récord en open-weight estaba en 1.6 billones. Y la cereza del pastel: en el benchmark de código frontend más popular del momento, le quitó el primer lugar a Claude Fable 5.

Para los devs en México y LATAM esto tiene implicaciones reales, porque desde el 27 de julio los pesos completos son públicos y gratuitos.

Qué es Kimi K3 y por qué ese número de parámetros no es el que importa

Moonshot AI es la startup china detrás de Kimi, el asistente de IA que ya pelea con Claude y ChatGPT en el mercado asiático. Con K3, no solo lanzaron el modelo open-weight más grande del mundo sino que apostaron por una arquitectura que hace que el número bruto de parámetros sea un poco trampa.

K3 es un modelo Mixture-of-Experts (MoE). Tiene 896 expertos en su interior pero solo activa 16 de ellos por cada token procesado. Eso equivale a unos 50 mil millones de parámetros activos por cada inferencia, no 2.8 billones. La gracia está en que el modelo tiene acceso a toda esa capacidad especializada sin quemarla toda al mismo tiempo. Más eficiente, más rápido, más barato por llamada.

La arquitectura usa tres innovaciones propias:

  • Kimi Delta Attention (KDA): en vez de calcular atención completa capa por capa, calcula la diferencia respecto a la capa anterior. Más barato computacionalmente y con mejor flujo de información.
  • Stable LatentMoE: maneja el ruteo entre los 896 expertos con Quantile Balancing para evitar que algunos expertos trabajen de más y otros no hagan nada.
  • Attention Residuals: permite que las capas profundas consulten representaciones de capas anteriores, algo especialmente útil en modelos MoE grandes.

La ventana de contexto es de 1 millón de tokens con visión nativa incluida.

El número que importa: #1 en Frontend Code Arena

El benchmark que le dio el spotlight a Kimi K3 fue el Frontend Code Arena de LMArena, donde los usuarios evalúan código frontend generado por modelos de IA en escenarios reales. K3 sacó 1,679 puntos, dejando a Claude Fable 5 en segundo lugar con 1,631 y a GPT-5.6 Sol en tercero con 1,618. Además ganó primero en seis de siete categorías de frontend.

Para que entiendas qué tan notable es: la versión anterior, Kimi K2.6, ocupaba el lugar 18 de esa misma lista. K3 subió 17 lugares de golpe.

Esto es relevante para cualquier dev que use IA para escribir código web. En esa tarea concreta, K3 supera a los modelos más caros del mercado, incluyendo Fable 5.

Benchmarks honestos: ¿es mejor que Claude en todo?

No. Y hay que decirlo directo.

En el Artificial Analysis Intelligence Index (que mide rendimiento general), Kimi K3 queda en cuarto lugar con un score de ~57. Fable 5 lleva ~60, GPT-5.6 Sol ~59. Es un modelo muy capaz, pero en tareas de razonamiento general y agentes complejos todavía hay brecha.

Donde sí compite muy fuerte:

BenchmarkKimi K3Claude Fable 5
Frontend Code Arena1,679 (1er lugar)1,631
GPQA Diamond93.5%no reportado
Terminal-Bench 2.188.3%no reportado
GDPval v2 (Elo)1,6681,760
Cost per task$0.94$2.75

De 14 benchmarks comparados head-to-head con Fable 5, K3 gana 6 y pierde 8. No es el modelo más inteligente del planeta, pero en código y eficiencia tiene argumentos reales.

El precio es donde K3 rompe todo

Aquí es donde la cosa se pone interesante para los devs de LATAM. La estructura de precios de la API es:

  • Input (cache miss): $3.00 USD por millón de tokens
  • Input (cache hit): $0.30 USD por millón de tokens
  • Output: $15.00 USD por millón de tokens

Claude Fable 5 cobra $10/$50 por millón de tokens de input/output. O sea, K3 es aproximadamente un tercio del costo de Fable 5. En tareas de código donde la tasa de cache hit supera el 90% (según Moonshot), el input efectivo cae a $0.30 por millón. Para equipos chicos o startups mexicanas, eso cambia la ecuación por completo.

Como ya hablamos en nuestra guía práctica de GPT-OSS para devs en México, el acceso a modelos frontier de bajo costo es lo que está democratizando el desarrollo de IA en la región. K3 llega a ese mismo hueco pero con ventaja en código.

Open weights el 27 de julio: qué significa realmente

Los pesos completos del modelo estarán disponibles para descarga gratuita el 27 de julio de 2026. Esto es históricamente significativo: es la primera vez que un modelo de clase 3T tiene pesos abiertos. Permite que cualquier empresa, investigador o equipo lo descargue, modifique, afine y corra en su propia infraestructura sin pagar licencia.

El detalle es que “correrlo localmente” tiene sus matices:

  • Full precision: necesitas alrededor de 1.4 TB de memoria GPU. O sea, un clúster serio.
  • Cuantización INT4: baja a ~600 GB. Sigue siendo heavy, necesitas múltiples H100 o H200.
  • Cuantización Q4 de la comunidad: aquí viene lo interesante. Con una cuantización agresiva sobre los ~50B parámetros activos por forward pass, podría caber en 20-25 GB de VRAM. Eso entra en una RTX 5090 (32 GB). No es ideal, pero funciona para experimentar.

Para producción real, necesitas mínimo 8x H100/H200 con tensor parallelism. No es para cualquiera, pero el hecho de que sea posible en hardware consumer ya es una chimba comparado con los modelos propietarios que simplemente no puedes tocar.

Disponibilidad hoy y el problema del GPU crunch

Desde el 16 de julio puedes usar K3 en kimi.com, la app móvil de Kimi, Kimi Work, Kimi Code y la API de Moonshot. Hay dos variantes:

  • K3 Max: para chat general y tareas agénticas
  • K3 Swarm Max: para procesamiento paralelo a gran escala

El problema real es que la demanda fue tan alta que Moonshot tuvo que pausar temporalmente las suscripciones de pago. El GPU crunch es real: lanzar el modelo más grande del mundo de open-weight mientras lo sirves como API a millones de usuarios al mismo tiempo es un problema de infraestructura brutal. La situación ya se estabilizó pero muestra que incluso para Moonshot el cómputo es un cuello de botella.

Esto conecta directamente con lo que estamos viendo en LATAM: el acceso a infraestructura de cómputo masivo es el verdadero límite. En ese contexto, proyectos como Coatlicue, la supercomputadora de IA más potente de LATAM que México está construyendo, toman más sentido que nunca.

China y las restricciones de cómputo de EUA

Tom’s Hardware reportó que Kimi K3 fue desarrollado mientras China opera bajo restricciones de exportación de semiconductores de alta gama impuestas por Estados Unidos. El hecho de que lograron entrenar un modelo de esta escala bajo esas condiciones es, en sí mismo, una señal de la capacidad técnica que China ha desarrollado internamente.

Por qué esto importa para devs en México

La neta es que K3 abre varias puertas concretas:

  1. API más barata: si ya usas Claude o GPT para proyectos de código, K3 puede reducir costos hasta 70% en las mismas tareas.
  2. Open weights gratis: desde el 27 de julio puedes descargarlo, afinarlo con tus datos y desplegarlo sin pagar licencia.
  3. Especialización en frontend: si tu stack es React, Vue, Svelte o cualquier framework web, en este momento K3 es el mejor modelo disponible en ese nicho específico.
  4. 1M de tokens de contexto: mete un repo entero al contexto y que K3 lo analice completo. Eso cambia cómo puedes usarlo para revisión de código o refactorización.

¿Es el mejor modelo de IA del mundo? No todavía. Fable 5 sigue siendo más inteligente en términos generales. Pero es el mejor en código frontend, cuesta un tercio, y en menos de una semana sus pesos serán totalmente libres.

Para los devs en LATAM que están buscando una alternativa real a pagar suscripciones de $20-$200 USD al mes a empresas gringas, Kimi K3 es probablemente la noticia más importante de julio 2026.

¿Ya lo probaste? ¿Cambiarías tu stack de IA por K3? Cuéntanos en los comentarios qué benchmark o tarea quieres que probemos primero cuando saquen los pesos.

Fuentes

Comentarios

No te pierdas ningún post

Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.

También te puede interesar