Kimi K3 (Kimi 3.0): benchmarks, costes y novedades de la IA china
Por Daniele Forciniti

Kimi K3 —que mucha gente llama también Kimi 3.0— es el nuevo modelo de Moonshot AI, lanzado el 16 de julio de 2026, y con sus 2,8 billones de parámetros es el modelo «de pesos abiertos» más grande jamás publicado, es decir, descargable por cualquiera que tenga medios para moverlo. En kimi.com se usa gratis con chat ilimitado, y es primero del mundo en la clasificación de desarrollo frontend, por delante de Claude Fable 5. Pero hay un detalle que casi nadie cuenta: por API es el modelo chino más caro jamás publicado. Gratis para usarlo, todo menos económico para integrarlo.
Desde hace más de 10 años trabajo con webs, SEO y contenidos, y sigo de cerca los modelos chinos desde que DeepSeek revolvió el mercado. Aquí te cuento qué hace de verdad Kimi K3, cuánto cuesta en serio y —sobre todo— cuándo compensa y cuándo no.
Qué es y por qué se habla tanto de él
Moonshot AI es un laboratorio chino, y Kimi K3 es su modelo más capaz: multimodal (también entiende imágenes), pensado para programación, razonamiento y automatización del trabajo intelectual. La ventana de contexto es de 1 millón de tokens, al nivel de los mejores modelos occidentales, frente a los 200.000 de la generación anterior. Los tokens son los trocitos en los que el modelo parte el texto, de media algo menos de una palabra cada uno: un millón de tokens son unas 750.000 palabras, una decena de novelas. En la práctica puedes darle un archivo entero y lo tiene todo presente mientras responde.
El número que da titulares son los 2,8 billones de parámetros. Los parámetros son los valores numéricos que el modelo ajusta durante el entrenamiento: juntos son su memoria y su destreza, y cuantos más hay, más cosas puede aprender. Con esa cifra Kimi K3 le arrebata a DeepSeek (que se quedaba en 1,6 billones con el v4 Pro) el récord del modelo abierto más grande de la historia.
La arquitectura, eso sí, es lista, y aquí conviene explicar unas siglas que se leen en todas partes: Mixture of Experts, o sea «mezcla de expertos». En vez de ser un único cerebro que se enciende entero con cada pregunta, el modelo está dividido en 896 subredes especializadas — a eso llaman «expertos» — y para cada trocito de texto activa solo 16, las que hacen falta en ese momento. Es como tener un despacho con 896 profesionales y convocar a la reunión solo a los 16 que tocan ese día. El modelo sigue siendo enorme, pero en cada petición trabaja una parte pequeña — y así Moonshot declara una eficiencia unas 2,5 veces mejor que Kimi K2.
Es la tercera sacudida que llega de China después de DeepSeek y Manus, y esta vez no se juega solo con el precio: se juega con el rendimiento.
Benchmarks de Kimi K3: hasta dónde llega de verdad
Empecemos por el cuadro general. En el Intelligence Index de Artificial Analysis, que mide los modelos de forma independiente, Kimi K3 marca 57,1 puntos y se coloca cuarto entre 189 modelos: por detrás de Claude Fable 5 y de las dos versiones de GPT-5.6 Sol, pero por delante de Claude Opus 4.8 (55,7) y GPT-5.5.
| Modelo | Intelligence Index | Coste por tarea |
|---|---|---|
| Claude Fable 5 | 59,9 | 2,75 $ |
| GPT-5.6 Sol (max) | 58,9 | 1,04 $ |
| Kimi K3 | 57,1 | 0,94 $ |
| Claude Opus 4.8 | 55,7 | 1,80 $ |
El dato interesante es la columna de costes: 0,94 $ por tarea completada, menos que GPT-5.6 Sol (1,04 $) y alrededor de la mitad que Opus 4.8 (1,80 $). Tres puntos de índice por debajo del mejor, pero a un tercio del coste de Fable 5. Es el mismo razonamiento que hacía en el artículo sobre cuánto estás pagando de verdad por la IA: los últimos puntos de rendimiento siempre son los más caros.
Luego hay dos resultados donde Kimi K3 lo hace aún mejor:
- Desarrollo frontend: es primero del mundo en la Frontend Code Arena con 1.679 puntos, por delante de Claude Fable 5 y de GPT-5.6 Sol. Para quien construye interfaces web es el dato más relevante de todos.
- Trabajo de conocimiento de largo recorrido: Elo de 1.547, solo por detrás de Claude Fable 5. El Elo es el sistema de puntuación que nació en el ajedrez: se enfrenta a los modelos entre sí y quien gana sube, quien pierde baja. Respecto a la versión anterior (K2.6) son 732 puntos más: un salto enorme en pocos meses.
- Eficiencia: consume un 21% menos de tokens que K2.6 para completar las mismas tareas.
Una precisión necesaria: buena parte de las comparativas publicadas por Moonshot son mediciones internas, hechas con entornos y configuraciones distintas. Los números de Artificial Analysis son independientes; los de la empresa hay que cogerlos con la cautela que se usa siempre con los datos de quien vende.
Cuánto cuesta de verdad: la paradoja del «gratis»
Aquí está la parte que casi nadie explica bien, y que lo cambia todo según cómo uses el modelo.
Si lo usas como persona, en kimi.com o desde la app, hay un plan gratuito con chat ilimitado para uso básico. Desde ese punto de vista sí, es gratis: te registras y lo pruebas, igual que harías con ChatGPT o Claude en su versión free. Y sí, puedes chatear en español.
Si lo integras en un proyecto — es decir, lo conectas a tu web, a tu gestión interna o a una app mediante API, el canal con el que dos programas se hablan entre ellos — la historia es otra:
| Concepto | Precio (por millón de tokens) |
|---|---|
| Entrada desde caché | 0,30 $ |
| Entrada normal | 3,00 $ |
| Salida | 15,00 $ |
Entrada es lo que le mandas al modelo (la pregunta, los documentos, el código), salida es lo que te responde. Tres dólares de entrada y quince de salida colocan a Kimi K3 al nivel de la serie Claude Sonnet, y lo convierten en el modelo más caro jamás publicado por un laboratorio chino. Para entender el salto: la versión anterior, Kimi K2.6, costaba 0,95 $ y 4 $. Es una subida de más de tres veces.
Hay un atenuante serio: la caché a 0,30 $. La caché es la memoria de lo que ya has enviado: si vuelves a mandar el mismo texto — las instrucciones fijas, los ficheros de un proyecto — no lo pagas otra vez a precio completo, sino a una décima parte. Moonshot declara más de un 90% de reutilización de caché en cargas de programación, y si en tu caso es realmente así el coste efectivo se desploma. Pero es un dato de la empresa, que conviene verificar en tu propio flujo de trabajo antes de echar cuentas.
En mis años de trabajo he aprendido a desconfiar de la palabra «gratis» cuando se refiere a herramientas que luego tienes que integrar. Aquí la fórmula honesta es: gratis para probarlo y usarlo a mano, caro si construyes un producto encima.
«Pesos abiertos» no significa que puedas usarlo en tu casa
Kimi K3 se presenta como modelo open-weight, «de pesos abiertos». Los pesos son el resultado del entrenamiento: un fichero enorme con todos los valores numéricos que el modelo ha aprendido — en el fondo, el modelo mismo. En productos cerrados como ChatGPT ese fichero se queda en los servidores de la empresa y no sale de ahí; publicarlo significa que en teoría puedes descargar el modelo y alojarlo en tus servidores, sin depender de nadie. En teoría.
En la práctica hace falta un pequeño centro de datos. La documentación oficial de vLLM habla de al menos 8 GPU GB300, las tarjetas más potentes que existen hoy, y de configuraciones multinodo para aguantar tráfico real. Con las H100, mucho más habituales, hacen falta 32, y para servicio a gran escala se llega a 64. Ojo: no son gigas de memoria, son tarjetas aceleradoras físicas, de decenas de miles de euros cada una. Traducido: no es cosa para una empresa normal, sino para grandes proveedores cloud, gobiernos y organizaciones con infraestructuras potentes. La autonomía que prometen los pesos abiertos, para la inmensa mayoría de las empresas, se queda en teoría.
En los plazos Moonshot sí cumplió: los pesos se publicaron el 27 de julio de 2026 en Hugging Face, en el repositorio moonshotai/Kimi-K3, con 96 ficheros de pesos y ya miles de descargas. Pero hay un detalle que conviene mirar de cerca: la licencia no es una estándar tipo MIT o Apache, sino una licencia personalizada llamada «kimi-k3». «Pesos abiertos» no equivale automáticamente a «open source» en el sentido clásico: las condiciones de uso hay que leerlas antes de construir nada encima.
Y no es un detalle menor en Europa, porque desde el 2 de agosto de 2026 se aplica el Reglamento europeo de IA, cuyas exenciones para modelos open source dependen justamente de las condiciones de licencia.
Una prueba independiente en español baja el entusiasmo
Más allá de los números oficiales, vale la pena mirar las pruebas de quien no tiene intereses en juego. Un benchmark independiente que compara 70 modelos sobre tareas en español coloca a Kimi K3 en el puesto once por calidad pura, con 8,22 sobre 10 — a solo 0,19 puntos del primero. En calidad, por tanto, está: prácticamente empatado con Claude Opus 4.8 (8,30).
El problema llega cuando se pone la calidad junto al coste y la velocidad. En esa clasificación combinada Kimi K3 cae al puesto treinta y uno de 70. Por dos motivos:
- Es lento: genera unos 34 tokens por segundo, frente a una media de 60 en los modelos de frontera. GPT-5.6 Luna hace 113.
- Cuesta: unos 23 $ cada mil llamadas, frente a los 9 $ de GPT-5.6 Luna, que además en la misma prueba saca mejor calidad (8,41).
- Como referencia, GLM 5.2 alcanza la calidad de Opus a una cuarta parte del precio (0,95 $ / 3 $).
Un apunte que nos toca de cerca a quienes publicamos en español: el autor advierte que, para textos destinados al público, conviene revisar la salida antes de publicarla. No es un defecto exclusivo de este modelo, pero con contenidos en castellano conviene tenerlo presente.
Existe, eso sí, una salida que casi nadie destaca: la suscripción Kimi Code, en torno a los 50 $ al mes. Pagando una cuota fija en lugar del consumo, las cuentas cambian por completo y el modelo pasa a ser interesante. Es la misma lógica de siempre: no es el modelo lo que es caro o barato, es la forma en que lo pagas.
A quién le conviene de verdad
Juntando rendimiento, costes y límites, mi lectura es esta:
- Si desarrollas interfaces web: pruébalo en serio. Ser primero en la Frontend Code Arena por delante de Fable 5 no es un detalle, y comprobarlo en kimi.com es gratis.
- Si solo quieres probar una IA potente sin pagar: el plan gratuito con chat ilimitado es una buena puerta de entrada.
- Si vas a usarlo mucho para programar: mira la suscripción Kimi Code antes que la API por consumo. La diferencia en la factura es grande.
- Si tienes que integrarlo en un producto: echa bien las cuentas. A 3$/15$ y 34 tokens por segundo no es ni la opción barata ni la rápida.
- Si trabajas con datos sensibles o clientes públicos: haz revisar la licencia personalizada antes de ponerlo en producción.
Si estás comparando con las alternativas occidentales, lo conté en la guía sobre Opus 5 de Anthropic y en la comparativa entre Fable 5 y ChatGPT 5.6.
Qué queda cuando quitas el ruido
Kimi K3 es un modelo serio, y el primer puesto en frontend lo demuestra. Pero el relato que circula —»la IA china gratis que gana a todos»— es cómodo e impreciso. La verdad es más interesante: es gratis para usarlo a mano, es competitivo en coste por tarea, y al mismo tiempo es el modelo chino más caro de la historia para quien lo integra. Y encima, lento.
El dato que en mi opinión importa más que ningún otro es otro: +732 puntos Elo respecto a la versión anterior en pocos meses. No impresiona la puntuación absoluta, impresiona la velocidad a la que se está cerrando la distancia. Quien daba por hecho que los modelos chinos eran una copia barata de los americanos tiene que actualizar la idea.
El consejo sigue siendo el de siempre: pruébalo en tu trabajo real antes de decidir. Los benchmarks miden tests, no tu oficio.
Preguntas frecuentes
¿Qué es Kimi K3?
Es el modelo de inteligencia artificial de Moonshot AI, laboratorio chino, lanzado el 16 de julio de 2026. Tiene 2,8 billones de parámetros, lee hasta 1 millón de tokens de una vez (unas 750.000 palabras) y es el modelo de pesos abiertos más grande jamás publicado: los pesos, o sea el fichero con todo lo que ha aprendido, son públicos y descargables. Mucha gente lo llama también Kimi 3.0.
¿Kimi K3 es realmente gratis?
Sí para uso personal: en kimi.com y en las apps hay un plan gratuito con chat ilimitado para uso básico, y puedes usarlo en español. No para desarrolladores: por API cuesta 3 $ por millón de tokens de entrada y 15 $ de salida, el precio más alto aplicado nunca por un laboratorio chino.
¿Kimi K3 es mejor que ChatGPT o Claude?
Depende de la tarea. En el Intelligence Index es cuarto con 57,1 puntos, por detrás de Claude Fable 5 y GPT-5.6 Sol. Sin embargo es primero del mundo en desarrollo de interfaces frontend, por delante de ambos, y cuesta menos por tarea completada (0,94 $).
¿Se han publicado los pesos de Kimi K3?
Sí, el 27 de julio de 2026 en Hugging Face, en el repositorio moonshotai/Kimi-K3. Ojo con la licencia: no es una estándar como MIT o Apache, sino una licencia personalizada llamada «kimi-k3», que conviene leer antes de usarla en un producto.
¿Puedo instalar Kimi K3 en mis servidores?
En teoría sí, porque es un modelo de pesos abiertos, pero hacen falta al menos 8 GPU GB300 según la documentación oficial de vLLM, que pasan a 32 con las H100, más habituales, y hasta 64 para servicio a gran escala. Hablamos de tarjetas aceleradoras físicas, no de memoria: en la práctica está al alcance solo de grandes proveedores cloud y organizaciones con infraestructuras potentes.
¿Es rápido Kimi K3?
No especialmente. En pruebas independientes genera unos 34 tokens por segundo, frente a una media de 60 en los modelos de frontera y los 113 de GPT-5.6 Luna. Si necesitas respuestas inmediatas, no es su punto fuerte.
¿Cuál es la forma más barata de usarlo?
La suscripción Kimi Code, de unos 50 $ al mes, en lugar de pagar por consumo vía API. Con uso intensivo la diferencia en la factura es notable, porque por token Kimi K3 sale caro.
Fuentes
- Moonshot AI – web oficial
- Hugging Face – pesos oficiales moonshotai/Kimi-K3
- Artificial Analysis – Intelligence Index y coste por tarea
- Cristian Tala – Benchmark independiente en español de Kimi K3
- Simon Willison – Kimi K3: precios, benchmarks y prueba práctica
Opus 5 de Anthropic: todas las novedades, los benchmarks y
Opus 5 de Anthropic: todas las novedades, los benchmarks y los costes Por Daniele Forciniti Claude Opus 5 es el nuevo modelo…
Estás pagando la IA 10 veces de más: los 3
Estás pagando la IA 10 veces de más: los 3 modelos que uso yo (y lo que cuestan de verdad) Por…
NotebookLM ha muerto: bienvenido Gemini Notebook
NotebookLM ha muerto: bienvenido Gemini Notebook (y esta vez cambia de verdad) Por Daniele Forciniti Gemini Notebook es el nuevo nombre de…
Google AI Overviews ya genera imágenes: qué cambia para tu
Google AI Overviews ya genera imágenes: qué cambia para tu web Por Daniele Forciniti Google anunció el 14 de julio de 2026…
Fable 5 VS ChatGPT 5.6: benchmarks y costes comparados
Fable 5 VS ChatGPT 5.6: benchmarks y costes comparados Por Daniele Forciniti En la comparativa entre Fable 5 y ChatGPT 5.6 no…
El navegador se convierte en un agente: empieza la guerra
En 2026 el navegador ya no sirve solo para navegar: se está convirtiendo en un agente de IA capaz de…