La carrera por liderar la inteligencia artificial ya no tiene un vencedor indiscutible. Kimi K3, el nuevo modelo de Moonshot AI, ha logrado situarse por delante de GPT-5.6 Sol y Claude Fable 5 en varias pruebas de programación, navegación y automatización, aunque pierde en otras tareas complejas. El resultado confirma que la competición se ha fragmentado: cada modelo destaca en terrenos diferentes.
Las claves de la batalla entre los grandes modelos en 20 segundos
- Kimi K3 lidera varias pruebas de programación prolongada, navegación y hojas de cálculo.
- GPT-5.6 Sol conserva ventaja en otros ejercicios técnicos y de razonamiento.
- Claude Fable 5 sigue por delante en tareas profesionales y desarrollo complejo.
- Moonshot promete liberar los pesos de Kimi K3 el 27/07/2026, pero todavía no están disponibles.
La imagen habitual de esta carrera presenta a los modelos como si compitieran en una única clasificación. En realidad, no existe una prueba capaz de decidir cuál es “el mejor” en todos los escenarios. Un sistema puede programar una interfaz sobresaliente y fallar al mantener un proyecto de software durante horas. Otro puede destacar al investigar en internet, pero necesitar más ayuda para manejar una hoja de cálculo o interpretar un gráfico.
Los resultados publicados por Moonshot muestran precisamente esa diversidad. Kimi K3 gana en algunas de las pruebas utilizadas para medir programación, agentes y trabajo con documentos, mientras GPT-5.6 Sol y Claude Fable 5 dominan otras. La propia empresa china reconoce que su modelo todavía queda por detrás de ambos en rendimiento general y experiencia de uso.
No hay un ganador absoluto
Kimi K3 ha llamado la atención porque se aproxima a los modelos propietarios más avanzados en varias evaluaciones públicas. En Terminal Bench 2.1, que mide la capacidad de trabajar mediante una terminal, obtiene 88,3 puntos, apenas medio punto por debajo de GPT-5.6 Sol.
También lidera Program Bench, con 77,8 puntos, y SWE Marathon, una prueba orientada a sesiones prolongadas de ingeniería de software, donde alcanza 42 puntos. En esta última queda por delante de Claude Opus 4.8, GPT-5.6 Sol y Claude Fable 5.
Sin embargo, el resultado cambia cuando la evaluación se centra en otros tipos de desarrollo. GPT-5.6 Sol encabeza DeepSWE con 73 puntos, frente a los 67,5 de Kimi K3. Claude Fable 5 se impone en FrontierSWE con 86,6, mientras Kimi queda en 81,2.
| Prueba de programación | Modelo líder | Puntuación |
|---|---|---|
| DeepSWE | GPT-5.6 Sol | 73,0 |
| Program Bench | Kimi K3 | 77,8 |
| Terminal Bench 2.1 | GPT-5.6 Sol | 88,8 |
| FrontierSWE | Claude Fable 5 | 86,6 |
| SWE Marathon | Kimi K3 | 42,0 |
La conclusión no es que uno de ellos programe bien y los demás no. Los tres se encuentran en la parte alta, pero responden de forma diferente según la duración de la tarea, las herramientas disponibles, el tipo de repositorio y el entorno que controla al modelo.
Ese último punto importa mucho. Los resultados no se obtuvieron siempre con el mismo sistema. Kimi K3 utilizó en varias pruebas Kimi Code, GPT-5.6 Sol trabajó con Codex y los modelos de Anthropic usaron Claude Code u otros entornos.
Estos programas deciden cómo se entrega el contexto, cuándo se ejecuta una herramienta y cómo se recupera el agente de un error. Por tanto, las pruebas no comparan únicamente al modelo, sino al conjunto formado por modelo, herramientas e instrucciones.
Kimi K3 destaca cuando debe actuar como agente
Las mejores cifras de Kimi K3 aparecen en tareas donde la inteligencia artificial tiene que realizar varios pasos, consultar fuentes y utilizar aplicaciones.
En BrowseComp, una evaluación de navegación e investigación, obtiene 91,2 puntos, por delante de GPT-5.6 Sol, con 90,4, y de Claude Fable 5, con 88. También gana Automation Bench y SpreadsheetBench 2, aunque por márgenes reducidos.
| Prueba de agentes | Kimi K3 | Principal rival |
|---|---|---|
| BrowseComp | 91,2 | GPT-5.6 Sol: 90,4 |
| Automation Bench | 30,8 | GPT-5.6 Sol: 29,7 |
| SpreadsheetBench 2 | 34,8 | Claude Fable 5: 34,7 |
| JobBench | 52,9 | Claude Fable 5: 57,4 |
| GDPval-AA v2 | 1.668 | Claude Fable 5: 1.760 |
Estas evaluaciones intentan aproximarse a la siguiente generación de asistentes: sistemas que no se limitan a contestar preguntas, sino que pueden buscar información, modificar documentos, trabajar con código o completar una serie de acciones.
Kimi supera a sus rivales en algunas de esas tareas, pero Claude Fable 5 conserva ventaja en JobBench y GDPval-AA, dos pruebas que se acercan más al trabajo profesional general. Esto ayuda a explicar por qué Moonshot evita afirmar que su modelo ha superado globalmente a los mejores sistemas cerrados.
La empresa también reconoce dos limitaciones. La primera es que Kimi K3 puede volverse inestable si el programa que lo utiliza no conserva correctamente su historial de razonamiento. La segunda es su tendencia a tomar demasiadas decisiones por iniciativa propia cuando una petición es ambigua.
Esa iniciativa puede resultar útil en un proyecto largo, pero también generar problemas. Un agente que intenta resolverlo todo sin preguntar puede modificar más archivos de los necesarios, instalar componentes no previstos o interpretar incorrectamente la intención del usuario.
GPT-5.6 y Claude mantienen ventajas importantes
GPT-5.6 Sol conserva el mejor resultado en varias pruebas técnicas y visuales. Además de liderar DeepSWE y Terminal Bench, encabeza MMMU-Pro, una evaluación multimodal, y MathVision, centrada en problemas matemáticos presentados mediante imágenes.
Claude Fable 5 destaca en tareas complejas de desarrollo, trabajo profesional y razonamiento visual. Obtiene el mejor resultado en FrontierSWE, JobBench, GDPval-AA y varias pruebas de comprensión de gráficos y documentos.
| Área | Modelo que más destaca en los datos publicados |
|---|---|
| Trabajo con terminal | GPT-5.6 Sol |
| Programación prolongada | Kimi K3 |
| Desarrollo complejo de software | Claude Fable 5 |
| Navegación e investigación | Kimi K3 |
| Tareas profesionales generales | Claude Fable 5 |
| Comprensión visual y matemática | GPT-5.6 Sol y Claude Fable 5 |
| Hojas de cálculo | Kimi K3, por una diferencia mínima |
La igualdad creciente entre modelos plantea además un problema para las clasificaciones. Una diferencia de unas décimas puede cambiar con una actualización, un entorno distinto o una nueva muestra de ejercicios. Presentar cualquier resultado como una victoria definitiva simplifica en exceso una competición que cambia cada pocas semanas.
También debe distinguirse entre pruebas públicas e internas. Moonshot incluye Kimi Code Bench 2.0 y otras mediciones diseñadas por la propia compañía. Pueden aportar información, pero tienen menos valor como comparación independiente que una clasificación gestionada por terceros.
El tamaño de Kimi K3 no significa que utilice todos sus parámetros
Kimi K3 alcanza los 2,8 billones de parámetros, una cifra muy superior a la de numerosos modelos anteriores. Sin embargo, su arquitectura de mezcla de expertos solo activa 16 de los 896 grupos disponibles durante cada operación.
Esto significa que el modelo dispone de una enorme capacidad total, pero no utiliza todo ese cálculo para generar cada palabra. El sistema selecciona las partes que considera más apropiadas según la consulta.
| Característica | Kimi K3 |
|---|---|
| Parámetros totales | 2,8 billones |
| Expertos disponibles | 896 |
| Expertos activados | 16 |
| Ventana de contexto | Un millón de tokens |
| Capacidades | Texto, imágenes y vídeo |
| Infraestructura recomendada | 64 aceleradores o más |
Esta arquitectura permite crecer sin asumir el coste completo de un modelo denso de tamaño parecido. Aun así, Kimi K3 continúa siendo demasiado grande para ejecutarse con facilidad en un ordenador doméstico.
Moonshot recomienda infraestructuras con al menos 64 aceleradores para ofrecer el modelo de forma eficiente. La futura publicación de sus pesos no hará que cualquier usuario pueda instalarlo en su portátil, pero sí permitirá que proveedores, universidades y empresas lo estudien, adapten y ejecuten sin depender exclusivamente de la API oficial.
La apertura puede cambiar precios y dependencia tecnológica
La promesa de liberar los pesos completos antes del 27/07/2026 es uno de los elementos más relevantes del anuncio. Hasta que se publique el modelo y se conozca su licencia definitiva, resulta más preciso describirlo como un sistema con pesos abiertos anunciados.
El término “open source” aplicado a la inteligencia artificial genera debate. Publicar los pesos permite ejecutar y modificar un modelo, pero no significa necesariamente revelar los datos de entrenamiento, el código completo utilizado para crearlo o todos los procesos necesarios para reproducirlo.
Aun con esas limitaciones, un modelo abierto y competitivo puede aumentar la presión sobre las plataformas cerradas. Las empresas tendrían más capacidad para elegir dónde ejecutan sus sistemas, controlar información sensible y negociar precios con los proveedores.
La API de Kimi K3 cuesta oficialmente 3 dólares por millón de tokens de entrada sin caché y 15 dólares por la salida. El precio es solo una parte de la comparación: también cuentan la velocidad, la fiabilidad, la privacidad y el coste de mantener la infraestructura.
La competencia ya no enfrenta únicamente a empresas estadounidenses. Moonshot AI, Alibaba, Zhipu, DeepSeek y MiniMax están aumentando la presencia de los laboratorios chinos en las clasificaciones internacionales. Sus modelos ejercen presión sobre OpenAI, Anthropic, Google y otras compañías que hasta hace poco dominaban casi todas las pruebas.
Esta batalla tampoco puede extrapolarse automáticamente a la robótica, la medicina o la conducción autónoma. Generar código o investigar en internet es diferente de controlar una máquina física o tomar una decisión clínica. Esos campos necesitan datos propios, pruebas de seguridad y validación en el mundo real.
Lo que sí muestran los resultados es que la distancia entre los modelos abiertos y cerrados se ha reducido. Kimi K3 no ha destronado de forma general a GPT-5.6 Sol ni a Claude Fable 5, pero puede vencerlos en tareas concretas y mantenerse cerca en muchas otras.
La próxima fase de la competición no dependerá únicamente de quién obtiene la mayor puntuación. También importará qué modelo cuesta menos, se integra mejor, respeta los datos de sus usuarios y mantiene un comportamiento fiable durante tareas largas.
Preguntas frecuentes
¿Es Kimi K3 mejor que GPT-5.6 y Claude Fable 5?
Depende de la tarea. Kimi gana en algunas pruebas de programación prolongada, navegación y automatización, mientras GPT-5.6 y Claude conservan ventaja en otras evaluaciones.
¿Kimi K3 es ya un modelo abierto?
Sus pesos completos todavía no se han publicado. Moonshot AI ha anunciado que los liberará antes del 27/07/2026 junto con más información técnica.
¿Qué significa que tenga 2,8 billones de parámetros?
Es el tamaño total del modelo, pero solo activa 16 de sus 896 expertos durante cada operación. Esto reduce el cálculo necesario frente a utilizar todos los parámetros al mismo tiempo.
¿Por qué los resultados de los benchmarks pueden variar?
Cada evaluación mide habilidades diferentes y los modelos no siempre utilizan las mismas herramientas. El entorno de ejecución, las instrucciones y los controles de seguridad pueden modificar la puntuación.