Modèles IA 11 min de lecture Intermédiaire

Kimi K3 : prix, capacités et limites au lancement

Architecture, contexte et prix API de Kimi K3

Kimi K3 est le modèle phare annoncé par Moonshot AI le 16 juillet 2026. Il combine vision native, 1M de tokens de contexte et une architecture Mixture of Experts de 2,8T de paramètres, avec 16 experts actifs sur 896. L’API officielle facture 0,30$ l’entrée en cache, 3$ l’entrée hors cache et 15$ la sortie par million de tokens. Les poids complets sont annoncés pour le 27 juillet 2026. Cette page distingue donc les faits publiés par Moonshot des performances qui restent à reproduire sur des cas métier.

Que sait-on réellement de Kimi K3 ?

Moonshot AI présente Kimi K3 comme son modèle phare pour le code de longue durée, le travail documentaire et le raisonnement. Le modèle accepte nativement les images et annonce un contexte de 1M de tokens. Son architecture atteint 2,8T de paramètres au total, avec 16 experts actifs sur 896 pour chaque token.

Ce chiffre décrit la taille de l’architecture, pas la quantité de calcul mobilisée à chaque réponse. Le mécanisme Mixture of Experts active une fraction du réseau, ce qui permet d’augmenter la capacité totale sans payer le coût des 2,8T de paramètres à chaque token.

Moonshot cite aussi Kimi Delta Attention, Attention Residuals et Stable LatentMoE. Ces mécanismes visent la stabilité sur les longues séquences et l’efficacité de l’inférence. Leur intérêt opérationnel devra être confirmé avec les poids, les outils de déploiement et des tests reproductibles.

Où Kimi K3 est-il disponible ?

Au 18 juillet 2026, Kimi K3 est disponible dans Kimi.com, Kimi Work, Kimi Code et l’API Kimi. L’identifiant API annoncé pour la plateforme générale est kimi-k3. Kimi Code utilise aussi l’identifiant k3 dans son offre destinée aux agents de développement.

Les surfaces ne partagent pas nécessairement les mêmes quotas, points d’accès ou options de raisonnement. La documentation Kimi Code présente des interfaces compatibles OpenAI et Anthropic, tandis que la plateforme API générale conserve sa propre facturation à l’usage. La configuration exacte doit être vérifiée sur le produit réellement utilisé.

Moonshot annonce la publication des poids complets pour le 27 juillet 2026. Une installation locale ou un audit indépendant des poids ne peut donc pas être présenté comme disponible au 18 juillet.

Combien coûte l’API Kimi K3 ?

Type de tokensPrix pour 1M tokensPoint de vigilance
Entrée avec cache0,30$Le taux de cache réel dépend de la répétition des préfixes
Entrée sans cache3$Les gros contextes uniques peuvent faire monter la facture
Sortie15$Le raisonnement et les longues réponses augmentent le coût

Moonshot annonce un taux de cache supérieur à 90% sur ses workloads de code. Ce chiffre décrit son infrastructure et ses usages, sans garantir le même résultat pour un produit externe dont les prompts, dépôts et sessions changent fréquemment.

Dans quels cas Kimi K3 mérite un test ?

Le modèle devient intéressant quand une tâche combine un contexte volumineux, du code réparti sur plusieurs fichiers et une exécution longue. Une base documentaire multimodale, un dépôt important ou une analyse croisée de documents et d’images correspondent à des scénarios cohérents.

Pour une classification simple, une extraction courte ou une réponse répétitive, cette capacité risque d’être surdimensionnée. Un modèle plus léger réduit la latence et la facture, tout en laissant Kimi K3 comme niveau supérieur lorsque le premier modèle échoue.

Le guide choisir un modèle par tâche, coût et confidentialité fournit une matrice pour cadrer ce test sans transformer le lancement d’un modèle en décision de stack.

Protocole de test recommandé après la sortie des poids

  1. Figer 30 tâches représentatives, dont des échecs connus de la stack actuelle.
  2. Comparer l’API officielle et, si l’infrastructure le permet, une exécution des poids publiés.
  3. Mesurer la récupération dans le long contexte, les appels d’outils et la stabilité sur plusieurs étapes.
  4. Journaliser les tokens non cachés, le temps jusqu’au premier token et le coût par résultat accepté.
  5. Contrôler la licence, la mémoire requise et la compatibilité des moteurs d’inférence avant toute production.

Cette page sera mise à jour après un protocole terrain reproductible. En attendant, les performances citées restent celles de Moonshot et ne sont pas reformulées comme des observations indépendantes.

Limites testées et points à vérifier

Cette page repose sur les sources officielles disponibles. Aucun test terrain Meydeey n’est revendiqué lorsque le produit n’a pas encore été évalué dans un protocole reproductible.

  • Aucun test terrain Meydeey n’est revendiqué dans cette page au 18 juillet 2026.
  • Les poids complets sont annoncés pour le 27 juillet 2026 et ne sont donc pas encore vérifiables localement.
  • Les benchmarks du billet de lancement viennent de Moonshot et doivent être reproduits sur des tâches réelles.

Sources officielles et méthode

Les informations instables ont été vérifiées le 18 juillet 2026 sur les pages officielles ci-dessous. Les faits publiés par un éditeur sont distingués des observations terrain et des limites qui restent à reproduire.

Consulter la méthode éditoriale et les règles de vérification.

Construire une stack IA qui reste maîtrisable

Le LABO IA t’aide à choisir les modèles, cadrer les coûts et mettre en production des systèmes vérifiables sans dépendre d’un seul fournisseur.

Découvrir le programme

Questions fréquentes

Kimi K3 est-il open source ?

Moonshot présente Kimi K3 comme un modèle ouvert, mais annonce la publication des poids complets pour le 27 juillet 2026. Au 18 juillet, il faut donc distinguer l’annonce d’ouverture de la disponibilité effective des poids.

Combien coûte l’API Kimi K3 ?

Le billet officiel affiche 0,30$ par million de tokens d’entrée en cache, 3$ hors cache et 15$ en sortie. La facture réelle dépend fortement du taux de cache et de la longueur des réponses.

Peut-on utiliser Kimi K3 dans un agent de code ?

Oui. Kimi K3 est disponible dans Kimi Code avec l’identifiant k3. La documentation prévoit aussi des points d’accès compatibles OpenAI et Anthropic, selon le produit et l’abonnement utilisés.