
Dans cet article (4)
Analyse économique du cache KV d’AgentX InferenceXv3
Points clés
- Évaluez les agents avec un contexte long et des traces multi-tours, pas seulement avec des démonstrations propres à échange unique.
- Suivez le taux de succès du KVCache et le coût total en tokens comme métriques de production essentielles pour les charges de travail des agents.
- Comparez les piles de service et les plateformes ensemble, car le coût dépend de l’ensemble de l’enveloppe d’inférence.
Les charges de travail des agents ne sont pas seulement des conversations plus longues. Ce sont des machines à coûts complexes et multi-tours, où le comportement de service compte désormais autant que le choix du modèle.
Les charges de travail des agents ne se résument pas à des conversations plus longues. Ce sont des machines de coût complexes et multi-tours, où le comportement de service compte désormais autant que le choix du modèle.
Un chatbot demande une réponse. Un agent arrive avec une valise à roulettes, trois sous-agents, un million de tokens de contexte et la conviction sincère que votre budget d’inférence n’est qu’une suggestion. Le rapport AgentX InferenceXv3 de SemiAnalysis se situe dans cet espace inconfortable mais utile entre la magie des démos et les calculs de production. Les points principaux sont inhabituellement directs : SemiAnalysis cite un jeu de données à 3 millions de dollars, une longueur de contexte de plus de 1 million, des charges de travail multi-tours, des sous-agents et un taux de réussite KVCache de plus de 95 %. Ce n’est pas un concours de beauté entre modèles. C’est un audit de pile de service déguisé en détective.
La mise à jour, selon SemiAnalysis
SemiAnalysis décrit AgentX 1.0 comme un benchmark d’inférence de codage agentique multi-tours, entièrement open source, avec un contexte de 1 million, publié sous licence Apache 2.0. Le rapport présente cette sortie autour d’une question précise : savoir si le rempart CUDA tient dans l’inférence agentique. Je laisserai le combat de puces à Theo, parce que c’est lui qui règne sur le dôme du tonnerre en silicium. Pour les bâtisseurs, le point immédiat est plus simple : le benchmark est conçu autour du comportement des agents, pas seulement d’un chat poli où l’on entre une invite et l’on reçoit une réponse.
SemiAnalysis indique aussi que les charges de travail agentiques multi-tours à long contexte ont connu une croissance rapide depuis le point d’inflexion de Claude Code en novembre 2025, et qu’elles dominent désormais le trafic de l’inférence en production. Le même rapport affirme que les dépenses agentiques Enterprise d’OpenAI ont dépassé les dépenses ChatGPT en avril 2026. Ce sont de grandes affirmations, et la conséquence opérationnelle est plus importante que l’étiquette marketing. Si votre benchmark ressemble encore à un seul échange bien rangé, votre banc de test mesure peut-être une posture de yoga pendant que la production assemble des meubles dans un camion en mouvement.
Le champ de bataille est
le comportement du cache, soutient SemiAnalysis à travers ce qu’il mesure
La partie la plus importante de l’aperçu de SemiAnalysis est peut-être ce qu’il place côte à côte : longueur de contexte de plus de 1 million, multi-tours, sous-agents et taux de réussite KVCache de plus de 95 %. Cette combinaison indique aux bâtisseurs où la pression se déplace. Les systèmes agentiques accumulent du contexte, reviennent sur le travail précédent et répartissent les tâches entre sous-agents, de sorte que la couche de service doit être évaluée comme une partie du produit, et non comme un détail de plomberie ennuyeux caché derrière la fiche du modèle. La plomberie, malheureusement, c’est là que la cave se remplit d’eau.
Cela ne signifie pas que la qualité du modèle a cessé d’être importante. Cela signifie que la qualité du modèle seule est une explication incomplète du coût et de la latence des agents dès que les charges de travail deviennent longues et multi-tours. SemiAnalysis demande en réalité aux fournisseurs et aux utilisateurs de montrer comment le système se comporte sous la forme du trafic agentique réel. La leçon pratique est de traiter le taux de réussite KVCache comme une métrique de benchmark de premier plan, parce que le rapport le fait, plutôt que comme une note de bas de page destinée aux trois personnes qui lisent les sorties de profileur pour le plaisir.
InferenceX transforme le service agentique en tableau de coûts
L’aperçu complémentaire d’InferenceX de SemiAnalysis présente les coûts d’inférence agentique comme un coût par million de tokens totaux, plus bas étant meilleur. Il indique que les chiffres utilisent la meilleure enveloppe de service observée de chaque plateforme pour le scénario présenté avec chaque modèle, en s’appuyant sur InferenceX, les enquêtes de prix SemiAnalysis Market de juillet 2026 et un modèle TCO de cloud IA. C’est important, car l’inférence agentique ne concerne pas seulement les tokens générés : elle concerne toute l’enveloppe de service autour d’une charge de travail. Le tableur est entré dans la discussion, et il a apporté les justificatifs.
Pour le scénario DeepSeek V4 Pro 1.6T présenté dans InferenceX, le tableau compare B200 Reference, MI355X, B300, GB200 NVL72 et GB300 NVL72. InferenceX liste MI355X à 0,355 $ par million de tokens totaux et le décrit comme 18 % plus cher que B200, avec SGLang et FP4. Il liste B300 à 0,245 $ et le décrit comme 18 % moins cher que B200, également avec SGLang et FP4, tandis que la référence B200 est présentée avec vLLM et FP4. Le point intéressant n’est pas seulement quelle ligne est la moins chère. C’est que la pile logicielle, la précision, la plateforme et la forme de la charge de travail sont désormais inséparables dans l’histoire des coûts.
Ce que les bâtisseurs devraient faire ensuite, d’après SemiAnalysis et
InferenceX Pris ensemble, le rapport AgentX de SemiAnalysis et l’aperçu des coûts d’InferenceX suggèrent une boucle d’évaluation plus utile pour les produits agentiques. Faites des benchmarks avec un long contexte si votre produit utilise un long contexte. Testez les flux de travail multi-tours et à sous-agents si votre produit en dépend. Suivez le taux de réussite KVCache parce que SemiAnalysis met en avant les 95 %+ comme propriété principale, et comparez le coût par million de tokens totaux parce qu’InferenceX l’utilise comme unité de comparaison économique.
La prochaine chose à surveiller est de savoir si davantage de fournisseurs publieront des résultats d’inférence en forme d’agent plutôt que des tours d’honneur en forme de chat. Les bâtisseurs devraient demander des résultats sur la charge de travail qu’ils exécutent réellement, y compris la longueur de contexte, la structure des tours, la pile de service et le coût total en tokens. Les investisseurs devraient aussi y prêter attention, car les marges des agents peuvent dépendre autant de l’efficacité du service que du nom de modèle qui paraît le mieux dans une présentation. Le modèle peut encore être brillant, mais dans le service agentique, le comptable a découvert le cache.