
Neste artigo (4)
Análise econômica do cache KV do AgentX InferenceXv3
Principais conclusões
- Avalie agentes com contexto longo e rastros multi-turno, não apenas demos limpas de uma única troca.
- Acompanhe a Taxa de Acerto do KVCache e o custo total de tokens como métricas centrais de produção para cargas de trabalho de agentes.
- Compare stacks e plataformas de serving em conjunto, porque o custo depende do envelope completo de inferência.
As cargas de trabalho dos agentes não são apenas conversas mais longas. Elas são máquinas de custo complexas e com vários turnos, nas quais o comportamento de atendimento agora importa tanto quanto a escolha do modelo.
As cargas de trabalho de agentes não são apenas conversas mais longas. Elas são máquinas de custo confusas e com vários turnos, nas quais o comportamento de atendimento agora importa tanto quanto a escolha do modelo.
Um chatbot pede uma resposta. Um agente aparece com uma mala de rodinhas, três subagentes, um milhão de tokens de contexto e uma crença sincera de que seu orçamento de inferência é apenas uma sugestão. O relatório AgentX InferenceXv3 da SemiAnalysis chega naquele espaço desconfortável, mas útil, entre a mágica das demos e a matemática da produção. Os destaques são incomumente diretos: a SemiAnalysis cita um dataset de US$ 3 milhões, comprimento de contexto de mais de 1 milhão, cargas de trabalho multi-turno, subagentes e taxa de acerto de KVCache acima de 95%. Isso não é um concurso de beleza de modelos. É uma auditoria de stack de serving vestindo um sobretudo.
A atualização, segundo a SemiAnalysis
A SemiAnalysis descreve o AgentX 1.0 como um benchmark de inferência de codificação agêntica, multi-turno e totalmente open source, com contexto de 1 milhão, lançado sob a licença Apache 2.0. O relatório enquadra o lançamento em torno de uma pergunta específica: se o fosso da CUDA se sustenta na inferência agêntica. Vou deixar a batalha dos chips para o Theo, porque ele é dono da arena de trovões do silício. Para builders, o ponto imediato é mais simples: o benchmark foi projetado em torno do comportamento de agentes, não apenas do padrão educado de prompt entrando e resposta saindo no chat.
A SemiAnalysis também diz que cargas de trabalho agênticas de longo contexto e multi-turno cresceram rapidamente desde o ponto de inflexão do Claude Code em novembro de 2025, e que agora dominam o tráfego de inferência em produção. O mesmo relatório diz que os gastos agênticos Enterprise da OpenAI ultrapassaram os gastos com ChatGPT em abril de 2026. Essas são afirmações grandes, e a consequência operacional é maior do que a marca. Se o seu benchmark ainda se parece com uma única troca organizada, seu ambiente de teste talvez esteja medindo uma pose de yoga enquanto a produção está montando móveis dentro de um caminhão em movimento.
O campo de batalha é
o comportamento do cache, argumenta a SemiAnalysis pelo que mede
A parte mais importante do teaser da SemiAnalysis talvez seja o que ele coloca lado a lado: comprimento de contexto de mais de 1 milhão, multi-turno, subagentes e taxa de acerto de KVCache acima de 95%. Essa combinação mostra aos builders para onde o estresse está se deslocando. Sistemas agênticos acumulam contexto, revisitam trabalhos anteriores e distribuem tarefas entre subagentes, então a camada de serving precisa ser avaliada como parte do produto, não como um detalhe tedioso de encanamento escondido atrás do model card. E, irritantemente, é no encanamento que o porão alaga.
Isso não significa que a qualidade do modelo deixou de importar. Significa que a qualidade do modelo sozinha é uma explicação incompleta para custo e latência de agentes quando as cargas de trabalho são longas e multi-turno. Na prática, a SemiAnalysis está pedindo a fornecedores e usuários que mostrem como o sistema se comporta sob o formato do tráfego real de agentes. A conclusão prática é tratar a taxa de acerto de KVCache como uma métrica de benchmark de primeira classe, porque o relatório faz isso, em vez de tratá-la como uma nota de rodapé para as três pessoas que leem saída de profiler por lazer.
O InferenceX transforma serving agêntico em uma tabela de custos
A visão geral complementar do InferenceX da SemiAnalysis informa custos de inferência agêntica como custo por milhão de tokens totais, em que menor é melhor. Ela diz que os números usam o melhor envelope de serving observado de cada plataforma para o cenário mostrado com cada modelo, com base no InferenceX, nas Pesquisas de Preços de Mercado da SemiAnalysis de julho de 2026 e em um Modelo de TCO de AI Cloud. Isso importa porque inferência agêntica não é só sobre tokens gerados; é sobre todo o envelope de serving em torno de uma carga de trabalho. A planilha entrou no chat, e trouxe os comprovantes.
Para o cenário DeepSeek V4 Pro 1.6T mostrado no InferenceX, a tabela compara B200 Reference, MI355X, B300, GB200 NVL72 e GB300 NVL72. O InferenceX lista o MI355X a US$ 0,355 por milhão de tokens totais e o descreve como 18% mais caro que o B200, usando SGLang e FP4. Ele lista o B300 a US$ 0,245 e o descreve como 18% mais barato que o B200, também usando SGLang e FP4, enquanto a referência B200 é mostrada com vLLM e FP4. A parte interessante não é apenas qual linha é mais barata. É que stack de software, precisão, plataforma e formato da carga de trabalho agora são inseparáveis na história de custos.
O que builders devem fazer
a seguir, com base na SemiAnalysis e no InferenceX
Em conjunto, o relatório AgentX da SemiAnalysis e a visão geral de custos do InferenceX sugerem um ciclo de avaliação mais útil para produtos com agentes. Faça benchmark com contexto longo se seu produto usa contexto longo. Teste fluxos de trabalho multi-turno e com subagentes se seu produto depende deles. Acompanhe a taxa de acerto de KVCache porque a SemiAnalysis destaca 95%+ como uma propriedade de manchete, e compare custo por milhão de tokens totais porque o InferenceX usa isso como unidade de comparação econômica.
O próximo ponto a observar é se mais fornecedores vão publicar resultados de inferência no formato de agentes, em vez de voltas da vitória no formato de chat. Builders devem pedir resultados na carga de trabalho que realmente executam, incluindo comprimento de contexto, estrutura de turnos, stack de serving e custo total de tokens. Investidores também devem prestar atenção, porque as margens de agentes podem depender tanto da eficiência de serving quanto de qual nome de modelo parece melhor em um pitch deck. O modelo ainda pode ser brilhante, mas, no serving de agentes, o contador descobriu o cache.