Análisis de trazas de Grok 4.5 Compute Plus
Puntos Clave
- Evalúa los modelos de codificación dentro de flujos de trabajo reales de agentes, no solo en demostraciones de chat o benchmarks estáticos.
- Pregunta a los proveedores qué datos de trazas y uso de herramientas dieron forma al entrenamiento antes de confiar en afirmaciones sobre codificación.
- Observa los bucles de retroalimentación tan de cerca como el tamaño del modelo al comparar asistentes de codificación de frontera.
La lección del lanzamiento de xAI no es solo tener modelos más grandes, sino mejores trazas de sesiones reales de programación agéntica.
La lección del lanzamiento de xAI no son solo modelos más grandes, sino mejores rastros de sesiones reales de programación agéntica.
Todos están mirando a Grok 4.5 como si fuera una carrera de caballos en una tabla de clasificación, lo cual es comprensible y también es la razón por la que terminamos reseñando restaurantes contando los hornos. La historia más interesante es la lista de ingredientes. FourWeekMBA presenta el lanzamiento de Grok 4.5 de xAI como evidencia de que los modelos de codificación de frontera se están construyendo con una receta que llamaré cómputo más trazas, porque, al parecer, incluso las redes neuronales ahora necesitan recibos.
FourWeekMBA dice que lo interesante es la dieta de trazas
FourWeekMBA, citando el lanzamiento de xAI del 8 de julio junto con reportes de TechCrunch, Axios y benchmarks de Artificial Analysis, sostiene que Grok 4.5 trata menos de un único lanzamiento de producto y más de un patrón visible de construcción de modelos. Su afirmación clave es que el lanzamiento de xAI del 8 de julio fue entrenado con datos reales de sesiones de desarrolladores en Cursor, lo que convierte los flujos de trabajo de codificación agéntica en señal de entrenamiento, en lugar de simple confeti de demostración. FullStack informa de forma similar que Grok 4.5 funciona sobre un nuevo modelo fundacional a gran escala, incorpora datos de actividad real de desarrolladores y está posicionado para codificación, agentes y trabajo intensivo en conocimiento. Eso importa porque los asistentes de codificación no solo necesitan conocer la sintaxis; necesitan aprender ese extraño bailecito en el que los humanos ejecutan pruebas, maldicen bajito, editan tres archivos y, de algún modo, lo llaman ingeniería.
Artificial Analysis sitúa a Grok 4.5 cerca de la cabeza
Artificial Analysis informó el 8 de julio de 2026 que Grok 4.5 obtuvo 54 puntos en su Índice de Inteligencia, quedando en cuarto lugar detrás de Fable 5, GPT-5.5 y Opus 4.8. El mismo análisis dice que Grok 4.5 mejoró 16 puntos respecto a Grok 4.3 y tuvo un desempeño especialmente bueno en trabajo agéntico de conocimiento y codificación. En el Índice de Agentes de Codificación de Artificial Analysis, obtuvo una puntuación a la par de GPT-5.5 en Codex sobre el banco de pruebas Grok Build, a un costo mucho menor según el informe. Traducción: no es una coronación, pero definitivamente ya no es el remate fácil del chatbot en X.
Kie AI muestra por qué la filtración en realidad trataba sobre señales de
entrenamiento El desglose de Kie AI del 15 de julio rastreó pistas previas al lanzamiento hasta el 6 de julio, cuando apareció una cadena en la interfaz web de Grok que apuntaba a Grok 4.5. El mismo informe describía el modelo como construido sobre un modelo fundacional V9 de 1,5 billones de parámetros, con datos de Cursor mezclados durante el entrenamiento suplementario, y decía que había estado en beta privada en SpaceX y Tesla durante aproximadamente una semana. Kie AI también señaló que los benchmarks oficiales, los precios, la ventana de contexto y la fecha de lanzamiento aún no se habían publicado en ese momento. La lección útil no es que las filtraciones sean estrategia de producto —por favor, no conviertas eso en un KPI—, sino que la filtración puso en el centro la procedencia de los datos de entrenamiento tanto como el tamaño del modelo.
Axios dice que la inundación de modelos ahora es el clima
Axios enmarcó esa misma semana como una en la que los laboratorios estadounidenses estaban inundando la zona, señalando Meta Muse Spark 1.1 y la familia GPT-5.6 de OpenAI entre los movimientos que hacían que el panorama de modelos fuera más difícil de seguir. Ese contexto es importante porque el latigazo de benchmarks se ha convertido en la interfaz de usuario predeterminada de las noticias sobre IA. Si cada laboratorio puede lanzar un anuncio de un modelo más grande o más barato, la pregunta duradera para quienes construyen es qué ciclo de retroalimentación hizo mejor al modelo. El cómputo compra capacidad, pero las trazas compran comportamiento, y el comportamiento es lo que hace que un agente sea útil en lugar de meramente verboso (un influencer de LinkedIn con modo JSON).
La conclusión de FullStack para constructores: instrumenta el flujo
de trabajo FullStack describe Grok 4.5 como dirigido a equipos que están comparando Claude, GPT y costos, con foco en ingeniería de software, agentes y análisis de formato largo. Para los equipos de ingeniería, la conclusión práctica es evaluar los modelos de codificación dentro de flujos de trabajo reales, no solo en cajas de chat y acertijos sintéticos. Haz seguimiento de si el modelo puede leer contexto, usar herramientas, recuperarse de intentos fallidos y mejorar a lo largo de ciclos de tareas realistas. La próxima carrera de modelos de codificación puede que la gane menos quien tenga el horno más grande y más quien conserve el mejor cuaderno de laboratorio.
