
En este artículo (4)
Claude Code por encima de Codex: análisis de la encuesta del 75% de ZDNet
Puntos Clave
- Trata el resultado del 75% de Claude Code de ZDNet como una señal de flujo de trabajo, no como un veredicto universal.
- Evalúa los agentes de programación en tu propio repositorio, especialmente el manejo del contexto, los reintentos y la carga de revisión.
- Usa los benchmarks como comprobaciones de capacidad, pero deja que la fricción diaria de ingeniería decida la adopción.
Una encuesta pequeña pero útil sugiere que a los desarrolladores les importa menos el brillo de las clasificaciones y más las herramientas que se comportan bien durante el trabajo real.
Una encuesta pequeña pero útil sugiere que a los desarrolladores les importa menos el brillo de las tablas de clasificación y más las herramientas que se comportan bien durante el trabajo real.
El benchmark de programación con IA más ruidoso aparentemente no es una tabla de clasificación. Es un desarrollador mirando un repositorio a medio refactorizar a las 11:47 p. m., preguntándose si su agente de programación está ayudando o está recreando a un mapache en una sala de servidores. Según David Gewirtz de ZDNet, el 75% de los 138 desarrolladores que encuestó prefieren Claude Code antes que Codex. Eso no es una ley universal de la física, pero sí es una señal útil en la niebla: el encaje con el flujo de trabajo diario está venciendo a las impresiones abstractas sobre los modelos.
El voto de ZDNet trata realmente sobre la fricción ZDNet’s David Gewirtz informa
que tres de cada cuatro desarrolladores en su encuesta de 138 personas usan Claude Code, y la cifra del titular es menos interesante que lo que implica. Los desarrolladores no eligen un asistente de programación como la gente elige un póster de un coche deportivo. Eligen la herramienta que sobrevive al contacto con su repositorio, sus convenciones de nombres, su extraña suite de pruebas y ese archivo que nadie toca porque quizá sea estructural. Por eso este resultado importa, aunque la encuesta sea de tamaño modesto. Un agente de programación no es un chatbot con sudadera. Tiene que leer contexto, planificar cambios, recuperarse de la ambigüedad y evitar convertir una pequeña refactorización en una sesión espiritista de dependencias. Si los desarrolladores se están agrupando alrededor de Claude Code, la lección práctica es que la fiabilidad percibida y la utilidad a nivel de repositorio quizá estén persuadiendo más que las brillantes tablas comparativas.
freeCodeCamp plantea la elección como encaje con el flujo de trabajo Manish
Shivanandhan de freeCodeCamp describe Codex de OpenAI y Claude Code de Anthropic como parte de una clase más nueva de asistentes de programación con IA que pueden escribir código, depurar aplicaciones, refactorizar proyectos y ejecutar flujos de trabajo complejos. La misma comparación sostiene que elegir entre ellos depende menos de encontrar un ganador universal y más de ajustar la herramienta al flujo de trabajo, la estructura y los objetivos de desarrollo de un equipo. Traducción: el mejor agente de programación es el que encaja con tu ciclo de ingeniería, no el que gana una pelea de benchmarks enjaulados y luego se confunde con tu monorepo. Ese enfoque ayuda a explicar el resultado de ZDNet sin convertirlo en una reunión de club de fans. Codex y Claude Code pueden ser herramientas serias, pero los desarrolladores tienden a premiar al asistente que reduce el coste de coordinación. Si un modelo escribe código elegante pero necesita dirección constante, se convierte en un autocompletado muy caro con una asignatura secundaria de filosofía. Si mantiene suficiente contexto para hacer ediciones útiles sin drama, la gente perdona mucho.
Los benchmarks todavía importan, pero la ergonomía paga el alquiler
La encuesta de ZDNet es un recordatorio de que la preferencia de los desarrolladores es una señal de producto, no solo una señal de modelo. Los benchmarks pueden decirte si un agente tiene capacidad bruta, pero rara vez capturan si se comporta bien a través de las mil pequeñas humillaciones del trabajo de software. Eso incluye tickets poco claros, migraciones parciales, pruebas que fallan y bases de código con la pureza arquitectónica de un cajón de trastos. La conclusión práctica no es que Claude Code sea siempre mejor que Codex. La conclusión es que los equipos deberían probar los agentes de programación en su propio trabajo, no en la ruta de demostración de otra persona. Pasa la herramienta por una corrección de bug, una refactorización y un cambio de varios archivos. Observa con qué frecuencia hace preguntas aclaratorias, qué tan bien preserva la intención y si revisar su salida se siente como una revisión de código o como cuidar a un loro con cafeína.
Qué deberían observar después los creadores La comparación de freeCodeCamp
plantea el punto sensato de que el asistente adecuado depende del flujo de trabajo y los objetivos, mientras que la encuesta de ZDNet muestra hacia dónde se inclina actualmente una parte de los desarrolladores en activo. Para los lectores que eligen herramientas, eso significa que la próxima evaluación debería ser aburrida a propósito: medir el tiempo de revisión, la tasa de reversión, los reintentos de prompts y si el agente puede manejar tu repositorio real. Las métricas aburridas son donde las afirmaciones de productividad van a madurar o a evaporarse en silencio. La señal de preferencia por Claude Code no es el final de la historia de Codex, y definitivamente no es una coronación. Es un recordatorio de que la programación con IA se está volviendo menos sobre quién puede generar código y más sobre quién puede colaborar sin hacer que los humanos tengan que fregar la purpurina. En software, el ganador rara vez es el asistente más llamativo. Es el que te permite cerrar el portátil antes de medianoche.