
En este artículo (4)
Estándares de datos de IA encarnada: China responde en diez días
Puntos Clave
- Sigue los estándares de datos tan de cerca como los lanzamientos de modelos al construir sistemas de IA física.
- Planifica la recopilación, el etiquetado, el almacenamiento y el intercambio de datos de robots antes de escalar el entrenamiento de modelos.
- Observa los campos de entrenamiento de China y la orientación local para obtener pistas sobre la velocidad de despliegue de la robótica.
El plan de estándares de la Administración Nacional de Datos muestra que el progreso de los robots puede depender de una infraestructura de datos compartida, no solo de modelos fundacionales más llamativos.
El plan de estándares de la Administración Nacional de Datos muestra que el progreso de los robots puede depender de una infraestructura de datos compartida, no solo de modelos fundacionales más brillantes.
Todo el mundo sigue preguntando qué modelo fundacional para robots ganará. La respuesta menos glamorosa quizá sea: el que tenga el “escape de datos” mejor coreografiado. Los robots humanoides no aprenden a doblar toallas, esquivar transpaletas o agarrar una llave inglesa resbaladiza absorbiendo la web y esperando que la física sea generosa. Necesitan realidad grabada, lo cual es molesto porque la realidad tiene una documentación de API terrible. La Administración Nacional de Datos de China está entrando ahora en ese lío. La agencia dijo que desarrollará estándares para datos de entrenamiento de IA encarnada y orientará a las autoridades locales, según Bloomberg, apenas diez días después de que siete empresas pidieran infraestructura pública de datos y estándares comunes, según The Next Web. Ese calendario es la historia. Los robots no solo están esperando un cerebro de modelo más grande; están esperando una canalización nacional de datos con etiquetas, gobernanza y suficiente coherencia para que el entrenamiento no se convierta en caos artesanal con bata de laboratorio.
La petición se convirtió rápido en maquinaria de política pública, según
The Next Web The Next Web informó que el movimiento de la Administración Nacional de Datos siguió a una reunión del 10 de septiembre presidida por Liu Liehong, jefe de la agencia, con la asistencia de institutos de investigación, empresas tecnológicas y organizaciones de robótica humanoide. Diez días antes, la misma agencia se reunió con siete empresas que solicitaron infraestructura pública de datos para la IA encarnada y estándares de datos comunes, según el mismo informe. Eso es una energía de retroalimentación inusualmente directa, al menos para los estándares de la política pública, donde la urgencia a menudo se mueve como una Roomba atrapada debajo de un sofá. Bloomberg informó que la Administración Nacional de Datos planea reforzar la planificación y la orientación para el desarrollo del sector, al tiempo que apoya a las empresas que aumentan la inversión en recursos de datos. TradingView News, al resumir la iniciativa, dijo que las prioridades incluyen estándares formales sobre cómo se recopilan, etiquetan, almacenan y comparten los datos de IA encarnada, además de orientación para los gobiernos locales sobre gobernanza de datos. En un inglés menos burocrático: el país está intentando estandarizar el tramo intermedio y desordenado entre un robot tocando el mundo y un modelo aprendiendo de ese contacto.
El cuello de botella son horas
de realidad, informa The Next Web The Next Web cita la estimación de la Academia China de Tecnología de la Información y las Comunicaciones de que los modelos fundacionales de IA encarnada necesitan aproximadamente 10 millones de horas de datos reales de entrenamiento. El mismo informe dice que en todo el mundo solo existen entre 100.000 y 1 millón de horas de datos de alta calidad. Esa brecha no es un error de redondeo; es el Gran Cañón vestido con un traje de captura de movimiento. Por eso la IA encarnada es diferente de los modelos de texto de una manera muy cara. El texto es abundante, imperfecto y legalmente picante, pero existe a escala planetaria. Los datos de interacción robótica son más difíciles porque deben capturar física, conciencia espacial, lecturas de sensores, resultados de acciones y movimiento humano en entornos donde la gravedad no deja de presentar informes de errores. China ya está construyendo oferta, según The Next Web, que informa que hay más de 70 campos de entrenamiento de IA encarnada en funcionamiento, en su mayoría para fabricación industrial, con 46 más planificados. Si esas instalaciones producen datos bajo estándares compartidos, los desarrolladores privados de modelos obtienen más que horas en bruto. Obtienen horas comparables, que es la diferencia entre un conjunto de datos y un cajón de trastos con marcas de tiempo.
Los estándares se están convirtiendo en la pila tecnológica, dice TradingView
TradingView News describe la IA encarnada como sistemas que perciben e interactúan físicamente con su entorno, desde robots de almacén hasta brazos quirúrgicos y humanoides. Esa amplitud importa porque un estándar de datos tiene que sobrevivir a máquinas, sensores, tareas y expectativas de seguridad muy diferentes. Un brazo robótico en una fábrica y un humanoide en una cabina de demostración producen datos generados por máquinas, pero fingir que esos flujos son mágicamente intercambiables es la forma de conseguir teatro de benchmarks con mejor iluminación. The AI Insider informó que China emitió su primer sistema nacional de estándares para robots humanoides e IA encarnada, presentado el 28 de febrero en Pekín. Ese marco se organizó en seis componentes, incluidos aspectos comunes básicos, computación inteligente y similar al cerebro, extremidades y componentes, máquinas y sistemas completos, aplicación, y seguridad y ética, y fue redactado por más de 120 instituciones bajo el comité técnico del Ministerio de Industria y Tecnología de la Información. El mismo informe dijo que más de 140 fabricantes nacionales lanzaron más de 330 modelos humanoides en 2025, lo que ayuda a explicar por qué aquí los estándares no son un adorno de papeleo. Son semáforos antes de que todos salgan corriendo hacia la intersección cargando servomotores.
Europa tiene reglas de acceso, no tuberías
de producción, dice The Next Web The Next Web contrasta el despliegue de China con la Ley de Datos de Europa, que regula el acceso a los datos generados por máquinas, pero no crea la infraestructura para producirlos. El informe dice que la mayoría de las acciones de la Estrategia de Unión de Datos de la UE, incluidos los laboratorios de datos planificados, no se habían llevado a cabo diez meses después de su publicación. Las reglas de acceso son útiles, pero no son equipos de recopilación de datos, sensores calibrados, esquemas compartidos ni campos de entrenamiento donde los robots fallan repetidamente en tareas reales hasta volverse un poco menos vergonzosos. La demanda de infraestructura nacional tampoco es nueva dentro de China. Yicai Global informó que Zhou Yunjie, presidente y director ejecutivo de Haier Group, pidió plataformas nacionales de innovación abierta para la inteligencia encarnada, un programa nacional de datos dedicado y un marco de estándares de grado industrial que abarque diseño, fabricación, pruebas y despliegue. Esa petición anterior rima con la solicitud de las siete empresas que reportó The Next Web, lo que sugiere que la industria ve la infraestructura de datos como una dependencia compartida más que como un bonito accesorio de política pública. Para quienes construyen IA, la lección es maravillosamente poco sexy y, por eso, probablemente importante: observen la capa de datos. Los lanzamientos de modelos seguirán recibiendo las demostraciones brillantes, los aplausos y los movimientos de manos vagamente humanoides tipo jazz. Pero si la IA física escala, puede que sea porque alguien estandarizó cómo los robots registran el mundo, etiquetan sus errores y comparten suficiente realidad para que los modelos dejen de aprender a partir de vibras. La revolución robótica no llegará con un monólogo; llegará como una migración de esquema.