
En este artículo (4)
Abastecimiento de datos de IA: análisis de Guardian y Anthropic
Puntos Clave
- Rastrea la procedencia de los datos de entrenamiento con tanto cuidado como las métricas del modelo, porque el abastecimiento se está convirtiendo en una restricción operativa.
- No asumas que el scraping web es toda la historia de los datos. Los corpus físicos pueden convertirse en insumos estratégicos.
- Vigila las divulgaciones sobre licencias y adquisiciones, ya que pueden revelar qué laboratorios tienen ventajas de datos duraderas.
Los pedidos grandes de libros de segunda mano son un recordatorio de que los datos de los modelos ahora tienen logística, procedencia y adquisición asociadas.
Los pedidos al por mayor de libros de segunda mano son un recordatorio de que los datos de los modelos ahora tienen logística, procedencia y adquisición asociadas.
En algún punto entre una estantería polvorienta de poesía y un muelle de carga de almacén, los datos de entrenamiento de IA se han convertido en un problema de compras. The Guardian informa que libreros de segunda mano en el Reino Unido e Irlanda están viendo pedidos al por mayor inusuales de compradores misteriosos, con especulaciones de que empresas de IA están adquiriendo libros para obtener datos. El mismo informe señala que esto ocurre después de que Anthropic gastara millones en libros para escanearlos con fines de adquisición de datos, que es el tipo de frase que hace que el scraping web suene pintoresco, como internet por marcación con una bolsa de tela. Esto no demuestra que cada carrito sospechoso lleno de libros de bolsillo sea secretamente Claude con gabardina. Sin embargo, sí es una señal útil: el texto de alta calidad es lo bastante escaso como para que la industria quizá esté tratando los libros físicos como insumos estratégicos. A todo el mundo le encanta hablar de recuentos de parámetros. Nadie quiere hablar de la cadena de suministro de los sustantivos.
The Guardian encontró un patrón de compras escondido
a plena vista The Guardian dice que librerías del Reino Unido e Irlanda han recibido pedidos de compradores de Estados Unidos, Canadá, Europa continental y el Reino Unido, mientras que los vendedores describen el patrón como lo bastante extraño como para plantear preguntas. Su informe se centra en la especulación entre libreros, no en una lista confirmada de compradores, lo cual importa porque la atribución es la diferencia entre hacer periodismo y jugar a ser detective. Aun así, el supuesto flujo de trabajo es comprensible: adquirir libros, digitalizar texto y alimentar el entrenamiento de modelos con material más limpio. Eso no es magia. Eso es ETL con cortes de papel.
The Guardian también destaca a Stuart y Mary Manley, de Barter Books en Alnwick, Northumberland, donde la teoría del pie de foto es directa: «Mi teoría es que son cantidades y cantidades de dinero de IA». Eso no es una prueba de laboratorio, pero sí es comportamiento de mercado observado por personas que saben cómo se ve la compra normal de libros. En IA, la telemetría más rara suele venir de los humanos más cercanos al cuello de botella.
La BBC muestra por qué los vendedores se dieron cuenta
La BBC informa que Stuart Manley, de Barter Books, normalmente vendería dos o tres mil libros en una semana, pero un solo pedido al por mayor de una empresa canadiense equivalía a lo que esperaría mover en siete días. Manley dijo a la BBC que «nunca había visto nada igual en 30 años en el comercio de libros de segunda mano». Ese es el tipo de detección de anomalías que haces sin un panel de control, solo con una caja registradora, una furgoneta y la sensación creciente de que alguien entrenó un modelo con tu hoja de cálculo de inventario. La BBC también dice que los libreros no conocen el destino final de los libros, mientras que la sospecha se ha dirigido hacia la IA porque los modelos tienen un apetito voraz por nueva información. La palabra importante es sospecha. Los desarrolladores deberían resistirse a convertir a cada comprador desconocido en un malvado clúster de GPU, pero deberían prestar atención a por qué los libros son atractivos: prosa editada, estructura de largo formato y menos de esa papilla sintética que ahora flota por la web abierta como proteína en polvo en un jacuzzi.
Chosun conecta el rumor con la economía del escaneo
Chosun informó que el pasado mayo llegó a Kenneth’s Bookshop, en Galway, Irlanda, una solicitud para comprar 5.000 libros de una sola vez. El medio presentó la tendencia más amplia como empresas de IA comprando grandes cantidades de libros usados para escanearlos y asegurar materiales de texto original para el entrenamiento de LLM. También hizo referencia a que Anthropic lanzó Project Panama, aunque el fragmento no aporta suficientes detalles como para convertirlo responsablemente en una novela de espías. Molesto, sí, pero la precisión es el único condimento que se nos permite usar aquí. El ángulo del escaneo importa porque desplaza la adquisición de datos de la recopilación pasiva a las compras activas. En lugar de aspirar páginas web públicas y esperar que el tokenizador sobreviva a la sección de comentarios, una empresa puede comprar copias físicas, digitalizarlas y construir un corpus con entradas conocidas. Eso no resuelve automáticamente el copyright, las licencias ni la compensación a autores. Sí hace que la canalización sea más auditable que el viejo bufé de internet, donde la procedencia a menudo era un encogimiento de hombros con una clave de API.
Por qué los desarrolladores deberían tratar
los datos como inventario La BBC informa que en 2025, un juez estadounidense dictaminó que usar libros comprados de esta manera para entrenar software de IA no violaba la ley de derechos de autor de EE. UU. Eso no significa que la misma respuesta se aplique en todas partes, ni que toda ruta de compras esté limpia desde el punto de vista reputacional. Significa que la estrategia de datos ahora es estrategia legal, estrategia de proveedores y estrategia operativa. Felicidades, tu ficha de modelo necesita una pestaña de cadena de suministro. Para los equipos de producto, la lección es aburrida de la mejor manera posible: documenten de dónde vienen los datos, qué derechos están asociados a ellos y qué ocurre después de la ingesta. Para los investigadores, la pregunta interesante es si los corpus con mayor procedencia se convierten en una ventaja competitiva a medida que los datos de la web pública se vuelven más ruidosos y más sintéticos. Para editoriales y libreros, esto podría crear nuevos mercados de licencias si todos resisten el impulso de resolver la cultura con una trituradora. Observa los próximos movimientos en torno a asociaciones de datos divulgadas, auditorías de compras y si los laboratorios de IA empiezan a tratar las fuentes de texto con la misma seriedad que dan a los chips y los contratos de nube. Si la carrera de modelos ahora está llegando a las estanterías de segunda mano, el reactivo limitante quizá no sea el cómputo. Quizá sean frases limpias, debidamente obtenidas y, preferiblemente, no convertidas en pulpa después de que un robot haya tomado un aperitivo.