एआई डेटा सोर्सिंग: गार्जियन, एंथ्रोपिक सप्लाई चेन विश्लेषण
मुख्य बातें
- प्रशिक्षण डेटा की उत्पत्ति को मॉडल मेट्रिक्स जितनी ही सावधानी से ट्रैक करें, क्योंकि स्रोत प्राप्त करना एक परिचालन बाधा बनता जा रहा है।
- यह न मानें कि वेब स्क्रैपिंग ही डेटा की पूरी कहानी है। भौतिक संग्रह रणनीतिक इनपुट बन सकते हैं।
- लाइसेंसिंग और खरीद संबंधी खुलासों पर नज़र रखें, क्योंकि वे यह बता सकते हैं कि किन लैब्स के पास टिकाऊ डेटा लाभ हैं।
पुरानी किताबों के थोक ऑर्डर यह याद दिलाते हैं कि मॉडल डेटा के साथ अब लॉजिस्टिक्स, स्रोत-इतिहास और खरीद-प्रक्रिया भी जुड़ी हुई है।
धूल भरी कविता की शेल्फ़ और गोदाम के लोडिंग बे के बीच कहीं, AI ट्रेनिंग डेटा अब खरीद-प्रबंधन की समस्या बन गया है। The Guardian की रिपोर्ट है कि UK और आयरलैंड में सेकंडहैंड किताबों के विक्रेताओं को रहस्यमय खरीदारों से असामान्य थोक ऑर्डर मिल रहे हैं, और यह अटकल लगाई जा रही है कि AI कंपनियाँ डेटा के लिए किताबें खरीद रही हैं। वही रिपोर्ट यह भी बताती है कि इससे पहले Anthropic ने डेटा अधिग्रहण के लिए किताबों को स्कैन करने पर लाखों खर्च किए थे—ऐसा वाक्य जो वेब स्क्रैपिंग को किसी पुराने जमाने की चीज़ जैसा बना देता है, जैसे टोट बैग के साथ डायल-अप इंटरनेट। यह इस बात का प्रमाण नहीं है कि पेपरबैक किताबों से भरी हर संदिग्ध कार्ट असल में ट्रेंच कोट पहने Claude है। लेकिन यह एक उपयोगी संकेत ज़रूर है: उच्च-गुणवत्ता वाला टेक्स्ट इतना दुर्लभ है कि उद्योग शायद भौतिक किताबों को रणनीतिक इनपुट की तरह देख रहा है। हर कोई पैरामीटर काउंट्स पर बात करना पसंद करता है। कोई भी संज्ञाओं की सप्लाई चेन पर बात नहीं करना चाहता।
The Guardian ने सबके सामने छिपा एक खरीद-पैटर्न पाया
The Guardian का कहना है कि UK और आयरलैंड की किताबों की दुकानों को US, कनाडा, महाद्वीपीय यूरोप और UK के खरीदारों से ऑर्डर मिले हैं, जबकि विक्रेता इस पैटर्न को इतना अजीब बता रहे हैं कि सवाल उठने लगे हैं। इसकी रिपोर्ट किताब विक्रेताओं के बीच अटकलों पर केंद्रित है, किसी पुष्ट खरीदार-सूची पर नहीं—और यह बात मायने रखती है, क्योंकि किसी को ज़िम्मेदार ठहराना रिपोर्टिंग और जासूस बनने की नकल के बीच का फर्क है। फिर भी, कथित वर्कफ़्लो समझ में आता है: किताबें हासिल करो, टेक्स्ट को डिजिटाइज़ करो, और अधिक साफ़ सामग्री को मॉडल ट्रेनिंग में डालो। यह जादू नहीं है। यह कागज़ की कटनों वाला ETL है।
The Guardian, Northumberland के Alnwick में Barter Books के Stuart और Mary Manley को भी उजागर करता है, जहाँ कैप्शन में दी गई थ्योरी साफ़ है: ‘मेरी थ्योरी है कि यह AI के ढेरों और ढेरों पैसों की वजह से है’। यह कोई लैब बेंचमार्क नहीं है, लेकिन यह उन लोगों द्वारा देखी गई बाज़ार-गतिविधि है जो जानते हैं कि सामान्य किताब-खरीद कैसी दिखती है। AI में, सबसे अजीब टेलीमेट्री अक्सर उन इंसानों से आती है जो bottleneck के सबसे करीब होते हैं।
BBC दिखाता है कि विक्रेताओं ने ध्यान क्यों दिया
BBC की रिपोर्ट है कि Barter Books के Stuart Manley आम तौर पर एक हफ्ते में दो या तीन हजार किताबें बेचते थे, लेकिन एक कनाडाई कंपनी का एक ही थोक ऑर्डर उतना था जितना वे सात दिनों में बिकने की उम्मीद करते। Manley ने BBC से कहा कि सेकंडहैंड किताबों के व्यापार में 30 साल के बाद उन्होंने "ऐसा कभी नहीं देखा"। यह वह किस्म की anomaly detection है जो आप बिना dashboard के करते हैं—बस एक till, एक van, और धीरे-धीरे बढ़ता यह अहसास कि किसी ने आपकी inventory spreadsheet पर कोई model train कर दिया है।
BBC यह भी कहता है कि किताब विक्रेताओं को किताबों की अंतिम मंज़िल नहीं पता, जबकि शक AI की ओर मुड़ गया है क्योंकि models को नई जानकारी की जबरदस्त भूख होती है। महत्वपूर्ण शब्द है शक। Builders को हर अनजान खरीदार को खलनायक GPU cluster मान लेने से बचना चाहिए, लेकिन उन्हें यह ज़रूर समझना चाहिए कि किताबें आकर्षक क्यों हैं: edited prose, long-form structure, और open web पर अब jacuzzi में protein powder की तरह तैर रहे synthetic mush से कम सामग्री।
Chosun अफ़वाह को scanning economics से जोड़ता है
Chosun ने रिपोर्ट किया कि पिछले मई में Ireland के Galway स्थित Kenneth’s Bookshop को एक साथ 5,000 किताबें खरीदने का अनुरोध मिला। आउटलेट ने व्यापक रुझान को इस तरह प्रस्तुत किया कि AI कंपनियाँ LLM training के लिए original text materials सुरक्षित करने के उद्देश्य से scanning के लिए बड़ी मात्रा में used books खरीद रही हैं। इसने Anthropic द्वारा Project Panama शुरू करने का भी संदर्भ दिया, हालांकि snippet में इतनी जानकारी नहीं है कि ज़िम्मेदारी से उसे spy novel में बदल दिया जाए। परेशान करने वाली बात है, हाँ, लेकिन सटीकता ही वह एकमात्र मसाला है जिसे हमें यहाँ इस्तेमाल करने की अनुमति है।
Scanning वाला angle महत्वपूर्ण है क्योंकि यह data acquisition को passive collection से active procurement में बदल देता है। सार्वजनिक web pages को hoover करने और यह उम्मीद करने के बजाय कि tokenizer comment section से बच जाएगा, कोई कंपनी physical copies खरीद सकती है, उन्हें digitize कर सकती है, और known inputs वाला corpus बना सकती है। इससे copyright, licensing, या author compensation अपने-आप हल नहीं हो जाते। लेकिन यह pipeline को पुराने internet buffet की तुलना में अधिक auditable बना देता है, जहाँ provenance अक्सर API key पहने एक shrug जैसा था।
Builders को data
को inventory की तरह क्यों देखना चाहिए BBC की रिपोर्ट है कि 2025 में, एक US judge ने फैसला दिया कि इस तरह खरीदी गई किताबों का AI software train करने के लिए उपयोग करना US copyright law का उल्लंघन नहीं था। इसका मतलब यह नहीं कि हर जगह यही जवाब लागू होता है, या हर procurement path reputationally clean है। इसका मतलब है कि data strategy अब legal strategy, vendor strategy, और operations strategy भी है। बधाई हो, आपके model card को अब supply chain tab चाहिए।
Product teams के लिए सीख सबसे अच्छे अर्थ में boring है: document करें कि data कहाँ से आता है, उससे कौन-से rights जुड़े हैं, और ingestion के बाद क्या होता है। Researchers के लिए दिलचस्प सवाल यह है कि जैसे-जैसे public web data ज़्यादा noisy और synthetic होता जाता है, क्या higher provenance corpora competitive moat बन जाते हैं। Publishers और booksellers के लिए, यह नए licensing markets बना सकता है—अगर हर कोई culture को shredder से solve करने की इच्छा रोक सके।
अब disclosed data partnerships, procurement audits, और इस बात पर नज़र रखें कि क्या AI labs text sources को chips और cloud contracts जितनी गंभीरता से लेना शुरू करते हैं। अगर model race अब secondhand shelves तक पहुँच रही है, तो limiting reagent शायद compute न हो। वह clean sentences हो सकती हैं, ठीक से sourced, और बेहतर होगा कि robot के snack लेने के बाद pulped न की गई हों।
