मोस्टिक वेट-लेवल AI: मॉडल बिना शब्दों के मिलते हैं
मुख्य बातें
- वेट-स्तर के सहयोग को एक गंभीर इंटरऑपरेबिलिटी विचार के रूप में लें, केवल साइ-फाइ सजावट के रूप में नहीं।
- पूछें कि समन्वय लागत इन्फरेंस के दौरान होती है या पहले, किसी मर्ज या सर्च चरण में।
- प्रॉम्प्ट ऑर्केस्ट्रेशन को वेट-आधारित ब्रिज से बदलने से पहले पुनरुत्पादनीय डेमो की मांग करें।
WIRED की रिपोर्ट मॉडल सहयोग के लिए एक अधिक अनोखे रास्ते की ओर इशारा करती है, जहाँ प्रॉम्प्ट ही एकमात्र हैंडशेक नहीं होते।
आपके मॉडल सभी एक ग्रुप चैट में फँसे हुए हैं, और Mostik फोन ज़ब्त करना चाहता है। WIRED के Will Knight बताते हैं कि यह स्टार्टअप, जिसका नाम रूसी में “पुल” है, AI मॉडलों को शब्दों के बजाय उनके वेट्स में मौजूद गणितीय मानों के ज़रिए इंटरैक्ट कराने के तरीके पर काम कर रहा है। यह या तो मशीन टेलीपैथी है, या फिर बस लिनियर अल्जेब्रा है जिसने छोटी-सी मखमली केप पहन रखी है। हाइप पर शक करने वालों के लिए परेशान करने वाली बात यह है कि तकनीकी आधार बेतुका नहीं है। उल्टा लगने वाला हिस्सा सरल है: भाषा इंसानों के लिए सुविधाजनक इंटरफ़ेस हो सकती है, लेकिन मॉडलों के लिए यह एक तंग गलियारा है। प्रॉम्प्ट-आधारित ऑर्केस्ट्रेशन एक मॉडल से कहता है कि वह अपने हाई-डायमेंशनल अंदरूनी उलझाव को टेक्स्ट में समेटे, फिर दूसरे मॉडल से कहता है कि वह उस टेक्स्ट को फिर से किसी उपयोगी चीज़ में फैलाए। यह काम कर सकता है, उसी तरह जैसे आप सोफ़े को बाथरूम की खिड़की से निकाल सकते हैं, बशर्ते सब लोग प्रतिबद्ध हों और कोई पेंट के बारे में सवाल न पूछे।
WIRED का पुल वेट्स के बारे में है, बातचीत
के बारे में नहीं WIRED के अनुसार, Mostik का तरीका अलग-अलग मॉडलों को उनके वेट्स में पाए जाने वाले गणितीय मानों का उपयोग करके इंटरैक्ट करने देता है—वे मान जो यह आकार देते हैं कि कोई प्रॉम्प्ट आउटपुट में कैसे बदलता है। WIRED यह भी रिपोर्ट करता है कि Mostik ने इस तरीके का उपयोग करके एक ऐसा मॉडल बनाया जो ARC-AGI 3 में शीर्ष पर पहुँचा, जबकि उसने अधिक विवरण साझा करने से इनकार किया क्योंकि वह प्रतियोगिता जीतना चाहता है। एक प्रदर्शन के लिए, WIRED कहता है कि कंपनी ने GLM-5.2 के सबसे बड़े संस्करण को शामिल करते हुए एक पुल बनाया, जिसमें 753 अरब पैरामीटर हैं।
यह इसलिए मायने रखता है क्योंकि सामान्य मल्टी-मॉडल स्टैक टेक्स्ट को साझा भाषा मानता है, जो डैशबोर्ड के लिए दोस्ताना है और बारीकियों के लिए दुश्मन। Mostik की पेशकश इससे ज़्यादा ऐसी है जैसे मॉडलों को एक निजी एडैप्टर लेयर दी जाए, जहाँ हैंडऑफ़ मॉडल-नेटिव गणित में होता है। अगर प्रॉम्प्ट पोस्टकार्ड हैं, तो वेट्स प्लंबिंग हैं—कम आकर्षक, लेकिन यह तय करने की अधिक संभावना रखते हैं कि घर में बाढ़ आएगी या नहीं।
RAND की याद दिलाने वाली बात: वेट्स ही मूल्यवान चीज़ हैं
AI मॉडल वेट्स को सुरक्षित करने पर RAND की रिपोर्ट वेट्स को ऐसे सीखने योग्य पैरामीटर के रूप में परिभाषित करती है जो किसी AI मॉडल की मूल बुद्धिमत्ता को एन्कोड करते हैं। यह फ़्रेमिंग यहाँ उपयोगी है क्योंकि Mostik केवल कोई नया संदेश फ़ॉर्मैट प्रस्तावित नहीं कर रहा है। वह मॉडल के उस हिस्से की ओर इशारा कर रहा है जिसे लैब्स पहले से ही चोरी और दुरुपयोग से बचाने लायक रणनीतिक रूप से महत्वपूर्ण मानती हैं।
इसीलिए बिल्डरों को चतुर विचार को ऑपरेशनल सिरदर्द से अलग रखना चाहिए। अगर सहयोग वेट्स या वेट-से-सटे प्रतिनिधित्वों के ज़रिए होता है, तो इंटरऑपरेबिलिटी, एक्सेस कंट्रोल, प्रोवेनेंस, और लीकेज जोखिम प्रथम-श्रेणी की डिज़ाइन समस्याएँ बन जाते हैं। मैं गहरे खतरे की मॉडलिंग Sam पर छोड़ूँगा, क्योंकि मुझे नींद पसंद है, लेकिन इंजीनियरिंग से सीख साफ़ है: बेहतर पुल को भी गार्डरेल्स, लॉग्स, और बोल्ट्स के लिए ज़िम्मेदार किसी व्यक्ति की ज़रूरत होती है।
MoCo दिखाता है कि सहयोग अभी भी उलझा हुआ है
MOCO पेपर, जिसका शीर्षक A One-Stop Shop for Model Collaboration Research है, मॉडल सहयोग का अध्ययन करता है और मॉडल संरचना में छोटे बदलावों के प्रति मल्टीएजेंट बहस की संवेदनशीलता पर लीव-वन-आउट विश्लेषण शामिल करता है। अनुवाद: मॉडल काउंसिल में एक प्रतिभागी को बदलने से परिणाम बदल सकता है, क्योंकि लगता है न्यूरल नेटवर्क भी अजीब ग्रुप प्रोजेक्ट वाली ऊर्जा लेकर आते हैं।
यह Mostik के लिए उपयोगी पृष्ठभूमि है, क्योंकि सहयोग की गुणवत्ता सिर्फ मॉडलों को जोड़ने के बारे में नहीं है; यह इस बारे में है कि दबाव में उनकी क्षमताएँ कैसे मिलती हैं। arXivIQ का एक अलग MoCo विश्लेषण बिल्डरों के लिए सबसे साफ़ अंतर बताता है: टेक्स्ट-स्तर के तरीके आम तौर पर उपयोग के दौरान लागत पैदा करते हैं, जबकि वेट-स्तर के तरीके मर्ज कोएफ़िशिएंट्स की खोज वाले चरण में लागत पहले ही डाल देते हैं और इन्फ़रेंस समय पर शून्य-ओवरहेड सहयोग कर सकते हैं। यह साबित नहीं करता कि Mostik का सिस्टम व्यापक रूप से काम करता है, लेकिन यह समझाता है कि विचार आकर्षक क्यों है। अगर आप अनुरोधों को सर्व करने से पहले समन्वय कर चुका टैक्स चुका सकते हैं, तो आपका इन्फ़रेंस पथ कम भीड़भाड़ वाला हो जाता है, जो डिस्ट्रीब्यूटेड सिस्टम्स के लिए स्पा डे के सबसे करीब है।
बिल्डरों को आगे क्या देखना चाहिए
WIRED की रिपोर्ट जनता के सामने एक दिलचस्प दावा और जानबूझकर अधूरी इम्प्लीमेंटेशन कहानी छोड़ती है, खासकर ARC-AGI 3 सिस्टम के आसपास जिसे Mostik ने उजागर नहीं किया। सही प्रतिक्रिया न तालियाँ है न खारिज करना; सही प्रतिक्रिया मापन है। बिल्डरों को पुनरुत्पादित किए जा सकने वाले डेमो, प्रॉम्प्ट ऑर्केस्ट्रेशन के साथ तुलना, मॉडल परिवारों में प्रमाण, और वेट्स तक किस तरह की पहुँच चाहिए इस पर स्पष्टता ढूँढनी चाहिए।
अगर Mostik सही है, तो अगली दिलचस्प मॉडल सहयोग लेयर शायद एजेंटों जैसी नहीं दिखेगी जो शिष्टता से पैराग्राफ़ों का आदान-प्रदान करते हैं। यह शायद एडैप्टरों, मर्जों, लेटेंट चैनलों, और ऐसे इन्फ़रेंस पाइपलाइनों जैसी दिखेगी जो भाषा को पूरे डाक-तंत्र के बजाय सिर्फ़ एक आउटपुट फ़ॉर्मैट मानती हैं। अजीब बात यह नहीं है कि मॉडल शायद हमारी तरह बात करना बंद कर दें; अजीब बात यह है कि हमने उनसे पहले ही भाषा को ऑफिस ईमेल की तरह इस्तेमाल करवाया।
