
इस लेख में (4)
Inkling Small विश्लेषण: 40 बनाम 276B पर Inkling 41
मुख्य बातें
- मॉडलों का आकलन केवल कुल पैरामीटर संख्या के आधार पर नहीं, बल्कि कार्य के अनुरूपता, लाइसेंसिंग, संदर्भ और सर्विंग आवश्यकताओं के आधार पर करें।
- यह मानने से पहले कि Inkling Small की बेंचमार्क निकटता उत्पादन विश्वसनीयता में बदल जाएगी, इसे वास्तविक कार्यभारों पर परखें।
- सक्रिय MoE पैरामीटरों पर करीबी नज़र रखें, क्योंकि वे व्यावहारिक डिप्लॉयमेंट ट्रेडऑफ को आकार देते हैं।
Thinking Machines Lab का छोटा ओपन वेट्स मॉडल कुल 276B और सक्रिय MoE 12B का उपयोग करता है, जबकि Inkling कुल 975B और सक्रिय 41B का उपयोग करता है।
Thinking Machines Lab का छोटा ओपन वेट्स मॉडल कुल 276B और 12B सक्रिय MoE का उपयोग करता है, जबकि Inkling कुल 975B और 41B सक्रिय का उपयोग करता है।
कभी पैरामीटर काउंट AI उद्योग का पसंदीदा जिम-मिरर हुआ करता था। बड़ा दिखना बेहतर लगता था, भले ही मॉडल असल में वेयरहाउस की रोशनी में बस मसल्स दिखा रहा हो। फिर Thinking Machines Lab का Inkling Small आया: 276B कुल पैरामीटर, 12B सक्रिय MoE, और Artificial Analysis Intelligence Index पर 40 का स्कोर—Inkling के 41 से बस एक अंक पीछे, जबकि Inkling का वजन 975B कुल और 41B सक्रिय पैरामीटर है। कहीं न कहीं, “moat” नाम की एक स्प्रेडशीट चुपचाप पसीना बहा रही है। छोटा संस्करण: Thinking Machines Lab ने एक छोटा open weights reasoning model जारी किया है, जो एक third-party benchmark पर अपने flagship sibling के असहज रूप से करीब पहुंचता है। उपयोगी संस्करण: यह फिर याद दिलाता है कि parameter count अब यह तय करने का बहुत खराब proxy बनता जा रहा है कि कोई model deploy करने लायक, उपयोगी, या आपके GPU budget को किसी बहुत महंगे raccoon की तरह खिलाने लायक है या नहीं।
Artificial Analysis कहता है कि छोटा होने का मतलब कमजोर होना नहीं था
Artificial Analysis ने 30 जुलाई, 2026 को रिपोर्ट किया कि Inkling Small उसके Intelligence Index पर 40 स्कोर करता है, Inkling से केवल एक अंक कम, जिसे दो हफ्ते पहले 41 के स्कोर के साथ लॉन्च किया गया था। उसी Artificial Analysis रिपोर्ट के अनुसार Inkling Small एक open weights reasoning model है, जिसमें text, image, और speech input के साथ 256K token context window भी है। यह अहम तुलना भी देती है: Inkling Small में 276B कुल पैरामीटर और 12B सक्रिय MoE हैं, जबकि Inkling में 975B कुल और 41B सक्रिय हैं। यह कोई rounding error नहीं है; यह benchmark receipts के साथ आया diet plan है।
Artificial Analysis ने यह भी रिपोर्ट किया कि Inkling Small कई coding और frontier reasoning evaluations में Inkling के बराबर या उससे आगे है। यह Humanity's Last Exam पर 32% बनाम 30%, GPQA Diamond पर 89% बनाम 87%, CritPt पर 8% बनाम 5%, और SciCode पर 49% बनाम 46% स्कोर करता है। Benchmarks product experience नहीं होते, और जो भी आपको उल्टा बताए, वह शायद soup को भी viscosity से judge करता होगा। लेकिन जब छोटा model कई subtests जीतता है, तो कहानी cute रहने से आगे बढ़कर architectural हो जाती है।
Thinking Machines deployment वाली दलील को और जोर से रख रहा है
Thinking Machines ने 30 जुलाई, 2026 को अपनी साइट पर Inkling Small की घोषणा की, जिसमें reasoning और agentic tasks, multimodality, epistemics, safety, और benchmarking के sections दिए गए। कंपनी announcement page से readers को Tinker, model card, और Hugging Face की ओर भी भेजती है। यह distribution pattern मायने रखता है, क्योंकि open weights models सिर्फ benchmark charts से नहीं जीते या हारते; वे इस बात से भी जीते या हारते हैं कि developers उन्हें सच में inspect, adapt, और run कर सकते हैं या नहीं—बिना procurement ticket को शून्य में भेजे।
VentureBeat रिपोर्ट करता है कि Inkling Small, Thinking Machines द्वारा Inkling जारी करने के सिर्फ दो हफ्ते बाद आया; Inkling उसका पहला open source AI language model था। VentureBeat यह भी कहता है कि Inkling Small एक permissive Apache 2.0 license का उपयोग करता है और Artificial Analysis Intelligence Index पर बड़े model से केवल एक अंक पीछे है। Enterprise teams के लिए, license detail सजावट नहीं है। यह lab में model आजमाने और legal द्वारा roadmap पर कुर्सी फेंक देने के बीच का अंतर है।
VentureBeat इसे open weights contender के रूप में पेश करता है
VentureBeat ने पहले original Inkling को उन enterprises के लिए बताया था जो agentic AI workloads को ऐसे open weights models पर ले जाना चाहते हैं जिन्हें वे customize, control, और on premises या virtual private clouds में run कर सकें। यह context Inkling Small को एक simple sibling release से ज्यादा दिलचस्प बनाता है। अगर छोटा model leaderboard पर flagship के करीब बैठ सकता है, तो practical question यह कम रह जाता है कि हम कितना बड़ा जा सकते हैं, और अधिक यह हो जाता है कि इस workload के लिए हमें सच में कितना model चाहिए।
यहीं AI infrastructure आतिशबाजी से plumbing में बदलता है, जो कम glamorous है लेकिन नकली बनाना कहीं ज्यादा मुश्किल है। Mixture of Experts यहां खास तौर पर relevant है, क्योंकि active parameter count वही हिस्सा है जो किसी given token के लिए काम कर रहा होता है। MoE किसी consulting firm जैसा सुनाई देता है जो हर आह के हिसाब से charge करती हो, लेकिन idea सीधा है: हर input के लिए हर expert subnetwork को जागना जरूरी नहीं। Artificial Analysis Inkling Small के लिए 12B active MoE और Inkling के लिए 41B active रिपोर्ट करता है। यही gap है जिसके कारण builders logo पर नजरें गड़ाने से पहले latency, memory, batching, और hosting constraints पर गौर करेंगे।
Artificial Analysis builders को असली homework देता है
Artificial Analysis कहता है कि Inkling Small के size या उससे छोटे किसी open weights model का Intelligence Index score इससे अधिक नहीं है। यह भी note करता है कि DeepSeek V4 Flash 284B total और 13B active के साथ 40 स्कोर करता है, MiniMax-M3 23B active के साथ 44 तक पहुंचता है, और GLM-5.2 40B active के साथ 51 तक पहुंचता है। मतलब, Inkling Small से ऊपर अभी भी जगह है, लेकिन size-to-score curve productive तरीके से अजीब हो रहा है। पुराना chart, जहां अधिक parameters का मतलब बेहतर model होता था, अब प्रकृति का नियम कम और fridge magnet ज्यादा लग रहा है।
AI के साथ build करने वाले readers के लिए move सरल है: models को सिर्फ total parameter count से नहीं, बल्कि task fit, licensing, context window, modality support, और serving constraints से evaluate करें। Inkling Small को अभी भी real workload testing की जरूरत होगी, खासकर agents, coding flows, multimodal inputs, और boring enterprise traffic के तहत reliability के लिए—सबसे कठोर benchmark, क्योंकि इसमें meetings भी शामिल होती हैं। लेकिन यह release open weights teams को यह सोच दोबारा जांचने की ठोस वजह देता है कि उन्हें सच में कितना model चाहिए। Scoreboard अभी भी scoreboard है, लेकिन tape measure को अभी office decor में demote कर दिया गया है।