
इस लेख में (4)
Nemotron 3.5 Lightning विश्लेषण: तैनाती-योग्यता की जीत
मुख्य बातें
- ओपन-वेट एजेंट मॉडल्स की तुलना करते समय केवल पैरामीटर संख्या नहीं, बल्कि डिप्लॉयबिलिटी का मूल्यांकन करें।
- उत्पादन में Nemotron 3.5 Lightning पर दांव लगाने से पहले लॉन्ग-कॉन्टेक्स्ट व्यवहार और सर्विंग स्पीड का परीक्षण करें।
- यदि आप व्यावसायिक कस्टमाइजेशन की योजना बना रहे हैं, तो OpenMDW 1.1 और Nvidia की रेसिपीज की शुरुआती समीक्षा करें।
30B MoE मॉडल, 3B सक्रिय पैरामीटर, 1M संदर्भ, OpenMDW-1.1 लाइसेंसिंग और रेसिपीज़ के साथ, तैनाती ही मुख्य कहानी बन जाती है।
3B सक्रिय पैरामीटर, 1M कॉन्टेक्स्ट, OpenMDW-1.1 लाइसेंसिंग और रेसिपी वाला 30B MoE मॉडल—इसी वजह से डिप्लॉयमेंट इसकी असली कहानी बन जाता है।
ओपन मॉडल प्रतियोगिता कभी पैरामीटर संख्या के लिए बॉडीबिल्डिंग शो जैसी हुआ करती थी। हर कोई बड़े नंबर दिखाकर ताकत दिखाता था, और कोई यह नहीं पूछता था कि क्या वह चीज़ सच में डिप्लॉयमेंट के दरवाज़े से गुजर सकती है बिना चौखट, ड्राईवॉल, और तीन इंटर्न्स को साथ ले उड़ाए। Nvidia का Nemotron 3.5 Lightning इसलिए दिलचस्प है क्योंकि यह एक शांत तर्क देता है: ओपन वेट्स अब इस बात से कम जुड़े हैं कि किसके पास सबसे बड़ा मॉडल है, और इस बात से ज़्यादा कि कौन एक उपयोगी मॉडल शिप कर सकता है। NVIDIA NIM के अनुसार, Nemotron 3.5 Lightning 11 अगस्त 2026 को 30B मॉडल के रूप में आया, जिसमें 3B सक्रिय पैरामीटर हैं, एक mixture of experts सेटअप जो मॉडल के ज़्यादातर हिस्से को सोए रहने देता है जबकि एक छोटा हिस्सा काम करता है। यह ठीक-ठीक विनम्रता नहीं है। यह कुछ ऐसा है जैसे सलाहकारों से भरे स्टेडियम को नियुक्त करना और बैठक में केवल तीन को आने देना, जो सच कहें तो मैनेजमेंट की प्रगति है।
Artificial Analysis ने आकार के दिखावे को डाइट पर डाला
Artificial Analysis रिपोर्ट करता है कि Nemotron 3.5 Lightning पहला Nemotron 3.5 मॉडल है और NVIDIA Nemotron 3 Nano 30B A3B का उत्तराधिकारी है। इसकी गिनती 31.6B कुल पैरामीटर और 3.6B सक्रिय पैरामीटर बताती है, साथ ही यह भी नोट करती है कि मॉडल Nemotron 3 Nano की hybrid Mamba-Transformer आर्किटेक्चर को बनाए रखता है। उपयोगी हिस्सा स्कोर में बदलाव है: Artificial Analysis Lightning को अपने Intelligence Index पर 24 देता है, जो Nemotron 3 Nano के 15 से ऊपर है, इसे OpenAI के gpt-oss-120b के 24 के बराबर रखता है और Nemotron 3 Super के 26 से बस पीछे, जिसे Artificial Analysis इसके आकार का लगभग चार गुना बताता है।
यही तुलना असली बात है। एक छोटा open-weight मॉडल अगर एक intelligence index पर बहुत बड़े नामी प्रतिद्वंद्वी की बराबरी करता है, तो इसका मतलब यह नहीं कि आप मूल्यांकन फेंक दें और केप पहनकर सीधे प्रोडक्शन में दौड़ पड़ें। इसका मतलब यह है कि निर्माण का सवाल बदल जाता है: क्या यह मॉडल लीडरबोर्ड जीत सकता है से क्या यह मॉडल आपके असली प्रोडक्ट के अंदर सस्ते, तेज़ और कानूनी रूप से चल सकता है।
NVIDIA NIM डिप्लॉयमेंट की बात रखता है
NVIDIA NIM का मॉडल कार्ड इस तर्क का बिल्डर-फेसिंग आकार देता है: NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 एक MoE, Mamba-2, MoE, और Attention hybrid architecture का उपयोग करता है, 1M टोकन तक की context lengths को सपोर्ट करता है, और English, coding languages, Spanish, French, German, Italian, और Japanese को सूचीबद्ध करता है। ये सिर्फ spec-sheet सजावट नहीं हैं। एक मिलियन टोकन विंडो यह बदल देती है कि टीमें लंबे दस्तावेज़ों, टूल ट्रेसेज़, repo context, और agent memory के साथ क्या प्रयास कर सकती हैं, बशर्ते वे retrieval hygiene को JSON वाले कबाड़ दराज़ में बदलने से रोक सकें।
वही NVIDIA NIM कार्ड लाइसेंस को OpenMDW License Agreement, version 1.1 के रूप में सूचीबद्ध करता है। commercial use का मूल्यांकन कर रही टीमों के लिए, वह लाइसेंस लाइन due diligence checklist में latency, hosting cost, और data policy के बगल में होनी चाहिए, न कि legal later नाम के उदास PDF फ़ोल्डर में। NVIDIA यह भी कहता है कि Nemotron open models का एक परिवार है, जिसमें open weights, training data, और recipes हैं, और यही कम आंकी गई बात है: recipes वह जगह हैं जहाँ reproducibility लैब कोट पहने vibes होना बंद करती है।
NVIDIA का तकनीकी ब्लॉग इसे एजेंट प्लम्बिंग की तरह पेश करता है
Chris Alexiuk और Chintan Patel द्वारा लिखा गया NVIDIA का technical blog Nemotron 3.5 Lightning को long-running agents के लिए तेज़, सटीक specialized task execution के संदर्भ में पेश करता है। NVIDIA NIM इच्छित भूमिका के बारे में और भी स्पष्ट है, इसे long-running autonomous agents, sub-agent workhorse deployments, और agentic workflows के लिए सबसे अच्छा बताता है। यह हर सवाल का जवाब देने वाले एक विशाल oracle model से बहुत अलग product shape है, जो procurement badge पहने नींद से वंचित जादूगर जैसा व्यवहार करता है।
यहीं active-parameter design मायने रखता है। agents के लिए inference अक्सर हजारों calls से मौत जैसा होता है: plan, search, summarize, call tool, inspect result, retry, logs से माफ़ी मांगना, repeat। एक मॉडल जो usable reasoning बनाए रखते हुए active compute को कम रखता है, वह वह boring middle layer बन सकता है जो ज़्यादातर काम करता है, और boring middle layers ही वे चीज़ें हैं जिनसे software को वास्तव में पैसे मिलते हैं।
Artificial Analysis वह tradeoff दिखाता है जिसे builders को test करना चाहिए
Artificial Analysis tradeoff को लेकर सावधान है। यह कहता है कि Nemotron 3.5 Lightning अपनी size class के छोटे models में Qwen3.6 35B A3B से पीछे है, जिसका score 32 है, और Muse Glimmer से भी, जिसे 35 पर high चिह्नित किया गया है। लेकिन final NVFP4 weights चलाने वाले DeepInfra endpoint की pre-release testing में, Artificial Analysis ने लगभग 670 tokens per second की median output speeds मापीं, जो ऐसा नंबर है जिससे agent loops ठंडा होता सूप देखने जैसे कम लगते हैं।
agentic numbers भी वही हैं जहाँ यह release हल्की-फुल्की मसालेदार से ज़्यादा बन जाती है। Artificial Analysis Nemotron 3 Nano की तुलना में agentic evaluations पर सबसे बड़े gains रिपोर्ट करता है, जिसमें GDPval-AA v2 पर plus 334 ELO move शामिल है, जिसने gpt-oss-120b और Nemotron 3 Super को पार किया, साथ ही Termina पर gains भी। इससे Lightning universal answer नहीं बन जाता, क्योंकि AI में universal answers आमतौर पर perfume लगाए invoices ही होते हैं। लेकिन यह उन टीमों के लिए एक गंभीर candidate बन जाता है जो ऐसे agents बना रही हैं जिन्हें speed, long context, open weights, और pray करने के बजाय tune करने लायक पर्याप्त transparency चाहिए।
open models के साथ build कर रहे readers के लिए, अगला उपयोगी कदम इंटरनेट पर parameter totals के बारे में बहस करना नहीं है, हालांकि मैं cardio का सम्मान करता हूँ। वास्तविक deployment surface को test करें: context stuffing बनाम retrieval, NVFP4 serving behavior, agent loop latency, license review, और क्या NVIDIA की recipes आपके अपने domain data से मेल खाती हैं। open-weight contest अब monster truck rally नहीं है; यह latency budget वाला shipping department है।