ESP32-S3 LLM विश्लेषण: $8 वाली Gemma ट्रिक पर 28.9M
मुख्य बातें
- एज AI बनाते समय मेमोरी प्लेसमेंट को एक प्रथम-श्रेणी का डिज़ाइन विकल्प मानें।
- यदि आपके डिवाइस में फ्लैश है लेकिन RAM सीमित है, तो Gemma शैली के Per-Layer Embeddings का अध्ययन करें।
- सीमित कार्यों के लिए छोटे स्थानीय LLMs का उपयोग करें, बड़े होस्टेड मॉडल्स के प्रतिस्थापन के रूप में नहीं।
Hackster.io का छोटा स्थानीय इन्फ़रेंस डेमो चैटबॉट की चमक-दमक से कम, और सख्त मेमोरी हिसाब-किताब से ज़्यादा जुड़ा है।
Hackster.io का छोटा स्थानीय इन्फ़रेंस डेमो चैटबॉट की चमक-दमक से कम, और कड़े मेमोरी हिसाब-किताब से अधिक जुड़ा है।
$8 के माइक्रोकंट्रोलर पर चलने वाला एक लैंग्वेज मॉडल सुनने में ऐसा लगता है जैसे कोई फर्मवेयर इंजीनियर यह बात ठीक उस समय कहे, जब फायर अलार्म स्प्रिंट रेट्रो में शामिल होने वाला हो। फिर भी Hackster.io रिपोर्ट करता है कि एक डेवलपर ने 28.9M पैरामीटर वाला LLM पूरी तरह से ESP32-S3 पर चला दिया है, जिसमें न कोई क्लाउड कनेक्टिविटी है और न ही कोई बाहरी सर्वर शामिल है। टेक्स्ट एक छोटे डिस्प्ले पर लगभग 9.5 टोकन प्रति सेकंड की गति से जाता है, जो डेटा सेंटर वाली शान तो बिल्कुल नहीं है, लेकिन यह उन सभी लोगों के लिए गहरी झुंझलाहट की बात है जिन्हें लगा था कि छोटे चिप्स अब दिलचस्प नहीं रहे। बात यह नहीं है कि आपका अगला एंटरप्राइज़ कोपायलट उस बोर्ड से चलना चाहिए जिसकी कीमत दोपहर के खाने से कम हो। Hackster.io स्पष्ट करता है कि यह कोई फ्रंटियर मॉडल नहीं है, और शुक्र है, क्योंकि मेरे टोस्टर को तिमाही OKRs की ज़रूरत नहीं है। बात यह है कि एज AI अब आर्किटेक्चर, प्लेसमेंट और बाधा-संतुष्टि का अभ्यास बनता जा रहा है, जो मूल रूप से Tetris जैसा है, बस हर ब्लॉक एक टेंसर है और संगीत आपकी RAM बजट की चीख है।
Hackster.io ने माचिस की डिब्बी में एक
LLM पकड़ लिया Hackster.io के Nick Bild रिपोर्ट करते हैं कि यहां इस्तेमाल किए गए ESP32-S3 में 512KB SRAM, 8MB PSRAM और 16MB फ्लैश स्टोरेज है। यही पूरा मैदान है। कोई बाहरी सर्वर चुपचाप पर्दे के पीछे कठिन काम नहीं कर रहा, कोई क्लाउड कनेक्टिविटी दरवाज़े के नीचे से मॉडल के जवाब नहीं सरका रही, और कोई GPU पर्दे के पीछे मज़ेदार चश्मा पहनकर नहीं छिपा है। यही संख्याएँ इस डेमो को सिर्फ प्यारा नहीं, बल्कि शिक्षाप्रद बनाती हैं। Hackster.io नोट करता है कि इस श्रेणी के माइक्रोकंट्रोलर पर पहले के लैंग्वेज मॉडल लगभग 260,000 पैरामीटर तक थे, जबकि यह इम्प्लीमेंटेशन लगभग 100 गुना बड़ा है। अकेला पैरामीटर काउंट अब भी मॉडलों के लिए व्यक्तित्व मापने का बेहद खराब तरीका है, जैसे रसोइयों की रैंकिंग रसोई में कांटों की संख्या से करना, लेकिन इस मामले में यह हमें कुछ उपयोगी बताता है: बिल्डर ने सामान्य मेमोरी सीमा से आगे निकलने का तरीका खोज लिया।
AI Weekly असली तरकीब की ओर इशारा करता है
AI Weekly रिपोर्ट करता है कि मॉडल Google के Gemma मॉडलों से लिए गए Per-Layer Embeddings का उपयोग करता है, ताकि इसके 25M पैरामीटर RAM के बजाय फ्लैश में रखे जा सकें। वही वाक्य असली इंजीनियरिंग कहानी है, बस उसने एक छोटी टोपी पहन रखी है। RAM तंग अपार्टमेंट है, फ्लैश स्टोरेज यूनिट है, और मॉडल वह व्यक्ति है जो ज़िद कर रहा है कि सेक्शनल सोफ़ा भावनात्मक महत्व रखता है। यह महत्वपूर्ण है क्योंकि कई एज AI चर्चाएँ मॉडल आकार पर ऐसे अटक जाती हैं मानो छोटा करो नाम का कोई एक ही नॉब हो। AI Weekly के सारांश से ज़्यादा उपयोगी सीख यह है कि पैरामीटर कहाँ रहते हैं, यह उतना ही मायने रख सकता है जितना कि कितने पैरामीटर मौजूद हैं। यदि भारी हिस्से कम RAM के लिए प्रतिस्पर्धा करने के बजाय फ्लैश में बैठ सकते हैं, तो एक माइक्रोकंट्रोलर वह काम करने की कोशिश कर सकता है जो पहले बेतुका लगता था, या कम से कम कानूनी रूप से कम आपत्तिजनक तरीके से बेतुका।
GitHub दिखाता है कि बिल्डर्स पहले ही इसे परख रहे हैं
slvDev के esp32-ai प्रोजेक्ट की सार्वजनिक GitHub रिपॉज़िटरी स्निपेट में 2.3k स्टार, 265 फोर्क और 31 कमिट दिखाती है। यह कोई बेंचमार्क नहीं है, और निश्चित रूप से पीयर रिव्यू भी नहीं है, लेकिन यह एक उपयोगी संकेत है कि बिल्डर्स वायरिंग को खुद देखना चाहते हैं। ओपन सोर्स ध्यान आम तौर पर वहाँ इकट्ठा होता है जहाँ कोई दोहराने योग्य तरकीब होती है, न कि सिर्फ स्नीकर्स पहनी हुई प्रेस रिलीज़। व्यावहारिक डेवलपर्स के लिए, GitHub वाला पहलू छोटे स्थानीय इन्फ़रेंस के बारे में पढ़ने और यह पूछने के बीच का अंतर है कि क्या आपका अपना डिवाइस कोई संकरी लैंग्वेज टास्क होस्ट कर सकता है। किसी को भी यह उम्मीद नहीं करनी चाहिए कि 28.9M पैरामीटर वाला माइक्रोकंट्रोलर मॉडल बड़े सिस्टमों की जगह ले लेगा। लेकिन सीमित इंटरफेस, स्थानीय प्रॉम्प्ट, ऑफलाइन खिलौनों, प्रायोगिक डिस्प्ले और गोपनीयता-संवेदनशील प्रोटोटाइप्स के लिए, विचार का आकार उत्पन्न गद्य की वाक्पटुता से अधिक महत्वपूर्ण है।
एज AI बिल्डर्स को आगे क्या सीखना चाहिए
Hackster.io की रिपोर्ट और AI Weekly का मेमोरी ब्रेकडाउन एक बड़े डिज़ाइन पैटर्न की ओर इशारा करते हैं: छोटे डिवाइसों पर स्थानीय लैंग्वेज इन्फ़रेंस मिनी ChatGPT की कामना करने के बारे में कम और कठोर सिस्टम इंजीनियरिंग के बारे में ज़्यादा है। बिल्डर के लिए प्रासंगिक सीख यह है कि पहले मेमोरी मैप से शुरुआत करें, फिर ऐसे आर्किटेक्चर ट्रिक्स चुनें जो डिवाइस में फिट हों, उल्टा नहीं। यह embedded ML अपनी जड़ों की ओर लौट रहा है, जहाँ हर बाइट का ऑडिट ऐसे होता है जैसे उसने हेलीकॉप्टर के खर्च की रिपोर्ट जमा की हो। बेहतर छोटे मॉडल आर्किटेक्चर, अधिक आक्रामक स्टोरेज रणनीतियों और ऐसे डेमो के लिए इस क्षेत्र पर नज़र रखें जो स्थानीय AI को पार्टी ट्रिक जैसा कम और deployable विकल्प जैसा अधिक महसूस कराएँ। यदि आप एज पर निर्माण करते हैं, तो ESP32-S3 डेमो यह याद दिलाता है कि मेमोरी को मॉडल डिज़ाइन का हिस्सा मानें, न कि सिर्फ वह जगह जहाँ मॉडल संयोग से उतर जाता है। क्लाउड अब भी उपयोगी है, लेकिन लगता है माइक्रोकंट्रोलर ने नाइट क्लासेज़ शुरू कर दी हैं।
