Analyse LLM sur ESP32-S3 : 28,9 M avec l’astuce Gemma à 8 $
Points clés
- Traitez le placement de la mémoire comme un choix de conception de premier ordre lors de la création d’IA en périphérie.
- Étudiez les intégrations par couche de style Gemma si votre appareil dispose de mémoire flash mais de peu de RAM.
- Utilisez de minuscules LLM locaux pour des tâches contraintes, et non comme remplacements des grands modèles hébergés.
La minuscule démo d’inférence locale de Hackster.io parle moins de gloire de chatbot que de comptabilité impitoyable de la mémoire.
La minuscule démo d’inférence locale de Hackster.io parle moins de gloire de chatbot que de comptabilité mémoire impitoyable.
Un modèle de langage qui fonctionne sur un microcontrôleur à 8 dollars, cela ressemble à quelque chose qu’un ingénieur firmware dirait juste avant que l’alarme incendie ne rejoigne la rétrospective de sprint. Pourtant, Hackster.io rapporte qu’un développeur fait tourner un LLM de 28,9 millions de paramètres entièrement sur un ESP32-S3, sans connexion au cloud ni serveur externe. Le texte s’affiche sur un petit écran à environ 9,5 tokens par seconde, ce qui n’a pas exactement l’allure triomphante d’un centre de données, mais c’est profondément agaçant pour quiconque pensait que les toutes petites puces avaient fini d’être intéressantes. Le but n’est pas que votre prochain copilote d’entreprise soit alimenté par une carte qui coûte moins cher qu’un déjeuner. Hackster.io précise clairement qu’il ne s’agit pas d’un modèle de pointe, et heureusement, car mon grille-pain n’a pas besoin d’OKR trimestriels. Le point important, c’est que l’IA en périphérie devient un exercice d’architecture, de placement et de satisfaction de contraintes, ce qui est essentiellement du Tetris, sauf que chaque bloc est un tenseur et que la musique est votre budget RAM en train de hurler.
Hackster.io repère un
LLM dans une boîte d’allumettes Nick Bild, de Hackster.io, rapporte que l’ESP32-S3 utilisé ici dispose de 512 Ko de SRAM, de 8 Mo de PSRAM et de 16 Mo de stockage flash. C’est toute l’arène. Aucun serveur externe ne fait discrètement le gros du travail en coulisses, aucune connexion au cloud ne glisse les réponses du modèle sous la porte, et aucun GPU ne se cache derrière un rideau avec des lunettes fantaisie. Ce sont ces chiffres qui rendent la démonstration instructive plutôt que simplement mignonne. Hackster.io note que les précédents modèles de langage sur cette catégorie de microcontrôleur comptaient environ 260 000 paramètres, tandis que cette implémentation est environ 100 fois plus grande. Le nombre de paramètres à lui seul reste un très mauvais indicateur de personnalité pour les modèles, un peu comme classer les chefs selon le nombre de fourchettes dans leur cuisine, mais dans ce cas, il nous dit quelque chose d’utile : le concepteur a trouvé un moyen de contourner le plafond de mémoire habituel.
AI Weekly montre la vraie astuce
AI Weekly rapporte que le modèle utilise des Per-Layer Embeddings empruntés aux modèles Gemma de Google afin de conserver 25 millions de ses paramètres dans la mémoire flash plutôt que dans la RAM. Cette phrase, c’est l’histoire d’ingénierie avec un tout petit chapeau. La RAM est le petit appartement encombré, la flash est le garde-meuble, et le modèle est la personne qui insiste pour garder le canapé d’angle parce qu’il a une valeur sentimentale. C’est important parce que beaucoup de discussions sur l’IA en périphérie restent bloquées sur la taille du modèle, comme si la réduction était un simple bouton portant l’étiquette « petit, s’il vous plaît ». La leçon la plus utile du résumé d’AI Weekly est que l’endroit où résident les paramètres peut compter autant que leur nombre. Si les éléments volumineux peuvent rester en flash au lieu de se battre pour une RAM rare, un microcontrôleur peut tenter des tâches qui semblaient auparavant absurdes, ou du moins absurdes d’une manière un peu moins juridiquement risquée.
GitHub montre que les concepteurs testent déjà la bête
Le dépôt GitHub public du projet esp32-ai de slvDev affiche 2,3 k étoiles, 265 forks et 31 commits dans l’extrait. Ce n’est pas un benchmark, et ce n’est certainement pas une revue par les pairs, mais c’est un signal utile montrant que les concepteurs veulent inspecter le câblage. L’attention open source a tendance à se rassembler là où il existe une astuce reproductible, pas simplement un communiqué de presse avec des baskets. Pour les développeurs pragmatiques, l’angle GitHub fait la différence entre lire un article sur une minuscule inférence locale et se demander si son propre appareil pourrait héberger une tâche linguistique plus étroite. Personne ne devrait s’attendre à ce qu’un modèle sur microcontrôleur de 28,9 millions de paramètres remplace des systèmes plus grands. Mais pour des interfaces contraintes, des invites locales, des jouets hors ligne, des affichages expérimentaux et des prototypes sensibles à la confidentialité, la forme de l’idée compte davantage que l’éloquence de la prose générée.
Ce que les concepteurs d’IA en périphérie devraient apprendre ensuite
Le rapport de Hackster.io et la décomposition mémoire d’AI Weekly pointent vers un modèle de conception plus large : l’inférence linguistique locale sur de petits appareils consiste moins à rêver d’un mini ChatGPT qu’à faire de l’ingénierie système impitoyable. La leçon à retenir pour les concepteurs est de commencer par la carte mémoire, puis de choisir les astuces d’architecture qui conviennent à l’appareil, et non l’inverse. C’est le ML embarqué qui revient à ses racines, où chaque octet est audité comme s’il avait soumis une note de frais pour un hélicoptère. Surveillez cet espace pour voir arriver de meilleures architectures de petits modèles, des stratégies de stockage plus agressives et des démonstrations qui feront passer l’IA locale du tour de magie à une option réellement déployable. Si vous construisez en périphérie, la démonstration sur ESP32-S3 rappelle qu’il faut traiter la mémoire comme une partie de la conception du modèle, et non simplement comme l’endroit où le modèle finit par atterrir. Le cloud reste utile, mais apparemment, le microcontrôleur a commencé à prendre des cours du soir.
