Dans cet article (4)
Levée de fonds de 65 M$ d’Ollama : analyse économique de la plateforme d’IA locale
Points clés
- Traitez les outils d’IA locaux comme une infrastructure de plateforme, et non comme un simple flux de travail de bricolage.
- Surveillez de près les modèles de tarification, car la facturation du temps GPU change la façon dont les développeurs estiment les coûts de l’IA.
- L’adoption par les développeurs peut devenir un canal de distribution lorsque les obstacles à la configuration disparaissent.
Près de 9 millions de développeurs suggèrent que le flux de travail de modèle local en une seule commande évolue vers une plateforme de développement soutenue par le cloud.
Une simple commande de terminal vient de débarquer dans une Series B de 65 M$ avec un hoodie et, d’une manière ou d’une autre, une table de capitalisation. Selon TNW, Ollama a levé ce tour de financement alors que son exécuteur de modèles ouverts atteignait près de 9 millions de développeurs, ce qui correspond à peu près au moment où l’IA locale cesse de ressembler à un projet de synthé bricolé dans un sous-sol et commence à ressembler à de l’infrastructure. L’attrait est presque agressivement simple : télécharger un modèle à poids ouverts, l’exécuter en local et éviter de transformer chaque expérience en rituel d’achat. Pour les créateurs, la nouvelle concerne moins les confettis du capital-risque qu’un flux de travail qui devient une activité de plateforme sans exiger d’abord que tout le monde se prosterne devant l’autel de la tarification au jeton.
Ce qui s’est passé, et pourquoi les créateurs s’en soucient TNW rapporte
qu’Ollama a levé une Series B de 65 M$ menée par Theory Ventures, avec la participation de Benchmark, 8VC, Y Combinator et d’autres. Le même rapport indique que ce tour porte le financement total à 88 M$, trois ans après le lancement. C’est une somme significative pour un outil surtout connu pour rendre la configuration de modèles à poids ouverts aussi simple que l’installation d’une dépendance développeur normale, et non comme l’invocation d’un démon GPU avec un pentagramme en YAML. TNW décrit aussi le pont produit qui en fait plus qu’un utilitaire de bureau : les développeurs peuvent exécuter un modèle localement avec une seule commande, et si l’ordinateur portable ne peut pas gérer un modèle plus grand, le cloud d’Ollama l’exécute avec la même configuration. Selon TNW, le cloud est facturé au temps GPU plutôt qu’au jeton, ce qui aligne la facture sur l’usage du calcul au lieu de donner à chaque prompt l’impression de nourrir un parcmètre qui aurait appris la poésie. Ce schéma local d’abord, cloud ensuite, est le mouvement de plateforme caché en pleine vue. Il permet aux développeurs de garder les expérimentations rapides près de leurs machines, puis de faire évoluer les charges de travail plus importantes sans changer de modèle mental. Dans les outils pour développeurs, cela compte, car la mémoire musculaire est un canal de distribution. Demandez à Docker, ou à n’importe quel ingénieur qui a tapé une commande qu’il ne comprend plus vraiment, mais à laquelle il fait profondément confiance.
L’adoption fait le bruit important en silence Hyper.ai rapporte qu’Ollama compte
8,9 millions de développeurs actifs mensuels, 176 000 étoiles GitHub, 17 000 forks et une utilisation dans 85 % des entreprises du Fortune 500. Ces chiffres ne prouvent pas que chaque entreprise fait passer des charges de travail critiques par Ollama, car les étoiles GitHub ne sont pas des bons de commande signés, et mon SRE intérieur m’oblige légalement à le dire. Mais ils montrent une large familiarité chez les développeurs, et la familiarité est souvent la façon dont l’infrastructure se faufile dans les entreprises en baskets. Hyper.ai rapporte aussi qu’Ollama fonctionne avec une équipe de 14 employés. Cela rend son profil d’adoption particulièrement intéressant, car l’entreprise semble avoir grandi en ponçant un flux de travail douloureux plutôt qu’en inventant un nouveau nom de catégorie dans un stand de conférence. La leçon centrale pour les créateurs est durable et délicieusement peu sexy : réduire les frictions de configuration, rencontrer les développeurs là où ils travaillent déjà, et laisser la distribution s’accumuler avant que la monétisation essaie de se mettre une couronne.
La mémoire musculaire de Docker n’est pas un accident L’histoire des fondateurs
est pertinente ici, pas seulement du matériel d’album souvenir de startup. TNW rapporte que Jeff Morgan et le cofondateur Michael Chiang ont créé Kitematic, que Docker a rachetée en 2015, et que leur travail est devenu Docker Desktop. Hyper.ai identifie de même Morgan et Chiang comme des vétérans de Docker et Kitematic, et indique qu’Ollama a été lancé en 2023 pour simplifier le déploiement de grands modèles de langage à poids ouverts sur des ordinateurs personnels. Ce contexte aide à expliquer la forme du produit. Ollama n’essaie pas de forcer les développeurs à se soucier de chaque détail de configuration matérielle avant de pouvoir tester un modèle. Hyper.ai indique que la plateforme abstrait les configurations matérielles complexes généralement nécessaires à l’inférence d’IA locale. En clair, elle transforme l’empilement de pilotes, de fichiers de modèles et de contraintes de machine en quelque chose de plus proche d’une expérience développeur normale, ce qui est moins glamour qu’un graphique de benchmark et bien plus susceptible d’être utilisé un mardi.
Le modèle économique est
le vrai test Hyper.ai rapporte que l’application de bureau principale d’Ollama reste gratuite et inchangée, tandis que l’entreprise s’est étendue à un service cloud par abonnement pour les modèles plus grands et plus exigeants en calcul. Hyper.ai indique que le service cloud facture selon l’utilisation du GPU plutôt qu’au nombre de jetons, avec des niveaux allant du gratuit à 100 $ par mois. Cela donne à Ollama une trajectoire plus claire que celle de nombreux outils proches de l’open source : garder le flux de travail local suffisamment gratuit pour se diffuser, puis facturer lorsque les charges de travail ont besoin de calcul hébergé. La question maintenant est de savoir si Ollama peut préserver la confiance des développeurs qui l’a menée jusque-là tout en construisant une activité cloud sur les bords. Les créateurs devraient observer si l’expérience locale reste rapide, ennuyeuse et fiable, car « ennuyeux » est le plus grand compliment que l’infrastructure puisse recevoir. Si Ollama y parvient, les outils d’IA open source locale ressembleront moins à une quête annexe de passionnés et davantage à la prochaine couche durable de la pile développeur IA. L’invite de terminal, au grand dam de PowerPoint, reste invaincue.
