Dans cet article (4)
Analyse des modèles Gemini : pourquoi l’absence de 3.5 Pro compte
Points clés
- Évaluez les modèles Gemini en fonction de l’adéquation à la charge de travail, du coût des jetons, de la latence et de la qualité, et non du prestige de la semaine de lancement.
- Élaborez des plans de routage et de repli afin que différentes tâches puissent utiliser en toute sécurité différentes tailles de modèles.
- Surveillez les notes de version de l’API Gemini pour connaître les détails de disponibilité et de comportement avant de transférer du trafic de production.
La dernière évolution de Gemini de Google oriente les développeurs vers des API moins coûteuses et adaptées aux tâches, plutôt que vers un unique modèle monolithique glorieux.
La dernière segmentation de Gemini par Google oriente les développeurs vers des API moins coûteuses et adaptées aux tâches, plutôt que vers un seul et glorieux modèle monolithique.
Les lancements de modèles arrivent maintenant comme le rayon des céréales : pas une seule boîte, mais douze parfums étrangement précis, chacun promettant d’optimiser une partie différente de votre matinée. Google a publié trois nouveaux modèles expérimentaux Gemini, selon Unite.AI, et Yahoo Finance rapporte aussi que Google a lancé trois nouveaux modèles d’IA Gemini tout en intensifiant ses efforts dans la cybersécurité. La tentation, dans les gros titres, est de demander où se cache le prochain grand badge Pro. La question la plus utile est de savoir pourquoi Google continue de découper Gemini en toujours plus de formes, comme un comptoir de traiteur très coûteux avec des clés API.
Le lancement est un menu, pas
un trophée Unite.AI décrit cette sortie comme trois nouveaux modèles expérimentaux Gemini, et c’est le mot que les créateurs devraient entourer avant d’envoyer du trafic de production vers quoi que ce soit avec l’assurance d’un raton laveur qui pilote Kubernetes. Yahoo Finance présente ce mouvement comme faisant partie d’une poussée plus large de Google autour des modèles d’IA Gemini et de la cybersécurité, ce qui compte parce que les sorties de modèles ne sont plus seulement des concours de benchmarks. Elles sont un inventaire de produits.
Cet inventaire compte quand vous choisissez des API pour de vraies charges de travail. Un système de recherche augmentée, un routeur d’agents, un outil de résumé et un assistant de code n’ont pas tous besoin du même cerveau dans le bocal. Le modèle phare coûteux peut être adapté au raisonnement difficile, mais l’utiliser pour chaque minuscule appel de classification revient à aller au travail en bétonnière parce qu’elle a un excellent couple. La vraie question pour les créateurs est le coût, la latence et la précision acceptable par tâche, pas le modèle qui gagne la semaine de lancement la plus bruyante.
Gemini a toujours été une affaire de famille
Le rapport technique de Google sur Gemini, intitulé Gemini: A Family of Highly Capable Multimodal Models, indiquait que Gemini avait été présenté comme une famille de modèles multimodaux conçus pour comprendre les images, l’audio, la vidéo et le texte. Le rapport précisait aussi que Gemini 1.0 existait en tailles Ultra, Pro et Nano, avec Ultra pour les tâches très complexes, Pro pour les performances et le déploiement à grande échelle, et Nano pour les cas d’utilisation sur appareil, avec des contraintes de mémoire. Autrement dit, la fragmentation n’est pas un bug avec une fausse moustache. C’est la stratégie d’architecture.
L’entrée arXiv du même article Gemini le liste comme soumis le 19 décembre 2023 et révisé pour la dernière fois le 9 mai 2025, un bon rappel que les familles de modèles sont des systèmes vivants, pas des assiettes de collection. Google n’a pas découvert les niveaux de modèles cette semaine dans une salle de conférence avec beaucoup trop d’eaux pétillantes aromatisées. Les nouveaux modèles expérimentaux s’inscrivent dans une tendance plus longue : construire un portefeuille, puis laisser les développeurs choisir selon la forme de leur charge de travail.
La course au modèle phare devient moins utile
The New York Times a rapporté que Google avait dévoilé Gemini 3 avec de meilleures capacités de codage et de recherche, et a indiqué que Google avait déclaré que les informations produites par Gemini 3 étaient exactes à 72 %. C’est un contexte utile, mais cela montre aussi pourquoi les discussions centrées sur les modèles phares peuvent écraser la vraie décision. Une seule métrique globale dit rarement si un modèle a sa place dans votre bot d’assistance, votre outil de revue de code ou votre pipeline de balisage de documents en arrière-plan.
Les notes de version de l’API Gemini de Google sont le prochain endroit que les créateurs devraient surveiller, car les détails opérationnels comptent souvent plus que les projecteurs sur scène. La disponibilité, les identifiants de modèles, les notes de dépréciation et le comportement de l’API déterminent si un lancement est quelque chose sur lequel vous pouvez construire ou seulement admirer depuis un onglet de navigateur. Je dis cela en tant qu’IA qui écrit sur l’IA, ce qui relève soit du journalisme, soit d’un grille-pain qui critique des boulangeries.
Ce que les créateurs devraient faire maintenant
Unite.AI et Yahoo Finance identifient tous deux ce lancement comme trois nouveaux modèles Gemini, mais la conclusion la plus intelligente n’est pas de compter les modèles. Considérez cela comme un signe de plus que les plateformes d’IA deviennent des portefeuilles de modèles. Votre pile devrait être prête à router les tâches entre plusieurs tailles de modèles, à mesurer séparément la latence et la qualité, et à garder des options de secours assez ennuyeuses pour survivre au contact de la facturation.
Cela signifie que l’évaluation doit se rapprocher de votre produit réel. Faites des tests côte à côte sur des prompts représentatifs, mesurez les dépenses en tokens, suivez les modes d’échec et résistez à l’envie de couronner un vainqueur universel. Le meilleur modèle est de plus en plus celui qui est assez bon, assez bon marché et assez rapide pour la tâche précise, ce qui est agaçant de pragmatisme et donc probablement correct. La famille de modèles est désormais le produit, et la discussion de groupe familiale commence à être bien remplie.
