IA & ML · 30 août
Un raisonnement IA jusqu’à 11 fois moins coûteux place l’efficacité de l’inférence avant les benchmarks
Une approche de raisonnement moins coûteuse suggère que le prochain concours d’IA pourrait porter sur l’économie du temps d’exécution, et non sur les confettis des classements.
- Traitez le coût d’inférence comme une métrique d’évaluation essentielle, et non comme une réflexion après coup à côté des scores de précision.
- Surveillez les techniques qui réduisent les jetons de raisonnement ou orientent sélectivement le calcul, en particulier pour les flux de travail d’agents.
- Ne supposez pas qu’un coût inférieur par exécution signifie un coût inférieur à grande échelle ; mesurez la latence, les nouvelles tentatives et l’utilisation totale des jetons.