IA e ML · 30 de ago.
Raciocínio de IA até 11 vezes mais barato coloca a eficiência de inferência à frente dos benchmarks
Uma abordagem de raciocínio mais barata sugere que a próxima disputa de IA pode ser sobre economia de tempo de execução, não sobre confetes no topo dos rankings.
- Trate o custo de inferência como uma métrica central de avaliação, não como algo secundário ao lado das pontuações de precisão.
- Observe técnicas que reduzem tokens de raciocínio ou direcionam a computação de forma seletiva, especialmente para fluxos de trabalho com agentes.
- Não presuma que ser mais barato por execução significa ser mais barato em escala; meça latência, novas tentativas e uso total de tokens.