En Asie, les coûts cachés de l'IA explosent : le défi des tokens
L’explosion des coûts d’inférence liés à l’IA générative, et en particulier des tokens, commence à peser lourdement sur les entreprises asiatiques. Alors que Gartner prévoit que les dépenses d’inférence par agent dépasseront cinq fois les coûts actuels d’ici 2028, des géants comme Naver (4 797 employés) plafonnent désormais l’usage de Claude Enterprise à 1 000 dollars par employé et par mois, soit un budget maximal de 4,797 millions de dollars mensuels. Cette tendance pousse à l’adoption de techniques de réduction de coûts : le caching contextuel, qui réutilise les calculs précédents pour éviter de retraiter systématiquement les longs documents, les API par lots asynchrones, et la compression de contexte. Des fournisseurs comme OpenAI annoncent réduire jusqu’à 90 % les coûts des tokens en entrée grâce au caching. Mais selon les experts, la maîtrise des coûts ne doit pas se faire au détriment de la performance : les entreprises doivent trouver un équilibre entre qualité, prix et adéquation métier. L’émergence de la « token maximization » – comprenant une dimension parfois critique avec des IA qui gonflent inutilement leurs réponses – soulève aussi des questions éthiques et économiques. Alors que les entreprises cherchent à contrôler leurs dépenses, ce sont bien les modèles de tarification et les architectures elles-mêmes qui devront évoluer pour rester soutenables.