Zhipu dévoile GLM-5.3-FlashX : 200 tokens/s sur 100 000 accélérateurs chinois
Zhipu AI (chinois : 智谱AI) a lancé son modèle d'inférence FLASH, GLM-5.3-FlashX, revendiquant un débit d'environ 200 tokens par seconde, exécuté sur environ 100 000 accélérateurs nationaux. Le modèle sous-jacent, Flash Base, est un MoE (mélange d'experts) ouvert de 320 milliards de paramètres avec seulement 18 milliards activés, conçu pour l'efficacité. Cette annonce survient dans un contexte de restrictions américaines renforcées (patrimoine, nouvelles règles d'exportation) qui poussent les acteurs chinois à optimiser leurs propres puces (comme le Kunpeng de Huawei ou les accélérateurs de Biren) via des logiciels. L'originalité réside dans l'utilisation d'un 'Infra Agent' qui optimise automatiquement la pile de service, réduisant les coûts et la latence pour les applications en temps réel. Concrètement, pour les développeurs et entreprises chinois, cela signifie une capacité à déployer des serveurs d'inférence à grande échelle sans dépendre des GPU Nvidia, avec des coûts réduits et une souveraineté accrue. Pour les clients internationaux, cela indique que l'IA chinoise continue de progresser malgré les sanctions, mais avec des tarifs et des écosystèmes logiciels différents, ce qui affectera la concurrence mondiale sur les prix et les choix techniques.