Iflytek lance Spark-ASR-2.0, une reconnaissance vocale qui gère bruit, dialectes et mélange chinois-anglais
L'entreprise chinoise Iflytek a expédié Spark-ASR-2.0, sa nouvelle version de système de reconnaissance vocale. Elle améliore la prise en compte du bruit ambiant, des dialectes (mandarin régional, cantonais, etc.) et des alternances codiques chinois-anglais (code-switching), un usage très courant dans les métropoles et les milieux professionnels asiatiques. La version 2.0 est initialement déployée sur le clavier Iflytek Input (comptant des centaines de millions d'utilisateurs) et sera accessible via API ouverte. Le coût d'inférence n'augmente que d'environ 10 % par rapport à la version 1.0. Pour les entreprises tech, les développeurs d'assistants vocaux et les utilisateurs quotidiens en Chine, cela signifie une dictée fiable dans des environnements bruyants (transports, usines) et sans nécessité de basculer manuellement entre langues ou dialectes. Iflytek accélère ainsi la bataille avec Baidu, Alibaba et Tencent sur le marché de l'IA vocale asiatique, où le code-switching était historiquement un point faible.