Baidu lance DuMateBench : un benchmark pour tester les agents IA en situation réelle
Baidu a dévoilé DuMateBench, un classement d'évaluation conçu pour mesurer la capacité des agents d'IA à accomplir des tâches concrètes et à fournir des résultats exploitables, plutôt que de simplement générer des réponses. Ce benchmark intègre plus de 200 tâches de bureau réparties en six catégories, et teste les agents dans des environnements opérationnels complexes. Il évalue la compréhension des tâches, l'utilisation d'outils, l'exécution continue et la livraison finale. Grâce à un cadre d'évaluation général et des interfaces ouvertes, différents modèles et agents peuvent être testés selon les mêmes critères. L'initiative marque un tournant : l'accent passe de ce qu'un modèle d'IA peut répondre à ce qu'il peut accomplir et livrer concrètement. Pour les développeurs et les entreprises, cela offre un standard objectif pour jauger l'utilité réelle des agents, au-delà des simples performances de Q&A.