ByteDance identifie la cause des échecs de récupération de contexte long chez DeepSeek
Les chercheurs de la division Seed de ByteDance ont publié une étude technique qui démontre que la compression par lots du cache KV (KV-cache) dans les modèles DeepSeek rend la récupération d'information très sensible à la position des tokens dans la fenêtre de compression, avec des écarts de précision allant jusqu'à 40 points de pourcentage selon l'emplacement. Ce phénomène, baptisé « sensibilité à la phase », a été reproduit sur des modèles entraînés de zéro, montrant que différentes têtes d'attention se spécialisent dans des positions distinctes. Les résultats moyens des benchmarks peuvent donc masquer des faiblesses systématiques : un même fait sera facilement retrouvé à une position et quasi inaccessible à une autre. Cette découverte remet en cause la fiabilité des évaluations actuelles des modèles à long contexte et pousse les concepteurs (comme DeepSeek et d'autres labos) à repenser les stratégies de compression pour garantir une récupération uniforme, ce qui impactera directement les applications nécessitant une mémoire précise sur de longs documents.