AsiaLens
Dossiers Podcast Archives À propos S'abonner
ÉconomieMarchés & MonnaiesCrypto & Actifs numériquesEntreprises & IndustrieTech & SouverainetéGéopolitique & Diplomatie
Tech & Souveraineté

ByteDance identifie la cause des échecs de récupération de contexte long chez DeepSeek

Chine · TechNode · il y a 19 h
ByteDance identifie la cause des échecs de récupération de contexte long chez DeepSeek

Les chercheurs de la division Seed de ByteDance ont publié une étude technique qui démontre que la compression par lots du cache KV (KV-cache) dans les modèles DeepSeek rend la récupération d'information très sensible à la position des tokens dans la fenêtre de compression, avec des écarts de précision allant jusqu'à 40 points de pourcentage selon l'emplacement. Ce phénomène, baptisé « sensibilité à la phase », a été reproduit sur des modèles entraînés de zéro, montrant que différentes têtes d'attention se spécialisent dans des positions distinctes. Les résultats moyens des benchmarks peuvent donc masquer des faiblesses systématiques : un même fait sera facilement retrouvé à une position et quasi inaccessible à une autre. Cette découverte remet en cause la fiabilité des évaluations actuelles des modèles à long contexte et pousse les concepteurs (comme DeepSeek et d'autres labos) à repenser les stratégies de compression pour garantir une récupération uniforme, ce qui impactera directement les applications nécessitant une mémoire précise sur de longs documents.

À retenir
→ Cette découverte oblige les développeurs de modèles à long contexte à repenser la compression KV-cache pour éviter des trous de performance allant jusqu'à 40 % selon la position des informations, ce qui remet en cause la fiabilité des benchmarks actuels.
Lire la source · TechNode ↗
Partager cet article
𝕏 Posterin LinkedInWhatsApp✉ Email

Dans la même rubrique