DeepSeek et cache KV : vraie économie ou facture cachée ? — Le centre de gravité

DeepSeek et cache KV : vraie économie ou facture cachée ?

Le centre de gravité · 21/09/2026 08:23 · 6 min

Contenu de l'épisode

DeepSeek affirme avoir divisé par quatre la mémoire nécessaire pour garder en vie les contextes géants de ses modèles. Mais cette prouesse technique en FP4 et en rejeu dynamique allège-t-elle réellement la facture des flottes d’agents, ou déplace-t-elle simplement le coût vers d’autres serveurs ? Plongée sous le capot d’un arbitrage FinOps qui redéfinit l’économie de l’inférence.

#modeles #meta-volatile #finops #deepseek

Plus d'informations