DeepSeek et cache KV : vraie économie ou facture cachée ?
Contenu de l'épisode
DeepSeek affirme avoir divisé par quatre la mémoire nécessaire pour garder en vie les contextes géants de ses modèles. Mais cette prouesse technique en FP4 et en rejeu dynamique allège-t-elle réellement la facture des flottes d’agents, ou déplace-t-elle simplement le coût vers d’autres serveurs ? Plongée sous le capot d’un arbitrage FinOps qui redéfinit l’économie de l’inférence.
#modeles #meta-volatile #finops #deepseek