Agents de recherche : pourquoi le score final est un piège
Contenu de l'épisode
Quand un agent IA optimise un workflow, a-t-il vraiment compris la cause du succès ou a-t-il simplement profité d’un coup de dés ? Le benchmark WhatWorkedBench révèle l’angle mort des agents autonomes : leur incapacité fréquente à relier une modification de code à son impact réel. Une confrontation indispensable entre accélération aveugle et rigueur scientifique.
#modeles #meta-evergreen #agents #causalite #benchmark