Agents IA : pourquoi ils savent coder mais pas choisir
Contenu de l'épisode
Les agents IA savent générer et tester des centaines de lignes de code, mais savent-ils seulement où ils vont ? Le benchmark Taste-Bench révèle une faille troublante : face à une bifurcation cruciale, leur discernement plonge parfois sous le hasard, et penser plus longtemps n'y change rien. Faut-il dissocier l'exécution brute de la supervision de trajectoire pour rendre l'autonomie viable ?
#modeles #meta-evergreen #agents #benchmarks #decision