Claude Opus 4.8, calé sur l'honnêteté, repasse en tête
Opus 4.8 passe 69,2 % sur SWE-Bench Pro (10 pts devant GPT-5.5) et 1890 Elo sur GDPval (+137 vs 4.7), au même prix que 4.7 ($5/$25 par M de tokens). Entraîné à signaler ses incertitudes plutôt qu'à affirmer sur preuve mince — la fin du « you're absolutely right ». Détecte ses propres erreurs de code 4× mieux que 4.7. Ajoute un mode rapide (~2,5× plus vite, 3× moins cher qu'avant) et un contrôle d'effort par réponse, contexte 1M.