Zetamind · Veille modèles · Données au
Comparatif des cinq modèles vedettes et de leur contexte concurrent, orienté usage réel : quel modèle pour quel rôle, en priorisant l'accès OAuth. Chaque chiffre porte son niveau de confiance ; les sources datées sont en bas.
Claude Opus 5 vise la tête sur SWE-bench Pro (79,2 %, inféré) grâce à sa vérification de cause racine. GPT-5.6 Sol mène le CLI agentique (Terminal-Bench 88,8 %).
Serré et proche de la saturation : GPT-5.6 Sol en tête (GPQA ~95 %), Grok 4.5 au plafond en maths (AIME ~100 %). Écarts faibles.
Gemini 3.6 et la ligne Fable d'Anthropic gardent l'avantage vision. Données MMMU par modèle encore rares au 24 juil., beaucoup restent en Hypothèse.
Gemini 3.6 Flash et Grok 4.5 tiennent le meilleur rapport perf/prix. Pour Cédric, tout passe en OAuth : Opus 5, Kimi K3, GPT, Grok, Gemini sont déjà branchés.
Cliquez une en-tête pour trier. Le carré coloré à côté de chaque score indique son niveau de confiance. Un tiret signale une valeur non publiée ou indisponible.
Classement décroissant sur la métrique choisie. Seuls les modèles avec une valeur publiée ou inférée apparaissent.
Six axes normalisés sur 0-100 pour les cinq modèles vedettes. Cliquez un modèle dans la légende pour l'isoler.
Axes : Code (SWE-bench Pro), CLI (Terminal-Bench), Sciences (GPQA), Maths (AIME), Prix/valeur (coût inversé), Contexte. Un axe à zéro veut dire donnée non publiée, pas absence de capacité. Le radar mêle des valeurs Vérifiées et Inférées.
Forces, limites et mode d'accès. La pastille OAuth indique si Cédric y accède sans clé API payante.
Reco d'usage en priorisant l'accès OAuth déjà en place. Un principal, un secours par rôle.
Consultées les 24 et 25 juillet 2026. La veille s'appuie sur des annonces éditeurs et des agrégateurs publics ; les résumés de moteur ont été recoupés, d'où les tags Inféré quand la source primaire n'a pas été ouverte directement.