DeepSeek V4 Pro est sorti : on l'a noté sur nos six tâches d'agent — et il devient notre chef d'orchestre
La nouvelle version de DeepSeek vient d'arriver sur les fournisseurs d'inférence. Vaut-elle mieux que le modèle qu'on déploie déjà ? On a repris notre banc complet — six vraies tâches d'agent, un juge qui note en aveugle — et on l'a notée deux fois : qualité pure et réactivité. Verdict : elle ne remplace pas flash, elle le commande.
Le nouveau DeepSeek V4 Pro est 3e en qualité pure— quasi ex æquo avec GLM 5.2, devant flash — mais dernier en direct (27 s par réponse). Alors on donne à chacun son poste : pro orchestre, flash absorbe le volume, GLM 5.2 tranche en juge. Trois rôles, trois modèles.

On continue le journal de bord. À l'épisode 2, on a noté neuf modèles sur six vraies tâches d'agent, juge en aveugle : un souverain quasi gratuit finissait deuxième. Depuis, DeepSeek a sorti sa version « Pro » — la question est simple : est-ce qu'elle change notre classement ?
Alors on a repris le même banc : les six tâches figées (post LinkedIn, relance mail, réponse SAV, recherche catalogue, audit visibilité, qualification prospect), le même juge en aveugle, la même note sur 100 — et on a ajouté le nouveau venu dans la colonne. Pas de test au rabais : la vraie méthode de l'épisode 2, appliquée au Pro.
01Le classement — deux notes, parce que deux usages
Un agent n'est pas une seule chose. Un chatbot doit répondre vite, un agent de fond (devis, synthèse, rédaction, orchestration) a le droit de prendre 30 secondes si le résultat est meilleur. Alors on note chaque modèle deux fois, avec le même juge en aveugle : la note « fond » (qualité pure, sans vitesse ni coût) et la note « direct »(réactif, où la vitesse pèse).
| # | Modèle | Note « fond » | Note « direct » |
|---|---|---|---|
| 1 | GPT-5.5 | 94,6 | 82,2 |
| 2 | GLM 5.2 | 90,0 | 70,4 |
| 3 | deepseek-v4-pronouveau | 89,8 | 68,3 |
| 4 | Claude Sonnet 4.6 | 87,8 | 73,7 |
| 5 | deepseek-v4-flash | 87,3 | 79,5 |
| 6 | Claude Opus 4.8 | 85,3 | 72,8 |
| 7 | Mistral Medium 3.5 | 84,4 | 83,4 |
| 8 | GPT-OSS 120B | 78,0 | 83,6 |
Juge glm-5.2, en aveugle. deepseek-v4-pro et glm-5.2 ont été mesurés trois fois, les autres une seule — les écarts dans la bande 85-90 sont donc indicatifs. Ce qui est solide : en note « fond », GPT-5.5 décroche en tête, et le Pro monte 3e, quasi ex æquo avec GLM 5.2(89,8 contre 90,0) — devant flash. En note « direct », il plonge dernier, plombé par ses 27 secondes. Deux notes, deux réalités différentes.
02Le détail — chacun sa force, chacun son talon
Un classement global cache le détail. On a mis côte à côte les trois modèles qu'on fait tourner sur le même fournisseur — flash, Pro et GLM — sur chacune des cinq dimensions.
| Dimension | flash | Pro | GLM 5.2 |
|---|---|---|---|
| Qualité du français | 3,7 | 3,9 | 3,8 |
| Fiabilité (n'invente rien) | 4,9 | 5,0 | 5,0 |
| Pertinence / jugement | 4,7 | 4,6 | 4,8 |
| Vitesse | 2,5 | 0,7 | 1,7 |
| Coût | 5,0 | 3,3 | 1,7 |
Chacun a sa force : flash sur la vitesse et le coût, Pro sur le français (3,9, le meilleur des trois) et la fiabilité, GLM 5.2 sur le jugement (4,8). Mais les talons pèsent lourd : Pro est quatre fois plus lent que flash, et GLM coûte quatre fois plus cher que Pro.
03Le cache et le coût — le vrai critère qu'on oublie
La note « coût » du classement vient d'un calcul, mais on a aussi mesuré le coût réel de chaque appel, cache compris. Le cache change tout : le début du prompt est mis en mémoire, et on ne le repaie pas au tour suivant — c'est ce qui rend un agent multi-tours abordable.
| Modèle | Coût réel / appel | Latence moyenne |
|---|---|---|
| deepseek-v4-flash | ≈ 0,0001 € | 6,7 s |
| deepseek-v4-pro | ≈ 0,0014 € | 27,4 s |
| glm-5.2 | ≈ 0,0056 € | 9,7 s |
Deux lectures se dégagent. D'un côté : le Pro coûte 14 fois plus cher que flash (0,0014 € contre 0,0001 €) et répond en 27 secondes contre 6,7 s. De l'autre : GLM 5.2 coûte 4 fois plus cher que le Pro (0,0056 €) — c'est lui le plus cher des trois, pas le Pro. Le cache (149 tokens mis en mémoire par appel pour le Pro) n'absorbe pas ces écarts : c'est le volume de sortie et le prix au token qui font la différence.
Le cache, c'est l'angle mort des comparatifs classiques. Un modèle « moins cher au million de tokens » peut revenir plus cher en pratique s'il réfléchit long et génère beaucoup de sortie — ou au contraire presque gratuit si son prompt est servi depuis le cache. On l'avait déjà montré à l'épisode 1 : le coût réel d'un agent, c'est le cache plus le volume de sortie, pas le prix affiché.
04Notre choix : trois rôles, trois modèles
Le Pro ne remplace pas flash — et GLM n'est pas là pour écrire. Chacun a son poste.
Les deux notes disent la même chose : chaque modèle excelle sur un terrain. Pro écrit le meilleur français et décide (3,9 / fiabilité 5,0) ; flash absorbe le volume, rapide et quasi gratuit ; GLM 5.2 est le meilleur juge (pertinence 4,8). Alors on ne force personne : on donne à chacun le rôle qu'il maîtrise.
Notre architecture : deepseek-v4-pro en orchestrateur — il lit, comprend, décide et répartit, et il délègue l'exécution à deepseek-v4-flash. GLM 5.2, lui, est sollicité ponctuellement quand il faut trancher : qualifier un prospect, évaluer un audit, donner un second avis. Trois rôles, trois modèles, chacun au juste prix.
Pour nos clients, une chose est sûre : cet arbitrage n'est pas figé. Le paysage des modèles bouge toutes les semaines, et le bon choix se re-tranche en continu — ce banc sert justement à savoir qui mettre où, mesures à l'appui. Et la seule vraie limite de Pro aujourd'hui n'est ni la qualité ni le prix : c'est la latence. Dès qu'il gagnera en rapidité, il deviendra notre choix par défaut.
Un agent IA qui choisit le bon modèle pour chaque tâche
On déploie des assistants sur-mesure pour PME, avec le bon modèle au bon prix, hébergés en Europe. Parlons de votre cas concret.
Discuter de mon projetJournal de bord — 12 août 2026. Banc complet repris de l'épisode 2 (six tâches figées), juge glm-5.2 en aveugle, coûts réels mesurés cache compris. deepseek-v4-pro ajouté, mesuré trois fois. Modèles open-weight, servables en région européenne. Scénarios fictifs, sans donnée personnelle. La méthode complète du banc qualité est dans l'épisode 2.