DeepSeek sort V4.1 Flash - un million de tokens de contexte, des images et des prix des dizaines de fois inférieurs à ceux d'Anthropic
10 septembre 2026Cet article a été réalisé avec une solution qui orchestre sous supervision humaine une ferme de modèles d'IA, notamment pour la recherche, la vérification, la correction et la traduction.
Chaque lancement de DeepSeek suit le même scénario. L'entreprise montre des graphiques où son modèle devance OpenAI et Anthropic, puis tout Internet passe quelques jours à vérifier ce qu'il en est. Aujourd'hui, 10 septembre, DeepSeek a publié V4.1 Flash - le plus petit modèle de la nouvelle famille V4.1 et, comme l'a écrit sur X le chercheur de l'entreprise Zizheng Pan, « notre premier modèle phare avec prise en charge multimodale native ». Les poids sont sur Hugging Face sous licence MIT, chacun peut donc faire tourner le modèle par ses propres moyens. Le message de DeepSeek sur X comptait 3,4 millions de vues après douze heures.
Les chiffres impressionnent surtout par le contraste. Le modèle compte 552 milliards de paramètres dans une architecture mixture of experts, mais seuls 8 milliards sont actifs par token à la lecture de l'entrée et 16 milliards à la génération de la réponse - DeepSeek parle d'une architecture asymétrique Causal Encoder-Decoder. S'y ajoutent 196 milliards de paramètres de mémoire Engram, qui peuvent être stockés sur un SSD ordinaire. Le contexte est d'un million de tokens, soit plusieurs gros livres à la fois, et une réponse peut atteindre 384 000 tokens. Le cache KV occupe 890 octets par token, un quart du Flash précédent, et c'est en grande partie de là que vient le faible coût des longues conversations. Des utilisateurs de Hacker News mesurent 250 à 400 tokens par seconde via l'API.
Tarifs hors heures de pointe : 0,02 RMB par million de tokens d'entrée lus depuis le cache, 1 RMB pour l'entrée ordinaire et 4 RMB pour la sortie - environ 0,15 et 0,60 dollar. Aux heures de pointe, du lundi au vendredi de 9 h à 12 h et de 14 h à 18 h heure de Pékin (de 3 h à 6 h et de 8 h à 12 h, heure de Paris), les tarifs doublent. À titre de comparaison, Claude Fable 5 coûte 10 dollars par million de tokens en entrée et 50 dollars en sortie ; hors pointe, DeepSeek est donc respectivement 66 et 83 fois moins cher. Cela se voit surtout sur les longues tâches agentiques. L'utilisateur k9294 a recalculé sur Hacker News la consommation de tokens d'une seule session de programmation (447 tours, 36,5 millions de tokens lus depuis le cache) selon les grilles des deux modèles : 55 dollars aux tarifs de GPT-6 Astra, 36 à 73 cents aux tarifs de V4.1 Flash. Un autre utilisateur, mmastrac, a fait passer 2,1 milliards de tokens par la version preview en deux jours et a payé 22 dollars.
Artificial Analysis a calculé en août qu'une seule tâche de son jeu de tests coûtait 3 cents sur le V4 Flash précédent et 3,15 dollars sur Fable 5, plus de cent fois plus. Sauf que ce calcul reposait encore sur les anciens prix, plus bas, de DeepSeek. Les premiers tests indépendants du nouveau modèle sont apparus sur X en quelques heures. Paweł Huryn a donné à 23 modèles deux dépôts contenant 105 bugs cachés à corriger. Parmi les résultats : GPT-5.6 Luna (max) en a corrigé 33 pour 1,80 dollar, Claude Opus 5 (max) 27 pour 51,33 dollars, Grok 4.6 (xhigh) 27 pour 16,96 dollars, DeepSeek V4.1 Flash (max) 24 pour 1,08 dollar. Ledit mmastrac a conclu après deux jours de travail : « un peu au-dessus d'Opus 4.8, pas tout à fait Opus 5, pas Fable ».
Et qu'en est-il de l'ambition de « battre OpenAI et Anthropic » ? Dans le tableau de DeepSeek sur Hugging Face, le nouveau modèle bat Claude Opus 5 sur DeepSWE (74,2 contre 74,0), Terminal-Bench 2.1 et AutomationBench, mais perd sur GPQA Diamond (90,9 contre 93,4), Terminal-Bench 3.0 (30,0 contre 43,3) et Humanity's Last Exam sans outils (36,8 contre 56,3). Dans la dernière version de l'Intelligence Index indépendant, publiée le 7 septembre, le V4 Flash précédent obtient 35 points, le V4 Pro d'août 36, tandis que Claude Opus 5 obtient 51, Fable 5 50 et GPT-5.6 Sol 47. Artificial Analysis n'a pas encore mesuré V4.1 Flash. Il est plus honnête de parler du meilleur rapport qualité-prix que d'un meilleur modèle. Même si, avec un tel écart de prix, il y a quand même de quoi discuter.
Il y a aussi un revers. Le V4 Flash précédent avait 284 milliards de paramètres ; le nouveau en a presque deux fois plus. « Ce n'est plus vraiment du Flash », a écrit l'utilisateur de Hacker News revolvingthrow, et un autre, petu, a estimé qu'une vitesse utilisable à la maison demande environ 384 Go de mémoire, soit trois machines Nvidia Spark ou quatre cartes RTX Pro 6000. D'autres ont répondu que flash désigne la vitesse, pas la taille, et que ce modèle est deux fois plus rapide que son prédécesseur. Les deux camps ont raison - le modèle ne tient simplement plus sur un ordinateur portable.
Un détail intéressant de l'avis envoyé aux clients de l'API : à partir du 14 septembre (6 h, heure de Paris), toutes les requêtes adressées à V4 Pro seront redirigées vers V4.1 Flash et facturées aux tarifs Flash. DeepSeek écrit que des tests menés par plusieurs entités indépendantes ont donné au nouveau modèle, plus petit, l'avantage sur l'ancien modèle phare en termes de résultats, de coût, de vitesse et de temps d'exécution total. V4.1 Pro doit arriver plus tard, sans date. Le modèle est déjà pris en charge par Tencent (WorkBuddy, CodeBuddy) et OpenCode.
Il vaut la peine de garder le calendrier en tête. En mai, DeepSeek annonçait que la baisse de 75 % du prix de V4 Pro resterait permanente. À la mi-août, l'entreprise a relevé ses prix de 50 à 1 100 %, introduit des tarifs de pointe et hors pointe, et fixé V4 Pro à environ trois fois le tarif Flash. Selon la presse, elle lève actuellement près de 8 milliards de dollars sur une valorisation de 74 milliards de dollars, prépare une introduction en bourse sur le STAR Market de Shanghai, construit des centres de données et conçoit ses propres puces. La baisse d'aujourd'hui est de 32 % sur l'entrée, 57 % sur le cache et 9 % sur la sortie, et les actions de MiniMax ont chuté de 9 % à Hong Kong, celles de Z.ai de 10 % et celles d'Alibaba de plus de 3 %. « Le moins cher » est donc une notion relative - qui dépend de l'heure de la journée.
Mixture of experts (MoE) - une architecture dans laquelle le modèle est composé de nombreux sous-réseaux spécialisés (« experts ») et n'en active que quelques-uns pour chaque token. Le modèle peut ainsi être énorme tout en calculant aussi vite et à un coût aussi bas qu'un modèle des dizaines de fois plus petit. Cache KV - l'endroit où le modèle conserve le contenu déjà traité de la conversation pour ne pas le recalculer à chaque nouveau mot ; plus il est petit par token, moins les longues sessions coûtent cher.