DeepSeek vydal V4.1 Flash - milion tokenů kontextu, obrázky a ceny desítkykrát nižší než u Anthropicu
10 září 2026Tento článek vznikl pomocí řešení, které pod lidským dohledem orchestruje farmu modelů AI, mimo jiné při rešerši, ověřování, korekturách a překladu.
Při každé premiéře DeepSeeku se opakuje stejný scénář. Firma ukáže grafy, na kterých její model překonává OpenAI a Anthropic, a pak celý internet několik dní zkoumá, kolik je na tom pravdy. Dnes, 10. září, DeepSeek vydal V4.1 Flash - nejmenší model nové rodiny V4.1, a jak na X napsal výzkumník firmy Zizheng Pan, „náš první vlajkový model s nativní multimodální podporou“. Váhy leží na Hugging Face pod licencí MIT, takže si model může kdokoli spustit u sebe. Příspěvek DeepSeeku na X měl po dvanácti hodinách 3,4 milionu zobrazení.
Čísla dělají dojem hlavně kontrastem. Model má 552 miliard parametrů v architektuře mixture of experts, ale na každý token se aktivuje jen 8 miliard při čtení vstupu a 16 miliard při generování odpovědi - DeepSeek tomu říká asymetrická architektura Causal Encoder-Decoder. K tomu přibývá 196 miliard parametrů paměti Engram, které mohou ležet na obyčejném SSD. Kontext je milion tokenů, tedy několik tlustých knih najednou, a odpověď může mít až 384 tisíc tokenů. KV cache zabírá 890 bajtů na token, čtvrtinu oproti předchozímu Flashi, a právě z toho z velké části plyne nízká cena dlouhých konverzací. Uživatelé Hacker News naměřili z API 250-400 tokenů za sekundu.
Ceník mimo špičku: 0,02 RMB za milion vstupních tokenů načtených z cache, 1 RMB za běžný vstup a 4 RMB za výstup - v dolarech zhruba 0,15 a 0,60. Ve špičce, tedy od pondělí do pátku 9:00-12:00 a 14:00-18:00 pekingského času (03:00-06:00 a 08:00-12:00 našeho času), se sazby zdvojnásobují. Pro srovnání Claude Fable 5 stojí 10 dolarů za milion vstupních a 50 dolarů za milion výstupních tokenů, takže mimo špičku je DeepSeek levnější 66krát, respektive 83krát. Nejlépe je to vidět na dlouhých agentních úlohách. Uživatel k9294 na Hacker News přepočítal spotřebu tokenů z jedné programátorské relace (447 výměn, 36,5 milionu tokenů načtených z cache) podle ceníků obou modelů: 55 dolarů podle sazeb GPT-6 Astra, 36-73 centů podle sazeb V4.1 Flash. Další uživatel, mmastrac, prohnal verzí preview za dva dny 2,1 miliardy tokenů a zaplatil 22 dolarů.
Artificial Analysis v srpnu spočítalo, že jedna úloha z jeho sady testů stála na předchozím V4 Flash 3 centy a na Fable 5 3,15 dolaru, více než stonásobek. Jenže ten výpočet se ještě opíral o staré, nižší ceny DeepSeeku. První nezávislé testy nového modelu se na X objevily během několika hodin. Paweł Huryn dal 23 modelům dva repozitáře se 105 skrytými chybami k opravě. Vybrané výsledky: GPT-5.6 Luna (max) opravil 33 chyb za 1,80 dolaru, Claude Opus 5 (max) 27 za 51,33 dolaru, Grok 4.6 (xhigh) 27 za 16,96 dolaru a DeepSeek V4.1 Flash (max) 24 za 1,08 dolaru. Zmíněný mmastrac po dvou dnech práce shrnul: „trochu nad Opusem 4.8, ne úplně Opus 5, ne Fable“.
A co „překonání OpenAI a Anthropicu“? V tabulce DeepSeeku na Hugging Face nový model poráží Claude Opus 5 v DeepSWE (74,2 ku 74,0), Terminal-Bench 2.1 a AutomationBench, ale prohrává v GPQA Diamond (90,9 ku 93,4), Terminal-Bench 3.0 (30,0 ku 43,3) a Humanity's Last Exam bez nástrojů (36,8 ku 56,3). V nejnovější verzi nezávislého Intelligence Index, vydané 7. září, má předchozí V4 Flash 35 bodů, srpnový V4 Pro 36, zatímco Claude Opus 5 má 51, Fable 5 50 a GPT-5.6 Sol 47. Organizace Artificial Analysis model V4.1 Flash zatím nezměřila. Poctivější je mluvit o nejlepším poměru kvality a ceny než o lepším modelu. I když při takovém rozdílu v ceně je stejně o čem mluvit.
Má to i druhou stranu. Předchozí V4 Flash měl 284 miliard parametrů, nový má skoro dvakrát tolik. „To už vlastně není flash,“ napsal na Hacker News uživatel revolvingthrow a jiný, petu, odhadl, že na použitelnou rychlost doma je potřeba asi 384 GB paměti, tedy tři počítače Nvidia Spark nebo čtyři karty RTX Pro 6000. Jiní odpovídali, že flash znamená rychlost, ne velikost, a tenhle model je dvakrát rychlejší než jeho předchůdce. Obě strany mají pravdu - model se prostě už do notebooku nevejde.
Zajímavý detail z oznámení pro zákazníky API: od 14. září (06:00 našeho času) budou všechny dotazy na V4 Pro přesměrovány na V4.1 Flash a účtovány podle sazeb Flash. DeepSeek píše, že testy několika nezávislých stran přisoudily novému, menšímu modelu převahu nad starou vlajkovou lodí ve výsledcích, ceně, rychlosti i celkové době běhu. V4.1 Pro má vyjít později, bez uvedeného data. Model už podporují Tencent (WorkBuddy, CodeBuddy) a OpenCode.
Přitom stojí za to pamatovat na kalendář. V květnu DeepSeek oznámil, že 75procentní sleva na V4 Pro zůstane natrvalo. V polovině srpna zvedl ceny o 50 až 1 100 procent, zavedl tarify špička/mimo špičku a V4 Pro nacenil zhruba na trojnásobek sazby Flash. Podle zpráv firma právě získává kolem 8 miliard dolarů při ocenění 74 miliard dolarů, chystá vstup na šanghajský STAR Market, staví datová centra a navrhuje vlastní čipy. Dnešní zlevnění činí 32 procent u vstupu, 57 procent u cache a 9 procent u výstupu, a akcie MiniMaxu spadly v Hongkongu o 9 procent, Z.ai o 10 procent a Alibaby o více než 3 procenta. „Nejlevnější“ je tedy relativní pojem - a záleží na denní době.
Mixture of experts (MoE) - architektura, ve které se model skládá z mnoha specializovaných podsítí („expertů“) a pro každý token aktivuje jen několik z nich. Díky tomu může být model obrovský, a přitom počítá tak rychle a levně jako model desítkykrát menší. KV cache - místo, kde si model drží už zpracovaný obsah konverzace, aby ho nemusel při každém dalším slově počítat znovu; čím méně místa na token zabírá, tím levnější jsou dlouhé relace.