DeepSeek vydal V4.1 Flash - milión tokenov kontextu, obrázky a ceny desiatky ráz nižšie ako u Anthropicu
10 septembra 2026Tento článok vznikol pomocou riešenia, ktoré pod ľudským dohľadom orchestruje farmu modelov AI, okrem iného pri rešerši, overovaní, korektúre a preklade.
Pri každej premiére DeepSeeku sa opakuje rovnaký scenár. Firma ukáže grafy, na ktorých jej model prekonáva OpenAI a Anthropic, a potom celý internet niekoľko dní skúma, koľko je na tom pravdy. Dnes, 10. septembra, DeepSeek vydal V4.1 Flash - najmenší model novej rodiny V4.1, a ako na X napísal výskumník firmy Zizheng Pan, „náš prvý vlajkový model s natívnou multimodálnou podporou“. Váhy sú k dispozícii na Hugging Face pod licenciou MIT, takže si model môže ktokoľvek spustiť u seba. Príspevok DeepSeeku na X mal po dvanástich hodinách 3,4 milióna zobrazení.
Čísla robia dojem hlavne kontrastom. Model má 552 miliárd parametrov v architektúre mixture of experts, ale na každý token pripadá len 8 miliárd pri čítaní vstupu a 16 miliárd pri generovaní odpovede - DeepSeek to nazýva asymetrická architektúra Causal Encoder-Decoder. K tomu pribúda 196 miliárd parametrov pamäte Engram, ktorú možno uložiť na bežnom SSD. Kontext je milión tokenov, teda niekoľko hrubých kníh naraz, a odpoveď môže mať až 384-tisíc tokenov. KV cache zaberá 890 bajtov na token, štvrtinu oproti predchádzajúcemu Flashu, a práve z toho z veľkej časti plynie nízka cena dlhých konverzácií. Používatelia Hacker News namerali z API 250-400 tokenov za sekundu.
Cenník mimo špičky: 0,02 RMB za milión vstupných tokenov načítaných z cache, 1 RMB za bežný vstup a 4 RMB za výstup - v dolároch zhruba 0,15 a 0,60. V špičke, teda od pondelka do piatka 9:00-12:00 a 14:00-18:00 pekinského času (03:00-06:00 a 08:00-12:00 nášho času), sa sadzby zdvojnásobujú. Pre porovnanie, Claude Fable 5 stojí 10 dolárov za milión vstupných a 50 dolárov za milión výstupných tokenov, takže mimo špičky je DeepSeek lacnejší 66-krát, respektíve 83-krát. Najlepšie to vidno na dlhých agentných úlohách. Používateľ k9294 na Hacker News prepočítal spotrebu tokenov z jednej programátorskej relácie (447 výmen, 36,5 milióna tokenov načítaných z cache) podľa cenníkov oboch modelov: 55 dolárov podľa sadzieb GPT-6 Astra, 36-73 centov podľa sadzieb V4.1 Flash. Ďalší používateľ, mmastrac, prehnal cez verziu preview za dva dni 2,1 miliardy tokenov a zaplatil 22 dolárov.
Spoločnosť Artificial Analysis v auguste vypočítala, že jedna úloha z jej testovacieho súboru stála na predchádzajúcom V4 Flash 3 centy a na Fable 5 3,15 dolára, vyše stonásobne viac. Lenže ten výpočet sa ešte opieral o staré, nižšie ceny DeepSeeku. Prvé nezávislé testy nového modelu sa na X objavili v priebehu niekoľkých hodín. Paweł Huryn dal 23 modelom dva repozitáre so 105 skrytými chybami na opravu. Vybrané výsledky: GPT-5.6 Luna (max) opravil 33 chýb za 1,80 dolára, Claude Opus 5 (max) 27 za 51,33 dolára, Grok 4.6 (xhigh) 27 za 16,96 dolára a DeepSeek V4.1 Flash (max) 24 za 1,08 dolára. Spomínaný mmastrac po dvoch dňoch práce zhrnul: „trochu nad Opusom 4.8, nie celkom Opus 5, nie Fable“.
A čo „prekonanie OpenAI a Anthropicu“? V tabuľke DeepSeeku na Hugging Face nový model poráža Claude Opus 5 v DeepSWE (74,2 ku 74,0), Terminal-Bench 2.1 a AutomationBench, ale prehráva v GPQA Diamond (90,9 ku 93,4), Terminal-Bench 3.0 (30,0 ku 43,3) a Humanity's Last Exam bez nástrojov (36,8 ku 56,3). V najnovšej verzii nezávislého Intelligence Index, vydanej 7. septembra, má predchádzajúci V4 Flash 35 bodov, augustový V4 Pro 36, zatiaľ čo Claude Opus 5 má 51, Fable 5 50 a GPT-5.6 Sol 47. Spoločnosť Artificial Analysis model V4.1 Flash zatiaľ nemerala. Poctivejšie je hovoriť o najlepšom pomere kvality a ceny ako o lepšom modeli. Aj keď pri takomto cenovom rozdiele je stále o čom hovoriť.
Má to aj druhú stranu. Predchádzajúci V4 Flash mal 284 miliárd parametrov, nový má skoro dvakrát toľko. „To už naozaj nie je flash,“ napísal na Hacker News používateľ revolvingthrow a iný, petu, odhadol, že na použiteľnú rýchlosť doma treba asi 384 GB pamäte, teda tri počítače Nvidia Spark alebo štyri karty RTX Pro 6000. Iní odpovedali, že flash znamená rýchlosť, nie veľkosť, a tento model je dvakrát rýchlejší ako jeho predchodca. Obe strany majú pravdu - model sa do notebooka jednoducho už nezmestí.
Zaujímavý detail z oznámenia pre zákazníkov API: od 14. septembra (06:00 nášho času) budú všetky požiadavky na V4 Pro presmerované na V4.1 Flash a účtované podľa sadzieb Flash. DeepSeek píše, že testy viacerých nezávislých strán priznali novému, menšiemu modelu prevahu nad starou vlajkovou loďou vo výsledkoch, cene, rýchlosti aj celkovom čase behu. V4.1 Pro má vyjsť neskôr, bez uvedeného dátumu. Model už podporujú Tencent (WorkBuddy, CodeBuddy) a OpenCode.
Pritom sa oplatí pamätať na kalendár. V máji DeepSeek oznámil, že 75-percentná zľava na V4 Pro zostane natrvalo. V polovici augusta zdvihol ceny o 50 až 1 100 percent, zaviedol tarify špička/mimo špičky a V4 Pro nacenil zhruba na trojnásobok sadzby Flash. Podľa správ firma práve získava okolo 8 miliárd dolárov pri ocenení 74 miliárd dolárov, chystá vstup na šanghajský STAR Market, stavia dátové centrá a navrhuje vlastné čipy. Dnešné zlacnenie je 32 percent pri vstupe, 57 percent pri cache a 9 percent pri výstupe a akcie MiniMaxu spadli v Hongkongu o 9 percent, Z.ai o 10 percent a Alibaby o viac ako 3 percentá. „Najlacnejší“ je teda relatívny pojem - a závisí od dennej doby.
Mixture of experts (MoE) - architektúra, v ktorej sa model skladá z mnohých špecializovaných podsietí („expertov“) a pri každom tokene aktivuje len niekoľko z nich. Vďaka tomu môže byť model obrovský, a pritom počíta tak rýchlo a lacno ako model desiatky ráz menší. KV cache - miesto, kde si model drží už spracovaný obsah konverzácie, aby ho nemusel pri každom ďalšom slove počítať znova; čím je menšia na token, tým sú dlhé relácie lacnejšie.