Krzysztof Śmiałowski / Software & AI
O mnie Newsy Chat AI ↗ Kontakt

← Wszystkie newsy

DeepSeek wydał V4.1 Flash - milion tokenów kontekstu, obsługa obrazów i cena kilkadziesiąt razy niższa niż u Anthropic

10 września 2026

Ten artykuł powstał za pomocą rozwiązania, które pod nadzorem człowieka orkiestruje farmę modeli AI m.in. przy researchu, weryfikacji, korekcie i tłumaczeniu.

DeepSeek wydał V4.1 Flash - milion tokenów kontekstu, obsługa obrazów i cena kilkadziesiąt razy niższa niż u Anthropic

Przy każdej premierze DeepSeeka powtarza się ten sam schemat. Firma pokazuje wykresy, na których jej model wyprzedza OpenAI i Anthropic, a potem przez kilka dni cały internet sprawdza, ile w tym prawdy. Dziś, 10 września, DeepSeek wydał V4.1 Flash - najmniejszy model nowej rodziny V4.1 i, jak napisał na X badacz firmy Zizheng Pan, „nasz pierwszy flagowy model z natywną obsługą obrazów”. Wagi leżą na Hugging Face, na licencji MIT, więc każdy może uruchomić model u siebie. Po dwunastu godzinach wpis DeepSeeka na X miał 3,4 mln wyświetleń.

Liczby robią wrażenie głównie przez kontrast. Model ma 552 mld parametrów w architekturze mixture of experts, ale na jeden token pracuje tylko 8 mld przy czytaniu wejścia i 16 mld przy generowaniu odpowiedzi - DeepSeek nazywa to asymetrycznym układem Causal Encoder-Decoder. Do tego dochodzi 196 mld parametrów pamięci Engram, które mogą leżeć na zwykłym dysku SSD. Kontekst to milion tokenów, czyli kilka grubych książek naraz, a odpowiedź może mieć do 384 tys. tokenów. Pamięć podręczna KV zajmuje 890 bajtów na token, cztery razy mniej niż w poprzednim Flashu, i to z niej w dużej mierze bierze się niski koszt długich rozmów. Użytkownicy Hacker News mierzą w API 250-400 tokenów na sekundę.

Cennik poza szczytem: 0,02 RMB za milion tokenów wejścia odczytanych z pamięci podręcznej, 1 RMB za zwykłe wejście i 4 RMB za wyjście - w dolarach około 0,15 za wejście i 0,60 za wyjście. W godzinach szczytu, czyli od poniedziałku do piątku 9-12 i 14-18 czasu pekińskiego (u nas 3-6 i 8-12), stawki się podwajają. Dla porównania Claude Fable 5 kosztuje 10 dolarów za wejście i 50 za wyjście, więc poza szczytem DeepSeek jest tańszy odpowiednio 66 i 83 razy. Najlepiej widać to na długich zadaniach agentowych. Użytkownik k9294 przeliczył na Hacker News zużycie tokenów z jednej sesji programistycznej (447 tur, 36,5 mln tokenów odczytanych z pamięci podręcznej) po cennikach obu modeli: 55 dolarów według stawek GPT-6 Astra, 36-73 centy według stawek V4.1 Flash. Inny, mmastrac, przepuścił przez wersję preview 2,1 mld tokenów w dwa dni i zapłacił 22 dolary.

Artificial Analysis policzyło w sierpniu, że jedno zadanie z jego zestawu testów kosztowało na poprzednim V4 Flash - 3 centy, a na Fable 5 - 3,15 dolara, ponad sto razy więcej. Tyle że to wyliczenie opierało się jeszcze na starych, niższych cenach DeepSeeka. Pierwsze niezależne testy nowego modelu pojawiły się na X w ciągu kilku godzin. Paweł Huryn dał 23 modelom dwa repozytoria ze 105 ukrytymi błędami do naprawienia. Wybrane wyniki: GPT-5.6 Luna (max) 33 za 1,80 dolara, Claude Opus 5 (max) 27 za 51,33, Grok 4.6 (xhigh) 27 za 16,96, DeepSeek V4.1 Flash (max) 24 za 1,08. Wspomniany mmastrac ocenił po dwóch dniach pracy: „trochę powyżej Opusa 4.8, nie całkiem Opus 5, nie Fable”.

A co z „pokonaniem OpenAI i Anthropic”? W tabeli DeepSeeka na Hugging Face nowy model wygrywa z Claude Opus 5 w DeepSWE (74,2 do 74,0), Terminal-Bench 2.1 i AutomationBench, ale przegrywa w GPQA Diamond (90,9 do 93,4), Terminal-Bench 3.0 (30,0 do 43,3) i Humanity's Last Exam bez narzędzi (36,8 do 56,3). W najnowszej wersji niezależnego Intelligence Index, wydanej 7 września, poprzedni V4 Flash ma 35 punktów, sierpniowy V4 Pro 36, a Claude Opus 5 51, Fable 5 50 i GPT-5.6 Sol 47. Artificial Analysis nie zmierzyło jeszcze V4.1 Flash. Uczciwiej mówić o najlepszym stosunku jakości do ceny niż o lepszym modelu. Choć przy takiej różnicy w cenie i tak jest o czym rozmawiać.

Jest też druga strona. Poprzedni V4 Flash miał 284 mld parametrów, nowy ma prawie dwa razy tyle. „To już nie jest flash” - napisał na Hacker News użytkownik revolvingthrow. Inny, petu, szacował, że do sensownej szybkości w domu trzeba około 384 GB pamięci, czyli trzech komputerów Nvidia Spark albo czterech kart RTX Pro 6000. Inni odpowiadali, że flash oznacza szybkość, nie rozmiar, a ten model jest dwa razy szybszy od poprzednika. Obie strony mają rację - ten model po prostu przestał się mieścić na laptopie.

Ciekawy szczegół z zawiadomienia dla klientów API: od 14 września (6:00 naszego czasu) wszystkie zapytania do V4 Pro będą przekierowywane na V4.1 Flash i rozliczane po stawkach Flash. DeepSeek pisze, że testy różnych podmiotów dały nowemu, mniejszemu modelowi przewagę nad starym flagowcem pod względem wyników, kosztu, szybkości i całkowitego czasu. V4.1 Pro ma wyjść później, bez podanej daty. Model obsługują już Tencent (WorkBuddy, CodeBuddy) i OpenCode.

Warto przy tym pamiętać o kalendarzu. W maju DeepSeek zapowiadał, że 75-procentowa obniżka ceny V4 Pro zostanie na stałe. W połowie sierpnia podniósł ceny o 50-1100 procent i wprowadził taryfy szczytową i pozaszczytową, a V4 Pro wycenił około trzy razy drożej niż Flasha. Według doniesień firma zbiera około 8 mld dolarów przy wycenie 74 mld, szykuje debiut na szanghajskim STAR Market, buduje centra danych i projektuje własne układy. Dzisiejsza obniżka to 32 procent na wejściu, 57 na pamięci podręcznej i 9 na wyjściu, a akcje MiniMaxa spadły w Hongkongu o 9 procent, Z.ai o 10, Alibaby o ponad 3. „Najtańszy” jest więc pojęciem względnym - i zależy od godziny.

Mixture of experts (MoE) - architektura, w której model składa się z wielu wyspecjalizowanych podsieci („ekspertów”), a przy każdym tokenie uruchamia tylko kilka z nich. Dzięki temu model może być ogromny, a liczy tak szybko i tanio, jak model kilkadziesiąt razy mniejszy. Pamięć podręczna KV (KV cache) - miejsce, w którym model trzyma przetworzoną wcześniej treść rozmowy, żeby nie liczyć jej od nowa przy każdym kolejnym słowie; im mniejsza na token, tym tańsze długie sesje.