Krzysztof Śmiałowski / Software & AI
O mnie Newsy Chat AI ↗ Kontakt

← Wszystkie newsy

Dwie premiery w półtorej godziny - Anthropic i OpenAI ścigają się już ceną, nie wynikiem

22 września 2026

Ten artykuł powstał za pomocą rozwiązania, które pod nadzorem człowieka orkiestruje farmę modeli AI m.in. przy researchu, weryfikacji, korekcie i tłumaczeniu.

Dwie premiery w półtorej godziny - Anthropic i OpenAI ścigają się już ceną, nie wynikiem

Od listopada cennik Opusa stał w miejscu. Simon Willison, współtwórca Django, od trzech lat prowadzący jeden z najczęściej cytowanych blogów o modelach językowych, policzył to na świeżo: Opus 4.5, 4.6, 4.7, 4.8 i 5 kosztowały dokładnie tyle samo, 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych. Pięć premier, jeden cennik.

We wtorek 22 września obie firmy obniżyły ceny w ciągu jednego popołudnia. Najpierw Anthropic wypuścił Claude Opus 5.5: 4 dolary za milion tokenów wejściowych i 20 za milion wyjściowych, o 20 procent mniej niż za Opusa 5. Odczyty z pamięci podręcznej staniały mocniej, z 0,50 do 0,20 dolara, czyli o 60 procent. Półtorej godziny później, według TechCruncha, OpenAI pokazał GPT-6 Sol i GPT-6 Luna z cenami ściętymi o połowę: Sol 2 i 10 dolarów, Luna 0,10 i 0,50 dolara.

Tyle że 20 procent to nie jest liczba, którą Anthropic eksponuje. Stoi w komunikacie obok innej. „Nasze testy pokazują, że przy domyślnych ustawieniach będzie kosztował o 40 procent mniej niż Opus 5 przy typowych obciążeniach” - pisze firma i wyjaśnia, skąd bierze się różnica: „Kosztuje mniej za token niż Opus 5 i zużywa mniej tokenów na zadanie, co w sumie daje czterdziestoprocentowy spadek kosztów”. Połowa obniżki jest w cenniku. Druga połowa ma wynikać z mniejszego zużycia tokenów, a to zależy już od tego, jak ustawisz model.

Pierwszy niezależny pomiar dał wynik przeciwny. Serwis Artificial Analysis, który sprawdza modele własnym zestawem zadań, zmierzył u Opusa 5.5 około 119 tysięcy tokenów wyjściowych na zadanie wobec 73 tysięcy u Opusa 5. Koszt całego zadania, liczony razem z wejściem i pamięcią podręczną, pozostał według serwisu taki sam mimo niższych cen. Ta liczba pochodzi jednak z pomiaru na maksymalnym poziomie wysiłku, a Anthropic mówi o domyślnym, który przy tej premierze zmienił się z wysokiego na średni. Ktoś w dyskusji na Hacker News porównał wszystkie poziomy: na maksymalnym nowy model zużywa o 38 procent więcej tokenów, na wysokim o 21 procent mniej, a oszczędniejszy jest na trzech z pięciu.

Pierwsza doba testów pokazała ten sam rozrzut. Inny użytkownik tego samego forum sprawdził modele na własnym zestawie dwunastu łatek z czternastoma zaszytymi błędami: Opus 5.5 znalazł osiem za 15,40 dolara, Opus 5 znalazł sześć za 58,19 dolara, Fable 5.1 siedem za 66,34 dolara. „Najlepszy i zarazem najtańszy” - podsumował, zaznaczając, że próbka jest mała, a kwoty to szacunek z wiersza poleceń, nie faktura. Prawie czterokrotnie niższy koszt, czyli oszczędność znacznie większa niż obiecane 40 procent. Tego samego dnia Willison wybrał dla Opusa 5.5 maksymalny poziom wysiłku i dwa razy nie dostał żadnej odpowiedzi, bo model wyczerpał limit 128 tysięcy tokenów wyjściowych, zanim skończył myśleć. Każda nieudana próba kosztowała 2,56 dolara i prawie 20 minut.

U OpenAI obniżka jest czysto cennikowa i akurat to jej zaleta, bo nie ma w niej żadnego „przy typowych obciążeniach”. Jest za to co innego. Artificial Analysis stwierdził, że wyniki Sola i Luny w indeksie inteligencji i w indeksie agentów programistycznych „pozostają na poziomie GPT-5.6, z postępem w części testów i pogorszeniem w innych”. Wynik Luny w tym drugim spadł o dwa punkty. Sol rzadziej zmyśla, zamiast przyznać, że nie wie: wskaźnik halucynacji zmalał z 92 do 60 procent. Odpowiada jednak na 83 procent pytań zamiast 99, więc trafność spadła z 59 do 54 procent. Do tego dwa zastrzeżenia drobnym drukiem. Obniżkę o 50 procent obliczono względem ceny promocyjnej GPT-5.6, nie katalogowej, a promocja ma obowiązywać „co najmniej do 21 listopada 2026”. I próg: powyżej 272 tysięcy tokenów wejściowych Sol kosztuje 4 i 15 dolarów zamiast 2 i 10, przy czym wyższa stawka obejmuje całe zapytanie, nie samą nadwyżkę. Przy modelu reklamowanym oknem miliona tokenów to nie szczegół.

Teraz o tym, co dotyczy większości czytelników. Jeśli płacisz abonament, a nie rachunek za API, nie potaniało ci nic. David Gewirtz z ZDNET-u ujął to najkrócej: „Dla użytkowników API to wielka sprawa. Ale dla nas, w abonamentach za 20, 100 czy 200 dolarów miesięcznie, te oszczędności nie przekładają się bezpośrednio na nasze rachunki”. Dodał, że pytanie, czy tańszy model wolniej zjada limit, nie doczekało się odpowiedzi w całym dwunastostronicowym komunikacie OpenAI. Firma o cenach abonamentów nie napisała nic, wspomniała tylko ogólnie o wyższych limitach. Anthropic dał coś konkretniejszego. Podniósł pięciogodzinne limity w abonamentach Pro, Max, Team oraz w Enterprise rozliczanym od liczby stanowisk, a do tego dał odnowienie limitu do wykorzystania w dogodnym momencie. Nie napisał, o ile podniósł. Informację o 20 procentach podał Gewirtz.

Wniosek jest praktyczny i trochę nudny: cena za token przestała być ceną. Liczy się to, ile kosztuje dokończone zadanie, a tego nie da się odczytać ani z cennika, ani z cudzego benchmarku, bo w tych samych dwóch modelach zadanie raz kosztuje tyle samo, raz cztery razy mniej. Da się policzyć u siebie, na tym samym zestawie zadań, przy tym samym poziomie wysiłku, na starej wersji i na nowej. Pisaliśmy o tym w czerwcu, gdy branża zaczynała szukać sposobu, jak zapanować nad wydatkami na tokeny. Trzy miesiące później obie firmy same zaczęły podawać koszt wykonania zadania obok wyników testów.

Wszystkie trzy modele udostępniono od razu, także w Polsce. Opus 5.5 jest dostępny przez API oraz w usługach Amazona, Google'a i Microsoftu, a GPT-6 Sol i Luna są dostępne przez API oraz w ChatGPT Work i Codeksie. W dniu premiery nie było ich jeszcze w zwykłym czacie ChatGPT. OpenAI zapowiedział, że będzie je tam stopniowo udostępniał. Ceny wszędzie w dolarach, stawek w złotych nie podała żadna z firm.

Token - fragment tekstu; modele dzielą zdania na tokeny, a stawki liczy się za milion. Po angielsku jeden token to mniej więcej trzy czwarte słowa, po polsku odwrotnie: na jedno nasze słowo schodzą zwykle ponad dwa tokeny, bo tokenizery odcinają końcówki fleksyjne jako osobne kawałki, więc ten sam tekst po polsku kosztuje jakieś dwa razy więcej. Prompt caching - przechowywanie raz wysłanego kontekstu w pamięci podręcznej, żeby przy kolejnym pytaniu nie płacić za niego pełnej stawki; przy pracy agentowej odczyty z tej pamięci to zwykle większość rachunku. Effort - poziom wysiłku; ustawienie, które mówi modelowi, ile ma się nagadać: jak długo myśleć, ile razy sięgnąć po narzędzia i jak obszernie odpowiedzieć.