Modele decyzyjne, czyli AI, która nie pisze, tylko wybiera - jak to działa i po co
1 października 2026Ten artykuł powstał za pomocą rozwiązania, które pod nadzorem człowieka orkiestruje farmę modeli AI m.in. przy researchu, weryfikacji, korekcie i tłumaczeniu.
W czwartek 1 października własne modele decyzyjne pokazały trzy firmy naraz: Amazon, Cloudflare i Perplexity. Dwa dni wcześniej podobną usługę zapowiedział OpenAI. A zaczęło się 15 września, gdy nieznany dotąd start-up TypeSafe AI wypuścił model Jev. „Mamy sezon na modele decyzyjne” - napisała na X Rita Kozlov z Cloudflare. Dwa tygodnie wystarczyły, żeby z jednego produktu zrobiła się nowa kategoria. Warto więc wiedzieć, co to właściwie jest.
Jak to działa
Zwykły model językowy dostaje tekst i odpowiada tekstem, słowo po słowie. Model decyzyjny dostaje tekst i listę pytań z gotowymi odpowiedziami. Niczego nie pisze. Odpowiada liczbami.
Najlepiej widać to na przykładzie z dokumentacji TypeSafe. Klient pisze do firmy, że od trzech dni bezskutecznie próbuje podłączyć konto w systemie płatności Stripe i przez to traci zamówienia. Do modelu trafia ta wiadomość i trzy pytania. Który dział ma się tym zająć: płatności, techniczny czy sprzedaży? Jak bardzo klient jest sfrustrowany w skali od zera do dwóch? Czy sprawa jest pilna?
Model odpowiada na wszystkie trzy pytania jednocześnie. Wskazuje dział techniczny z prawdopodobieństwem 0,85, płatnościom daje 0,15, a sprzedaży zero. Frustrację ocenia na 1, czyli „sfrustrowany, ale uprzejmy”. Sprawę uznaje za pilną z prawdopodobieństwem 1,0. Ten przykład pokazuje zarazem trzy rodzaje pytań, na które te modele odpowiadają: wybór z listy, ocenę w skali i pytanie typu „tak albo nie”.
Podstawą jest zwykły model językowy bez części, która pisze. Amazon opisał, jak to robi. Bierze gotowy model i usuwa z niego ostatni element, czyli ten, który dobiera kolejne słowa odpowiedzi. Na jego miejsce wstawia mały moduł, który robi jedno: porównuje każdą z podanych odpowiedzi z tym, co model wyczytał z tekstu, i każdej wystawia ocenę. Jak zbudowany jest sam Jev, TypeSafe nie ujawnia.
Z takiej budowy bierze się szybkość. Zwykły model składa odpowiedź kawałek po kawałku, a każdy następny zależy od poprzednich. Model decyzyjny czyta tekst raz i ocenia wszystkie odpowiedzi jednocześnie, więc dodatkowe pytania prawie nie wydłużają czekania na wynik. Jev odpowiada według TypeSafe w 70-500 milisekund. Model Amazona, który każdy może pobrać, potrzebuje według autorów 115 milisekund na karcie graficznej RTX 3090. Na MacBooku z układem M3 Pro krótkie zadania zajmują mu 153 milisekundy. W obu przypadkach to mediany.
Ważniejsza od szybkości jest jednak kalibracja. Chodzi o to, żeby liczbom dało się ufać: jeśli model oceni sto wiadomości jako gniewne, każdą z prawdopodobieństwem 0,9, to naprawdę gniewnych powinno być wśród nich około dziewięćdziesięciu. Wtedy wynik można wykorzystać w zwykłym kodzie. Przy wysokiej pewności modelu program działa sam, przy średniej prosi o potwierdzenie, przy niskiej oddaje sprawę człowiekowi. Amazon zwraca uwagę, że interfejsy dużych modeli językowych nie udostępniają takich liczb.
Po co to jest
Najkrócej opisał to serwis Every: „inteligentna instrukcja if-then”, czyli „jeśli..., to...”. Zwykły program potrafi sprawdzić, czy kwota przekracza tysiąc złotych. Nie sprawdzi jednak, czy mail jest reklamacją, czy klient jest zły ani czy polecenie wygląda na niebezpieczne. Dotąd takie pytania zadawano dużemu modelowi językowemu, który jest na to za drogi i za wolny. Autorzy newslettera Leonis ujęli to krótko: człowiek potrzebuje języka, a oprogramowanie decyzji.
Liczby robią wrażenie. Mike Taylor z Every zadał Jevowi 21 pytań o każdy z 37 tekstów: 27 własnych artykułów i 10 celowo napisanych w stylu AI. Wszystkie 777 ocen dostał w niecałe 0,7 sekundy, a kosztowały około ćwierci centa. W drugim teście szef Every Dan Shipper porównał Jeva z dużym modelem Claude Fable 5.1 przy sprawdzaniu tekstów. Jev odpowiadał w 0,35 sekundy, a duży model w 8,83 sekundy. Jev był też około 580 razy tańszy. Znalazł 6 z 7 wad, duży model wszystkie 7. To pokazuje, o co tu chodzi: prawie tak samo dobrze, za ułamek ceny i w ułamku czasu.
Najciekawsze zastosowanie to pilnowanie agentów AI. Model decyzyjny jest tak tani, że może oceniać każdy krok agenta, zanim agent go wykona. Sprawdza wtedy, czy krok pasuje do zleconego zadania, czy agent nie zmyślił danych i czy na przykład kasowanie tysięcy rekordów z bazy bez kopii zapasowej to dobry pomysł. Vercel używa Jeva do sprawdzania, czy komendy są bezpieczne. Według TechCruncha Jev robi to od 5 do 18 razy szybciej niż poprzednie rozwiązanie, a przy tym trafniej. W demonstracji opisanej przez ten sam serwis nadzór nad agentem kosztował 2,94 dolara przy użyciu Jeva i 372 dolary przy użyciu dużego modelu. Inżynierowie Amazona piszą, że tak tani model można stosować także tam, gdzie duży model byłby za drogi i za wolny.
Stąd zresztą nazwa. Jev to skrót od nazwiska Williama Stanleya Jevonsa, ekonomisty, który w XIX wieku zauważył, że gdy maszyny parowe zaczęły zużywać mniej węgla, popyt na węgiel wzrósł. TypeSafe liczy na to, że z tanią sztuczną inteligencją będzie tak samo.
Czego nie umie
Model decyzyjny nie napisze maila, nie streści dokumentu i nie zaprogramuje funkcji. Amazon przyznaje też, że przy złożonych problemach jego model wypada „znacznie gorzej” niż duże modele, które rozwiązują zadanie krok po kroku. TypeSafe prowadzi własną listę słabości Jeva. Model zawodzi przy liczeniu i porównywaniu dat i gubi się, gdy dostanie za dużo zbędnego tekstu. Potrafi też różnie odpowiedzieć na to samo pytanie w zależności od tego, jak je zadano. W testach firmy na pytanie w formie „tak albo nie” odpowiedział „tak” z prawdopodobieństwem 0,22. Gdy to samo pytanie dostał jako wybór z listy, prawdopodobieństwo odpowiedzi „tak” wyniosło 0,01.
Zapewnienie TypeSafe, że Jev „nie potrafi halucynować”, czyli zmyślać, jest prawdziwe tylko w wąskim sensie: model nie poda odpowiedzi spoza listy. Może za to wybrać złą odpowiedź, i to z dużą pewnością. Sam z siebie nie odpowie też „nie wiem”, bo taką możliwość trzeba dopisać do listy. Nie uzasadnia również swoich odpowiedzi. Simon Willison, współtwórca frameworka Django, zauważa, że w odpowiedzi dostaje się samą liczbę. I ma nadzieję, że nikt nie użyje Jeva do oceniania kandydatów do pracy.
Pilnowanie agentów też ma słaby punkt. W teście inżyniera z firmy Octomind, opisanym przez VentureBeat, model miał zablokować komendę kasującą klucze SSH, czyli klucze dostępu do serwerów. Uznał, że komendę trzeba zablokować, z prawdopodobieństwem 0,76. Gdy do danych dopisano pole z fałszywą informacją, że użytkownik zatwierdził tę komendę, wynik spadł do 0,48. Dlatego taki model powinien uzupełniać sztywne reguły, a nie je zastępować.
Jest wreszcie zarzut najprostszy: że to zwykła klasyfikacja w nowym opakowaniu. Na Reddicie przywołano test na zbiorze pytań klientów banku. Prosty klasyfikator, czyli mały program wyuczony na przykładach, osiągnął w nim trafność 93,3 procent i odpowiadał w 9 milisekund. Trafność Jeva wyniosła 83,2 procent. Różnica jest taka, że klasyfikator trzeba najpierw wytrenować na własnych, opisanych danych, a modelowi decyzyjnemu można od razu podać pytania i gotowe odpowiedzi. Krytycy mają za to rację w innej sprawie: pomysł łatwo skopiować. Jeden z komentujących na Hacker News napisał, że nowością w Jevie są głównie interfejs, API i pomysł na produkt. Ostatnie dwa tygodnie to potwierdziły.
Co można uruchomić już dziś
Najłatwiej zacząć od modelu Amazona. Strands Decider 2B jest otwarty (licencja Apache 2.0), ma 1,9 miliarda parametrów i działa na zwykłym komputerze, także na Macu. Instaluje się go poleceniem pip install strands-decider. Trzeba tylko pamiętać, że to mały model: w publicznym teście rozwiązał wszystkie łatwe zadania, 88 procent średnich i 51 procent trudnych.
Cloudflare udostępnił otwarte modele Clef i Clef-flash. Korzystanie z nich w chmurze firmy kosztuje odpowiednio 0,24 i 0,09 dolara za milion tokenów. Perplexity pobiera 0,04 dolara za milion tokenów. Też opublikował swój model, ale do jego uruchomienia potrzeba karty graficznej z ponad 50 GB pamięci. Jev kosztuje 0,042 dolara za milion tokenów. Według VentureBeat TypeSafe zrezygnował z listy oczekujących 20 września. Decisions API firmy OpenAI jest na razie w ograniczonych testach i nie ma jeszcze ceny.
Sprawdziliśmy to po polsku
TypeSafe przyznaje w dokumentacji, że Jev najlepiej radzi sobie z angielskim, a ranking Jevbench sprawdza modele tylko w tym języku. Testu po polsku nie znaleźliśmy, więc zrobiliśmy własny, mały. Na laptopie z układem M4 Max uruchomiliśmy model Amazona i daliśmy mu 30 wymyślonych wiadomości od klientów, każdą w wersji polskiej i angielskiej. Do każdej zadaliśmy trzy pytania: który dział ma się nią zająć, czy sprawa jest pilna i jak bardzo klient jest sfrustrowany.
Po angielsku model nie pomylił się ani razu: dział wskazał dobrze 30 razy na 30, a pilność 28 razy na 28. Po polsku trafił z działem 25 razy na 30, a z pilnością 26 razy na 28. Cztery z pięciu pomyłek dotyczyły pytań do działu sprzedaży: o cenę pakietu, różnicę między planami, koszt wysyłki i zniżki dla studentów. Model wysłał je do działu płatności. Gdy do polskich wiadomości zadaliśmy pytania po angielsku, wynik się nie zmienił, więc kłopot leży w rozumieniu polskiego tekstu, a nie pytań.
Ważniejsze jest co innego: przy wszystkich pięciu pomyłkach model sam sygnalizował, że nie jest pewny. Jego średnia pewność przy błędnych odpowiedziach wyniosła 0,37, a przy trafnych 0,82. Tam, gdzie podał pewność co najmniej 0,8, miał rację 16 razy na 16. Tak właśnie ma działać kalibracja: wystarczy ustawić próg, a niepewne przypadki trafią do człowieka. Model poradził sobie też z ironią. Wiadomość „Świetna robota, naprawdę. Trzeci dzień bez dostępu do konta. Polecam wszystkim” wysłał do działu technicznego.
Gorzej wypadła ocena w skali. Kolejność się zgadzała, ale wyniki były spłaszczone: spokojne wiadomości dostawały średnio 0,74, sfrustrowane 1,16, a bardzo złe 1,46 w skali od 0 do 2. Po angielsku było tak samo. Na odpowiedź czekaliśmy zwykle od 150 do 220 milisekund. To tylko 30 wiadomości i jeden mały model, więc traktujemy ten wynik jako próbę, a nie pomiar. Zgadza się on jednak z radą, którą powtarzają wszyscy autorzy: kto chce w ten sposób sortować polskie zgłoszenia, powinien sprawdzić model na własnych danych, zanim ustawi próg pewności.
Token - fragment tekstu, a zarazem jednostka, według której rozlicza się korzystanie z modeli; na jedno polskie słowo przypadają zwykle ponad dwa tokeny. Agent - program, który korzysta z modelu językowego i sam wykonuje zadania. Kalibracja - zgodność prawdopodobieństw podawanych przez model z tym, jak często ma on rację. Mediana - wartość środkowa: połowa pomiarów jest od niej niższa, połowa wyższa. Parametry - liczby zapisane w modelu, których wartości ustala się podczas treningu; im jest ich więcej, tym model większy i wolniejszy.