Przejdź do treści
Wróć do bloga
8 min czytania

Ile naprawdę kosztuje model językowy

Token to kawałek tekstu, mniej więcej cztery znaki albo trzy czwarte słowa. W tokenach jesteś rozliczany i w tokenach mierzy się prawie wszystko inne. Zebraliśmy liczby, które faktycznie decydują o rachunku, z cenników i pomiarów z września 2026 roku, razem z ich źródłami.

LLMKosztyWydajność

Cennik modelu językowego wygląda prosto: tyle a tyle dolarów za milion tokenów wejściowych i tyle a tyle za milion wyjściowych. Wejściowe to tekst, który wysyłasz, wyjściowe to tekst, który model pisze. Rachunek na koniec miesiąca powstaje jednak z pomnożenia kilku liczb naraz i pomyłka w jednej z nich potrafi przesunąć wynik o rząd wielkości. Poniżej każda z nich osobno, z cennikami sprawdzonymi 21 września 2026 roku.

Cena za milion tokenów różni się ponad stokrotnie

W jednym cenniku, u jednego dostawcy, różnica między najdroższym a najtańszym modelem przekracza sto razy. OpenAI liczy za GPT‑6 Astra 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, a za GPT‑5 nano 0,05 i 0,40 dolara. Na wyjściu to sto dwadzieścia pięć razy taniej. U Anthropica Claude Fable 5.1 kosztuje 10 i 50 dolarów, Claude Sonnet 5 kosztuje 2 i 10 dolarów, a Claude Haiku 4.5 kosztuje 1 i 5 dolarów. Google bierze za Gemini 3.5 Flash‑Lite 0,30 dolara na wejściu i 2,50 na wyjściu. DeepSeek za model deepseek-flash liczy 0,30 i 1,20 dolara w godzinach szczytu.

Wykres słupkowy jedenastu modeli. GPT‑6 Astra i Claude Fable 5.1 kosztują po 50 dolarów za milion tokenów wyjściowych, Claude Haiku 4.5 pięć dolarów, a GPT‑5 nano 0,40 dolara.
Ceny wyjścia z oficjalnych cenników czterech dostawców, stan na wrzesień 2026. Skrajne wartości dzieli sto dwadzieścia pięć razy.Źródło: dane: cenniki OpenAI, Anthropic, Google i DeepSeekOtwórz w pełnym rozmiarze

Wyjście jest w tych cennikach od czterech do ponad ośmiu razy droższe od wejścia. Długość odpowiedzi kosztuje więc więcej niż długość pytania, co jest pierwszą rzeczą do ograniczenia, kiedy rachunek zaczyna rosnąć.

Ile tokenów zjada jeden przebieg procesu

Cena za milion tokenów nic nie znaczy, dopóki nie wiesz, ile tokenów zużywa jedno zadanie. Anthropic podaje w dokumentacji własny przykład: obsługa jednego zgłoszenia od klienta to średnio około 3700 tokenów, a dziesięć tysięcy takich zgłoszeń na modelu Claude Haiku 4.5 kosztuje około 37 dolarów.

  • Jeden token to około czterech znaków albo trzech czwartych słowa w angielskim, według dokumentacji Anthropica.
  • Przeciętna strona internetowa o objętości 10 kB to około 2500 tokenów, duża strona dokumentacji o objętości 100 kB około 25 000, a praca naukowa w PDF o objętości 500 kB około 125 000 tokenów.
  • Same definicje narzędzi, czyli opisy funkcji, których model może użyć, też się liczą: zestaw do obsługi przeglądarki dokłada około 6600 tokenów wejściowych do każdego zapytania, zestaw do obsługi komputera około 4500.
  • Godzinna sesja programistyczna na Claude Opus 5, z 50 000 tokenów wejściowych i 15 000 wyjściowych, to 0,625 dolara w samych tokenach.

Okno kontekstu jest większe niż obszar, z którego model korzysta

Okno kontekstu to ilość tekstu, jaką model obejmuje w jednym zapytaniu. Claude Opus 5, Claude Sonnet 5 i Claude Fable 5.1 mają okno miliona tokenów, czyli mniej więcej 750 tysięcy angielskich słów. Pomiary pokazują jednak, że użyteczny obszar kończy się dużo wcześniej. W teście NoLiMa, przedstawionym na konferencji ICML 2025, przebadano trzynaście modeli deklarujących co najmniej 128 tysięcy tokenów kontekstu. Przy 32 tysiącach tokenów jedenaście z nich spadło poniżej połowy własnego wyniku z krótkiego kontekstu, a GPT‑4o, jeden z najlepszych w tym zestawieniu, zjechał z 99,3 do 69,7 procent.

Wcześniejsze prace mówią to samo innym językiem. Benchmark RULER przebadał siedemnaście modeli i stwierdził, że spośród deklarujących 32 tysiące tokenów lub więcej tylko połowa utrzymuje zadowalający wynik przy tej długości. Praca „Lost in the Middle” z „Transactions of the ACL” pokazała, że model najlepiej znajduje informację umieszczoną na początku albo na końcu wejścia i wyraźnie gorzej radzi sobie z tą w środku. Anthropic pisze o tym w swojej dokumentacji wprost: wraz ze wzrostem liczby tokenów dokładność i pamięć modelu spadają, a zjawisko to nazywa „context rot”.

Wniosek praktyczny: wielkie okno kontekstu jest zabezpieczeniem, a nie metodą pracy. Wrzucenie całej bazy wiedzy do jednego zapytania to jednocześnie najdroższy i najmniej skuteczny wariant.

Opóźnienie to dwie liczby, nie jedna

Pierwsza to czas do pierwszego tokenu, czyli ile sekund mija od wysłania zapytania do pojawienia się pierwszego fragmentu odpowiedzi. Druga to prędkość wyjścia, czyli ile tokenów na sekundę model pisze potem. Tak definiuje je Artificial Analysis, serwis mierzący modele niezależnie od dostawców. NVIDIA dodaje w dokumentacji technicznej, że czas do pierwszego tokenu zawiera kolejkowanie, przetworzenie całego wejścia i opóźnienie sieci, więc rośnie razem z długością promptu, czyli polecenia wysyłanego do modelu.

Użytkownik odczuwa przede wszystkim pierwszą z tych liczb. Jakob Nielsen opisał trzy progi reakcji systemu: 0,1 sekundy to granica wrażenia natychmiastowości, jedna sekunda to granica, przy której tok myślenia użytkownika pozostaje nieprzerwany, a dziesięć sekund to granica utrzymania uwagi. W pomiarach Artificial Analysis najniższe opóźnienie ma starszy, lekki Gemini 2.5 Flash‑Lite bez rozumowania, z wynikiem 0,30 sekundy. Modele rozumujące, czyli takie, które przed odpowiedzią prowadzą wewnętrzne wnioskowanie, mieszczą się w innej skali: czas do pierwszego tokenu właściwej odpowiedzi wynosi w konfiguracji maksymalnego wysiłku 291 sekund dla Claude Fable 5.1 i 258 sekund dla GPT‑6 Astra. W procesie nocnym nie ma to znaczenia, w oknie czatu ma decydujące.

Wykres słupkowy dziesięciu dostawców serwujących ten sam model. Najszybszy osiąga 579 tokenów na sekundę, najwolniejszy 61.
Model DeepSeek V4.1 Flash mierzony u dziesięciu dostawców. Te same wagi, ponad dziewięciokrotna różnica prędkości.Źródło: dane: pomiary Artificial AnalysisOtwórz w pełnym rozmiarze

Prędkość wyjścia zależy nie tylko od modelu, ale też od tego, kto go serwuje. Ten sam DeepSeek V4.1 Flash mierzony u dziesięciu dostawców daje od 61 do 579 tokenów na sekundę, a czas do pierwszego fragmentu odpowiedzi waha się od 0,76 do 1,81 sekundy. Przy identycznych wagach modelu wybór dostawcy zmienia odczucie użytkownika bardziej niż wybór modelu.

Kiedy tańszy model jest właściwą odpowiedzią

Anthropic radzi w swojej dokumentacji wprost: tańszy model do zadań prostych, średni do większości obciążeń produkcyjnych, najdroższy do najtrudniejszego rozumowania. Pomiary niezależne to potwierdzają. W zestawieniu Artificial Analysis Claude Fable 5.1 ma 53 punkty indeksu inteligencji przy cenie 7,175 dolara za milion tokenów, a Muse Spark 1.3 ma 48 punktów przy 0,78 dolara. Pięć punktów różnicy w jakości kosztuje ponad dziewięć razy więcej.

  • Tokeny rozumowania są rozliczane jak tokeny wyjściowe, w momencie wygenerowania, więc model rozumujący podnosi rachunek nawet przy krótkiej odpowiedzi.
  • Okno kontekstu liczy wszystko: polecenie systemowe, całą historię rozmowy, wyniki narzędzi, obrazy i dokumenty oraz to, co model dopiero wygeneruje.
  • Cache nie zmniejsza zużycia okna kontekstu. Zmienia tylko cenę tych tokenów, nie to, czy zajmują miejsce.
  • Jedyny wiarygodny test to Twoje dane i próg jakości ustalony, zanim cokolwiek uruchomimy.

Rabaty, które zmieniają arytmetykę

Dwa mechanizmy potrafią przesunąć rachunek mocniej niż zmiana modelu. Pierwszy to cache, czyli pamięć na powtarzalny początek zapytania. Drugi to tryb wsadowy, czyli przetwarzanie bez gwarancji czasu odpowiedzi.

  • U Anthropica zapis do cache’u kosztuje 1,25 raza cenę wejścia przy ważności pięciu minut i dwa razy przy ważności godziny, a odczyt 0,1 ceny wejścia, przy czym dla Claude Fable 5.1 i Mythos 5.1 jest to 0,025. Zapis zwraca się po jednym odczycie w wariancie pięciominutowym i po dwóch w godzinnym.
  • OpenAI włącza cache domyślnie, obniża cenę powtórzonych tokenów o do 90 procent, wymaga wspólnego początku o długości co najmniej 1024 tokenów i trzyma wpis przez 30 minut od ostatniego użycia.
  • U DeepSeeka trafienie w cache kosztuje 0,006 dolara za milion tokenów wobec 0,30 dolara przy chybieniu, czyli pięćdziesiąt razy mniej.
  • Tryb wsadowy zdejmuje 50 procent ceny u OpenAI, Anthropica i Google. OpenAI deklaruje wykonanie w ciągu 24 godzin, do 50 000 zapytań w jednej paczce, z osobnej puli limitów.
  • Rabaty się sumują. W przykładzie z dokumentacji Anthropica godzinna sesja na Claude Opus 5 spada z 0,625 do 0,445 dolara w tokenach, gdy 40 000 z 50 000 tokenów wejściowych pochodzi z cache’u.

Czego te liczby nie obiecują

Wszystkie ceny w tym tekście pochodzą z cenników sprawdzonych 21 września 2026 roku i będą się zmieniać. W cenniku Google widać to czarno na białym: Gemini 3.8 Flash kosztuje 0,75 dolara za milion tokenów wejściowych do 31 grudnia 2026 roku i 1,50 dolara od 1 stycznia 2027 roku. Ruch bywa też w drugą stronę. Anthropic odwołał zapowiedzianą na 1 września 2026 podwyżkę Claude Sonnet 5 z 2 i 10 dolarów na 3 i 15 dolarów.

Sama cena za token nie jest w pełni porównywalna między modelami, bo różne modele inaczej dzielą tekst na tokeny. Anthropic ostrzega w cenniku, że modele od wersji 4.7 wzwyż używają nowego tokenizera, który z tego samego tekstu robi około 30 procent więcej tokenów. Tańszy cennik potrafi więc dać wyższy rachunek. Praca Petrova i współautorów z konferencji NeurIPS 2023 pokazała z kolei, że ten sam tekst przetłumaczony na różne języki różni się długością w tokenach nawet piętnastokrotnie, i wiąże to wprost z kosztem dostępu do usług komercyjnych. Zanim przyjmiesz jakikolwiek cennik za swój, policz tokeny na własnym materiale, po polsku.

Pomiary prędkości są cudze. Artificial Analysis podaje mediany z własnych obciążeń: testy na tysiąc i dziesięć tysięcy tokenów wejściowych osiem razy dziennie, test na sto tysięcy tokenów raz w tygodniu. Twój prompt, Twój region i Twój wzorzec ruchu dadzą inne wartości. Tak samo wyniki NoLiMa i RULER są wynikami na zadaniach ich autorów, nie na Twoich dokumentach.

Jeśli chcesz mieć te liczby policzone dla konkretnego procesu w Twojej firmie, napisz do nas. Do zamiany cennika na kwotę miesięczną wystarczy opis jednego procesu i próbka danych, na których on pracuje.

Źródła

  1. 01OpenAI, API pricing
  2. 02Anthropic, Claude API pricing
  3. 03Google, Gemini API pricing
  4. 04DeepSeek, API pricing
  5. 05Artificial Analysis, model intelligence and latency comparison
  6. 06Modarressi et al., NoLiMa: Long‑Context Evaluation Beyond Literal Matching, ICML 2025
  7. 07Hsieh et al., RULER: What’s the Real Context Size of Your Long‑Context Language Models?

Więcej z bloga

5 min czytania

Jev: model, który zwraca decyzję zamiast zdania

TypeSafe AI wypuściło 15 września model, który nie pisze tekstu. Oddaje wybraną opcję i prawdopodobieństwo, kosztuje 0,042 dolara za milion tokenów wejściowych, a za wyjście nie płaci się nic. Sprawdzamy, co z tego zostaje po odjęciu marketingu.

Czytaj
6 min czytania

Umiejętności agenta: dlaczego pięć działa lepiej niż sto

Przy puli pięciu skilli właściwy stanowi 29,6% tych, po które agent faktycznie sięga, przy stu już tylko 3,3%. W sierpniu publiczny rejestr skilli rozdawał klony, które kradły klucze SSH. Cztery zasady dla zespołu, który pracuje z agentami.

Czytaj

Opisz proces, który zabiera najwięcej czasu

Wystarczy kilka zdań. Odpowiemy, czy da się go usprawnić, ile to mniej więcej kosztuje i czy w ogóle potrzebujesz do tego AI.