Pronájem velkého jazykového modelu v cloudu se účtuje v dolarech za milion tokenů. Lokální nasazení naopak v korunách za kilowatthodinu a v odpisové ceně GPU. Pro malou firmu nebo power uživatele je klíčové spočítat, při jakém objemu provozu se vyplatí pořídit vlastní hardware místo volání API.
Z čeho se skládají náklady
U cloudového API platíte za vstupní a výstupní tokeny zvlášť. Ceny se liší podle modelu – například OpenAI GPT-4o stojí přibližně 5 dolarů za milion vstupních a 15 dolarů za milion výstupních tokenů, zatímco menší GPT-3.5 Turbo vyjde na 0,5 a 1,5 dolaru. Open-source modely jako Llama 3 70B přes poskytovatele Together AI nebo Fireworks se účtují jednotnou sazbou kolem 0,9 dolaru za milion tokenů (vstup i výstup dohromady). U lokálního nasazení tvoří náklady hardware (GPU, základní deska, RAM, SSD), elektřina, chlazení a čas strávený instalací a údržbou.
Jak spočítat cloudové náklady
Nejprve odhadněte měsíční objem tokenů. Pro běžného chatbota to bývá 5–20 milionů vstupních a 1–5 milionů výstupních tokenů. Poté vynásobte objem cenou za milion. Příklad: 10 milionů vstupních a 2 miliony výstupních tokenů u GPT-4o znamená (10 × 5) + (2 × 15) = 80 dolarů měsíčně, tedy zhruba 1 800 Kč při kurzu 22,50 Kč/USD. U Llama 3 70B přes API by stejný objem při sazbě 0,9 dolaru za milion vyšel na 10,8 dolaru, tedy přibližně 243 Kč. Ceny se ale mění, proto vždy vycházejte z aktuálního ceníku poskytovatele.
Jak spočítat lokální náklady
Lokální provoz znamená pořídit GPU, které se vejde do rozpočtu a zvládne zvolený model. Pro 7B–13B model v 4bitové kvantizaci stačí 24GB VRAM, což splní RTX 4090 (cca 50 000 Kč) nebo použité RTX 3090 (cca 20 000 Kč). Pro 70B model v 4bitové kvantizaci potřebujete alespoň 40–48 GB VRAM, takže buď dvě RTX 4090, nebo jednu A100 80GB (kolem 200 000 Kč).
Elektřina: RTX 4090 má při inference příkon přibližně 300–400 W, celý systém se dostane na 500 W. Pokud GPU běží 8 hodin denně, 30 dní v měsíci, spotřebuje 120 kWh. Při ceně 6 Kč/kWh (běžná firemní sazba v ČR) to je 720 Kč měsíčně. Dvě RTX 4090 spotřebují asi 1 kW, tedy 1 440 Kč měsíčně.
Čas: instalace a optimalizace inference serveru (llama.cpp, vLLM, TGI) zabere 10–40 hodin. Při hodinové sazbě 500 Kč to je 5 000–20 000 Kč jednorázově. Průběžná údržba – aktualizace, monitoring, řešení pádů – spolkne 2–5 hodin měsíčně, tedy 1 000–2 500 Kč.
Odpisy: hardware odepisujte na 3 roky. RTX 3090 za 20 000 Kč znamená 556 Kč měsíčně. Dvě RTX 4090 plus server za 130 000 Kč vyjde na 3 611 Kč měsíčně.
Příklad: 7B model
Lokální 7B model na jedné RTX 3090: odpis 556 Kč + elektřina 720 Kč + údržba 1 000 Kč = 2 276 Kč měsíčně. Cloudové API pro stejný objem (12 milionů tokenů) u Llama 3 8B přes Together AI stojí 0,2 dolaru za milion, tedy 2,4 dolaru = 54 Kč. Cloud je takřka 40krát levnější. Lokální 7B model ale nedosahuje kvality GPT-4o ani Llama 3 70B, takže srovnání je třeba dělat při stejné kvalitě výstupu.
Příklad: 70B model
Lokální 70B model na dvou RTX 4090: odpis 3 611 Kč + elektřina 1 440 Kč + údržba 1 500 Kč = 6 551 Kč měsíčně. Cloudová Llama 3 70B přes API: při 12 milionech tokenů zaplatíte 10,8 dolaru (243 Kč), při 100 milionech 90 dolarů (2 025 Kč), při 300 milionech 270 dolarů (6 075 Kč). Break-even se pohybuje kolem 300 milionů tokenů měsíčně, což je přibližně 10 milionů tokenů denně. Pro malou firmu to je vysoký objem – odpovídá nepřetržitému provozu chatbota s desítkami tisíc dotazů denně.
Co výpočet mění
Do rozhodování vstupují i faktory, které se špatně kvantifikují. Kvalita modelu: 70B model se blíží GPT-3.5, ale na GPT-4o ztrácí. Soukromí: pokud zpracováváte citlivá data, lokální model eliminuje riziko úniku přes API a zjednodušuje soulad s GDPR. Latence: lokální inference může být rychlejší, ale při vytížení více uživateli se zpomalí. Možnost fine-tuningu: vlastní data můžete trénovat lokálně bez dalších poplatků. Dostupnost: cloud API může mít výpadky, lokální hardware zase porouchá se.
Praktický postup
1. Změřte měsíční objem vstupních a výstupních tokenů. 2. Zjistěte aktuální ceny API pro modely, které zvažujete. 3. Spočítejte měsíční náklady na cloud. 4. Navrhněte lokální konfiguraci GPU a spočítejte TCO na 3 roky (hardware + elektřina + čas). 5. Porovnejte a přidejte nefinanční kritéria (soukromí, latence, kontrola). 6. Pokud je objem do 50 milionů tokenů měsíčně a nejde o citlivá data, je cloud téměř vždy levnější. 7. Pokud objem přesahuje 200–300 milionů tokenů nebo potřebujete data držet pod kontrolou, lokální 70B model se může vyplatit.
Výpočet není jednorázový – s klesajícími cenami GPU a měnícími se ceníky API se break-even posouvá. Doporučujeme přepočítat každých šest měsíců.
Foto: panumas nikhomkhai / Pexels