Cloudová AI vs. lokální model: jak spočítat náklady na tokeny, elektřinu a hardware

Rozhodnutí mezi cloudovým API a lokálním nasazením LLM závisí na objemu tokenů, ceně elektřiny a času. Přinášíme praktický kalkulační rámec pro malé firmy a power uživatele, včetně příkladů pro 7B a 70B modely.

Cloudová AI vs. lokální model: jak spočítat náklady na tokeny, elektřinu a hardware

Pronájem velkého jazykového modelu v cloudu se účtuje v dolarech za milion tokenů. Lokální nasazení naopak v korunách za kilowatthodinu a v odpisové ceně GPU. Pro malou firmu nebo power uživatele je klíčové spočítat, při jakém objemu provozu se vyplatí pořídit vlastní hardware místo volání API.

Z čeho se skládají náklady

U cloudového API platíte za vstupní a výstupní tokeny zvlášť. Ceny se liší podle modelu – například OpenAI GPT-4o stojí přibližně 5 dolarů za milion vstupních a 15 dolarů za milion výstupních tokenů, zatímco menší GPT-3.5 Turbo vyjde na 0,5 a 1,5 dolaru. Open-source modely jako Llama 3 70B přes poskytovatele Together AI nebo Fireworks se účtují jednotnou sazbou kolem 0,9 dolaru za milion tokenů (vstup i výstup dohromady). U lokálního nasazení tvoří náklady hardware (GPU, základní deska, RAM, SSD), elektřina, chlazení a čas strávený instalací a údržbou.

Jak spočítat cloudové náklady

Nejprve odhadněte měsíční objem tokenů. Pro běžného chatbota to bývá 5–20 milionů vstupních a 1–5 milionů výstupních tokenů. Poté vynásobte objem cenou za milion. Příklad: 10 milionů vstupních a 2 miliony výstupních tokenů u GPT-4o znamená (10 × 5) + (2 × 15) = 80 dolarů měsíčně, tedy zhruba 1 800 Kč při kurzu 22,50 Kč/USD. U Llama 3 70B přes API by stejný objem při sazbě 0,9 dolaru za milion vyšel na 10,8 dolaru, tedy přibližně 243 Kč. Ceny se ale mění, proto vždy vycházejte z aktuálního ceníku poskytovatele.

Jak spočítat lokální náklady

Lokální provoz znamená pořídit GPU, které se vejde do rozpočtu a zvládne zvolený model. Pro 7B–13B model v 4bitové kvantizaci stačí 24GB VRAM, což splní RTX 4090 (cca 50 000 Kč) nebo použité RTX 3090 (cca 20 000 Kč). Pro 70B model v 4bitové kvantizaci potřebujete alespoň 40–48 GB VRAM, takže buď dvě RTX 4090, nebo jednu A100 80GB (kolem 200 000 Kč).

Elektřina: RTX 4090 má při inference příkon přibližně 300–400 W, celý systém se dostane na 500 W. Pokud GPU běží 8 hodin denně, 30 dní v měsíci, spotřebuje 120 kWh. Při ceně 6 Kč/kWh (běžná firemní sazba v ČR) to je 720 Kč měsíčně. Dvě RTX 4090 spotřebují asi 1 kW, tedy 1 440 Kč měsíčně.

Čas: instalace a optimalizace inference serveru (llama.cpp, vLLM, TGI) zabere 10–40 hodin. Při hodinové sazbě 500 Kč to je 5 000–20 000 Kč jednorázově. Průběžná údržba – aktualizace, monitoring, řešení pádů – spolkne 2–5 hodin měsíčně, tedy 1 000–2 500 Kč.

Odpisy: hardware odepisujte na 3 roky. RTX 3090 za 20 000 Kč znamená 556 Kč měsíčně. Dvě RTX 4090 plus server za 130 000 Kč vyjde na 3 611 Kč měsíčně.

Příklad: 7B model

Lokální 7B model na jedné RTX 3090: odpis 556 Kč + elektřina 720 Kč + údržba 1 000 Kč = 2 276 Kč měsíčně. Cloudové API pro stejný objem (12 milionů tokenů) u Llama 3 8B přes Together AI stojí 0,2 dolaru za milion, tedy 2,4 dolaru = 54 Kč. Cloud je takřka 40krát levnější. Lokální 7B model ale nedosahuje kvality GPT-4o ani Llama 3 70B, takže srovnání je třeba dělat při stejné kvalitě výstupu.

Příklad: 70B model

Lokální 70B model na dvou RTX 4090: odpis 3 611 Kč + elektřina 1 440 Kč + údržba 1 500 Kč = 6 551 Kč měsíčně. Cloudová Llama 3 70B přes API: při 12 milionech tokenů zaplatíte 10,8 dolaru (243 Kč), při 100 milionech 90 dolarů (2 025 Kč), při 300 milionech 270 dolarů (6 075 Kč). Break-even se pohybuje kolem 300 milionů tokenů měsíčně, což je přibližně 10 milionů tokenů denně. Pro malou firmu to je vysoký objem – odpovídá nepřetržitému provozu chatbota s desítkami tisíc dotazů denně.

Co výpočet mění

Do rozhodování vstupují i faktory, které se špatně kvantifikují. Kvalita modelu: 70B model se blíží GPT-3.5, ale na GPT-4o ztrácí. Soukromí: pokud zpracováváte citlivá data, lokální model eliminuje riziko úniku přes API a zjednodušuje soulad s GDPR. Latence: lokální inference může být rychlejší, ale při vytížení více uživateli se zpomalí. Možnost fine-tuningu: vlastní data můžete trénovat lokálně bez dalších poplatků. Dostupnost: cloud API může mít výpadky, lokální hardware zase porouchá se.

Praktický postup

1. Změřte měsíční objem vstupních a výstupních tokenů. 2. Zjistěte aktuální ceny API pro modely, které zvažujete. 3. Spočítejte měsíční náklady na cloud. 4. Navrhněte lokální konfiguraci GPU a spočítejte TCO na 3 roky (hardware + elektřina + čas). 5. Porovnejte a přidejte nefinanční kritéria (soukromí, latence, kontrola). 6. Pokud je objem do 50 milionů tokenů měsíčně a nejde o citlivá data, je cloud téměř vždy levnější. 7. Pokud objem přesahuje 200–300 milionů tokenů nebo potřebujete data držet pod kontrolou, lokální 70B model se může vyplatit.

Výpočet není jednorázový – s klesajícími cenami GPU a měnícími se ceníky API se break-even posouvá. Doporučujeme přepočítat každých šest měsíců.

Foto: panumas nikhomkhai / Pexels

Přečtěte si také

Jak vybrat smartphone na focení: rozhoduje velikost senzoru a software, ne megapixely

Jak vybrat smartphone na focení: rozhoduje velikost senzoru a software, ne megapixely

Počet megapixelů je při výběru fotomobilu nejméně vypovídající údaj. O kvalitě snímku rozhoduje fyzická velikost snímače, optická stabilizace a to, jak agresivně telefon upravuje fotku pomocí AI.

Číst článek