Lokální běh jazykového modelu je vždy limitován velikostí paměti, do které se model načte. Model Llama 3 8B ve 4bitové kvantizaci Q4_K_M zabírá 4,7 GB. Pro spuštění je nutné mít volnou paměť alespoň 6 GB, protože kontext a mezivýpočty přidávají další 1–2 GB. Telefon se 16GB RAM si poradí, notebook s 8GB grafickou pamětí také, ale v obou případech zůstanete u modelů kolem 8 miliard parametrů.
Velikost modelu určuje minimální nároky
Pokud se rozhodnete pro konkrétní model, spočtěte si přesně, kolik paměti potřebuje. Pro kvantizované GGUF modely platí přibližné hodnoty: 3B model má ~2 GB, 7B model ~4,5 GB, 8B model ~4,7 GB, 14B model ~8,5 GB a 70B model ~39 GB. K těmto číslům je vždy nutné připočítat rezervu pro kontext. Například při 32 000 tokenech kontextu naroste paměťová náročnost o 1–2 GB u modelů do 14B a o 5–6 GB u 70B modelů.
V praxi to znamená, že telefon se 16GB RAM (po odečtení systému a běžných aplikací) disponuje zhruba 10 GB volné paměti. Tam se pohodlně vejde model 8B s velkým kontextem. Notebook s 64GB RAM, ať už jde o MacBook M3 Max, nebo běžný Windows notebook, poskytne po odečtení systému 55–58 GB volné paměti. To umožní načíst 70B model se středním kontextem, i když to bude hlavně na CPU s pomalejší odezvou. Pro nejlepší výkon GPU je ale potřeba grafická karta s 16–24GB VRAM.
Kdy mobil ještě stačí
Mobil s NPU a 16GB RAM je ideální pro offline běh malých modelů typu Phi-3-mini (3,8B), Mistral 7B nebo Gemma 2 9B. V aplikacích jako MLC Chat, PocketPal AI (Android) nebo LLMFarm (iOS) načtete model doslova pár kliknutí. Odezva je v řádu jednotek až desítek tokenů za sekundu, což postačí pro psaní krátkých zpráv, překlad nebo jednoduchou rešerši. S 24GB RAM (např. ROG Phone 8 Pro) si troufnete i na 14B model, ale bez volného kontextu nad 16 000 tokenů.
Podstatné omezení mobilu je tepelný management. NPU sice spotřebuje méně energie než GPU, ale telefon nemá aktivní ventilátor. Při delším generování (např. analýza delšího textu) začne procesor throttlovat a rychlost klesá často na polovinu. Pro jednorázové úkoly se s tím dá žít, pro kontinuální práci je to nepoužitelné.
Notebook přichází ke slovu u modelů nad 14B
Pro větší modely, jako je Qwen 2.5 14B, Code Llama 13B nebo Mixtral 8x7B, je notebook s NVidia RTX s alespoň 8GB VRAM (RTX 4060 Laptop) minimum. Pokud model přesáhne VRAM, musíte využít hybridní režim – část vrstev běží na GPU, část na CPU. V praxi to znamená, že 14B model ve Q4 na 8GB VRAM poběží rychlostí kolem 15–25 tokenů za sekundu, což je poloviční rychlost oproti plnému GPU běhu. S 16GB VRAM (RTX 4080 Laptop) už se 14B model vejde celý a generování je svižné.
Pro 70B model se bez 64GB unifikované paměti nebo serveru neobejdete. MacBook M3 Max s 64GB a 128GB paměti je prakticky jediný notebook, který dokáže takový model načíst v paměti a dosahovat 5–15 tokenů za sekundu díky Metal akceleraci. Windows notebook s RTX 4090 (16GB VRAM) 70B model celý nepojme a musíte se spolehnout na offloading do 64GB RAM, kde je rychlost výrazně nižší.
Rychlost generování: propustnost paměti je král
Jazykový model generuje token po tokenu a každý krok potřebuje přečíst celou váhu modelu z paměti. Proto je rozhodující propustnost paměti, ne jen hrubý výkon NPU/GPU. Telefon s LPDDR5X pamětí dosahuje propustnosti okolo 68 GB/s, zatímco RTX 4060 Laptop má GDDR6 paměť s propustností 272 GB/s, tedy čtyřnásobek. MacBook M3 Max má unifikovanou paměť s propustností 400 GB/s. Z toho logicky vyplývá, že i stejný model poběží na notebooku s GPU 3–5× rychleji než na mobilu.
Praktický dopad ukazuje příklad s Llama 3 8B: mobil s NPU zvládne asi 10 tokenů za sekundu, notebook s RTX 4060 dosahuje 40–50 tokenů za sekundu. Uživatel notebooku tak má pocit plynulé konverzace, zatímco mobil se více podobá psaní na zastaralém dotykovém zařízení.
Úložiště: méně viditelné, ale také důležité
Modely zabírají na disku stejně jako v paměti. Telefony se základním 128GB úložištěm se rychle zaplní, proto doporučuji vybírat konfiguraci s 256 GB nebo 512 GB. Notebooky jsou na tom lépe – 1TB SSD je dnes běžný a modely 70B (39 GB) se do něj bez problémů vejdou. Důležitá je i rychlost čtení: notebookové NVMe SSD čte 7 000 MB/s, mobilní UFS 4.0 dosahuje 3 000 MB/s. Delší modely se tak načítají pomaleji.
Kterou platformu si pořídit pro lokální AI
Odpověď závisí na velikosti modelů, které chcete pravidelně používat. Pokud jde o 7–9B modely pro psaní e-mailů, shrnutí článků nebo chatbotovu konverzaci, postačí telefon se 16GB RAM a 256GB úložištěm. Vybírejte modely s podporou NPU (např. Gemma 2 9B) a aplikace, které umí 4bit kvantizaci.
Pokud vyvíjíte aplikace, testujete RAG nad vlastními dokumenty nebo programujete s Code Llama 13B, sáhněte po notebooku s RTX 4060/4070 Laptop (8–12GB VRAM) a 32GB RAM. Pro modely typu 70B budete potřebovat MacBook M3 Max s 64GB unifikované paměti, popřípadě Windows notebook s RTX 4090 a 64GB RAM, kde ale využijete offloading a výkon bude nižší.
Pro lokalní testování cloudových modelů je zajímavá i varianta externí GPU přes Thunderbolt, ale to je spíše nadstavba pro speciální použití.
Foto: Rickie-Tom Schünemann / Pexels