Lokální AI na ultrabooku: Klíčové parametry pro běh modelů bez cloudu

14.8.2026  Windows tipy

Běh jazykových modelů přímo v notebooku už není sci-fi. Vyplatí se vědět, které parametry ultrabooku rozhodují o tom, jestli to zvládne.

Lokální AI na ultrabooku: Klíčové parametry pro běh modelů bez cloudu

Pro spuštění jazykového modelu se 7 miliardami parametrů v kvantizaci Q4 (čtyřbitová) potřebuje model přibližně 4–6 GB volné paměti. K tomu si připočtěte systém a aplikace, takže ultrabook s 16 GB RAM je minimum, s 32 GB máte pohodlnější rezervu. A protože naprostá většina ultrabooků nemá dedikovanou grafiku, integrovaný GPU sdílí systémovou paměť – takže „VRAM" je ve skutečnosti vaše RAM.

Proč je RAM důležitější než NPU

U jazykových modelů je hlavním bottleneckem paměť pro uložení vah. Procesor a GPU počítají matice, ale váhy musí být v paměti. Z toho důvodu je rychlost paměti a její velikost to, co určuje, jak velký model spustíte. NPU (neuronová jednotka) v procesorech Intel Core Ultra, AMD Ryzen AI nebo Apple Neural Engine je optimalizována na menší modely pro úlohy jako rozpoznávání obrazu, hluk na pozadí nebo segmentaci objektů. Například NPU v Meteor Lake zvládá detekci očí pro Windows Studio Effects, ale ne běh Llama 3. Pro generování textu s rozsáhlými modely NPU nevyužijete – zde záleží na kombinaci CPU a integrované GPU. GPU je při výpočtu matic výrazně rychlejší než CPU, ale opět ji brzdí rychlost sdílené paměti.

Jakou paměť vybrat u konkrétních procesorů

U Apple Silicon MacBooků (M1, M2, M3) je paměť sjednocená – procesor, GPU a Neural Engine přistupují ke stejným čipům. Doporučovaný základ pro lokální AI je 16 GB, který zvládne zmíněný 7B model. Pro 13B modely (např. Llama 13B nebo Mistral 13B) je rozumné mít 32 GB, jinak se model nevejde do paměti a systém začne swapovat na disk, což výrazně zpomalí odezvu.

V prostředí Windows a Linuxu jsou aktuálně výhodnou volbou procesory Intel Core Ultra (Meteor Lake) a AMD Ryzen AI 7x/9x. Mají NPU, ale hlavně jejich integrované grafické čipy (Intel Arc, AMD Radeon 780M) zvládají API jako Vulkan a Metal, přes které lze akcelerovat modely pomocí llama.cpp. U Windows ultrabooků počítejte s tím, že 16 GB RAM je minimum, 32 GB je dnes už běžný standard pro modely s více než 10B parametry. U 13B modelů se doporučuje 32 GB.

Pozor na fakt, že u mnoha ultrabooků s LPDDR5 pamětí je paměť připájená k základní desce – do budoucna ji nerozšíříte. Takže pokud víte, že byste chtěli lokální AI, raději sáhněte po verzi s 32GB rovnou.

Software pro lokální běh

Nejpoužívanější nástroje jsou:

  • Ollama – jednoduchý CLI nástroj, který stáhne, kvantizuje a spustí model. Spustíte ho příkazem ollama run llama3.
  • LM Studio – grafické rozhraní pro Windows, macOS a Linux. Umožňuje stáhnout modely z Hugging Face, nastavit kvantizaci a běžet lokálně.
  • llama.cpp – knihovna a CLI pro běh modelů na CPU/GPU s podporou kvantizace. Je základ mnoha dalších nástrojů.

Samotné modely v kvantizaci Q4 mají velikost podle počtu parametrů – 7B model zabere přibližně 4 GB disku, 13B model zhruba 7–8 GB. Na běžný 512GB SSD se jich vejde desítky.

Na co se zaměřit při výběru ultrabooku

Před koupí si ověřte:

  1. Minimálně 16 GB operační paměti (případně 32 GB pro 13B+ modely).
  2. Procesor s integrovanou grafikou, která podporuje Vulkan nebo Metal – tedy Intel Core Ultra s Arc GPU, AMD Ryzen AI s Radeon 780M nebo Apple M-series.
  3. Dostatečný výkon při napájení z baterie – mnoho ultrabooků při běhu na baterii snižuje frekvenci GPU, což zpomalí inference. Zkontrolujte i recenze, které měří výdrž při zátěži.
  4. Odvod tepla – delší běh modelu zahřívá notebook, takže kvalitní chlazení je nutné.

Pro běžného uživatele, který chce vyzkoušet lokální AI, je dnes nejdostupnější cestou MacBook s 16GB paměti a softwarem Ollama nebo LM Studio. V kancelářském prostředí dávají smysl i Windows ultrabooky s procesorem Core Ultra 7 nebo Ryzen AI 9, které mají dostatečný výkon na 7B i 13B modely v kvantizaci Q4.

Příkaz ollama run llama3 na notebooku s 16GB RAM zvládne generovat text rychlostí, která se blíží pomalé lidské četbě – konkrétní počet tokenů za sekundu se liší podle verze čipu, ale pohybuje se v jednotkách až desítkách. Pro porovnání: cloudové API mají výrazně vyšší propustnost, ale za cenu odesílání dat na servery a poplatků.

Foto: Matheus Bertelli / Pexels

Přečtěte si také

Neuvěřitelné triky pro zvýšení zabezpečení vašeho Windows pomocí biometrických údajů

4.9.2025  Windows tipy

Biometrické zabezpečení se stává stále populárnější metodou pro ochranu našich digitálních dat. Díky této technologii můžeme zvýšit bezpečnost našich zařízení bez nutnosti zapamatování komplikovaných hesel. V tomto článku se podíváme na několik užitečných triků, jak můžete využít biometrické údaje pro zvýšení zabezpečení vašeho Windows počítače.

Číst článek