Windows, Linux nebo macOS pro lokální AI: kde poběží 7B až 14B model nejrychleji

11.10.2026  Windows tipy

O rychlosti lokálního modelu nerozhoduje jen grafická karta, ale hlavně backend, který ji umí obsloužit — CUDA, ROCm, Vulkan nebo Metal. Na stejné sestavě se tak výkon při generování textu liší podle operačního systému.

Windows, Linux nebo macOS pro lokální AI: kde poběží 7B až 14B model nejrychleji

Backend rozhoduje víc než operační systém

Generování tokenů u velkých jazykových modelů není výpočetně náročné — je omezené propustností pamětí. Pro každý token musí GPU přečíst celou váhu modelu, takže platí jednoduché pravidlo: maximální rychlost v tokenech za sekundu se přibližně rovná propustnosti paměti dělené velikostí modelu v bajtech. Model Llama 3.1 8B v kvantizaci Q4_K_M zabírá zhruba 4,9 GB. Na kartě s propustností 504 GB/s (například RTX 4070) je teoretický strop kolem 100 tokenů za sekundu; reálný výkon se drží pod ním kvůli režii backendu. Model Qwen 2.5 14B ve stejné kvantizaci má kolem 9 GB, takže strop padá na zhruba 55 tokenů za sekundu — a na 12GB kartě se ještě vejde do VRAM, na 8GB už ne a část vrstev se musí počítat na procesoru, což rychlost srazí řádově.

Z toho vyplývá, že hardware určuje strop, ale backend určuje, jak blízko se k němu dostanete. A právě tady se operační systémy výrazně rozcházejí.

Windows: CUDA funguje bez cavyků, ROCm s výhradami

S kartami NVIDIA je Windows bezproblémová volba. CUDA je na této platformě plnohodnotná a podporují ji všechny praktické nástroje: llama.cpp (oficiální CUDA build), Ollama, LM Studio i text-generation-webui. Nastavení spočívá v instalaci ovladače a stažení binárky, žádné překlady ze zdrojů nejsou potřeba. Kdo chce linuxové nástroje, může použít WSL2 s průchodem CUDA, ale přidává si vrstvu virtualizace a sdílení paměti mezi Windows a WSL, které u velkých modelů někdy způsobuje výpadky při načítání.

U AMD je situace složitější. ROCm pro Windows existuje jen jako HIP SDK a oficiálně podporuje omezený seznam karet — prakticky Radeon RX 7900 XTX/XT/GRE, 7800 XT, 7700 XT a 7600. Majitelé jiných modelů, například RX 6800 nebo starších generací, musí sáhnout po backendu Vulkan v llama.cpp. Ten funguje spolehlivě a je přenositelný, ale u stejné karty obvykle zaostává za nativním ROCm na Linuxu, protože nemá přístup k optimalizovaným knihovnám pro maticové operace. Alternativou je DirectML, to je ale spíš nouzové řešení.

Linux: nejširší podpora a nejlepší výkon u AMD

Linux je referenční platforma pro lokální inference. CUDA tu běží nativně, ROCm podporuje RDNA2 a RDNA3 karty bez omezení seznamu, a co je důležité, dostanete přístup k nástrojům, které na Windows neexistují nebo jsou tam okleštěné. vLLM pro dávkové zpracování a vysokou propustnost je prakticky jen linuxová záležitost. TensorRT-LLM od NVIDIA sice existuje i pro Windows, ale plná podpora a optimalizace míří na Linux. Pro běžné použití stačí llama.cpp zkompilované s příslušným backendem.

Cena za to je vyšší náročnost: u NVIDIA potřebujete sladit verzi ovladače, CUDA toolkit a cuDNN, u AMD zase jádro a firmware. Rozbitá kombinace se projeví chybou při inicializaci kontextu, ne pádem systému, takže se to dá odladit. Kdo ale chce jen spustit model a nemá chuť řešit závislosti, na Linuxu narazí častěji než na Windows.

macOS: Metal a sdílená paměť

Apple Silicon nemá CUDA ani ROCm, zato má Metal a takzvanou unified memory. Model se načítá do téže paměti, kterou používají aplikace a systém, takže se 14B model v Q4 vejde i na Mac se 16 GB RAM, kde by se na diskrétní kartě s 8 GB VRAM nevešel. llama.cpp má Metal backend od začátku, Ollama i LM Studio ho používají automaticky a konfigurace je nulová.

Rychlost pak určuje šířka paměťové sběrnice daného čipu. Základní M4 má 120 GB/s, M4 Pro 273 GB/s a M4 Max 546 GB/s. Pro 8B model v Q4 to znamená teoretický strop přibližně 24 tokenů za sekundu na M4, 55 na M4 Pro a 111 na M4 Max. Rozdíl mezi levným a drahým čipem je tedy v této úloze přímo úměrný ceně, protože oba mají stejný backend i software.

Stejná sestava, jiný výsledek

Vezměte stolní počítač s Ryzenem a Radeonem RX 7900 XTX (24 GB, 960 GB/s). Na Linuxu s ROCm dá 8B model v Q4 teoreticky až 195 tokenů za sekundu. Přepněte na Windows: buď použijete HIP SDK s podporou, nebo Vulkan. Vulkan je stabilnější, ale obvykle pomalejší. Stejná karta, stejný model, jen jiný systém a jiný backend.

U NVIDIA je rozdíl menší, protože CUDA je kvalitní na obou platformách. Přesto se vyplatí vědět, že kontejnery s předpřipraveným prostředím (například oficiální image pro vLLM nebo text-generation-webui) jsou stavěné na Linux. Na Windows je rozjedete jen přes WSL2.

Jak se rozhodnout

Máte NVIDIA a chcete minimální práci: Windows s Ollamou nebo LM Studiem. Máte NVIDIA a chcete maximální propustnost pro více požadavků najednou: Linux s vLLM. Máte AMD: Linux s ROCm, pokud karta patří mezi podporované; jinak počítejte s Vulkanem a nižším výkonem. Máte Mac: nic neřešíte, ale rychlost si kupujete spolu s šířkou paměťové sběrnice. Model 7B až 14B v Q4 se vejde do 12 GB VRAM u diskrétních karet a do 16 GB unified memory u Applu; menší paměť znamená odkládání vrstev na procesor a prudký pokles rychlosti.

Foto: Matheus Bertelli / Pexels

Přečtěte si také

SMB, NFS nebo WebDAV: který protokol zvolit pro sdílení souborů mezi telefonem, PC a NAS

SMB, NFS nebo WebDAV: který protokol zvolit pro sdílení souborů mezi telefonem, PC a NAS

26.9.2026  Windows tipy

SMB zvládne Windows i macOS, NFS je nejrychlejší na Linuxu a WebDAV projde i přes webové proxy. Poradíme, jak nakonfigurovat přístup z Androidu i iPhonu a kdy se vyplatí sáhnout po cloudu.

Číst článek