Lokální modely

Ollama, llama.cpp, GPU a kolik toho potřebuješ.

Co se naučíš: Rozjedeš si model u sebe a budeš vědět, jaké železo na co potřebuješ.

5 min čtení + cvičeníNavazuje na:📏 Velikost a kvantizace

Model nemusí běžet v cizím cloudu. Otevřené modely si stáhneš a spustíš na vlastním železe, data nikam neodejdou, neplatíš za token a nikdo ti nezmění model pod rukama. Cenou je horší kvalita u složitých úloh, pořízení GPU a to, že provoz je najednou tvoje starost.


Čím to spustit

NástrojPro koho
OllamaNejjednodušší start. Jeden příkaz, stáhne model, nabídne HTTP API.
llama.cppKdyž chceš detailní kontrolu, běh na CPU nebo na slabším železe.
LM StudioKlikací aplikace, dobré na zkoušení a porovnávání modelů.
vLLMProdukční nasazení s víc uživateli, vysoká propustnost.
# nejrychlejší cesta k vlastnímu modelu
ollama run <model>

# a hned máš i API na localhost:11434
curl localhost:11434/api/generate -d '{"model":"<model>","prompt":"Ahoj"}'

Co potřebuješ za železo

Rozhoduje VRAM (paměť grafické karty). Připomeň si výpočet z velikosti modelu:

7–8B ve 4bitech   ≈ 4–5 GB   → běžná herní karta, i notebooková
13–14B ve 4bitech ≈ 8–9 GB   → karta s 12 GB
30B ve 4bitech    ≈ 18 GB    → karta s 24 GB
70B ve 4bitech    ≈ 40 GB    → profi karta nebo dvě

Bez GPU to poběží na procesoru, ale pomalu (jednotky tokenů za sekundu). Na dávkové noční zpracování to stačí, na chat ne.

💡 Na Apple Silicon je situace lepší, než by ses čekal: sdílená paměť znamená, že MacBook s 32 GB utáhne i model, na který bys jinak potřeboval drahou grafiku.


Kdy to dává smysl

  • Data nesmí ven (zdravotnictví, právo, interní dokumenty).
  • Velký objem jednoduchých úloh: klasifikace milionu záznamů přes API stojí majlant, lokálně jen elektřinu.
  • Chceš stabilitu: model se ti nezmění, dokud ho sám nevyměníš.
  • Vývoj a experimenty bez sledování účtu.
  • Offline provoz (terén, izolovaná síť).

Kdy ne

  • Potřebuješ špičkovou kvalitu na složité uvažování, tam jsou největší uzavřené modely pořád dál.
  • Máš malý provoz. Karta za desítky tisíc se ti u pár tisíc dotazů měsíčně nevrátí.
  • Nemáš kapacitu na provoz (aktualizace, monitoring, škálování).

Na co narazíš

  • Kvalita kolísá podle úlohy. Malý model může být výborný na extrakci a slabý na uvažování. Otestuj ho na své sadě, ne podle žebříčků.
  • Kontextové okno bývá menší a delší kontext žere víc paměti.
  • Formáty a nástroje. Podpora tool use a JSON schémat je u otevřených modelů různá; ověř dřív, než na tom postavíš architekturu.
  • Čeština. Menší modely bývají silně anglocentrické. Vyzkoušej česky, ne jen anglicky.
  • Licence. „Otevřený“ neznamená vždy „smíš komerčně“. Přečti si podmínky konkrétního modelu.

Hybridní přístup

Nejrozumnější bývá kombinace: lokální model na citlivé a objemné úlohy, API na to složité. Napiš si kód tak, aby se poskytovatel dal přepnout konfigurací, vyplatí se to i kdybys nikdy lokálně nejel, protože ceny a modely se mění.


Cvičení

  1. Máš kartu s 12 GB VRAM. Vejde se model 14 B v Q4? A kolik zbyde na kontext?
  2. Stejný model ti lokálně odpovídá znatelně hůř než přes API. Vyjmenuj tři možné příčiny, které nejsou „lokální model je horší“.
Náčrt řešení: rozbal, až si cvičení zkusíš sám
  1. Vejde, ale těsně: váhy zaberou kolem 7 GB a zbyde asi 4 až 5 GB na kontext a režii.14 mld × 0,5 B = 7 GB. Z toho, co zbývá, si část vezme KV cache, která roste s délkou kontextu, a část běhové prostředí. Prakticky počítej s krátkým až středním kontextem a sleduj, kdy začne systém odkládat vrstvy do RAM, protože pak rychlost spadne řádově.
  2. Kvantizace, chat template a parametry vzorkování. Q4 je znatelně hrubší než fp16, takže ztráta kvality může být v kvantizaci, ne v modelu. Druhá a nejčastější příčina je špatný chat template: když lokální nástroj skládá zprávy jinak, než na jakém formátu model trénoval, chová se zmateně. Třetí jsou výchozí hodnoty temperature a repeat penalty, které se mezi nástroji liší a bývají nastavené jinak než u poskytovatele.

Shrnutí

  • Ollama je nejrychlejší start, vLLM pro produkci, llama.cpp pro kontrolu a slabé železo.
  • Rozhoduje VRAM: 7–8B ve 4bitech běží skoro všude, 70B potřebuje profi kartu.
  • Lokálně se vyplatí citlivá data, velké objemy jednoduché práce a stabilita.
  • Vždy otestuj na vlastní sadě a ověř češtinu, podporu nástrojů a licenci.
Máte zpracovat milion interních dokumentů, které nesmí opustit firmu. Cloud, nebo lokální model?

Lokální. Data nesmí ven a u takového objemu by platba za tokeny byla mnohonásobně dražší než pořízení karty. Kvalita menšího modelu na extrakci a klasifikaci obvykle stačí, ověř na vlastní testovací sadě.

Kolik VRAM potřebuješ na model 13B ve 4bitové kvantizaci?

Zhruba 8–9 GB na samotné váhy plus rezervu na kontext, takže reálně karta s 12 GB. Ve FP16 by tentýž model potřeboval přes 26 GB.

Proč nevybírat lokální model podle žebříčků na internetu?

Protože měří jiné úlohy a často jen anglicky. Malý model může být skvělý na extrakci a slabý na uvažování, případně mizerný v češtině. Rozhodne test na vlastních datech.