Model nemusí běžet v cizím cloudu. Otevřené modely si stáhneš a spustíš na vlastním železe, data nikam neodejdou, neplatíš za token a nikdo ti nezmění model pod rukama. Cenou je horší kvalita u složitých úloh, pořízení GPU a to, že provoz je najednou tvoje starost.
Čím to spustit
| Nástroj | Pro koho |
|---|---|
| Ollama | Nejjednodušší start. Jeden příkaz, stáhne model, nabídne HTTP API. |
| llama.cpp | Když chceš detailní kontrolu, běh na CPU nebo na slabším železe. |
| LM Studio | Klikací aplikace, dobré na zkoušení a porovnávání modelů. |
| vLLM | Produkční nasazení s víc uživateli, vysoká propustnost. |
# nejrychlejší cesta k vlastnímu modelu
ollama run <model>
# a hned máš i API na localhost:11434
curl localhost:11434/api/generate -d '{"model":"<model>","prompt":"Ahoj"}'
Co potřebuješ za železo
Rozhoduje VRAM (paměť grafické karty). Připomeň si výpočet z velikosti modelu:
7–8B ve 4bitech ≈ 4–5 GB → běžná herní karta, i notebooková
13–14B ve 4bitech ≈ 8–9 GB → karta s 12 GB
30B ve 4bitech ≈ 18 GB → karta s 24 GB
70B ve 4bitech ≈ 40 GB → profi karta nebo dvě
Bez GPU to poběží na procesoru, ale pomalu (jednotky tokenů za sekundu). Na dávkové noční zpracování to stačí, na chat ne.
💡 Na Apple Silicon je situace lepší, než by ses čekal: sdílená paměť znamená, že MacBook s 32 GB utáhne i model, na který bys jinak potřeboval drahou grafiku.
Kdy to dává smysl
- Data nesmí ven (zdravotnictví, právo, interní dokumenty).
- Velký objem jednoduchých úloh: klasifikace milionu záznamů přes API stojí majlant, lokálně jen elektřinu.
- Chceš stabilitu: model se ti nezmění, dokud ho sám nevyměníš.
- Vývoj a experimenty bez sledování účtu.
- Offline provoz (terén, izolovaná síť).
Kdy ne
- Potřebuješ špičkovou kvalitu na složité uvažování, tam jsou největší uzavřené modely pořád dál.
- Máš malý provoz. Karta za desítky tisíc se ti u pár tisíc dotazů měsíčně nevrátí.
- Nemáš kapacitu na provoz (aktualizace, monitoring, škálování).
Na co narazíš
- Kvalita kolísá podle úlohy. Malý model může být výborný na extrakci a slabý na uvažování. Otestuj ho na své sadě, ne podle žebříčků.
- Kontextové okno bývá menší a delší kontext žere víc paměti.
- Formáty a nástroje. Podpora
tool usea JSON schémat je u otevřených modelů různá; ověř dřív, než na tom postavíš architekturu. - Čeština. Menší modely bývají silně anglocentrické. Vyzkoušej česky, ne jen anglicky.
- Licence. „Otevřený“ neznamená vždy „smíš komerčně“. Přečti si podmínky konkrétního modelu.
Hybridní přístup
Nejrozumnější bývá kombinace: lokální model na citlivé a objemné úlohy, API na to složité. Napiš si kód tak, aby se poskytovatel dal přepnout konfigurací, vyplatí se to i kdybys nikdy lokálně nejel, protože ceny a modely se mění.
Cvičení
- Máš kartu s 12 GB VRAM. Vejde se model 14 B v Q4? A kolik zbyde na kontext?
- Stejný model ti lokálně odpovídá znatelně hůř než přes API. Vyjmenuj tři možné příčiny, které nejsou „lokální model je horší“.
Náčrt řešení: rozbal, až si cvičení zkusíš sám
- Vejde, ale těsně: váhy zaberou kolem 7 GB a zbyde asi 4 až 5 GB na kontext a režii.
14 mld × 0,5 B = 7 GB. Z toho, co zbývá, si část vezme KV cache, která roste s délkou kontextu, a část běhové prostředí. Prakticky počítej s krátkým až středním kontextem a sleduj, kdy začne systém odkládat vrstvy do RAM, protože pak rychlost spadne řádově. - Kvantizace, chat template a parametry vzorkování. Q4 je znatelně hrubší než fp16, takže ztráta kvality může být v kvantizaci, ne v modelu. Druhá a nejčastější příčina je špatný chat template: když lokální nástroj skládá zprávy jinak, než na jakém formátu model trénoval, chová se zmateně. Třetí jsou výchozí hodnoty temperature a repeat penalty, které se mezi nástroji liší a bývají nastavené jinak než u poskytovatele.
Shrnutí
- Ollama je nejrychlejší start, vLLM pro produkci, llama.cpp pro kontrolu a slabé železo.
- Rozhoduje VRAM: 7–8B ve 4bitech běží skoro všude, 70B potřebuje profi kartu.
- Lokálně se vyplatí citlivá data, velké objemy jednoduché práce a stabilita.
- Vždy otestuj na vlastní sadě a ověř češtinu, podporu nástrojů a licenci.
Máte zpracovat milion interních dokumentů, které nesmí opustit firmu. Cloud, nebo lokální model?
Lokální. Data nesmí ven a u takového objemu by platba za tokeny byla mnohonásobně dražší než pořízení karty. Kvalita menšího modelu na extrakci a klasifikaci obvykle stačí, ověř na vlastní testovací sadě.
Kolik VRAM potřebuješ na model 13B ve 4bitové kvantizaci?
Zhruba 8–9 GB na samotné váhy plus rezervu na kontext, takže reálně karta s 12 GB. Ve FP16 by tentýž model potřeboval přes 26 GB.
Proč nevybírat lokální model podle žebříčků na internetu?
Protože měří jiné úlohy a často jen anglicky. Malý model může být skvělý na extrakci a slabý na uvažování, případně mizerný v češtině. Rozhodne test na vlastních datech.
