Shrnutí celého kurzu na jedno místo plus tipy, kam pokračovat. Když si po měsíci nebudeš něčím jistý, začni tady.
Cheatsheet: co si zapamatovat
Jak se model učí
- Loss = −log p(správný token); gradient říká, kam posunout každý parametr; backprop ho spočítá jedním průchodem zpět.
- AdamW + warmup + cosine decay; stavy optimizeru zaberou ~4× velikost modelu.
- bf16 pro trénink (rozsah > přesnost), mixed precision s fp32 master vahami.
- Paměť netrénuješ celou: ZeRO/FSDP rozdělí stavy mezi karty, LoRA trénuje jen adaptér.
Co je uvnitř
- Residual stream je sběrnice; induction heads kopírují dřívější vzor a stojí za učením v kontextu.
- Superpozice: koncepty jsou směry, ne neurony, proto jsou neurony polysémantické.
- Formát výstupu se vynucuje maskováním logitů podle automatu, ne prosbou.
- Perplexity = e^loss; napříč tokenizery neporovnatelná.
Jak to funguje
- Model hádá další token; všechno ostatní je důsledek.
- Blok = norm → attention → residual → norm → FFN → residual, opakovaný N×; FFN drží většinu parametrů.
- KV cache = 2 × vrstvy × kv_hlavy × head_dim × délka × bajty, hlavní žrout paměti při provozu.
- Generování je omezené propustností paměti, ne výpočtem. Proto batching a spekulativní dekódování.
- Vidí tokeny, ne písmena → neumí spolehlivě počítat znaky a čísla.
- Fakta jsou rozpuštěná ve vahách → halucinace nejsou porucha, ale vlastnost.
- Kontext je jediná paměť. Co v něm není, neexistuje.
Jak s ním mluvit
- Prompt = úkol + kontext + formát + mantinely.
- Příklad funguje líp než vysvětlování.
- Vždy řekni, co dělat při nejistotě („napiš Nevím“).
- Formát vynuť schématem, ne prosbou.
temperaturenízko na data, výš na tvorbu.
Jak stavět aplikaci
- Znalosti → RAG. Chování a styl → fine-tuning. Nepleť si to.
- Tři až pět dobrých úryvků poráží dvacet průměrných.
- Retrieval měř odděleně od generování.
- Agenta piš, až když postup neznáš dopředu.
- Výstup vždy zvaliduj; model není poslední instance.
Provoz
- Verzuj prompty, připínej verze modelu, testuj na vlastní sadě.
- Měř latenci p95, cenu na dotaz a podíl fallbacků.
- Limity a autorizace patří do kódu, ne do promptu.
- Nastav tvrdý strop útraty.
Rychlá diagnostika
| Příznak | Kde hledat |
|---|---|
| Model si vymýšlí | Chybí podklady (RAG) nebo povolení říct „nevím“ |
| Odpovídá „nevím“, i když data máte | Retrieval (chunking, hybridní hledání) |
| Rozbitý JSON | Vynucení schématu (strukturovaný výstup) |
| Zapomíná začátek konverzace | Přeteklo kontextové okno |
| Účet letí nahoru | Historie, velký model na triviální úlohy (cena) |
| Usekává odpovědi | max_tokens a stop_reason (parametry) |
| Po upgradu se chování změnilo | Nepřipnutá verze modelu (produkce) |
| Po kvantizaci horší kvalita | Příliš agresivní bitová šířka (numerika) |
| Model si dopisuje repliky uživatele | Špatný chat template (tokenizer) |
| Divné chování po vložení cizího textu | Prompt injection |
Kam pokračovat
Ke čtení
- Dokumentace poskytovatele, kterého používáš, je to jediný zdroj, který je aktuální.
- Attention Is All You Need (2017), původní článek o transformeru. Náročné, ale je to ten základ.
- Training Compute-Optimal LLMs (Chinchilla, 2022), poměr parametrů a dat, dodnes zásadní.
- FlashAttention (2022), ukázka, že u velkých modelů rozhoduje pohyb dat, ne počet operací.
- GQA (2023) a LoRA/QLoRA, dvě práce, které nejvíc ovlivnily praktický provoz a ladění.
- The Illustrated Transformer (Jay Alammar), totéž vysvětlené obrázky, mnohem přívětivější.
- Blogy k vyhledávání a RAG od autorů vektorových databází (často nejpraktičtější obsah vůbec).
K vyzkoušení
- Postav si RAG nad vlastními poznámkami. Naučí tě to víc než deset článků.
- Rozjeď lokální model přes Ollamu a porovnej ho s API na své úloze.
- Napiš testovací sadu k něčemu, co už máš a zjisti, jak si to doopravdy vede.
- Zkus na vlastní aplikaci prompt injection, než to zkusí někdo jiný.
Související kapitoly z ostatních kurzů
- AI / LLM integrace v Backend po lopatě, pohled z backendové strany.
- Bezpečnost, autorizace a OWASP, které platí i pro AI aplikace.
- Caching a Observability, obojí využiješ přesně tak, jak je tam popsané.
Poslední rada
Obor se mění rychle, ale základy z první kapitoly platí dál: model hádá další token, kontext je jeho jediná paměť a zodpovědnost za výsledek zůstává na tobě. Modely se budou střídat, tahle tři pravidla ne.
Aplikace odpovídá „nevím“, i když dokument s odpovědí v systému je. Kde začít hledat?
U vyhledávání, ne u promptu. Zkontroluj, jestli se správný úryvek vůbec dostal mezi nalezené, tedy chunking, embedding, filtry a to, jestli není potřeba doplnit fulltext a přeřazení výsledků.
Jaká tři pravidla platí bez ohledu na to, jaký model zrovna používáš?
Model předpovídá další token, kontext je jeho jediná paměť a zodpovědnost za správnost výstupu zůstává na tobě. Z toho plyne potřeba dodávat podklady, hlídat kontext a validovat výsledek.
