LLM po lopatě

LLM od tokenu k vlastní AI aplikaci: jak model doopravdy funguje, jak s ním mluvit, jak nad ním postavit RAG, agenty a hlídat cenu a hlavně kde všude to praská. Junior-friendly, na analogiích, s důrazem na proč to tak je.

Kurz 3 · Od tokenu k vlastní AI aplikaci

Kurz 1Backend po lopatěBackend & System Design, databáze, distribuované systémy, škálování.

Kudy na to

Kurz má 62 kapitol a přečíst se dá celý, ale nemusíš. Podle toho, proč jsi tady, si vyber cestu. Každá dává smysl samostatně.

Chci stavět aplikaci

Potřebuješ chatbota, RAG nebo agenta. Vnitřek modelu tě zajímá jen potud, pokud ti něco praská.

22 kapitol · zhruba 2 hodiny

  1. 1. Co je LLM
  2. 2. Tokeny a kontextové okno
  3. 3. Zprávy, prompting, parametry
  4. 4. Strukturovaný výstup a nástroje
  5. 5. Projekt: RAG nad svými soubory
  6. 6. Rizika a provoz

Architekturu si necháš na později, nebo úplně.

Chci rozumět modelu

Chceš vědět, co se uvnitř děje, a umět si to spočítat. Na konci máš vlastní natrénovaný transformer.

20 kapitol · zhruba 4 hodiny a počítač u ruky

  1. 1. Predikce a embeddingy
  2. 2. Od bigramu k transformeru
  3. 3. Attention ručně na číslech
  4. 4. Postav si vlastní model
  5. 5. Vylepši si model
  6. 6. Změř si scaling zákon

Pak už si vybíráš podle chuti: MoE, RoPE, kvantizace, inference.

Chci projít všechno

Od tokenu po vlastní model a hotovou aplikaci. Nejdelší, ale jediná cesta, po které nezůstanou díry.

62 kapitol · zhruba 10 hodin s cvičeními

  1. Prostě začni na začátku

Postup si odškrtávej, ukládá se v prohlížeči.

Princip: LLM se nenaučíš sbíráním „magických promptů". Naučíš se ho, když pochopíš princip, že model hádá další token, že kontext je jeho jediná paměť a že zodpovědnost za výsledek zůstává na tobě. Každá kapitola má proto skládací otázky s odpověďmi, ať si pochopení rovnou ověříš.

Obsah kurzu · LLM od základu

Co je LLMCo to umí, co ne, a proč to není databáze ani vyhledávač.TokenyModel nevidí písmena ani slova. Proč na tom záleží.Predikce dalšího tokenuCelé kouzlo: pravděpodobnost dalšího kousku textu.EmbeddingyVýznam jako souřadnice. Základ hledání i RAG.Transformer po lopatěAttention, vrstvy, hlavy, bez matematiky.Jak model vznikáPretraining, instrukční ladění, RLHF.Velikost a kvantizaceCo znamená 7B, kolik to žere, co je Q4.Od bigramu k transformeruPostavíme model po krocích, každý řeší selhání předchozího.Anatomie modeluKompletní průchod vrstvami: co se kde počítá a proč.Attention ručně na číslechSpočítáme pozornost krok za krokem na třech tokenech.Attention do hloubkyMHA → MQA → GQA → MLA a KV cache jako hlavní bottleneck.Transformer v kóduCelý blok v padesáti řádcích, včetně rozměrů tenzorů.Postav si vlastní modelSpustitelný trénink na tvém počítači, se skutečnými výstupy.Poziční kódováníSinusoida → learned → RoPE → prodlužování kontextu.Normalizace a aktivacePre-norm, RMSNorm, SwiGLU, residual a proč zrovna takhle.Mixture of ExpertsRouter, řídká aktivace, proč mají dnešní modely „aktivní parametry“.Scaling zákonyKaplan, Chinchilla a proč jsou modely menší a trénované déle.Trénovací dataFiltrace, deduplikace, dekontaminace a míchání zdrojů.Moderní tréninkData, SFT, RLHF → DPO/GRPO, syntetická data, distilace.Reasoning modelyTest-time compute, thinking tokeny, RL na uvažování.MultimodalitaJak se do modelu dostane obrázek, zvuk a video.Inference stackPrefill vs decode, batching, paged attention, spekulace.Alternativy transformeruSSM/Mamba, hybridy a proč transformer pořád vede.Vývoj 2017 → 2026Co se za devět let změnilo a proč: časová osa.Čtení specifikace modeluSpočítat paměť, KV cache, propustnost a náklady.Vylepši si modelPřidej RMSNorm, RoPE, víc hlav a SwiGLU a změř, co to udělalo.Změř si scaling zákonNatrénuj model v pěti velikostech a ověř předpověď, která selže.Trénink vs generováníTeacher forcing a proč trénink zvládne tisíc predikcí naráz.Backprop ručněDerivace na jednom neuronu, krok za krokem s čísly.Loss a gradientCo se přesně minimalizuje a jak model ví, kam posunout váhy.Optimizer a learning rateAdamW, warmup, cosine decay a proč trénink žere tolik paměti.Tokenizer od nulyJak vzniká BPE slovník, speciální tokeny a chat template.Numerika a přesnostFP32 → BF16 → FP8, outliers a jak funguje kvantizace uvnitř.Distribuovaný tréninkData, tensor a pipeline paralelismus, ZeRO/FSDP, komunikace.Když se trénink pokazíTvary křivky loss, NaN, spikes a jak chybu najít.Co je uvnitř modeluInduction heads, superpozice, features a sparse autoencoders.Učení v kontextuJak se model učí z příkladů, když se váhy nemění.Vzorkování a řízené dekódováníZ logits na token a jak se formát vynutí maskováním.Perplexity a benchmarkyCo znamená loss 2,1, jak číst MMLU, pass@k a Elo z arén.Zprávy a rolesystem/user/assistant, jak model vidí konverzaci.PromptingInstrukce, kontext, příklady, co funguje a proč.Parametry generovánítemperature, top-p, max tokens, stop, seed.Kontextové oknoKolik se vejde, co vypadne, ztráta uprostřed.HalucinaceProč si model vymýšlí a jak to omezit.Strukturovaný výstupJSON, schémata, validace, opravné smyčky.Nástroje (tool use)Function calling: model volá tvůj kód.Volání APIRequest, streaming, chyby, retry, timeouty.Dělení dokumentůChunky, překryv, metadata, základ RAG.Vektorová databázePodobnostní hledání, indexy, hybridní search.RAG krok za krokemNajdi → vlož do promptu → odpověz se zdroji.Projekt: zeptej se svých souborůPostav RAG nad vlastní složkou a změř, jestli funguje.AgentiSmyčka plánuj-jednej-pozoruj a kde se láme.Paměť konverzaceHistorie, shrnování, dlouhodobá paměť.EvaluaceTestovací sada, LLM jako porotce, regrese.Cena a latenceTokeny jsou peníze. Cache, model routing, dávky.Prompt injectionÚtok přes data. Nejpodceňovanější riziko.Bezpečnost datCo poslat ven, co ne, GDPR, retence.GuardrailsLimity, filtry, schvalování akcí, fallbacky.Co LLM neumíPočítání, čas, novinky, mýty a benchmarky.Lokální modelyOllama, llama.cpp, GPU a kolik toho potřebuješ.Fine-tuningKdy ladit vlastní model a kdy je to zbytečné.LLM v produkciVerzování promptů, monitoring, incidenty.Zdroje & cheatsheetKam dál, co číst, co sledovat.