Zdroje & cheatsheet

Kam dál, co číst, co sledovat.

Co se naučíš: Najdeš tu, kam pokračovat dál, a rychlý přehled toho podstatného na jedno místo.

4 min čtení

Shrnutí celého kurzu na jedno místo plus tipy, kam pokračovat. Když si po měsíci nebudeš něčím jistý, začni tady.


Cheatsheet: co si zapamatovat

Jak se model učí

  • Loss = −log p(správný token); gradient říká, kam posunout každý parametr; backprop ho spočítá jedním průchodem zpět.
  • AdamW + warmup + cosine decay; stavy optimizeru zaberou ~4× velikost modelu.
  • bf16 pro trénink (rozsah > přesnost), mixed precision s fp32 master vahami.
  • Paměť netrénuješ celou: ZeRO/FSDP rozdělí stavy mezi karty, LoRA trénuje jen adaptér.

Co je uvnitř

  • Residual stream je sběrnice; induction heads kopírují dřívější vzor a stojí za učením v kontextu.
  • Superpozice: koncepty jsou směry, ne neurony, proto jsou neurony polysémantické.
  • Formát výstupu se vynucuje maskováním logitů podle automatu, ne prosbou.
  • Perplexity = e^loss; napříč tokenizery neporovnatelná.

Jak to funguje

  • Model hádá další token; všechno ostatní je důsledek.
  • Blok = norm → attention → residual → norm → FFN → residual, opakovaný N×; FFN drží většinu parametrů.
  • KV cache = 2 × vrstvy × kv_hlavy × head_dim × délka × bajty, hlavní žrout paměti při provozu.
  • Generování je omezené propustností paměti, ne výpočtem. Proto batching a spekulativní dekódování.
  • Vidí tokeny, ne písmena → neumí spolehlivě počítat znaky a čísla.
  • Fakta jsou rozpuštěná ve vahách → halucinace nejsou porucha, ale vlastnost.
  • Kontext je jediná paměť. Co v něm není, neexistuje.

Jak s ním mluvit

  • Prompt = úkol + kontext + formát + mantinely.
  • Příklad funguje líp než vysvětlování.
  • Vždy řekni, co dělat při nejistotě („napiš Nevím“).
  • Formát vynuť schématem, ne prosbou.
  • temperature nízko na data, výš na tvorbu.

Jak stavět aplikaci

  • Znalosti → RAG. Chování a styl → fine-tuning. Nepleť si to.
  • Tři až pět dobrých úryvků poráží dvacet průměrných.
  • Retrieval měř odděleně od generování.
  • Agenta piš, až když postup neznáš dopředu.
  • Výstup vždy zvaliduj; model není poslední instance.

Provoz

  • Verzuj prompty, připínej verze modelu, testuj na vlastní sadě.
  • Měř latenci p95, cenu na dotaz a podíl fallbacků.
  • Limity a autorizace patří do kódu, ne do promptu.
  • Nastav tvrdý strop útraty.

Rychlá diagnostika

PříznakKde hledat
Model si vymýšlíChybí podklady (RAG) nebo povolení říct „nevím“
Odpovídá „nevím“, i když data máteRetrieval (chunking, hybridní hledání)
Rozbitý JSONVynucení schématu (strukturovaný výstup)
Zapomíná začátek konverzacePřeteklo kontextové okno
Účet letí nahoruHistorie, velký model na triviální úlohy (cena)
Usekává odpovědimax_tokens a stop_reason (parametry)
Po upgradu se chování změniloNepřipnutá verze modelu (produkce)
Po kvantizaci horší kvalitaPříliš agresivní bitová šířka (numerika)
Model si dopisuje repliky uživateleŠpatný chat template (tokenizer)
Divné chování po vložení cizího textuPrompt injection

Kam pokračovat

Ke čtení

  • Dokumentace poskytovatele, kterého používáš, je to jediný zdroj, který je aktuální.
  • Attention Is All You Need (2017), původní článek o transformeru. Náročné, ale je to ten základ.
  • Training Compute-Optimal LLMs (Chinchilla, 2022), poměr parametrů a dat, dodnes zásadní.
  • FlashAttention (2022), ukázka, že u velkých modelů rozhoduje pohyb dat, ne počet operací.
  • GQA (2023) a LoRA/QLoRA, dvě práce, které nejvíc ovlivnily praktický provoz a ladění.
  • The Illustrated Transformer (Jay Alammar), totéž vysvětlené obrázky, mnohem přívětivější.
  • Blogy k vyhledávání a RAG od autorů vektorových databází (často nejpraktičtější obsah vůbec).

K vyzkoušení

  1. Postav si RAG nad vlastními poznámkami. Naučí tě to víc než deset článků.
  2. Rozjeď lokální model přes Ollamu a porovnej ho s API na své úloze.
  3. Napiš testovací sadu k něčemu, co už máš a zjisti, jak si to doopravdy vede.
  4. Zkus na vlastní aplikaci prompt injection, než to zkusí někdo jiný.

Související kapitoly z ostatních kurzů


Poslední rada

Obor se mění rychle, ale základy z první kapitoly platí dál: model hádá další token, kontext je jeho jediná paměť a zodpovědnost za výsledek zůstává na tobě. Modely se budou střídat, tahle tři pravidla ne.

Aplikace odpovídá „nevím“, i když dokument s odpovědí v systému je. Kde začít hledat?

U vyhledávání, ne u promptu. Zkontroluj, jestli se správný úryvek vůbec dostal mezi nalezené, tedy chunking, embedding, filtry a to, jestli není potřeba doplnit fulltext a přeřazení výsledků.

Jaká tři pravidla platí bez ohledu na to, jaký model zrovna používáš?

Model předpovídá další token, kontext je jeho jediná paměť a zodpovědnost za správnost výstupu zůstává na tobě. Z toho plyne potřeba dodávat podklady, hlídat kontext a validovat výsledek.