Mezi původním transformerem a dnešním modelem je propast. Většina změn ale nebyla revoluce, byla to série malých rozhodnutí, z nichž každé řešilo konkrétní problém. Tahle časová osa je shrnutí celé kapitoly o architektuře a zároveň nejrychlejší způsob, jak si udělat pořádek v tom, co je dnes standard a proč.
Časová osa
2017. Transformer. Encoder-decoder pro překlad. Attention nahradila rekurenci, protože se dá paralelizovat. Post-norm, sinusoidální pozice, ReLU, plná MHA.
2018–2019. Rozdělení cest. BERT (encoder-only) pro porozumění, GPT (decoder-only) pro generování. Ukázalo se, že decoder-only zvládne obojí, a stal se standardem.
2020. Scaling laws a GPT-3. Kvalita roste předvídatelně s velikostí. 175 miliard parametrů. Objevuje se učení z příkladů v promptu (few-shot) bez dotrénování.
2021. Zaměření na instrukce. Ukazuje se, že model se dá naučit poslouchat zadání dotrénováním na instrukcích a že je to důležitější než další zvětšování.
2022. Tři zásadní věci najednou. RLHF (model odpovídá tak, jak lidé chtějí) přinesl chatovací rozhraní, jaké známe. Chinchilla ukázala, že modely jsou nedotrénované. FlashAttention udělal z attention IO problém, ne výpočetní.
2023. Konsolidace architektury. Otevřené modely ustálily dnešní recept: RMSNorm, SwiGLU, RoPE, pre-norm, bez biasů. Přichází GQA (menší KV cache), QLoRA (fine-tuning na jedné kartě) a vlna kvantizací.
2024. MoE, dlouhý kontext, multimodalita. Řídká aktivace umožnila obří modely s únosnou cenou. Kontexty skáčou z tisíců na statisíce tokenů (RoPE scaling). Obraz se stává běžnou součástí vstupu. Nástroje a strukturovaný výstup se z hacků mění ve standardní API. DPO nahrazuje PPO.
2025–2026. Uvažování a agenti. Škálování výpočtu při inferenci: model si odpověď rozmýšlí. RL na ověřitelných úlohách. Malé destilované modely dohánějí velké z předchozí generace. Agentní smyčky a standardizace nástrojového rozhraní. Důraz se přesouvá od „jak velký model“ k „jak dobrý systém kolem něj“.
Vysvětlivka: co byl encoder a co je cross-attention
Původní transformer měl dvě části. Encoder četl vstup (větu k překladu) bez kauzální masky, každý token viděl na všechny, protože vstup je celý známý dopředu. Decoder pak generoval výstup token po tokenu a kromě pozornosti na vlastní dosavadní výstup měl ještě cross-attention: dotazy braly z decoderu, ale klíče a hodnoty z encoderu.
self-attention: Q, K, V ze stejné sekvence
cross-attention: Q z decoderu, K a V z encoderu (nebo z jiné modality)
Decoder-only modely encoder nemají, vstup i výstup jsou jedna sekvence. Cross-attention ale nezmizelo: používá se dodnes u multimodálních modelů, kde dotazy pocházejí z textové části a klíče s hodnotami z obrazového enkodéru.
Co se změnilo v architektuře, přehledně
| Součást | 2017 | 2026 | Proč |
|---|---|---|---|
| Struktura | encoder-decoder | decoder-only | jednodušší, zvládne obojí |
| Normalizace | post-norm, LayerNorm | pre-norm, RMSNorm | stabilní trénink hlubokých sítí |
| Pozice | sinusoidální | RoPE (+ scaling) | relativní vzdálenosti, roztažitelný kontext |
| Aktivace | ReLU | SwiGLU | lepší výsledky za stejné parametry |
| Attention | MHA | GQA / MLA | menší KV cache při zachování kvality |
| Bias členy | ano | ne | zbytečné, komplikují trénink |
| FFN | hustá | často MoE | kapacita bez ceny za výpočet |
| Kontext | 512 | 128 k – 1 M | RoPE scaling, okna, dotrénování |
| Zarovnání | žádné | SFT + DPO/RL | z doplňovače textu asistent |
| Inference | naivní | KV cache, batching, paged | z laboratoře do produkce |
Co se naopak nezměnilo
- Predikce dalšího tokenu je pořád jediný trénovací cíl.
- Attention + FFN v residual streamu je pořád základní stavební blok.
- Znalosti jsou rozpuštěné ve vahách, takže halucinace nezmizely.
- Kontext je jediná paměť. Všechno kolem RAG a agentů vyplývá právě z toho.
Proto platí, že kdo rozumí základům z první kapitoly, rozumí i modelu, který vyjde za dva roky.
Kam to podle všeho míří
Střízlivě, bez věštění: nejvíc energie dnes jde do inference-time compute (nechat model přemýšlet, kolik je potřeba), efektivity (menší modely se schopnostmi velkých, levnější serving) a spolehlivosti (ověřitelné výstupy, nástroje, agenti, kteří se nezaseknou). Zvětšování modelu za každou cenu přestalo být hlavní osou.
Cvičení
- Vyber tři změny mezi rokem 2017 a dneškem, které nejvíc ovlivnily cenu provozu, a tři, které nejvíc ovlivnily kvalitu. Překrývají se?
- Původní paper měl encoder i decoder. Proč dnešní jazykové modely encoder nemají?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
- Cena: GQA, kvantizace a MoE. Kvalita: víc a lepších dat, instrukční a preferenční ladění, škálování. Skoro se nepřekrývají, a to je hlavní pointa. Většina architektonických změn po roce 2017 řešila provozní náklady, ne inteligenci; kvalitu táhla data a měřítko. Proto vypadá dnešní blok tak podobně tomu původnímu, i když modely umí nesrovnatelně víc.
- Protože pro generování textu není k čemu. Encoder je od toho, aby zpracoval vstupní sekvenci obousměrně, což dává smysl u překladu, kde vstup a výstup jsou dva různé texty. U jazykového modelu je vstup i výstup jeden proud a všechno, co model potřebuje, je pokračovat v něm. Decoder s kauzální maskou tedy stačí a je jednodušší i levnější.
Shrnutí
- Dnešní architektura je součet drobných vylepšení, ne jediný objev.
- Standard 2026: decoder-only, pre-norm + RMSNorm, RoPE, SwiGLU, GQA, často MoE.
- Zlom nastal třikrát: scaling laws (2020), RLHF a Chinchilla (2022), reasoning (2025).
- Základní princip, predikce tokenu v residual streamu, se nezměnil.
Které tři architektonické změny odlišují model z roku 2026 od původního transformeru nejvíc?
Přechod na decoder-only s pre-norm a RMSNorm (stabilita hlubokých sítí), RoPE místo absolutních pozic (relativní vzdálenosti a roztažitelný kontext) a GQA místo plné MHA (řádově menší KV cache). K tomu SwiGLU místo ReLU a u velkých modelů řídká aktivace přes MoE.
Proč se dnešní důraz přesouvá od velikosti modelu ke kvalitě systému kolem něj?
Protože zvětšování narazilo na dostupnost dat a na ekonomiku provozu, zatímco velkou část rozdílu v užitečnosti dělá kontext, retrieval, nástroje, validace a možnost nechat model déle uvažovat. Menší dobře obsloužený model tak často porazí větší nasazený naivně.
Co se za devět let nezměnilo?
Trénovací cíl (predikce dalšího tokenu), základní blok attention + FFN v residual streamu, fakt, že znalosti jsou rozpuštěné ve vahách (a tedy halucinace), a to, že kontext je jediná paměť modelu. Právě proto základní principy nezastarávají.
