Vývoj 2017 → 2026

Co se za devět let změnilo a proč: časová osa.

Co se naučíš: Uvidíš na časové ose, co se za devět let změnilo a proč, takže ti zapadnou zkratky z papírů.

6 min čtení + cvičeníNavazuje na:🏗️ Anatomie modelu

Mezi původním transformerem a dnešním modelem je propast. Většina změn ale nebyla revoluce, byla to série malých rozhodnutí, z nichž každé řešilo konkrétní problém. Tahle časová osa je shrnutí celé kapitoly o architektuře a zároveň nejrychlejší způsob, jak si udělat pořádek v tom, co je dnes standard a proč.


Časová osa

2017. Transformer. Encoder-decoder pro překlad. Attention nahradila rekurenci, protože se dá paralelizovat. Post-norm, sinusoidální pozice, ReLU, plná MHA.

2018–2019. Rozdělení cest. BERT (encoder-only) pro porozumění, GPT (decoder-only) pro generování. Ukázalo se, že decoder-only zvládne obojí, a stal se standardem.

2020. Scaling laws a GPT-3. Kvalita roste předvídatelně s velikostí. 175 miliard parametrů. Objevuje se učení z příkladů v promptu (few-shot) bez dotrénování.

2021. Zaměření na instrukce. Ukazuje se, že model se dá naučit poslouchat zadání dotrénováním na instrukcích a že je to důležitější než další zvětšování.

2022. Tři zásadní věci najednou. RLHF (model odpovídá tak, jak lidé chtějí) přinesl chatovací rozhraní, jaké známe. Chinchilla ukázala, že modely jsou nedotrénované. FlashAttention udělal z attention IO problém, ne výpočetní.

2023. Konsolidace architektury. Otevřené modely ustálily dnešní recept: RMSNorm, SwiGLU, RoPE, pre-norm, bez biasů. Přichází GQA (menší KV cache), QLoRA (fine-tuning na jedné kartě) a vlna kvantizací.

2024. MoE, dlouhý kontext, multimodalita. Řídká aktivace umožnila obří modely s únosnou cenou. Kontexty skáčou z tisíců na statisíce tokenů (RoPE scaling). Obraz se stává běžnou součástí vstupu. Nástroje a strukturovaný výstup se z hacků mění ve standardní API. DPO nahrazuje PPO.

2025–2026. Uvažování a agenti. Škálování výpočtu při inferenci: model si odpověď rozmýšlí. RL na ověřitelných úlohách. Malé destilované modely dohánějí velké z předchozí generace. Agentní smyčky a standardizace nástrojového rozhraní. Důraz se přesouvá od „jak velký model“ k „jak dobrý systém kolem něj“.


Vysvětlivka: co byl encoder a co je cross-attention

Původní transformer měl dvě části. Encoder četl vstup (větu k překladu) bez kauzální masky, každý token viděl na všechny, protože vstup je celý známý dopředu. Decoder pak generoval výstup token po tokenu a kromě pozornosti na vlastní dosavadní výstup měl ještě cross-attention: dotazy braly z decoderu, ale klíče a hodnoty z encoderu.

self-attention:   Q, K, V  ze stejné sekvence
cross-attention:  Q z decoderu, K a V z encoderu (nebo z jiné modality)

Decoder-only modely encoder nemají, vstup i výstup jsou jedna sekvence. Cross-attention ale nezmizelo: používá se dodnes u multimodálních modelů, kde dotazy pocházejí z textové části a klíče s hodnotami z obrazového enkodéru.


Co se změnilo v architektuře, přehledně

Součást20172026Proč
Strukturaencoder-decoderdecoder-onlyjednodušší, zvládne obojí
Normalizacepost-norm, LayerNormpre-norm, RMSNormstabilní trénink hlubokých sítí
PozicesinusoidálníRoPE (+ scaling)relativní vzdálenosti, roztažitelný kontext
AktivaceReLUSwiGLUlepší výsledky za stejné parametry
AttentionMHAGQA / MLAmenší KV cache při zachování kvality
Bias členyanonezbytečné, komplikují trénink
FFNhustáčasto MoEkapacita bez ceny za výpočet
Kontext512128 k – 1 MRoPE scaling, okna, dotrénování
ZarovnánížádnéSFT + DPO/RLz doplňovače textu asistent
InferencenaivníKV cache, batching, pagedz laboratoře do produkce

Co se naopak nezměnilo

  • Predikce dalšího tokenu je pořád jediný trénovací cíl.
  • Attention + FFN v residual streamu je pořád základní stavební blok.
  • Znalosti jsou rozpuštěné ve vahách, takže halucinace nezmizely.
  • Kontext je jediná paměť. Všechno kolem RAG a agentů vyplývá právě z toho.

Proto platí, že kdo rozumí základům z první kapitoly, rozumí i modelu, který vyjde za dva roky.


Kam to podle všeho míří

Střízlivě, bez věštění: nejvíc energie dnes jde do inference-time compute (nechat model přemýšlet, kolik je potřeba), efektivity (menší modely se schopnostmi velkých, levnější serving) a spolehlivosti (ověřitelné výstupy, nástroje, agenti, kteří se nezaseknou). Zvětšování modelu za každou cenu přestalo být hlavní osou.


Cvičení

  1. Vyber tři změny mezi rokem 2017 a dneškem, které nejvíc ovlivnily cenu provozu, a tři, které nejvíc ovlivnily kvalitu. Překrývají se?
  2. Původní paper měl encoder i decoder. Proč dnešní jazykové modely encoder nemají?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
  1. Cena: GQA, kvantizace a MoE. Kvalita: víc a lepších dat, instrukční a preferenční ladění, škálování. Skoro se nepřekrývají, a to je hlavní pointa. Většina architektonických změn po roce 2017 řešila provozní náklady, ne inteligenci; kvalitu táhla data a měřítko. Proto vypadá dnešní blok tak podobně tomu původnímu, i když modely umí nesrovnatelně víc.
  2. Protože pro generování textu není k čemu. Encoder je od toho, aby zpracoval vstupní sekvenci obousměrně, což dává smysl u překladu, kde vstup a výstup jsou dva různé texty. U jazykového modelu je vstup i výstup jeden proud a všechno, co model potřebuje, je pokračovat v něm. Decoder s kauzální maskou tedy stačí a je jednodušší i levnější.

Shrnutí

  • Dnešní architektura je součet drobných vylepšení, ne jediný objev.
  • Standard 2026: decoder-only, pre-norm + RMSNorm, RoPE, SwiGLU, GQA, často MoE.
  • Zlom nastal třikrát: scaling laws (2020), RLHF a Chinchilla (2022), reasoning (2025).
  • Základní princip, predikce tokenu v residual streamu, se nezměnil.
Které tři architektonické změny odlišují model z roku 2026 od původního transformeru nejvíc?

Přechod na decoder-only s pre-norm a RMSNorm (stabilita hlubokých sítí), RoPE místo absolutních pozic (relativní vzdálenosti a roztažitelný kontext) a GQA místo plné MHA (řádově menší KV cache). K tomu SwiGLU místo ReLU a u velkých modelů řídká aktivace přes MoE.

Proč se dnešní důraz přesouvá od velikosti modelu ke kvalitě systému kolem něj?

Protože zvětšování narazilo na dostupnost dat a na ekonomiku provozu, zatímco velkou část rozdílu v užitečnosti dělá kontext, retrieval, nástroje, validace a možnost nechat model déle uvažovat. Menší dobře obsloužený model tak často porazí větší nasazený naivně.

Co se za devět let nezměnilo?

Trénovací cíl (predikce dalšího tokenu), základní blok attention + FFN v residual streamu, fakt, že znalosti jsou rozpuštěné ve vahách (a tedy halucinace), a to, že kontext je jediná paměť modelu. Právě proto základní principy nezastarávají.