Transformer má jednu zásadní vadu: pozornost roste kvadraticky s délkou a KV cache lineárně. Devět let se hledá něco lepšího. Pár kandidátů je zajímavých a v praxi se objevují v hybridní podobě, ale transformer pořád vede, a je dobré vědět proč.
Stavové modely (SSM, Mamba)
Myšlenka je stará jako rekurentní sítě: místo aby si model pamatoval všechny předchozí tokeny, drží stav pevné velikosti, který průběžně aktualizuje.
transformer: pamatuje si všechno → cache roste s délkou → drahé, ale nic neztratí
SSM: drží stav pevné velikosti → konstantní paměť → levné, ale musí zapomínat
Moderní varianty (Mamba a spol.) přidaly selektivitu: stav se aktualizuje podle obsahu tokenu, takže model se učí, co si nechat a co zahodit. Výsledek je lineární složitost a konstantní paměť při generování, pro velmi dlouhé sekvence velmi lákavé.
Proč to nevytlačilo transformer: v úlohách, kde je potřeba přesně sáhnout na konkrétní dřívější token (najdi v textu tohle jméno, zkopíruj přesně tuhle hodnotu), je pevný stav ve nevýhodě. Attention má doslovný přístup ke všemu, SSM jen ke svému shrnutí.
Hybridy: dnešní praktická odpověď
Ukázalo se, že nemusíš volit. Střídání vrstev dává většinu výhod obojího:
… → SSM vrstva → SSM vrstva → attention vrstva → SSM → SSM → attention → …
Attention vrstvy zajistí přesné vyhledávání v kontextu, SSM vrstvy nesou většinu práce levně. Podobně funguje střídání plné a oknové pozornosti u čistě transformerových modelů. Tenhle přístup dnes najdeš v řadě modelů s dlouhým kontextem.
Další směry, které stojí za zmínku
- Lineární attention. Přeformuluje pozornost tak, aby šla počítat lineárně. Rychlé, ale historicky za cenu znatelné ztráty kvality.
- Retrieval-augmented architektury. Model má menší kontext, zato natrénovaný přístup do externí paměti, v podstatě RAG zabudovaný do architektury.
- Difuzní modely pro text. Generují text „najednou“ a postupně ho zpřesňují místo token po tokenu. Slibné hlavně kvůli paralelizaci, zatím okrajové.
Proč transformer pořád vyhrává
- Ekosystém. Devět let optimalizací: FlashAttention, kernely, kvantizace, serving. Nová architektura startuje s desetinovým výkonem, i když je teoreticky lepší.
- Paralelní trénink. Transformer zpracuje celou sekvenci naráz, rekurentní modely mají sériovou závislost. Na trénování obřích modelů je to zásadní.
- Doslovný přístup ke kontextu. Spousta reálných úloh (RAG, práce s dokumenty, kód) stojí na přesném vytažení konkrétní informace.
- Předvídatelné škálování. U transformeru víme, jak se chová při zvětšování. U alternativ je to méně prozkoumané.
Co s tím jako inženýr
Nemusíš tyhle architektury umět implementovat, ale vyplatí se je poznat ve specifikaci: když u modelu vidíš „hybrid“, „state space“ nebo „linear attention“, čekej jiné chování u dlouhého kontextu, obvykle levnější provoz, ale slabší přesné vyhledávání v datech. Otestuj to na své úloze, ideálně na dlouhém dokumentu s dotazem na konkrétní detail.
Cvičení
- SSM má konstantní paměť bez ohledu na délku kontextu. Proč tedy nevytlačil transformer?
- U jaké úlohy bys volil hybridní model a u jaké čistý transformer?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
- Protože pevně velký stav znamená, že se do něj všechno nevejde. Transformer si drží všechny předchozí tokeny a může se kdykoli přesně podívat zpět, což je drahé, ale spolehlivé. SSM průběžně aktualizuje shrnutí, takže platí konstantní paměť, ale doslovné vybavení konkrétního údaje z dávné minulosti mu jde hůř. A přesně to potřebuješ u citací, práce s kódem a vytahování údajů z dokumentů.
- Hybrid tam, kde je dlouhý proud dat a nepotřebuješ doslovnost: přepisy hovorů, telemetrie, sledování dlouhého kontextu v čase. Čistý transformer tam, kde se má citovat a přesně vybavovat: RAG, kód, extrakce údajů. Dnešní hybridy střídají oba typy vrstev právě proto, aby měly konstantní paměť u většiny vrstev a schopnost přesně se ohlédnout u zbytku.
Shrnutí
- SSM/Mamba drží stav pevné velikosti: lineární složitost, konstantní paměť, ale horší doslovné vyhledávání.
- Hybridní modely střídají SSM a attention vrstvy a berou si výhody obojího.
- Transformer drží pozici hlavně kvůli ekosystému, paralelnímu tréninku a přesnému přístupu ke kontextu.
- U alternativních architektur testuj přesně to, v čem jsou slabé: hledání konkrétního detailu v dlouhém textu.
V čem je hlavní architektonický rozdíl mezi transformerem a stavovým modelem (SSM)?
Transformer si drží klíče a hodnoty všech předchozích tokenů, takže má ke kontextu doslovný přístup, ale paměť roste s délkou. SSM drží stav pevné velikosti, který průběžně aktualizuje, je to konstantně paměťově náročné a lineární, ale model musí informace shrnovat a zapomínat.
Proč se v praxi objevují hybridní modely místo čistých SSM?
Protože attention je nenahraditelná tam, kde je potřeba přesně sáhnout na konkrétní dřívější token. Střídání SSM a attention vrstev dá levný provoz na dlouhém kontextu a zároveň zachová schopnost doslovného vyhledávání.
Testuješ model s hybridní architekturou. Na co se zaměřit?
Na úlohy vyžadující přesné vytažení konkrétního detailu z dlouhého kontextu, najít jméno, číslo nebo pasáž a citovat je doslova. Právě tam bývají architektury se stavovou pamětí slabší než čistý transformer.
