Alternativy transformeru

SSM/Mamba, hybridy a proč transformer pořád vede.

Co se naučíš: Budeš vědět, co jsou state space modely a proč transformer i přes svou kvadratiku pořád vede.

5 min čtení + cvičeníNavazuje na:🔎 Attention do hloubky

Transformer má jednu zásadní vadu: pozornost roste kvadraticky s délkou a KV cache lineárně. Devět let se hledá něco lepšího. Pár kandidátů je zajímavých a v praxi se objevují v hybridní podobě, ale transformer pořád vede, a je dobré vědět proč.


Stavové modely (SSM, Mamba)

Myšlenka je stará jako rekurentní sítě: místo aby si model pamatoval všechny předchozí tokeny, drží stav pevné velikosti, který průběžně aktualizuje.

transformer: pamatuje si všechno → cache roste s délkou → drahé, ale nic neztratí
SSM:         drží stav pevné velikosti → konstantní paměť → levné, ale musí zapomínat

Moderní varianty (Mamba a spol.) přidaly selektivitu: stav se aktualizuje podle obsahu tokenu, takže model se učí, co si nechat a co zahodit. Výsledek je lineární složitost a konstantní paměť při generování, pro velmi dlouhé sekvence velmi lákavé.

Proč to nevytlačilo transformer: v úlohách, kde je potřeba přesně sáhnout na konkrétní dřívější token (najdi v textu tohle jméno, zkopíruj přesně tuhle hodnotu), je pevný stav ve nevýhodě. Attention má doslovný přístup ke všemu, SSM jen ke svému shrnutí.


Hybridy: dnešní praktická odpověď

Ukázalo se, že nemusíš volit. Střídání vrstev dává většinu výhod obojího:

… → SSM vrstva → SSM vrstva → attention vrstva → SSM → SSM → attention → …

Attention vrstvy zajistí přesné vyhledávání v kontextu, SSM vrstvy nesou většinu práce levně. Podobně funguje střídání plné a oknové pozornosti u čistě transformerových modelů. Tenhle přístup dnes najdeš v řadě modelů s dlouhým kontextem.


Další směry, které stojí za zmínku

  • Lineární attention. Přeformuluje pozornost tak, aby šla počítat lineárně. Rychlé, ale historicky za cenu znatelné ztráty kvality.
  • Retrieval-augmented architektury. Model má menší kontext, zato natrénovaný přístup do externí paměti, v podstatě RAG zabudovaný do architektury.
  • Difuzní modely pro text. Generují text „najednou“ a postupně ho zpřesňují místo token po tokenu. Slibné hlavně kvůli paralelizaci, zatím okrajové.

Proč transformer pořád vyhrává

  1. Ekosystém. Devět let optimalizací: FlashAttention, kernely, kvantizace, serving. Nová architektura startuje s desetinovým výkonem, i když je teoreticky lepší.
  2. Paralelní trénink. Transformer zpracuje celou sekvenci naráz, rekurentní modely mají sériovou závislost. Na trénování obřích modelů je to zásadní.
  3. Doslovný přístup ke kontextu. Spousta reálných úloh (RAG, práce s dokumenty, kód) stojí na přesném vytažení konkrétní informace.
  4. Předvídatelné škálování. U transformeru víme, jak se chová při zvětšování. U alternativ je to méně prozkoumané.

Co s tím jako inženýr

Nemusíš tyhle architektury umět implementovat, ale vyplatí se je poznat ve specifikaci: když u modelu vidíš „hybrid“, „state space“ nebo „linear attention“, čekej jiné chování u dlouhého kontextu, obvykle levnější provoz, ale slabší přesné vyhledávání v datech. Otestuj to na své úloze, ideálně na dlouhém dokumentu s dotazem na konkrétní detail.


Cvičení

  1. SSM má konstantní paměť bez ohledu na délku kontextu. Proč tedy nevytlačil transformer?
  2. U jaké úlohy bys volil hybridní model a u jaké čistý transformer?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
  1. Protože pevně velký stav znamená, že se do něj všechno nevejde. Transformer si drží všechny předchozí tokeny a může se kdykoli přesně podívat zpět, což je drahé, ale spolehlivé. SSM průběžně aktualizuje shrnutí, takže platí konstantní paměť, ale doslovné vybavení konkrétního údaje z dávné minulosti mu jde hůř. A přesně to potřebuješ u citací, práce s kódem a vytahování údajů z dokumentů.
  2. Hybrid tam, kde je dlouhý proud dat a nepotřebuješ doslovnost: přepisy hovorů, telemetrie, sledování dlouhého kontextu v čase. Čistý transformer tam, kde se má citovat a přesně vybavovat: RAG, kód, extrakce údajů. Dnešní hybridy střídají oba typy vrstev právě proto, aby měly konstantní paměť u většiny vrstev a schopnost přesně se ohlédnout u zbytku.

Shrnutí

  • SSM/Mamba drží stav pevné velikosti: lineární složitost, konstantní paměť, ale horší doslovné vyhledávání.
  • Hybridní modely střídají SSM a attention vrstvy a berou si výhody obojího.
  • Transformer drží pozici hlavně kvůli ekosystému, paralelnímu tréninku a přesnému přístupu ke kontextu.
  • U alternativních architektur testuj přesně to, v čem jsou slabé: hledání konkrétního detailu v dlouhém textu.
V čem je hlavní architektonický rozdíl mezi transformerem a stavovým modelem (SSM)?

Transformer si drží klíče a hodnoty všech předchozích tokenů, takže má ke kontextu doslovný přístup, ale paměť roste s délkou. SSM drží stav pevné velikosti, který průběžně aktualizuje, je to konstantně paměťově náročné a lineární, ale model musí informace shrnovat a zapomínat.

Proč se v praxi objevují hybridní modely místo čistých SSM?

Protože attention je nenahraditelná tam, kde je potřeba přesně sáhnout na konkrétní dřívější token. Střídání SSM a attention vrstev dá levný provoz na dlouhém kontextu a zároveň zachová schopnost doslovného vyhledávání.

Testuješ model s hybridní architekturou. Na co se zaměřit?

Na úlohy vyžadující přesné vytažení konkrétního detailu z dlouhého kontextu, najít jméno, číslo nebo pasáž a citovat je doslova. Právě tam bývají architektury se stavovou pamětí slabší než čistý transformer.