Reasoning modely

Test-time compute, thinking tokeny, RL na uvažování.

Co se naučíš: Pochopíš, co jsou thinking tokeny a proč se u nich platí za text, který nikdy neuvidíš.

5 min čtení + cvičeníNavazuje na:🧪 Moderní trénink

Nejvýraznější změna posledních let: ukázalo se, že se dá škálovat i výpočet při odpovídání, ne jen při tréninku. Model, který dostane prostor „rozmyslet si to“, vygenerovat stovky nebo tisíce tokenů úvah, než odpoví, řeší úlohy, na které stejně velký model bez té možnosti nestačí. Tomuhle se říká test-time compute a stojí za tím celá nová kategorie modelů.


Odkud se to vzalo

Nejdřív se přišlo na to, že věta „postupuj krok za krokem“ v promptu zlepší výsledky u úloh vyžadujících uvažování, mezikroky se stanou součástí kontextu a další token se hádá z lepšího základu (viz predikce).

Pak přišel logický krok: naučit model dělat to sám a dobře. Ne prosbou v promptu, ale tréninkem na úlohách, kde jde výsledek automaticky ověřit (matematika, kód), s posilovaným učením podle toho, jestli konečná odpověď vyšla, nikoli podle toho, jak úvaha vypadá.

Model se tak sám naučil postupy, které nikdo neprogramoval: rozdělit problém, zkusit cestu, poznat slepou uličku, vrátit se, ověřit si výsledek jinak.


Jak to vypadá v provozu

běžný model:     prompt → 200 tokenů odpovědi
reasoning model: prompt → 3 000 tokenů úvah (skrytých) → 200 tokenů odpovědi

Úvahové tokeny se obvykle uživateli nezobrazují (nebo jen ve zkrácené podobě), ale platí se za ně a čeká se na ně. To je hlavní praktický dopad: odpověď může trvat desítky sekund a stát mnohonásobek běžného volání.

Většina těchhle modelů umožňuje řídit, jak dlouho přemýšlet, nižší nebo vyšší rozpočet na uvažování. Je to nová páka vedle výběru modelu.


Kdy se to vyplatí a kdy je to plýtvání

ÚlohaReasoning model
Klasifikace, extrakce, přepis, překladNe. Čistá ztráta času a peněz.
Běžná konverzace, shrnutíNe
Matematika, algoritmy, složitý kódAno
Návrh architektury, analýza kompromisůAno
Ladění záludné chybyAno
Úlohy na několik kroků s podmínkamiObvykle ano

💡 Praktický vzorec pro produkci: routuj. Většinu provozu odbav běžným modelem a reasoning model volej jen tam, kde jednoduchý model selhává, nebo když si to uživatel vyžádá.


Co se tím změnilo koncepčně

  1. Kvalita se dá koupit časem. Dřív bylo jediné, co šlo udělat, sáhnout po větším modelu. Dnes můžeš nechat menší model přemýšlet déle a u některých úloh je to výhodnější.
  2. Nová dimenze scaling zákonů. Ke tréninkovému výpočtu přibyl inferenční, který se dá měnit za běhu podle obtížnosti dotazu.
  3. Úvahy jako datový zdroj. Vygenerované postupy silného modelu se dají použít k destilaci do menších modelů, které pak umí „přemýšlet“ taky.

Na co si dát pozor

  • Úvaha není vysvětlení. Text, který model vypíše jako uvažování, nemusí odpovídat tomu, co ho k odpovědi skutečně vedlo. Nezacházej s ním jako s auditní stopou.
  • Delší přemýšlení nezaručí lepší výsledek. U jednoduchých úloh naopak vede k přemýšlení o věcech, na kterých nezáleží.
  • Latence. Ve chvíli, kdy uživatel čeká, jsou desítky sekund problém. Zvaž streamování průběhu nebo asynchronní zpracování.
  • Náklady. Úvahové tokeny se počítají jako výstupní, tedy ty dražší. Nastav si strop.

Cvičení

  1. Reasoning model odpoví na tvůj dotaz za 40 sekund a na účtu vidíš desetkrát víc výstupních tokenů, než má odpověď. Kde jsou?
  2. U jakých úloh se reasoning model vyplatí a u jakých je to vyhazování peněz?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
  1. Ve skrytých úvahách. Model před odpovědí vygeneruje dlouhý řetěz uvažování, který ti poskytovatel obvykle neukáže, ale účtuje ho jako výstupní tokeny. Odtud plyne i ta latence: každý token úvahy je samostatný průchod modelem. Při rozpočtování je proto potřeba počítat s násobky oproti běžnému modelu a hlídat limit na délku uvažování.
  2. Vyplatí se tam, kde je jedna správná odpověď a cesta k ní má víc kroků: matematika, kód s testy, logické úlohy, plánování. Nevyplatí se u přeformulování, klasifikace, extrakce údajů a jednoduchých odpovědí z podkladů. U těch druhých není co odvozovat, takže dostaneš stejný výsledek pomaleji a dráž. Rozumný postup je použít levný model jako výchozí a na reasoning přepínat jen u úloh, kde selhává.

Shrnutí

  • Reasoning modely škálují výpočet při odpovídání: generují dlouhé skryté úvahy, než odpoví.
  • Schopnost vznikla RL tréninkem na ověřitelných úlohách, ne psaním pravidel.
  • Vyplatí se u matematiky, kódu a vícekrokových úloh; jinde je to ztráta času a peněz.
  • Úvahový text není spolehlivé vysvětlení rozhodnutí a platí se jako drahý výstup.
Co znamená „test-time compute“ a proč je to novinka?

Že se výkon dá zvýšit tím, kolik výpočtu model spotřebuje při odpovídání, typicky generováním dlouhé úvahy před finální odpovědí. Novinka je to proto, že dřív šlo kvalitu zvyšovat prakticky jen větším modelem nebo delším tréninkem; teď je to volba, kterou děláš při každém dotazu.

Aplikace klasifikuje tikety do kategorií. Má smysl nasadit reasoning model?

Ne. Klasifikace nevyžaduje vícekrokové uvažování, takže úvahové tokeny by jen prodloužily latenci a zvýšily cenu bez přínosu. Reasoning model se vyplatí u matematiky, složitého kódu a úloh o několika krocích.

Můžeš úvahový text modelu použít jako doklad, proč rozhodl tak, jak rozhodl?

Ne. Vypsaná úvaha je také jen generovaný text a nemusí odpovídat skutečnému výpočtu, který k odpovědi vedl. Jako auditní stopa je nespolehlivá, pokud potřebuješ zdůvodnění, musí být ověřitelné jinak, například odkazem na podklady.