Co LLM neumí

Počítání, čas, novinky, mýty a benchmarky.

Co se naučíš: Budeš znát věci, které model neumí a umět nebude, takže na ně přestaneš narážet.

4 min čtení + cvičeníNavazuje na:🌀 Halucinace

Kolem LLM je hodně nadšení a hodně nesmyslů. Tahle kapitola je záměrně střízlivá: co model spolehlivě neumí, jaké mýty se traduje a jak číst tabulky s benchmarky, aby ses nenechal obalamutit. Znát limity je stejně důležité jako znát možnosti, ušetří ti to nasazení, které nemohlo vyjít.


Co mu prostě nejde

Přesné počítání. Hádá pokračování textu, ne aritmetiku. U delších čísel se plete, a co hůř, plete se sebevědomě. Řešení: nástroj s kalkulačkou nebo výpočet v kódu.

Práce se znaky. Kolik r je v „jahoda“, otoč slovo pozpátku, spočítej slabiky, naráží na tokenizaci.

Vědět, co neví. Nemá vnitřní ukazatel jistoty. Vymyšlená odpověď vypadá stejně sebejistě jako správná (halucinace).

Aktuální informace. Zná svět po datum uzávěrky tréninku. Bez vyhledávání nebo podkladů ti o dnešku neřekne nic.

Čas a stav. Netuší, kolik je hodin, jak dlouho konverzace trvá ani co se stalo mezi voláními, pokud mu to neřekneš.

Spolehlivé dodržení dlouhého seznamu pravidel. U dvaceti zákazů si po chvíli některý přestane hlídat. Míň pravidel, zbytek ohlídej kódem.

Determinismus. Dvakrát tatáž otázka může dát dvě různé odpovědi (parametry).


Mýty

MýtusJak to je
„Model přemýšlí jako člověk.“Předpovídá tokeny. Že to připomíná uvažování, je důsledek, ne záměr.
„Učí se z našich konverzací.“Běžné volání API vahy nemění; to dělá jen samostatný trénink.
„Nový model vyřeší náš problém.“Většina problémů je v datech, retrievalu a validaci, ne v modelu.
„Když to zvládne v ukázce, zvládne to v produkci.“Ukázka je pár vstupů. Produkce je dlouhý chvost divných případů.
„Fine-tuning ho naučí naše fakta.“Fakta patří do kontextu; fine-tuning mění chování (fine-tuning).
„Nahradí programátory / právníky / doktory.“Nahrazuje část rutiny. Zodpovědnost se přesouvá na kontrolu, ne mizí.

Jak číst benchmarky

Čísla typu „89,3 % na MMLU“ vypadají vědecky, ale jsou zrádná:

  • Kontaminace. Testovací otázky bývají v tréninkových datech. Model si je mohl zapamatovat.
  • Neměří tvůj problém. Skvělý výsledek v maturitních otázkách neříká nic o tom, jak model vytáhne položky z tvých faktur.
  • Vybraná měření. Poskytovatel ukáže, kde vyhrál.
  • Rychle zastarávají. Dnešní pořadí platí do příštího vydání.

💡 Jediný benchmark, na kterém záleží, je tvoje testovací sada (evaluace). Deset až padesát reálných případů z tvé domény rozhodne líp než všechny žebříčky dohromady.


Kde je hranice rozumného nasazení

Zeptej se: co se stane, když model odpoví špatně?

  • Nic zásadního (návrh textu, nápady) → nasaď a nech ho pracovat.
  • Nepříjemnost (špatně zařazený tiket) → nasaď s měřením a možností opravy.
  • Škoda (chybná informace zákazníkovi, špatná částka) → jen s validací a kontrolou.
  • Vážná škoda (peníze, zdraví, právo) → model může nanejvýš připravovat podklad, rozhoduje člověk.

Cvičení

  1. Uživatel chce po modelu spočítat součet 200 čísel z tabulky. Proč to dopadne špatně a jak úlohu přeformulovat?
  2. Model tvrdí s naprostou jistotou něco, co je nepravda. Proč nepomůže zeptat se ho, jak si je jistý?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
  1. Protože sčítání není predikce textu a model nemá pracovní paměť ani přenos do vyššího řádu. U dvou čísel to zvládne, protože takové příklady viděl; u dvou set se chyba objeví skoro jistě. Oprava je nedávat mu úlohu, kterou má vykonat, ale úlohu, kterou má připravit: ať vrátí čísla ve strukturovaném tvaru a součet spočítá tvůj kód. Případně mu dej kalkulačku jako nástroj. Viz nástroje.
  2. Protože sebehodnocení je taky jen generovaný text. Model nemá přístup ke stavu „tohle jsem si vymyslel“; vzpomínání a vymýšlení probíhá stejným mechanismem, takže vysoká deklarovaná jistota nekoreluje s pravdivostí, jen se stylem. Použitelnější signály jsou vnější: shoda víc nezávislých vzorků, dohledatelnost tvrzení v podkladech a rozptyl pravděpodobností při generování.

Shrnutí

  • Model neumí přesně počítat, pracovat se znaky, znát dnešek ani vědět, co neví.
  • Většina „chyb modelu“ je ve skutečnosti chyba v datech, retrievalu nebo chybějící validaci.
  • Benchmarky neříkají nic o tvé úloze; rozhoduje vlastní testovací sada.
  • Míru nasazení odvozuj od ceny chyby, ne od nadšení.
Model má v benchmarcích skvělé výsledky, ale ve vaší aplikaci na extrakci dat z faktur chybuje. Jak to?

Benchmarky měří jiné úlohy, než je ta tvoje, a bývají zatížené kontaminací tréninkových dat. Rozhodnout může jen vlastní testovací sada s reálnými fakturami, podle ní vybírej model i ladění.

Proč je nebezpečné spoléhat na to, že model „řekne, když si není jistý“?

Protože nemá vnitřní míru jistoty, vymyšlená odpověď probíhá stejným způsobem jako správná. Pomáhá dát mu podklady, výslovně povolit „nevím“ a hlavně ověřovat výstup mimo model.

Kdy je nasazení LLM bez lidské kontroly nezodpovědné?

Když má chyba vážné následky, peníze, zdraví, právní závazky. Tam smí model nanejvýš připravit podklad a rozhodnutí musí potvrdit člověk. Míru kontroly odvozuj od ceny chyby, ne od toho, jak dobře to vypadá v demu.