Ve chvíli, kdy pošleš prompt do cizího API, opustila data tvůj server. To nemusí být problém, ale musí to být rozhodnutí, ne nedopatření. Tahle kapitola je o tom, co posílat, co ne, jak to ošetřit smluvně a technicky, a jak nezpůsobit únik osobních údajů vlastní nedbalostí.
Kam data putují
tvoje aplikace → API poskytovatele → model
↓
logy, monitoring, případně lidská kontrola
Co si u poskytovatele ověř před nasazením:
- Používají moje data k tréninku? U firemních tarifů zpravidla ne, ale musí to být napsané.
- Jak dlouho drží logy? Typicky dny až měsíce kvůli zneužití.
- Kde fyzicky běží? Kvůli GDPR má smysl EU region.
- Máme podepsané zpracovatelské podmínky (DPA)? Bez nich je zpracování osobních údajů problém.
Co do promptu nepatří
| Nikdy | Proč |
|---|---|
| Hesla, API klíče, tokeny | Nemají tam co dělat a skončí v logu |
| Čísla platebních karet | PCI DSS; navíc model je k ničemu nepotřebuje |
| Rodná čísla, zdravotní údaje | Zvláštní kategorie osobních údajů |
| Kompletní databázový dump | I kdyby to prošlo, platíš tokeny za balast |
Zásada minimalizace: pošli jen to, bez čeho nejde úkol splnit. Když stačí „zákazník je z Prahy, tarif Premium“, neposílej celý profil.
Pseudonymizace
Než prompt odešleš, nahraď citlivé údaje zástupkami a po odpovědi je vrať zpět:
před: "Napiš odpověď pro Jana Nováka, nar. 3. 5. 1988, tel. 777 123 456."
odesláno: "Napiš odpověď pro [JMENO], nar. [DATUM], tel. [TELEFON]."
po: dosadíš zpět
Funguje to dobře u jmen, kontaktů a čísel. Pozor na to, že kontext může člověka prozradit i bez jména („náš jediný zákazník ve Vsetíně“) a že nahrazování musí být spolehlivé, jinak je horší než žádné.
Logování: nejčastější díra
Ironií je, že data nejčastěji unikají u tebe, ne u poskytovatele. Prompty se logují kvůli ladění a skončí v Elasticu, ke kterému má přístup celá firma.
Pravidla, která se vyplatí:
- Logy s prompty drž odděleně a s přísnějším přístupem než běžné logy.
- Nastav retenci (dny, ne roky) a mazání.
- Maskuj citlivá pole už při zápisu.
- Nesbírej celé prompty, když stačí hash, délka a metadata (model, verze promptu, tokeny).
Kdy zvolit lokální model
Když data nesmí ven ani teoreticky, zdravotnictví, právo, utajované informace, firemní politika. Cenou je horší kvalita, provoz GPU a údržba. Podrobnosti v lokálních modelech.
💡 Střední cesta: rozdělit úlohy. Citlivé zpracování udělá lokální model, obecné úlohy (překlad marketingového textu) běží přes API.
Uživatelé to musí vědět
Pokud zpracováváš osobní údaje přes třetí stranu, patří to do zásad ochrany osobních údajů: kdo je zpracovatel, kam data jdou, jak dlouho se drží. A počítej s tím, že uživatel má právo na výmaz, což znamená umět smazat i uložené konverzace a jejich embeddingy.
Cvičení
- Chceš do modelu posílat zákaznické e-maily kvůli kategorizaci. Vyjmenuj, co si musíš ověřit, než to zapneš.
- Zákazník požádá o výmaz svých údajů podle GDPR. Co to znamená pro data, která už prošla přes API?
Náčrt řešení: rozbal, až si cvičení zkusíš sám
- Právní titul, smlouvu s poskytovatelem, retenci, lokalitu a rozsah dat. Musíš mít důvod, proč data zpracováváš, a mít ho popsaný. S poskytovatelem potřebuješ zpracovatelskou smlouvu a písemné potvrzení, že data nepoužije k tréninku. Zajímá tě, jak dlouho si drží logy a kde fyzicky leží. A nakonec: pošli jen to, co je pro úlohu nutné, tedy ideálně e-mail bez podpisu, telefonu a čísla smlouvy.
- Že musíš vymazat svoje kopie a spolehnout se na smluvní závazek poskytovatele u těch jeho. Ve svých systémech smažeš vstupy, výstupy i logy. U poskytovatele nemáš technickou kontrolu, proto je klíčové mít smluvně ošetřenou retenci a nepoužívání k tréninku. A hlavní důvod, proč se citlivá data pseudonymizují ještě před odesláním: co neodešlo, se nemusí mazat.
Shrnutí
- Odeslání do API = předání dat třetí straně; musí to být vědomé a smluvně ošetřené.
- Posílej minimum, citlivé údaje pseudonymizuj.
- Největší riziko bývá ve vlastních logách, odděl je, maskuj a maž.
- Když data nesmí ven, sáhni po lokálním modelu, případně jen na citlivou část.
Chceš do promptu poslat zákaznický profil, aby model napsal personalizovanou odpověď. Co uděláš?
Pošleš jen údaje nutné k té odpovědi, ideálně pseudonymizované (jméno a kontakty nahradíš zástupkami a po vygenerování je dosadíš zpět). Kompletní profil nemá důvod opustit tvůj systém.
Poskytovatel garantuje, že data nepoužívá k tréninku. Znamená to, že je vše v pořádku?
Ne. Data k němu stále putují a nějakou dobu je drží v logách, takže je potřeba ošetřit smluvně (zpracovatelské podmínky), vybrat vhodný region a hlavně pořád platí minimalizace, posílat jen to, co je nezbytné.
Kde nejčastěji uniknou data při práci s LLM?
Ve vlastních logách. Prompty se logují kvůli ladění a skončí v systému, ke kterému má přístup mnohem víc lidí než k původní databázi. Proto se logy s prompty oddělují, maskují a mají krátkou retenci.
