Firma může mít pravidlo, že interní dokumenty neopouštějí její síť. Přesto se může stát, že při nasazení AI vzniknou kopie, indexy, logy nebo zálohy u dalších poskytovatelů. Nestačí proto vědět, kde leží původní soubor. Je potřeba sledovat celou cestu dat od nahrání dokumentu až po výslednou odpověď.
To platí pro smlouvy, směrnice, technickou dokumentaci, nabídky, osobní údaje i interní know-how.
Otázka není jen „Kde máme dokument?“, ale také „Kdo z něj vytváří index, kam se posílá dotaz, co se ukládá do logů a kdo vidí výslednou odpověď?“
Jak AI s dokumenty obvykle pracuje
Při běžném nasazení se dokumenty nejprve načtou a připraví pro vyhledávání. Systém je rozdělí na menší části, vytvoří vyhledávací index a při dotazu najde relevantní pasáže. Ty následně předá jazykovému modelu, který sestaví odpověď.
Zjednodušeně:
- dokument se načte ze zdroje,
- text se zpracuje a rozdělí,
- vznikne vyhledávací index,
- uživatel položí otázku,
- systém vybere relevantní části,
- model z nich vytvoří odpověď,
- aplikace může uložit dotaz, odpověď nebo technický log.
Každý z těchto kroků může běžet lokálně, v soukromém prostředí nebo u externí služby. Odpověď „dokumenty máme na vlastním disku“ proto sama nestačí.
Které kopie a stopy mohou vzniknout
Původní soubor
Zdroj může být na interním disku, v dokumentovém systému, cloudovém úložišti nebo e-mailu. AI by měla získat pouze takový přístup, který skutečně potřebuje.
Zpracovaný text
Při načtení může vzniknout textová kopie, náhled nebo dočasný soubor. Je potřeba vědět, kde se ukládá a kdy se maže.
Vyhledávací index
Index umožňuje rychle najít relevantní pasáže. Může obsahovat části původního textu nebo jejich matematické reprezentace. Ani tyto reprezentace nelze automaticky považovat za necitlivé.
Dotaz a vybrané pasáže
Když uživatel položí otázku, systém může modelu poslat nejen dotaz, ale i nalezené části dokumentu. Pokud model běží u externího poskytovatele, právě v tomto kroku mohou interní informace opustit firemní prostředí.
Historie chatu a logy
Aplikace může ukládat konverzace kvůli pohodlí, auditu nebo ladění. Technické logy někdy obsahují více informací, než firma očekává. Je proto potřeba určit, co se loguje, jak dlouho a kdo k tomu má přístup.
Zálohy
Lokální systém může mít šifrovanou zálohu mimo firmu. To může být rozumné, ale musí být jasné, kde záloha leží, kdo drží klíče a jak se ověřuje obnova.
Co může běžet kompletně lokálně
V lokálním řešení mohou uvnitř firemního prostředí běžet:
- načítání a převod dokumentů,
- vyhledávací index,
- databáze znalostí,
- jazykový model,
- uživatelské rozhraní,
- historie konverzací,
- logování,
- automatizační nástroje.
Takové nasazení snižuje potřebu posílat citlivý obsah externímu modelu. Neznamená však automaticky úplné soukromí. Server může používat vzdálenou správu, aktualizace, externí zálohu nebo další API. Každá taková cesta musí být popsaná.
Kdy může být cloud stále užitečný
Cloud není automaticky špatně. Může nabídnout výkonnější model, rychlé škálování nebo službu, kterou by bylo složité provozovat lokálně.
Důležité je rozhodnout:
- které typy dokumentů do něj smějí,
- zda se data používají pro další zlepšování služby,
- jak dlouho se uchovávají,
- kde se zpracovávají,
- kdo je smluvním zpracovatelem,
- zda má firma odpovídající tarif a smluvní podmínky,
- jestli lze citlivé části před odesláním odstranit.
Hybridní řešení může například zpracovat interní dokument lokálně a externímu modelu poslat pouze obecný, anonymizovaný úkol. To však musí zajišťovat technické pravidlo, ne pouhé očekávání, že si na to uživatel vždy vzpomene.
Oprávnění jsou stejně důležitá jako umístění serveru
Lokální server může být bezpečnější vůči externímu úniku, ale stále může zpřístupnit dokument nesprávnému zaměstnanci. AI nesmí obejít pravidla, která platí v původním systému.
Pokud účetní dokument vidí pouze finance, neměl by se jeho obsah objevit v odpovědi pro celou firmu. Správné řešení proto zohledňuje:
- identitu uživatele,
- jeho roli,
- oprávnění původního zdroje,
- klasifikaci dokumentu,
- povolený způsob použití,
- audit přístupů.
Společný chatbot s jednou společnou znalostní bází může být jednoduchý na ukázku, ale nebezpečný v produkčním provozu.
Sedm otázek pro dodavatele
Před nasazením se ptejte:
- Kde leží původní dokumenty a jejich zpracované kopie?
- Kde se vytváří a ukládá vyhledávací index?
- Který model dostává dotaz a nalezené pasáže?
- Co se ukládá do historie a technických logů?
- Jak systém respektuje oprávnění jednotlivých uživatelů?
- Kam se ukládají zálohy a kdo drží šifrovací klíče?
- Které externí služby jsou nezbytné a které lze vypnout?
Odpovědi by měly být konkrétní. Věta „řešení je bezpečné“ nenahrazuje popis datového toku.
Praktický model rozdělení dokumentů
Ne všechny informace potřebují stejný režim. Firma si může vytvořit například tři úrovně:
Obecné firemní informace
Veřejné produktové podklady, návody a obsah webu lze často používat s menším omezením.
Interní provozní informace
Směrnice, zápisy, nabídky nebo projektová dokumentace vyžadují přihlášení, role a řízené uchování.
Citlivé a regulované informace
Osobní údaje, právní dokumenty, zdravotní informace nebo obchodní tajemství mohou vyžadovat kompletně lokální zpracování, zvláštní schválení nebo vyloučení z AI systému.
Toto rozdělení pomůže rozhodnout, zda firma potřebuje čistě lokální, cloudové, nebo hybridní řešení.
Kdy vlastní AI server dává největší smysl
Lokální prostředí je přirozeným kandidátem, pokud firma:
- pravidelně pracuje s citlivými interními dokumenty,
- potřebuje řídit přístup podle rolí,
- chce mít pod kontrolou indexy, historii a logy,
- potřebuje propojit více interních zdrojů,
- nechce být u klíčového procesu závislá pouze na jednom externím modelu.
Nejdřív je ale potřeba zmapovat zdroje a datový tok. Server bez správných oprávnění, pravidel a správy může pouze přesunout problém na jiné místo.
Jak postupujeme při návrhu
U firemního AI řešení nejprve určujeme:
- zdroje dokumentů,
- jejich citlivost a vlastníky,
- skupiny uživatelů,
- požadované otázky a úlohy,
- povolené modely a služby,
- dobu uchování,
- zálohy, logování a odpovědnost.
Teprve potom dává smysl vybírat konkrétní model, server a aplikaci.
Kodo navrhuje AI servery pro firmy jako celé řešení, ne pouze jako hardware. Pokud chcete zjistit, kudy by při práci s AI procházely vaše dokumenty, můžeme nejprve připravit mapu dat a bezpečný pilot.
