Největší bezpečnostní riziko AI agenta není to, že napíše špatnou odpověď. Je to okamžik, kdy dostane přístup k e-mailu, souborům, CRM nebo internímu systému a může nad nimi jednat rychleji, než člověk stihne jeho krok zkontrolovat.
Anthropic 10. září zveřejnil rozsáhlou zprávu o případech, které jeho tým mezi prosincem 2025 a srpnem 2026 odhalil a narušil. Popisuje pokusy zneužít modely Claude v kybernetických operacích, vlivových kampaních, sledování, podvodech, biologickém výzkumu, vývoji konvenčních zbraní a při nepovolené „destilaci“ schopností modelu.
Není to důkaz, že každý AI nástroj automaticky ohrožuje firmu. Report sám říká, že zveřejňuje výběr nejzávažnějších a nejnovějších případů, nikoli statisticky běžné používání. Je to ale velmi konkrétní důkaz, že útočníci už AI nevyužívají jen k napsání přesvědčivějšího e-mailu. Zkoušejí ji zapojit do celého pracovního řetězce: od vyhledání cíle přes přípravu infrastruktury až po vyhodnocení výsledků.
Pro firmy z toho plyne jednoduchá změna pohledu. Bezpečnost AI agentů nelze vyřešit jedním zákazem citlivých promptů. Musí se řídit podobně jako přístupy zaměstnanců, integrace mezi systémy a automatizace, které umějí něco skutečně provést.
Co Anthropic ve zprávě skutečně popisuje
Anthropic uvádí sedm oblastí zneužití. V každé firma popisuje aktivitu, kterou identifikovala, zasáhla proti ní a podle potřeby sdílela informace s úřady nebo partnery. Zapojené byly modely řady Haiku, Sonnet a Opus; report nemá být hodnocením běžných uživatelů Claude ani tvrzením, že modely samostatně prováděly celé operace bez člověka.
| Oblast | Co report popisuje | Co si z toho vzít ve firmě |
|---|---|---|
| Kybernetické operace | Pokusy využít AI v průzkumu, přípravě kampaní, práci s ukradenými daty a udržování přístupu | Agent s přístupem k systémům musí mít minimální nutná oprávnění a dohled nad každou akcí |
| Sledování a vlivové operace | Vytváření falešných person, zpráv a podkladů pro cílené působení | Výstupy AI nesmí automaticky odcházet ven bez odpovědného člověka a ověření původu |
| Podvody | Škálování věrohodné komunikace a falešných profilů | Je nutné ověřovat změny plateb, dodavatelů a citlivé žádosti jiným kanálem |
| Biologický a zbrojní kontext | Složitá odborná zadání, která se mohou tvářit jako legitimní výzkum | Bezpečnostní pravidla mají počítat i s odbornými obory a nákupními či výzkumnými workflow |
| Destilace modelů | Pokusy vytěžit odpovědi modelu pro trénink nebo napodobení jeho schopností | Firma má vědět, kam odcházejí prompty, logy a data přes externí routery či nástroje |
Nejdůležitější část pro běžnou firmu je kybernetická kapitola. Anthropic v ní popisuje aktéra, který zkoušel AI využívat při přípravě a provozu kampaní, například k hledání cílů, práci s nástroji a zpracování velkého objemu získaných dat. Člověk přitom zůstával v roli, která upravuje postup a směr práce.
To je podstatné rozlišení. Riziko nevzniká tím, že by model měl vlastní úmysl. Vzniká spojením schopného modelu, člověka se špatným záměrem, nástrojů a příliš širokých oprávnění.
Od špatného textu ke špatné akci
Je rozdíl mezi chatem a agentem.
Chat připraví návrh e-mailu nebo shrnutí dokumentu. Člověk si ho přečte a rozhodne, co s ním udělá. Agent může stejný e-mail odeslat, vyhledat zákazníka v CRM, stáhnout přílohy, změnit stav objednávky nebo spustit další automatizaci.
Každý z těchto kroků je sám o sobě užitečný. Riziko roste až jejich složením. Agent, který může číst e-mail, pracovat se soubory a posílat zprávy, nemusí nikam „hackovat“, aby způsobil problém. Stačí, aby špatně pochopil instrukci v dokumentu, naletěl podvrženému zadání nebo dostal příliš široké oprávnění.
Představte si tři běžné situace:
- AI asistent třídí e-maily a najde v přeposlané konverzaci instrukci, aby změnil bankovní účet dodavatele.
- Agent nad firemními dokumenty dostane přístup i k diskům, které pro jeho úkol nejsou potřeba, a zahrne citlivé údaje do exportu.
- Automatizace v CRM umí vytvářet slevové kupóny či měnit objednávky, ale nemá limit na hodnotu ani schválení druhého člověka.
Ani jedna z těchto situací nevyžaduje fantastický scénář z bezpečnostního reportu. Všechny vycházejí z obyčejného problému: nástroj umí udělat více, než skutečně potřebuje.
Oprávnění jsou důležitější než chytrost modelu
Firma nemá bezpečnostní otázku stavět jako „je tento model dost chytrý a bezpečný?“. Správnější otázka zní: „Co přesně může tento agent přečíst, změnit, odeslat nebo spustit — a kdo to uvidí?“
To vede k několika praktickým pravidlům.
1. Začněte jen se čtením
První verze agenta by měla pokud možno vyhledávat, třídit, navrhovat a vytvářet koncept výstupu. Neměla by bez potvrzení odesílat komunikaci, měnit data, publikovat obsah, rušit objednávky ani spouštět platby.
2. Rozdělte přístupy podle úlohy
Asistent, který připravuje nabídku, nepotřebuje přístup k celé účetní historii. Agent, který monitoruje zákaznické dotazy, nepotřebuje právo měnit ceny ani exportovat všechny kontakty. Každý samostatný účel má mít vlastní účet služby nebo token s omezeným rozsahem.
3. Nevěřte instrukcím zvenčí
Text v e-mailu, na webové stránce, v příloze nebo v nahraném dokumentu není automaticky pokyn pro agenta. Může jít o obsah, který má agent pouze číst a shrnout. Pravidla, podle kterých agent něco smí udělat, musí pocházet z důvěryhodně nastaveného workflow, ne z libovolného obsahu, který se mu zrovna zobrazí.
4. Zaveďte schválení tam, kde je škoda nevratná
Odeslání e-mailu jménem firmy, změna zákaznických dat, zveřejnění příspěvku, sleva nad stanovenou částku nebo export seznamu kontaktů mají mít jasný bod lidského potvrzení. Schválení nemusí znamenat návrat k ruční práci. Znamená, že člověk schvaluje omezený seznam akcí, které už agent připravil.
5. Ukládejte stopu, ne jen výsledek
Nestačí vědět, že agent vytvořil nabídku nebo přesunul objednávku. Potřebujete zjistit, z jakých zdrojů vycházel, jaké nástroje použil, s jakým oprávněním a kdo změnu schválil. Bez záznamu je velmi obtížné chybu vyšetřit i opravit.
Sedm otázek před prvním nasazením
Tento krátký kontrolní seznam často odhalí riziko dřív než dlouhá debata o konkrétním modelu.
- Jakou konkrétní práci má agent dělat a co do ní nepatří?
- K jakým zdrojům dat se dostane a které z nich může pouze číst?
- Jaké akce může provést bez člověka?
- Které akce musí vždy schválit konkrétní role?
- Jak se agent zachová, když narazí na nejasný nebo rozporný pokyn?
- Kde uvidíme historii jeho kroků, použitých nástrojů a změn?
- Jak rychle lze agentovi odebrat přístup, zastavit běh a ručně dokončit rozpracovanou práci?
Pokud na některou z těchto otázek není jasná odpověď, agent ještě není připravený na produkční provoz. To není důvod projekt zrušit. Je to důvod zmenšit jeho rozsah a začít bezpečným pilotem.
Co je na zprávě opravdu nové
Nejnovější report není první varování před phishingem nebo zneužitím generativní AI. Nové je měřítko a propojení činností. Anthropic popisuje případy, kde se AI objevuje v několika krocích téže práce: při výzkumu, tvorbě obsahu, technické přípravě, třídění dat a úpravě postupu.
Právě proto přestává stačit jednorázové školení „neposílejte do chatu hesla“. To pravidlo platí dál. Pro agentní systémy je ale potřeba doplnit další vrstvu: řízení identit, přístupů, nástrojů, finančních limitů a lidského schvalování.
Zpráva zároveň ukazuje, že poskytovatelé modelů mohou škodlivou aktivitu zachytit už ve fázi přípravy. To je cenná ochranná vrstva, nikoli náhrada za firemní nastavení. Poskytovatel nezná váš proces, obchodní hranice ani to, která změna v CRM je pro vás v pořádku a která už není.
Hlavní závěr
Anthropic popisuje reálné a narušené případy zneužití AI, ne běžné používání každého firemního asistenta. Zpráva proto není argumentem pro zákaz AI. Je argumentem pro dospělejší nasazení.
Firmy by měly posuzovat AI agenta podle jeho skutečných oprávnění a akcí, ne jen podle názvu modelu. Začněte úzkou úlohou, přístupem jen pro čtení, omezenými tokeny, záznamem kroků a lidským schválením nevratných akcí. Teprve když to funguje, má smysl přidávat další systémy a větší samostatnost.
Jak s bezpečným nasazením AI pomáhá Kodo
V Kodo pomáháme firmám najít procesy, které má smysl automatizovat, a nastavit je tak, aby AI měla jen nezbytné přístupy. Navrhujeme pilotní workflow, hranice oprávnění, lidská schválení i kontrolní záznamy, aby automatizace šetřila čas bez zbytečného provozního rizika.
Související články
- OpenAI Astra a bezpečné nasazení AI agentů: oprávnění, sandbox a lidské schválení
- CrowdStrike a OpenAI: proč se bezpečnost AI agentů stává samostatnou službou
- Firemní dokumenty v AI: co zůstává lokálně a co může odejít do cloudu
- Myslíte, že AI agent nahradí vaši asistentku? Zatím ani omylem
Zdroje
- Anthropic: Detecting and countering misuse of AI — September 2026
- Anthropic Threat Intelligence: přehled zveřejněných reportů
- NIST: AI Risk Management Framework
Článek vychází z veřejné zprávy Anthropic o vybraných případech, které firma identifikovala a narušila. Nejde o tvrzení, že každý AI nástroj nebo každý uživatel představuje stejné riziko.
