Novinky24. srpna 2026

AI agenti žerou hlavně cache. Kde teď hledat úspory

Agenti spálí až pětkrát víc tokenů než lidé a víc než 85 procent nákladů tvoří cache. OpenAI zároveň zlevnilo Sol a přidalo přehled úspor z cache.

P

Predrag Pavič

Autor

Sdílet:

OpenAI 21. srpna 2026 zlevnilo vlajkový model GPT-5.6 Sol na 4 USD za milion vstupních a 20 USD za milion výstupních tokenů. Vstup klesl o 20 %, výstup o 33 %. Akční cena platí nejméně do 21. listopadu 2026.

Ve stejných dnech přibyl na platformě Prompt Caching dashboard: cache hit rate, čtení a zápis cache, reálné úspory.

To by byla jen další zpráva o ceníku. Důležitější je druhé číslo ze stejného týdne: agenti spálí skoro 5× víc tokenů než lidé a víc než 85 % těch tokenů je cachovaný prompt.

Levnější model tedy pomůže. Nejvíc ale pořád rozhoduje, jak dlouhý kontext agent tahá dokola.

Tento článek navazuje na GPT-5.6 zlevnilo až o 80 %: co to znamená pro firemní automatizace a Jak ušetřit na AI modelech.

Co se přesně změnilo u Solu

V červenci zlevnily Luna a Terra. Sol zůstal na 5 / 30 USD. Teď klesl i Sol.

Model GPT-5.6 SolPředtímTeď (od 21. 8. 2026)Změna
Vstup / 1M tokenů5 USD4 USD−20 %
Výstup / 1M tokenů30 USD20 USD−33 %

Zlevnění je oficiální. Platí do 21. 11. 2026 a uvidíme, jestli zůstane. Pro provoz to znamená nižší účet bez zásahu do kódu — pokud už voláte alias gpt-5.6 nebo gpt-5.6-sol.

Zdroj: OpenAI API Changelog

Proč samotné zlevnění nestačí

Data z newsletteru a16z Charts of the Week (21. 8., podklady OpenRouter / OpenAI / Similarweb) ukazují tři věci:

  1. Agenti spotřebují skoro 5× víc tokenů než lidé v chatu.
  2. Od února spotřeba agentů vyskočila 14×.
  3. Víc než 85 % tokenů agentů je cache — tedy opakovaný systémový prompt, návody, historie, nástroje.

Současně klesá návštěvnost webů klasických automatizačních platforem (n8n, Zapier, Make) o dvojciferná procenta, zatímco AI-native nástroje rostou. To není důvod platformu zahodit. Je to důvod přepočítat, kde platíte za opakování stejného zadání.

Zdroj: PPC Land – Agents burn 5x more tokens than humans

Čísla nepocházejí z našeho auditu. Jde o agregovaná data trhu. Směr je ale stejný, jaký vidíme u klientských workflow: účet neroste proto, že je model „drahý“. Roste proto, že agent dostane příliš dlouhý brief a opakuje ho pořád dokola.

Co z toho má majitel firmy

1) Levnější Sol neznamená pouštět ho na všechno

Sol má zůstat na těžké kusy: složité rozhodnutí, citlivý výstup, nejasné zadání. Rutina patří levnějšímu modelu.

2) Cache je teď viditelná

Dřív se úspory z cache spíš odhadovaly. Nový dashboard ukáže hit rate a kolik peněz cache reálně ušetřila. Když je hit rate nízký, platíte znovu za stejný návod.

3) Dlouhý prompt je tichý účet

Když do agenta strčíte celou příručku firmy, celou historii chatu a deset nástrojů „jen pro jistotu“, platíte to při každém kroku. I když je většina z toho v cache, pořád to nafukuje kontext a počet iterací.

Praktický příklad: odpovědi na poptávky

Špatně po zlevnění:

„Sol je levnější, tak na každý mail pouštíme Sol a dáváme mu celý katalog.“

Lépe:

  1. Levný model vytáhne typ poptávky, produkt a termín.
  2. Do dalšího kroku jde jen potřebný kus katalogu, ne celý ceník.
  3. Střední nebo silný model napíše návrh odpovědi.
  4. Člověk schválí jen výjimky.
  5. V dashboardu jednou týdně zkontrolujete cache hit rate u nejdražšího workflow.

Výsledek: méně tokenů, méně oprav, stejná kvalita tam, kde chyba bolí.

Co udělat tento týden

  1. Ověřit, že automatizace volají aktuální alias modelu, ne starý název.
  2. Otevřít nový Prompt Caching report u tří nejdražších workflow.
  3. Zapsat cache hit rate. Pod 50 % je důvod zkrátit systémový prompt.
  4. Oddělit rutinu od těžké práce — Sol nechat jen na těžkou.
  5. Spočítat cenu za hotový výsledek, ne cenu za milion tokenů.

Kdo už má přepínání modelů, má náskok. Zlevnění Solu je bonus. Pořádek v kontextu je úspora.

Jak to řešíme v Kodo

V Kodo bereme nové ceny jako důvod k auditu nákladů, ne k přepnutí všeho na nejdražší model.

Umíme:

  • změřit, kde workflow žere tokeny,
  • zkrátit kontext a zvednout využití cache,
  • přepínat levný / střední / silný model podle rizika,
  • nechat člověka ve smyčce jen u výjimek,
  • pohlídat, aby agent neměl víc práv, než potřebuje.

O bezpečném nasazení agentů jsme psali v OpenAI Astra a bezpečné nasazení AI agentů.

Ozvěte se, když chcete přepočítat konkrétní automatizaci.

Víc o službě: Automatizace pro firmy

Verdikt

Sol je levnější. To je dobrá zpráva. Horší zpráva je, že agenti pořád platí hlavně za opakovaný kontext.

Kdo zlevnění využije nejlíp?

  • ne ten, kdo jen přepne chat na Sol,
  • ale ten, kdo změří cache, zkrátí zadání a nechá drahý model jen na těžké kroky.

Související články

Zdroje

Nebo zvolte téma

Nechtěli jste další článek? Přepněte se do jiné kategorie — nebo zůstaňte u Novinky.

Záměr nebo nápad?

Máte konkrétní projekt? Napište nám.

Ať už řešíte web, focení, měření nebo automatizaci — ozvěte se. Domluvíme se na 30 minut a řekneme vám, jestli vám můžeme pomoct.

Napište nám

Nástroje a zdroje

Spolupracujeme a čerpáme inspiraci

Pracujeme s ověřenými platformami a AI nástroji — bereme z nich služby, data i inspiraci pro každodenní práci.