Automatizace9. září 2026

GPT-6 Astra jako kontrolor webu: co ukázal první veřejný test a co stále nevíme

GPT-6 Astra už někdo nechal téměř dvě hodiny procházet webovou aplikaci v Chromu. Model našel několik přehlédnutých problémů, ale veřejné testy zatím neukazují přesnost, počet planých poplachů ani skutečnou cenu webové kontroly.

P

Predrag Pavič

Autor

Sdílet:

OpenAI tvrdí, že GPT‑6 Astra dokáže ovládat prohlížeč, testovat web a spouštět frontendové QA kontroly. První veřejná zkušenost ukazuje, že to není jen teoretická možnost: model téměř dvě hodiny samostatně procházel webovou aplikaci v Chromu a našel problémy, které vývojářskému týmu unikly.

Zní to jako příchod automatického testera. Důkazy jsou ale zatím podstatně slabší než titulek.

Neznáme počet nalezených chyb, plané poplachy, přehlédnuté problémy ani cenu testu. Nemáme veřejný QA report a pokus neproběhl podle předem zveřejněné metodiky.

Tento článek není vlastním testem Kodo.

Vychází z veřejně popsaného pokusu Claire Vo na aplikaci ChatPRD, z kvantifikovaných testů kontroly zdrojového kódu a z oficiálních tvrzení OpenAI. U každého zdroje oddělujeme, co bylo skutečně provedeno, od toho, co zatím pouze slibuje výrobce.

Co OpenAI o kontrole webu slibuje

OpenAI při představení GPT‑6 Astra uvedlo, že model může vytvořit web a potom spustit frontendové QA kontroly, aby ověřil funkčnost jeho prvků. Astra má také umět ovládat počítač, instalovat a testovat software a řešit problémy, které vidí na obrazovce.

To je důležitý posun. Běžný jazykový model může navrhnout testovací scénář nebo přečíst zdrojový kód. Agent s přístupem k prohlížeči může úkol také provést:

  • otevřít testovací verzi webu,
  • klikat na prvky,
  • vyplňovat formuláře,
  • měnit velikost okna,
  • obnovovat stránku,
  • sledovat chybové hlášky,
  • kontrolovat konzoli vývojáře,
  • opakovat stejný scénář s různými vstupy,
  • připravit seznam nálezů.

Oficiální ukázka ale není nezávislý důkaz spolehlivosti. OpenAI přímo upozorňuje, že zveřejněná videa jsou sestříhané výňatky z delších běhů. Z ukázky proto nezjistíme, kolikrát se model ztratil, kolik potřeboval zásahů ani co přehlédl.

Claire Vo nechala Astru 105 minut testovat ChatPRD

Nejkonkrétnější veřejnou zkušenost popsala Claire Vo, zakladatelka produktové aplikace ChatPRD a autorka pořadu How I AI.

Její tým pracoval na stabilizaci chatovací části aplikace a řešil obtížně reprodukovatelné souběhy událostí. Po nasazení změny do náhledové větve zadala Astře jednoduchý úkol:

„Can you just, like, test this in Chrome?“

Volně přeloženo: „Můžeš to prostě otestovat v Chromu?“

Podle jejího popisu model otevřel náhledovou verzi aplikace a pracoval přibližně hodinu a 45 minut. Procházel rozhraní, odesílal zprávy v chatu, obnovoval stránku a kontroloval konzoli vývojáře kvůli chybovým záznamům.

Vo uvedla, že Astra našla několik problémů, které jejich tým přehlédl. Právě v tom je pokus zajímavý: model nečetl pouze zadání ani nevytvářel seznam obecných doporučení. Skutečně používal aplikaci a opakoval úkony, které by byly pro člověka zdlouhavé.

Co tento pokus dokazuje

Z veřejného popisu lze bezpečně vyvodit tři věci.

Astra vydrží u delší práce v prohlížeči

Běh trval 105 minut. Model tedy nezvládl jen krátké klikací demo, ale delší sled opakovaných činností.

Umí kombinovat uživatelské a technické signály

Astra pracovala s viditelným rozhraním a současně sledovala konzoli vývojáře. To je užitečné, protože některé chyby se uživateli projeví pouze zpomalením nebo nejasným chováním, zatímco technická příčina se objeví v logu.

Může najít problém, který týmu unikl

Podle autorky model označil několik přehlédnutých problémů. To podporuje využití AI jako dalšího kontrolního pohledu po práci vývojářů.

Pokus ale nedokazuje, že Astra web zkontrolovala úplně nebo spolehlivě.

Co naopak stále nevíme

Claire Vo nezveřejnila plný testovací protokol ani výsledný report. Veřejně tedy neznáme:

OtázkaDostupný údaj
Kolik problémů Astra označila?Pouze „několik“
Kolik nálezů tým potvrdil jako skutečné chyby?Neuvedeno
Kolik připomínek byly plané poplachy?Neuvedeno
Kolik známých chyb Astra přehlédla?Neuvedeno
Kolikrát musel člověk zasáhnout?Neuvedeno
Jaké přesné nástroje a oprávnění model dostal?Neuvedeno
Kolik test spotřeboval tokenů?Neuvedeno
Kolik celý běh stál?Neuvedeno
Šel by výsledek zopakovat na jiné aplikaci?Neověřeno

To není kritika autorky. Nešlo o vědecký benchmark, ale o praktickou zkušenost při vývoji vlastního produktu. Pro firemní rozhodnutí však právě tyto chybějící údaje rozhodují.

„Model našel několik problémů“ není totéž jako „model provedl spolehlivý audit webu“.

Bez ručního kontrolního seznamu nevíme, co Astra přehlédla. Bez ověření nálezů neznáme přesnost. A bez ceny celého běhu nelze určit návratnost.

Kontrola webu a kontrola kódu nejsou stejná disciplína

Do hodnocení Astry se často přidávají výsledky code review. Jsou relevantní, ale nesmějí se vydávat za test webu v prohlížeči.

Kontrola zdrojového kódu hledá například:

  • chybnou podmínku,
  • problém s časovým pásmem,
  • nezabezpečenou cestu,
  • chybějící ošetření výjimky,
  • konflikt mezi několika soubory.

Kontrola živého webu ověřuje jiné věci:

  • zda uživatel dokončí formulář,
  • zda navigace vede na správnou stránku,
  • zda je prvek viditelný na mobilu,
  • zda se po chybě zobrazí srozumitelná zpráva,
  • zda se nákupní nebo přihlašovací cesta nezastaví,
  • zda skutečné chování odpovídá zadání.

Silný agent by měl postupně spojit obě vrstvy: najít problém v prohlížeči, dohledat jeho příčinu v kódu a po opravě znovu provést test. Veřejné výsledky ale zatím potvrzují každou část odděleně lépe než celý uzavřený proces.

Kvantifikovaný test paddo.dev: sedm skutečných nálezů v kódu

Autor vývojářského blogu paddo.dev otestoval Astru na kódu, který plánuje publikaci článků. Zadání bylo pouze pro čtení: model měl najít cokoli, co by mohlo předčasně zveřejnit budoucí článek nebo naopak skrýt již publikovaný text.

Stejný úkol proběhl při různých úrovních uvažování:

RežimČasVykázaná spotřebaCena podle API ceníkuNálezy
Low60 sekund1 118 tokenů0,48 USD5
Vyšší režim135 sekund3 159 tokenů1,00 USD5
Max446 sekund11 299 tokenů2,06 USD7

Autor uvedl, že všech sedm nálezů bylo skutečných. Maximální režim přidal dva další problémy a lépe seřadil jejich závažnost. Zároveň sám upozornil na omezení: šlo o jeden úkol, jeden repozitář a kontrolu hodnotil člověk, který vlastní kód dobře znal.

Pro webové QA je výsledek povzbudivý, ale nepřenosný jedna ku jedné. Astra zde neklikala v prohlížeči, nevyplňovala formuláře a nekontrolovala responzivitu. Četla zdrojový kód.

CodeRabbit vidí největší rozdíl u složitějších změn

Společnost CodeRabbit porovnala Astru s dalšími modely při code review. Podle jejího prvního hodnocení našla Astra prostřednictvím použitelných připomínek přibližně o čtyři procenta více označených chyb než GPT‑5.6 Sol a o 22 procent více než Opus 5.

U složitějších kontrol napříč více soubory byl rozdíl větší: proti Solu přibližně 20 procent a proti Opusu 5 asi 33 procent.

Ani tato čísla neříkají, kolik chyb Astra najde na konkrétním webu. CodeRabbit výslovně označuje výsledek za časný a orientační. Ukazuje však oblast, ve které může silnější model dávat ekonomický smysl: složitou kontrolu souvislostí, které jsou rozdělené mezi více částí projektu.

Benchmark ovládání počítače není test kvality webu

Astra dosahuje silných výsledků v benchmarcích pro práci s počítačem a rozpoznání prvků na obrazovce. Takový benchmark může ověřit, zda model najde správné tlačítko, vybere položku nebo dokončí určený úkol.

Neodpovídá ale automaticky na otázku, zda model pozná, že:

  • text tlačítka je nesrozumitelný,
  • kontaktní formulář neposílá potvrzení,
  • mobilní menu překrývá obsah,
  • důležitá stránka nemá správný titulek,
  • validace přijme nesprávný údaj,
  • uživatelská cesta sice technicky funguje, ale nedává smysl.

Schopnost ovládat prohlížeč je podmínkou pro autonomní QA. Není důkazem kvality výsledného auditu.

Může Astra nahradit testera

Z dostupných výsledků zatím ne.

Může ale převzít část práce, která je pro člověka únavná a drahá:

  • opakování stejného scénáře s různými vstupy,
  • proklikání více variant navigace,
  • obnovování stránky v rizikových okamžicích,
  • kontrolu technických logů během používání aplikace,
  • dokumentaci postupu,
  • přípravu prvního seznamu nálezů,
  • opakovaný test po opravě.

Člověk stále určuje rozsah, připravuje známé testovací případy, ověřuje nálezy a rozhoduje, zda je chování opravdu chyba. Důležitý je také kontext: model nemusí pochopit, že technicky funkční krok odporuje obchodnímu pravidlu nebo potřebám konkrétní skupiny zákazníků.

Nejrealističtější role Astry dnes není „samostatný QA tým“. Je to vytrvalý pomocník, který provede objem rutinních kontrol a předá člověku problémy k potvrzení.

Jak by měl vypadat poctivý firemní test

Firma by neměla model pustit na web s obecným pokynem „najdi chyby“ a potom počítat délku reportu. Potřebuje porovnání s výsledkem, který zná.

1. Připravte bezpečné prostředí

Použijte testovací nebo náhledovou verzi. Agent by neměl pracovat s reálnými platbami, osobními údaji zákazníků ani možností měnit produkční data.

2. Vytvořte ruční kontrolní seznam

Zapište známé scénáře: navigaci, formuláře, přihlášení, košík, mobilní zobrazení, chybové stavy, texty a metadata. Bez tohoto seznamu nezměříte pokrytí.

3. Vložte známé chyby

Do bezpečné kopie úmyslně připravte několik problémů různých typů. Potom lze spočítat, kolik z nich model našel.

4. Přesně určete oprávnění

Pro první test stačí čtení, klikání a vytvoření reportu. Opravy kódu, mazání dat nebo publikování změn mají vyžadovat samostatné schválení.

5. Měřte celý dokončený úkol

Zapisujte čas modelu i člověka, počet zásahů, spotřebu, cenu, potvrzené chyby, plané poplachy a přehlédnuté problémy.

6. Test zopakujte

Jeden povedený běh může být náhoda. Stejné zadání spusťte na dalším webu a po čase znovu na první aplikaci.

Metriky, které mají smysl

MetrikaPraktický význam
DokončeníProšel model celý zadaný rozsah?
PokrytíKolik známých chyb zachytil?
PřesnostKolik označených nálezů byly skutečné chyby?
Plané poplachyKolik času zabralo ověřování zbytečných připomínek?
Lidské zásahyKolikrát bylo nutné model znovu nasměrovat?
Čas k reportuJak dlouho trval použitelný výsledek včetně kontroly?
CenaKolik stál celý běh, ne pouze jedna odpověď?
RizikoPokusil se agent provést něco mimo povolený rozsah?

Právě tyto hodnoty ve zveřejněném testu ChatPRD chybějí. Dokud je někdo nezměří, nelze Astru označit za ověřenou náhradu klasického QA.

Kde může být přínos už dnes

Největší smysl může mít Astra u webových aplikací, které:

  • mají hodně opakovaných uživatelských scénářů,
  • často vydávají nové verze,
  • obsahují chyby závislé na pořadí kroků,
  • potřebují kombinovat pohled na obrazovku a technické logy,
  • mají bezpečnou testovací kopii,
  • dokážou každý nález rychle ověřit.

U jednoduchého prezentačního webu může stejnou práci levněji zvládnout běžný crawler, automatické testy nebo slabší model. Nejsilnější model není automaticky nejvýhodnější.

Ekonomika se nepočítá podle ceny jedné odpovědi. Rozhoduje, zda agent ušetří čas testera, najde drahou chybu před zákazníkem a nezahltí tým falešnými nálezy.

Verdikt

První veřejná zkušenost Claire Vo ukazuje, že GPT‑6 Astra dokáže více než vytvořit seznam doporučení. Model 105 minut používal webovou aplikaci v Chromu, opakoval testovací kroky, sledoval konzoli a podle autorky našel několik problémů, které tým přehlédl.

To je zajímavý signál, nikoli definitivní důkaz.

Veřejně stále chybí reprodukovatelný test, který by porovnal Astru s ruční kontrolou, zveřejnil známé chyby, přesnost, plané poplachy, lidské zásahy a cenu. Kvantifikované výsledky zatím máme hlavně z kontroly zdrojového kódu, což je související, ale odlišná disciplína.

Firmy proto nemusí čekat, až bude vše dokonale změřené. Mohou Astru otestovat na bezpečné kopii vlastního webu. Neměly by ale zaměnit působivou autonomní ukázku za hotovou náhradu QA procesu.

Astra dnes vypadá jako schopný pomocník pro opakované testování webu. Ověřeným autonomním kontrolorem se stane teprve tehdy, až dokáže stejný výsledek spolehlivě opakovat a někdo zveřejní i to, co přehlédla.

Jak s testováním a automatizací pomáhá Kodo

V Kodo pomáháme firmám vybrat úlohy, na kterých lze AI modely férově porovnat. Připravíme testovací scénáře, hranice oprávnění a metriky, podle kterých se rozhodne, zda automatizace skutečně šetří práci.

U webů můžeme propojit automatické technické kontroly, práci AI agenta a lidské ověření do jednoho opakovatelného procesu.

Automatizace a AI

Kontaktovat Kodo

Související články

Zdroje

Stav veřejných zdrojů a výsledků ověřen k 9. září 2026. Test aplikace ChatPRD provedla Claire Vo; Kodo tento test neprovádělo.

Nebo zvolte téma

Nechtěli jste další článek? Přepněte se do jiné kategorie — nebo zůstaňte u Automatizace.

Záměr nebo nápad?

Máte konkrétní projekt? Napište nám.

Ať už řešíte web, focení, měření nebo automatizaci — ozvěte se. Domluvíme se na 30 minut a řekneme vám, jestli vám můžeme pomoct.

Napište nám

Technologické zázemí

Vybíráme technologie podle cíle projektu

Nejsme vázaní na jednu značku. Pro každý projekt vybíráme vhodné AI modely, automatizaci a infrastrukturu a propojujeme je do jednoho funkčního řešení.

AI, automatizace a vývoj

  • GoogleGoogle
  • ChatGPTChatGPT
  • ClaudeClaude
  • DeepSeekDeepSeek
  • LM StudioLM Studio
  • GitHubGitHub
  • n8nn8n
  • NotionNotion
  • VercelVercel
  • CloudflareCloudflare
  • MetaMeta

Hardware a AI servery

  • NVIDIANVIDIA
  • AMDAMD
  • ASUSASUS
  • LenovoLenovo
  • HPHP