OpenAI tvrdí, že GPT‑6 Astra dokáže ovládat prohlížeč, testovat web a spouštět frontendové QA kontroly. První veřejná zkušenost ukazuje, že to není jen teoretická možnost: model téměř dvě hodiny samostatně procházel webovou aplikaci v Chromu a našel problémy, které vývojářskému týmu unikly.
Zní to jako příchod automatického testera. Důkazy jsou ale zatím podstatně slabší než titulek.
Neznáme počet nalezených chyb, plané poplachy, přehlédnuté problémy ani cenu testu. Nemáme veřejný QA report a pokus neproběhl podle předem zveřejněné metodiky.
Tento článek není vlastním testem Kodo.Vychází z veřejně popsaného pokusu Claire Vo na aplikaci ChatPRD, z kvantifikovaných testů kontroly zdrojového kódu a z oficiálních tvrzení OpenAI. U každého zdroje oddělujeme, co bylo skutečně provedeno, od toho, co zatím pouze slibuje výrobce.
Co OpenAI o kontrole webu slibuje
OpenAI při představení GPT‑6 Astra uvedlo, že model může vytvořit web a potom spustit frontendové QA kontroly, aby ověřil funkčnost jeho prvků. Astra má také umět ovládat počítač, instalovat a testovat software a řešit problémy, které vidí na obrazovce.
To je důležitý posun. Běžný jazykový model může navrhnout testovací scénář nebo přečíst zdrojový kód. Agent s přístupem k prohlížeči může úkol také provést:
- otevřít testovací verzi webu,
- klikat na prvky,
- vyplňovat formuláře,
- měnit velikost okna,
- obnovovat stránku,
- sledovat chybové hlášky,
- kontrolovat konzoli vývojáře,
- opakovat stejný scénář s různými vstupy,
- připravit seznam nálezů.
Oficiální ukázka ale není nezávislý důkaz spolehlivosti. OpenAI přímo upozorňuje, že zveřejněná videa jsou sestříhané výňatky z delších běhů. Z ukázky proto nezjistíme, kolikrát se model ztratil, kolik potřeboval zásahů ani co přehlédl.
Claire Vo nechala Astru 105 minut testovat ChatPRD
Nejkonkrétnější veřejnou zkušenost popsala Claire Vo, zakladatelka produktové aplikace ChatPRD a autorka pořadu How I AI.
Její tým pracoval na stabilizaci chatovací části aplikace a řešil obtížně reprodukovatelné souběhy událostí. Po nasazení změny do náhledové větve zadala Astře jednoduchý úkol:
„Can you just, like, test this in Chrome?“
Volně přeloženo: „Můžeš to prostě otestovat v Chromu?“
Podle jejího popisu model otevřel náhledovou verzi aplikace a pracoval přibližně hodinu a 45 minut. Procházel rozhraní, odesílal zprávy v chatu, obnovoval stránku a kontroloval konzoli vývojáře kvůli chybovým záznamům.
Vo uvedla, že Astra našla několik problémů, které jejich tým přehlédl. Právě v tom je pokus zajímavý: model nečetl pouze zadání ani nevytvářel seznam obecných doporučení. Skutečně používal aplikaci a opakoval úkony, které by byly pro člověka zdlouhavé.
Co tento pokus dokazuje
Z veřejného popisu lze bezpečně vyvodit tři věci.
Astra vydrží u delší práce v prohlížeči
Běh trval 105 minut. Model tedy nezvládl jen krátké klikací demo, ale delší sled opakovaných činností.
Umí kombinovat uživatelské a technické signály
Astra pracovala s viditelným rozhraním a současně sledovala konzoli vývojáře. To je užitečné, protože některé chyby se uživateli projeví pouze zpomalením nebo nejasným chováním, zatímco technická příčina se objeví v logu.
Může najít problém, který týmu unikl
Podle autorky model označil několik přehlédnutých problémů. To podporuje využití AI jako dalšího kontrolního pohledu po práci vývojářů.
Pokus ale nedokazuje, že Astra web zkontrolovala úplně nebo spolehlivě.
Co naopak stále nevíme
Claire Vo nezveřejnila plný testovací protokol ani výsledný report. Veřejně tedy neznáme:
| Otázka | Dostupný údaj |
|---|---|
| Kolik problémů Astra označila? | Pouze „několik“ |
| Kolik nálezů tým potvrdil jako skutečné chyby? | Neuvedeno |
| Kolik připomínek byly plané poplachy? | Neuvedeno |
| Kolik známých chyb Astra přehlédla? | Neuvedeno |
| Kolikrát musel člověk zasáhnout? | Neuvedeno |
| Jaké přesné nástroje a oprávnění model dostal? | Neuvedeno |
| Kolik test spotřeboval tokenů? | Neuvedeno |
| Kolik celý běh stál? | Neuvedeno |
| Šel by výsledek zopakovat na jiné aplikaci? | Neověřeno |
To není kritika autorky. Nešlo o vědecký benchmark, ale o praktickou zkušenost při vývoji vlastního produktu. Pro firemní rozhodnutí však právě tyto chybějící údaje rozhodují.
„Model našel několik problémů“ není totéž jako „model provedl spolehlivý audit webu“.Bez ručního kontrolního seznamu nevíme, co Astra přehlédla. Bez ověření nálezů neznáme přesnost. A bez ceny celého běhu nelze určit návratnost.
Kontrola webu a kontrola kódu nejsou stejná disciplína
Do hodnocení Astry se často přidávají výsledky code review. Jsou relevantní, ale nesmějí se vydávat za test webu v prohlížeči.
Kontrola zdrojového kódu hledá například:
- chybnou podmínku,
- problém s časovým pásmem,
- nezabezpečenou cestu,
- chybějící ošetření výjimky,
- konflikt mezi několika soubory.
Kontrola živého webu ověřuje jiné věci:
- zda uživatel dokončí formulář,
- zda navigace vede na správnou stránku,
- zda je prvek viditelný na mobilu,
- zda se po chybě zobrazí srozumitelná zpráva,
- zda se nákupní nebo přihlašovací cesta nezastaví,
- zda skutečné chování odpovídá zadání.
Silný agent by měl postupně spojit obě vrstvy: najít problém v prohlížeči, dohledat jeho příčinu v kódu a po opravě znovu provést test. Veřejné výsledky ale zatím potvrzují každou část odděleně lépe než celý uzavřený proces.
Kvantifikovaný test paddo.dev: sedm skutečných nálezů v kódu
Autor vývojářského blogu paddo.dev otestoval Astru na kódu, který plánuje publikaci článků. Zadání bylo pouze pro čtení: model měl najít cokoli, co by mohlo předčasně zveřejnit budoucí článek nebo naopak skrýt již publikovaný text.
Stejný úkol proběhl při různých úrovních uvažování:
| Režim | Čas | Vykázaná spotřeba | Cena podle API ceníku | Nálezy |
|---|---|---|---|---|
| Low | 60 sekund | 1 118 tokenů | 0,48 USD | 5 |
| Vyšší režim | 135 sekund | 3 159 tokenů | 1,00 USD | 5 |
| Max | 446 sekund | 11 299 tokenů | 2,06 USD | 7 |
Autor uvedl, že všech sedm nálezů bylo skutečných. Maximální režim přidal dva další problémy a lépe seřadil jejich závažnost. Zároveň sám upozornil na omezení: šlo o jeden úkol, jeden repozitář a kontrolu hodnotil člověk, který vlastní kód dobře znal.
Pro webové QA je výsledek povzbudivý, ale nepřenosný jedna ku jedné. Astra zde neklikala v prohlížeči, nevyplňovala formuláře a nekontrolovala responzivitu. Četla zdrojový kód.
CodeRabbit vidí největší rozdíl u složitějších změn
Společnost CodeRabbit porovnala Astru s dalšími modely při code review. Podle jejího prvního hodnocení našla Astra prostřednictvím použitelných připomínek přibližně o čtyři procenta více označených chyb než GPT‑5.6 Sol a o 22 procent více než Opus 5.
U složitějších kontrol napříč více soubory byl rozdíl větší: proti Solu přibližně 20 procent a proti Opusu 5 asi 33 procent.
Ani tato čísla neříkají, kolik chyb Astra najde na konkrétním webu. CodeRabbit výslovně označuje výsledek za časný a orientační. Ukazuje však oblast, ve které může silnější model dávat ekonomický smysl: složitou kontrolu souvislostí, které jsou rozdělené mezi více částí projektu.
Benchmark ovládání počítače není test kvality webu
Astra dosahuje silných výsledků v benchmarcích pro práci s počítačem a rozpoznání prvků na obrazovce. Takový benchmark může ověřit, zda model najde správné tlačítko, vybere položku nebo dokončí určený úkol.
Neodpovídá ale automaticky na otázku, zda model pozná, že:
- text tlačítka je nesrozumitelný,
- kontaktní formulář neposílá potvrzení,
- mobilní menu překrývá obsah,
- důležitá stránka nemá správný titulek,
- validace přijme nesprávný údaj,
- uživatelská cesta sice technicky funguje, ale nedává smysl.
Schopnost ovládat prohlížeč je podmínkou pro autonomní QA. Není důkazem kvality výsledného auditu.
Může Astra nahradit testera
Z dostupných výsledků zatím ne.
Může ale převzít část práce, která je pro člověka únavná a drahá:
- opakování stejného scénáře s různými vstupy,
- proklikání více variant navigace,
- obnovování stránky v rizikových okamžicích,
- kontrolu technických logů během používání aplikace,
- dokumentaci postupu,
- přípravu prvního seznamu nálezů,
- opakovaný test po opravě.
Člověk stále určuje rozsah, připravuje známé testovací případy, ověřuje nálezy a rozhoduje, zda je chování opravdu chyba. Důležitý je také kontext: model nemusí pochopit, že technicky funkční krok odporuje obchodnímu pravidlu nebo potřebám konkrétní skupiny zákazníků.
Nejrealističtější role Astry dnes není „samostatný QA tým“. Je to vytrvalý pomocník, který provede objem rutinních kontrol a předá člověku problémy k potvrzení.
Jak by měl vypadat poctivý firemní test
Firma by neměla model pustit na web s obecným pokynem „najdi chyby“ a potom počítat délku reportu. Potřebuje porovnání s výsledkem, který zná.
1. Připravte bezpečné prostředí
Použijte testovací nebo náhledovou verzi. Agent by neměl pracovat s reálnými platbami, osobními údaji zákazníků ani možností měnit produkční data.
2. Vytvořte ruční kontrolní seznam
Zapište známé scénáře: navigaci, formuláře, přihlášení, košík, mobilní zobrazení, chybové stavy, texty a metadata. Bez tohoto seznamu nezměříte pokrytí.
3. Vložte známé chyby
Do bezpečné kopie úmyslně připravte několik problémů různých typů. Potom lze spočítat, kolik z nich model našel.
4. Přesně určete oprávnění
Pro první test stačí čtení, klikání a vytvoření reportu. Opravy kódu, mazání dat nebo publikování změn mají vyžadovat samostatné schválení.
5. Měřte celý dokončený úkol
Zapisujte čas modelu i člověka, počet zásahů, spotřebu, cenu, potvrzené chyby, plané poplachy a přehlédnuté problémy.
6. Test zopakujte
Jeden povedený běh může být náhoda. Stejné zadání spusťte na dalším webu a po čase znovu na první aplikaci.
Metriky, které mají smysl
| Metrika | Praktický význam |
|---|---|
| Dokončení | Prošel model celý zadaný rozsah? |
| Pokrytí | Kolik známých chyb zachytil? |
| Přesnost | Kolik označených nálezů byly skutečné chyby? |
| Plané poplachy | Kolik času zabralo ověřování zbytečných připomínek? |
| Lidské zásahy | Kolikrát bylo nutné model znovu nasměrovat? |
| Čas k reportu | Jak dlouho trval použitelný výsledek včetně kontroly? |
| Cena | Kolik stál celý běh, ne pouze jedna odpověď? |
| Riziko | Pokusil se agent provést něco mimo povolený rozsah? |
Právě tyto hodnoty ve zveřejněném testu ChatPRD chybějí. Dokud je někdo nezměří, nelze Astru označit za ověřenou náhradu klasického QA.
Kde může být přínos už dnes
Největší smysl může mít Astra u webových aplikací, které:
- mají hodně opakovaných uživatelských scénářů,
- často vydávají nové verze,
- obsahují chyby závislé na pořadí kroků,
- potřebují kombinovat pohled na obrazovku a technické logy,
- mají bezpečnou testovací kopii,
- dokážou každý nález rychle ověřit.
U jednoduchého prezentačního webu může stejnou práci levněji zvládnout běžný crawler, automatické testy nebo slabší model. Nejsilnější model není automaticky nejvýhodnější.
Ekonomika se nepočítá podle ceny jedné odpovědi. Rozhoduje, zda agent ušetří čas testera, najde drahou chybu před zákazníkem a nezahltí tým falešnými nálezy.
Verdikt
První veřejná zkušenost Claire Vo ukazuje, že GPT‑6 Astra dokáže více než vytvořit seznam doporučení. Model 105 minut používal webovou aplikaci v Chromu, opakoval testovací kroky, sledoval konzoli a podle autorky našel několik problémů, které tým přehlédl.
To je zajímavý signál, nikoli definitivní důkaz.
Veřejně stále chybí reprodukovatelný test, který by porovnal Astru s ruční kontrolou, zveřejnil známé chyby, přesnost, plané poplachy, lidské zásahy a cenu. Kvantifikované výsledky zatím máme hlavně z kontroly zdrojového kódu, což je související, ale odlišná disciplína.
Firmy proto nemusí čekat, až bude vše dokonale změřené. Mohou Astru otestovat na bezpečné kopii vlastního webu. Neměly by ale zaměnit působivou autonomní ukázku za hotovou náhradu QA procesu.
Astra dnes vypadá jako schopný pomocník pro opakované testování webu. Ověřeným autonomním kontrolorem se stane teprve tehdy, až dokáže stejný výsledek spolehlivě opakovat a někdo zveřejní i to, co přehlédla.
Jak s testováním a automatizací pomáhá Kodo
V Kodo pomáháme firmám vybrat úlohy, na kterých lze AI modely férově porovnat. Připravíme testovací scénáře, hranice oprávnění a metriky, podle kterých se rozhodne, zda automatizace skutečně šetří práci.
U webů můžeme propojit automatické technické kontroly, práci AI agenta a lidské ověření do jednoho opakovatelného procesu.
Související články
- První zkušenosti s GPT-6 Astra: silný model, který má stále své mouchy
- GPT-6 Astra: co umí, kolik stojí a kdy bude dostupná v ChatGPT
- GPT-6 Astra vs. GPT-5.6 Sol: který model vybrat
- OpenAI Astra a bezpečné nasazení AI agentů
- Jak poznat proces, který se vyplatí automatizovat
Zdroje
- Claire Vo / ChatPRD — GPT-6 Astra Review: Automated QA
- OpenAI — GPT-6 Astra: A new generation of intelligence
- paddo.dev — GPT-6 Astra effort-level code-review test
- CodeRabbit — GPT-6 Astra code-review evaluation
- Lenny’s Newsletter — shrnutí zkušeností Claire Vo s GPT-6 Astra
Stav veřejných zdrojů a výsledků ověřen k 9. září 2026. Test aplikace ChatPRD provedla Claire Vo; Kodo tento test neprovádělo.
