Text bez JavaScriptu: co ukázalo 80 českých domén
Roboti ChatGPT, Claude a Perplexity podle měření z prosince 2024 JavaScript stahovali, ale nespouštěli — pracovali s tím, co vrátí server. Novější veřejné měření nemám a chování se může změnit. Kolik textu jim tedy z českých webů zbude?
Vzal jsem stejných 80 domén jako u měření opt-outů — 33 médií a 47 e-shopů. U každé jednu stránku ze sitemapy: stáhl jsem ji prostým HTTP klientem, vykreslil v prohlížeči a hledal, jestli je hlavní text i v té serverové verzi.
| Krok | Počet |
|---|---|
| změřených domén | 80 |
| vyřazeno z měřicích důvodů | 14 |
| porovnatelných | 66 |
| hlavní text nalezen v serverovém HTML | 66 |
| prokazatelně chybějící hlavní text | 0 |
Co z toho plyne pro majitele webu
- Hlavní text bývá v serverovém HTML častěji, než tvrdí zkratkovité titulky o webech nečitelných pro AI. Aspoň v tomhle vzorku a aspoň u jedné stránky na doménu.
- Problém bývá jinde než v textu — v navigaci, v odlišné odpovědi serveru podle klienta, nebo ve špatně zvolené testovací stránce.
- Automatické vyhodnocení bez ruční kontroly je nespolehlivé. U mě vyrobilo 23 nálezů a pravý nebyl ani jeden.
Proč vypadlo 14 domén
Vyřazená doména není nečitelná doména. Je to případ, který jsem nezměřil — a proto ho nepočítám ani na jednu stranu.
| Důvod vyřazení | Počet |
|---|---|
| bez použitelné sitemapy | 4 |
| prohlížeč dostal míň textu než HTTP klient (narazil na zeď) | 4 |
| přesměrování jinam než na měřenou adresu | 2 |
| žádný odstavec delší než 120 znaků | 2 |
| chyba vykreslení nebo nedostupná stránka | 2 |
Kdybych těchhle 14 hodil mezi „nečitelné“, měl bych titulek o sedmnácti procentech českých webů. A byl by nepoctivý.
Proč automatika hlásí chybějící text falešně
Napoprvé jsem porovnával počty slov. Vyšly poměry přes 100 % — server posílal víc textu než prohlížeč. Metrika nedávala smysl.
Napodruhé jsem hledal v serverovém HTML nejdelší odstavec z vykreslené stránky. Patnáct z osmdesáti webů vyšlo jako „text chybí“. Ruční kontrola nepotvrdila ani jeden.
Napotřetí jsem přidal filtr na text lišty a chybové hlášky, kontrolu přesměrování a kontrolu, jestli prohlížeč vůbec dostal víc textu než HTTP klient. Zbylo osm z osmdesáti — a po ruční kontrole zase žádný pravý.
Kde bývá problém častěji než v hlavním textu
- Odkazy a navigace generované až JavaScriptem. Text na stránce je, ale robot se na ni nedostane, protože cestu k ní dokresluje prohlížeč.
- Různé HTML pro různé klienty. Server může odpovídat jinak podle User-Agentu, cookies, geolokace nebo ochrany proti robotům.
- Špatně zvolená testovací stránka. Homepage, kategorie a článek se chovají různě; test na jedné z nich nevypovídá o zbytku.
- Chyba měření. Nejčastější „nález“ ze všech — a ten se pozná jen tak, že se na něj člověk podívá.
Jak si to ověříte u sebe
Test jedné stránky
- Stáhněte si stránku bez prohlížeče curl -sS 'https://vasweb.cz/vas-clanek/' > raw.html — uvidíte syrovou odpověď serveru bez JavaScriptu. Konkrétnímu robotovi může server odpovědět jinak.
- Najděte v souboru větu ze svého textu grep -c 'kus vaší věty' raw.html — když vrátí nulu, zkuste kratší úsek bez diakritiky.
- Než vyhlásíte poplach, zkontrolujte kódování text plný otazníků nechybí, jen ho čtete špatně. Napoví hlavička Content-Type.
- Zopakujte to na třech typech stránek článek, produkt, kategorie — chovají se různě.
- Zkontrolujte i odkazy, ne jen text když se navigace dogeneruje až v prohlížeči, robot na stránku nemusí dojít.
Jak číst procenta o nečitelnosti webů pro AI
U čísel typu „X % webů je pro AI nečitelných“ je podstatné vědět, jak vznikla. Z tohohle měření mi vyšly tři otázky:
- Jak poznali, že obsah chybí? Kolik z toho byly lišty se souhlasem a chybové hlášky?
- Kolik nálezů ověřili ručně? U mě prošlo automatikou 23 nálezů a ruční kontrolu nepřežil ani jeden.
- Co udělali s weby, kde měření selhalo? U mě jich bylo 14 z 80.
Nemám metodiku cizích měření, takže netvrdím, že jsou špatná. Bez odpovědí na tyhle tři otázky se ale jejich čísla hůř interpretují a skoro nedají s ničím porovnat. Delší postup má článek o čtení studií.
Počítat neúspěšná měření jako nálezy
Web bez sitemapy nebo s rozbitým vykreslením není nečitelný web. Je to případ, který jste nezměřili.
Věřit nejdelšímu odstavci
Na hodně stránkách je nejdelší souvislý text lišta se souhlasem, ne obsah.
Publikovat, co vypadne ze skriptu
Dvacet tři nálezů, nula pravých. Ruční kontrola nebyla formalita, byla to celá práce.
Limity
- Jeden odečet, 12. srpna 2026, jedna stránka na doménu. O zbytku webu to neříká nic.
- Vzorek není náhodný — 33 médií je ruční seznam, 47 e-shopů z jedné platformy. Neplatí to jako obrázek českého webu.
- Měřím serverové HTML, ne chování robotů. Chrome není robot OpenAI a server mu může odpovědět jinak než jemu.
Co udělat dnes
Stáhněte si přes curl tři typy svých stránek, najděte v nich jednu větu z hlavního obsahu a zkontrolujte, jestli jde navigace projít bez JavaScriptu. Když něco nesedí, ověřte to očima dřív, než z toho uděláte závěr — u mě to byl rozdíl mezi nulou a patnácti „nálezy“.