Přeskočit na obsah

Hlas a obraz v AI: jedno je doložené, druhé ne

U obrazového vyhledávání Google publikuje čísla i mechanismus. U hlasového si statistiky odporují a primární zdroj chybí. Co z toho plyne pro obsah.

~1 000 slov 6 častých otázek ~5 minut čtení Aktualizováno: 2026-07-19
Hlas a obraz v AI: jedno je doložené, druhé ne
Stručná odpověď

Multimodální vyhledávání znamená, že se systému ptáte textem, obrazem i hlasem zároveň. U obrazu Google zveřejnil konkrétní čísla i mechanismus rozpadu dotazu nad obrázkem. U hlasu veřejně dostupné statistiky rok od roku kolísají a primární zdroj pro ně chybí.

Multimodální vyhledávání znamená, že se systému ptáte textem, obrazem i hlasem zároveň. U obrazu Google zveřejnil konkrétní čísla i mechanismus rozpadu dotazu nad obrázkem. U hlasu veřejně dostupné statistiky rok od roku kolísají a primární zdroj pro ně chybí.

Tyhle dvě věci se obvykle zmiňují jedním dechem — „hlas a obraz mění vyhledávání“. Když se ale člověk podívá, čím je která podložená, jsou to dva úplně různé případy.

Obraz: Google publikuje čísla i mechanismus

Začneme tím, co doložit jde.

  • Google Lens: v květnu 2025 Google uvedl, že ho k hledání toho, co lidé vidí, používá více než 1,5 miliardy lidí měsíčně.
  • AI Mode: na I/O v květnu 2026 Google oznámil, že rok po spuštění překročil miliardu měsíčních uživatelů a že se dotazy podle něj „více než zdvojnásobují každé čtvrtletí od spuštění“.
  • Multimodální vstup: už v dubnu 2025 Google u AI Mode popsal, že můžete vyfotit nebo nahrát obrázek, zeptat se na něj a dostat odpověď „s odkazy, kam jít dál“.

Jsou to produktová čísla samotného Googlu, takže neříkají všechno. Ale jsou veřejná, datovaná a ověřitelná — což je u tohohle tématu vzácnost.

Jak AI vlastně čte obrázek

Tohle je pro majitele webu prakticky nejzajímavější část a Google ji popsal poměrně konkrétně. Říká tomu visual search fan-out, tedy rozpad dotazu nad obrázkem.

Podle Googlu systém „pouští několik dotazů na obrázek jako celek i na objekty uvnitř něj a získává tak větší záběr a hloubku informací než tradiční vyhledávání“.

Pro e-shop to má tři docela hmatatelné důsledky:

  • Na produktové fotce nehraje roli jen produkt, ale i rekvizity, prostředí a další předměty v záběru.
  • Lifestyle fotka může systému předat širší kontext než čistý packshot — ale zároveň víc šumu.
  • U hlavní fotky proto stojí za úvahu, co přesně na ní má být rozpoznáno jako podstatné.

To ale neznamená, že z toho jde odvodit přesný návod na alt texty nebo kompozici záběru. Google žádný takový postup nezveřejnil a domýšlet si ho by bylo přesně to, co tenhle článek kritizuje u hlasu.

Hlas: čísla, která nikdo neumí doložit

A teď ta druhá polovina tématu, o které se mluví minimálně stejně dlouho.

Když jsme hledali, jak velké hlasové vyhledávání vlastně je, našli jsme pro rok 2026 hned několik různých čísel. Každé měřilo něco jiného — podíl na všech dotazech, míru užívání, denní frekvenci — a navzájem si odporovala. Konkrétní hodnoty tady schválně neuvádíme: žádná z nich neodkazovala na primární měření a všechny pocházely ze souhrnů statistik na SEO webech, které citují jiné souhrny statistik. Vytištěné by se čtenáři zafixovaly jako fakt, i když je článek zpochybňuje.

Neznamená to, že lidé hlasem nehledají — určitě ano. Znamená to, že nemáme čím podložit ani velikost, ani růst toho kanálu. A pokud na něj někdo chce vyčlenit rozpočet jako na samostatnou disciplínu, měl by k tomu mít lepší podklad než souhrn statistik.

Co který zdroj vlastně obsahuje

Aby bylo vidět, na čem článek stojí a co jsme museli vyřadit:

Aspekt
Google I/O, 19. 5. 2026 AI Mode přes miliardu měsíčních uživatelů; dotazy se podle Googlu zdvojnásobují každé čtvrtletí Žádná čísla o Lens, obrazovém vyhledávání ani hlasu
Aktualizace AI Mode, 20. 5. 2025 Lens používá přes 1,5 miliardy lidí měsíčně Nic o multimodálním mechanismu
Multimodální AI Mode, 7. 4. 2025 Popis visual search fan-out a nahrávání fotek Žádná čísla o objemech
Hlasové vyhledávání Několik navzájem si odporujících hodnot ze souhrnů statistik Jakýkoli dohledatelný primární zdroj

Kam dát práci a kam ne

Dobrá zpráva je, že se toho moc měnit nemusí — a hlavně ne pod hlavičkou „voice SEO“.

Co u hlasu dává intuitivně smysl, tedy přirozeně formulované otázky a odpověď hned na začátku, je přesně to, co pomáhá i v textových AI odpovědích. Rozebírají to pasážová optimalizace a obsah pro AI éru. Nejvíc to uvidíte na FAQ, na otázkách u produktů a v úvodech kategorií.

U obrazu je navíc jeden konkrétní důvod, proč fotky nepodceňovat: pokud systém rozebírá i objekty okolo, je volba scény součástí informace, ne jen otázkou designu. Souvisí to s tím, co rozebírá článek o produktových stránkách.

Kde končí podklad

Nejde z toho odvodit návod na alt texty. Google nepublikoval postup „jak psát pro multimodální vyhledávání“ a my si ho nevymyslíme. Značení obrázků strukturovanými daty je samostatné téma.

Neplyne z toho nic o českém trhu. Všechna čísla jsou globální nebo z USA.

Neplyne z toho, že hlas nefunguje. Plyne z toho, že o něm nemáme spolehlivá data — což je jiné tvrzení.

Co si odnést

Když příště narazíte na článek, který v jedné větě spojí „hlasové a obrazové vyhledávání rostou“, zkuste si u obou půlek položit stejnou otázku: kdo to změřil a kde to publikoval? U obrazu dostanete odpověď s datem. U hlasu narazíte na souhrn, který cituje jiný souhrn.

Čtyři pravidla, která z toho plynou:

  1. Nezakládejte samostatný projekt na hlasové vyhledávání, dokud pro něj nemáte data z vlastního webu.
  2. U fotek řešte celý záběr, ne jen hlavní produkt — rekvizity a prostředí systém čte taky.
  3. Odpověď a otázku dejte nahoru na FAQ, u produktů a v úvodech kategorií; funguje to napříč způsoby zadání dotazu.
  4. Pokud máte rozpočet na jednu věc, dejte ho do lepších fotek a jasnějších odpovědí na stránce, ne do disciplíny pojmenované podle toho, jak se dotaz zadává.

Jestli nechcete stavět rozhodnutí na marketingových souhrnech, dává smysl podívat se nejdřív na vlastní viditelnost a obsahové signály. AI SEO audit za 9 990 Kč projde, kde vás AI nástroje zmiňují a odkud o vás berou informace.

Zdroje: blog Google — I/O 2026 (19. 5. 2026), aktualizace AI Mode (20. 5. 2025) a představení multimodálního AI Mode (7. 4. 2025). Statistiky hlasového vyhledávání pocházejí ze souhrnných přehledů bez primárního zdroje. Stav k 19. 7. 2026.

Sniper Design
Pomoc s implementací

Nechcete to řešit interně? Postavíme to za vás.

V Sniper Design děláme kompletní AI SEO — strategii, audit, implementaci i obsah. Zlatý Upgates partner od 2016, přes 600 e‑shopů na CZ trhu. AI vyhledávání implementujeme do návrhů homepage, obsahové struktury i auditů klientských webů.

  • Zlatý Upgates partner
  • 600+ e‑shopů
  • Vlastní e‑shop MEGA DETAIL
FAQ · 6 otázek

Časté otázky, které k tématu padají

01 Co znamená multimodální vyhledávání?
Že systému nemusíte položit dotaz jen textem. Vyfotíte nebo nahrajete obrázek, zeptáte se na něj a dostanete odpověď. Google to popsal u AI Mode v dubnu 2025: nahrajete fotku, položíte otázku a dostanete odpověď včetně odkazů, kam jít dál.
02 Jak AI zpracuje obrázek?
Google popisuje takzvaný visual search fan-out: systém podle něj pouští několik dotazů najednou — na obrázek jako celek i na jednotlivé objekty v něm — a získává tak víc informací než klasické vyhledávání. Prakticky to znamená, že čte i vedlejší předměty ve scéně, ne jen hlavní motiv.
03 Jak velké je obrazové vyhledávání?
Google v květnu 2025 uvedl, že Lens používá k hledání toho, co lidé vidí, více než 1,5 miliardy lidí měsíčně. Na I/O v květnu 2026 pak oznámil, že AI Mode rok po spuštění překročil miliardu měsíčních uživatelů a dotazy se podle něj víc než zdvojnásobují každé čtvrtletí.
04 A kolik je hlasových dotazů?
Nevíme a nikdo z veřejně dostupných zdrojů, které jsme prošli, to nedokládá. Souhrny statistik uvádějí pro rok 2026 několik různých hodnot, které měří různé věci a navzájem si odporují; žádná neodkazuje na primární měření. Konkrétní čísla proto neuvádíme ani my — berte podobné statistiky v článcích o hlasovém vyhledávání s rezervou.
05 Má smysl optimalizovat pro hlasové vyhledávání?
Jako samostatná disciplína to podložené není. Co u hlasu dává smysl — přirozeně formulované otázky a odpověď hned na začátku — je ale přesně to, co pomáhá i v textových AI odpovědích. Nejde tedy o práci navíc, jen se to nemusí dělat pod hlavičkou hlasové optimalizace.
06 Co to znamená pro fotky produktů?
Pokud systém čte i vedlejší objekty v obrázku, nese fotka víc informace, než se obvykle předpokládá — rekvizity, prostředí a další předměty v záběru taky něco sdělují. Je to mechanická úvaha z popisu Googlu, ne jeho doporučený postup, takže z ní nedělejte přesná pravidla pro focení.
Čtěte dál

Související články

Všechny články v blogu Zpět na úvod