Multimodální vyhledávání znamená, že se systému ptáte textem, obrazem i hlasem zároveň. U obrazu Google zveřejnil konkrétní čísla i mechanismus rozpadu dotazu nad obrázkem. U hlasu veřejně dostupné statistiky rok od roku kolísají a primární zdroj pro ně chybí.
Tyhle dvě věci se obvykle zmiňují jedním dechem — „hlas a obraz mění vyhledávání“. Když se ale člověk podívá, čím je která podložená, jsou to dva úplně různé případy.
Obraz: Google publikuje čísla i mechanismus
Začneme tím, co doložit jde.
- Google Lens: v květnu 2025 Google uvedl, že ho k hledání toho, co lidé vidí, používá více než 1,5 miliardy lidí měsíčně.
- AI Mode: na I/O v květnu 2026 Google oznámil, že rok po spuštění překročil miliardu měsíčních uživatelů a že se dotazy podle něj „více než zdvojnásobují každé čtvrtletí od spuštění“.
- Multimodální vstup: už v dubnu 2025 Google u AI Mode popsal, že můžete vyfotit nebo nahrát obrázek, zeptat se na něj a dostat odpověď „s odkazy, kam jít dál“.
Jsou to produktová čísla samotného Googlu, takže neříkají všechno. Ale jsou veřejná, datovaná a ověřitelná — což je u tohohle tématu vzácnost.
Jak AI vlastně čte obrázek
Tohle je pro majitele webu prakticky nejzajímavější část a Google ji popsal poměrně konkrétně. Říká tomu visual search fan-out, tedy rozpad dotazu nad obrázkem.
Podle Googlu systém „pouští několik dotazů na obrázek jako celek i na objekty uvnitř něj a získává tak větší záběr a hloubku informací než tradiční vyhledávání“.
Pro e-shop to má tři docela hmatatelné důsledky:
- Na produktové fotce nehraje roli jen produkt, ale i rekvizity, prostředí a další předměty v záběru.
- Lifestyle fotka může systému předat širší kontext než čistý packshot — ale zároveň víc šumu.
- U hlavní fotky proto stojí za úvahu, co přesně na ní má být rozpoznáno jako podstatné.
To ale neznamená, že z toho jde odvodit přesný návod na alt texty nebo kompozici záběru. Google žádný takový postup nezveřejnil a domýšlet si ho by bylo přesně to, co tenhle článek kritizuje u hlasu.
Hlas: čísla, která nikdo neumí doložit
A teď ta druhá polovina tématu, o které se mluví minimálně stejně dlouho.
Když jsme hledali, jak velké hlasové vyhledávání vlastně je, našli jsme pro rok 2026 hned několik různých čísel. Každé měřilo něco jiného — podíl na všech dotazech, míru užívání, denní frekvenci — a navzájem si odporovala. Konkrétní hodnoty tady schválně neuvádíme: žádná z nich neodkazovala na primární měření a všechny pocházely ze souhrnů statistik na SEO webech, které citují jiné souhrny statistik. Vytištěné by se čtenáři zafixovaly jako fakt, i když je článek zpochybňuje.
Neznamená to, že lidé hlasem nehledají — určitě ano. Znamená to, že nemáme čím podložit ani velikost, ani růst toho kanálu. A pokud na něj někdo chce vyčlenit rozpočet jako na samostatnou disciplínu, měl by k tomu mít lepší podklad než souhrn statistik.
Co který zdroj vlastně obsahuje
Aby bylo vidět, na čem článek stojí a co jsme museli vyřadit:
| Aspekt | ||
|---|---|---|
| Google I/O, 19. 5. 2026 | AI Mode přes miliardu měsíčních uživatelů; dotazy se podle Googlu zdvojnásobují každé čtvrtletí | Žádná čísla o Lens, obrazovém vyhledávání ani hlasu |
| Aktualizace AI Mode, 20. 5. 2025 | Lens používá přes 1,5 miliardy lidí měsíčně | Nic o multimodálním mechanismu |
| Multimodální AI Mode, 7. 4. 2025 | Popis visual search fan-out a nahrávání fotek | Žádná čísla o objemech |
| Hlasové vyhledávání | Několik navzájem si odporujících hodnot ze souhrnů statistik | Jakýkoli dohledatelný primární zdroj |
Kam dát práci a kam ne
Dobrá zpráva je, že se toho moc měnit nemusí — a hlavně ne pod hlavičkou „voice SEO“.
Co u hlasu dává intuitivně smysl, tedy přirozeně formulované otázky a odpověď hned na začátku, je přesně to, co pomáhá i v textových AI odpovědích. Rozebírají to pasážová optimalizace a obsah pro AI éru. Nejvíc to uvidíte na FAQ, na otázkách u produktů a v úvodech kategorií.
U obrazu je navíc jeden konkrétní důvod, proč fotky nepodceňovat: pokud systém rozebírá i objekty okolo, je volba scény součástí informace, ne jen otázkou designu. Souvisí to s tím, co rozebírá článek o produktových stránkách.
Kde končí podklad
Nejde z toho odvodit návod na alt texty. Google nepublikoval postup „jak psát pro multimodální vyhledávání“ a my si ho nevymyslíme. Značení obrázků strukturovanými daty je samostatné téma.
Neplyne z toho nic o českém trhu. Všechna čísla jsou globální nebo z USA.
Neplyne z toho, že hlas nefunguje. Plyne z toho, že o něm nemáme spolehlivá data — což je jiné tvrzení.
Co si odnést
Když příště narazíte na článek, který v jedné větě spojí „hlasové a obrazové vyhledávání rostou“, zkuste si u obou půlek položit stejnou otázku: kdo to změřil a kde to publikoval? U obrazu dostanete odpověď s datem. U hlasu narazíte na souhrn, který cituje jiný souhrn.
Čtyři pravidla, která z toho plynou:
- Nezakládejte samostatný projekt na hlasové vyhledávání, dokud pro něj nemáte data z vlastního webu.
- U fotek řešte celý záběr, ne jen hlavní produkt — rekvizity a prostředí systém čte taky.
- Odpověď a otázku dejte nahoru na FAQ, u produktů a v úvodech kategorií; funguje to napříč způsoby zadání dotazu.
- Pokud máte rozpočet na jednu věc, dejte ho do lepších fotek a jasnějších odpovědí na stránce, ne do disciplíny pojmenované podle toho, jak se dotaz zadává.
Jestli nechcete stavět rozhodnutí na marketingových souhrnech, dává smysl podívat se nejdřív na vlastní viditelnost a obsahové signály. AI SEO audit za 9 990 Kč projde, kde vás AI nástroje zmiňují a odkud o vás berou informace.
Zdroje: blog Google — I/O 2026 (19. 5. 2026), aktualizace AI Mode (20. 5. 2025) a představení multimodálního AI Mode (7. 4. 2025). Statistiky hlasového vyhledávání pocházejí ze souhrnných přehledů bez primárního zdroje. Stav k 19. 7. 2026.