Přejít k obsahu
GetProfit

← Všechny pojmy

Crawl budget (rozpočet procházení)

Crawl budget je množina adres webu, které Google může a chce procházet, omezená tím, kolik zátěže server unese, a zájmem Googlu o tyto stránky.

Jak to funguje

Crawl budget určují dvě věci. Limit kapacity procházení závisí na serveru: rychlé a stabilní odpovědi ho zvyšují, zpomalení a chyby serveru ho snižují. Poptávka po procházení závisí na tom, kolik adres Google zná, jak jsou oblíbené a jak často se mění. Duplicitní a nepotřebné adresy plýtvají rozpočtem a častým zdrojem je fasetová navigace: každá kombinace filtrů je nová adresa.

Limit kapacity sdílejí všechny crawlery Googlu včetně crawleru Googlebot. Google Shopping má vlastní poptávku po produktech ve feedu obchodu v Merchant Center. Google upozorňuje, že vysoká poptávka jednoho crawleru může snížit kapacitu pro ostatní.

Crawl budget nemusí být váš problém vůbec. Průvodce Googlu je určen pro weby s 1 milionem a více unikátních stránek, které se mění týdně, s 10 000 a více, které se mění denně, nebo s mnoha adresami ve stavu „Discovered – currently not indexed“ (zjištěno, ale zatím neindexováno). Google tyto hodnoty označuje za hrubé odhady. Produktové stránky, které nejsou zaindexované vysvětluje, které stránky stojí za námahu.

Kde to uvidíte

  • Search Console → sestava „Crawl Stats“: historie procházení Googlebotem a dostupnost hostitele.
  • Search Console → sestava „Page indexing“: stav „Discovered – currently not indexed“.

Příklad

Ukázkový obchod, nejde o data klientů.

Obchod se stolním nádobím má 3 000 produktů ve 40 kategoriích. Každou kategorii lze filtrovat podle 8 barev, 5 materiálů a 4 cenových pásem a každá kombinace dostane vlastní adresu: 40 × 8 × 5 × 4 = 6 400 stránek s filtry. Google teď může najít 9 440 adres místo 3 040 a dvě ze tří jsou filtry (6 400 ÷ 9 440 = 68 %).

Nezaměňovat s

  • Indexace — uložení stránky pro výsledky vyhledávání. Ne každá procházená stránka se indexuje.

Správný a chybný výklad

  • Špatně: „Nové produkty nejsou v Googlu ani po dni, takže nám došel crawl budget.“ Správně: Google uvádí, že většina webů by neměla čekat procházení v týž den: kontrola a indexace stránky obvykle trvá tři dny i déle.
  • Špatně: „Dejte na stránky s filtry noindex, ušetříte crawl budget.“ Správně: Google si stránku s noindex stále vyžádá, než ji vyřadí. Pokud nechcete, aby se procházely adresy filtrů, které ve vyhledávání nejsou potřeba, Google doporučuje robots.txt.

Zdroje