Crawl- en indexmanagement
Voor sites vanaf ongeveer tienduizend URL's. Daaronder is crawlbudget zelden je probleem en ben je beter geholpen met technische SEO.
Bij grote sites gaat het anders. Google besluit dan zelf welk deel van je site hij bijhoudt, en dat besluit valt vaak verkeerd uit. Je nieuwe productpagina's blijven weken buiten de index terwijl je filtercombinaties uit 2019 elke dag opnieuw worden opgehaald.
Waar het misgaat
Onder de tienduizend URL’s is crawlbudget zelden je probleem. Daarboven gaat het anders: je nieuwe productpagina’s blijven weken buiten de index, terwijl je filtercombinaties uit 2019 elke dag opnieuw worden opgehaald.
-
?kleur=&maat=Facetnavigatie die miljoenen combinaties genereert uit een paar duizend producten -
index bloatDuizenden dunne pagina's die je sterke pagina's verdringen -
?page=40Pagination waarbij pagina 40 nooit bereikt wordt en de producten daarop dus niet bestaan -
/zoeken?q=Interne zoekresultaten die geïndexeerd raken -
410 / 301 / 200Uitverkochte producten die blijven staan, verdwijnen of redirecten, zonder beleid daarin -
301 → 301 → 301Redirectketens die crawlbudget opeten -
noindexrobots.txtennoindexdie elkaar tegenwerken
Hoe ik het onderzoek
Het uitgangspunt is het indexeringsrapport in Google Search Console, in combinatie met een crawlsimulatie van je site. Die twee naast elkaar laten zien welke URL’s Google kent, welke hij overslaat en welke hij wel ophaalt maar niet indexeert.
Daaruit valt af te leiden welk deel van je crawlbudget naar waardeloze URL’s gaat, en wat er vrijkomt als je dat afknijpt.
Een logfileanalyse kan daar bovenop, maar niet standaard. Serverlogs laten zien wat Googlebot werkelijk heeft opgehaald, hoe vaak en met welke responstijd. Dat is waardevol als de rapporten elkaar tegenspreken of als je precies wilt weten waar het crawlbudget blijft. Bij de meeste vraagstukken is het niet nodig, en dan bereken ik het ook niet.
Wat je krijgt
- Een crawlbudgetanalyse: waar het naartoe gaat, uitgesplitst naar type URL
- Een indexeringsoverzicht: wat er in de index staat, wat eruit hoort, en wat erin hoort maar er niet in staat
- Een uitvoeringsplan met de juiste instrumenten per geval:
robots.txt,noindex, canonical, statuscode of parameterbeleid, want die zijn niet uitwisselbaar - Monitoring die aanslaat als het opnieuw wegloopt
Verwante diensten
Zit je vraagstuk breder dan deze dienst, dan is een van deze de gerichtere ingang.
Wil je weten waar jouw crawlbudget heen gaat?
Vertel wat er speelt. Meestal laat ik binnen één werkdag weten of ik je kan helpen, en zo niet, dan verwijs ik je door.