CarislyBot
CarislyBot is de crawler van Carisly. Hij haalt openbare vacatures op bij werkgevers: uit hun wervingssystemen (zoals Recruitee, Greenhouse, Lever, Workable, Personio, Teamtailor en Ashby) en uit de gestructureerde vacaturegegevens (schema.org JobPosting) op hun eigen website.
User-Agent: CarislyBot/1.0 (+https://carisly.com/bot)
Wat we ophalen en bewaren
- Alleen openbare vacaturepagina's en vacaturefeeds; nooit pagina's achter een inlog.
- We bewaren per vacature alleen: functietitel, werkgever, locatie, werkvorm, salaris (als de werkgever dat gestructureerd vermeldt), datum en de link naar de vacature. Nooit de volledige vacaturetekst.
- Op de site linken we altijd naar de vacature bij de werkgever.
Hoe vaak
Elke werkgever één keer per 24 uur. De verzoeken zijn verdeeld over de dag, in kleine porties per uur, zodat er geen pieken ontstaan.
Hoe we ons gedragen
- robots.txt is leidend (User-agent: CarislyBot of *), inclusief Crawl-delay.
- Maximaal één verzoek per seconde per domein, en een vaste grens op het totaal aantal gelijktijdige verzoeken.
- Bij HTTP 429 of 503 houden we ons aan Retry-After en wachten we steeds langer. Blijft een site weigeren, dan slaan we het domein 7 dagen over.
- Waar de site dat ondersteunt, vragen we alleen of er iets veranderd is (ETag / If-Modified-Since).
- We omzeilen nooit een blokkade: geen proxies, geen wisselende IP-adressen, geen andere User-Agent, geen inloggen en geen captcha's.
Afmelden
Wil je niet dat CarislyBot je site bezoekt? Zet dit in je robots.txt:
User-agent: CarislyBot / Disallow: /
Of mail ons je domein of bedrijfsnaam via contact@carisly.com. We zetten je dan op onze afmeldlijst: de crawler komt niet meer langs en je vacatures verdwijnen bij de eerstvolgende batch van de site.