Trainen op je website
Crawlen, paginalimieten en antwoorden actueel houden
Hoe crawlen werkt
Chatixy begint bij de URL die je opgeeft en volgt interne links tot de paginalimiet van je abonnement is bereikt, waarbij de zichtbare tekstinhoud van elke pagina wordt geïndexeerd. Pagina's achter logins, betaalmuren of robots.txt-blokkades worden overgeslagen.
Er gelden twee limieten. De pagina-limiet per site beperkt een enkele crawl (Starter 150, Pro 2.500, Business 10.000 pagina's). Daarnaast is er een dagelijkse crawl-toelage die het aantal geïndexeerde pagina's over *al* je websites op één dag beperkt (Starter 150, Pro 12.500, Business 50.000 pagina's) en die om 00:00 UTC wordt gereset. Als een crawl wordt geweigerd omdat de dagelijkse toelage is opgebruikt, laat het kennis-tabblad je dat weten en kun je het opnieuw proberen na de reset.
De crawl is meestal binnen enkele minuten klaar voor typische marketingwebsites; zeer grote sites worden op de achtergrond verwerkt en je supportagent verbetert naarmate er meer pagina's worden toegevoegd.
Pagina's uitsluiten
Je kunt paden uitsluiten waarvan je niet wilt dat de agent ze gebruikt om te leren - vacaturepagina's, juridische archieven, interne tools.
- Voeg padpatronen zoals
/blog/archive/*toe in de kennisinstellingen van het project - Uitgesloten pagina's worden bij de volgende crawl uit de index verwijderd
robots.txt-disallow-regels worden altijd gerespecteerd
Antwoorden actueel houden
Je kunt op elk moment een handmatige her-crawl starten vanuit het kennis-tabblad - handig direct nadat je nieuwe documenten hebt gepubliceerd of prijzen hebt gewijzigd. Een her-crawl is weer beschikbaar 14 dagen nadat de laatste is voltooid.
Je kunt ook geplande her-crawls per website inschakelen en zelf de frequentie kiezen - elke 14, 30 of 90 dagen. Dezelfde opties zijn beschikbaar in elk abonnement.
Tips
- Start een handmatige hercrawl na grote site-updates, zodat de agent nooit verouderde content citeert.
Belangrijk
- Het verwijderen van een pagina van je site verwijdert deze niet direct uit de index - hij verdwijnt bij de volgende crawl, of je kunt de bron handmatig verwijderen.