基于您的网站进行训练
抓取、页面上限以及保持答案的时效性
抓取的工作原理
Chatixy从您提供的URL开始,按照您的计划页面限制,跟踪内部链接,索引每个页面的可见文本内容。登录页面、付费墙或robots.txt阻止的页面将被跳过。
有两个限制适用。每站点页面限制限制单次抓取(入门版150页,专业版2,500页,商务版10,000页)。此外,每日抓取配额限制一天内*所有*网站的索引页面数量(入门版150页,专业版12,500页,商务版50,000页),并在UTC时间00:00重置。如果抓取被拒绝是因为每日配额已用完,知识选项卡会通知您,您可以在重置后再次运行。
对于典型的营销网站,抓取通常在几分钟内完成;非常大的网站将在后台处理,随着页面的增加,您的支持代理将得到改进。
排除页面
您可以排除那些不希望客服坐席学习的路径,比如招聘页面、法律存档、内部工具。
- 在项目的知识设置中添加诸如
/blog/archive/*这样的路径模式 - 被排除的页面会在下次抓取时从索引中移除
robots.txt中的 disallow 规则始终会被遵守
保持答案的时效性
您可以随时从知识选项卡触发手动重新抓取 - 这在您发布新文档或更改定价后非常有用。重新抓取在上次完成后的14天后再次可用。
您还可以为每个网站开启定期重新抓取并自行选择频率 - 每14天、30天或90天。每个计划都提供相同的选项。
提示
- 在大规模站点更新后触发手动重新抓取,这样客服坐席就绝不会引用过时的内容。
重要
- 从您的网站删除某个页面,并不会立即将其从索引中移除:它会在下次抓取时消失,您也可以手动删除该来源。