基于您的网站进行训练

抓取、页面上限以及保持答案的时效性

抓取的工作原理

Chatixy从您提供的URL开始,按照您的计划页面限制,跟踪内部链接,索引每个页面的可见文本内容。登录页面、付费墙或robots.txt阻止的页面将被跳过。

有两个限制适用。每站点页面限制限制单次抓取(入门版150页,专业版2,500页,商务版10,000页)。此外,每日抓取配额限制一天内*所有*网站的索引页面数量(入门版150页,专业版12,500页,商务版50,000页),并在UTC时间00:00重置。如果抓取被拒绝是因为每日配额已用完,知识选项卡会通知您,您可以在重置后再次运行。

对于典型的营销网站,抓取通常在几分钟内完成;非常大的网站将在后台处理,随着页面的增加,您的支持代理将得到改进。

排除页面

您可以排除那些不希望客服坐席学习的路径,比如招聘页面、法律存档、内部工具。

  • 在项目的知识设置中添加诸如 /blog/archive/* 这样的路径模式
  • 被排除的页面会在下次抓取时从索引中移除
  • robots.txt 中的 disallow 规则始终会被遵守

保持答案的时效性

您可以随时从知识选项卡触发手动重新抓取 - 这在您发布新文档或更改定价后非常有用。重新抓取在上次完成后的14天后再次可用。

您还可以为每个网站开启定期重新抓取并自行选择频率 - 每14天、30天或90天。每个计划都提供相同的选项。

提示

  • 在大规模站点更新后触发手动重新抓取,这样客服坐席就绝不会引用过时的内容。

重要

  • 从您的网站删除某个页面,并不会立即将其从索引中移除:它会在下次抓取时消失,您也可以手动删除该来源。