웹사이트로 학습시키기

크롤링, 페이지 제한, 답변을 최신 상태로 유지하기

크롤링 작동 방식

Chatixy는 제공된 URL에서 시작하여 내부 링크를 따라가며, 각 페이지의 보이는 텍스트 콘텐츠를 색인화합니다. 로그인, 유료 벽, 또는 robots.txt로 차단된 페이지는 건너뜁니다.

두 가지 제한이 적용됩니다. 사이트별 페이지 제한은 단일 크롤링을 제한합니다 (Starter 150, Pro 2,500, Business 10,000 페이지). 그 외에도, 일일 크롤링 허용량은 하루 동안 *모든* 웹사이트에서 색인화할 수 있는 페이지 수를 제한하며 (Starter 150, Pro 12,500, Business 50,000 페이지), 00:00 UTC에 초기화됩니다. 일일 허용량이 소진되어 크롤링이 거부되면, 지식 탭에서 이를 알려주며 초기화 후 다시 실행할 수 있습니다.

일반적인 마케팅 사이트의 경우 크롤링은 몇 분 내에 완료되며, 매우 큰 사이트는 백그라운드에서 처리되어 페이지가 추가됨에 따라 지원 에이전트가 개선됩니다.

페이지 제외하기

에이전트가 학습하지 않았으면 하는 경로(채용 페이지, 법률 자료실, 내부 도구 등)를 제외할 수 있습니다.

  • 프로젝트의 지식 설정에서 /blog/archive/* 같은 경로 패턴을 추가하세요
  • 제외한 페이지는 다음 크롤링 때 색인에서 제거됩니다
  • robots.txt의 disallow 규칙은 항상 준수합니다

답변을 최신 상태로 유지하기

지식 탭에서 언제든지 수동 재크롤링을 실행할 수 있습니다 - 새로운 문서를 게시하거나 가격을 변경한 직후에 유용합니다. 재크롤링은 마지막 완료 후 14일 후에 다시 가능합니다.

또한, 웹사이트별로 예약 재크롤링을 설정하고 주기를 직접 선택할 수 있습니다 - 14일, 30일 또는 90일마다 가능합니다. 모든 플랜에서 동일한 옵션을 사용할 수 있습니다.

  • 에이전트가 오래된 내용을 인용하지 않도록 사이트를 크게 바꾼 뒤에는 수동 재크롤링을 실행하세요.

중요

  • 사이트에서 페이지를 삭제해도 색인에서 곧바로 제거되지는 않습니다. 다음 크롤링 때 사라지며, 원한다면 소스를 직접 삭제할 수도 있습니다.