
经常有人问怎么“用自己的数据训练 ChatGPT”。但对客户支持而言,您几乎从来都不需要去微调模型,您真正想要的,是让 AI 从您的内容里检索答案,并始终以这些内容为准。下面就讲讲这背后的原理,以及具体怎么设置。
微调还是检索?
微调是把规律固化进模型,既贵又慢,还很容易出错。检索(也就是常说的 RAG)则是把您的内容存进一个可搜索的知识库,回答时再把相关片段喂给模型。对客服来说,检索明显更胜一筹:答案始终准确,内容一变就立刻同步,而且能标明出处。
1. 收集素材
最好用的客服助手,会从您手头已有的一切里学习:
- 您的网站:产品、定价和帮助页面
- 文档:PDF、Word 和 Markdown(手册、政策、操作手册)
- 您的帮助中心或知识库
2. 建索引,而不是微调
用 Chatixy,您只要粘贴网址、上传文件,它就会把内容切分好,索引进一个私有知识库。没有要标注的训练数据,也没有要托管的模型,索引几分钟就能完成。
3. 让答案有据可查、标明出处
由于助手是从您索引过的那些具体页面和文档里检索的,每个答案都能附上它所引用的来源链接。一旦问题超出了知识库的范围,好的助手会如实说明并转接给真人,而不是自己编一个答案出来。
4. 保持内容更新
您的内容在变,助手也得跟着变。Chatixy 会按计划自动重新抓取您的站点;每当您发布新文档或调整定价,也可以手动触发一次重新抓取,这样助手就永远不会引用过时的信息。
我需要懂机器学习吗?
不需要。检索这套思路的精髓就在于:您提供的是内容,不是模型。只要您会粘贴链接、上传文件,就能用自己的数据训练出一个客服助手。
常见问题
基于我的数据训练客服助手和微调 ChatGPT 是一回事吗?
通常不是一回事。对客服来说,在已索引的内容上做检索(RAG)是更好的办法:答案既准确又及时,助手还能标明出处,同时也省去了微调的成本和风险。
客服助手能从 PDF 和文档中学习吗?
可以。Chatixy 会把 PDF、Word 和 Markdown 文件连同网站抓取的内容一起,统一收进一个知识库,并标明它引用了哪个来源。