如何评估 RAG 系统的效果?
发布于
一、评估维度
- 检索质量:检索到的文档是否相关。
- 生成质量:回答是否准确、完整、流畅。
- 端到端效果:整体回答是否满足用户。
二、检索评估指标
- Recall(召回率):相关文档中被检索到的比例。
- Precision(精确率):检索到的文档中相关的比例。
- MRR:第一个相关文档的排名倒数。
- NDCG:考虑排名的相关性。
三、生成评估指标
- Faithfulness(忠实度):回答是否基于检索文档,无幻觉。
- Answer Relevancy(回答相关性):回答是否切题。
- Context Precision(上下文精确率):检索上下文是否相关。
- Context Recall(上下文召回率):关键信息是否被检索到。
四、评估方法
- 人工评估:准确但慢。
- LLM-as-Judge:用 LLM 打分,快但有偏差。
- RAGAS:开源 RAG 评估框架,自动计算上述指标。
- TruLens、DeepEval:其他评估工具。
五、优化方向
- 检索差 → 优化分块、Embedding、检索方式。
- 生成差 → 优化 Prompt、调 LLM。
- 端到端差 → 考虑重排(Rerank)、多轮检索。