跳到主要内容

评测与反馈

MimirQ 集成 RAGAS 评测框架,支持对 RAG 对话质量进行自动化评估,并提供回归测试门禁能力。

RAGAS 评测框架

RAGAS 是业界标准的 RAG 评测框架,MimirQ 基于已存储的对话消息与引用数据执行评测,无需重新发起 RAG 请求。

评测指标

指标含义评估维度
Faithfulness答案是否忠实于检索到的上下文幻觉检测
Answer Relevancy答案与用户问题的相关程度回答质量
Context Precision检索上下文中有用信息的比例检索精度
Context Recall检索是否覆盖了回答所需的全部信息检索召回
指标选择建议

日常评测建议至少启用 Faithfulness + Context Precision;完整评测可启用全部四项指标,但耗时更长(需 LLM 参与评分)。

评测任务生命周期

评测数据模型:

模型说明
RagasEvaluationRun评测运行记录(status / metrics / summary)
RagasEvaluationItem单轮评测结果(per-turn scores)
RagasRegressionRun回归测试运行
RagasRegressionCase回归基准样本
RagasRegressionItem回归对比结果

回归门禁流程

阈值配置

回归门禁阈值通过 RAG_EVAL_SUMMARY_PATH 配置文件管理,建议 Faithfulness >= 0.85、Context Precision >= 0.75。

API 端点

方法路径说明
POST/api/v1/evaluations创建评测任务
GET/api/v1/evaluations/{id}查询评测结果
GET/api/v1/evaluations/{id}/items查询逐轮详情
POST/api/v1/evaluations/regression创建回归测试
GET/api/v1/evaluations/regression/{id}查询回归结果

评测配置

参数说明
RAGAS_ENABLED评测功能开关
RAGAS_LLM_MODEL评分用 LLM 模型
RAGAS_EMBEDDING_MODEL评分用 Embedding 模型
RAG_EVAL_SUMMARY_PATH回归基准文件路径

关键源码

文件职责
app/rag/evaluation/ragas.pyRAGAS 评测服务主逻辑
app/models/evaluation.py评测数据模型
app/api/v1/evaluations.py评测 API 路由
app/api/schemas/evaluation.py请求/响应 Schema

相关链接:证据与可解释性 · 对话与模板 · 治理与合规