跳到主要内容

RAG 端到端数据流

从数据评估、文档入库到检索与生成的完整数据流,帮助理解 MimirQ 各组件如何协作。企业知识库不应从“上传文件”直接开始:先用代表性样本验证解析质量与资源成本,再确定 dataset 的解析、治理和切块策略。

交付起点

  1. 抽样评估:统计扫描页、图片、表格、公式和版式复杂度,建立验收样本。
  2. 选择解析器:用同一批样本比较结构完整性、阅读顺序、吞吐和失败率,不把某个解析器写死为全局最优。
  3. 确定治理与切块规则:明确人工校验范围、规则 DSL、metadata 合约,以及标题、记录或父子块边界。
  4. 固定回归集:在正式发布前用 Golden 题集验证召回证据,而不是只观察最终回答是否流畅。

全流程总览

入库阶段详解

各阶段说明

阶段组件输入输出
评估Parser Benchmark + 人工复核代表性样本数据画像 + 解析基线 + 成本估算
上传API Server原始文件document_id + 对象存储路径
解析Parser Service原始文件结构化文本 + 元数据
治理Pipeline Worker + 可选人工复核解析结果 + 规则 / DSL规范化内容 + metadata
切块Pipeline Worker治理后内容带 provenance 的业务片段
EmbeddingPipeline Worker文本片段向量表示
索引Milvus + PostgreSQL向量 + 文本可检索的索引

检索阶段详解

混合检索策略

MimirQ 采用 HybridRetriever,支持多路召回:

检索路方法擅长场景
向量检索语义相似度(ANN)语义匹配、同义表达
BM25关键词匹配精确术语、专有名词
SPLADE稀疏向量兼顾语义与关键词
KG图谱关系扩展实体关联、多跳推理

生成阶段详解

关键配置参数

参数影响阶段说明
parser_backend解析按 dataset / 文档选择解析器
chunk_strategy切块选择标题、父子、语义或其他业务适配策略
chunk_size切块策略允许时的长度上限,不应作为所有文档的统一边界
embedding_modelEmbedding向量模型选择
top_k检索各路召回数量
rerank_model重排序重排模型选择
temperature生成LLM 生成随机性

相关链接