从数据评估、文档入库到检索与生成的完整数据流,帮助理解 MimirQ 各组件如何协作。企业知识库不应从“上传文件”直接开始:先用代表性样本验证解析质量与资源成本,再确定 dataset 的解析、治理和切块策略。
交付起点
- 抽样评估:统计扫描页、图片、表格、公式和版式复杂度,建立验收样本。
- 选择解析器:用同一批样本比较结构完整性、阅读顺序、吞吐和失败率,不把某个解析器写死为全局最优。
- 确定治理与切块规则:明确人工校验范围、规则 DSL、metadata 合约,以及标题、记录或父子块边界。
- 固定回归集:在正式发布前用 Golden 题集验证召回证据,而不是只观察最终回答是否流畅。
全流程总览
入库阶段详解
各阶段说明
| 阶段 | 组件 | 输入 | 输出 |
|---|
| 评估 | Parser Benchmark + 人工复核 | 代表性样本 | 数据画像 + 解析基线 + 成本估算 |
| 上传 | API Server | 原始文件 | document_id + 对象存储路径 |
| 解析 | Parser Service | 原始文件 | 结构化文本 + 元数据 |
| 治理 | Pipeline Worker + 可选人工复核 | 解析结果 + 规则 / DSL | 规范化内容 + metadata |
| 切块 | Pipeline Worker | 治理后内容 | 带 provenance 的业务片段 |
| Embedding | Pipeline Worker | 文本片段 | 向量表示 |
| 索引 | Milvus + PostgreSQL | 向量 + 文本 | 可检索的索引 |
检索阶段详解
混合检索策略
MimirQ 采用 HybridRetriever,支持多路召回:
| 检索路 | 方法 | 擅长场景 |
|---|
| 向量检索 | 语义相似度(ANN) | 语义匹配、同义表达 |
| BM25 | 关键词匹配 | 精确术语、专有名词 |
| SPLADE | 稀疏向量 | 兼顾语义与关键词 |
| KG | 图谱关系扩展 | 实体关联、多跳推理 |
生成阶段详解
关键配置参数
| 参数 | 影响阶段 | 说明 |
|---|
parser_backend | 解析 | 按 dataset / 文档选择解析器 |
chunk_strategy | 切块 | 选择标题、父子、语义或其他业务适配策略 |
chunk_size | 切块 | 策略允许时的长度上限,不应作为所有文档的统一边界 |
embedding_model | Embedding | 向量模型选择 |
top_k | 检索 | 各路召回数量 |
rerank_model | 重排序 | 重排模型选择 |
temperature | 生成 | LLM 生成随机性 |
相关链接