跳到主要内容

运维手册总览

本手册面向 运维工程师、SRE 与平台管理员,覆盖 MimirQ 的部署方式、健康检查、可观测性与日常运维操作。

服务概览

服务默认端口健康检查端点说明
FastAPI (主服务)8000GET /api/v1/health/readyAPI 入口
Arq Workermake worker-check文档解析、索引等异步任务
PostgreSQL5432pg_isready关系数据存储
Milvus19530gRPC health check向量数据库
Redis6379redis-cli ping缓存与消息队列
MinIO9000 / 9001GET /minio/health/live对象存储

基础设施依赖

部署方式对比

方式适用场景优点缺点
Docker Compose本地开发、PoC、小团队一键启动、配置简单无自动扩缩、无高可用
Helm / K8s生产环境、多租户弹性伸缩、滚动更新、健康探针运维复杂度高
源码部署深度调试、定制开发完全可控需手动管理依赖与进程
推荐

生产环境推荐 Helm / K8s 部署,搭配 PostgreSQL 高可用集群与 Milvus 分布式模式。本地开发使用 Docker Compose 即可。

可观测性

Prometheus 指标

设置 PROMETHEUS_ENABLED=true 后,MimirQ 暴露 Prometheus 兼容的 /metrics 端点:

指标类别示例说明
HTTP 请求http_requests_total, http_request_duration_seconds按路由、方法、状态码分组
并发请求http_requests_in_progress当前 API 并发量

Arq 队列、PostgreSQL、Milvus、Redis 与 MinIO 的运行状态应结合应用日志、make worker-check 和各依赖自身的 exporter 监控;MimirQ 不会直接暴露队列层的专用指标。

Grafana Dashboard

建议配置以下面板:

  • API 概览 -- 请求量、延迟 P50/P95/P99、错误率
  • 任务队列 -- 待处理数、执行时长、失败率
  • 存储 -- PostgreSQL 连接池、Milvus 查询延迟、Redis 命中率
  • 资源 -- CPU、内存、磁盘 I/O

详见 可观测性配置

关键运维操作

操作文档
从建库到评测的完整操作完整操作指南
首次安装与最小配置快速开始
健康探针配置健康检查
监控与告警可观测性
部署与升级部署指南
配置与元数据配置管理

日常巡检清单

每日巡检
  1. 检查所有服务健康端点返回 200
  2. 使用 make worker-check 确认 Arq Worker 正常发布存活标记
  3. 检查 PostgreSQL 连接池使用率 < 80%
  4. 确认 Milvus 集合同步状态正常
  5. 检查磁盘使用率(MinIO 存储 / PostgreSQL WAL)
  6. 查看 Grafana 告警面板是否有未处理告警

关键配置文件

文件用途
docker/docker-compose*.ymlDocker Compose 编排
deploy/helm/mimirq/Helm Chart 模板
.env.example / app/core/config.py环境变量模板与应用配置定义
alembic.ini数据库迁移配置
.env / web/.env.local本地后端与前端环境变量
敏感配置

数据库密码、JWT 密钥、API Key 等敏感配置请通过环境变量或 Kubernetes Secret 注入,切勿提交到代码仓库。

相关链接