Skip to main content
本指南将指导您完成 UltraRAG UI 的全栈部署,包括生成模型(LLM)、检索模型(Embedding)以及 Milvus 向量数据库。

模型推理服务部署

UltraRAG UI 统一采用 OpenAI API 协议进行调用。您可以选择直接在宿主机使用 Screen 运行,或使用 Docker 容器化部署。

生成模型部署

以 Qwen3-32B 为例,建议使用多卡并行以保证推理速度。 Screen (宿主机直接运行)
  1. 新建会话会话:
  1. 启动命令:
script/vllm_serve.sh
出现类似以下输出,表示模型服务启动成功:
  1. 退出会话:按下 Ctrl + A + D 可退出并保持服务在后台运行。 如需重新进入该会话,可执行:
Docker (容器化部署)

检索模型部署

以 Qwen3-Embedding-0.6B 为例,通常占用显存较小。 Screen (宿主机直接运行)
  1. 新建会话:
  1. 启动命令:
script/vllm_serve_emb.sh
Docker (容器化部署)

向量数据库部署 (Milvus)

Milvus 用于高效存储和检索向量数据。 官方部署
自定义部署 若需自定义端口(如防止端口冲突)或数据路径,可使用以下脚本:
start_milvus.sh
修改GRPC_PORT、HTTP_PORT以及DATA_DIR,并运行以下命令进行部署:
部署成功后,您可以通过以下命令检查Milvus的状态:
如果一切正常,您应该能够看到Milvus容器正在运行。
UI 配置提示:启动成功后,在 UltraRAG UI 的 Knowledge Base -> Configure DB 中填写 GRPC_PORT 地址(如 tcp://127.0.0.1:29901)。点击 Connect 显示 Connected 即代表成功。