模型推理服务部署
UltraRAG UI 统一采用 OpenAI API 协议进行调用。您可以选择直接在宿主机使用Screen 运行,或使用 Docker 容器化部署。
生成模型部署
以 Qwen3-32B 为例,建议使用多卡并行以保证推理速度。 Screen (宿主机直接运行)- 新建会话会话:
- 启动命令:
script/vllm_serve.sh
- 退出会话:按下
Ctrl + A + D可退出并保持服务在后台运行。 如需重新进入该会话,可执行:
检索模型部署
以 Qwen3-Embedding-0.6B 为例,通常占用显存较小。 Screen (宿主机直接运行)- 新建会话:
- 启动命令:
script/vllm_serve_emb.sh
向量数据库部署 (Milvus)
Milvus 用于高效存储和检索向量数据。 官方部署start_milvus.sh