Skip to main content

简介

在日常使用中,我们常常遇到这样的场景:购买了新设备,却不清楚某些功能如何设置, 而翻阅说明书既耗时又低效。此时,如果有一个智能助手能直接回答问题,将极大提升体验。 例如,某位用户购买了 尼康 Z7 相机,想了解其“电子减震功能在哪些场景不可用”。 直接询问 LLM 得到的回答如下:
可以看到,模型虽然能生成语义流畅的回答,但由于缺乏真实文档支撑,往往会出现“似是而非”的结果。 为了解决这一问题,UltraRAG 基于 VisRAG 实现了一种多模态检索增强 Pipeline。 它不再依赖繁琐的文本解析,而是直接将“相关文档的截图”输入给视觉语言模型,从而实现基于视觉语义的真实文档问答。

构建个人知识库

以“尼康使用说明书”为例。你可以 点击此处下载 PDF 文件。 我们使用 UltraRAG 的 Corpus Server 将该 PDF 直接转换为图像语料库:
examples/build_image_corpus.yaml
执行以下命令:
修改参数如下:
examples/parameters/build_image_corpus_parameter.yaml
运行 Pipeline:
执行完成后,将自动生成图像语料文件:
corpora/image.jsonl
接下来,使用 Retriever Server 对图像语料进行向量化编码与索引:
examples/corpus_index.yaml
执行以下命令:
修改参数:
examples/parameters/corpus_index_parameter.yaml
运行索引构建:

VisRAG

准备用户查询文件:
data/test.jsonl
定义 VisRAG Pipeline:
examples/visrag.yaml
执行以下命令:
修改参数:
examples/parameters/visrag_parameter.yaml
运行该Pipeline:
执行以下命令启动 Case Study Viewer:
系统会自动展示检索到的说明书页面截图: 模型生成的回答将基于真实图像内容,示例如下:
通过视觉语义增强,系统能更准确地回答用户问题,尤其适用于说明书、教材、报表等多模态场景。