build_text_corpus
签名
- 支持 .txt / .md;
- 支持 .docx(读取段落与表格内容);
- 支持 .pdf / .xps / .oxps / .epub / .mobi / .fb2(经 pymupdf 纯文本抽取)。
- 目录模式下会递归处理。
build_image_corpus
签名
- 仅支持 PDF:以 144DPI 渲染每页为 JPG(RGB),并校验文件有效性。
- 目录模式下会递归处理。
mineru_parse
签名
- 调用 CLI
mineru对 PDF/目录进行结构化解析,输出到mineru_dir。
build_mineru_corpus
签名
- 汇总 MinerU 解析产物为 文本语料 JSONL 与 图片索引 JSONL。
- 文本:
- 图片:
chunk_documents
签名
- 将输入文本语料(JSONL,含
id/title/contents)按所选后端切分为段落块: - Chunk Backend: 支持
token/sentence/recursive。 - Tokenizer: tokenizer_or_token_counter 可选
word、character或tiktoken编码名称(如gpt2)。 - Chunk Size: 通过
chunk_size控制块大小(overlap 默认为 size/4)。 - 可选在每个块首部附加文档标题(
use_title)。
参数配置
servers/corpus/parameter.yaml
chunk_backend_configs 详细参数: