build_text_corpus
Signature
- Supports .txt / .md;
- Supports .docx (reads paragraphs and tables);
- Supports .pdf / .xps / .oxps / .epub / .mobi / .fb2 (pure text extraction via pymupdf).
- Recursively processes in directory mode.
build_image_corpus
Signature
- Only supports PDF: Renders each page as JPG (RGB) at 144DPI and validates file validity.
- Recursively processes in directory mode.
mineru_parse
Signature
- Calls CLI
mineruto structurally parse PDF/directory and outputs tomineru_dir.
build_mineru_corpus
Signature
- Aggregates MinerU parsing artifacts into Text Corpus JSONL and Image Index JSONL.
- Text:
- Image:
chunk_documents
Signature
- Chunks input text corpus (JSONL, containing
id/title/contents) into paragraphs using selected backend: - Chunk Backend: Supports
token/sentence/recursive. - Tokenizer:
tokenizer_or_token_countercan beword,character, ortiktokenencoding name (e.g.,gpt2). - Chunk Size: Controls block size via
chunk_size(overlap defaults to size/4). - Optionally appends document title to the beginning of each block (
use_title).
Configuration
servers/corpus/parameter.yaml
chunk_backend_configs Detailed Parameters: