Skip to main content

build_text_corpus

Signature
Function
  • Supports .txt / .md;
  • Supports .docx (reads paragraphs and tables);
  • Supports .pdf / .xps / .oxps / .epub / .mobi / .fb2 (pure text extraction via pymupdf).
  • Recursively processes in directory mode.
Output Format (JSONL)

build_image_corpus

Signature
Function
  • Only supports PDF: Renders each page as JPG (RGB) at 144DPI and validates file validity.
  • Recursively processes in directory mode.
Output Index (JSONL)

mineru_parse

Signature
Function
  • Calls CLI mineru to structurally parse PDF/directory and outputs to mineru_dir.

build_mineru_corpus

Signature
Function
  • Aggregates MinerU parsing artifacts into Text Corpus JSONL and Image Index JSONL.
Output Format (JSONL)
  • Text:
  • Image:

chunk_documents

Signature
Function
  • Chunks input text corpus (JSONL, containing id/title/contents) into paragraphs using selected backend:
  • Chunk Backend: Supports token / sentence / recursive.
  • Tokenizer: tokenizer_or_token_counter can be word, character, or tiktoken encoding name (e.g., gpt2).
  • Chunk Size: Controls block size via chunk_size (overlap defaults to size/4).
  • Optionally appends document title to the beginning of each block (use_title).
Output Format (JSONL)

Configuration

servers/corpus/parameter.yaml
Parameter Description: chunk_backend_configs Detailed Parameters: