作用
Benchmark Server 用于加载评测数据集,常用于基准测试、问答任务或生成任务中的数据配置阶段。我们强烈推荐将数据预处理为
.jsonl格式。data/sample_nq_10.jsonl
使用示例
基本用法
examples/load_data.yaml
examples/parameters/load_data_parameter.yaml
新增加载数据集字段
在某些情况下,我们可能不仅需要加载query 与 ground_truth 字段,还希望使用数据集中的其他信息,如已检索的 passage。
此时,可以通过修改 Benchmark Server 的代码,新增需要返回的字段。
你可以用相同方式扩展其他字段(例如 cot、retrieved_passages 等),只需在装饰器输出与 key_map 中同步添加对应键名即可。
如果你有生成好的结果(如 pred 字段),可以配合 Evaluation Server 一同使用,实现快速评估。
get_data 函数中新增 id_ls 字段:
servers/prompt/src/benchmark.py
id_ls 并指定其在原始数据中的对应键名:
examples/parameters/load_data_parameter.yaml