Skip to content

Latest commit

 

History

History
25 lines (13 loc) · 1.45 KB

File metadata and controls

25 lines (13 loc) · 1.45 KB

设计原则

调用与评分分离

调用层负责取得回答并记录运行状态,评分层读取已经保存的回答。参考标注、字段规则和评分结果独立保存,可用于不同的模型运行方式。

首次回答优先

没有取得回答的网络失败可以重试。取得回答后,不因 JSON 错误、字段缺失或原文依据不足而重新调用。格式问题和内容问题本身就是评测结果。

失败类型分离

network_error 表示未取得回答,包括连接中断、超时和非成功 HTTP 状态。content_error 表示外部服务或命令已经结束,但传输包中没有可读取的回答文本。answered 只表示取得文本,不表示文本正确。

原始文本约束

字段值与原文依据分开检查。依据必须是输入文本中的连续片段,这可以发现一部分无原文支持的输出,但不能证明模型对引文的理解正确。需要较高可靠性时,仍应复核依据与字段值之间的关系。

可追溯结果

每个运行单元单独写文件,并记录文本、提示和模型标识。提示与原文保存 SHA-256,便于检查不同运行是否使用了同一输入。项目默认不在结果文件中重复保存原文,以降低不必要的数据复制。

可替换适配器

适配器实现 generate(prompt) -> AdapterResponse。项目内置 OpenAI-compatible 与命令行两种适配器,新增适配器时无需改动运行器和评分器。