EvalForge

模型评测:候选与参考文本逐项打分(BLEU-4、ROUGE-L/N、token F1、精确匹配、编辑相似度),支持批量成对评测与 pass@k 估算 · 单文件 · 零依赖 · 本地优先

候选输出

参考答案

评测结果

pass@k 估算

批量评测(每行:候选 | 参考)

零依赖 离线可用 数据不出本机 旗舰