skills-eval/eval_framework
wanjia 8574ad5c79 feat: 添加评估框架核心代码
- checker.py: 确定性检查器 + CHECK_REGISTRY 注册表模式
- models.py: Pydantic 数据模型(EvalCase, CheckResult 等)
- runner.py: 评估运行器
- benchmark.py: Benchmark 聚合与报告生成
- llm_judge.py: LLM-as-Judge 语义评估
- config.py: 框架配置
2026-06-12 16:24:36 +08:00
..
__init__.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00
benchmark.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00
checker.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00
config.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00
llm_judge.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00
models.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00
runner.py feat: 添加评估框架核心代码 2026-06-12 16:24:36 +08:00