Commit Graph

5 Commits

Author SHA1 Message Date
wanjia baadd47b0d chore: 移除 agent 定义文件,添加 skills 目录占位
- 移除 skills/product-design-agent.md(skill 内容不提交到仓库)
- 添加 skills/.gitkeep 保持目录结构
2026-06-12 16:37:57 +08:00
wanjia 42ec02e4f0 feat: 添加评测配置和运行脚本
评测配置:
- evals/product-design-module/: 产品设计 skill 评测场景和自定义检查
- evals/web-creator/: 网页生成 skill 评测场景和自定义检查
- evals/web-design-summary/: 网页设计摘要 skill 评测场景和自定义检查

运行脚本:
- run_llm_eval_web.py: Web skill LLM 评测(支持 web-creator/web-design-summary)
- run_llm_eval_v2_full.py: 产品设计 skill LLM 评测(完整版)
- run_llm_eval_v2.py: 产品设计 skill LLM 评测(v2)
- run_llm_eval.py: 产品设计 skill LLM 评测(初版)
- run_eval.py: 框架内置评估运行器
- run_real_eval.py: 真实 sub-agent 评估脚本
- benchmark_report.py: Benchmark 报告生成

Agent 定义:
- skills/product-design-agent.md: 产品设计 Agent 角色定义
2026-06-12 16:25:25 +08:00
wanjia be8d92e8c7 docs: 添加评估方法论文档
- research.md: 深度 Research 报告(评估方法论、工具调研)
- eval-framework-guide.md: 框架使用说明(API、配置、扩展)
- skill-eval-optimization-guide.md: 评测优化指南(实战经验、迭代案例、检查清单)
- eval.md: 评估参考链接汇总
2026-06-12 16:24:58 +08:00
wanjia 8574ad5c79 feat: 添加评估框架核心代码
- checker.py: 确定性检查器 + CHECK_REGISTRY 注册表模式
- models.py: Pydantic 数据模型(EvalCase, CheckResult 等)
- runner.py: 评估运行器
- benchmark.py: Benchmark 聚合与报告生成
- llm_judge.py: LLM-as-Judge 语义评估
- config.py: 框架配置
2026-06-12 16:24:36 +08:00
wanjia b4364c3d42 chore: 初始化项目仓库
添加 .gitignore(排除 skills 内容、eval_output、__pycache__)
添加 README.md(项目介绍、结构说明、快速开始)
2026-06-12 16:24:27 +08:00