工程基建主线项目
DevBench Local · AI 模型能力评测平台
把「哪个模型代码写得好」变成可复现的工程问题:隔离环境 + 确定性验收 + 三层评分。
- 角色
- 独立设计开发
- 周期
- 2026 - 至今
- 状态
- MVP 发布候选,含正式 Release Audit(AC-001~AC-016)
TypeScriptFastifyReactViteDockerGit WorktreeDeepEval
背景与问题
想比较多个 IDE 里不同大模型完成真实开发任务的能力,但手工复制项目、手工记录结果的做法存在初始条件不一致、工作目录互相污染、主观评分受裁判模型偏差影响等问题。这个项目把「测评」本身变成一套可复用、可信任的工程化流程。
我的角色
独立完成产品定义、架构设计、前后端开发。先写 14 份规格文档(PRD、系统架构、验收评分、语义评测契约等)收敛需求,再落地实现。
架构示意
Web 管理界面(Vite / React)
Fastify Server(TypeScript Monorepo · 11 个内部包)
Git Worktree 隔离工作区
Docker 确定性验收
DeepEval 语义评测 + 视觉模型盲评 + 人工确认(三层评分)
技术方案
- 为每个 IDE/模型组合创建隔离 Git Worktree,统一下发题目和提示词,避免工作目录互相污染
- 每轮修复保存代码快照,Docker 中执行确定性验收(前端视觉/交互 + 后端功能)
- 语义评测(DeepEval 隔离 Runner)+ 视觉模型盲评 + 人工确认三层叠加,缓解裁判模型偏差
- 生成单题横向对比报告和多题综合能力报告
核心难点与取舍
让「测评」本身可信:裁判模型天然存在位置偏差和同厂偏好。取舍是不依赖单次 LLM 打分,用三层评分叠加换可信度,并在文档中记录每类评分的校准方式和模型网关扩展模式。
成果指标
4.4 万
行代码 · 324 个源文件
11 个
Monorepo 内部包
16 项
Release Audit 验收项
成果
- 完整实现选题 → 统一提示词 → 隔离工作区 → 自动验收 → 人工确认评价的全链路
- 沉淀一套可复用的「AI 能力测评」方法论文档体系
- 单文件样例报告可直接外发(见下方链接)