韦建生
工程基建主线项目

DevBench Local · AI 模型能力评测平台

把「哪个模型代码写得好」变成可复现的工程问题:隔离环境 + 确定性验收 + 三层评分。

角色
独立设计开发
周期
2026 - 至今
状态
MVP 发布候选,含正式 Release Audit(AC-001~AC-016)
TypeScriptFastifyReactViteDockerGit WorktreeDeepEval

背景与问题

想比较多个 IDE 里不同大模型完成真实开发任务的能力,但手工复制项目、手工记录结果的做法存在初始条件不一致、工作目录互相污染、主观评分受裁判模型偏差影响等问题。这个项目把「测评」本身变成一套可复用、可信任的工程化流程。

我的角色

独立完成产品定义、架构设计、前后端开发。先写 14 份规格文档(PRD、系统架构、验收评分、语义评测契约等)收敛需求,再落地实现。

架构示意

Web 管理界面(Vite / React)
Fastify Server(TypeScript Monorepo · 11 个内部包)
Git Worktree 隔离工作区
Docker 确定性验收
DeepEval 语义评测 + 视觉模型盲评 + 人工确认(三层评分)
324 个源文件 · 约 4.4 万行代码 · 14 份规格文档先行

技术方案

  • 为每个 IDE/模型组合创建隔离 Git Worktree,统一下发题目和提示词,避免工作目录互相污染
  • 每轮修复保存代码快照,Docker 中执行确定性验收(前端视觉/交互 + 后端功能)
  • 语义评测(DeepEval 隔离 Runner)+ 视觉模型盲评 + 人工确认三层叠加,缓解裁判模型偏差
  • 生成单题横向对比报告和多题综合能力报告

核心难点与取舍

让「测评」本身可信:裁判模型天然存在位置偏差和同厂偏好。取舍是不依赖单次 LLM 打分,用三层评分叠加换可信度,并在文档中记录每类评分的校准方式和模型网关扩展模式。

成果指标

4.4 万

行代码 · 324 个源文件

11 个

Monorepo 内部包

16 项

Release Audit 验收项

成果

  • 完整实现选题 → 统一提示词 → 隔离工作区 → 自动验收 → 人工确认评价的全链路
  • 沉淀一套可复用的「AI 能力测评」方法论文档体系
  • 单文件样例报告可直接外发(见下方链接)

链接