模型 × 题目对比矩阵
每格展示最终得分(含人工确认后的主观分)、结论与提交次数;加权总分按本次测评配置的能力分类权重折算。
| 参测模型 | FlowShop 订单取消事务修复服务器逻辑修复 | FlowShop 订单报表性能优化速度与资源优化 | 修复订单工作台的键盘误触与焦点丢失网页界面 | 总分 |
|---|---|---|---|---|
| Claude Sonnet 4.5 · Cursor | 100.0通过 · 2 次提交 | 100.0通过 · 1 次提交 | 96.4通过 · 1 次提交 | 98.6加权总分 |
| GPT-5 Codex · Cursor | 100.0通过 · 1 次提交 | 100.0通过 · 2 次提交 | 92.5通过 · 2 次提交 | 97.0加权总分 |
| Gemini 2.5 Pro · Windsurf | 100.0通过 · 3 次提交 | 35.0已终止 · 2 次提交 | 35.0已终止 · 2 次提交 | 54.5加权总分 |
多维能力雷达
功能正确=确定性验收得分;自动测试=验收阶段通过率;代码质量/视觉质量=人工确认后的评审分;一次通过=首次提交即通过的比例。
| 参测模型 | 功能正确 | 自动测试 | 代码质量 | 视觉质量 | 一次通过 |
|---|---|---|---|---|---|
| Claude Sonnet 4.5 · Cursor | 100.0 | 100.0 | 89.5 | 88.0 | 66.7 |
| GPT-5 Codex · Cursor | 100.0 | 100.0 | 87.0 | 75.0 | 33.3 |
| Gemini 2.5 Pro · Windsurf | 61.7 | 71.4 | 72.0 | 待评 | 0.0 |
时间与成本
墙钟时长指从创建工作区到最终验收完成的时间,不代表模型活跃工作时间;评审成本为语义/视觉评审的模型调用花费。
| 参测模型 | 总时长 | 提交次数 | 首次通过率 | 评审 Token | 评审成本 |
|---|---|---|---|---|---|
| Claude Sonnet 4.5 · CursorAnthropic / claude-sonnet-4.5 | 4 小时 53 分钟 | 4 | 67% | 27,376 | $0.106 |
| GPT-5 Codex · CursorOpenAI / gpt-5-codex | 5 小时 31 分钟 | 5 | 33% | 21,032 | $0.095 |
| Gemini 2.5 Pro · WindsurfGoogle / gemini-2.5-pro | 5 小时 51 分钟 | 7 | 0% | 7,454 | $0.025 |
逐题下钻
每道题展开后可以看到各模型的提交时间线、验收阶段结果、评分维度与评审评语;隐藏测试仅展示允许公开的摘要。
FlowShop 订单取消事务修复v1.0.0 · 服务器逻辑修复
Claude Sonnet 4.5 · Cursor通过100.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 取消正确性 | 35% | 100.0 | 自动验收 |
| 事务与幂等 | 65% | 100.0 | 自动验收 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开回归测试硬门槛 | 通过 | 14/14 | 订单取消接口的公开回归测试全部通过。 |
| 事务与幂等验收硬门槛 | 未通过 | 6/9 | 取消流程的幂等或事务一致性仍有未通过项。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开回归测试硬门槛 | 通过 | 14/14 | 订单取消接口的公开回归测试全部通过。 |
| 事务与幂等验收硬门槛 | 通过 | 9/9 | 并发取消、部分回补失败与重复请求场景全部保持一致性。 |
质量评审
三次采样 86 / 88 / 91 → 机器聚合 88.0(方差 4.2)
人工确认 88.0 · 确认机器建议;事务重构清晰,重试路径覆盖完整。
三次采样 85 / 86 / 86 → 机器聚合 86.0(方差 0.2)
等待人工确认
GPT-5 Codex · Cursor通过100.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 取消正确性 | 35% | 100.0 | 自动验收 |
| 事务与幂等 | 65% | 100.0 | 自动验收 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开回归测试硬门槛 | 通过 | 14/14 | 订单取消接口的公开回归测试全部通过。 |
| 事务与幂等验收硬门槛 | 通过 | 9/9 | 并发取消、部分回补失败与重复请求场景全部保持一致性。 |
质量评审
三次采样 90 / 92 / 89 → 机器聚合 90.0(方差 1.6)
人工确认 90.0 · 确认机器建议;一次提交即通过,改动范围克制。
Gemini 2.5 Pro · Windsurf通过100.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 取消正确性 | 35% | 100.0 | 自动验收 |
| 事务与幂等 | 65% | 100.0 | 自动验收 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开回归测试硬门槛 | 未通过 | 11/14 | 取消已发货订单时未返回预期错误码,3 个公开用例未通过。 |
| 事务与幂等验收硬门槛 | 未通过 | 4/9 | 取消流程的幂等或事务一致性仍有未通过项。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开回归测试硬门槛 | 通过 | 14/14 | 订单取消接口的公开回归测试全部通过。 |
| 事务与幂等验收硬门槛 | 未通过 | 6/9 | 取消流程的幂等或事务一致性仍有未通过项。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开回归测试硬门槛 | 通过 | 14/14 | 订单取消接口的公开回归测试全部通过。 |
| 事务与幂等验收硬门槛 | 通过 | 9/9 | 并发取消、部分回补失败与重复请求场景全部保持一致性。 |
质量评审
三次采样 74 / 78 / 76 → 机器聚合 76.0(方差 2.7)
人工确认 72.0 · 下调 4 分:重复代码集中在核心路径,后续维护成本高。
FlowShop 订单报表性能优化v1.0.0 · 速度与资源优化
Claude Sonnet 4.5 · Cursor通过100.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 行为等价 | 35% | 100.0 | 自动验收 |
| 查询与时延 | 65% | 100.0 | 自动验收 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 行为等价回归硬门槛 | 通过 | 12/12 | 订单报表聚合结果与基线实现完全等价。 |
| 大数据性能验收硬门槛 | 通过 | 6/6 | 10 万订单数据集下查询数量与时延均在阈值内。 |
质量评审
三次采样 91 / 90 / 93 → 机器聚合 91.0(方差 1.6)
人工确认 91.0 · 确认机器建议;查询计数断言是加分项。
GPT-5 Codex · Cursor通过100.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 行为等价 | 35% | 100.0 | 自动验收 |
| 查询与时延 | 65% | 100.0 | 自动验收 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 行为等价回归硬门槛 | 通过 | 12/12 | 订单报表聚合结果与基线实现完全等价。 |
| 大数据性能验收硬门槛 | 未通过 | 3/6 | 报表查询数量、时延或行为等价仍有未通过项。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 行为等价回归硬门槛 | 通过 | 12/12 | 订单报表聚合结果与基线实现完全等价。 |
| 大数据性能验收硬门槛 | 通过 | 6/6 | 10 万订单数据集下查询数量与时延均在阈值内。 |
质量评审
三次采样 82 / 84 / 86 → 机器聚合 84.0(方差 2.7)
人工确认 84.0 · 确认机器建议。
Gemini 2.5 Pro · Windsurf已终止35.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 行为等价 | 35% | 100.0 | 自动验收 |
| 查询与时延 | 65% | 0.0 | 自动验收 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 行为等价回归硬门槛 | 通过 | 12/12 | 订单报表聚合结果与基线实现完全等价。 |
| 大数据性能验收硬门槛 | 未通过 | 3/6 | 报表查询数量、时延或行为等价仍有未通过项。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 行为等价回归硬门槛 | 通过 | 12/12 | 订单报表聚合结果与基线实现完全等价。 |
| 大数据性能验收硬门槛 | 未通过 | 3/6 | 报表查询数量、时延或行为等价仍有未通过项。 |
修复订单工作台的键盘误触与焦点丢失v1.0.2 · 网页界面
Claude Sonnet 4.5 · Cursor通过96.4
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 订单处理主流程 | 35% | 100.0 | 自动验收 |
| 键盘、焦点与响应式 | 35% | 100.0 | 自动验收 |
| 页面设计质量 | 30% | 88.0 | 评审模型 + 人工确认 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开订单处理流程硬门槛 | 通过 | 11/11 | 订单筛选、批量操作与详情浮层的公开流程全部通过。 |
| 键盘上下文、焦点与移动端验收硬门槛 | 通过 | 13/13 | 输入上下文、列表键盘导航、弹窗焦点恢复与移动端布局全部通过。 |
| 工作台关键场景截图硬门槛 | 通过 | 4/4 | 桌面与移动端 4 个关键场景截图采集完成。 |
质量评审
三次采样 84 / 86 / 88 → 机器聚合 86.0(方差 2.7)
人工确认 88.0 · 上调 2 分:错误态与空态处理超出题目要求。
GPT-5 Codex · Cursor通过92.5
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 订单处理主流程 | 35% | 100.0 | 自动验收 |
| 键盘、焦点与响应式 | 35% | 100.0 | 自动验收 |
| 页面设计质量 | 30% | 75.0 | 评审模型 + 人工确认 |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开订单处理流程硬门槛 | 通过 | 11/11 | 订单筛选、批量操作与详情浮层的公开流程全部通过。 |
| 键盘上下文、焦点与移动端验收硬门槛 | 未通过 | 9/13 | 输入上下文、列表键盘操作、弹窗焦点恢复或移动端布局仍有未通过项。 |
| 工作台关键场景截图硬门槛 | 通过 | 4/4 | 桌面与移动端 4 个关键场景截图采集完成。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开订单处理流程硬门槛 | 通过 | 11/11 | 订单筛选、批量操作与详情浮层的公开流程全部通过。 |
| 键盘上下文、焦点与移动端验收硬门槛 | 通过 | 13/13 | 输入上下文、列表键盘导航、弹窗焦点恢复与移动端布局全部通过。 |
| 工作台关键场景截图硬门槛 | 通过 | 4/4 | 桌面与移动端 4 个关键场景截图采集完成。 |
质量评审
三次采样 76 / 78 / 80 → 机器聚合 78.0(方差 2.7)
人工确认 75.0 · 下调 3 分:移动端遮挡问题在真机复核中确认存在。
Gemini 2.5 Pro · Windsurf已终止35.0
评分维度
| 维度 | 权重 | 得分 | 来源 |
|---|---|---|---|
| 订单处理主流程 | 35% | 100.0 | 自动验收 |
| 键盘、焦点与响应式 | 35% | 0.0 | 自动验收 |
| 页面设计质量 | 30% | 待评 | 评审模型(待确认) |
提交与验收过程
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开订单处理流程硬门槛 | 未通过 | 9/11 | 批量选择后执行发货操作时列表状态未同步,2 个公开用例未通过。 |
| 键盘上下文、焦点与移动端验收硬门槛 | 未通过 | 7/13 | 输入上下文、列表键盘操作、弹窗焦点恢复或移动端布局仍有未通过项。 |
| 工作台关键场景截图硬门槛 | 未通过 | 2/4 | 公开流程未通过,关键场景截图仅完成 2 个。 |
| 验收阶段 | 结果 | 用例 | 摘要 |
|---|---|---|---|
| 公开订单处理流程硬门槛 | 通过 | 11/11 | 订单筛选、批量操作与详情浮层的公开流程全部通过。 |
| 键盘上下文、焦点与移动端验收硬门槛 | 未通过 | 9/13 | 输入上下文、列表键盘操作、弹窗焦点恢复或移动端布局仍有未通过项。 |
| 工作台关键场景截图硬门槛 | 通过 | 4/4 | 桌面与移动端 4 个关键场景截图采集完成。 |