DevBench Local

FlowShop 三模型全栈对比 · 演示数据

生成于 2026-07-20 15:31 · 本地测评对比报告 · 单文件可离线查看

参测模型3
题目数量3
模型答题记录9
结果可比性可以比较

模型 × 题目对比矩阵

每格展示最终得分(含人工确认后的主观分)、结论与提交次数;加权总分按本次测评配置的能力分类权重折算。

参测模型FlowShop 订单取消事务修复服务器逻辑修复FlowShop 订单报表性能优化速度与资源优化修复订单工作台的键盘误触与焦点丢失网页界面总分
Claude Sonnet 4.5 · Cursor100.0通过 · 2 次提交100.0通过 · 1 次提交96.4通过 · 1 次提交98.6加权总分
GPT-5 Codex · Cursor100.0通过 · 1 次提交100.0通过 · 2 次提交92.5通过 · 2 次提交97.0加权总分
Gemini 2.5 Pro · Windsurf100.0通过 · 3 次提交35.0已终止 · 2 次提交35.0已终止 · 2 次提交54.5加权总分

多维能力雷达

功能正确=确定性验收得分;自动测试=验收阶段通过率;代码质量/视觉质量=人工确认后的评审分;一次通过=首次提交即通过的比例。

功能正确自动测试代码质量视觉质量一次通过
参测模型功能正确自动测试代码质量视觉质量一次通过
Claude Sonnet 4.5 · Cursor100.0100.089.588.066.7
GPT-5 Codex · Cursor100.0100.087.075.033.3
Gemini 2.5 Pro · Windsurf61.771.472.0待评0.0

时间与成本

墙钟时长指从创建工作区到最终验收完成的时间,不代表模型活跃工作时间;评审成本为语义/视觉评审的模型调用花费。

参测模型总时长提交次数首次通过率评审 Token评审成本
Claude Sonnet 4.5 · CursorAnthropic / claude-sonnet-4.54 小时 53 分钟467%27,376$0.106
GPT-5 Codex · CursorOpenAI / gpt-5-codex5 小时 31 分钟533%21,032$0.095
Gemini 2.5 Pro · WindsurfGoogle / gemini-2.5-pro5 小时 51 分钟70%7,454$0.025

逐题下钻

每道题展开后可以看到各模型的提交时间线、验收阶段结果、评分维度与评审评语;隐藏测试仅展示允许公开的摘要。

FlowShop 订单取消事务修复v1.0.0 · 服务器逻辑修复

Claude Sonnet 4.5 · Cursor通过100.02 次提交 · 1 小时 45 分钟 · 评审 $0.052

评分维度

维度权重得分来源
取消正确性35%100.0自动验收
事务与幂等65%100.0自动验收

提交与验收过程

第 1 次提交2026-07-08 09:41 · 2 个文件 · +70 -23 · 验收未通过 · 确定性得分 35.0
验收阶段结果用例摘要
公开回归测试硬门槛通过14/14订单取消接口的公开回归测试全部通过。
事务与幂等验收硬门槛未通过6/9取消流程的幂等或事务一致性仍有未通过项。
第 2 次提交2026-07-08 10:07 · 2 个文件 · +71 -12 · 验收通过 · 确定性得分 100.0
验收阶段结果用例摘要
公开回归测试硬门槛通过14/14订单取消接口的公开回归测试全部通过。
事务与幂等验收硬门槛通过9/9并发取消、部分回补失败与重复请求场景全部保持一致性。

质量评审

通用实现质量主评 · anthropic / claude-opus-4.1同厂评审警告

三次采样 86 / 88 / 91 → 机器聚合 88.0(方差 4.2)

人工确认 88.0 · 确认机器建议;事务重构清晰,重试路径覆盖完整。

通用实现质量跨供应商复评 · openai / gpt-5

三次采样 85 / 86 / 86 → 机器聚合 86.0(方差 0.2)

等待人工确认

GPT-5 Codex · Cursor通过100.01 次提交 · 1 小时 18 分钟 · 评审 $0.032

评分维度

维度权重得分来源
取消正确性35%100.0自动验收
事务与幂等65%100.0自动验收

提交与验收过程

第 1 次提交2026-07-08 09:38 · 2 个文件 · +67 -23 · 验收通过 · 确定性得分 100.0
验收阶段结果用例摘要
公开回归测试硬门槛通过14/14订单取消接口的公开回归测试全部通过。
事务与幂等验收硬门槛通过9/9并发取消、部分回补失败与重复请求场景全部保持一致性。

质量评审

通用实现质量主评 · anthropic / claude-opus-4.1

三次采样 90 / 92 / 89 → 机器聚合 90.0(方差 1.6)

人工确认 90.0 · 确认机器建议;一次提交即通过,改动范围克制。

Gemini 2.5 Pro · Windsurf通过100.03 次提交 · 2 小时 34 分钟 · 评审 $0.025

评分维度

维度权重得分来源
取消正确性35%100.0自动验收
事务与幂等65%100.0自动验收

提交与验收过程

第 1 次提交2026-07-08 09:52 · 1 个文件 · +39 -14 · 验收未通过 · 确定性得分 0.0
验收阶段结果用例摘要
公开回归测试硬门槛未通过11/14取消已发货订单时未返回预期错误码,3 个公开用例未通过。
事务与幂等验收硬门槛未通过4/9取消流程的幂等或事务一致性仍有未通过项。
第 2 次提交2026-07-08 10:24 · 1 个文件 · +27 -11 · 验收未通过 · 确定性得分 35.0
验收阶段结果用例摘要
公开回归测试硬门槛通过14/14订单取消接口的公开回归测试全部通过。
事务与幂等验收硬门槛未通过6/9取消流程的幂等或事务一致性仍有未通过项。
第 3 次提交2026-07-08 10:58 · 2 个文件 · +40 -13 · 验收通过 · 确定性得分 100.0
验收阶段结果用例摘要
公开回归测试硬门槛通过14/14订单取消接口的公开回归测试全部通过。
事务与幂等验收硬门槛通过9/9并发取消、部分回补失败与重复请求场景全部保持一致性。

质量评审

通用实现质量主评 · anthropic / claude-opus-4.1

三次采样 74 / 78 / 76 → 机器聚合 76.0(方差 2.7)

人工确认 72.0 · 下调 4 分:重复代码集中在核心路径,后续维护成本高。

FlowShop 订单报表性能优化v1.0.0 · 速度与资源优化

Claude Sonnet 4.5 · Cursor通过100.01 次提交 · 1 小时 29 分钟 · 评审 $0.026

评分维度

维度权重得分来源
行为等价35%100.0自动验收
查询与时延65%100.0自动验收

提交与验收过程

第 1 次提交2026-07-08 14:38 · 2 个文件 · +127 -58 · 验收通过 · 确定性得分 100.0
验收阶段结果用例摘要
行为等价回归硬门槛通过12/12订单报表聚合结果与基线实现完全等价。
大数据性能验收硬门槛通过6/610 万订单数据集下查询数量与时延均在阈值内。

质量评审

通用实现质量主评 · anthropic / claude-opus-4.1同厂评审警告

三次采样 91 / 90 / 93 → 机器聚合 91.0(方差 1.6)

人工确认 91.0 · 确认机器建议;查询计数断言是加分项。

GPT-5 Codex · Cursor通过100.02 次提交 · 2 小时 2 分钟 · 评审 $0.031

评分维度

维度权重得分来源
行为等价35%100.0自动验收
查询与时延65%100.0自动验收

提交与验收过程

第 1 次提交2026-07-08 14:38 · 1 个文件 · +49 -31 · 验收未通过 · 确定性得分 35.0
验收阶段结果用例摘要
行为等价回归硬门槛通过12/12订单报表聚合结果与基线实现完全等价。
大数据性能验收硬门槛未通过3/6报表查询数量、时延或行为等价仍有未通过项。
第 2 次提交2026-07-08 15:16 · 2 个文件 · +80 -25 · 验收通过 · 确定性得分 100.0
验收阶段结果用例摘要
行为等价回归硬门槛通过12/12订单报表聚合结果与基线实现完全等价。
大数据性能验收硬门槛通过6/610 万订单数据集下查询数量与时延均在阈值内。

质量评审

通用实现质量主评 · anthropic / claude-opus-4.1

三次采样 82 / 84 / 86 → 机器聚合 84.0(方差 2.7)

人工确认 84.0 · 确认机器建议。

Gemini 2.5 Pro · Windsurf已终止35.02 次提交 · 1 小时 34 分钟

评分维度

维度权重得分来源
行为等价35%100.0自动验收
查询与时延65%0.0自动验收

提交与验收过程

第 1 次提交2026-07-08 14:46 · 1 个文件 · +41 -22 · 验收未通过 · 确定性得分 35.0
验收阶段结果用例摘要
行为等价回归硬门槛通过12/12订单报表聚合结果与基线实现完全等价。
大数据性能验收硬门槛未通过3/6报表查询数量、时延或行为等价仍有未通过项。
第 2 次提交2026-07-08 15:32 · 1 个文件 · +29 -15 · 验收未通过 · 确定性得分 35.0
验收阶段结果用例摘要
行为等价回归硬门槛通过12/12订单报表聚合结果与基线实现完全等价。
大数据性能验收硬门槛未通过3/6报表查询数量、时延或行为等价仍有未通过项。

修复订单工作台的键盘误触与焦点丢失v1.0.2 · 网页界面

Claude Sonnet 4.5 · Cursor通过96.41 次提交 · 1 小时 39 分钟 · 评审 $0.028

评分维度

维度权重得分来源
订单处理主流程35%100.0自动验收
键盘、焦点与响应式35%100.0自动验收
页面设计质量30%88.0评审模型 + 人工确认

提交与验收过程

第 1 次提交2026-07-08 12:16 · 3 个文件 · +191 -62 · 验收通过
验收阶段结果用例摘要
公开订单处理流程硬门槛通过11/11订单筛选、批量操作与详情浮层的公开流程全部通过。
键盘上下文、焦点与移动端验收硬门槛通过13/13输入上下文、列表键盘导航、弹窗焦点恢复与移动端布局全部通过。
工作台关键场景截图硬门槛通过4/4桌面与移动端 4 个关键场景截图采集完成。

质量评审

订单工作台设计质量主评 · google / gemini-2.5-pro

三次采样 84 / 86 / 88 → 机器聚合 86.0(方差 2.7)

人工确认 88.0 · 上调 2 分:错误态与空态处理超出题目要求。

GPT-5 Codex · Cursor通过92.52 次提交 · 2 小时 11 分钟 · 评审 $0.031

评分维度

维度权重得分来源
订单处理主流程35%100.0自动验收
键盘、焦点与响应式35%100.0自动验收
页面设计质量30%75.0评审模型 + 人工确认

提交与验收过程

第 1 次提交2026-07-08 12:16 · 2 个文件 · +137 -47 · 验收未通过
验收阶段结果用例摘要
公开订单处理流程硬门槛通过11/11订单筛选、批量操作与详情浮层的公开流程全部通过。
键盘上下文、焦点与移动端验收硬门槛未通过9/13输入上下文、列表键盘操作、弹窗焦点恢复或移动端布局仍有未通过项。
工作台关键场景截图硬门槛通过4/4桌面与移动端 4 个关键场景截图采集完成。
第 2 次提交2026-07-08 12:53 · 2 个文件 · +75 -28 · 验收通过
验收阶段结果用例摘要
公开订单处理流程硬门槛通过11/11订单筛选、批量操作与详情浮层的公开流程全部通过。
键盘上下文、焦点与移动端验收硬门槛通过13/13输入上下文、列表键盘导航、弹窗焦点恢复与移动端布局全部通过。
工作台关键场景截图硬门槛通过4/4桌面与移动端 4 个关键场景截图采集完成。

质量评审

订单工作台设计质量主评 · google / gemini-2.5-pro

三次采样 76 / 78 / 80 → 机器聚合 78.0(方差 2.7)

人工确认 75.0 · 下调 3 分:移动端遮挡问题在真机复核中确认存在。

Gemini 2.5 Pro · Windsurf已终止35.02 次提交 · 1 小时 43 分钟

评分维度

维度权重得分来源
订单处理主流程35%100.0自动验收
键盘、焦点与响应式35%0.0自动验收
页面设计质量30%待评评审模型(待确认)

提交与验收过程

第 1 次提交2026-07-08 12:24 · 1 个文件 · +87 -30 · 验收未通过
验收阶段结果用例摘要
公开订单处理流程硬门槛未通过9/11批量选择后执行发货操作时列表状态未同步,2 个公开用例未通过。
键盘上下文、焦点与移动端验收硬门槛未通过7/13输入上下文、列表键盘操作、弹窗焦点恢复或移动端布局仍有未通过项。
工作台关键场景截图硬门槛未通过2/4公开流程未通过,关键场景截图仅完成 2 个。
第 2 次提交2026-07-08 13:09 · 2 个文件 · +56 -23 · 验收未通过
验收阶段结果用例摘要
公开订单处理流程硬门槛通过11/11订单筛选、批量操作与详情浮层的公开流程全部通过。
键盘上下文、焦点与移动端验收硬门槛未通过9/13输入上下文、列表键盘操作、弹窗焦点恢复或移动端布局仍有未通过项。
工作台关键场景截图硬门槛通过4/4桌面与移动端 4 个关键场景截图采集完成。