📊 WorkBuddy vs QoderWork 效果&成本对比评测报告

覆盖产品:WorkBuddy 5.1.5QoderWork CN 0.5.13
评测模型:GLM-5.2  Deepseek-V4-Pro
统计口径:每条样本各跑 3 轮,逐轮记录 → 取可用轮次中位数 → 分难度取均值
评测集:开源评测集(SWE-Bench) + WorkBuddy 自建评测集(包含:日常办公 / 数据分析 / 图片生成 / PPT 制作 / 文档总结 等维度),共 10 条样本 (简单 4 · 中等 3 · 较难 3)
生成时间:2026-06-22 23:38
📖 任务难度说明
· 简单:5–15 min,单文件改动;逻辑直白的简单任务。(例:修改一个代码缺陷)
· 中等:15 min – 30 min,涉及 2–3 个文件,涉及新增任务、外部工具逻辑调用。(例:生成一份调研报告)
· 较难:30–60 min,长程任务 / 多文件的修改;任务需设计意图或跨任务、跨系统关联关系。(例:设计一个复杂系统)
📦 配套:WorkBuddy 企业测评样板间
本报告所用评测集已打包提供,含 SWE-Bench 标准用例 5 个 + WorkBuddy 自建办公场景 5 个(PPT / 文档 / PRD / 数据可视化),附测评指引与自动验证脚本,可独立复现本报告或扩展为企业自有测评集。
⬇ 下载测评样板间(.zip)
📊 Part 1 · 核心结论对比
📌 总结
【GLM-5.2】WorkBuddy 在 简单/较难任务 Token 全面占优简单档 Money 也更低中等任务 Money/Credit 略高于 QoderWork。解决率 WB 97% vs QB 93%WB 优势在较难档任务(89% vs 78%,↑11.1pp),简单/中等持平。
【DeepSeek-V4-Pro】WorkBuddy 在 三档任务 Money / Credit 全面优于 QoderWork;仅 中等任务 Token ↑6.8% 为唯一劣势项,幅度已显著收窄。解决率 WB 90% vs QB 83%WB 优势在较难档任务(67% vs 44%,↑22.2pp)
【GLM-5.2】WorkBuddy vs QoderWork
✅ WorkBuddy 优势
简单全面占优
  • Token ↓43.3% (771K vs 1.36M)
  • Credit ↓9.9% (50.7 vs 56.3)
  • Money ↓23.8% (¥1.47 vs ¥1.93)
  • 解决率 持平 (100% vs 100%)
中等
  • Token ↓29.5% (1.77M vs 2.52M)
  • 解决率 持平 (100% vs 100%)
较难
  • Token ↓28.9% (2.29M vs 3.22M)
  • Money ↓2.7% (¥4.74 vs ¥4.87)
  • 解决率 ↑11.1pp (89% vs 78%,8/9 vs 7/9)
❌ WorkBuddy 劣势
中等
  • Credit ↑18.4% (104.1 vs 87.9)
  • Money ↑10.2% (¥3.02 vs ¥2.74)
较难
  • Credit ↑3.8% (163.4 vs 157.4)
【DeepSeek-V4-Pro】WorkBuddy vs QoderWork
✅ WorkBuddy 优势 Money / Credit 三档全面占优
简单全面占优
  • Token ↓0.3% (629K vs 631K)
  • Credit ↓76.1% (5.7 vs 23.8)
  • Money ↓76.4% (¥0.17 vs ¥0.70)
  • 解决率 持平 (100% vs 100%)
中等
  • Credit ↓69.8% (10.6 vs 34.6)
  • Money ↓71.3% (¥0.31 vs ¥1.06)
  • 解决率 持平 (100% vs 100%)
较难全面占优
  • Token ↓27.7% (1.59M vs 2.20M)
  • Credit ↓81.1% (11.8 vs 62.8)
  • Money ↓82.1% (¥0.34 vs ¥1.92)
  • 解决率 ↑22.2pp (67% vs 44%,6/9 vs 4/9)
❌ WorkBuddy 劣势
中等
  • Token ↑6.8% (805K vs 754K) — 唯一劣势项,但 Money 仍 ↓71.3%

计价口径:WorkBuddy 与 QoderWork 使用的模型服务来源和计费策略不同,Token / Credit / Money 不能简单线性换算;Money 反映本次评测中各自内置模型服务形态下的实际消耗。补充限制:WorkBuddy 当前暂不支持采集自定义模型 Token 消耗,QoderWork 当前暂不支持接入自定义模型。

📊 Part 2 · 关键发现与选型建议
💡 核心发现
1
Token 与 Money 不完全同步:DeepSeekV4 + WorkBuddy 在中等难度上 Token ↑6.8%,但 Money ↓71.3%金额差异不能只归因于定价,还受模型输出长度、工具调用路径、上下文轮次、执行策略和计费口径共同影响。
2
GLM-5.2 仅中等难度需关注:GLM-5.2 + WorkBuddy Token 全面节省(简单 ↓43.3%、较难 ↓28.9%),Money 简单/较难均更低,仅中等难度 Money ↑10.2%,成本敏感时建议结合具体任务评估。
3
DeepSeek-V4-Pro 综合最优:DeepSeekV4 + WorkBuddy 三档 Money 全面下降(简单 ↓76.4%、中等 ↓71.3%、较难 ↓82.1%),解决率 90% vs QoderWork 83%。效果与成本在本次样本中表现最均衡。
🎯效果维度任务解决率
最高:GLM + WorkBuddy97%
最低:DeepSeek + QoderWork83%
WorkBuddy 在两模型上均优于 QoderWork
🪙Token 效率全难度均值
最低:DeepSeek + WorkBuddy1.00M
最高:GLM + QoderWork2.36M
WorkBuddy 在两个模型 Token 均低于 QoderWork
💰金钱成本全难度均值
最低:DeepSeek + WorkBuddy¥0.24
最高:GLM + QoderWork¥3.18
⚠ 差异来自模型行为、调用路径与计费口径等多因素
🏆综合性价比ROI = 解决率÷Money
最高:DeepSeek + WorkBuddy378
最低:GLM + QoderWork29
DeepSeek + WorkBuddy 在本次口径下综合表现更优
📋 Part 3 · 明细数据
逐样本中位数对比:每条样本取可用轮次中位数,用于快速定位样本级优劣;绿底为更优、红底为更差。
DeepseekDeepseek-V4-Pro · 逐样本中位数对比(10 条)
绿底 该指标更优 · 红底 该指标更差
难度#样本WorkBuddy + Deepseek-V4-ProQoderWork + Deepseek-V4-Pro
TokenCredit金额解决TokenCredit金额解决
简单1sympy__sympy-19954705K5.5¥0.163/3422K20.1¥0.593/3
简单2sympy__sympy-24539473K3.8¥0.113/3191K3.7¥0.103/3
中等3django__django-15561850K6.9¥0.203/31.09M27.9¥0.923/3
中等4psf__requests-1142715K5.5¥0.163/3586K44.9¥1.323/3
较难5matplotlib__matplotlib-206763.33M19.0¥0.552/34.16M97.4¥2.870/3
简单6sft_20260503_043924_d3aa51967K8.6¥0.253/3744K35.2¥1.053/3
简单7sft_20260515_040512_b232b5370K4.8¥0.143/31.17M36.1¥1.063/3
中等8sft_20260515_115707_60fb7c830K11.0¥0.323/3585K31.0¥0.933/3
较难9sft_20260516_085129_1b725d563K7.6¥0.222/31.32M39.0¥1.353/3
较难10sft_20260515_144219_381535877K9.0¥0.262/31.13M52.0¥1.541/3
GLMGLM-5.2 · 逐样本中位数对比(10 条)
绿底 该指标更优 · 红底 该指标更差
难度#样本WorkBuddy + GLM-5.2QoderWork + GLM-5.2
TokenCredit金额解决TokenCredit金额解决
简单1sympy__sympy-199541.15M72.0¥2.093/31.84M58.2¥2.313/3
简单2sympy__sympy-24539998K58.0¥1.683/3533K49.3¥1.933/3
中等3django__django-155614.08M222¥6.443/33.97M127¥3.733/3
中等4psf__requests-1142522K38.0¥1.103/31.65M48.0¥1.863/3
较难5matplotlib__matplotlib-206764.30M246¥7.133/31.28M34.9¥1.391/3
简单6sft_20260503_043924_d3aa51532K41.7¥1.213/32.30M64.1¥1.893/3
简单7sft_20260515_040512_b232b5403K31.0¥0.903/3774K53.5¥1.573/3
中等8sft_20260515_115707_60fb7c717K52.2¥1.513/31.93M89.1¥2.623/3
较难9sft_20260516_085129_1b725d1.36M107¥3.113/31.93M134¥4.123/3
较难10sft_20260515_144219_3815351.20M137¥3.982/36.44M303¥9.093/3
📊 Part 4 · 分难度三指标对比
Deepseek Deepseek-V4-Pro | QoderWork 侧数据覆盖 Token 100%Credit 100%Money 100%
🔤 Token 消耗 (K)
💳 Credit 消耗
💴 Money 金额 (¥)
结论:Deepseek + WorkBuddy 在 Credit/Money 上整体优于 QoderWork,Money 三档分别 简单 ↓76.4% · 中等 ↓71.3% · 较难 ↓82.1%。中等难度 Token 更高但 Money 更低,说明金额结果受模型输出、工具调用路径、上下文轮次和计费口径等因素共同影响,不能仅按 Token 判断。
GLM GLM-5.2 | QoderWork 侧数据覆盖 Token 100%Credit 100%Money 100%
🔤 Token 消耗 (K)
💳 Credit 消耗
💴 Money 金额 (¥)
结论:GLM-5.2 + WorkBuddy Token 全面节省,Money 三档分别 简单 ↓23.6% · 中等 ↑10.2% · 较难 ↓2.6%。这说明 Token 降低与金额变化不完全同步,仍需结合模型行为、执行路径、上下文规模、重试/工具调用情况和计费口径综合判断
💰 跨模型 Money 全景对比
本次样本下:Deepseek + WorkBuddy 在各难度 Money 表现最低GLM 两侧 Money 绝对值显著更高。该结果是模型行为、执行路径与计费口径共同作用的观测值;虚线 = QoderWork 侧数据包含缺失样本。