<aside> 📊
这是一份数据集,不是一份榜单。
同一批中文 Excel 任务,交给 13 个「模型 × 运行环境」的组合各跑一次,记录耗时、是否一次跑通、在哪里失败,并保留 AI 实际产出的表格文件。每格样本量为 1——它能告诉你 AI 在这类任务上会怎么翻车,不足以支持谁比谁强的排名。
</aside>
| 项 | 数值 | 说明 |
|---|---|---|
| 受测配置 | 13 | 覆盖第一方专用插件、第三方通用壳、一体化办公产品、通用 agent 四类 |
| 实跑运行记录 | 142 | 每格 n=1,未跑的占位行不计入 |
| 附 AI 产出文件 | 140 | 其余 2 条为超时或未能完成,无产出(见下「覆盖范围」) |
| 测试窗口 | 2026 年 8 月底 | 测试时均使用当时能用到的最新的模型及载体版本,测试日期可见「测试日期」列。 |
142 条记录不是「12 题 × 13 配置」的完整矩阵。以下配置没有跑满全部 12 道题,不能直接拿均值与其他配置横向比较:
| 受测配置 | 实跑题数 | 未跑的题 | 主要原因 |
|---|---|---|---|
| Kimi Work | 3 / 12 | 只跑了 A01、A02、A03 三道 L1/L2,缺 A04–A11 与 Q11 | Kimi K3 作为底层模型,免费额度过低,大部分任务复杂度高,不足以支撑。 |
| Kimi-K3 @ Pi | 9 / 12 | A01、A02、A03 | Kimi K3 已在 Kimi Work 中测试过这三题 |
| Workbuddy (Auto) | 11 / 12 | A11 | 任务复杂度高,综合过往表现决定不跑。 |
| Workbuddy (Hy3) | 11 / 12 | A11 | 任务复杂度高,综合过往表现决定不跑。 |
| 其余 9 个配置 | 12 / 12 | — |
另有 2 条记录计入了运行记录、但没有可下载的产出文件:A10 × Workbuddy (Hy3)(跑了 40 分钟未解决问题)、A11 × Kimi-K3 @ Pi(输出 token 上限死锁)。这两条的「L3 无硬编码」未勾,含义是「无产出可判」而非「写死了值」。