<aside> 📊

这是一份数据集,不是一份榜单。

同一批中文 Excel 任务,交给 13 个「模型 × 运行环境」的组合各跑一次,记录耗时、是否一次跑通、在哪里失败,并保留 AI 实际产出的表格文件。每格样本量为 1——它能告诉你 AI 在这类任务上会怎么翻车,不足以支持谁比谁强的排名。

</aside>

快速开始

数据集速览

数值 说明
受测配置 13 覆盖第一方专用插件、第三方通用壳、一体化办公产品、通用 agent 四类
实跑运行记录 142 每格 n=1,未跑的占位行不计入
附 AI 产出文件 140 其余 2 条为超时或未能完成,无产出(见下「覆盖范围」)
测试窗口 2026 年 8 月底 测试时均使用当时能用到的最新的模型及载体版本,测试日期可见「测试日期」列。

覆盖范围

142 条记录不是「12 题 × 13 配置」的完整矩阵。以下配置没有跑满全部 12 道题,不能直接拿均值与其他配置横向比较

受测配置 实跑题数 未跑的题 主要原因
Kimi Work 3 / 12 只跑了 A01、A02、A03 三道 L1/L2,缺 A04–A11 与 Q11 Kimi K3 作为底层模型,免费额度过低,大部分任务复杂度高,不足以支撑。
Kimi-K3 @ Pi 9 / 12 A01、A02、A03 Kimi K3 已在 Kimi Work 中测试过这三题
Workbuddy (Auto) 11 / 12 A11 任务复杂度高,综合过往表现决定不跑。
Workbuddy (Hy3) 11 / 12 A11 任务复杂度高,综合过往表现决定不跑。
其余 9 个配置 12 / 12

另有 2 条记录计入了运行记录、但没有可下载的产出文件:A10 × Workbuddy (Hy3)(跑了 40 分钟未解决问题)、A11 × Kimi-K3 @ Pi(输出 token 上限死锁)。这两条的「L3 无硬编码」未勾,含义是「无产出可判」而非「写死了值」。

怎么读这份数据

它能回答的

它不能回答的