工具评测看"它好不好",维小宝验收看"他干得成不成、划不划算"。
| 工具评测八维 | 对应的数字员工验收维度 | 为什么延伸 |
|---|---|---|
| 能力 | 任务完成率 | 工具"能力强"不等于任务"能交付"——先看跑没跑完 |
| 效果 | 正确率 | 工具看输出质量,员工看结果对不对(要抽检) |
| 易用性 + 稳定性 | 人工介入率 · 可复现率 | 要人一直盯着、或每次结果不一样,就不算能交出去 |
| 成本 | 单任务成本 · 平均耗时 | 把成本落到"一次任务"上,B 端才看得懂 |
| 商业价值 | ROI 实际记录 | 从估算变成客户签字的实际数 |
| 安全 · 国产适配 | 保留(合规与可用性门槛) | 不放松:涉密不输入、生成必标识、国产模型可替换 |
| (工具八维无主观维度) | 用户满意度 | 员工是"人"用的,好不好用由使用者打分 |
| # | 指标 | 定义(怎么算) | 数据来源 | 建议阈值 | 当前实测 |
|---|---|---|---|---|---|
| 1 | 任务完成率 | 成功产出交付物的执行 ÷ 总执行 | 系统自动(执行凭证) | ≥ 95% | 100%(6/6 次) |
| 2 | 正确率 | 抽检交付物中"事实/参数/政策无错"的占比 | 人工抽检(≥20 项) | ≥ 90% | 待抽检(暂无真实客户样本) |
| 3 | 人工介入率 | 必须人签字的步骤 ÷ 总步骤 | 链定义(7 字段) | ≤ 30% | 22%(商品 1/6、会议 1/4、面试 1/4) |
| 4 | 单任务成本 | 一次链执行消耗的模型费用(估算)+人工分钟折旧 | 系统估算+人工记录 | ≤ 2 元 | ≈0.002 元(模型估算:单步约 540 token) |
| 5 | 平均耗时 | 从提交到拿到交付物(不含人工复核) | 系统自动(凭证耗时) | ≤ 3 分钟 | 约 3.3 秒(批量包 3.1~4.1s / 纪要 2.1~2.3s / 简历 4.4s) |
| 6 | 可复现率 | 关键小节覆盖率(结构化链)+关键要素抽检(自由文本链)——不是逐字相同 | 系统自动+人工抽检 | 覆盖 100%·要素齐全 ≥ 90% | 覆盖 100%/100%(商品上市、会议到落地);逐字相似度均值 0.76 → 所以按要素口径评 |
| 7 | 用户满意度 | 使用者打分 1~5(或 👍 率) | 应用内反馈+验收表 | ≥ 4.0 | 待客户试用 |
| 8 | ROI 实际记录 | 客户签字确认的"省了多少人工/多少钱/多少时间" | 必须客户方签字 | 有记录(不设阈值) | 待第一家客户 |
worker_evals → 形成可对外引用的记录本页数据来自站内执行凭证(chain_runs)与真实运行,实测时间 2026-09-11;AI 生成内容一律标识,对外发布前人工复核。