# 数字员工能力验收标准（八维）

> v1.0 · 2026-09-11 · 星屿数字平台（珠海星屿未来科技有限公司）
> 定位：把「AI 工具评测」延伸到「**AI 数字员工评测**」——工具看"它好不好"，数字员工看"**它干得成不成、划不划算**"。
> 站内对应页：`worker-standard.html`（本文件与页面同源）

---

## 一、为什么要从工具八维延伸到数字员工八维

工具评测回答的是"这个工具能力强不强、值不值得用"；而企业把一段工作交出去时，真正关心的是：
**活儿跑完了没有、对不对、要人盯多久、花多少钱、多快、下次还一样吗、用户满意吗、到底省了多少钱。**

这八件事，工具八维答不了。所以保留工具八维作为"选型标准"，另立**数字员工八维**作为"验收标准"。

| 工具评测八维（已有） | 对应的数字员工验收维度 | 为什么延伸 |
|---|---|---|
| 能力 | **任务完成率** | 工具"能力强"不等于任务"能交付" |
| 效果 | **正确率** | 输出质量 ≠ 结果正确（必须抽检） |
| 易用性 + 稳定性 | **人工介入率 · 可复现率** | 要人一直盯、或每次不一样，就不算能交出去 |
| 成本 | **单任务成本 · 平均耗时** | 成本落到"一次任务"，B 端才看得懂 |
| 商业价值 | **ROI 实际记录** | 从估算变成客户签字的实际数 |
| 安全 · 国产适配 | 保留（合规与可用性门槛） | 涉密不输入、生成必标识、模型可替换 |
| （无独立主观维度） | **用户满意度** | 员工是"人"用的，好不好用由使用者打分 |

---

## 二、数字员工八维验收表

| # | 指标 | 定义（怎么算） | 数据来源 | 建议阈值（首版，可调） |
|---|---|---|---|---|
| 1 | 任务完成率 | 成功产出交付物的执行 ÷ 总执行 | 系统自动（执行凭证） | ≥ 95% |
| 2 | 正确率 | 抽检交付物中"事实/参数/政策无错"的占比 | 人工抽检（≥20 项） | ≥ 90% |
| 3 | 人工介入率 | 必须人签字的步骤 ÷ 总步骤 | 链定义（7 字段） | ≤ 30% |
| 4 | 单任务成本 | 一次链执行的模型费用（估算）＋人工分钟折算 | 系统估算＋人工记录 | ≤ 2 元 |
| 5 | 平均耗时 | 从提交到拿到交付物（不含人工复核） | 系统自动（凭证耗时） | ≤ 3 分钟 |
| 6 | 可复现率 | **结构一致 ＋ 关键要素齐全**（不是逐字相同） | 系统自动＋人工抽检 | 结构一致 100%；要素齐全 ≥ 90% |
| 7 | 用户满意度 | 使用者打分 1~5（或 👍 率） | 应用内反馈＋验收表 | ≥ 4.0 |
| 8 | ROI 实际记录 | 客户签字确认的"省了多少人工/钱/时间" | **必须客户方签字** | 有记录（不设阈值） |

---

## 三、当前实测（2026-09-11，来自站内执行凭证与真实运行）

| # | 指标 | 实测 | 达线 |
|---|---|---|---|
| 1 | 任务完成率 | **100%（6/6 次执行全部成功）** | ✅ |
| 2 | 正确率 | 待抽检（暂无真实客户样本） | ⏳ |
| 3 | 人工介入率 | **22%**（商品上市 1/6、会议到落地 1/4、面试准备 1/4） | ✅ |
| 4 | 单任务成本 | **≈0.002 元**（模型估算：单步约 540 token；**非账单口径**） | ✅ |
| 5 | 平均耗时 | **约 3.3 秒**（批量包 3.1~4.1s / 会议纪要 2.1~2.3s / 简历优化 4.4s） | ✅ |
| 6 | 可复现率 | **结构一致 100%（2/2 条可测链）**；逐字相似度均值 **0.70** | ✅（按结构口径） |
| 7 | 用户满意度 | 待客户试用 | ⏳ |
| 8 | ROI 实际记录 | 待第一家客户签字 | ⏳ |

**测试方法**：3 条链各取首步应用，同一组输入**连跑两遍**（共 6 次执行）：
- 结构一致率：批量交付包（固定 7 小节）、会议纪要（固定四大块）→ 两跑小节集合完全一致；
- 简历优化属**自由文本型**输出，没有固定小节 → 标题集合测不出，需改用"关键要素清单"人工抽检；
- 逐字相似度：0.715 / 0.757 / 0.614。

---

## 四、为什么把"可复现率"定义成结构而不是文字

实测结论：**同输入两跑，结构能完全一致，但文字相似度只有 0.61~0.76**（模型措辞会变）。
所以"可复现"不能定义成"结果一样"，而应定义为：
**同样的小节结构 + 同样的关键要素 + 可用率不下降**。

这条定义的意义：它让验收可执行、也让我们不能拿"文本相似度"糊弄验收。
**若某天要改这个口径，必须在本页留下变更说明。**

---

## 五、怎么测（三步，谁做什么）

| 步骤 | 谁做 | 产出 |
|---|---|---|
| ① 自测 | 我们 | 同输入两跑，记录完成率/结构一致率/耗时/token → 系统凭证自动留痕（`chain_runs`） |
| ② 抽检 | 双方 | 抽 10~20 份交付物，判"可直接用 / 改 1~2 处 / 不能用" → 正确率与可用率 |
| ③ 客户验收 | 客户 | 填满意度与 ROI（签字），录入后台 `worker_evals` → 形成可对外引用的记录 |

---

## 六、纪律（不做假数）

1. **没数据就写"待测"**，不把估算冒充实测——正确率、满意度、ROI 目前都是空的，因为只能来自真实客户；
2. **成本只报估算口径**（token 折算），并注明"非账单"；
3. **ROI 必须客户签字**，我们自己算的一律不对外；
4. 指标口径变更（如今日的可复现率）**必须留变更说明**。

---

## 七、八维与商业模式的衔接

八维验收表不只是技术文档，它是**计价与续约的依据**：

- 报价单位从"按应用/按 token"改为 **按链的一次可交付执行**；
- 续约与扩大范围，看的是第 1、2、6、8 这四个数（完成率、正确率、可复现率、ROI 记录）；
- 任何一项不达线时的处理：**先补口径与输入清单，再重测一周**；连续两周不达线，暂停这条链的对外报价。

> 所有数字以站内实测与客户签字为准；不编造行业数据；AI 生成内容先审后显示并标识。
