维小宝 · 八维能力验收标准

维小宝干得怎么样,用这八个数说话

工具评测看"它好不好",维小宝验收看"他干得成不成、划不划算"。

两套八维的关系

工具八维 → 数字员工八维:能力好不好 → 活儿干得成不成
工具评测八维对应的数字员工验收维度为什么延伸
能力任务完成率工具"能力强"不等于任务"能交付"——先看跑没跑完
效果正确率工具看输出质量,员工看结果对不对(要抽检)
易用性 + 稳定性人工介入率 · 可复现率要人一直盯着、或每次结果不一样,就不算能交出去
成本单任务成本 · 平均耗时把成本落到"一次任务"上,B 端才看得懂
商业价值ROI 实际记录从估算变成客户签字的实际数
安全 · 国产适配保留(合规与可用性门槛)不放松:涉密不输入、生成必标识、国产模型可替换
(工具八维无主观维度)用户满意度员工是"人"用的,好不好用由使用者打分

数字员工八维验收表

指标 · 定义 · 数据来源 · 建议阈值(首版,可调) · 当前实测
#指标定义(怎么算)数据来源建议阈值当前实测
1任务完成率成功产出交付物的执行 ÷ 总执行系统自动(执行凭证)≥ 95%100%(6/6 次)
2正确率抽检交付物中"事实/参数/政策无错"的占比人工抽检(≥20 项)≥ 90%待抽检(暂无真实客户样本)
3人工介入率必须人签字的步骤 ÷ 总步骤链定义(7 字段)≤ 30%22%(商品 1/6、会议 1/4、面试 1/4)
4单任务成本一次链执行消耗的模型费用(估算)+人工分钟折旧系统估算+人工记录≤ 2 元≈0.002 元(模型估算:单步约 540 token)
5平均耗时从提交到拿到交付物(不含人工复核)系统自动(凭证耗时)≤ 3 分钟约 3.3 秒(批量包 3.1~4.1s / 纪要 2.1~2.3s / 简历 4.4s)
6可复现率关键小节覆盖率(结构化链)+关键要素抽检(自由文本链)——不是逐字相同系统自动+人工抽检覆盖 100%·要素齐全 ≥ 90%覆盖 100%/100%(商品上市、会议到落地);逐字相似度均值 0.76 → 所以按要素口径评
7用户满意度使用者打分 1~5(或 👍 率)应用内反馈+验收表≥ 4.0待客户试用
8ROI 实际记录客户签字确认的"省了多少人工/多少钱/多少时间"必须客户方签字有记录(不设阈值)待第一家客户
可复现率的定义改过两次,都写在这里
① 最初想用"逐字相似度"——实测同输入两跑只有 0.44~0.98(均值约 0.76),模型措辞会变,口径不成立
② 改成"小节标题集合完全相等"——实测同一链两跑的标题写法会漂移("决议事项" vs "决议事项:"), 会把稳定输出误判成"不一致"(同一条链一次 100%、一次 50%),口径太脆
③ 现在的口径:关键小节覆盖率(预先定义这条链必须出现哪几个小节,两跑都要 100% 命中); 自由文本型的链(如简历优化)不适用结构指标,改用关键要素清单人工抽检
已自动化:复现测试脚本(`repro_check.py`)每月 1 日 09:40 自动跑一次并写入验收库 `worker_evals`; 后台「数据总览」里有数字员工八维看板,可一键重跑并查看历史(含每条链的覆盖率、相似度、耗时)。
① 自测(我们做)同一组输入跑两遍,记录:完成率、结构一致率、耗时、token → 系统凭证留痕
② 抽检(一起做)从交付物里抽 10~20 份,逐份判"可直接用 / 改 1~2 处 / 不能用" → 得到正确率与可用率
③ 客户验收(客户做)填满意度与 ROI(客户签字),录进后台 worker_evals → 形成可对外引用的记录

纪律(不做假数)

1. 没数据就写"待测",不填估算冒充实测——正确率、满意度、ROI 目前都空着,只能来自真实客户;
2. 成本只报估算口径(token 折算),注明"非账单";
3. ROI 必须客户签字,我们自己算的一律不对外;
4. 指标口径变更(例如可复现率的定义),在本页留下变更说明,不悄悄改。
下载 .md 版 下载 Word 版 看一条活怎么走完 试用记录与验收表

本页数据来自站内执行凭证(chain_runs)与真实运行,实测时间 2026-09-11;AI 生成内容一律标识,对外发布前人工复核。