AI 工具评测标准
怎么筛、怎么评、怎么保证不说假话——全部公开。也是"维小宝"推荐的依据。
一、我们怎么筛:三道门
① 收录门真实存在的产品:官网可达、有明确功能;资讯/栏目页/纯导航不算工具;官网打不开的不收录。
② 证据门每个应用/模板立项先过证据分级:有真实用户需求证据的优先做,证据弱的进"体验中"并标注,无证据的不做。
③ 上架门先审后显示:AI 生成内容(评测/专题/应用)先入草稿,人工审核后上架;AI 生成处有标识。
二、证据分级(S / A / B / C)
用证据决定"做什么、推什么":
S 级:站内真实需求 ≥5 个不同用户 → 上主货架
A 级:公开强证据(常识高频/可查证的公开资料)→ 上主货架并标注来源
B 级:有一定场景但证据弱 → 仅进"体验中",标注待验证
C 级:无证据或价值存疑 → 不建、不推
敢说实话:截至本页发布,平台真实用户样本仍很少,因此不宣称"百姓都需要";哪些场景真有用,交给真实使用数据说话。
三、我们怎么评:七个维度
| 维度 | 我们看什么 |
| 功能覆盖 | 官方宣称的核心能力是否真实可用;哪些是"演示"、哪些能日常用 |
| 易用上手 | 第一次用要几步;有没有中文与引导;移动端可用性 |
| 成本效率 | 免费额度、价格档位、达到同样结果的时间与花费(以官方页面为准) |
| 安全与隐私 | 数据处理说明、是否要求上传敏感信息、有无公开隐私政策 |
| 场景适配 | 它最适合谁、在什么任务里明显优于替代方案 |
| 成功率与稳定 | 同类任务多次使用的稳定程度、失败后的补救方式 |
| 更新与售后 | 更新频率、文档 / 社区、问题反馈渠道 |
来源规则:评测文字基于官方文档 + 公开信息 + 站内使用观察;未能核实的细节写成"以官方为准",绝不编造价格、参数、政策或案例。
四、四道闸 · 一闭环
规格闸生成类应用必须有结构化规格(输入/输出/步骤/边界),不达标不放行。
纪律闸事实纪律注入每次生成:没给的数据不编,量化处写"以官方/实测为准"。
审核闸先审后显示 + 抽检;发现问题可下架、可归档、可回滚。
使用闸👍👎 与使用数据回流,弱项淘汰、强项加精——闭环靠真实使用。
五、质量月报(口径与节奏)
按自然月出一份《AI 应用质量月报》,先内后外,敢晒丑:
- 开箱可用率:固定测试集逐应用跑多次,能产出可用结果的比例;
- 编造率(目标 ≤1%):抽检"无依据却给出具体数字/政策/承诺"的比例;
- 覆盖与热度:应用/模板/场景数量、使用次数、👍👎、回访;
- 问题榜:最差的若干项与改进结论。
注明:早期样本量小时,月报标注样本量与置信程度,不用小样本下市场结论。
六、数据诚实声明(不做的事)
- 不编造价格、参数、政策、案例、用户评价;没有真实案例就不写案例;
- 不吹做不到的能力(如"实时学习所有应用""自我进化");
- 不做收费推荐位、不刷榜、不删差评(投诉举报通道公开);
- AI 生成内容一律标识;涉及医疗/法律/政策只给通用做法并提示以官方为准;
- 删除先归档、发布可回滚、操作有留痕。
七、纠错与反馈
发现评测有误、工具信息过时——直接指出,我们核正并更新页面:
下一步,直接免费用
标准不止于展示 —— 按需求由维小宝筛选并执行: