GLOBAL SIGNAL / 热度持续更新INDEPENDENT EVIDENCE / 结论可追溯

METHODOLOGY / V0.1

先有证据,再有结论。

skill-vs 不是一个把 Stars、安装量和主观评分相加的网站。
我们把“受欢迎”与“有效”拆成两套独立系统。

同一任务+同一环境+唯一变量=可解释的差异
01

DEFINE THE JOB

先定义任务

固定输入、预期输出、成功条件和不可接受的错误。任务必须接近真实业务,而不是为了让某个 Skill 好看。

02

ESTABLISH BASELINE

跑无 Skill 基线

在同一模型、同一环境与同一工具条件下,先记录没有目标 Skill 时的完成率、耗时、错误和人工干预。

03

CONTROL THE CHANGE

只改变一个变量

启用目标 Skill,保持其他条件尽量一致。若环境差异无法消除,必须把它写进结论边界。

04

KEEP THE EVIDENCE

保存可复查证据

保留任务说明、关键过程、最终产物、错误记录和评分表。重要结论必须能回到具体证据。

05

REPORT THE TRADE-OFF

写出收益与代价

不仅报告是否成功,还报告多用了多少时间、上下文、权限与人工操作,以及在哪些条件下可能失效。

SCORE WITHOUT MAGIC

评分是证据的索引,不是神秘总分。

Alpha 阶段优先保留分项结果,避免用一个漂亮数字掩盖失败。只有当任务类型和样本量足够稳定时,才讨论跨 Skill 的综合排序。

40

任务完成

是否完整、正确地完成明确要求。

25

结果质量

输出是否可用、准确且符合业务边界。

20

稳定与复现

同类任务能否重复,失败是否可解释。

15

成本与风险

时间、人工、权限与潜在副作用。

WHAT WE WILL NOT CLAIM

skill-vs 不会替你做的三件事

×

不保证绝对安全

评测只能覆盖已观察到的版本、权限和任务,安装前仍需自行审查。

×

不把一次成功泛化

单个环境的成功不会被包装成对所有模型和业务都有效。

×

不出售榜位

商业合作必须与编辑结论分开标识,不能购买“实测推荐”。