DEFINE THE JOB
先定义任务
固定输入、预期输出、成功条件和不可接受的错误。任务必须接近真实业务,而不是为了让某个 Skill 好看。
METHODOLOGY / V0.1
skill-vs 不是一个把 Stars、安装量和主观评分相加的网站。
我们把“受欢迎”与“有效”拆成两套独立系统。
DEFINE THE JOB
固定输入、预期输出、成功条件和不可接受的错误。任务必须接近真实业务,而不是为了让某个 Skill 好看。
ESTABLISH BASELINE
在同一模型、同一环境与同一工具条件下,先记录没有目标 Skill 时的完成率、耗时、错误和人工干预。
CONTROL THE CHANGE
启用目标 Skill,保持其他条件尽量一致。若环境差异无法消除,必须把它写进结论边界。
KEEP THE EVIDENCE
保留任务说明、关键过程、最终产物、错误记录和评分表。重要结论必须能回到具体证据。
REPORT THE TRADE-OFF
不仅报告是否成功,还报告多用了多少时间、上下文、权限与人工操作,以及在哪些条件下可能失效。
SCORE WITHOUT MAGIC
Alpha 阶段优先保留分项结果,避免用一个漂亮数字掩盖失败。只有当任务类型和样本量足够稳定时,才讨论跨 Skill 的综合排序。
是否完整、正确地完成明确要求。
输出是否可用、准确且符合业务边界。
同类任务能否重复,失败是否可解释。
时间、人工、权限与潜在副作用。
WHAT WE WILL NOT CLAIM
评测只能覆盖已观察到的版本、权限和任务,安装前仍需自行审查。
单个环境的成功不会被包装成对所有模型和业务都有效。
商业合作必须与编辑结论分开标识,不能购买“实测推荐”。