啥好用(sha-hao-yong)

一个替你在安装前多看两眼的 Skill:这是啥,好用吗,适合我吗?

License: MIT Agent Skills Status

刷到一个新 Skill 时,人往往会卡在一个很微妙的位置:

装吧,怕折腾一晚上,最后发现根本用不上;不装吧,又怕错过一个真好东西。

sha-hao-yong 的中文名叫“啥好用”。这个名字没有故作高深,因为它想回答的就是普通人在安装前最想问的三句话:

  1. 这是啥?
  2. 好用吗?
  3. 适合我吗?

给它一个 GitHub 地址、ZIP、文件夹、SKILL.md、插件、命令行工具或安装说明,它会只读检查当前可见材料,整理安装条件、费用、Token、风险、适用场景和现实限制,最后生成一份白纸墨字的 HTML 安装前说明书。

为什么做“啥好用”

Skill 推荐越来越像逛应用商店:

  • “必装 Top 10”看着都很心动。
  • Star 涨得很快,不等于正好适合你。
  • README 写着“一键安装”,背后可能还有 Python、Node.js、浏览器扩展、账号和 Key。
  • 功能看着很多,真正用起来也许只解决一个很窄的问题。
  • 免费下载不代表没有 API 费用、Token 消耗或维护成本。

一个 Skill 值不值得装,不能只看它“能做什么”,还要看你得准备什么、一次任务有多麻烦、结果能不能直接用,以及它跟你的需求到底贴不贴。

“啥好用”不替你追热点。它更像那个愿意陪你把包装拆开、说明书翻完,然后说一句实话的朋友:

这个挺适合你,可以试试。

这个东西不错,但不是你现在需要的。

这个先别急着装,前置条件比你想的多。

适合谁

  • 经常在 GitHub、Skill 市场、推荐榜和社交平台发现新工具的人。
  • 管理了不少 Skills,想减少重复、冲突和吃灰安装的人。
  • 不熟悉代码,但想先弄明白依赖、账号、费用和权限的人。
  • 需要给团队筛选工具,并留下可分享评估说明的人。
  • 希望根据自己的真实任务判断,而不是只看 Star 和宣传语的人。

它不太适合这些任务:

  • 代码安全认证、恶意代码检测或隐私合规审计。
  • 精确性能测试、长期稳定性测试和多设备兼容认证。
  • 自动安装、注册、授权、付费或运行候选对象。
  • 只想听一句“好”或“不好”,不愿意看条件和限制。

它会替你看什么

问题 它会检查什么
这是啥 主要用途、目标用户、输入、工作方式和最终交付
好用吗 公开关注度、文档完整度、安装难度、任务难度、费用、Token、风险和调用准确性
适合我吗 跟需求贴不贴、结果好不好用、适合与不适合的场景、是否建议安装

它不会用 Star 替代效果,也不会用“安装简单”替代质量。找不到的数据会写“未验证”,不会为了把表填满而猜一个数字。

两种评估方式

A:结合你的需求评估

适合已经知道自己想做什么的人。它只会追问一个核心问题:

您希望评估的 Skill 是【名称】,请问您希望它能帮您做什么?

后面的适合度会围绕这项真实需求判断。

B:按一般目标用户评估

适合先了解一个 Skill 的定位,或者给 README、工具清单和团队选型做公开说明。它会根据候选对象的官方定位界定适用人群,不再追问个人需求。

它怎样工作

接收候选对象
  → 选择 A / B 评估方式
  → 锁定一条固定常规任务
  → 只读检查官方材料和公开数据
  → 分别计算好用度与适合度
  → 自动合成推荐度
  → 校验文字、数字和必填项
  → 生成单文件 HTML 说明书

“固定常规任务”是它用来保证前后评分不乱飘的尺子。它不会今天拿最轻演示打分,明天又拿全部功能全开的极端任务打分。

安装复杂度始终按“从零安装”计算。你电脑上已经装过,不会因此少扣分;你还没安装,也不会因此在适合度里被重复扣分。

报告里的三个分数

好用度

回答“这个 Skill 本身做得怎么样”。它综合查看:

  • 风险值
  • 公开关注度
  • 安装复杂度
  • 可验证性
  • 任务复杂度
  • 额外费用
  • Token 消耗
  • Skill 调用准确性

适合度

回答“它对当前需求或目标人群有没有用”。重点看两件事:

  • 能力跟任务贴不贴。
  • 最后交付的东西能不能直接使用或核对。

推荐度

把好用度和适合度合在一起,回答“值不值得安装”。一个优秀但不适合你的 Skill,不会因为名气大就得到高推荐;一个方向很对但文档和风险表现糟糕的 Skill,也不会轻松过关。

推荐度 结论
0–3.9 不推荐
4.0–5.9 谨慎采用
6.0–7.4 有条件推荐
7.5–8.9 推荐
9.0–10 强推荐

分数是决策辅助,不是给 Skill 发奖状。真正重要的是分数后面的原因、条件和未验证事项。

自己评自己

“啥好用”也跑过一次自己的流程。结果是 7.9/10,推荐:免费、只读、安装轻和评分规则明确是主要优点;项目公开时间短、第三方反馈少、公式还缺少长期验证是主要不足。

查看完整 HTML 自评

啥好用 Skill 自评:推荐度 7.9/10,好用度 7.8/10,适合度 8.0/10

自己评自己当然不能算第三方认证。把这份报告放出来,是为了让你先看看它会怎样写结论、怎样承认不足,以及最后交付长什么样。

最终得到什么

一份可以直接打开和分享的单文件 HTML 报告,包含:

  • 结论概述和 10 格推荐条
  • “这是啥、好用吗、适合我吗”三部分
  • 好用之处和可能卡住的地方
  • 八项评估指标
  • 安装准备表
  • 适合与不适合场景
  • 使用节奏建议
  • 来源与未验证事项

过程 JSON 会单独保留,用来复核本次评分和重新生成报告。HTML 由脚本统一渲染,避免模型临时手写页面导致样式和数字口径漂移。

它跑起来很轻

  • 一个能够读取 Agent Skills 和候选材料的 AI agent。
  • Python 3,用于检查过程 JSON 和生成 HTML。
  • 不需要第三方 Python 依赖,渲染脚本只使用标准库。
  • 评估公开网址时需要联网;评估本地文件时可以只看现有材料。

它默认只读候选对象:不安装陌生代码,不读取凭证,不注册,不付费,也不上传材料。

安装

克隆项目:

git clone https://github.com/hexiaofeier/sha-hao-yong.git

也可以让支持安装 Skill 的 AI agent 读取这个 GitHub 地址,并请它在安装前检查文件和依赖。

客户端 用户级目录 显式调用
Claude Code ~/.claude/skills/sha-hao-yong /sha-hao-yong
Codex ~/.agents/skills/sha-hao-yong $sha-hao-yong
WorkBuddy ~/.workbuddy/skills/sha-hao-yong 在 Skill 列表中选择

部分现有 Codex 安装也会读取 ~/.codex/skills/sha-hao-yong。安装后如果没有立即显示,请新开一个会话。

Windows PowerShell 示例

以 Codex 当前用户级目录为例:

New-Item -ItemType Directory -Force "$HOME/.agents/skills" | Out-Null
git clone https://github.com/hexiaofeier/sha-hao-yong.git "$HOME/.agents/skills/sha-hao-yong"

macOS / Linux 示例

mkdir -p ~/.agents/skills
git clone https://github.com/hexiaofeier/sha-hao-yong.git ~/.agents/skills/sha-hao-yong

快速开始

用啥好用评估这个 Skill:<GitHub 地址>
用啥好用按我的需求评估这个文件夹。
我希望它能帮我批量整理访谈记录,并生成可复核的分析报告。
用啥好用按一般目标用户评估这个 ZIP,输出 HTML 安装前说明书。

首次启动且没有指定模式时,它会先让你选 A 或 B,再继续读取材料。

项目结构

sha-hao-yong/
├── SKILL.md
├── README.md
├── LICENSE
├── agents/
│   └── openai.yaml
├── references/                 # 评分、写作与报告规范
├── scripts/
│   └── render_report.py        # 校验并生成 HTML
├── examples/                   # 自评 HTML 与过程 JSON
└── docs/
    └── assets/                 # README 展示图片

优点

  • 问题很直白:不堆功能名,直接回答这是啥、好不好用、适不适合。
  • 先锁定尺子再打分:同一个 Skill 重评时不随意更换典型任务。
  • 只读候选对象:评估阶段不运行陌生代码,也不碰账号、Key 和密码。
  • 分数有出处:好用度、适合度和推荐度由固定公式计算,不由模型临场拍脑袋。
  • 强制说人话:渲染前会拦截待填写项、内部黑话和不完整结构。
  • 结果便于分享:单文件 HTML 可以直接打开、归档或发给团队讨论。

不足与现实限制

  • 只读检查无法证明陌生代码安全,也不能替代真实安装和长期使用。
  • 公开材料写得漂亮,实际产品仍可能不好用;报告会保留这层不确定性。
  • 联网查资料、读取长文档和比较多个来源会消耗较多 Token。
  • 新项目缺少大量第三方案例,评分公式仍需要更多真实任务检验。
  • 不同 AI agent 的联网和文件读取能力不同,最终能查到的证据会有差异。
  • 候选对象更新后,旧评估可能过期,需要重新运行。

持续更新

“啥好用”会继续更新,重点不是把分数算得越来越复杂,而是让判断越来越可信、越来越好懂:

  • 用更多真实 Skill 检查评分是否稳定。
  • 补充不同类型候选对象的公开示例。
  • 调整安装、Token、风险和可验证性的判断规则。
  • 改进 Claude Code、Codex、WorkBuddy 等客户端的安装说明。
  • 继续删黑话、长句和看起来专业但没有帮助的表达。
  • 根据第三方反馈修正不合理的分数和结论。

发现评分不合理、说明过期或报告里还有“人类看不懂”的句子,欢迎提交 Issue

重要边界

“啥好用”提供的是安装前采用参考,不是免死金牌。它不能替代:

  • 代码安全审计
  • 恶意代码检测
  • 软件质量和性能测试
  • 隐私与合规审查
  • 许可证或法律意见

下载、安装、授权、付费、上传或运行自动操作之前,请再核对来源、依赖、权限、数据去向、收费方式和许可证。涉及重要账号、敏感数据和不可逆操作时,优先使用测试环境、最小权限、专用账号和可恢复备份。

License

MIT License。欢迎使用、修改和继续改进;具体权利与免责边界以许可证为准。