啥好用(sha-hao-yong)
一个替你在安装前多看两眼的 Skill:这是啥,好用吗,适合我吗?
刷到一个新 Skill 时,人往往会卡在一个很微妙的位置:
装吧,怕折腾一晚上,最后发现根本用不上;不装吧,又怕错过一个真好东西。
sha-hao-yong 的中文名叫“啥好用”。这个名字没有故作高深,因为它想回答的就是普通人在安装前最想问的三句话:
- 这是啥?
- 好用吗?
- 适合我吗?
给它一个 GitHub 地址、ZIP、文件夹、SKILL.md、插件、命令行工具或安装说明,它会只读检查当前可见材料,整理安装条件、费用、Token、风险、适用场景和现实限制,最后生成一份白纸墨字的 HTML 安装前说明书。
为什么做“啥好用”
Skill 推荐越来越像逛应用商店:
- “必装 Top 10”看着都很心动。
- Star 涨得很快,不等于正好适合你。
- README 写着“一键安装”,背后可能还有 Python、Node.js、浏览器扩展、账号和 Key。
- 功能看着很多,真正用起来也许只解决一个很窄的问题。
- 免费下载不代表没有 API 费用、Token 消耗或维护成本。
一个 Skill 值不值得装,不能只看它“能做什么”,还要看你得准备什么、一次任务有多麻烦、结果能不能直接用,以及它跟你的需求到底贴不贴。
“啥好用”不替你追热点。它更像那个愿意陪你把包装拆开、说明书翻完,然后说一句实话的朋友:
这个挺适合你,可以试试。
这个东西不错,但不是你现在需要的。
这个先别急着装,前置条件比你想的多。
适合谁
- 经常在 GitHub、Skill 市场、推荐榜和社交平台发现新工具的人。
- 管理了不少 Skills,想减少重复、冲突和吃灰安装的人。
- 不熟悉代码,但想先弄明白依赖、账号、费用和权限的人。
- 需要给团队筛选工具,并留下可分享评估说明的人。
- 希望根据自己的真实任务判断,而不是只看 Star 和宣传语的人。
它不太适合这些任务:
- 代码安全认证、恶意代码检测或隐私合规审计。
- 精确性能测试、长期稳定性测试和多设备兼容认证。
- 自动安装、注册、授权、付费或运行候选对象。
- 只想听一句“好”或“不好”,不愿意看条件和限制。
它会替你看什么
| 问题 | 它会检查什么 |
|---|---|
| 这是啥 | 主要用途、目标用户、输入、工作方式和最终交付 |
| 好用吗 | 公开关注度、文档完整度、安装难度、任务难度、费用、Token、风险和调用准确性 |
| 适合我吗 | 跟需求贴不贴、结果好不好用、适合与不适合的场景、是否建议安装 |
它不会用 Star 替代效果,也不会用“安装简单”替代质量。找不到的数据会写“未验证”,不会为了把表填满而猜一个数字。
两种评估方式
A:结合你的需求评估
适合已经知道自己想做什么的人。它只会追问一个核心问题:
您希望评估的 Skill 是【名称】,请问您希望它能帮您做什么?
后面的适合度会围绕这项真实需求判断。
B:按一般目标用户评估
适合先了解一个 Skill 的定位,或者给 README、工具清单和团队选型做公开说明。它会根据候选对象的官方定位界定适用人群,不再追问个人需求。
它怎样工作
接收候选对象
→ 选择 A / B 评估方式
→ 锁定一条固定常规任务
→ 只读检查官方材料和公开数据
→ 分别计算好用度与适合度
→ 自动合成推荐度
→ 校验文字、数字和必填项
→ 生成单文件 HTML 说明书
“固定常规任务”是它用来保证前后评分不乱飘的尺子。它不会今天拿最轻演示打分,明天又拿全部功能全开的极端任务打分。
安装复杂度始终按“从零安装”计算。你电脑上已经装过,不会因此少扣分;你还没安装,也不会因此在适合度里被重复扣分。
报告里的三个分数
好用度
回答“这个 Skill 本身做得怎么样”。它综合查看:
- 风险值
- 公开关注度
- 安装复杂度
- 可验证性
- 任务复杂度
- 额外费用
- Token 消耗
- Skill 调用准确性
适合度
回答“它对当前需求或目标人群有没有用”。重点看两件事:
- 能力跟任务贴不贴。
- 最后交付的东西能不能直接使用或核对。
推荐度
把好用度和适合度合在一起,回答“值不值得安装”。一个优秀但不适合你的 Skill,不会因为名气大就得到高推荐;一个方向很对但文档和风险表现糟糕的 Skill,也不会轻松过关。
| 推荐度 | 结论 |
|---|---|
| 0–3.9 | 不推荐 |
| 4.0–5.9 | 谨慎采用 |
| 6.0–7.4 | 有条件推荐 |
| 7.5–8.9 | 推荐 |
| 9.0–10 | 强推荐 |
分数是决策辅助,不是给 Skill 发奖状。真正重要的是分数后面的原因、条件和未验证事项。
自己评自己
“啥好用”也跑过一次自己的流程。结果是 7.9/10,推荐:免费、只读、安装轻和评分规则明确是主要优点;项目公开时间短、第三方反馈少、公式还缺少长期验证是主要不足。

自己评自己当然不能算第三方认证。把这份报告放出来,是为了让你先看看它会怎样写结论、怎样承认不足,以及最后交付长什么样。
最终得到什么
一份可以直接打开和分享的单文件 HTML 报告,包含:
- 结论概述和 10 格推荐条
- “这是啥、好用吗、适合我吗”三部分
- 好用之处和可能卡住的地方
- 八项评估指标
- 安装准备表
- 适合与不适合场景
- 使用节奏建议
- 来源与未验证事项
过程 JSON 会单独保留,用来复核本次评分和重新生成报告。HTML 由脚本统一渲染,避免模型临时手写页面导致样式和数字口径漂移。
它跑起来很轻
- 一个能够读取 Agent Skills 和候选材料的 AI agent。
- Python 3,用于检查过程 JSON 和生成 HTML。
- 不需要第三方 Python 依赖,渲染脚本只使用标准库。
- 评估公开网址时需要联网;评估本地文件时可以只看现有材料。
它默认只读候选对象:不安装陌生代码,不读取凭证,不注册,不付费,也不上传材料。
安装
克隆项目:
git clone https://github.com/hexiaofeier/sha-hao-yong.git
也可以让支持安装 Skill 的 AI agent 读取这个 GitHub 地址,并请它在安装前检查文件和依赖。
| 客户端 | 用户级目录 | 显式调用 |
|---|---|---|
| Claude Code | ~/.claude/skills/sha-hao-yong |
/sha-hao-yong |
| Codex | ~/.agents/skills/sha-hao-yong |
$sha-hao-yong |
| WorkBuddy | ~/.workbuddy/skills/sha-hao-yong |
在 Skill 列表中选择 |
部分现有 Codex 安装也会读取 ~/.codex/skills/sha-hao-yong。安装后如果没有立即显示,请新开一个会话。
Windows PowerShell 示例
以 Codex 当前用户级目录为例:
New-Item -ItemType Directory -Force "$HOME/.agents/skills" | Out-Null
git clone https://github.com/hexiaofeier/sha-hao-yong.git "$HOME/.agents/skills/sha-hao-yong"
macOS / Linux 示例
mkdir -p ~/.agents/skills
git clone https://github.com/hexiaofeier/sha-hao-yong.git ~/.agents/skills/sha-hao-yong
快速开始
用啥好用评估这个 Skill:<GitHub 地址>
用啥好用按我的需求评估这个文件夹。
我希望它能帮我批量整理访谈记录,并生成可复核的分析报告。
用啥好用按一般目标用户评估这个 ZIP,输出 HTML 安装前说明书。
首次启动且没有指定模式时,它会先让你选 A 或 B,再继续读取材料。
项目结构
sha-hao-yong/
├── SKILL.md
├── README.md
├── LICENSE
├── agents/
│ └── openai.yaml
├── references/ # 评分、写作与报告规范
├── scripts/
│ └── render_report.py # 校验并生成 HTML
├── examples/ # 自评 HTML 与过程 JSON
└── docs/
└── assets/ # README 展示图片
优点
- 问题很直白:不堆功能名,直接回答这是啥、好不好用、适不适合。
- 先锁定尺子再打分:同一个 Skill 重评时不随意更换典型任务。
- 只读候选对象:评估阶段不运行陌生代码,也不碰账号、Key 和密码。
- 分数有出处:好用度、适合度和推荐度由固定公式计算,不由模型临场拍脑袋。
- 强制说人话:渲染前会拦截待填写项、内部黑话和不完整结构。
- 结果便于分享:单文件 HTML 可以直接打开、归档或发给团队讨论。
不足与现实限制
- 只读检查无法证明陌生代码安全,也不能替代真实安装和长期使用。
- 公开材料写得漂亮,实际产品仍可能不好用;报告会保留这层不确定性。
- 联网查资料、读取长文档和比较多个来源会消耗较多 Token。
- 新项目缺少大量第三方案例,评分公式仍需要更多真实任务检验。
- 不同 AI agent 的联网和文件读取能力不同,最终能查到的证据会有差异。
- 候选对象更新后,旧评估可能过期,需要重新运行。
持续更新
“啥好用”会继续更新,重点不是把分数算得越来越复杂,而是让判断越来越可信、越来越好懂:
- 用更多真实 Skill 检查评分是否稳定。
- 补充不同类型候选对象的公开示例。
- 调整安装、Token、风险和可验证性的判断规则。
- 改进 Claude Code、Codex、WorkBuddy 等客户端的安装说明。
- 继续删黑话、长句和看起来专业但没有帮助的表达。
- 根据第三方反馈修正不合理的分数和结论。
发现评分不合理、说明过期或报告里还有“人类看不懂”的句子,欢迎提交 Issue。
重要边界
“啥好用”提供的是安装前采用参考,不是免死金牌。它不能替代:
- 代码安全审计
- 恶意代码检测
- 软件质量和性能测试
- 隐私与合规审查
- 许可证或法律意见
下载、安装、授权、付费、上传或运行自动操作之前,请再核对来源、依赖、权限、数据去向、收费方式和许可证。涉及重要账号、敏感数据和不可逆操作时,优先使用测试环境、最小权限、专用账号和可恢复备份。
License
MIT License。欢迎使用、修改和继续改进;具体权利与免责边界以许可证为准。
No comments yet
Be the first to share your take.