2026 年,Agent Skill 已经不是什么新概念了。Claude Code、Codex、Cursor 都在用 Skill 增强 Agent 能力,SkillsBench 的研究数据也证实:精心编写的 Skill 能让任务完成率平均提升 16.2 个百分点。
但一个尴尬的问题摆在每个 Skill 开发者面前:你怎么证明自己的 Skill 真的有用?

"装上后感觉输出质量变好了"——这句话说服不了自己,更说服不了同事和用户。
阿里的答案是开源 CLI 工具 skill-up,它把 Agent Skill 的评测从手工折腾变成了声明式流水线,让"这个 Skill 有没有用"第一次可以用数字回答。
skill-up 是一个命令行评测框架。你在 Skill 包里写几个 YAML 文件,定义评测环境和用例,跑一行命令——它自动搭环境、装 Skill、调 Agent Engine、打分、出报告。整个过程可重复、可追溯、能跑在 CI 里。
如果说一个 Skill 是 Agent 的"技能书",那 skill-up 就是这本技能书的单元测试框架。
三大核心设计
1. 声明式用例,就像写单元测试
评测的核心是 case。skill-up 的 case 文件就像单元测试一样简洁:
input:
prompt: |
Please generate a Hello World program
expect:
must_contain:
- "Hello"
- "World"
must_not_contain:
- "error"
input.prompt 是发给 Agent 的指令,expect 声明预期行为。最简情况下甚至不需要显式写 judge——默认用 rule_based 规则匹配。
如果需要更复杂的评分,skill-up 提供三种策略:
- • rule_based:规则匹配
- • script:自定义脚本评分
- • agent_judge:让另一个 Agent 来当评委
2. 多引擎支持,拒绝"只在自己机器上能跑"
Agent Skill 开发有个经典坑:同一个 Skill,在 Claude Code 下效果好,到 Codex 下就可能翻车。
skill-up 内置支持 claude_code、codex、qodercli、qwen_code,还能通过 engine.custom 接入自定义 Agent。配合内置的 GitHub Action,可以在每个 PR 上同时跑跨引擎评测矩阵——一个 PR 提交上来,自动告诉你"在 Claude Code 下通过,在 Codex 下挂了"。
3. AI 辅助写评测:skill-upper
"写评测"本身就是个门槛。skill-up 自带一个 Agent Skill 叫 skill-upper,装好之后,你对着 AI Agent 说人话就行——Agent 会自己在 evals/ 下生成 eval.yaml 和对应的 case 文件,然后调 skill-up run 跑一遍。
评测写完了你甚至没碰 YAML。
版本迭代速度
从 5 月底的 v0.2.0 到 7 月中旬的 v0.7.0,不到两个月推了 10 个版本:
版本日期关键能力
| v0.7.0 | 07-16 | 按用例独立配置 MCP,评测隔离性增强 |
| v0.6.0 | 07-15 | 多轮对话评测 + Judge 专属 Skill |
| v0.4.0 | 07-08 | Qwen Code 引擎 + HTTP transport + Windows 支持 |
| v0.2.2 | 05-26 | Docker runtime,容器隔离评测 |
GitHub 地址:https://github.com/alibaba/skill-up