Problem
AI Agent Skill 的迭代很容易停留在“手动试一下”的阶段:换一个模型、换一个 Agent、改一段提示词,都可能改变最终行为,但缺少稳定、可复用、可回归的评测方式。
Skill Up 解决的是这个问题:让 Skill 可以像工程系统一样被验证、比较和持续改进。
Role
Creator / Maintainer。
System
- 多 Engine 适配:支持 Claude Code、Codex、Qodercli 等不同执行环境。
- 可复用评测用例:同一份 case 可以跨 Agent 回放。
- 分层断言:通过 expect + judge 组合结构化检查和语义判断。
- CI 友好:让 Skill 质量可以进入自动化回归流程。
- 格式兼容:兼容 Anthropic skill-creator 格式。
Why It Matters
AI 工程化不只是把模型接进应用,而是建立一套能持续判断质量的工作流。Skill Up 是我在 Agent Skill 评测方向上的公开基础设施实验。