返回项目

已发布 · 2026-07-04 · Public / Open Source

Skill Up

面向 AI Agent Skill 的开源 CLI 评测框架,帮助开发者用可复用用例、分层断言和 CI 工作流持续评估 Skill 质量。

#AI Engineering#Evaluation#CLI#Open Source

Problem

AI Agent Skill 的迭代很容易停留在“手动试一下”的阶段:换一个模型、换一个 Agent、改一段提示词,都可能改变最终行为,但缺少稳定、可复用、可回归的评测方式。

Skill Up 解决的是这个问题:让 Skill 可以像工程系统一样被验证、比较和持续改进。

Role

Creator / Maintainer。

System

  • 多 Engine 适配:支持 Claude Code、Codex、Qodercli 等不同执行环境。
  • 可复用评测用例:同一份 case 可以跨 Agent 回放。
  • 分层断言:通过 expect + judge 组合结构化检查和语义判断。
  • CI 友好:让 Skill 质量可以进入自动化回归流程。
  • 格式兼容:兼容 Anthropic skill-creator 格式。

Why It Matters

AI 工程化不只是把模型接进应用,而是建立一套能持续判断质量的工作流。Skill Up 是我在 Agent Skill 评测方向上的公开基础设施实验。

Link

GitHub: alibaba/skill-up