Development
技能创建器
创建新技能、修改和改进现有技能,并衡量技能表现。当用户想从零创建技能、编辑或优化现有技能、运行评测来测试技能时使用。
一个用于创建新技能并迭代改进它们的技能。
先从理解用户的意图开始:
skill-name/
├── SKILL.md (required)
│ ├── YAML frontmatter (name, description required)
│ └── Markdown instructions
└── Bundled Resources (optional)
├── scripts/ - Executable code
├── references/ - Docs loaded into context
└── assets/ - Files used in output
技能采用三级加载机制:
在写完技能初稿后,构想 2-3 个贴近真实的测试提示词。将测试用例保存到 evals/evals.json。
{
"skill_name": "example-skill",
"evals": [
{
"id": 1,
"prompt": "User's task prompt",
"expected_output": "Description of expected result",
"files": []
}
]
}
对于每个测试用例,启动两个子代理:
为每个测试用例起草定量断言。
{
"total_tokens": 84852,
"duration_ms": 23332,
"total_duration_seconds": 23.3
}
将改进重点放在有具体抱怨的测试用例上。
description 字段决定了 Claude 是否会调用某个技能。在创建或改进技能之后,优化描述以提升触发的准确性。
创建 20 条评测查询(混合应触发与不应触发两类)。
python -m scripts.run_loop \
--eval-set <path-to-trigger-eval.json> \
--skill-path <path-to-skill> \
--model <model-id> \
--max-iterations 5
从 JSON 输出中取出 best_description,并更新该技能 SKILL.md 的 frontmatter。