skill 自动创建

适用平台ChatGPTCursorGeminiClaudeGitHub Copilot豆包TRAEDeepseekNotion AIUniversal

效果展示

暂无内容。

使用方法

一个用于创建新技能并对其进行迭代改进的技能。

在高层次上,创建技能的过程大致如下:

确定你希望该技能实现什么功能,以及大致如何实现 撰写技能的初稿 创建几个测试提示(prompts),并在这些提示上运行具备该技能访问权限的 Claude 帮助用户对结果进行定性和定量评估 在后台运行测试的同时,如果没有现成的定量评估方案,则起草一些(如果已有,则可直接使用,或根据需要进行修改)。然后向用户解释这些评估方案(如果已有,则解释现有的方案) 使用 eval-viewer/generate_review.py 脚本向用户展示结果供其查看,同时允许他们查看定量指标 根据用户对结果的评估反馈(以及从定量基准测试中发现的明显缺陷)重写技能 重复上述过程,直到满意为止 扩展测试集,并在更大规模上再次尝试 当你使用此技能时,你的任务是判断用户当前处于该流程的哪个阶段,然后介入并帮助他们推进到下一阶段。例如,用户可能会说:“我想为 X 创建一个技能。” 你可以帮助他们明确具体需求、撰写初稿、编写测试用例、确定评估方式、运行所有提示,并不断迭代。

另一方面,如果用户已经拥有技能的草稿,那么你可以直接进入评估/迭代环节。

当然,你也应始终保持灵活性;如果用户表示“我不需要运行大量评估,咱们凭感觉来就行”,那你也可以照做。

此外,在技能完成后(同样,顺序可以灵活调整),你还可以运行技能描述优化器——我们为此专门准备了一个独立脚本——以优化技能的触发效果。

明白了吗?明白了。

与用户沟通 技能创建器可能会被各种熟悉编程术语程度不同的用户使用。如果你还没听说(你怎么可能听说呢,毕竟这趋势才刚刚兴起),现在有一种潮流:Claude 的强大能力正激励水管工们打开终端,促使父母和祖父母去谷歌搜索“如何安装 npm”。另一方面,大多数用户可能具备相当的计算机素养。

因此,请注意上下文线索,以判断该如何措辞!作为默认情况,给你一些参考:

“评估(evaluation)”和“基准测试(benchmark)”属于临界词汇,但可以接受 对于“JSON”和“断言(assertion)”,你需要观察用户是否明确表现出了解这些术语,再决定是否直接使用而不加解释 如果你不确定,简要解释一下术语是可以的;如果你不确定用户是否理解某个术语,不妨附上简短定义予以澄清。