AI Agent Skill 工程化 09:让 Skill 自己变好——走向自进化流水线
不是「装一个叫 Darwin 的工具Skill 就会自己变好」。 而是真实问题 → 写成可测的东西 → 一次只改一处 → 考不过就回滚。前言一句话让 Skill 走向自动化需要有要求和约束。开场改完 Skill你怎么知道没改坏2026 年 6 月 22 日我用frontend-dev-prompt-craft跑了一轮真实任务订单继承与合并功能任务本身做完了。复盘时却发现一堆刺PRD 里的接口 path 是/api/resition/...项目里真正请求的是leave/...。Skill 生成的提示词经常只写一边下游 Loop 一接就漂飞走了。这类问题以前怎么处理记在脑子里改天改两句SKILL.md凭感觉说「应该好了」。但是现在我把问题写进skill-issues.jsonl排了优先级锁了一个假设改了校验脚本再跑 fixture 回归——eval-007 PASS旧用例没挂才 KEEP。这篇文章讲的就是这条线。不是「装一个叫 Darwin 的工具Skill 就会自己变好」。 而是真实问题 → 写成可测的东西 → 一次只改一处 → 考不过就回滚。配套仓库•脚手架plugins/frontend-team-toolkit/skill-engineering•案例 Skillskills/frontend-dev-prompt-craft08 讲原则09 讲怎么跑08篇把道理说清楚了单一修改面、固定验证标准、人类设边界、KEEP/REVERT。09 只做一件事——把这些原则落到你们仓库里已经有的脚本上真实使用 → skill-issues.jsonl → triage_issues.py → convert_issue_to_eval.py或手工补 eval → grade_evals.py改前基线 → 写 evolution-hypothesis.json只改一个维度 → grade_evals.py check_regression.py → KEEP 就发版挂了就回滚口诀还是那句问题可观测、Eval 可锚定、变异可单假设、回归可棘轮。先用人话讲一遍把 Skill 当成一段会跑偏的程序就好懂了你熟悉的自进化里对应什么Bug 单skill-issues.jsonl里的一行排期 / 优先级triage_issues.py单元测试evals/evals.json fixture改代码前先跑测试grade_evals.py打基线一次只修一个 bugevolution-hypothesis.json锁一个维度CI 红了不许合check_regression.pyhigh 挂就 REVERT「自进化」听起来很玄。落地后它就是别凭感觉改 Skill改完要考试。前置条件没有这些别谈自动变好跑通这条线Skill 目录至少要有•SKILL.md•evals/evals.json建议 ≥ 3 条•skill-issues.jsonl•results.tsv•.skill-meta.json用脚手架自检python3 plugins/frontend-team-toolkit/skill-engineering/bin/validate-skill.py \ plugins/frontend-team-toolkit/skills/frontend-dev-prompt-craft还有一条硬条件想做确定性回归就要有 fixture。没有 fixture 时你只能靠run_evals.py调 Agent 实测——慢、贵、不稳定。frontend-dev-prompt-craft后来把 eval-001007 全补上 fixture才做到grade_evals.py7/7 PASS。这不是锦上添花是门禁能自动化的前提。七步流水线对照真实试跑下面每一步都对应 2026-06-22 那次frontend-dev-prompt-craft试跑。完整记录在 Skill 目录的evolution-practice-log.md。1任务结束先记一行问题不要等「攒够十个再写」。下一单结束就追加{date:2026-06-22,skill:frontend-dev-prompt-craft,task_type:API,symptom:PRD 接口 path 与项目 request path 不一致提示词易只写其一,expected:output-contract 要求 PRD path 与项目 path 双轨记录,severity:high,source:session_retro,converted_to_eval:false,eval_id:null,status:open}那次特殊单任务session_retro 一口气记了 8 条。其中 path 双轨、枚举映射是 high。2Triage先打哪只蚊子./plugins/frontend-team-toolkit/skill-engineering/bin/run-evolution-cycle.sh \ --skill frontend-dev-prompt-craft \ --phase triage或直接python3 plugins/frontend-team-toolkit/skill-engineering/scripts/triage_issues.py \ --skills-base plugins/frontend-team-toolkit/skills \ --status open试跑结果15 条 openL10/L11path 双轨、术语→枚举优先级最高。每周只啃 top 1 的 high比一次改五处靠谱。3把问题变成 Eval有两种做法•半自动convert_issue_to_eval.py --dry-run预览确认后--apply•手工像我们当时那样eval-007craftloop 串联已经在 v0.1.1 建好本轮直接拿来当锚点关键不是「谁写的 eval」而是改 Skill 之前先有一条能复现失败的测试。4改之前先打基线有 fixture 时本地零 Tokenpython3 plugins/frontend-team-toolkit/skill-engineering/scripts/grade_evals.py \ --skill frontend-dev-prompt-craft \ --skills-base plugins/frontend-team-toolkit/skills \ --mode all \ --append-results没有 fixture、必须看真实 Agent 行为时再用run_evals.py。日常迭代优先 fixture。5写假设一次只改一个维度先写evolution-hypothesis.json再动手。我们那轮是这样的{ skill:frontend-dev-prompt-craft, target_eval:frontend-dev-prompt-craft-007, problem:PRD 接口 path 与项目 request path 未双轨记录, proposed_change:validate-output.sh --chain 增加 PRD path / 项目 path / userType 检查, dimension:output-contract, rollback_condition:eval-001~006 regression fail, status:verified }脚手架约定的可改维度每次只选一个维度改什么triggerdescription / When to ActivateworkflowWorkflow 步骤output-contractreferences/output-contract.mdtemplatereferences/prompt-templates.mdanti-patternAnti-patterns 表那一轮实际改的是validate-output.sh --chain让 eval-007 能卡住「双 path userType」。 假设写清楚回滚才有依据——不是「感觉不对再 git 找」而是「旧 regression 挂了就 REVERT」。6考试过了才 KEEPpython3 plugins/frontend-team-toolkit/skill-engineering/scripts/grade_evals.py \ --skill frontend-dev-prompt-craft \ --skills-base plugins/frontend-team-toolkit/skills \ --eval-id frontend-dev-prompt-craft-007 \ --append-results --version 0.1.2随后用棘轮门禁看 high riskpython3 plugins/frontend-team-toolkit/skill-engineering/scripts/check_regression.py \ --results plugins/frontend-team-toolkit/skills/frontend-dev-prompt-craft/results.tsv \ --risk high --block true试跑裁决轮次做了什么结果v0.1.2补--chain校验修 path 双轨eval-007 PASS →KEEPv0.1.3给 001006 全补 fixture7/7 PASSmaturity → beta挂了怎么办回滚本轮改动把失败原因写回 hypothesis / practice log下一轮换假设。棘轮的意义不是让你永远成功而是让失败变得便宜、可复盘。7发版并把 issue 关掉KEEP 之后才做这些1.更新CHANGELOG.md、.skill-meta.json2.相关 issue 标fixed可用mark_issue_resolved.py3.需要的话写两句LEARNINGS.md4.看趋势python3 plugins/frontend-team-toolkit/skill-engineering/scripts/evolution_report.py \ --results plugins/frontend-team-toolkit/skills/frontend-dev-prompt-craft/results.tsv哪些能自动试哪些必须人点头这条流水线再熟也有边界。适合小步试的•触发词措辞•Workflow 步骤顺序 / 检查点表述•output-contract 里可被脚本校验的字段•模板补充、反面例子不要交给「自动改完就合」的•Safety / 权限边界•对外承诺、合规条款•evals/evals.json本身测试基线被人偷偷改棘轮就废了•大范围重构一次改五十行以上先拆轮次一句话流水线负责提方案和考试人负责划红线。Darwin 是什么要不要装读到这里你可能才想起来标题里曾经出现过的 Darwin。Darwindarwin-skill是可选外挂不是本篇主角。用人话讲Darwin 像一个会改SKILL.md的实习生它按评分标准提修改、跑几轮试、分数涨了就留、跌了就回滚。 你们仓库里的grade_evals.py/check_regression.py才是带教老师和期末考试。脚手架 README 也把它放在「与外部工具配合可选」里和 skill-creator、skill-audit 并列。核心观点L5 外挂 darwin-skill仍须过 L4 棘轮。实践复盘里Darwin 封装还标在 P2——意思是七步流水线已经能跑Darwin 是加速「提假设」的插件不是地基。什么时候值得接 Darwin•你已经有完整 fixture 回归门禁•你厌倦了自己想「下一句 description 怎么改」•你接受Darwin 的产出照样要过check_regression.py什么时候先别装•还没有 eval / fixture•连skill-issues.jsonl都懒得写•指望「装上就全自动变好」没有 Darwin按本文七步手改一样是正经的自进化。有 Darwin也只是多了一个提案来源——考试规则不变。我们试跑时踩过的坑诚实版这些不是教学故事是脚手架evolution-practice-retro.md里记过的坑后来怎么处理无 fixture 的 eval 没法进确定性 CI补齐 001007 fixture再谈全量回归grade_evals.py子进程路径不对cwd 指到 Skill 目录convert_issue_to_eval.py的 dry-run 逻辑绕改成只有--apply才写入想一次修很多 issue强制单假设其余进evolution-backlog.md所以如果你照着本文做卡在「命令跑不通」——优先查脚手架脚本和 Skill 目录结构而不是怀疑方法论本身。方法论已经在一个真实 Skill 上跑通过脚本细节会继续迭代。读完你可以立刻做的三件事1.给正在用的那个 Skill建或打开skill-issues.jsonl把最近一次翻车写成一行2.跑一次triage_issues.py只选 top 1 high3.写一份evolution-hypothesis.json改一个维度跑grade_evals.py——过了再谈发版不要一上来研究 Darwin。先让「改完能考试」变成肌肉记忆。总结本篇只记住三件事1.自进化的主角是脚手架流水线不是 Darwin 这个skill。是一套自动流水线:issue → triage → eval → 单假设 →grade_evals→ KEEP/REVERT这条链在frontend-dev-prompt-craft上已经跑通过。2.没有 fixture就没有便宜的确定性回归没有回归就谈不上放心自动改。3.Darwin 是可选外挂它帮你提改法考试规则仍是你们自己的棘轮。

相关新闻

服装店入库功能对比测评:日进斗金服装收银系统 vs 管家婆

服装店入库功能对比测评:日进斗金服装收银系统 vs 管家婆

服装门店的入库环节直接关联库存准确性、上架效率和财务对账质量。由于服装商品具有多色、多尺码等属性,且供货商单据形式多样(包括机打小票、手写单、电子截图等),入库操作的便捷性与准确性成为门店选型的重要考量。本文基于实际…

2026/7/29 20:07:30阅读更多 →
Ark-Pets:将明日方舟干员变为你的智能桌面伙伴的终极指南

Ark-Pets:将明日方舟干员变为你的智能桌面伙伴的终极指南

Ark-Pets:将明日方舟干员变为你的智能桌面伙伴的终极指南 【免费下载链接】Ark-Pets Arknights Desktop Pets | 明日方舟桌宠 (ArkPets) 项目地址: https://gitcode.com/gh_mirrors/ar/Ark-Pets 你是否曾幻想过让《明日方舟》中那些可爱的干员走出游戏&#…

2026/7/29 20:07:30阅读更多 →
Pixelle-Video:AI视频创作革命,5分钟从创意到专业短视频

Pixelle-Video:AI视频创作革命,5分钟从创意到专业短视频

Pixelle-Video:AI视频创作革命,5分钟从创意到专业短视频 【免费下载链接】Pixelle-Video 🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine 项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video 你是否曾…

2026/7/29 20:07:30阅读更多 →
RAG 正在裸奔:往知识库塞 5 篇文档,90% 的回答就被劫持了

RAG 正在裸奔:往知识库塞 5 篇文档,90% 的回答就被劫持了

一个 RAG 系统跑了几个月,召回率 85%,用户反馈良好。然后有一天,有人往知识库里塞了 5 篇文档。第二天,90% 的问题都返回了攻击者指定的答案。你的系统看起来一切正常,但回答已经被劫持了。 你花了几个月调 RAG&#x…

2026/7/29 23:30:54阅读更多 →
Siglec: 糖蛋白受体家族的免疫调节作用

Siglec: 糖蛋白受体家族的免疫调节作用

SiglecSiglec(Sialic acid-binding immunoglobulin-like lectins)是一类含有免疫球蛋白样结构域的糖蛋白受体家族,广泛存在于多种免疫细胞中,包括B细胞、T细胞、巨噬细胞、树突状细胞及中性粒细胞等。它们以与唾液酸(s…

2026/7/29 23:30:54阅读更多 →
从零开始掌握二叉搜索树(C++ 完整实现与深度解析)

从零开始掌握二叉搜索树(C++ 完整实现与深度解析)

二叉搜索树(Binary Search Tree, BST)是最基础、最经典的树形数据结构之一。它不仅是理解更高级树结构(如 AVL 树、红黑树、B 树)的基石,在许多实际场景中也直接发挥作用。本文将从定义出发,手把手带你用 C…

2026/7/29 23:30:54阅读更多 →
QQ空间数据备份终极指南:如何一键导出你的青春记忆

QQ空间数据备份终极指南:如何一键导出你的青春记忆

QQ空间数据备份终极指南:如何一键导出你的青春记忆 【免费下载链接】QZoneExport QQ空间导出助手,用于备份QQ空间的说说、日志、私密日记、相册、视频、留言板、QQ好友、收藏夹、分享、最近访客为文件,便于迁移与保存 项目地址: https://gi…

2026/7/29 23:30:54阅读更多 →
仓库里堆的不是货,是真金白银 有色金属仓储:一个容错率为零的战场

仓库里堆的不是货,是真金白银 有色金属仓储:一个容错率为零的战场

有色金属仓储,和你在市面上看到的绝大多数仓库,有着本质区别。 这里放的,不是几块钱一瓶的饮料,不是几百块一件的衣服。是铜、是铝、是锌、是镍——每吨价格以万计,每垛货值动辄百万。 这不是仓库,这是一座…

2026/7/29 23:30:54阅读更多 →
robot_localization配置教程:EKF与UKF节点参数设置与最佳实践

robot_localization配置教程:EKF与UKF节点参数设置与最佳实践

robot_localization配置教程:EKF与UKF节点参数设置与最佳实践 【免费下载链接】ros-sensor-fusion-tutorial An in-depth step-by-step tutorial for implementing sensor fusion with robot_localization! 🛰 项目地址: https://gitcode.com/gh_mirro…

2026/7/29 23:28:54阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →