我给 AI 员工写了一份"灵魂协议":从定时任务到自我生长

我给 AI 员工写了一份"灵魂协议":从定时任务到自我生长
这篇文章回答一个很多做过 AI 的人都碰到的问题:为什么我的 AI 助手做久了就不"长进",永远只会按老办法干活? 我花了很长时间把它变成了一个"会自己成长的数字员工",还把完整思路开源了出来(链接在文末)。如果你是老板、用 AI 工作的人、或者单纯好奇"AI 到底能不能自己变聪明",都值得花 5 分钟看完。
一、止步于此
我有一个 AI 助手,每天帮我维护网站:定时发文、定时巡检、我发消息它处理。后来我给它加了个任务——每天下午四点去论坛逛逛,看看 AI 圈发生了什么,得出一些结论发给我。
它做得不错。但很快我发现一个尴尬的事实:它止步于此。
它今天逛论坛得出的结论,明天就忘了。它做的每件事都是断头的——触发、执行、结束,和上一次、下一次毫无关系。跑一百天和跑第一天一模一样。这不是一个员工,这是一个定时脚本(就是那种到点自动跑一下的程序)。
我开始想:正儿八经的"让 AI 自己生长",为什么做不到?我们总说给 AI 一个目标让它自己派生任务,那这套系统到底由什么驱动?是提示词(你交代它的话)吗?是某种更高级的心跳吗?
二、没有第四种触发
想清楚的第一件事:触发机制永远只有三种——人的消息、时钟(到点自动跑)、事件(有动静才触发)。没有第四种。AI 模型是纯被动的"计算器",算完就结束,没有后台进程、没有"想主动做点什么"的内在冲动。
所以"自我生长"不是发明新的触发源,而是把循环闭合起来:让上一轮的产出成为下一轮的输入。
我的 AI 助手尴尬的根源不在触发层,在于三条断掉的回路:
- 今天的发现不影响明天做什么(没有连续性);
- 做的事没有结果数据回来打分(没有方向);
- 判断"什么值得做"的那个身份永远不变(没有生长)。
把这三条接上,驱动力仍然全是时钟——但从外面看,它就是在自己给自己派任务。时钟只是电源,生长发生在别处。
三、招一个员工,不是买一个脚本
第二个关键认知:目标不该是 KPI(量化指标),该是身份。
"赚一百万"这种结果型目标,达成或失效后系统就死了,还会诱导 AI 走捷径。而"你是一个怎样的人"——比如"一个追前沿、有品味的 AI 内容主理人"——永远不会被"完成",能派生出无穷的事情。你是老板,你给的不是流程,是职责和判断依据。
在这个模型下,任务分两种:
- 固定任务是骨骼:每天几点探索、几点复盘、几点执行、每周整理——像上课一样,保证行为每天都发生;
- 临时任务是念头:AI 自己从见闻和复盘中长出来,也能自己清理掉。会死的任务才是健康的任务。
四、做梦,然后清醒地审判
临时任务立刻带来一个问题:多和少怎么控制?AI 天然觉得什么都值得做,放开了会任务爆炸,收紧了又回到死脚本。
解法是把"生成"和"准入"拆成两个独立动作:
- 每晚做梦:复盘之后放开发散——"这摊事还能怎么搞?"哪怕不靠谱。全部记进一个"梦"文件,不设上限、允许烂点子,因为梦不驱动任何行动;
- 次日准入:清醒地、带着身份重新审一遍昨晚的梦:"这样的人,现在值得为这件事花时间吗?"选中的才进正式任务队列,而且队列有硬上限(默认 7 条)——想进新的,先挤掉旧的。
AI 漂移(越做越跑偏)的风险,大多来自"念头直接变成行动"。梦与行动之间隔一次带身份的重新判断,这一刀就是主闸。
五、基因与血肉
跑通上面这些,还差最后一块,也是最核心的一块:判断的尺子本身,能不能生长?
如果判断"什么值得做"的身份是我第一天写死的几句话,那第 100 天的任务尺度和第 1 天还是一样——任务在更新,但"判断的性格"没长。真正的生长,派生的不是任务,是血肉。
所以身份分两层:
- 基因(只读):我写死的种子——"你是谁、追求什么、什么不许做"。故意写得生硬抽象,永不改动,只有我能改;
- 血肉(AI 自己写):它在经历中长出的自我认知——比如"我发现我写深度解读比追快讯效果好""我常逛前端论坛,AI+前端交叉地带是我的独特视角"。每天复盘的最后问一句:"今天的经历有没有改变我对'我是谁'的理解?"
血肉只能诠释基因、不能和基因矛盾;改动必须注明"基于什么经历"。判断任务时读的是"基因+血肉",于是那双尺子本身在变厚——第 1 天它按字面意思选任务,第 100 天它按一个有品味、有立场的"人"选任务。
生长的定义至此清楚了:不是任务越做越多,而是"判断任务的那个自我"越来越厚。
六、规则不能靠自觉
设计再漂亮,还有一个致命问题:规则写在文件里不等于会被执行。AI 对提示词里的规矩是"大概率遵守",跑一百轮总有几轮忘了限额、忘了写日志。
答案是分层执法:
- 硬规则交给脚本:一个几十行的校验脚本,每轮收尾必跑——任务队列超没超上限、任务带没带日期和理由、改自我认知附没附依据、日志写没写。违规就打回重写,通过才存档。模型负责判断,脚本负责执法;
- 软判断交给身份:品味、取舍、方向感,这些本来就该由"人"来判断;
- 残余误差交给代谢:偶尔一次抽风会被后面的轮次冲掉,而且每一版都有存档,随时能回退到任何一天,每周一份周报把方向盘交还给你。
顺便说个插曲:我把成品往 GitHub 推送前自己跑了一遍校验,被脚本拦下了——"身份文件被修改(只读区)、有改动但没写日志"。规则会咬人,这才叫真能跑起来。
七、它不是我的独创,但补上了公认的短板
动手前我调研了一圈:这种"用文档记录状态 + 定时心跳"的做法,业界已经有成熟地基(比如知名的开源项目 OpenClaw 就是这么做的)。学术上,斯坦福的 Generative Agents 研究、Voyager 那个项目,就是"复盘沉淀"和"自派任务"的源头;而早年的 AutoGPT 之所以火了一阵就凉了,恰恰因为没有身份锚、没有外部反馈、没有遗忘机制。
对照下来,我这套设计补的正好是现有方案的短板,尤其这三点别人做得少:
- 双层身份:只读基因 + 可生长的血肉,防跑偏;
- 梦和行动的隔离:念头不能直接变成行动,任务设上限、强制清理;
- 机械执法:规则不靠自觉,靠脚本保证每条都执行。
八、最有意思的部分:这个项目不是给人读的
最后一步让整件事变得好玩起来:这套系统的安装说明书,是写给 AI 读的。
使用方法只有一句话——把仓库链接发给你的 AI 助手,说:"读安装协议,按协议安装。"
这份安装协议是专门写给 AI 看的,核心规矩:
- 嫁接不覆盖:对方 AI 已有的记忆、人格是主人最宝贵的资产,一个字不许丢。已有文件沿用,缺的才建,冲突不许它自己裁决;
- 第一个动作是存档:装坏了可以整体回滚;
- 存量任务只做方案:现有定时任务逐条归类(和新的重叠/互补/无关),给出建议,一律等你拍板,它不许自己改;
- 入职面谈:文件就位不算装完。AI 必须回头问你一张清单——你希望它是一个什么样的"人"?负责什么?什么永远不做?什么可以直接做?每项都要你明确回答,不许用默认值糊弄过去;
- 就绪汇报:最后交一份报告——装了什么、它以后每天能干嘛、还需要你做什么。汇报送达,安装才算完成。
装好之后,你的角色就变了:不再是写脚本的程序员,而是带人的老板。每周花十分钟读周报、批准或驳回它的申请,偶尔调整方向。它做的很多事是你没安排过、甚至没想到的——这正是招一个人而不是买一个脚本的全部意义。
结语
一句话总结整个系统:时钟给电,身份给方向,状态文件给连续性,外部反馈给修正,执法脚本守底线,每周面谈防漂移。 生长不是某个零件的功能,而是这六件事凑齐之后,从整体上冒出来的东西。
项目已开源(MIT):https://github.com/caiaiacai/self-evolving-agent
全部的代码只是几个文档、四段定时提示词和一个校验脚本,零依赖。把链接发给你的 AI,让它自己来装——然后告诉我,它长成了什么样。