
第一章 一个能”自己变强”的AI编程Agent,来了
先说结论:这几天最炸的开源项目,是 Prime Intellect 甩出来的 Prime Agent。为什么值得你放下手里的活看两眼?就一句话——它是目前极少数”用一次比一次聪明”的编程 Agent。
你有没有过这种崩溃时刻?昨天刚跟 Cursor 讲清楚”我喜欢先写测试再写实现”,今天开新会话,它又跟没事人一样从头问你技术栈。每一个主流编程 Agent 都是”金鱼记忆”,会话一关,前面聊的全忘光。你得一遍遍复读自己的规矩,累不累?
Prime Agent 就是冲着这个痛点来的。它 8 月 5 日开源,一行命令就能装,跑在 Anthropic 的 Opus 5 上,在专门测抽象推理的 ARC-AGI-3 上拿了 95.5 分——人类专家基线才 95.4。更狠的是,它还从零手搓出了一个能跑的世嘉 MD 模拟器。这不是那种”刷题库”能作弊的成绩。开源、MIT 协议、背后是 7 月刚融了 1.3 亿美金、估值 10 亿刀的团队。分量够不够?
第二章 “上下文是变量”,这句话价值千金
Prime Agent 底层踩的是一个新范式:RLM,递归语言模型。听着玄乎,我给你翻译成人话。
普通 Agent 干活是这样的:你让它读一个文件,整个文件”哗”地全塞进上下文窗口,变成一堆 token。读 40 个文件?你的窗口就被 40 个文件的正文占满了,哪怕你只想看其中三行。每一次工具调用,都是一笔”永久税”,越读越堵,最后指令都被埋在 node_modules 的目录列表底下——这就是长任务 Agent 翻车的经典死法:上下文膨胀。
Prime Agent 换了个活法:它不直接”读”,而是写 Python。文件被塞进一个内核变量里,模型可以对它 len() 一下、正则切一刀、只挑出关心的那三个函数,然后只把这三个函数拎进自己的上下文。说白了——上下文不再是被动接收的一坨文字,而是它能随手操作的数据。
效果有多大?官方在长上下文评测 OOLONG 上,同一个开源模型 GLM-5.2,用 Prime Agent 跑出 0.700,换成普通方案只有 0.420——啥都没改,光换了处理上下文的方式,成绩提了 67%。这才是硬功夫。
第三章 一行命令装好,5分钟跑通第一个任务
别怕,上手比你想的简单。官方给的稳定版安装就一行:
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
装完进你的项目目录,敲 prime-agent 启动,第一次会让你跑 /login 选模型来源。它内置支持 Claude Pro/Max、ChatGPT Plus/Pro(走 Codex)、GitHub Copilot 这些订阅账号——你有现成的会员就不用另外掏 API 的钱。想用 API key 也行,设个环境变量就认。
然后先随便问一句”帮我总结这个仓库、告诉我怎么跑测试”,确认内核启动正常。这里我必须给你划重点:第一次玩,务必指到一个可丢弃的克隆或干净的 worktree 里!因为 Prime Agent 执行模型生成的 Python 和命令,是用你的用户权限跑的,官方明说了”它不是安全沙箱”。别拿你唯一的主仓库去冒险,先建个 Git 检查点,稳。

第四章 核心玩法:让 Agent 自己开分身
这是 Prime Agent 最爽的地方——子 Agent 不是什么复杂的编排框架,就是一个函数调用。
你想让它并行干两件事?直接说:”把’鉴权’和’测试覆盖率’当成两个独立子任务,并行跑,最后汇总。”底层它就会写这样的 Python:
auth = await rlm("审查 auth/ 的鉴权流程", name="auth-expert")api = await rlm("审查 src/ 的 HTTP 接口层", name="http-expert")
两个 await 一放,扇出就完成了,不用写 YAML、不用画 DAG、没有 supervisor 节点。这就是”子 Agent 即函数”的威力。
还有个新手最容易懵的点:rlm() 是”派活即返回”,它给你一个句柄,但不会等子 Agent 干完再返回结果。子 Agent 干完会主动向父 Agent 汇报。而且父 Agent 能在子 Agent 还在跑的时候实时”喊话”纠偏——”顺便把中间件的错误处理也覆盖一下”。这种父子、兄弟之间直接对讲的能力,是它区别于其他工具的核心。子 Agent 还扛得住内核重启、崩溃恢复,明天再来它还在。

第五章 会”记仇”的Agent:越用越懂你
回到开头那个痛点。Prime Agent 用一个叫 Continual Harness(持续进化脚手架)的东西,把”金鱼记忆”给治了。
它的系统提示词、学到的”技能”、子 Agent 的定义,全都作为持久状态存下来,而且 Agent 自己能对这些状态做增删改查。你敲一句:
/refine "永远先写测试再写实现"
这条规矩就焊进脚手架里了。下个会话还在,再下个会话也在。你用得越久,它就越懂你的工作习惯,你不用再维护什么提示词库、也不用每次手动喂上下文。对那些跑好几天、跨好多会话的大项目来说,这个差别是决定性的。
它还有一套 daemon 后台架构:关掉终端,会话照样在后台跑,子 Agent、定时任务、心跳全都不断。配合 /goal 让目标跨轮次持久、/autonomous 在配额内自主推进,你完全可以把一个长任务丢给它,睡一觉起来看结果。
第六章 避坑清单:这几个雷别踩
吹了这么多,也得说说它的坑,不然你上手要骂人。
- 它不是沙箱,安全线要自己划。再强调一遍:模型生成的代码用你的权限执行。第一次务必用可丢弃仓库,别指着你的家目录跑。
- 目前只官方支持 macOS 和 Linux。Windows 用户先看项目的平台说明,别当成原生 Windows 教程照抄,终端行为得单独验证一遍。
- 安装可能撞权限墙。全局 npm 目录写不进去是常见问题,解决办法是在测试工作区里用一个隔离的 npm prefix 重跑同一个官方安装脚本,就能干净装好,不动系统目录。
- 自进化循环用猛了很烧钱。按现在的模型定价,频繁触发 /refine 和递归子 Agent,token 消耗不小。还有开发者反馈生成的文件偶尔”代码膨胀”。这俩是真问题,不是能忽略的边角料。
- “自我改进”别理解错。它是脚手架层面记录和优化辅助状态,不是模型自己重训练,更不等于”默认就安全”。
第七章 该不该上车?我的判断
说句公道话:论纯写代码的质量和产品打磨度,Claude Code 还是 2026 年的标杆,Cursor 赢在 IDE 体验,Cline 赢在简单和”先审批后动手”的安全感。Prime Agent 赢的是一件事——持久化。
所以我的判断很清楚:如果你只是写写小脚本、改改 bug,现有工具够用,没必要折腾。但如果你的活是那种跨好几天、好几个会话的长项目,或者要跑重研究型任务、要让 Agent 无人值守跑好几个小时——那 Prime Agent 的自修改脚手架和持久子 Agent,是别的开源 Agent 现在给不了的。
更大的意义在于,它是 Prime Intellect “开源超级智能栈”这盘大棋的开发者入口。当巨头们把 AI 基础设施越关越死,有人愿意把这套东西 MIT 开源出来,这件事本身就值得点个赞。想尝鲜的,今天就拿个测试仓库跑一跑吧。
暂无评论内容