造Agent还要手调?LlamaFactory作者开源企鹅驾驭师:0.2元让Agent自进化,Codex平替

造Agent还要手调?LlamaFactory作者开源企鹅驾驭师:0.2元让Agent自进化,Codex平替 封面

第一章 手动调Agent太累?它让Agent自己造自己

做过Agent的人都知道一个真相:搭出来只是开始,调好才是噩梦。提示词改八百遍,准确率还在50%上下晃。

8月4日,LlamaFactory的作者郑耀威(GitHub 7万星那位)开了个新坑,叫PenguinHarness,中文名”企鹅驾驭师”。一句话点题:让Agent自动构建Agent,还能自己评测、自己迭代。

它是全球首个支持多Agent自进化的Harness。什么意思?你给它一个目标,它派出Agent去造另一个Agent,造完自己跑评测,分数低就改,改完再测,直到能交付。

最夸张的数据:从零构建一个新Agent,成本只要0.2元。耗时是Codex的一半,成本不到Codex的1/200,结果还更贴近可交付。准确率能从50%一路拉到90%。

Apache 2.0开源,Linux、macOS、Windows 10+全支持,x64和arm64都行。这正是2026年炒得火热的”AI造AI、递归自我进化”方向,被它做成了开箱即用的工具。

第二章 装好就开干:一行命令起Web

装它比想象中简单,官方一行安装器自带Node运行时。

Linux或macOS:curl -fsSL https://penguin.ooo/install.sh | sh,然后 penguin web。Windows的PowerShell里:irm https://penguin.ooo/install.ps1 | iex,同样 penguin web。装完自动打开 http://127.0.0.1:7364。

首次登录默认账号 admin / penguin-2026,进去第一件事——改密码。然后在应用内的Models页面配你的模型API Key,就能开聊了。

不想用在线安装?npm install -g @prismshadow/penguin-cli 也行(需Node >= 24)。每个GitHub Release还附带离线安装包,断网机器解压就能跑。

一句指令,0.2元造出一个带引用的RAG应用
一句指令,0.2元造出一个带引用的RAG应用

第三章 一句话构建RAG应用:0.2元的魔法

光吹没用,看实战。在对话框里输入一句:

“收集某个GitHub仓库的文档,做一个带来源引用的RAG问答应用。”

PenguinHarness的Agent会自动把这事拆成几步:抓取仓库文档、生成项目脚手架和依赖配置、实现检索增强和问答逻辑、带上可点击的引用、最后给出启动命令和示例。一套下来,一个完整的文档专家应用就出来了,带检索、带引用、带示例问题。

整个过程的Token成本,约0.2元。你没看错,两毛钱。同样的需求丢给Codex,花钱多几十倍,结果还中英混杂、没有流式、没有引用。

这背后是它的极简设计哲学:内核把Shell当通用接口,系统提示词只有Claude Code的十分之一(1300词对15000词)。轻,才跑得动、迭代得起。

自进化闭环:准确率从50%一路卷到90%
自进化闭环:准确率从50%一路卷到90%

第四章 自进化引擎:50%准确率飙到90%

企鹅驾驭师真正吓人的,是自进化闭环。它不是一次生成就完事,而是”生成—评测—反思—再生成”。

官方给的递归轨迹很说明问题:一个空白Agent基线只有4.81分(满分10)。第一轮,它从一份通过范例里推断出了”结构”,涨到5.61。第二轮,它递归地改自己的约定文件,把固定常量锁定成字面量,直接飙到9.80。

两轮自我迭代,分数单调上升,全程没有人工调参。Agent自己学会了”这个领域的报告该怎么写、哪些字段是死的、哪些是活的”。

这颠覆了过往认知:过去我们以为调Agent靠老师傅手感,现在可以让Agent自己当老师傅,越干越准。你只管定目标,进化交给引擎。

第五章 生产实战:体检报告与产线巡检

别以为这只是玩具。开发团队已经把它塞进了两个真实生产场景。

某体检机构,用企鹅驾驭师生成了一个”医学专家级报告核查Agent”。过去一份报告人工核查要30分钟,现在几十秒。准确率对标真专家,还不知疲倦。

某制造企业,用它造出多个Agent跑流水线巡检:全天候盯设备状态,异常自动恢复。结果产线停机时间减少65%,产出提升近2倍。

这两案例说明一件事:自进化Agent不是实验室demo,是能扛业务的”数字员工”。它便宜、可部署、能评测,老板看了会心动。

第六章 1000+模型随便接,还能当Codex平替

模型自由度是它的另一张王牌。DeepSeek V4、Kimi K3、GLM 5.2、Hunyuan 3、Qwen 3.8 Max、GPT 5.6、Gemini 3.6 Flash、Claude 5……内置预设一大堆,任何OpenAI协议端点也能接,加起来1000多种模型。

它内置的Agent保持极简,把Subagent当核心性能目标优化。多用户隔离、团队协同都支持——既能当Agent自动构建平台,也能当Codex的本地平替,用更低的成本干同样的活。

对国内用户友好:国产模型一键接入,网络稳、合规省心。想省钱,接本地Ollama;想上强度,换旗舰。一套引擎,全场景通吃。

第七章 谁该用?开发者、团队、一人公司

最后说清楚:这玩意儿不是给纯小白玩的,它面向”想认真用Agent的人”。

开发者:你可以用CLI和SDK把它脚本化,让Agent驱动Agent,写工具、跑评测、做递归进化。penguin run -m “做个XX”一句话派活。

团队:多用户隔离、团队协同、评测中心、Trace观测,企业部署的要件它都有。把Agent生产工程化,别再各写各的野脚本。

一人公司:你没精力手调几十个Agent,但你需要它们干活。让企鹅驾驭师当你的”Agent工厂”,0.2元一个造出来,自己迭代到能用,再上岗。2026年,会造Agent的人,比会用Agent的人值钱十倍。

© 版权声明
THE END
喜欢就支持一下吧
点赞60 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容