Prime Agent 正式开源:一个会自己变强的编程 Agent,ARC-AGI-3 95.5% 反超人类专家
- URL: https://mp.weixin.qq.com/s/R2E1N8LdHu1wpxf3SmHqLA
- Date Saved: 2026-08-08
- Source: WeChat (程叙架构与AI)
- Tags: ai-engineering, ai-tools, dev-tools
- Repo: https://github.com/PrimeIntellect-ai/prime-agent
Summary
Prime Intellect 于 8月5日正式开源 Prime Agent — 一个自改进的 RLM (Recursive Language Model) Harness,专为编程和长时间自主任务设计。
核心设计
-
RLM:整个会话是一个持久 IPython 内核 — 模型唯一工具就是 Python 环境,可以对历史上下文编程、调用工具、启动子 Agent。长会话变成”编程问题”而不是堆 token。
-
Continual Harness:harness 自己会进化 — Harness 的 prompt、memory、skill、子 Agent 规格都是可 CRUD 的实体。通过 /refine 机制根据实际轨迹做证据驱动的小改动,支持按 ID 回滚。
-
持久多 Agent 编排 + 直接通信 — 子 Agent 可后台常驻、互相发消息,支持 fan-out 并行、心跳、定时任务,限制在”核家庭”内通信防串线。
性能亮点
- ARC-AGI-3: 95.5% (Best@1),反超人类专家基线 95.4%;Best@3 达 99.97%
- 同款 Opus 5 换原生 harness 只有 30.2% — harness 差距比换模型还大
- EmulatorBench: 从零用 Rust 写出 SEGA Genesis 和 GBC 模拟器(沙箱无参考实现)
- 搭配开源模型 GLM-5.2 在长上下文基准上可与闭源模型竞争
- GPU kernel 写作 (PMPP-Hard) 表现优异
技术架构
- 基于开源项目 pi(84k+ star AI agent toolkit)构建
- TUI 界面,IPython 操作折叠展示
- Daemon 进程管理所有会话,终端断开 agent 照跑
- 子代理空闲 30 分钟自动卸载,被点名立刻从磁盘重载
- MIT 协议,GitHub 6500+ star
- 安装一行命令:
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
关键洞察
Agent 瓶颈越来越不只是模型本身 — harness 能否释放模型能力、能否随使用进化同样关键。Prime Agent 的 “harness 自我改进” 可能是下一波 Agent 军备竞赛的关键方向。