WeChat (程叙架构与AI)
ai-engineeringai-toolsdev-tools
Original source

Prime Agent 正式开源:一个会自己变强的编程 Agent,ARC-AGI-3 95.5% 反超人类专家

Summary

Prime Intellect 于 8月5日正式开源 Prime Agent — 一个自改进的 RLM (Recursive Language Model) Harness,专为编程和长时间自主任务设计。

核心设计

  1. RLM:整个会话是一个持久 IPython 内核 — 模型唯一工具就是 Python 环境,可以对历史上下文编程、调用工具、启动子 Agent。长会话变成”编程问题”而不是堆 token。

  2. Continual Harness:harness 自己会进化 — Harness 的 prompt、memory、skill、子 Agent 规格都是可 CRUD 的实体。通过 /refine 机制根据实际轨迹做证据驱动的小改动,支持按 ID 回滚。

  3. 持久多 Agent 编排 + 直接通信 — 子 Agent 可后台常驻、互相发消息,支持 fan-out 并行、心跳、定时任务,限制在”核家庭”内通信防串线。

性能亮点

  • ARC-AGI-3: 95.5% (Best@1),反超人类专家基线 95.4%;Best@3 达 99.97%
  • 同款 Opus 5 换原生 harness 只有 30.2% — harness 差距比换模型还大
  • EmulatorBench: 从零用 Rust 写出 SEGA Genesis 和 GBC 模拟器(沙箱无参考实现)
  • 搭配开源模型 GLM-5.2 在长上下文基准上可与闭源模型竞争
  • GPU kernel 写作 (PMPP-Hard) 表现优异

技术架构

  • 基于开源项目 pi(84k+ star AI agent toolkit)构建
  • TUI 界面,IPython 操作折叠展示
  • Daemon 进程管理所有会话,终端断开 agent 照跑
  • 子代理空闲 30 分钟自动卸载,被点名立刻从磁盘重载
  • MIT 协议,GitHub 6500+ star
  • 安装一行命令:curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh

关键洞察

Agent 瓶颈越来越不只是模型本身 — harness 能否释放模型能力、能否随使用进化同样关键。Prime Agent 的 “harness 自我改进” 可能是下一波 Agent 军备竞赛的关键方向。