WeChat (Datawhale)
ai-engineeringai-tools
Original source

DataFlow-Harness: 北大开源 AI 数据流水线 Agent 平台

Summary

北大 DCAI 团队发布 DataFlow-Harness — 让 Code Agent 在真实平台约束内构建可编辑、可复用的数据流水线(DAG),解决 NL2Pipeline gap。

核心问题

AI 数据准备(训练/微调/RAG)是 LLM 落地最难啃的骨头:解析文档、恢复版面、识别图表、对齐 QA、过滤低质量、统一格式。手搓脚本和 Code Agent 一次性脚本都难以复用和审计。

架构四组件

  1. Data Pipeline Backend — 状态中心,pipeline = (数据源D, 算子O, 依赖边E, Schema S, 运行状态R)
  2. MCP Tools Layer — Agent 通过 typed mutations 修改 pipeline(非自由脚本),走 Request-Validate-Commit 流程
  3. DataFlow-Skills — 编码算子选择模式、Schema 依赖、参数配置经验、流水线装配步骤
  4. DataFlow-WebUI — 对话 + DAG 画布双模式,共享同一份 pipeline 状态

性能数据

  • 端到端通过率 93.3%(接近 Context-Aware Claude Code 的 94.2%)
  • 成本比 Vanilla Claude Code 降 72.5%($0.261 vs $0.950)
  • 延迟降 49.9%(95.5s vs 190.7s)
  • 输出 Native DAG(可视化编辑、复用)

下游训练验证

  • 数学推理:微调 Qwen2.5-32B,AIME24@32 从 25.1 → 35.9
  • 通用 SFT:微调 Qwen2.5-7B-Base,MBPP 从 64.6 → 75.4
  • Skills 在复杂任务提升最大(QA basic: MCP-only 6/10 vs Harness 10/10)

关键洞察

  • Operator registry 解决”有哪些工具”,Skills 解决”工具如何连成正确数据流水线”
  • 封装成 Harness 后性能没下降,反而成本和延迟大幅降低
  • 数据工程的难点不是单次模型调用,而是多阶段流水线的组织和质量控制