DataFlow-Harness: 北大开源 AI 数据流水线 Agent 平台
- URL: https://mp.weixin.qq.com/s/Gah00ChUSnHItOnDMO6jBQ
- Date Saved: 2026-08-08
- Source: WeChat (Datawhale)
- Tags: ai-engineering, ai-tools
- Repo: https://github.com/OpenDCAI/DataFlow-WebUI
Summary
北大 DCAI 团队发布 DataFlow-Harness — 让 Code Agent 在真实平台约束内构建可编辑、可复用的数据流水线(DAG),解决 NL2Pipeline gap。
核心问题
AI 数据准备(训练/微调/RAG)是 LLM 落地最难啃的骨头:解析文档、恢复版面、识别图表、对齐 QA、过滤低质量、统一格式。手搓脚本和 Code Agent 一次性脚本都难以复用和审计。
架构四组件
- Data Pipeline Backend — 状态中心,pipeline = (数据源D, 算子O, 依赖边E, Schema S, 运行状态R)
- MCP Tools Layer — Agent 通过 typed mutations 修改 pipeline(非自由脚本),走 Request-Validate-Commit 流程
- DataFlow-Skills — 编码算子选择模式、Schema 依赖、参数配置经验、流水线装配步骤
- DataFlow-WebUI — 对话 + DAG 画布双模式,共享同一份 pipeline 状态
性能数据
- 端到端通过率 93.3%(接近 Context-Aware Claude Code 的 94.2%)
- 成本比 Vanilla Claude Code 降 72.5%($0.261 vs $0.950)
- 延迟降 49.9%(95.5s vs 190.7s)
- 输出 Native DAG(可视化编辑、复用)
下游训练验证
- 数学推理:微调 Qwen2.5-32B,AIME24@32 从 25.1 → 35.9
- 通用 SFT:微调 Qwen2.5-7B-Base,MBPP 从 64.6 → 75.4
- Skills 在复杂任务提升最大(QA basic: MCP-only 6/10 vs Harness 10/10)
关键洞察
- Operator registry 解决”有哪些工具”,Skills 解决”工具如何连成正确数据流水线”
- 封装成 Harness 后性能没下降,反而成本和延迟大幅降低
- 数据工程的难点不是单次模型调用,而是多阶段流水线的组织和质量控制