CLOUDFLARE DATA PIPELINE

数据标注 / 大模型训练数据交付流程图

数据依次经过 原始数据集存储 → R2(原始) → R2(处理后) → 客户存储 四个落地点, 中间由 入站迁移 · 站内处理 · 出站分发 三个操作串起来。 全链路核心价值:入站不限速、出站流量费 ¥0、出站不限带宽、处理不出网
主链路全景 END-TO-END FLOW
实线卡片 = 数据存储(数据落在哪里) 彩色块 = 数据操作(数据怎么流过去) 4 个存储节点 · 3 个操作步骤 · 每一步的优势直接标在操作块上
存储 01

原始数据集存储

数据标注公司的生产桶,托管在 阿里云 OSS 或自建对象存储,存放采集数据与标注成果
视频 / 图像 点云 文本语料
oss://dataset-raw/
操作 01
入站迁移
ECS 推送(rclone / s5cmd 分片并发)
或 Data Migration 托管迁移
入站不限速 · 入站流量 ¥0
存储 02

Cloudflare R2
(原始数据集)

数据在 CF 的第一份落地副本,与原桶保持 1:1,作为后续所有处理与分发的唯一数据源头
S3 兼容 入站已完成
r2://dataset-raw/
操作 02
站内处理
Workers 读取 → 清洗 / 去重 / 格式转换 / 脱敏 / 分片 → 回写
CF 内网闭环 · 零出网流量
存储 03

Cloudflare R2
(处理后数据集)

Workers 加工后的交付就绪版本,可直接被客户拉取;原始副本保留,处理可随时重跑、可迭代多版
交付就绪 可多版本并存
r2://dataset-processed/
操作 03
出站分发
客户 ECS / 训练集群主动拉取
或 Workers 取数转发(鉴权 · 限速 · 适配)
出站流量 ¥0 · 出站不限速
存储 04

客户存储

具身智能 / 大模型公司的训练集群、S3 兼容存储、NAS 或 HDFS,落盘后直接进入训练与评测
训练集群 标注平台回写
客户 VPC / IDC
三个操作详解与 Cloudflare 优势 OPERATION BREAKDOWN
1

操作 01 · 入站迁移

存储 01 原始数据集存储
→ 存储 02 R2(原始)
实现方式
阿里云 ECS 推送:rclone / s5cmd 多线程分片并发上传,脚本化、可断点续传
Cloudflare Data Migration:控制台配置源桶与凭据,CF 侧自动拉取,无需自建迁移机、无需运维
Cloudflare 优势
  • 入站带宽不限速:不设带宽上限、不做突发限速,吞吐只受源端 ECS 能力约束
  • 入站流量免费:写入 R2 不收流量费,也无跨区域入网费
  • S3 完全兼容:现有 rclone / SDK / 数据流水线脚本零改造直接接入
  • 本地直传 Local Upload:标注团队可在本地工作站用 rclone / Wrangler / 控制台拖拽 直接上传,无需先落 OSS 中转,也不占用源站公网出口带宽
📈
实测吞吐:基本达到 ECS 实例带宽上限,性能完全满足批量交付需求
2

操作 02 · 站内处理

存储 02 R2(原始)
→ 存储 03 R2(处理后)
典型处理任务
清洗与去重:剔除坏帧、重复样本、低质量数据
格式转换:JSONL / WebDataset / TFRecord / Parquet 互转
工程化处理:分片、压缩、脱敏、标注格式标准化、元数据抽取
Cloudflare 优势
  • 处理不出网:Workers 与 R2 在同一网络内闭环,读取—处理—回写全程 零出网流量费
  • 免运维弹性:全球边缘节点就近执行,自动扩缩容,无需管理服务器
  • 按请求计费:空闲不计费,避免为峰值常驻一批 ECS
  • 可编排:Queues 做任务队列与重试,Pipelines 承接流式数据摄取
💡
把「先下载 → 本地处理 → 再上传」的两次出网,压缩成 一次都不出网
3

操作 03 · 出站分发

存储 03 R2(处理后)
→ 存储 04 客户存储
实现方式
客户侧主动拉取:ECS 或训练集群用 rclone / S3 API 高并发并发拉取,直接落盘
Workers 拉取转发:由 Workers 取数并转发,同时完成鉴权、限速、格式适配与分发编排
Cloudflare 优势
  • 出口流量费 = 0:R2 不收 egress 费用,交付量越大省得越多
  • 出口带宽不限速:无带宽包上限、无突发限速、无阶梯计价
  • 链路更稳:Anycast 就近接入 + Cloudflare 骨干网回源,跨境/跨地域抖动更低
  • 无附加成本:不需要 NAT 网关、弹性公网 IP、专线或 CDN 加速包
📈
实测吞吐:基本跑满客户 ECS 网络带宽,交付周期可控
对数据标注类客户的核心价值 WHY CLOUDFLARE
成本可预测

最大的不确定项——出网流量费——直接归零。账单只剩存储量与操作次数,交付规模越大,单位成本越低。

交付无带宽瓶颈

入口出口均不限速,不再受带宽包与突发限制约束。TB 级数据集交付从「按周排期」压缩到「按天完成」。

S3 兼容,零改造

标准 S3 API,rclone、s5cmd、各语言 SDK、现有数据流水线全部可直接复用,迁移与接入成本极低。

存储 + 计算一体

R2 与 Workers 同网协同:数据不落地、不绕公网、不产生出网费即可完成加工,天然适合海量小文件处理。

方案对比 COMPARISON
对比维度 传统方案(OSS 直出公网 / 自建中转) Cloudflare R2 + Workers
出站流量费 按 GB 计费,数据量大时成为最大成本项,跨境 / 出海场景更贵 ¥ 0 —— R2 不收取任何 egress 费用
入站带宽 受 ECS 实例规格与带宽包上限约束 不限速,吞吐仅取决于源端能力
出站带宽 受带宽包约束,超出需临时加购,突发传输成本高 不限速,无突发限速、无阶梯计价
数据处理链路 需额外 ECS / 函数计算,数据「下载—处理—上传」产生双份出网流量 Workers 在 CF 内网闭环处理,零出网流量、零额外机器
迁移方式 自建迁移机 + 脚本运维,需持续盯进度与重试 Data Migration 托管迁移,或 ECS 直推,配置即用
接口兼容 各家 SDK 不一,切换需改造 标准 S3 兼容 API,现有工具链零改造
全球 / 跨境加速 需额外购买加速服务或专线,成本与运维双增 Anycast 就近接入 + 内置 CF 骨干网,无需额外组件
实测吞吐 受带宽包上限压制 入站 / 出站均可达 ECS 实例带宽上限