Skip to content

小模型号池驱动的数据清洗技术

🕒 Published at:

小模型号池驱动的数据清洗技术 ​

核心思路 ​

  • 不用昂贵的大模型做数据清洗,改用多个廉价小模型 API 组成资源池
  • 轮询调度 + 多路并发,榨干所有可用 API key 的吞吐量
  • 分层调度:父代理派子代理,子代理直调 API

技术栈 ​

组件作用
CPA(Cloud Proxy API)API 网关,多 provider 轮询 + 冷却 fallback
opencode Task 工具父代理派生子代理,天然支持并发
子代理(Sub-agent)每个处理 10 个 job,直接调 CPA
PROMPT.md任务规则文件,子代理自我读取

架构 ​

CPA 配置
  routing.strategy: round-robin  # 轮询分配
  session-affinity: false        # 关粘性会话

可用 provider 池(已启用):
  agnes-2.0-flash
  小水管user (deepseek-v4-flash 等)
  小水管claude (deepseek-v4-flash)
  yjjhwjw (agnes-2.0-flash)
  SenseNova (deepseek-v4-flash)

工作流程 ​

pending/ 按 10 个一分 → batch_001 ~ batch_422
                    ↓
父代理 A(前向 batch_001→211)  父代理 B(反向 batch_422→212)
    ↓ 循环派生子代理                  ↓ 循环派生子代理
10 个子代理并行处理 10 个 batch    10 个子代理并行处理 10 个 batch
    ↓ 每子代理调 CPA                   ↓ 每子代理调 CPA
CPA 轮询分配到不同 provider      CPA 轮询分配到不同 provider
    ↓                                  ↓
写 .decision.json 到原文件夹      写 .decision.json 到原文件夹

关键设计 ​

  • 每 10 个 job 一个文件夹:最小工作单元,子代理零冲突
  • 两路对进:前向 + 反向,避免文件锁竞争
  • 自我发现:子代理只需读 PROMPT.md,自动知道做什么
  • CPA 轮询:多个 provider 自动负载均衡,429 自动冷却换下一个
  • 不移动文件:原地写 .decision.json,零搬运开销

适用场景 ​

  • 大量数据需要逐条做 AI 判断(切分、分类、标注等)
  • 多个廉价 API 可用但单个有限速
  • 需要高并发吞吐但预算有限

实际效果 ​

  • 4355 条 job,分批 422 个文件夹
  • 20 个子代理并发(2 个父代理 × 10 个子代理)
  • 预计 2~3 小时完成全部清洗