首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >机器学习数据收集优化技术解析

机器学习数据收集优化技术解析

原创
作者头像
用户11764306
发布2025-08-13 21:36:46
发布2025-08-13 21:36:46
1640
举报

现代深度学习系统需要海量数据集才能实现优异性能,但关于收集数据量和类型的指导原则却很少。过度收集会导致不必要的成本,而收集不足则可能产生未来成本并延误工作流程。

提出了一种将数据收集工作流建模为形式化最优数据收集问题的新范式,允许设计者指定:

  • 性能目标
  • 收集成本
  • 时间范围
  • 未达目标的惩罚措施

该框架可泛化到具有多个数据源的任务(如半监督学习中的标记和未标记数据),并能轻松适配定制化分析场景(如向现有模型引入新类数据)。

为解决该问题,开发了Learn-Optimize-Collect (LOC)算法,其可最小化预期未来收集成本。通过数值实验将本框架与传统基线(通过神经缩放定律外推数据需求)进行比较,在多个分类、分割和检测任务上:

  • 显著降低未达性能目标的风险
  • 同时保持较低的总收集成本

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档