Loading [MathJax]/jax/output/CommonHTML/config.js
前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
圈层
工具
发布
首页
学习
活动
专区
圈层
工具
MCP广场
社区首页 >专栏 >AI自动化标注崛起,数据标注员要失业了?

AI自动化标注崛起,数据标注员要失业了?

作者头像
科技云报道
发布于 2024-01-29 03:41:56
发布于 2024-01-29 03:41:56
4280
举报
文章被收录于专栏:科技云报道科技云报道

数据标注行业流行着一句话:“有多少智能,就有多少人工”。

由于需要标注的数据规模庞大且成本较高,一些互联网巨头及一些AI公司很少自己设有标注团队,大多交给第三方数据服务公司或者数据标注团队来做。

这也衍生出了专为AI而生的人力密集型的数据标注产业链。

例如,众包平台Mechanical Turk上的20万名AI数据标注员,就分布在人力成本低廉的非洲和东南亚。印度甚至涌现了不少数据标注村,他们为美国、欧洲、澳洲和亚洲的AI公司服务。

在中国,上百万名 AI 数据标注员分布在贵州、山西、山东、河南等省份的二三线城市,并逐步向人力成本更低的县城渗透。

但讽刺的是,数据标注员正在被自己服务的AI所替代,已经有企业开始采用AI进行数据标注。

据彭博社1月14日报道,苹果公司将关闭圣地亚哥一个与人工智能业务相关的121人团队,这将导致数据标注员面临被解雇的风险。

那么,人工数据标注能否真的被AI全面替代,我们又是否会进入“AI训练AI”的时代呢?

AI自动化标注崛起

训练一个高效的大模型必不可少的是高质量的数据。OpenAI正是借助基于人类标注的数据,才一举从众多大模型企业中脱颖而出,让ChatGPT成为了大模型竞争中阶段性的胜利者。

但同时,OpenAI也因为使用非洲廉价的人工进行数据标注,被各种媒体口诛笔伐。

对于数据标注,一定需要找到一个新的方法,才能避免大量使用人工标注带来的包括道德风险在内的其他潜在麻烦。

因此,全球各大AI巨头和大型独角兽,都在进行数据标注自动化的探索。

苏黎世大学研究发现,ChatGPT平均每个标注成本低于0.003美元,比众包平台便宜20倍;在相关性、立场、主题等任务中,ChatGPT也是以4:1的效率优势“碾压”人类。

来自卡耐基梅隆大学、耶鲁大学和加州大学伯克利分校的一组研究人员更是发现:GPT-4在数据集标注表现上优于他们雇用的最熟练的众包员工。

这一突破为研究人员节约了超过50 万美元和2万个工时。

论文发出后,有网友评论称“这是直接端了平台工作者的饭碗”。

目前在自动驾驶领域,已经有车企开始采用AI进行自动化标注。

例如,特斯拉一直在积极推进自动化标注的进展,从2018至今,特斯拉的标注经历了4个阶段:

第1阶段(2018):只有纯人工的二维的图像标注,效率非常低;

第2阶段(2019):开始有3D label,但是是单趟的人工的;

第3阶段(2020):采用BEV空间进行标注,重投影的精度明显降低;

第4阶段(2021):采用多趟重建去进行标注,精度、效率、拓扑关系都达到了极高的水准。

2022年6月,特斯拉裁撤了200名为特斯拉标注视频以改进辅助系统的美国员工。

目前,特斯拉的自动标注能力大幅改善,标注10000个不到60秒的视频,大模型只需要运行一周即可,而同样的工作量人工标注却需要几个月的时间。

在国内,理想汽车董事长兼CEO李想曾在2023年4月份举行的一场论坛上表示,当理想汽车使用软件2.0的大模型,通过训练的方式进行自动化标定,过去需要用一年做的事情,基本上3个小时就能完成,效率是人的1000倍。

不仅如此,自动化标注工具也在飞速发展。

国外AI初创公司refuel推出了一个名为Autolabel的开源工具,可以使用市面上主流的大模型来对数据集进行标注。

该公司的测试结果称,Autolabel的标注效率相比人工标注提高了100倍,成本仅为人工成本的1/7。

国内一家名为视智未来的公司也在打造标注大模型。他们表示,有些项目已经用GPT交付了,准确率方面达到了80%多,与人工接近。

不得不说,在AI面前,无论成本还是效率,人类可以说是毫无优势。

RLAIF:AI标注训练方法

话说回来,ChatGPT是怎么抢了数据标注员的“饭碗”的?

以往数据标注员要干的事情,是将标注好的数据用作AI模型的训练集或评估标准,这个过程叫做RLHF(Reinforcement Learning from Human Feedback),即基于人类反馈的强化学习

RLHF也是被ChatGPT、Bard和LLaMA等新兴大模型带火的模型训练方法,它最大的好处就在于能够将模型和人类的偏好对齐,让大模型给出更符合人类表达习惯的回答。

不过发布在arXiv的一份论文表明,这份看起来只有人类能做的工作,也能被AI取代。AI取代了RLHF中的“H”,诞生了一种叫做“RLAIF”的训练方法。

这份由谷歌研究团队发布的论文显示,RLAIF能够在不依赖数据标注员的情况下,表现出能够与RLHF相媲美的训练结果——

如果拿传统的监督微调(SFT)训练方法作为基线比较,比起SFT,1200个真人“评委”对RLHF和RLAIF给出答案的满意度都超过了70%(两者差距只有2%);另外,如果只比较RLHF和RLAIF给出的答案,真人评委们对两者的满意度也是对半分。

具体而言,研究人员主要就“根据一段文字生成摘要”这一任务,展示了RLAIF的标记方法。

首先是序言(Preamble),用来介绍和描述手头任务的说明。给定一段文本和两个可能的摘要,输出1或2来指示哪个摘要最符合上述定义的连贯性、准确性、覆盖范围和整体质量。

其次是样本示例(1-Shot Exemplar)。给到一段文本,接着给到两个摘要,以及“摘要1更好”的偏好判断,让AI学着这个示例对接下来的样本做标注。

再次就是给出所要标注的样本(Sample to Annotate),包括一段文本和一对需要标记的摘要。

最后是结尾,用于提示模型的结束字符串。

就像人类标注员会给不同的回答打分一样(比如满分5分),AI也会依据偏好给每个摘要打分,这也是AI和人类标注员发挥作用的关键环节,主要是用于训练奖励模型(RM)并生成反馈内容。

论文介绍到,为了让RLAIF方法中AI标注更准确,研究者也加入了其他方法以获取更好的回答。

譬如为了避免随机性问题,会进行多次选择,其间还会对选项的顺序进行交换;此外还用到了思维链(CoT)推理,来进一步提升与人类偏好的对齐程度。

需要说明的是,谷歌的这篇论文也是第一个证明了RLAIF在某些任务上能够产生与RLHF相当的训练效果的研究。这意味着不用人类指点,AI也能训练自己的同类了。

该论文的发布很快收获了不少关注。比如有从业者评论道,等到GPT-5可能就不需要人类数据标注员了。

尽管这项工作凸显了RLAIF的潜力,但依然有一些局限性:

首先,这项研究仅探讨了摘要总结任务,关于其他任务的泛化性还需要进一步研究。

其次,研究人员没有评估LLM推理在经济成本上是否比人工标注更有优势。

此外,还有一些有趣的问题值得研究,例如RLHF与RLAIF相结合是否可以优于单一的一种方法,使用LLM直接分配奖励的效果如何,改进AI标注器对齐是否会转化为改进的最终策略, 以及是否使用LLM与策略模型大小相同的标注器可以进一步改进策略(即模型是否可以“自我改进”)。

重人力转向重技术

尽管AI自动化标注技术在快速发展,但第三方数据标注服务商并没那么乐观。

河南一家众包平台的项目经理认为,自动化标注还不能取代60%以上的标注需求,只能作为辅助标注工具处理单一或特定数据,提升人效。

另一家数据标注公司的产品经理认为,自动化标注只能过滤简单的基础数据,还不能像人一样从复杂有争议的场景中精确识别物体。

如果说简单的标注可以用AI来完成,那么人工参与的将是难度更高的数据筛选和标准工作,这也意味着数据标注行业的门槛将会不断提高。

作为对照,早在ChatGPT走红前,OpenAI就组建十几位博士生来“打标”。

而百度在海口的数据标注基地拥有数百名专职大模型数据标注师,标注师的本科率达到100%,需要具备一定的知识储备和逻辑分析能力。

不过大家也认同,未来的数据标注将从重人力转向重技术的趋势。

一家众包平台的创始人在和同行交流时说,未来不能堆人力,要有研发能力。也有从业者认为,人工标注对于泛化仍然极其重要,而RLHF+RLAIF混合方法比任何单一方法都要好。

总之,不是被同行“卷死”,就是被技术“卷死”。数据标注公司已做好了随时裁员的准备,同时向做自动化标注工具的方向发展。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2024-01-24,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 科技云报到 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
暂无评论
推荐阅读
编辑精选文章
换一批
SEO那些事:一句代码一键分享网站
这是很久以前就已经写过的笔记了,有一个习惯,每次遇到一个问题,都会进行百度,然后把解决问题的关键点记录下来,有人问我,为什么更新频率如此之快,大部分都是从前积累的知识点。
王小婷
2025/05/18
650
SEO那些事:一句代码一键分享网站
HTML5 学习总结(二)——HTML5新增属性与表单元素
张果
2018/01/04
3.7K0
HTML5 学习总结(二)——HTML5新增属性与表单元素
h5高仿微信web网页版|仿微信聊天项目
https://blog.csdn.net/xiaoyan_2015/article/details/81750894
andy2018
2018/08/18
4.4K0
h5高仿微信web网页版|仿微信聊天项目
实验 | 使用手机微信配合点击劫持漏洞进行钓鱼
钓鱼攻击一般指钓鱼式攻击。钓鱼式攻击是指企图从电子通讯中,通过伪装成信誉卓著的法人媒体以获得如用户名、密码和信用卡明细等个人敏感信息的犯罪诈骗过程。
FB客服
2021/08/24
6520
期末前端web大作业:HTML+CSS+JavaScript简洁的餐饮网站(8个页面) 学生美食网页设计作品静态HTML网页模板源码 大学生美食文化网站制作 简
👨‍🎓静态网站的编写主要是用HTML DIV+CSS JS等来完成页面的排版设计👩‍🎓,常用的网页设计软件有Dreamweaver、EditPlus、HBuilderX、VScode 、Webstorm、Animate等等,用的最多的还是DW,当然不同软件写出的前端Html5代码都是一致的,本网页适合修改成为各种类型的产品展示网页,比如美食、旅游、摄影、电影、音乐等等多种主题,希望对大家有所帮助。 🧡 【作者主页——🔥获取更多优质源码】 🧡 【web前端期末大作业——🔥🔥毕设项目精品实战案例(1000套)
IT司马青衫
2022/08/19
9860
期末前端web大作业:HTML+CSS+JavaScript简洁的餐饮网站(8个页面) 学生美食网页设计作品静态HTML网页模板源码 大学生美食文化网站制作 简
Spring Boot一键换肤,so easy!
松哥原创的 Spring Boot 视频教程已经杀青,感兴趣的小伙伴戳这里-->Spring Boot+Vue+微人事视频教程
江南一点雨
2021/05/11
3290
Spring Boot一键换肤,so easy!
网页结构简介
有人说“互联网中有50%以上的流量是爬虫”,第一次听这句话也许你会觉得这个说法实在太夸张了,怎么可能爬虫比用户还多呢?毕竟会爬虫的相对与不会爬虫的简直少之又少。
测试小兵
2019/07/22
1.3K0
网页结构简介
如何实现一个网页头部图标
主要代码: <link rel="icon" href="${ctx}/img/car.jpg" type="image/x-icon"/> 示例: <!DOCTYPE html> <html> <head> <meta charset="UTF-8"> <title></title> <link rel="icon" href="img/car.jpg" type="image/x-icon"/> </head> <body>
王小婷
2019/04/25
6970
如何实现一个网页头部图标
Bootstrap Table表格分页的使用及分页数据(Excel)导出
1:引入Bootstrap Table表格插件相关链接:这里直接拿来用就可以了,如果要下载到本地,可以自行去官网下载。
王小婷
2019/03/15
5.4K0
Bootstrap Table表格分页的使用及分页数据(Excel)导出
零基础html5+div+css+js网页开发教程第005期 hbuilder网站开发环境搭建
欢迎小伙伴继续观看网页开发教程。该教程是基础有简单计算机基础,但是却没有网页开发基础的同学使用的。如果您毫无计算机基础,对于本教程的使用还是会有一点的难度。
刘金玉编程
2019/11/25
8580
Css实战训练之图片点击放大
Css实战训练之图片点击放大 I. 背景 非常常见的一个功能了,一般网站上显示的都是缩略图,等你点击缩略图之后,会在一个弹框中显示放大的图片 那么这个功能是怎么实现的呢? 正好学习了下css的基础知识
一灰灰blog
2018/04/19
11.1K1
Css实战训练之图片点击放大
Python爬虫入门知识!
Python现在非常火,语法简单而且功能强大,很多同学都想学Python!所以小的给各位看官们准备了高价值Python学习视频教程及相关电子版书籍,欢迎前来领取!
python学习教程
2019/07/10
5530
Python爬虫入门知识!
CSS实现头像右上角消息数字提示
今天写个简单的小demo,关于CSS实现头像右上角消息数字提示,样式如下如图所示,在微信和扣扣消息里面比较常见。
王小婷
2019/03/15
2.8K0
CSS实现头像右上角消息数字提示
百度分享代码–一键分享Baidu Share BEGIN
百度分享代码已升级到2.0,本页将介绍新版百度分享的安装配置方法,请点击左侧列表查看相关章节。
全栈程序员站长
2022/11/10
1.8K0
Web前端安全策略之CSRF的攻击与防御
接着上一篇文章,本篇文章我们继续来讲解前端如何处理网站的安全问题,本文主要讲解跨站请求伪造(CSRF)。
@零一
2021/01/29
1.1K0
Web前端安全策略之CSRF的攻击与防御
微前端框架chunchao(春潮)开源啦
写在开头 为了让大家更能理解微前端的工作模式,微前端的最佳实践应该还需要探索 乞丐版微前端框架chunchao源码开源,仅仅为了让大家学习微前端的工作模式而已,实际项目中,我们有使用Paas模式,web components,git submodule等模式都可以实现微前端,当然业内肯定有独特的、优于这些模式的微前端实现 正式开始 推荐你先看我之前的几篇文章,这样才能更好的阅读本文 如果你有什么问题想跟我交流,可以加入我们的专业微前端交流群/技术交流群 往期我的原创推荐: 深度:从零编写一个微前端框架 微前
Peter谭金杰
2020/06/16
7900
大一html5期末大作业 :基于html实现非遗文化网页设计题材【传统文化木雕】7个页面
✍️ 作者简介: 一个热爱把逻辑思维转变为代码的技术博主 💂 作者主页: 【主页——🚀获取更多优质源码】 🎓 web前端期末大作业: 【📚毕设项目精品实战案例 (1000套) 】 🧡 程序员有趣的告白方式:【💌HTML七夕情人节表白网页制作 (110套) 】 🌎超炫酷的Echarts大屏可视化源码:【🔰 Echarts大屏展示大数据平台可视化(150套) 】 🔖 HTML+CSS+JS实例代码: 【🗂️HTML+CSS+JS实例代码 (炫酷代码) 继续更新中...】 🎁 免费且实用的W
IT司马青衫
2022/08/14
4550
大一html5期末大作业 :基于html实现非遗文化网页设计题材【传统文化木雕】7个页面
扫一扫二维码就能打开网站,就能添加联系人,就能链接wifi(续)
有些功能部分手机不能使用,网站,通讯录,wifi基本上每个手机都可以使用。(浏览器自带的扫描就够了,QQ扫码和微信扫码部分手机不能直接连接wifi) 在看之前你可以扫一扫下面几个二维码先看看效果: 上
逸鹏
2018/04/09
1.5K0
扫一扫二维码就能打开网站,就能添加联系人,就能链接wifi(续)
【HTML | CSS】纯CSS居然能做出这种效果,一款宝藏网页分享(超详细讲解 | 附源码)
💂作者简介: THUNDER王,一名热爱财税和SAP ABAP编程以及热爱分享的博主。目前于江西师范大学会计学专业大二本科在读,同时任汉硕云(广东)科技有限公司ABAP开发顾问。在学习工作中,我通常使用偏后端的开发语言ABAP,SQL进行任务的完成,对SAP企业管理系统,SAP ABAP开发和数据库具有较深入的研究。 💅文章概要: 各位C站的小伙伴们,今天我发现了一款纯CSS效果实现的精美页面,通过hover控件便可以实现网页的动态效果,无需引入Javascript。让我们一起来看看吧!收藏我并且
THUNDER王
2023/02/23
9710
【HTML | CSS】纯CSS居然能做出这种效果,一款宝藏网页分享(超详细讲解 | 附源码)
h5调用底层接口的一些知识
      之前接触过这方面的知识,一直想写一些关于代码的文字,但考虑到浪费时间,又不具备大神的实力,也不想去把别人的代码照搬过来,所以一直都是空白着的,今天敲代码的时候,有了一个比较好的想法,第一,定位在学习这一块,去学习一些领域的新知识,并分享自己每天的学习成果,第二,总结工作中遇到的代码,解决的问题,拿出自己的demo截图,做出一些文字说明解释,相信通过这两个途径,能够让自己取得更大的发展空间。
王小婷
2018/05/16
4.9K7
推荐阅读
相关推荐
SEO那些事:一句代码一键分享网站
更多 >
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档