近年来,数据标注行业经历了巨大的变革和挑战。娱乐资本论·视智未来采访了数据标注公司飞火大数据的CEO丁一峻,他分享了自己的创业历程、公司现状和对行业的洞察等。
(资料图片仅供参考)
从中我们可以感受到这个行业在繁华背后所面临的困境、竞争以及未来的方向。从做阿里的数据外包到转型做百度的业务,再到如今的数据采集车项目,丁一峻带我们走进数据标注行业的内部世界,一探行业的现状与前景。
飞火大数据公司成立于2019年,专注于AI感知数据采集和标注业务,主要做自动驾驶汽车、数据采集等业务。
---以下为采访实录---
关于公司:
视智未来:你最开始做数据标注公司的原因是?
飞火大数据CEO丁一峻(下同):
2018年我做阿里的数据外包业务,觉得利润可观,开始创业。早年百度开发过面向C端的标注平台,后来发现与其组建部门管理C端不如直接外包和团队合作,性价比更高,2019年我开始做百度的业务。
2019年做百度某数据标注业务项目截图
视智未来:您公司现在多少人?
高峰时有两三百人,现在公司只有40多位员工,老客户的需求还在,能维持正常运营,但这种单子很鸡肋,一个月几百几千跟办公室采购差不多,利润太低,项目体量也不稳定。数据行业缺乏像苹果、特斯拉一样需求稳定的工厂。不然我也不想裁人,有活还需要找外包,之前想过和学校还有监狱合作,但学校要考虑领导、辅导员各种利益分配,监狱对网络要求高,不如找全职。
视智未来:你们现在数据标注员的工资基本是?
基础的标注员往往都是属于地方上的最低工资标准,三线城市两三千左右,质检员和项目经理,能到七千左右。
视智未来:现在和2020年相比衰落了吗?
对我们来讲还好,也在开发培训工具,很多业务会外包,员工经验多了会转型做项目经理。
为了提高效率,我们开发了工具,之前2D拉框要8分一个,现在降到了5、6分,操作更便捷。质量上,如果客户不想要目标物低于某像素值的,工具直接调数值,标注员就不用标了。
但是这种工具标注公司基本只能自用,同行有能力买的,自己有开发的实力。没开发实力的,出不起这个钱。工具都是基于labelme的底层逻辑。早几年能打个信息差,卖平台赚点钱,现在不行了,大家都知道套路,直接上源码加个UI就成产品了。
现在甲方公司更愿意买。因为甲方公司没有工具的话,数据外包的安全性流程会比较乱,被拷贝、转走也不好管理。
视智未来:你们之前是做自动驾驶吗?
前两年做自动驾驶的公司好融资,这类订单多,今年AIGC 文本更火,这块订单多了。我们除了小语种没别的特色,跟着市场走。
视智未来:GPT 爆火之后,对你们公司的影响大吗?
文本类的零碎订单增多,很多公司会用大模型提炼数据,或者直接AI标注,甲方外包数据减少预算卡在了两三万。这样的订单增多,对我们小公司来讲意义不大,单价低,又需要投入太多的精力,跟收益不成正比。
视智未来:你们做的事,还挺用 AI来替代自己工作的。
对,我们做的就是一个自我淘汰的行业。这个行业最终可能会只剩质检员。
视智未来:你们的客户订单是私有的数据吗?还是公网数据?
之前我们做一家证券公司的数据标注,刚好有一位标注员,是这家证券公司的用户,他发现用了他的数据,提出了抗议。后来私下花钱和解了。谁采集数据,出了问题谁负责,所以一般我们也不会过问数据来源情况。
现在我们拓展业务,做了数据采集车,才关注到数据知识产权、数据安全这些事。
视智未来:你们一般采集哪类信息?
早年种类多样,比如人脸声音,现在都属于敏感信息了。现在就和合作单位做路采。
视智未来:人脸采集一般应用在哪里?
银行APP、高铁闸机,主播专用相机的人脸自动修复功能等。
关于行业:
视智未来:你觉得数据行业以后会怎么发展?
分两块,一个是行业本身的科技发展,一些简单的数据处理会被机器所替代。数据公司做小众的、有特色的领域。另一块是看政策,比如数据像期货一样进行交易,会诞生很多数据生产商,而不是靠接订单生存。这时候大家比的才不是资源,而是技术。
视智未来:目前数据行业接单主要看的是什么?
现在价格内卷的太厉害,主要看关系还有团队管理。
视智未来:你怎么看待国内的AIGC数据合成情况呢?
AIGC合成数据需要看政策,现在是灰色地带,好不好获取,就看胆子大不大了。谁也不知道未来会不会出爆款,有比拟真实数据的内容出现。
视智未来:你觉得数据标注行业像富士康工厂吗?
数据标注本质是高级搬砖,我们不如工厂,AI的产品线不像工厂那么完善,缺乏法律和社会面的支持,比如版权、数据安全。
视智未来:你了解到国内哪个城市在数据标注上走的靠前吗?
深圳和上海比较靠前,贵阳在打造数据存储之地,应该是因为贵阳那边山多电费相对便宜些。
视智未来:你们接下来的业务方向是?
公司搬到了工业配套更完善的苏州,在做数据采集车、数据回灌的生意。
标签:
仓储物流“成渝圈”如何乘势而上? 12月3日,连接昆明和万象的中老铁路全线开通运营,被惠及的显...
两件西周青铜簋时隔三千年成功配对 考古工作者介绍,这个铜簋的盖、身分别时隔40余年出土,纹饰...
“医保砍价”不是一个人在战斗 晁星 “我眼泪都快掉下来了”“每一个小群体都不该被放弃”…...
“购物成瘾”真的是一种病 刘艳 牛雅娟 本周日即将迎来“双十二”促销季,很多人又开始摩拳...
因迷恋山间风景,一男子在甘孜州稻城县海拔4000多米的无人区迷失方向,随后与同伴失联。12月的稻城...
嫌疑人DNA信息比中后,成都市公安局刑侦支队技术处DNA实验室民警白小刚一下坐在凳子上,恍惚迟疑间...
一批反映南京大屠杀历史的新书发布 新华社南京12月7日电(记者邱冰清、蒋芳)“以史为鉴,开创未来...
我在现场·照片背后的故事|电影《亲爱的》里面没有的结局,在我眼前“上映” 12月6日,在深圳市...
冥想?泡脚?不如听听助眠音乐 晚上睡不着,白天睡不醒,成为最贴合都市人群的“睡眠画像”。随...
养老话题 老年教育面临缺口 “终身教育”潜力无限 【现实挑战】“新老年”群体愿意在培养兴...
孙海洋被拐14年儿子如何找到的? 警方侦办另一宗拐骗儿童案时发现线索,通过人像比对、DNA确认找...
北京天文馆、圆明园将对未成年人免费开放 12月6日,北京天文馆发布通知称,12月8日起试行对未成...
今年全国粮食总产量再创新高 连续7年保持在1 3万亿斤以上 根据对全国31个省(区、市)的抽样调...
斑块软的很危险 硬的就无碍? 血管里的“垃圾”分类 赶快学起来! 一项最新研究显示:中国...
诺西那生钠注射液大幅降价 聚焦医保谈判背后脊髓性肌萎缩症家庭 医保目录公布那天 好多家长都...
抖音“窗花剪剪”遭抄袭 被判获赔20万元 法院认为“窗花剪剪”的这种表达方式理应受到《著作权...
公安机关近日侦破3起拐卖儿童案件 失散十几年 3组家庭终于团圆了 北京青年报记者12月6日从公...
2021年度十大网络用语发布 本报讯(记者 路艳霞)作为年度“汉语盘点”活动最具网络特色的组成部...
北京天文馆向未成年人免费开放 本报讯(记者 牛伟坤)北京天文馆对票价免费及优惠政策作出调整:1...
2021北京百个网红打卡地发布 本报讯(记者 李洋)2021北京网红打卡地推荐榜单昨晚正式发布。自然...