当前位置:

红网专访丨谱蓝科技蔡立:数据标注,不再是“画框框”

来源:红网 作者:吴公然 编辑:周洁 2026-08-04 09:39:57
时刻新闻
—分享—

微信图片_20260803175828_21_125_副本.jpg

谱蓝科技董事长蔡立。

红网时刻新闻记者 吴公然 实习生 刘佳恒 通讯员 艾萌 肖可 长沙报道

近日,上海世博中心,2026世界人工智能大会现场,一家来自湖南的企业——长沙谱蓝网络科技有限公司(以下简称谱蓝科技),凭借“高质量数据集定制研发”入选语料风云榜“新锐势力Top10”。

本届大会传递出一个清晰的信号:AI产业的竞争重心,正在从比拼“算力”和“模型参数”,全面转向以“高质量垂域语料”为核心的基础设施建设。

这也意味着,AI的下半场,将是一场围绕“数据质量”和“专业知识”的深度较量。而曾被视为低端劳动的数据标注行业,正蜕变为定义AI能力上限的核心枢纽。

大会释放的这些信号,对数据标注行业究竟意味着什么?广大标注企业又该如何应对变局?带着这些问题,记者日前专访了谱蓝科技董事长蔡立。

c125bca0fc9d489f9c1464859eebf94c.jpg

谱蓝科技入选2026世界人工智能大会语料风云榜“新锐势力Top10”。

告别“大力出奇迹”,“专而精”重新定位价值坐标

记者:今年大会大家都在提“数据枯竭”和“参数内卷”。作为一线从业者,你感受到大模型厂商对语料的需求,发生了什么本质变化?

蔡立:5年前客户问“你们能标多少框”,现在问的是“你的数据有效性怎么体现,如何在我的模型与智能体体现效果”。

最核心的变化是——粗放的“大力出奇迹”已成过去时,对“专而精”的渴求正在重新定义数据标注和有效性的价值坐标。

以前堆通用数据、拼参数规模,发现低质数据越多,“模型幻觉”越严重。尤其能源、交通这些领域,错一个标点可能出安全事故。

现在厂商要的是“可溯源、可迭代、可确权、合规安全”的高质量数据资产。说白了,当算法和算力“内卷”到一定程度,高质量垂域语料被普遍视为决定人工智能能力上限的核心要素。

记者:面对能源、交通这些“场景碎片化”严重的行业,谱蓝科技怎么解决标准化生产与定制化需求这对矛盾?

蔡立:这是个好问题。行业场景就像满地的碎玻璃,纯定制很“磨人”,纯标准化客户不能用。

我们的解法是,在底层搭建全流程标准化的数据生产线,从采集到质检像工厂流水线一样硬;上层储备模块化语料资产库,拆解通用赛道模块和客户专属模块,无需从零开发数据集,可快速适配各类碎片化场景,谱蓝科技建立了一套“数据(提纯)到数据(可用)”的标准化服务体系。

好比做菜,底料和工艺标准化,但给不同客户撒不同的“独家调料”,搭配我们的行业专家质控体系,既保住了专业准头,又把定制成本打下来一大截。

目前,这套方案已成功服务多家能源、交通行业头部客户,有效降低模型幻觉率,大幅提升行业大模型的落地实用性。

记者:这听上去像是一场“重资产”转型。你们打造工业化数据资产平台,背后的商业逻辑是什么?

蔡立:过去是“作坊式”拼人力,现在是“数据集”拼迭代。如今客户要的不是“一筐数据文件”,而是能反复迭代、有效的数据集,而有效创造价值,价值驱动确权,确权固化资产,确权的资产就是能入表的数据资产。

然而,纯人力根本做不到全流程可追溯、可管控。我们投入重金做工业化平台,用自动化流水线、智能质检、全链路数据治理,替代大部分标准化人工工序。

这不是省成本的事,是把一次性的“外包服务”,升级为长期、高附加值的“数据资产服务”,把数据的价值体现出来。

微信图片_20260803175830_23_125_副本.jpg谱蓝科技办公区。

从“能回答”到“能干活”,打通最后一公里

记者:当前AI正从“学知识”走向“学做任务”,谱蓝科技在把一线“老师傅经验”转化为语料时,遇到了哪些挑战?

蔡立:最难的不是技术,而是“隐性经验显性化”。

比如能源、电力一线的老师傅,判断故障全靠耳朵听异响、眼睛看火花,那是几十年的直觉经验,没写进过任何操作规程。人工智能不懂业务,而行业专家无法沉淀有效数据,导致AI无法真正落地企业。

而且,行业数据割裂严重,台账、工单、设备参数等各说各话。传统一次性交付的数据集,无法打通“工况、故障、规范、处置方案”的完整业务逻辑,训练出的模型容易出现逻辑冲突,无法适配一线复杂场景。

记者:那数据服务商在这“最后一公里”该扮演什么角色?只是润色数据吗?

蔡立:绝对不是。现在我们是“三合一”角色。

第一是“行业隐性知识的数字化翻译官”。我们带着数据工程师、AI训练师钻进一线,把老师傅的碎片化直觉经验,拆解成标准化、结构化、可训练的高质量行业语料,系统性沉淀企业专属核心资产。

第二是“行业AI的全周期闭环运营管家”。我们彻底摒弃一锤子买卖,建起“数据建设-模型适配-场景落地-样本回流”的循环,持续更新场景样本、优化数据集,让大模型始终适配最新行业工况,真正实现持续学任务、常态化进化。

第三是“行业数据安全合规的守门人”。我们依托本地化隔离数据体系和专属合规标准,在严守数据安全法规、保障企业核心经验不外泄的前提下,打通数据可用不可见的落地路径,让企业敢用、能用AI技术赋能生产。

记者:这种闭环服务,听起来已经脱离了“乙方”的范畴?

蔡立:对,我们和客户从“短期外包”变成了“长期共创”。

我们的团队需要和客户建立共同的目标,让客户拥有AI数据带来新的数据复利体系,我们的前端部署工程师(FED)需要和客户共同办公。只有浸入场景,才能做出真正能干活的数据,能够引导智能体和模型跑出真正意义的数据壁垒及核心价值。

AI反哺行业,人才结构迎来“脑力革命”

记者:据了解,谱蓝科技自研的AI预标注平台让效率提升了30%。大模型对数据标注行业自身的“反哺”效应,如何改变这个行业?

蔡立:AI对谱蓝科技改变是颠覆性的,不仅仅改变业务逻辑,更改变了组织架构,我们从金字塔型的组织管理,变成由数据驱动的组织管理。

如今,AI会追踪每名员工的工作足迹,为其量身定制提升方案和实施优化建议,并将关键洞察同步至决策层,让管理从“经验依赖”走向“数据导航”。

过去,别人问我是做什么的,我说“做数据标注”,对方多半会接一句:“哦,就是画框框、打标签的那种?”现在我会说,我们做的叫词元经济——帮大模型更好地理解世界、更好地回答问题。这完全是两码事。

以前按人头计件,卖的是劳动力;现在卖的是资产,是判断力。以前客户问“标完没”,现在问“你觉得这里AI为什么会出错”。我们的“慢思考”项目里,标注员不再画框,而是给AI的多个答案打分、教它推理。

这逼着我们的人才结构变了。

基础“画框”交给AI,人去做“把关”。现在行业缺的不是“人手”,而是能挑出AI逻辑漏洞、有专业能力的“AI出题专家”。这类复合人才被称为“数据炼金师”,薪资是过去普通标注员的5倍。

记者:所以在“AI打底+人工把关”的新模式下,对一线从业者的核心能力要求变成了什么?

蔡立:我总结为三层核心素养。

第一是审查力,能排查AI预标注的陷阱,补齐规则漏洞。

第二是判断力,在RLHF(基于人类反馈的强化学习)训练中,甄别模型优劣、识别AI幻觉。

第三是专业力,你得真懂医疗、金融、代码等垂直领域的知识。

记者:这对行业人才培养体系提出了哪些新要求?

蔡立:第一,要打破学科壁垒,搭建跨学科培养体系,培育兼具AI数据基础和垂直行业专业知识的复合型人才。

第二,培训重心要从“教操作”转向“教思维”,让从业者读懂模型训练逻辑,而非单纯机械作业。

第三,紧跟国家数据局“标注攻坚”专项行动,通过校企深度合作,搭建从基础标注到高端数据人才的梯度培养体系,补齐行业高质量数据人才短板。

当AI褪去炫目的参数泡沫,决定智能高度的,不是算力的蛮力,而是数据的精度。数据标注行业,正在经历一场从“人力”到“脑力”、从“外包”到“共创”的深刻质变。

相关报道:

湘企谱蓝科技跻身2026世界人工智能大会语料风云榜“新锐势力Top10”

来源:红网

作者:吴公然

编辑:周洁

本文为湖南频道原创文章,转载请附上原文出处链接和本声明。

本文链接:https://hn.rednet.cn/content/646042/96/16143982.html

阅读下一篇

返回红网首页 返回湖南频道首页