
正从桌面上拿起一张明信片,精准对准印章位置按下,随后将盖好章的明信片投进邮筒,整套动作一气呵成。
不远处,另一台端坐钢琴前,弹出一段完整旋律。再往前走,还有正有节奏地敲击编钟,发出清脆的声音。
这是11日中新经纬在2026年中国国际服务贸易交易会(下称服贸会)电信、计算机和信息服务专题展看到的几幕。
机器人越来越聪明,动作越来越流畅,但让学会这些动作,不仅仅是因为算法迭代,更是因为数据在背后支撑。数据从哪来?怎么变成能用的“教材”?
机器人要学会这些动作,首先得有足够的数据来训练。但现实是,数据远远不够用。
国金证券2026年7月发布的研报显示,截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,而训练通用具身模型至少需要1000万小时的多模态交互数据,当前数据量不足实际需求的5%。
中国信通院人工智能研究所等机构于2026年8月联合发布的《具身智能训练场研究报告(2026年)》(下称报告)也指出,具身基础模型要迎来“ChatGPT时刻”,至少需要千万小时级真实数据,而当前全球可用的高质量真实数据仅为数十万至百万小时级,供需之间存在量级差距。
凌宇科技(北京)有限公司(下称凌宇科技)研发总监张丽强对中新经纬表示,大语言模型有互联网多年的文字积累,可以直接训练;而具身智能需要的是对空间信息的感知和对动作行为的理解,这些数据没有成熟积累。“跟大语言模型差距差不多有1万倍。”张丽强说,这也意味着具身智能的数据赛道才刚刚起步,机会很大。
某运营商工作人员孟凡在采访中介绍,上个月在冰丝带落幕的第二届世界机器人运动大会上,公司打造的具身智能管理平台,接入了16个国家、666支队伍共2056台机器人。该平台收集的156万条运行数据,是机器人日常状态的数据反馈,包括位置信息、电量情况、关节温度、网络接入情况等。
“因为各品牌有差异,管理起来比较复杂,平台做了统一接入、统一建档、统一运营。”孟凡说,现阶段具身智能行业标准不统一、协议接口各有不同,统一整体运维和管理是行业正在解决的问题。
上述报告也指出,训练场面临场景任务同质化、数据多样性和流通性不足等共性挑战。不同本体、场景、机构之间的数据难以互通共享,进一步制约了模型训练效果。
景辰数智(北京)科技有限公司(下称景辰数智)工作人员师乐姣介绍,“景睿”机器人的数据来自石景山人形机器人数据训练中心。训练过程中,所有机器人都会有一个“老师”(数据采集员)。老师会带着机器人学习相应动作,比如盖章的小demo(示范样本)。在示范教学完成后,通过大量样本采集、标注与多轮质量核验,建成高质量数据集,输入模型开展机器人训练。
“真机数据采集现在缺口比较大,我们对样本合格率、采集成功率的要求很高。”师乐姣说,仅盖章这一个流程,从数据采集到模型训练,短程可能在半个月甚至几天就可以完成,但是要保证盖章完整以及每次拾取印章与盖章的可达性,还是需要大量的数据输入与强化学习后的验证。
另一种是便携采集模式。据张丽强介绍,凌宇科技在服贸会期间首次公开发布了一套便携式数据采集设备,一天大概能采集8到10小时的工作数据,生产数据量约400G。
北京数据集团智能院旗下北京数据先行区服务有限公司(下称京数公司)技术研发人员刘永辉向中新经纬表示,从“有数据”到“数据能用”,中间最困难的是数据处理。
“原始数据本身没有释放价值,核心在于中间的数据处理环节。”刘永辉介绍,最基础的是清洗,把字段不清晰、字段空白等问题找出来,有些筛选掉,有些打回去更新。清洗xc运动科技有限公司完成后,关键是标注。
刘永辉称,标注内容取决于实际应用场景:交通自动驾驶要对图像中的车、路边、车道线做语义分割和拉框标记;商务交流、展会交流等不同语种交互场景,标注会侧重转写,把说话中的所有发声单元如实展现出来。“只有把这些信息赋能到原始数据之上,形成的数据集才有xc运动科技有限公司价值。”
北京东土科技股份有限公司(下称)工作人员向中新经纬介绍,全国产化智能机器人通用电子架构由“鸿道操作系统+AUTBUS总线国际标准+MaVIEW工具软件平台”组成,包含大小脑融合机制、快速反应的神经网络及确定性控制,可快速开发机器人及应用机器人。
该工作人员表示,东土鸿道操作系统搭配AUTBUS、TSN确定性网络,解决机器人数据采集、传输两大痛点:一是时间不同步,二是网络拥堵丢包、传输时延忽快忽慢。