热点 · 2026-05-25 20:32:09
【本文来自持牌证券机构,不代表平台观点,请独立判断和决策】
兴业证券指出,数据规模已成为具身智能落地的核心瓶颈,以具身智能为代表的物理AI落地需要大量、高质量的预训练数据。当前行业主流真机训练数据量级仅在1万小时左右,与LLM训练所需的数据量相比存在巨大缺口,物理AI数据基建浪潮已至。核心公司:海天瑞声、中控技术、宇树科技。
数据规模为具身智能落地的核心瓶颈,供给缺口巨大。现阶段,数据已成为机器人大脑模型泛化能力提升、机器人量产的核心瓶颈之一。
目前行业主流真机训练数据量级在1万小时左右,而Gen-0模型的总训练数据量约27万小时。对比LLM模型,GPT-1约使用27万小时数据,而GPT-4训练规模已达约6.84亿小时,这意味着具身智能的训练数据量需要实现千倍以上的飞跃。
根据预测,2030年全球数据采集和标注市场规模将达到171亿美元。混合式数据策略已成为行业共识,即用第一视角、UMI数据、虚拟数据等进行预训练,再用真实数据精调。
全球具身智能本体厂商明显加速在数据采集方面的布局。
特斯拉在2025年6月调整其Optimus训练方法,从之前依赖动作捕捉服和远程操控,转向视觉捕捉模式,让AI通过摄像头学习复杂任务,以大幅提升数据采集规模。
国内企业同样在快速跟进。宇树科技拟募集20亿元投入智能机器人模型研发项目,重点加大在高质量数据采集方向的投入。智元机器人则开源了真实场景数据集AGIBOTWORLD2026,并计划在2026年实现千万小时级的数据产能。
此外,乐聚智能也拟投入6亿元建设高质量大规模数据集,构建一体化“数据工厂”。英伟达发布的EgoScale和DreamDojo论文显示,其已采用2万+至4万+小时的第一视角人类视频数据进行训练,这种非侵入式采集有望真正实现大规模数据获取。
由于数据采集业务具有重人力、重流程、重管理等特点,算法和本体厂商完全自建团队成本极高,难以应对波峰波谷需求,这为第三方数据服务商带来了巨大的机遇。
核心公司包括:
海天瑞声:AI数据服务商龙头,积极布局具身智能数据采集,已加入智元数据共创行动。
慧辰股份:营收高占比投入数采,发布“X”机器人智脑模型,落地医疗康养。
品茗科技:与通研院实控方合资设立子公司,旨在开展真实场景智能数据采集。
研报来源:兴业证券,蒋佳霖,S0190515050002,具身数据:物理AI巨大蓝海,供给缺口扩大。2026年05月24日