🔥 xgb_wiki🏠 总览📅 每日📄 研报🔗 产业链🧩 本体

物理AI巨大蓝海,数据缺口超1000倍,这些公司正手握“数据金矿”

热点 · 2026-05-25 20:32:09

🔥 题材

机器人

📈 个股

慧辰股份 海天瑞声

【本文来自持牌证券机构,不代表平台观点,请独立判断和决策】

兴业证券指出,数据规模已成为具身智能落地的核心瓶颈,以具身智能为代表的物理AI落地需要大量、高质量的预训练数据。当前行业主流真机训练数据量级仅在1万小时左右,与LLM训练所需的数据量相比存在巨大缺口,物理AI数据基建浪潮已至。核心公司:海天瑞声中控技术、宇树科技。

1)具身智能亟需训练数据ScaleUp,供给缺口巨大

数据规模为具身智能落地的核心瓶颈,供给缺口巨大。现阶段,数据已成为机器人大脑模型泛化能力提升、机器人量产的核心瓶颈之一。

目前行业主流真机训练数据量级在1万小时左右,而Gen-0模型的总训练数据量约27万小时。对比LLM模型,GPT-1约使用27万小时数据,而GPT-4训练规模已达约6.84亿小时,这意味着具身智能的训练数据量需要实现千倍以上的飞跃。

根据预测,2030年全球数据采集和标注市场规模将达到171亿美元。混合式数据策略已成为行业共识,即用第一视角、UMI数据、虚拟数据等进行预训练,再用真实数据精调。

2)本体厂商密集落子,数采方案向视频学习进化

全球具身智能本体厂商明显加速在数据采集方面的布局。

特斯拉在2025年6月调整其Optimus训练方法,从之前依赖动作捕捉服和远程操控,转向视觉捕捉模式,让AI通过摄像头学习复杂任务,以大幅提升数据采集规模。

国内企业同样在快速跟进。宇树科技拟募集20亿元投入智能机器人模型研发项目,重点加大在高质量数据采集方向的投入。智元机器人则开源了真实场景数据集AGIBOTWORLD2026,并计划在2026年实现千万小时级的数据产能。

此外,乐聚智能也拟投入6亿元建设高质量大规模数据集,构建一体化“数据工厂”。英伟达发布的EgoScale和DreamDojo论文显示,其已采用2万+至4万+小时的第一视角人类视频数据进行训练,这种非侵入式采集有望真正实现大规模数据获取。

3)物理AI数据“卖铲人”有望迎来产业爆发

由于数据采集业务具有重人力、重流程、重管理等特点,算法和本体厂商完全自建团队成本极高,难以应对波峰波谷需求,这为第三方数据服务商带来了巨大的机遇。

核心公司包括:

海天瑞声:AI数据服务商龙头,积极布局具身智能数据采集,已加入智元数据共创行动。

慧辰股份:营收高占比投入数采,发布“X”机器人智脑模型,落地医疗康养。

品茗科技:与通研院实控方合资设立子公司,旨在开展真实场景智能数据采集。

研报来源:兴业证券,蒋佳霖,S0190515050002,具身数据:物理AI巨大蓝海,供给缺口扩大。2026年05月24日

← 返回