总部地址
杭州市滨江区西兴街道中国数谷3号楼16楼
景联文发布双目3D第一视角具身数据集,以全栈能力破解VLA落地数据瓶颈
具身智能是人工智能进入物理世界的核心方向,但当前产业仍停留在演示和小规模试点阶段,规模化落地受阻。行业公认的瓶颈在于“具身大脑”不成熟,根本原因是缺少真实物理场景下可直接支撑闭环训练的高质量数据。
传统封闭数采场景单一,多数第一视角数据集仅停留在“2D视频+简单标注”,缺乏三维空间信息和精细动作对齐,导致VLA模型“听懂指令却做不对操作”,Sim-to-Real迁移效果差。
针对这一痛点,景联文推出双目3D第一视角具身智能数据集,从采集底层实现“视觉-空间-动作-语义”全链路高精度对齐,覆盖家用、仓储、医疗等六大真实场景,提供原生三维信息、高精度动作追踪及标准化语义标注,可直接对接主流训练管线。
该数据集依托“模数共振”体系,旨在为行业构建标准化、可复用的数据底座,助力机器人从演示验证加速走向规模化商用。

1、原生3D采集+高精度追踪,从根源缩小具身鸿沟
不同于行业普遍的单目2D采集方案,本次发布的数据集从采集端就以“支撑机器人真实物理动作训练”为目标,构建了完整的多模态标准化采集链路。
数据集依托头戴式双目视觉采集终端,搭载4096×1536高清双目RGB相机搭配独立深度ToF相机,同步采集色彩信息与深度信息,精准还原真实三维空间交互环境。
配套交付完整官方标定文件,包含双目左右目内参、8阶鱼眼畸变系数、多相机空间外参矩阵,研发团队无需自行标定调试,即可一键完成图像去畸变、像素转3D点云、多视角坐标统一,从根源解决单目数据“空间距离靠估算、位置偏差大”的问题,大幅提升模型真机落地的动作准确率。
针对手部动作追踪丢帧、漂移的行业顽疾,数据集同步输出高密度人体全身+双手关键点打点追踪数据流,追踪帧率最高可达87.5fps,是行业常规方案的近3倍。
数据完整覆盖人体24处全身关节与双手指尖骨骼可视化骨架点位,精准还原双手协同抓取、单手持物、触碰检视等全部肢体动作姿态;近距离操作无深度盲区,手部可视覆盖率接近100%,大幅降低手指自遮挡、快速操作下的轨迹漂移问题。
整套追踪数据经过12项自动化质检模块全维度校验,有效数据占比99.92%,视频与追踪信号时序匹配度达99.8%,无噪声脏数据片段,为机械臂精细操作训练提供稳定、精准的监督信号。
全部视频时序配套精细化结构化语义动作标注,采用统一标准化原子动作标签体系,精准区分单右手操作、双手协同、无手部检视三类交互模式;标注覆盖药盒、药瓶、厨具、食材、衣物、办公用品等上百类真实场景物体,同步提供动作描述文本,所有标注均经多轮校验无无效噪声片段。
数据格式兼容主流训练框架,可直接对接VLA模型、模仿学习、强化学习训练管线,省去30%以上的数据预处理时间,让研发精力真正回归模型迭代本身。
2、六大真实场景全覆盖 填补医疗等稀缺场景数据空白
通用型机器人落地的核心壁垒是跨场景泛化能力,单一场景数据永远练不出“全能型”机器人。
本次数据集一次性覆盖医院药房、家庭厨房、客厅、卧室、卫生间、办公室六大真实生活化场景,完整收录烹饪备菜、家居收纳整理、卫生清洁、衣物折叠、货架药品分拣等高频日常交互任务。
所有场景均采用统一采集标准、统一标注体系、统一数据格式,跨场景数据可无缝复用,一套数据同时适配家用服务、商用仓储、医疗辅助三大类机器人训练需求,大幅降低企业多场景研发的数据采购与整合成本。
其中真实医院药房场景为业内稀缺的合规数据资源,完整还原药品分拣、取药、归位等全流程操作,覆盖多形态药品物体标注,填补了医疗辅助机器人训练的数据空白,帮助垂直赛道企业快速突破数据瓶颈。
3、不止于数据交付:全栈能力+生态协同 定义具身数据行业标准
作为深耕具身智能数据领域的基础设施服务商,景联文的核心优势远不止于单一数据集交付,而是构建了“全栈技术底座+产业协同方法论+真实场景布局”的完整能力体系,真正解决“什么数据能训练好机器人”的行业核心问题。
1. 全栈自控的数据生产底座,覆盖全场景训练需求
景联文具备从采集装备到标注质检的全链路自研能力,依托SolarSense与QApex平台,构建“采集-治理-标注-验证-资产”闭环体系,实现多源异构数据的自动化清洗与标准化管控。
此前已发布UMI、EGO、真机遥操作、深度行为四类核心数据集,覆盖“无本体操作—真机遥操作—深度行为”全维度。本次双目3D数据集进一步补全产品矩阵,满足从基础视觉到端到端具身模型的全阶段训练需求。
2. “模数共振”方法论:本体+大脑+数据协同,打造迭代飞轮
区别于传统“按需采集”,景联文联合本体企业与具身大脑,构建产业协同模式:本体提供动作标准与物理反馈,大脑定义训练目标,景联文输出采集规范与治理体系。多方在真实场景中形成“场景-数据-模型-验证-再采集”闭环,使数据生产直接优化任务成功率,推动具身数据从“有没有”向“好不好”升级,并共同定义行业可复用标准。
3. 开放式真实场景布局,让数据从实验室走向产业
景联文正建设城市级开放式训练场,打破封闭数采场局限,依托工业制造、医疗照护、商业零售等政府统筹的真实场景,采集“动作-力觉-视觉”对齐的高质量数据。
该模式持续输出覆盖环境扰动、长序列任务和多人交互的复杂数据,为机器人规模化落地提供贴近实际的应用素材,同时为地方构建具身智能产业生态提供核心支撑。
未来,景联文将继续深耕具身智能数据领域,深化“模数共振”产业协同,推进城市数采场建设,携手更多产业链伙伴打造“数据-算法-硬件-场景”协同生态,为中国具身智能产业高质量发展筑牢坚实的数据基石。
如需获取数据集详细规格与样例数据,欢迎后台留言或联系我们咨询对接。