WAIC2026 清晰释放产业信号,人工智能发展主线正从数字空间转向物理世界。业内共识逐步形成,人形机器人想要迎来具备零样本泛化能力的 “GPT 时刻”,至少需要 1 亿小时量级真实交互训练数据,但是当前全行业可用优质具身数据存量存在巨大缺口,高质量数据供给已经成为制约物理 AI 规模化落地的底层瓶颈。在此背景下,依托清华大学计算机系孵化的清华系初创企业星忆智能,在本届大会推出适配 EgoKit 采集终端的全套自研算法方案,以第一人称 Ego-Centric 采集路线切入上游数据基础设施赛道,致力于打造标准化具身数据生产底座。
星忆智能 2026 年初正式成立,核心团队来自清华、北航,累计在 CVPR、ICCV、NeurIPS 等顶会发表 70 余篇论文,兼具前沿算法研究与大规模工程落地能力。创始人宋知珩拥有人形机器人全栈开发经验,曾任智元机器人双足人形整机与遥操作数采体系负责人,深度参与头部机器人企业商业化从零到一的建设。长期一线研发让团队发现行业普遍误区:大量企业盲目追求数据采集总量,忽视多模态时序对齐、三维空间精度等质量指标,海量低质量残缺数据无法帮助模型学习真实物理交互规律。为此企业避开机器人本体、通用大模型等红海赛道,定位为具身数据算法服务商,目标成为物理 AI 时代标准化 Ego 数据核心算法供给方。
当前赛道涌入大量跟风参与者,多数仅复刻头戴设备外观,只能实现基础视频录制,在多模态时序同步、遮挡条件下手部重建、自动化标注流水线三大核心环节存在明显短板。横向对比 Meta Project Aria、斯坦福 DexCap 以及国内同类轻量化采集方案,市面产品普遍存在模态单一、遮挡识别失效、标注成本高昂等问题,行业同类方案的数据可用率大多处于 93%-95%,标注一致性不足 90%。星忆智能自研算法搭配 EgoKit 终端后,数据可用率稳定高于 98%,标注一致性达到 96.7%,量化指标具备显著优势。
目前行业具身数据主要分为互联网视频、仿真合成、UMI 遥操作、真机部署、第一视角 Ego 数据五大来源,各类路线均存在固有短板。互联网视频缺少精细手部交互信息,仿真数据难以消除虚实域差距,真机大规模采集成本居高不下,遥操作数据受场景多样性限制。英伟达、Meta 等海外机构已经验证,第一视角 Ego 数据能够完整留存人类操作逻辑与接触细节,是提升机器人灵巧操作能力的核心数据源。星忆智能搭建软硬协同的完整 Ego 采集链路,适配 EgoKit 头戴多目相机与触觉传感手套,依靠自研算法实现 RGB、深度、IMU、力触觉信号毫秒级时空对齐,统一映射至同一物理坐标系,实现毫米级三维手部重建。
自研手部姿态基础模型构成核心技术壁垒,能够稳定应对手物自遮挡、低光照、运动模糊等复杂野外工况,缓解传统视觉识别漂移失效难题。相关算法多次斩获国际顶会杰出论文、Oral 报告;依托手物交互隐空间表征的视触融合技术,大幅增强模型对抓取、挤压等物理接触行为的理解。在数据生产环节,企业搭建基座模型辅助标注与人机协同质控流水线,复杂长序列交互任务标注成本缩减至传统方案的 1%,现已交付标准化数据集突破 12 万组,形成可复制的高质量数据闭环,这套自动化工程体系也是短期难以复刻的竞争壁垒。区别于单纯提供标注外包的厂商,星忆智能形成算法适配、三维重建、智能标注平台、数据集交付全链路服务,面向人形机器人企业、具身大模型研发团队、工业柔性产线、XR 交互研发机构输出一站式解决方案。
行业专家普遍预判通用机器人智能涌现窗口在 3 至 5 年,长期约束依旧是亿小时规模多模态交互数据储备。大厂依托算力与模型优势向下渗透,但很难深耕细分场景专属数据,上游数据算法赛道为创业公司留出差异化发展空间。现阶段资本市场资金大量涌向仿真平台、人形整机赛道,星忆智能尚处在早期发展阶段,仅完成数千万元融资,底层算法价值尚未被充分发掘,不少硬科技投资人认为项目存在明显估值洼地。公司技术路线获得多方权威认可,央视《焦点访谈》实地调研报道其人手动作捕捉、动作向机器人映射技术,方案入选科博会具身智能标杆案例、《DIKI 中国具身锐企榜》。
星忆智能的核心产业逻辑,是为物理 AI 持续供给高纯度训练数据。一方面依靠自研算法与自动化标注体系降低全行业数据生产门槛,另一方面持续自主产出稀缺视触融合第一视角数据集,填补行业数据缺口。后续团队计划依托新一轮资本持续迭代多模态感知与重建算法,扩充居家、工业、服务业多元场景人类操作数据资产,助力行业补齐高质量数据储备,推动通用人形机器人从展厅演示走向真实环境规模化落地。