新智具身联合复旦大学发布N0系列触觉技术报告并开源超三万小时交互数据
具身智能 | 发布:2026-07-27T04:28:38.000Z | 更新:2026-07-27T04:28:38.469Z | 作者:阿爻-智造编辑
新智具身联合复旦大学正式发布N0系列三份触觉技术报告,将触觉模态跃升为具身智能核心基建并全面开源相关数据与模型。该系列研究推出包含超3万小时视觉与触觉交互数据的NeoData数据集,以及统一表征模型NeoForce,解决跨设备数据融合难题。N0-VTLA模型通过预测未来50步触觉演变,使毛巾折叠等长程任务成功率提升至95%。N0-TWAM世界模型引入触觉想象机制,总参数量控制在72亿,真机测试平均成功率达46.3%。目前该技术已在汽车车灯装配、板卡插拔等工业场景落地验证,推动机器人向复杂物理世界交互迈进。
导语
2026年7月,上海新智具身智能科技有限公司联合复旦大学可信具身智能研究院,正式发布N0系列三份技术报告。该系列研究将触觉从辅助模态跃升为核心基建,并宣布相关数据与模型全部开源。此举标志着具身智能认知范式正从单一视觉驱动向视触融合演进,为行业补齐了关键的交互数据与模型基础,推动机器人向更复杂的物理世界交互迈进。
一、统一触觉数据标准构建交互语料库
不同触觉传感器输出的数据格式互不兼容,凝胶形变图、电容矩阵与六维力向量犹如各地“方言”无法融合,这是制约触觉数据规模化应用的核心瓶颈。针对这一问题,N0-Foundation报告提出了NeoData数据集与NeoForce统一表征模型。NeoData数据集包含超3万小时视觉-触觉交互操作数据,涵盖约140万条操作片段与33亿个时间步,并记录了80亿帧RGB画面与100亿帧触觉图像。数据采集中动用了Franka、Piper、UR5e等6种机器人本体,覆盖叠衣、插拔接头、倒液体等450项真实长程任务,由90位操作员采集完成。目前团队已开源5千小时视觉-触觉交互数据。据量子位2026年7月26日报道,该数据集的规模与多样性在当前的触觉数据集中处于前列。在此基础上,NeoForce模型能够学习具备迁移能力的触觉表征,无论底层传感器硬件如何,都能准确解析受力位置与力度变化,形成统一的“触觉普通话”,有效解决了跨设备数据融合难题,极大降低了多机器人协同开发的数据采集成本。
二、突破视觉信号淹没实现触觉预判
直接将触觉图像与RGB视觉信号简单拼接,会导致触觉信号被海量视觉Token淹没。因为触觉信号仅在接触瞬间产生高频响应,大部分时间处于静默状态。此外,当前触觉本质上是滞后反馈,属于典型的“后视镜”式感知。N0-VTLA报告提出不依赖滞后的当前触觉,而是预测未来50步内的触觉演变。该模型将当前触觉编码为紧凑的潜在Token,结合视觉上下文预判滑移、受力等趋势,从而指导动作模块提前调整。这种前瞻性的感知机制,使得机器人能够在接触发生前完成策略调整,有效避免了因反应延迟导致的操作失败。据量子位2026年7月26日报道,这一创新思路有效解决了视觉与触觉模态在时间维度上的不对齐问题。这一机制突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人能够从失败数据中自主进化。通过结合触觉信息训练进度评估模型,系统能够精准识别“退步”与“救场”等复杂行为,并结合离线强化学习进行持续优化,大幅提升了模型在动态物理环境中的响应前瞻性。
三、融合多模态信息提升长程任务成功率
在具体的任务执行层面,N0-VTLA模型展现出了显著的性能提升。在插插头任务中,引入触觉预判后成功率达到85%,而纯视觉方案仅为60%。在拔钥匙任务中,该模型成功率高达99%,相比之下视觉方案仅为35%。面对更为复杂的长程任务,视触融合的优势进一步凸显:毛巾折叠任务成功率从50%提升至95%,书包收纳任务从35%提升至80%,纸箱折叠任务从20%提升至75%。这些数据表明,触觉信息的引入不仅弥补了视觉在接触瞬间的感知盲区,更为机器人提供了维持物理交互稳定性的关键反馈。通过深度融合多模态信息,机器人能够在长序列操作中保持动作的连贯性与精确度,有效降低了因视觉遮挡或光照变化导致的操作失败风险。这种架构使得机器人能够处理更高维度的物理约束,为复杂工业装配与日常服务场景提供了可靠的技术支撑与数据验证,进一步拓宽了具身智能在精密制造领域的应用边界。
四、重构世界模型引入触觉想象机制
现有世界模型大多局限于未来视觉图像的生成,无法感知“手指夹没夹稳”或“插头会不会卡住”等关键触感信息。N0-TWAM报告提出在世界模型中重构“触觉想象”,同时预测未来视频、触觉、动作三个耦合序列。该模型采用混合专家架构,内置视频、触觉、动作三个异步专家网络。其中,视频专家从预训练模型热启动,触觉和动作专家则采用更窄的网络结构。这种设计使得模型总参数量控制在72亿,仅相当于全宽方案的一半,在保持高性能的同时大幅降低了计算开销。通过引入触觉想象机制,世界模型能够在执行动作前在内部模拟物理接触的预期结果,从而提前规划更合理的操作轨迹。据上海科技报2026年7月21日报道,这种多模态耦合预测机制,使得机器人能够在执行复杂操作时具备更强的环境适应能力。该架构有效避免了单一视觉预测在接触任务中的幻觉问题,确立了触觉在世界模型顶层设计中的核心地位,推动具身智能从被动响应向主动规划演进。
五、优化模型参数量验证视触融合优势
在性能验证方面,N0-TWAM模型通过详实的实验数据证明了触觉想象的必要性。在仿真环境中,该模型的平均成功率达到84.5%,而现有主流世界模型基线仅为36%。在真机测试环节,N0-TWAM在8项任务中的平均成功率为46.3%,显著高于LingBot-VA的21.9%。更为关键的是,消融实验证实了触觉模态的不可替代性:去除“未来触觉预测”或“当前触觉条件”均会导致性能显著下降。这表明触觉信息不仅是视觉的补充,更是构建准确物理世界模型的核心要素。新智具身自研传感器指尖每平方厘米约4万个感知点,结合超千平方米的专业触觉数据采集工厂,确保了底层数据的高精度与高一致性。整体测试结果表明,多模态融合架构在应对非结构化环境时具备更高的容错率,为复杂工业场景下的长时间连续作业提供了技术保障,共同验证了视触融合在提升机器人物理交互能力方面的显著优势,为后续大规模部署奠定了坚实基础。
六、落地工业制造场景展示精细化操作
技术的最终价值在于产业落地。在2026年WAIC上,新智具身通过四大展台联动展示了触觉技术的工业化应用。在模登时代展台,联合复旦展示了汽车车灯精细化装配;在静安市北合作展台,演示了板卡插拔精细化操作,直击电子制造与设备维护场景痛点;在上海国投展台,展出了自研自适应视触觉AI传感器;在上海电气展台,呈现了轨道交通自动化数据接口连线。据静安区政府网2026年7月21日报道,这些展示覆盖了从精密装配到智慧养老的多元场景,充分展现了触觉技术在提升工业生产精度与效率方面的巨大潜力。新智具身成立于2025年,脱胎于复旦大学可信具身智能研究院,获静安区科技经济委、静安资本及市北高新集团培育。复旦姜育刚教授担任研究院院长,吴祖煊教授担任首席科学家。通过产学研深度融合,新智具身正推动触觉具身智能从实验室走向真实产线。这种将前沿算法与工业需求紧密结合的模式,加速了制造业的智能化转型,为具身智能的大规模商业化提供了可复制的落地范本。
结语
N0系列技术报告的发布,为具身智能行业提供了从数据底座、模型架构到世界模型的完整触觉解决方案。通过3万小时交互语料库与多项性能突破,新智具身与复旦大学证明了触觉模态在复杂物理交互中的核心价值。随着数据与模型的全面开源,视触融合范式将加速普及,推动机器人真正具备与物理世界深度交互的能力,开启具身智能发展的新阶段。
常见问题
一、新智具身联合复旦发布的NeoData数据集包含多大规模的交互数据?
NeoData数据集包含超3万小时视觉-触觉交互操作数据,涵盖约140万条操作片段与33亿个时间步,并记录了80亿帧RGB画面与100亿帧触觉图像,目前团队已开源5千小时数据。
二、N0-VTLA模型在毛巾折叠等长程任务中实现了怎样的成功率提升?
引入触觉预判后,N0-VTLA模型将毛巾折叠任务成功率从50%提升至95%,书包收纳任务从35%提升至80%,纸箱折叠任务从20%提升至75%,显著弥补了视觉感知盲区。
三、N0-TWAM世界模型是如何通过触觉想象机制降低计算开销的?
N0-TWAM采用混合专家架构,内置视频、触觉、动作三个异步专家网络,将总参数量控制在72亿,仅相当于全宽方案的一半,在保持高性能的同时大幅降低了计算开销。
四、N0-TWAM模型在真机测试中相比主流基线LingBot-VA表现如何?
在真机测试环节,N0-TWAM在8项任务中的平均成功率达到46.3%,显著高于LingBot-VA的21.9%,验证了多模态融合架构在应对非结构化环境时具备更高的容错率。
五、新智具身在2026年WAIC上展示了哪些触觉技术的工业化应用场景?
新智具身展示了汽车车灯精细化装配、板卡插拔精细化操作、自适应视触觉AI传感器以及轨道交通自动化数据接口连线,覆盖了从精密装配到智慧养老的多元场景。
六、新智具身与复旦大学可信具身智能研究院具有怎样的渊源关系?
新智具身成立于2025年,脱胎于复旦大学可信具身智能研究院,由复旦姜育刚教授担任研究院院长,吴祖煊教授担任首席科学家,获静安区科技经济委等机构培育。
关于本文的常见问题
统一触觉数据标准构建交互语料库
不同触觉传感器输出的数据格式互不兼容,凝胶形变图、电容矩阵与六维力向量犹如各地“方言”无法融合,这是制约触觉数据规模化应用的核心瓶颈。针对这一问题,N0-Foundation报告提出了NeoData数据集与NeoForce统一表征模型。NeoData数据集包含 超3万小时视觉-触觉交互操作数据 ,涵盖 约140万条操作片段 与 33亿个时间步 ,并记录了 80亿帧RGB画面 与 100亿帧触觉图像 。数据采集中动用了Franka、Piper、UR5e等 6种机器人本体 ,覆盖叠衣、插拔接头、倒液体等 450项真实长程任务 ,由 90位操作员 采集完成。目前团队已 开源5千小时 视觉-触觉交互数据。据量子位2026年7月26日报道,该数据集的规模与多样性在当前的触觉数据集中处于前列。在此基础上,NeoForce模型能够学习具备迁移能力的触觉表征,无论底层传感器硬件如何,都能准确解析受力位置与力度变化,形成统一的“触觉普通话”,有效解决了跨设备数据融合难题,极大降低了多机器人协同开发的数据采集成本。 二、突破视觉信号淹没实现触觉预判</h3
突破视觉信号淹没实现触觉预判
直接将触觉图像与RGB视觉信号简单拼接,会导致触觉信号被海量视觉Token淹没。因为触觉信号仅在接触瞬间产生高频响应,大部分时间处于静默状态。此外,当前触觉本质上是滞后反馈,属于典型的“后视镜”式感知。N0-VTLA报告提出不依赖滞后的当前触觉,而是 预测未来50步内的触觉演变 。该模型将当前触觉编码为紧凑的潜在Token,结合视觉上下文预判滑移、受力等趋势,从而指导动作模块提前调整。这种前瞻性的感知机制,使得机器人能够在接触发生前完成策略调整,有效避免了因反应延迟导致的操作失败。据量子位2026年7月26日报道,这一创新思路有效解决了视觉与触觉模态在时间维度上的不对齐问题。这一机制突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人能够从失败数据中自主进化。通过结合触觉信息训练进度评估模型,系统能够精准识别“退步”与“救场”等复杂行为,并结合离线强化学习进行持续优化,大幅提升了模型在动态物理环境中的响应前瞻性。 三、融合多模态信息提升长程任务成功率</h3
融合多模态信息提升长程任务成功率
在具体的任务执行层面,N0-VTLA模型展现出了显著的性能提升。在插插头任务中,引入触觉预判后 成功率达到85% ,而纯视觉方案仅为 60% 。在拔钥匙任务中,该模型 成功率高达99% ,相比之下视觉方案 仅为35% 。面对更为复杂的长程任务,视触融合的优势进一步凸显:毛巾折叠任务 成功率从50%提升至95% ,书包收纳任务 从35%提升至80% ,纸箱折叠任务 从20%提升至75% 。这些数据表明,触觉信息的引入不仅弥补了视觉在接触瞬间的感知盲区,更为机器人提供了维持物理交互稳定性的关键反馈。通过深度融合多模态信息,机器人能够在长序列操作中保持动作的连贯性与精确度,有效降低了因视觉遮挡或光照变化导致的操作失败风险。这种架构使得机器人能够处理更高维度的物理约束,为复杂工业装配与日常服务场景提供了可靠的技术支撑与数据验证,进一步拓宽了具身智能在精密制造领域的应用边界。 四、重构世界模型引入触觉想象机制</h3
重构世界模型引入触觉想象机制
现有世界模型大多局限于未来视觉图像的生成,无法感知“手指夹没夹稳”或“插头会不会卡住”等关键触感信息。N0-TWAM报告提出在世界模型中重构“触觉想象”, 同时预测未来视频、触觉、动作三个耦合序列 。该模型采用混合专家架构,内置视频、触觉、动作三个异步专家网络。其中,视频专家从预训练模型热启动,触觉和动作专家则采用更窄的网络结构。这种设计使得模型总参数量控制在 72亿 , 仅相当于全宽方案的一半 ,在保持高性能的同时大幅降低了计算开销。通过引入触觉想象机制,世界模型能够在执行动作前在内部模拟物理接触的预期结果,从而提前规划更合理的操作轨迹。据上海科技报2026年7月21日报道,这种多模态耦合预测机制,使得机器人能够在执行复杂操作时具备更强的环境适应能力。该架构有效避免了单一视觉预测在接触任务中的幻觉问题,确立了触觉在世界模型顶层设计中的核心地位,推动具身智能从被动响应向主动规划演进。 五、优化模型参数量验证视触融合优势</h3
优化模型参数量验证视触融合优势
在性能验证方面,N0-TWAM模型通过详实的实验数据证明了触觉想象的必要性。在仿真环境中,该模型的 平均成功率达到84.5% ,而现有主流世界模型基线 仅为36% 。在真机测试环节,N0-TWAM在 8项任务中的平均成功率为46.3% ,显著高于LingBot-VA的 21.9% 。更为关键的是,消融实验证实了触觉模态的不可替代性:去除“未来触觉预测”或“当前触觉条件”均会导致性能显著下降。这表明触觉信息不仅是视觉的补充,更是构建准确物理世界模型的核心要素。新智具身自研传感器指尖 每平方厘米约4万个感知点 ,结合超千平方米的专业触觉数据采集工厂,确保了底层数据的高精度与高一致性。整体测试结果表明,多模态融合架构在应对非结构化环境时具备更高的容错率,为复杂工业场景下的长时间连续作业提供了技术保障,共同验证了视触融合在提升机器人物理交互能力方面的显著优势,为后续大规模部署奠定了坚实基础。 六、落地工业制造场景展示精细化操作</h3
落地工业制造场景展示精细化操作
技术的最终价值在于产业落地。在2026年WAIC上,新智具身通过四大展台联动展示了触觉技术的工业化应用。在模登时代展台,联合复旦展示了汽车车灯精细化装配;在静安市北合作展台,演示了板卡插拔精细化操作,直击电子制造与设备维护场景痛点;在上海国投展台,展出了自研自适应视触觉AI传感器;在上海电气展台,呈现了轨道交通自动化数据接口连线。据静安区政府网2026年7月21日报道,这些展示覆盖了从精密装配到智慧养老的多元场景,充分展现了触觉技术在提升工业生产精度与效率方面的巨大潜力。新智具身成立于2025年,脱胎于复旦大学可信具身智能研究院,获静安区科技经济委、静安资本及市北高新集团培育。复旦姜育刚教授担任研究院院长,吴祖煊教授担任首席科学家。通过产学研深度融合,新智具身正推动触觉具身智能从实验室走向真实产线。这种将前沿算法与工业需求紧密结合的模式,加速了制造业的智能化转型,为具身智能的大规模商业化提供了可复制的落地范本。 结语 N0系列技术报告的发布,为具身智能行业提供了从数据底座、模型架构到世界模型的完整触觉解决方案。通过3万小时交互语料库与多项性能突破,新智具身与复旦大学证明了触觉模态在复杂…
新智具身联合复旦发布的NeoData数据集包含多大规模的交互数据?
NeoData数据集包含超3万小时视觉-触觉交互操作数据,涵盖约140万条操作片段与33亿个时间步,并记录了80亿帧RGB画面与100亿帧触觉图像,目前团队已开源5千小时数据。 二、N0-VTLA模型在毛巾折叠等长程任务中实现了怎样的成功率提升?</h4
N0-VTLA模型在毛巾折叠等长程任务中实现了怎样的成功率提升?
引入触觉预判后,N0-VTLA模型将毛巾折叠任务成功率从50%提升至95%,书包收纳任务从35%提升至80%,纸箱折叠任务从20%提升至75%,显著弥补了视觉感知盲区。 三、N0-TWAM世界模型是如何通过触觉想象机制降低计算开销的?</h4