发布询价单
您的位置:首页 > 资讯 > 企业动态 > 正文

天创机器人联合清华、东南大学和视源、戴盟、承泰等产业伙伴发布首个基于可信安全策略的通用工业具身智能融合模型

2026-08-10 09:57 性质:转载 作者:天创机器人 来源:天创机器人
免责声明:AGV网(www.chinaagv.com)尊重合法版权,反对侵权盗版。(凡是我网所转载之文章,文中所有文字内容和图片视频之知识产权均系原作者和机构所有。文章内容观点,与本网无关。如有需要删除,敬请来电商榷!)
从“看懂任务”到“安全作业”:天创机器人牵头研发,联合清华大学、东南大学、视源股份、戴盟机器人以及承泰科技,正式发布面向泛工业运维和应急安全救援等场景的“基于可信安全策略的通用工业具...

从“看懂任务”到“安全作业”:天创机器人牵头研发,联合清华大学、东南大学、视源股份、戴盟机器人以及承泰科技,正式发布面向泛工业运维和应急安全救援等场景的“基于可信安全策略的通用工业具身智能融合模型”

今天,我们正式发布T-WAVES。这是天创机器人面向泛工业运维和应急安全救援等场景构建的基于可信安全策略的通用工业具身智能融合模型,其技术架构为T-WM-VTLA-S。

它不是一个单独的视觉语言模型,也不是一个只停留在实验室演示里的机器人策略。T-WAVES的目标,是基于T-WM-VTLA-S 技术架构,把视觉、语言、动作、状态向量型触觉、世界模型和外置安全控制放进同一个可训练、可部署、可验证的系统里,让机器人能够在真实场景中完成更长程、更高接触、更高风险的作业任务。

在接下来的发布文章中,我们将陆续展示基于该框架完成的典型任务:

  • 充电枪 /usb等插接类任务:机器人需要完成视觉定位、姿态对准、接触搜索、插入力控制与失败恢复。

  • 柜门开关任务 :机器人需要理解长程任务流程,先开门,再定位目标按钮,并按规则执行。

  • 旋钮操作:机器人需要在受限空间内完成抓握、旋转、限位判断与力矩控制。

  • 按钮操作:机器人需要识别按钮位置,执行动作,在感受到按钮按压程度到位以后会停止按压。

  • 拓展更多场景的作业任务:电力、消防、危化巡检等场景作业

  • 我们的判断很明确:工业机器人不是只需要“会看图说话”的模型,而是需要一个能够把任务理解、动作生成、接触感知和安全约束同时打通的具身智能系统。

图1 T-WM-VTLA-S技术架构

T-WM-VTLA-S由三个核心部分组成:

WM

World Model/世界模型

不直接替代控制器,而是生成subtask、goal image、future latent,为策略提供“下一步应该变成什么样”的目标提示,同时会生成目标位置,服务于安全层进行碰撞风险判断。

VTLA

Vision-Tactile-Language-Action

在视觉语言动作模型基础上加入触觉/接触信息,让机器人不仅能“看见”,还能在插接、拧阀、开门、按压等任务中感知接触状态。

S

Safety/外置安全层不完全交给神经网络内部“自觉遵守”,而是通过动作屏蔽、空间约束、力矩阈值、任务规则、急停与恢复策略形成独立的安全边界作为“硬约束”。

与从零大规模预训练不同,当前阶段我们选择一条更务实的路线:基于已有VLM/VLA/World Model能力进行微调,把Ego第一视角数据、UMI数据和真机数据对齐到统一动作空间,在真实作业闭环中逐步扩大能力边界。

01 

为什么工业机器人需要新的具身智能框架

开柜门+按消控盘也不是一个单步任务。机器人需要理解“先开门、再识别面板、再按指定按钮”的流程,还要处理门未完全打开、按钮被遮挡、机械臂姿态受限等情况。

配电房旋钮操作更复杂。机器人不仅要识别旋钮,还要抓住、旋转、判断阻力变化,并在接近限位时停止。这里真正重要的不只是视觉识别,而是接触、力矩、时序和安全。

因此,我们认为工业机器人作业能力至少要同时满足五个维度:

1. 空间精度

能够在复杂设备、狭窄空间和非标准工装中完成高精度定位。

2. 时间编排

能够执行多阶段任务,而不是只完成单个动作片段。

3. 接触丰富度

能够处理插入、按压、旋转、拉门、推门、锁扣、旋钮等高接触任务。

4. 工具/设备交互

能够理解真实工业设备、消防设备、电力设备、化工设备的操作逻辑。

5. 安全可控

在高风险环境中,动作必须被约束、可监控、可中止、可恢复。

T-WAVES正是围绕这五个维度设计。

图2 五维具身智能框架

02 

T-WAVES:不只是一个模型,而是一套作业系统

T-WAVES基于T-WM-VTLA-S技术架构,让不同模块各司其职,而不是把所有能力都压进一个黑盒策略里。

整体链路可以理解为:

视觉/语言/状态/触觉输入进入VTLA主干,World Model生成未来目标信息,动作专家输出机器人动作,外置安全层对动作进行约束和过滤,最后再下发到真实机器人控制系统。

简单来说:

模型负责理解和生成,世界模型负责想象和规划,触觉模块负责接触判断,安全层负责兜底。

这也是我们没有把安全层完全内化到模型里的原因。对于工业机器人来说,安全不是一个“希望模型学会”的偏好,而是一个必须独立存在的系统边界。

03 

第一层:用Ego、UMI和真机数据构建可微调的数据引擎

大规模预训练当然重要,但对于多数机器人公司来说,真正的现实问题是:没有办法一开始就拥有数万小时的机器人数据。

因此,T-WAVES当前采用的是微调优先路线。

我们把数据分为三类:

  • Ego第一视角数据

  • 用于学习人类完成任务时的高层语义、任务顺序、目标状态和操作意图。

  • UMI数据

  • 用于低成本采集人类操作轨迹,并同步记录指尖力触信息,补充手眼协调、末端运动、接触状态和任务过程数据。

  • 真机数据

  • 用于学习机器人本体上的真实动作分布、动力学、延迟、接触反馈和执行边界。

    这里最关键的问题不是“数据越多越好”,而是“不同来源的数据如何对齐”。

    在T-WAVES中,T-WM-VTLA-S技术架构将动作统一到TCP-local delta action空间。也就是说,无论原始数据来自UMI、Ego标注,还是机器人真机遥操作,最终都会尽量转换成相对于末端执行器自身坐标系的增量动作:

    [dx, dy, dz, droll, dpitch, dyaw, gripper]

    对于双臂系统,则扩展为左右臂各7维,共14维,并通过mask处理单臂/双臂数据差异。

    这样做的好处是:模型学习的是“末端应该如何相对当前接触点移动”,而不是强绑定某一个机器人arm base下的绝对坐标。对于插枪、阀门、柜门这类任务,这种表示更加贴近真实操作逻辑。

    图3 多源数据融合感知层

    04 

    第二层:World Model不直接控制机器人,而是生成目标

    T-WM-VTLA-S技术架构中的WM,并不是为了让机器人“看一段视频然后照着演”。它承担的是更明确的中间角色:为VTLA策略提供未来目标信息。

    在第二阶段训练中,World Model会根据当前观测、语言指令和动作条件,生成:

  • subtask:当前处于哪个任务阶段;

  • goal image:下一阶段希望看到的目标图像;

  • future latent:未来状态的潜在表示;

  • consistency signal:当前动作是否朝着合理未来推进。

  • 例如,在“开柜门+操作消控盘”任务中,策略不应该一开始就直接去按按钮。World Model可以提供类似这样的中间目标:

    1. 找到柜门把手;

    2. 打开柜门;

    3. 等待门体到达可操作角度;

    4. 定位消控盘目标按钮;

    5. 执行按压动作。

    这让VTLA不再只是从当前图像直接回归动作,而是多了一层“下一步世界应该变成什么样”的条件。

    当前我们采用轻量化的世界模型作为Goal-WM基础模型,并围绕工业作业数据进行微调。

    图4 世界模型融合方案

    05 

    第三层:VTLA,把触觉纳入动作生成

    传统VLA的输入通常是视觉、语言和机器人状态。但在工业作业里,这还不够。

    很多任务真正的关键发生在接触之后。

    插枪时,视觉可能已经看不到插头和插座之间的细微偏差,力反馈才是判断是否卡住、偏斜、插入成功的核心信号。

    拧阀门时,模型需要知道当前是空转、正常旋转、接近限位,还是遇到异常阻力。

    按消控盘时,机器人需要判断是否真正按下,而不是仅仅把末端移动到按钮表面。

    因此,T-WM-VTLA-S在第三阶段引入触觉分支,将力/力矩、接触状态、末端速度变化和任务阶段共同输入动作专家。

    这一阶段的目标不是让机器人“看起来动作更像”,而是让机器人在接触中更稳定、更可恢复、更接近真实作业需求。

    图5 VTLA架构图

    06 

    第四层:外置安全层,让模型能力进入真实现场

    在真实工业作业中,模型输出永远不能被无条件信任。

    T-WM-VTLA-S的S是一个外置安全层,它不完全依赖模型自己解释“我觉得这个动作安全”,而是从系统外部对动作进行检查和约束。

    它包括:

  • 工作空间约束限制机械臂进入危险区域、碰撞区域或不可达区域。

  • 速度与加速度限制

    防止模型输出突变动作,降低设备和人员风险。

  • 力/力矩阈值

    对插接、旋转、按压等任务设置接触边界。

  • 任务规则约束

    例如未完成开门前,不允许执行按按钮动作,根据子任务状态判断切换是否成功。

  • 动作屏蔽与重规划

    当模型动作违反规则时,安全层可以裁剪、替换动作直到达到安全的动作。

  • 急停与人工接管

    高风险状态下,系统必须允许快速中止和人工介入。

  • 这也是我们面向工业机器人场景坚持“模型+控制+安全系统”一体化设计的原因。

    具身智能最终要进入现场,而不是只停留在bfnchmark上。

    图6 系统外置安全层方案

    VLSA:T-WAVES外置安全层的早期技术来源

    这里需要特别说明的是,T-WAVES的S层除了增加安全规则和本体状态限制,同时保留了我们早期联合清华具身实验室发布的VLSA技术路线,同时进行实际结合处理。VLSA已被IROS 2026接收,它的核心思想是在视觉语言动作策略之外,增加一个可插拔、可审计、可独立升级的安全屏障,对模型输出动作进行风险识别、约束过滤和最小扰动修正。

    在T-WAVES中,VLSA-style safety被放在策略模型和机器人控制器之间。策略模型负责生成nominal action,外置安全层负责读取任务、视觉、深度、TCP状态、触觉和工作空间约束,并对动作块执行限幅、与障碍物碰撞距离检查和控制屏障约束,其中障碍物由世界模型提供坐标。

    如果动作仍处在可修正范围内,安全层输出最小扰动后的safe action;如果动作无法被修正到安全集合内,系统会触发拒绝执行、保持当前位置、降级恢复、人工接管或急停。这样,安全不被隐藏在神经网络黑箱内部,而是形成一个可解释、可测试、可持续升级的工业安全边界。

    07 

    三位一体的可信数据采集系统:真机、UMI与Ego

    T-WAVES并不依赖单一来源的数据,而是构建了由机器人真机数据、UMI数据和Ego第一视角人类数据组成的数据闭环。三类数据均来自受控采集流程,记录设备、操作者、任务、场景、标定参数及处理链路,确保数据来源可靠、过程可追溯、结果可复核。

    三类数据并非简单堆叠:

  • 真机数据提供与部署平台完全一致的动作、状态向量型触觉和安全边界;

  • UMI数据以更低成本扩展精细操作轨迹,并同步记录指尖状态向量型触觉、触觉与接触状态;

  • Ego数据负责扩展任务场景、操作语义和长时序行为多样性。

  • 它们分别位于“高动作保真度”和“大规模任务覆盖”的不同位置,经过统一时空标定与动作表征后共同用于模型微调。在进入模型训练前,采集数据将首先导入仿真环境进行统一评估。系统复现相机观测、机器人状态和末端动作轨迹,检查动作的可执行性、连续性、碰撞风险、关节限位、速度与加速度约束,以及任务完成情况。只有通过仿真评估的数据,才会进入后续训练数据集。

    这里的“可信”并不表示所有采集数据天然正确,而是指数据具备明确来源、完整标定、统一动作定义和训练前验证闭环。对于轨迹漂移、动作突变、碰撞、超限或任务失败的数据,系统会进行修正、重新标注或剔除,避免未经验证的数据直接进入训练流程。

    可将整体流程概括为:

    受控采集→来源与标定检查→坐标和动作空间统一→仿真回放评估→质量筛选→数据集入库→模型训练

    图7 多源可信数据采集系统

    机器人真机数据:带触觉反馈的VR遥操作

    我们使用VR设备遥操作机器人,机器人的双臂为视源提供,末端抓夹为戴盟机器人提供,雷达传感器由承泰科技提供,并在头显操作界面中实时可视化机器人末端六维力/力矩反馈。

    操作者不仅能够看到机器人第一视角、腕部视角和环境视角,还能够观察末端接触力的方向、大小和变化趋势。相比仅依赖视频的遥操作,这种方式可以帮助操作者更精细地控制:

  • 插枪过程中的位置、姿态和轴向插入力;

  • 柜门开启时的抓取力、拉力方向和门体运动;

  • 消控盘按钮的接近、接触和触发力度;

  • 旋拧按钮操作中的抓握稳定性、旋转力矩和卡阻状态。

  • 每条轨迹同步记录:

    其中包含多视角图像、机器人状态、末端位姿、动作、六维力/力矩、安全状态和语言指令。

    真机原始动作虽然定义在机器人基座坐标系下,但进入训练前统一转换成以当前TCP坐标系表示的局部增量:

    最终形成单臂7维、双臂14维的标准动作:

    这部分数据数量最少、采集成本最高,但与实际部署分布最接近,也是状态向量型触觉学习、接触控制和安全边界学习的主要数据来源。

    UMI:融合指尖力触感知与高精度SLAM重建的操作数据

    UMI用于快速采集人类完成任务时的精细操作轨迹。采集装置在指尖或夹爪接触端同步记录状态向量型触觉、触觉与接触状态,并通过高精度SLAM重建场景和夹爪运动;系统以夹爪中心点作为末端参考坐标系,恢复连续的相对位姿增量:

    因此,虽然UMI轨迹和真机轨迹的原始参考系不同——UMI相对于夹爪中心,真机位姿相对于机器人基座——二者在训练前都被转换成“当前末端坐标系下的下一步增量”。

    统一后的动作语义是:

    从当前夹爪/TCP出发,下一步应该沿哪个方向移动、旋转多少,以及何时开合夹爪。

    UMI能够较高效率地采集插入、旋拧、开门、按键等精细轨迹,并同步保留指尖接触力、触碰状态及其变化信息。由于这类数据仍不包含机器人本体的真实动力学、控制延迟和完整碰撞约束,因此进入训练前需要经过以下质量筛选:

  • SLAM轨迹置信度与重定位检查;

  • 夹爪中心和相机外参标定;

  • 轨迹速度、加速度和旋转跳变检测;

  • 机器人运动学可达性验证;

  • 仿真或真机回放验证;

  • 指尖力触信号与视觉、位姿轨迹的时间同步、标定及接触阶段检查。

  • 只有通过物理可执行性验证,并完成力触信号同步与质量检查的UMI轨迹,才进入动作专家训练。

    Ego数据:用第一视角扩展任务语义

    Ego数据从人类第一视角记录自然操作过程,通过高精度SLAM恢复头部在世界坐标系中的运动,同时估计双手相对于头部的六自由度位姿:

    由此可以重建手部在稳定世界坐标系中的运动,并计算手部局部增量:

    不过,人手并不等同于机器人TCP。Ego动作受人体结构、手指形态和物体遮挡影响,不能不加区分地作为机器人控制标签。

    因此,T-WAVES对Ego数据采用分层使用方式:

    1. 高置信度、可重定向轨迹用于学习粗粒度末端运动先验;

    2. 普通Ego数据主要监督子任务、目标图像和未来视觉Latent;

    3. 低动作置信度但任务内容有效的视频,只用于视觉语义和世界模型训练;

    4. 不让未经验证的人手轨迹直接监督机器人底层接触动作。

    换句话说,Ego数据更擅长告诉模型“接下来要完成什么”,真机数据则负责告诉模型“机器人具体应该如何安全完成”。

    三类数据的质量—数量—动作关系

    这里存在一个非常清晰的规律:

  • 数据数量越容易扩大,动作通常越不接近机器人本体;

  • 动作标签越真实,数据采集成本通常越高;

  • 真机数据决定动作落地的精度下限;

  • UMI数据扩大可执行技能的覆盖范围,并补充精细操作中的指尖力触与接触过程信息;

  • Ego数据决定模型能够理解多少任务、场景和操作逻辑。

  • 因此,我们不追求三类数据数量相等,也不对它们使用完全相同的损失函数,而是根据动作可信度进行分级监督:

    一般满足:

    而在世界模型和高层任务监督中则相反:

    这套数据体系形成了一条从“人类任务经验”到“可执行机器人动作”的逐级收敛路径:

    Ego任务语义→UMI操作轨迹→真机动作与力触觉→外置安全层

    一句话总结

    Ego数据拓展模型见过的世界,UMI数据拓展模型学过的动作并补充指尖力触线索,而真机数据决定这些动作能否在真实机器人上精确、安全地执行。

    08 

    面向下一代人机协同的数据引擎:Ego、肌电与脑机接口

    未来,T-WAVES的数据引擎将从视觉、指尖力触和机器人状态进一步扩展到人体生理信号。肌电信号用于增强手部动作和接触意图的观测,脑机接口则用于辅助识别任务阶段与子任务切换。

    Ego与肌电融合:补偿视觉遮挡下的动作信息

    Ego数据在真实操作中经常出现手部被物体、工具或身体遮挡的情况。此时,单纯依靠视觉跟踪容易造成手部位姿中断、抓握状态丢失或接触阶段判断错误。

    图8 Ego与肌电数据融合方案

    我们计划在操作者前臂布置表面肌电传感器,同步采集:

  • 手指屈伸相关肌群激活;

  • 抓握、释放和用力趋势;

  • 手腕旋转与稳定状态;

  • 动作开始、持续和结束时刻;

  • 接触前后的肌肉激活变化。

  • 肌电数据并不能直接恢复被遮挡的图像,但可以提供视觉不可见时的运动意图约束。例如,当视觉系统无法看到手指时,肌电信号仍可判断操作者是在抓紧、释放、旋拧还是持续施力。

    系统将采用遮挡感知的动态融合机制:

    当手部视觉跟踪置信度下降时,提高肌电和历史运动轨迹的权重;视觉恢复后,再利用视觉观测修正累计误差。

    肌电信号主要用于:

  • 补偿手部遮挡期间的动作Latent;

  • 判断抓握、释放和持续施力状态;

  • 辅助检测接触阶段;

  • 识别动作开始和结束边界;

  • 提高Ego手部轨迹重建的连续性;

  • 为Subtask和Goal-WM提供更准确的阶段标签。

  • 这类数据不会直接替代机器人力传感器。肌电反映的是人的运动意图和肌肉激活,机器人六维力传感器反映的则是真实环境作用力,二者分别服务于“意图理解”和“物理执行”。

    脑机接口与遥操作融合:用脑信号辅助Subtask Generate

    人在执行复杂任务时,通常会形成自然的任务切分逻辑。例如操作化工阀门时,人会经历:

    定位阀门→接近手轮→建立抓握→旋转→确认到位→释放撤离

    这些阶段不仅表现为外部动作变化,也会反映在注意力、运动准备、错误感知和任务切换相关的脑信号中。

    图9 脑机接口与遥操作融合方案

    未来的数据采集系统可将脑机接口与VR遥操作同步,联合记录:

  • EEG等非侵入式脑信号;

  • VR头部、手柄和视线状态;

  • 机器人视觉、状态与动作;

  • 末端六维力/力矩;

  • 人工接管与纠错行为;

  • 子任务语言标签和任务结果。

  • 脑信号不直接控制机器人底层动作,而是作为高层弱监督,辅助判断:

  • 当前操作者准备执行哪个子任务;

  • 子任务何时开始、完成或切换;

  • 操作者是否发现执行错误;

  • 是否需要停止、重试或改变策略;

  • 当前目标图像是否与人的任务预期一致。

  • 可以将潜在子任务建模为:

    随后由Goal-WM生成对应的子任务文本、目标图像和未来Latent:

    整体形成分层控制关系:

    脑信号:任务意图与阶段切分→肌电:动作准备与接触意图→Ego:视觉语义

    脑机接口在该系统中的定位不是“读脑控制机器人”,而是帮助模型理解人的任务组织方式,为Subtask Generate和长时序任务切分提供额外证据。最终动作仍由视觉—语言—状态向量型触觉—动作模型生成,并受到机器人状态、真实力反馈和外置安全层约束。

    09 

    三阶段训练路线:从动作对齐,到目标条件,再到状态向量型触觉接触

    T-WAVES基于T-WM-VTLA-S技术架构,当前不做从零大规模预训练,而是在VLA和世界模型的基模之上进行分阶段微调。三阶段训练的目的,是在有限但可信的数据条件下,避免一次性全量微调造成灾难性遗忘,也避免Ego、UMI、真机和仿真数据因为动作空间不同而相互冲突。

    图10 三阶段训练总体流程

    Stage 1A:动作接口适配

    Stage 1A是最保守的一步。此时冻结VLM Backbone、视觉编码器、和Action Expert,只训练State Projector、Action Input Projection、Action Output Projection、Embodiment Embedding和Action Space Embedding。

    这一阶段的目标不是追求任务成功率,而是先保证统一后的动作接口可用。UMI、真机和RoboTwin数据都会被转换为以抓夹中心/TCP为参考点的local delta action;单臂、双臂和不同末端执行器则通过ction mask标记有效维度。Stage 1A解决的是“模型能否读懂统一状态,并把动作解码到正确维度”的问题。

    图11 一阶段微调

    Stage 1B:动作专家微调

    Stage 1B开始解冻Action Expert/Flow Matching Head,同时引入VLM Top LoRA,但仍然冻结视觉编码器和VLM大部分主干。训练参数包括Action Expert、State Projector、Action Projection、Embodiment/Action Space Embedding和VLM Top LoRA。

    这一阶段让动作专家真正适配UMI、真机和仿真数据中的动作分布。模型不仅要输出正确维度的动作,还要学会合理的轨迹形状、速度节奏、接触前减速、夹爪开合时机和双臂协调。Stage 1B解决的是“动作分布是否像专家数据”的问题。

    Stage 1C:小学习率联合收敛

    Stage 1C是对Stage 1A和Stage 1B的稳定收敛。它不会突然开放全量模型,而是用更小学习率联合训练已经打开的动作相关模块:State Projector、Action Projection、Embodiment/Action Space Embedding、Action Expert和VLM Top LoRA。视觉编码器、VLM主干大部分层、Goal-WM、Subtask Head和Tactile MoE仍然冻结。Stage 1C的目标是让不同来源数据在同一动作空间中稳定共存,避免模型在UMI、真机和仿真之间来回漂移。

    Stage 2:Goal-WM+Goal-conditioned VTLA

    Stage 2引入世界模型。这里的World Model不直接控制机器人,而是生成subtask、subgoal image和goal latent,作为额外条件输入给VTLA Backbone与Action Expert。训练时混合三种goal来源:teacher goal、generated goal和dropped goal。teacher goal来自真实未来帧或阶段终点图像;generated goal来自Cosmos Goal-WM;dropped goal用于防止模型过度依赖目标图像。Stage 2主要训练Goal Encoder、Goal Latent Adapter、Goal-to-Action Adapter、Subtask Generator、Goal-conditioned Prefix Adapter、VLM Top LoRA,以及小学习率下的Action Expert和State/Action Projector。冻结视觉编码器、VLM大部分主干和Tactile MoE。

    图12 二阶段微调

    Stage 3:Tactile-aware VTLA微调

    Stage 3面向插枪、开柜门、按消控盘、拧化工阀门、压合和插拔等接触密集任务。此时在Stage 2的基础上引入力/力矩信号和Tactile MoE结构,训练Tactile State Encoder、Tactile MoE Router、Tactile Experts、Tactile-to-Action Adapter、Next Wrench Head、Contact Predictor,以及小学习率下的Action Expert和Action Projection。

    图13 三阶段微调

    一句话总结三阶段训练

    Stage 1解决动作空间对齐,Stage 2解决目标条件引导,Stage 3解决真实接触中的状态向量型触觉修正。T-WAVES不是把所有能力一次性塞进黑盒模型,而是通过分阶段开放参数,让基础模型逐步获得可执行动作、目标条件动作和状态向量型触觉接触动作能力。

    10 

    展示的任务视频

    我们会陆续发布基于T-WAVES模型完成的真实作业视频,特别要提到的是,在T-WAVES研发过程中,安全分层由清华具身院何潇老师团队提供支撑,东南大学宋爱国老师团队提供触觉融合方法相关支持,机器人7轴双臂为视源提供,力触觉末端抓夹为戴盟机器人提供,雷达传感器由承泰科技提供。

    11 

    我们对通用工业具身智能的判断

    过去的机器人智能,很多时候是在回答一个问题:机器人能不能完成某个动作?

    但工业机器人真正要回答的是另一个问题:机器人能不能在复杂、危险、不可完全结构化的环境中,稳定、安全、可恢复地完成一项作业?

    这要求系统同时具备四种能力:

  • 看懂现场;

  • 理解任务;

  • 生成动作;

  • 控制风险。

  • T-WAVES是我们对这个问题的第一版系统化回答。

    它不是终点,而是一个可以持续扩展的数据、模型和部署系统。随着更多作业视频、更多真机数据、更多UMI指尖力触数据和更多现场任务接入,T-WAVES将逐步从“会执行单个任务”走向“能迁移到一类任务”。

    我们的目标不是做一个只在实验室里漂亮演示的模型,而是让具身智能真正进入工业作业现场。

    从插枪、开柜门、按消控盘,到化工阀门、电力设备和危险环境操作,机器人需要的不只是大模型,而是一套能够被训练、被验证、被部署、被安全约束的完整系统。

    这就是T-WAVES——基于T-WM-VTLA-S技术架构构建的通用工业具身智能融合模型。

    项目地址:

    https://github.com/maryhh/T-WAVES.git

    部分开源数据:

    huggingface.co

    maryhh/umi_knob_lerobot_424_data


北京天创万安科技装备有限公司(TC-VIE)坐落于北京市北京经济技术开发区高新科技园区,服务于公共安全和生产安全领域,致力于先进安全装备的科技研发和生产制造,立志成为全球公共安全和生产安全行业的高科技装备制造标杆。

北京天创万安科技装备有限公司拥有一流的研发团队,其中硕士及以上学历研发人员达到35%,本科学历研发人员达到40%,公司与中国科技大学、中国矿业大学等单位合作,在煤矿安全装备、消防救援装备、特种安全装备、环保装备、石油、石化、电力等领域取得先成果,产品涉及环境参数检测及探测及采样类装备、生命探测仪类装备、特种机器人及模块装备、安保安全防范及抓捕类装备及器材、音视频记录取证类装备、无人机等十几个大类的研发。市场覆盖矿山企业、安监局、安保系统、消防部队、各级救援队、民政救灾、地震救援系统、国防系统、铁路系统、石油石化系统等多个领域。部分产品已出口到国外市场。

上市产品有矿用本安型平板计算机、矿用安标识别仪、本质安全型音视频记录仪、本质安全型红外测温仪、本质安全型红外热成像仪、单一气体测定器、多参数气体测定器、有毒有害气体检测仪、矿用本安型温湿度检测仪、本质安全型激光测距仪、便携式数字式粉尘测定仪、防爆粉尘采样器、矿用本安型数码相机、矿用本安型噪声检测仪、矿用本安型个人声暴露计、矿用通风多参数检测装置、矿用本安型激光指向仪、脉冲气压喷雾水枪、音频生命探测仪、视频生命探测仪、音视频生命探测仪、雷达生命探测仪、特种作业机器人、侦测无人机、安全监管移动手持终端、远距离灾区环境侦测系统、灾区无线音视频通讯装置、防爆探照灯、防爆对讲机、防爆型计时器、红外夜视仪、便携式烟气分析仪、矿用机械风速表等。

公司产品以每年30%的速度递增。

北京天创万安第一个研发出防爆型计时器的厂家;

北京天创万安第一个研发出超远距离遥控破胎器的厂家;

北京天创万安第一个研发出超级静音电钻的厂家;

北京天创万安第一个研发出超级穿墙雷达的厂家;

企业使命:让生命更安全 让生产更安全 让生活更安全

企业精神:质量第一  服务至上  真诚沟通  奉献社会

企业宗旨:为客户解决实际问题,以客户需求为导向

关注官方微信

手机扫码看新闻