HandTouch & HTBench:Ego视角统一触觉表征与评测
在具身智能不断走向真实物理交互的过程中,触觉感知正在成为继视觉之后另一条关键的信息通道。
然而,与视觉领域已经形成相对统一的数据体系与评测范式不同,触觉学习仍然长期处于分散状态。其中,不同硬件、不同任务、不同数据协议彼此割裂,使得模型难以在跨场景、跨设备条件下形成稳定的通用表示能力,这使得我们很难回答一个核心问题——什么样的触觉表征,才具备跨任务、跨场景、跨形态的通用能力?
但是,现阶段想要建立一个能够完全解决所有传感器和具体化差异的通用基准目前并不现实。我们没有想一步到位直接建立这样的通用基准,而是探索了一个可扩展且前景广阔的未来发展方向:将第一人称视角视觉与全手触觉数据相结合,这也是具身智能未来最有前景的技术路线之一,并向此做出第一步尝试。
基于这个愿景,我们团队提出了一个面向灵巧手触觉感知的统一评测和框架:

该工作围绕“统一评测 + 统一表征”两条主线,构建了大规模触觉基准 HT-Bench,并提出 HandTouch 视觉-触觉统一编码模型,在多任务、多场景与 OOD 泛化上实现系统性提升。

触觉学习为何难以“通用化”
当前触觉学习主要面临三类结构性瓶颈:
(1)数据与传感器高度碎片化:不同触觉设备(手指阵列、全手触觉、软体触觉)分布不一致,导致模型难以共享表示空间。
(2)任务定义彼此割裂:多数方法仅针对单一任务(抓取分类 / 接触预测 / 重建),缺乏统一评测协议。
(3)缺少 OOD(分布外)系统评估:模型往往只在“见过的物体/场景”中表现良好,无法验证真实泛化能力。
因此,一个核心缺口逐渐显现:是否存在一种“统一触觉表征”,可以同时支持结构理解、跨模态对齐与时序预测?
HT-Bench
“首个面向灵巧全手触觉的多任务多场景统一评测基准”
为解决触觉领域评测标准不统一的问题,我们构建了HT-Bench,一个面向灵巧全手触觉感知的大规模多任务评测基准。
该数据集包含超过一千万帧RGB视觉数据与七百八十万帧触觉数据,覆盖多种真实机器人交互场景,并额外设计了基于场景划分的Out-of-Distribution测试集,用于评估模型在未见任务中的泛化能力。
在任务设计上,HT-Bench并不依赖单一评价指标,而是从四个互补维度系统评估触觉表征能力,包括结构检索、触觉补全、视觉到触觉生成以及时序触觉预测。这些任务分别对应结构一致性、局部恢复能力、跨模态推断能力以及动态建模能力,从而形成一个更接近真实机器人操作需求的评测体系。

HandTouch
“统一触觉表征学习框架”
基于HT-Bench,我们进一步提出HandTouch,一种面向灵巧手触觉感知的统一表示学习框架。
该方法的核心目标是将连续且异构的触觉信号映射到一个共享的离散表示空间,从而实现跨设备与跨任务的统一建模能力。
整体方法采用三阶段训练策略逐步学习触觉表征。
- 在第一阶段,模型通过Self-attention Transformer与向量量化机制对触觉信号进行建模,将连续触觉数据离散化为token表示,从而学习触觉的空间拓扑结构,使不同来源的触觉数据能够进入统一的表示空间。
- 在第二阶段,引入视觉信息作为跨模态条件,通过mask重建任务学习视觉引导下的触觉补全能力。视觉特征通过cross-attention机制注入触觉重建过程,使模型能够在部分触觉缺失的情况下,利用视觉语义信息恢复接触结构,从而提升跨模态对齐能力。
- 在第三阶段,引入时间建模机制,使模型能够基于历史视觉与触觉序列预测当前及未来的触觉状态,从静态感知扩展到动态交互建模,实现对接触演化过程的学习。

实验结果:跨任务与OOD泛化能力验证
在HT-Bench上,我们对HandTouch进行了系统评估,并与CNN、ResNet、VAE以及ViT等常见触觉编码方法(在VTLA相关模型基础被用作触觉编码器)进行了对比实验。
实验结果表明,HandTouch在多个任务上均取得稳定提升。在结构检索任务中,模型Recall@5从74.65%提升至85.23%,显示出更强的触觉结构表征能力。在触觉补全任务中,RMSE显著降低至0.010,同时结构一致性指标cIoU提升至0.911,优于所有基线方法。在视觉到触觉生成任务中,模型在Out-of-Distribution场景下仍保持较高性能,cIoU提升至0.705,体现出较强的跨模态泛化能力。
整体来看,HandTouch在结构理解、跨模态对齐以及OOD泛化能力上均表现出稳定优势。

从“任务驱动”走向“表征统一”

HandTouch 的核心意义不在于单一任务的性能提升,而在于尝试回答一个更基础的问题:在灵巧手触觉感知中,是否存在一个可以跨任务、跨场景、跨硬件共享的统一表征空间。
围绕这一问题,HT-Bench 提供了系统化的评测基准,使不同方法能够在统一数据与任务体系下进行比较;HandTouch 则通过三阶段学习范式(结构建模、跨模态对齐与时序预测),探索了一种面向统一触觉表示的可行路径。
具体而言,模型通过离散化表示将异构触觉信号映射到统一空间,实现结构层面的对齐;通过引入视觉信息作为跨模态锚点,增强对缺失触觉信息的补全能力;并通过时间建模扩展对交互过程的动态理解能力。
整体来看,该工作指向一个更长期的目标:构建可共享、可迁移的触觉表征空间,使灵巧手具备更稳定的物理感知基础。未来,这一方向有望进一步扩展至更复杂的灵巧操作任务、更长时序真实交互、多机器人形态统一表示,以及与VLA与世界模型的深度融合。
原文链接
https://arxiv.org/pdf/2606.19161v1
引用
如果在研究或工程中使用本工作,请引用如下:
@article{huang2026htbench,
author = {Yuzhe Huang and Jiaping Wu and Jiaming Jiang and Hezhe Lin and Aikebaier Aierken and Yunlong Wang and Kun Cheng and Ziyuan Jiao and Yuanxin Zhong},
title = {HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision},
year = {2026},
howpublished = {arXiv preprint arXiv:2606.19161},
note = {HandTouch: A vector-quantized vision-tactile encoder for unified tactile representation learning}
}
