Computer ScienceEngineering

Hu Lu, Tingting Qin, Yuxin Li, Zhansheng Liu, Yingquan Wang, Shengli Wu, Shaohua Wan

2026.1.1IEEE MULTIMEDIA

DOI: 10.1109/mmul.2026.3652838

Abstract

Visible-infrared person re-identification aims to match pedestrian images across modalities, requiring the simultaneous handling of intra- and cross-modality discrepancies. Existing dual-stream networks extract modality-specific features but often suffer from over-coupling and insufficient shared identity modeling. Simple feature fusion strategies do not adequately address the modality gap. We propose a Vision Transformer-based deep learning framework, termed Transformer-based decoupled modality feature learning, which effectively learns both modality-specific and modality-shared features while leveraging modality-invariant identity information to decouple different modality representations. Specifically, we first introduce an identity-modality decoupling learning strategy to facilitate learning with reliable modality-shared features while preserving essential modality-specific information. Additionally, we design a novel identity-modality aggregation loss function that efficiently integrates modality-specific and modality-shared features, assisting the model in learning more modality-invariant representations from both identity consistency and modality adaptation perspectives. Extensive experiments on the SYSUMM01, RegDB, and low-light cross-modality datasets demonstrate that our method significantly outperforms existing state-of-the-art approaches.

Citation format

LU, Hu, et al. Transformer-based decoupled modality feature learning for visible-infrared person re-identification. IEEE MULTIMEDIA, 2026, 33(1): 47–59.