EN
TR
CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification
Abstract
Skin cancer is one of the most prevalent and deadly malignancies, necessitating early and precise diagnosis to improve patient survival rates. While recent advancements in deep learning have produced robust computer-aided diagnosis (CAD) systems, the majority of these models rely exclusively on visual features extracted from dermoscopic or clinical images. Conversely, dermatologists synthesize visual cues with patient clinical metadata (e.g., age, gender, continuous bleeding, and itchiness) to reach an accurate diagnosis. Prior research attempting multimodal fusion has largely depended on black-box concatenation-based late-fusion strategies or simple neural compression modules, obscuring clinical reasoning. To bridge this gap toward Explainable Artificial Intelligence (XAI), we propose CrossMeta-ViT, a deep vision-transformer metadata-fusion framework designed for transparent skin lesion classification. The core contribution of this architecture is a Cross-Attention Fusion module. Instead of sequentially concatenating features, CrossMeta-ViT utilizes encoded patient tabular metadata as a Query (Q) to dynamically attend to visual image patches acting as Keys (K) and Values (V). This mechanism ensures that structural image features are selected and weighted under the direct guidance of the patient's clinical history. We evaluated the framework on the smartphone-captured PAD-UFES-20 dataset for binary classification (Benign vs. Malignant). Using 5-fold cross-validation, CrossMeta-ViT achieved a macro F1-score of 0.8723 ± 0.0009, malignant recall of 0.9927, specificity of 0.7651, and an AUC of 0.955, while the held-out single-split evaluation yielded an accuracy of 0.90. These results support the model as a recall-oriented and interpretable multimodal aid for telemedicine pre-triage rather than as a universally dominant classifier.
Keywords
Supporting Institution
This research received no specific grant from any funding agency in the public, commercial, or not-for-profit sectors.
Ethical Statement
Ethics committee approval and/or legal/special permission is not required for this study.
References
- A. Esteva, B. Kuprel, R. A. Novoa, J. Ko, S. M. Swetter, H. M. Blau, and S. Thrun, “Dermatologist-level classification of skin cancer with deep neural networks”, Nature 542 (2017) 115–118. Doi: 10.1038/nature21056.
- P. Tschandl, C. Rosendahl, and H. Kittler, “The HAM10000 dataset, a large collection of multi-source dermatoscopic images of common pigmented skin lesions”, Sci. Data 5 (2018) 180161. Doi: 10.1038/sdata.2018.161.
- S. Vachmanus, T. Noraset, W. Piyanonpong, T. Rattananukrom, and S. Tuarob, “DeepMetaForge: A Deep Vision-Transformer Metadata-Fusion Network for Automatic Skin Lesion Classification”, IEEE Access 11 (2023) 145467–145484. Doi: 10.1109/ACCESS.2023.3345225.
- I. Aruk, I. Pacal, and A. N. Toprak, “A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification”, Expert Syst. Appl. 283 (2025) 127721. Doi: 10.1016/j.eswa.2025.127721.
- A. Shaik, S. S. Dutta, I. M. Sawant, S. Kumar, A. Balasundaram, and K. De, “An attention based hybrid approach using CNN and BiLSTM for improved skin lesion classification”, Sci. Rep. 15 (2025) 15680. Doi: 10.1038/s41598-025-00025-2.
- Z. Li, S. Jiang, F. Xiang, C. Li, S. Li, T. Gao, K. He, J. Chen, J. Zhang, and J. Zhang, “White patchy skin lesion classification using feature enhancement and interaction transformer module”, Biomed. Signal Process. Control 107 (2025) 107819. Doi: 10.1016/j.bspc.2025.107819.
- H. Ghazouani, “Multi-residual attention network for skin lesion classification”, Biomed. Signal Process. Control 103 (2025) 107449. Doi: 10.1016/j.bspc.2024.107449.
- A. G. C. Pacheco and R. A. Krohling, “The impact of patient clinical information on automated skin cancer detection”, Comput. Biol. Med. 116 (2020) 103545. Doi: 10.1016/j.compbiomed.2019.103545.
Details
Primary Language
English
Subjects
Software Engineering (Other)
Journal Section
Research Article
Authors
Publication Date
August 31, 2026
Submission Date
April 17, 2026
Acceptance Date
May 19, 2026
Published in Issue
Year 2026 Volume: 4 Number: 2
APA
Erdem, M. (2026). CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification. Alpha Journal of Engineering and Applied Sciences, 4(2), 36-48. https://doi.org/10.70988/ajeas.1932654
AMA
1.Erdem M. CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification. AJEAS. 2026;4(2):36-48. doi:10.70988/ajeas.1932654
Chicago
Erdem, Muhammetalp. 2026. “CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification”. Alpha Journal of Engineering and Applied Sciences 4 (2): 36-48. https://doi.org/10.70988/ajeas.1932654.
EndNote
Erdem M (August 1, 2026) CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification. Alpha Journal of Engineering and Applied Sciences 4 2 36–48.
IEEE
[1]M. Erdem, “CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification”, AJEAS, vol. 4, no. 2, pp. 36–48, Aug. 2026, doi: 10.70988/ajeas.1932654.
ISNAD
Erdem, Muhammetalp. “CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification”. Alpha Journal of Engineering and Applied Sciences 4/2 (August 1, 2026): 36-48. https://doi.org/10.70988/ajeas.1932654.
JAMA
1.Erdem M. CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification. AJEAS. 2026;4:36–48.
MLA
Erdem, Muhammetalp. “CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification”. Alpha Journal of Engineering and Applied Sciences, vol. 4, no. 2, Aug. 2026, pp. 36-48, doi:10.70988/ajeas.1932654.
Vancouver
1.Muhammetalp Erdem. CrossMeta-ViT: Concomitant Cross-Attention Guided Multimodal Fusion for Skin Lesion Classification. AJEAS. 2026 Aug. 1;4(2):36-48. doi:10.70988/ajeas.1932654
