Zhang, Haibin, Zou, Minghao, Rosin, Paul ORCID: https://orcid.org/0000-0002-4965-3884, Liu, Hantao ORCID: https://orcid.org/0000-0003-4544-3481 and Zhou, Wei
2026.
Cross-modal interaction for multi-dimensional AI-generated image quality assessment.
Presented at: 2026 18th International Conference on Quality of Multimedia Experience (QoMEX),
Cardiff, UK,
29 June 2026 - 03 July 2026.
2026 18th International Conference on Quality of Multimedia Experience (QoMEX).
IEEE,
10.1109/qomex69967.2026.11618318
|
Abstract
While AI-generated content has advanced rapidly, assessing the quality of AI-generated images (AGIs) remains challenging. Existing methods often separately evaluate perceptual quality, semantic alignment, and authenticity, overlooking their intrinsic correlations. Moreover, most CLIP-based approaches rely on global similarity between independently encoded features, limiting fine-grained vision-language interactions. To address this, we propose a cross-modal interaction framework for multidimensional AI-generated image quality assessment (CMIQA). Specifically, a bidirectional cross-modal interaction and fusion module improves fine-grained alignment by enabling bidirectional interactions between visual regions and textual semantics, while a consistency-aware loss weighting module adaptively adjusts the importance of different quality objectives based on the reliability of perceptual quality prediction. Experimental results demonstrate that our method achieves competitive performance on two public datasets.
| Item Type: | Conference or Workshop Item - published (Paper) |
|---|---|
| Date Type: | Publication |
| Status: | Published |
| Schools: | Schools > Computational & Mathematical Sciences Schools > Computer Science & Informatics |
| Publisher: | IEEE |
| ISBN: | 979-8-3195-0033-5 |
| ISSN: | 2372-7179 |
| Last Modified: | 10 Aug 2026 13:45 |
| URI: | https://orca.cardiff.ac.uk/id/eprint/188831 |
Actions (repository staff only)
![]() |
Edit Item |





Altmetric
Altmetric