Researchers from Northwest University and the Chinese Academy of Sciences have introduced Structured-Condensed Prompt Tuning (SCPT), an architectural optimization for vision-language models. The method employs semantic relation encoding and a condensation loss to improve fine-grained image recognition, demonstrating improved results on 14 benchmark datasets.