CLIP-Llama: A New Approach for Scene Text Recognition with a Pre-Trained Vision-Language Model and a Pre-Trained Language Model

This study focuses on Scene Text Recognition (STR), which plays a crucial role in various applications of artificial intelligence such as image retrieval, office automation, and intelligent transportation systems. Currently, pre-trained vision-language models have become the foundation for various d...

Full description

Saved in:

Bibliographic Details
Main Authors:	Xiaoqing Zhao, Miaomiao Xu, Wushour Silamu, Yanbing Li
Format:	Article
Language:	English
Published:	MDPI AG 2024-11-01
Series:	Sensors
Subjects:	scene text recognition vision-language model pre-trained language model
Online Access:	https://www.mdpi.com/1424-8220/24/22/7371
Tags:	Add Tag No Tags, Be the first to tag this record!

Internet

https://www.mdpi.com/1424-8220/24/22/7371

CLIP-Llama: A New Approach for Scene Text Recognition with a Pre-Trained Vision-Language Model and a Pre-Trained Language Model

Internet

Similar Items