Researchers from Alibaba Group and several universities have introduced Pixel Linguist II, a vision encoder that processes text directly in pixel space using native-resolution encoding. The model demonstrates state-of-the-art performance on visual document retrieval and semantic similarity tasks while maintaining robustness under significant visual token compression.