Tagged articles

visual encoder

2 articles · Page 1 of 1
Machine Heart
Machine Heart
Jul 26, 2026 · Artificial Intelligence

From Compression to Memory MonkeyOCRv2 Reconstruction Preserves Document Evidence

MonkeyOCRv2 demonstrates that a visual encoder’s ability to reconstruct pixel‑level document images—acting as visual memory—significantly boosts OCR and broader document AI benchmarks, with controlled experiments showing a 13.2‑point gain, cross‑task improvements, and the release of a 1.13‑billion‑image public dataset.

Document AIOCRbenchmark
0 likes · 17 min read
From Compression to Memory MonkeyOCRv2 Reconstruction Preserves Document Evidence
NewBeeNLP
NewBeeNLP
Dec 2, 2024 · Artificial Intelligence

What Are Today’s Unified Generation-and-Understanding Multimodal Model Architectures?

This article surveys current unified generation-and-understanding multimodal large-model architectures, compares LLM-centric and LLM-plus-diffusion designs, extracts common insights, details large-scale training tricks from models like Emu3, Chameleon and Janus, and outlines open research directions for visual encoders.

Large Language Modelsdiffusionmultimodal
0 likes · 5 min read
What Are Today’s Unified Generation-and-Understanding Multimodal Model Architectures?