Aligning Vision Language Models via anchor

Scholar
Read Paper

Paper coming soon. Check back or search on Google Scholar.

Search on Scholar →

Abstract

Preprint: Aligning visual tokens with semantic text anchors to enhance multi-modal reasoning capabilities.

Type Preprint
Venue NeurIPS 2026 (Under Review)
Date Jan 2026
Computer Vision Multi-Modal AI Alignment