Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

Scholar
Read Paper

Paper coming soon. Check back or search on Google Scholar.

Search on Scholar →

Abstract

Preprint: We decouple token compression from routing in multi-modal systems, improving processing speeds by up to 30%.

Type Preprint
Venue NeurIPS 2026 (Under Review)
Date Jan 2026
LLMs Token Compression Efficiency