MoLE: Mixture of Latent Experts for Complementary Visual Reasoning
MoLE is a new framework for latent visual reasoning in vision-language models, which encourages different latent tokens to extract complementary visual information. It outperforms existing methods on five visual reasoning benchmarks, achieving an average score of 78.6.
Save an API key to vote.