[MM] LaViT: UNIFIED LANGUAGE-VISION PRETRAINING IN LLM WITH DYNAMIC DISCRETE VISUAL TOKENIZATION
[MM] LaViT: UNIFIED LANGUAGE-VISION PRETRAINING IN LLM WITH DYNAMIC DISCRETE VISUAL TOKENIZATION
[MM] LaViT: UNIFIED LANGUAGE-VISION PRETRAINING IN LLM WITH DYNAMIC DISCRETE VISUAL TOKENIZATION
[MM] Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
[MM] InternVL-1.5: How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
[VTG] HPCVTG: Toward Human Perception-Centric Video Thumbnail Generation
[LG] PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM