VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lv, Chaoyue Niu, Fan Wu arXiv ↗ PDF ↗
VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation Juhye Park, Wooju Lee, Dasol Hong, Changki Sung, Youngwoo Seo, Dongwan Kang, Hyun Myung arXiv ↗ PDF ↗
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment Ziheng Jia, Linhan Cao, Jinliang Han, Zicheng Zhang, Jiaying Qian, Jiarui Wang, Zijian Chen, Guangtao Zhai, Xiongkuo Min arXiv ↗ PDF ↗
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin arXiv ↗ PDF ↗
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation Walid Bousselham, Hilde Kuehne, Cordelia Schmid arXiv ↗ PDF ↗
VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo arXiv ↗ PDF ↗
Variational Graph-based Normal Integration Lixiong Chen, Bohan Yu, Victor Adrian Prisacariu, Imari Sato PDF ↗
VecGlypher: Unified Vector Glyph Generation with Language Models Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han arXiv ↗ PDF ↗
Velox: Learning Representations of 4D Geometry and Appearance Anagh Malik, Dorian Chan, Xiaoming Zhao, David B. Lindell, Oncel Tuzel, Jen-Hao Rick Chang arXiv ↗ PDF ↗
Verifying Neural Network Robustness with Dual Perturbations Hai Duong, Lam Nguyen, Thanh Le, ThanhVu Nguyen PDF ↗
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu arXiv ↗ PDF ↗
ViTPrompt: Training-Free Prompt Refinement with Visual Tokens for Open-Vocabulary Detection Yitong Qin, Lihua Zhou, Jiwei Wei, Ran Ran, Shiyuan He, Zeyu Ma, Shuaifeng Li, Nianxin Li, Heng Tao Shen PDF ↗
VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv arXiv ↗ PDF ↗
VideoCoF: Unified Video Editing with Temporal Reasoner Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu arXiv ↗ PDF ↗
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu arXiv ↗ PDF ↗
Virtual Nodes Guided Dynamic Graph Neural Network for Brain Tumor Segmentation with Missing Modalities Sha Tao, Jiao Pan, Yu Guo, Chao Yao arXiv ↗ PDF ↗
VisPlay: Self-Evolving Vision-Language Models Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, Yonghui Yang arXiv ↗ PDF ↗
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang arXiv ↗ PDF ↗
Vision-Oriented Lightweight Neural Architecture Search with Budget-Adaptive Evaluation Yi Fan, Yu-Bin Yang PDF ↗
Vista4D: Video Reshooting with 4D Point Clouds Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca, Yash Kant, Ryan Burgert, Yuancheng Xu, Koichi Namekata, Yiwei Zhao, Bolei Zhou, Micah Goldblum, Paul Debevec, Ning Yu arXiv ↗ PDF ↗
Visual Diffusion Models are Geometric Solvers Nir Goren, Shai Yehezkel, Omer Dahary, Andrey Voynov, Or Patashnik, Daniel Cohen-Or arXiv ↗ PDF ↗
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling Xinlei Yu, Chengming Xu, Zhangquan Chen, Yudong Zhang, Shilin Lu, Cheng Yang, Jiangning Zhang, Shuicheng Yan, Xiaobin Hu arXiv ↗ PDF ↗
Vocabulary Scaling Law: Tuning Open-vocabulary Predictors for Their Openness Ziliang Chen, Yulu Li, Liangda Fang, Jusheng Zhang, Yongsen Zheng, Quanlong Guan, Xipeng Chen PDF ↗
VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation Maximilian Rokuss, Moritz Langenberg, Yannick Kirchhoff, Fabian Isensee, Benjamin Hamm, Constantin Ulrich, Sebastian Regnery, Lukas Bauer, Efthimios Katsigiannopulos, Tobias Norajitra, Klaus Maier-Hein arXiv ↗ PDF ↗
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang arXiv ↗ PDF ↗
WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery Chandrakanth Gudavalli, Tajuddin Manhar Mohammed, Abhay Yadav, Ananth Vishnu Bhaskar, Hardik Prajapati, Cheng Peng, Rama Chellappa, Shivkumar Chandrasekaran, B.S. Manjunath arXiv ↗ PDF ↗
WaDi: Weight Direction-aware Distillation for One-step Image Synthesis Lei Wang, Yang Cheng, Senmao Li, Ge Wu, Yaxing Wang, Jian Yang arXiv ↗ PDF ↗
Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI Xinhao Liu, Jiaqi Li, Youming Deng, Ruxin Chen, Yingjia Zhang, Yifei Ma, Li Guo, Yiming Li, Jing Zhang, Chen Feng arXiv ↗ PDF ↗
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng arXiv ↗ PDF ↗
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha arXiv ↗ PDF ↗
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen arXiv ↗ PDF ↗
What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models Pascal Chang, Kai Lascheit, Jingwei Tang, Markus Gross, Vinicius C. Azevedo PDF ↗
What Is the Optimal Ranking Score Between Precision and Recall? We Can Always Find It and It Is Rarely F1 Sébastien Piérard, Adrien Deliège, Marc Van Droogenbroeck PDF ↗
When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng arXiv ↗ PDF ↗
When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models Junrong Lian, Weijian Deng, Pengxu Wei, Yaqin Chen, Qixiang Ye, Liang Lin PDF ↗
When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators Krzysztof Adamkiewicz, Brian B. Moser, Stanislav Frolov, Tobias Christian Nauen, Federico Raue, Andreas Dengel PDF ↗
When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection Qiang Qi, Xiao Wang, Zongyuan Du, Yu Zhang PDF ↗
When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang arXiv ↗ PDF ↗
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Ma Jun, Jie Yu PDF ↗
White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation Shuwei Li, Lei Tan, Robby T. Tan arXiv ↗ PDF ↗
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition Shan Ning, Longtian Qiu, Jiaxuan Sun, Xuming He arXiv ↗ PDF ↗
WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu arXiv ↗ PDF ↗
Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting Nan Li, Yike Zeng, Qian Zhang, Qi Zhang, Zhiyi Pan, Wei Feng, Liang Wan PDF ↗
X-band Radar Non-Line-of-Sight Imaging Dongyu Du, Mingkun Zhao, Yutong Yang, Dominik Scheuble, Xiaolong Huang, Zijian Shao, Mario Bijelic, Kaushik Sengupta, Felix Heide PDF ↗
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal Chenyang Wu, Lina Lei, Fan Li, Chunle Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Mingming Cheng, Chongyi Li arXiv ↗ PDF ↗
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong arXiv ↗ PDF ↗
Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation Xiaole Zhao, Qingsong Pang, Xiaobo Zhang, Xun Xu, Xun Gong, Yan Yang, Tianrui Li PDF ↗
ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training Haian Jin, Rundi Wu, Tianyuan Zhang, Ruiqi Gao, Jonathan T. Barron, Noah Snavely, Aleksander Hołyński arXiv ↗ PDF ↗