CCF-A · IEEE/CVF Conference on Computer Vision and Pattern Recognition

CVPR 2026

Jun 3–7, 2026 · Denver, Colorado, United States · 850 papers · official site ↗

Posters 850 · page 5 of 5

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement
Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lv, Chaoyue Niu, Fan Wu arXiv ↗ PDF ↗
VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation
Juhye Park, Wooju Lee, Dasol Hong, Changki Sung, Youngwoo Seo, Dongwan Kang, Hyun Myung arXiv ↗ PDF ↗
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
Ziheng Jia, Linhan Cao, Jinliang Han, Zicheng Zhang, Jiaying Qian, Jiarui Wang, Zijian Chen, Guangtao Zhai, Xiongkuo Min arXiv ↗ PDF ↗
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin arXiv ↗ PDF ↗
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
Walid Bousselham, Hilde Kuehne, Cordelia Schmid arXiv ↗ PDF ↗
VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo arXiv ↗ PDF ↗
Variational Graph-based Normal Integration
Lixiong Chen, Bohan Yu, Victor Adrian Prisacariu, Imari Sato PDF ↗
VecGlypher: Unified Vector Glyph Generation with Language Models
Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han arXiv ↗ PDF ↗
Velox: Learning Representations of 4D Geometry and Appearance
Anagh Malik, Dorian Chan, Xiaoming Zhao, David B. Lindell, Oncel Tuzel, Jen-Hao Rick Chang arXiv ↗ PDF ↗
Verifying Neural Network Robustness with Dual Perturbations
Hai Duong, Lam Nguyen, Thanh Le, ThanhVu Nguyen PDF ↗
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control
Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu arXiv ↗ PDF ↗
ViTPrompt: Training-Free Prompt Refinement with Visual Tokens for Open-Vocabulary Detection
Yitong Qin, Lihua Zhou, Jiwei Wei, Ran Ran, Shiyuan He, Zeyu Ma, Shuaifeng Li, Nianxin Li, Heng Tao Shen PDF ↗
VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations
Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv arXiv ↗ PDF ↗
VideoCoF: Unified Video Editing with Temporal Reasoner
Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu arXiv ↗ PDF ↗
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu arXiv ↗ PDF ↗
Virtual Nodes Guided Dynamic Graph Neural Network for Brain Tumor Segmentation with Missing Modalities
Sha Tao, Jiao Pan, Yu Guo, Chao Yao arXiv ↗ PDF ↗
VisPlay: Self-Evolving Vision-Language Models
Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, Yonghui Yang arXiv ↗ PDF ↗
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models
Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang arXiv ↗ PDF ↗
Vision-Oriented Lightweight Neural Architecture Search with Budget-Adaptive Evaluation
Yi Fan, Yu-Bin Yang PDF ↗
Vista4D: Video Reshooting with 4D Point Clouds
Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca, Yash Kant, Ryan Burgert, Yuancheng Xu, Koichi Namekata, Yiwei Zhao, Bolei Zhou, Micah Goldblum, Paul Debevec, Ning Yu arXiv ↗ PDF ↗
Visual Diffusion Models are Geometric Solvers
Nir Goren, Shai Yehezkel, Omer Dahary, Andrey Voynov, Or Patashnik, Daniel Cohen-Or arXiv ↗ PDF ↗
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
Xinlei Yu, Chengming Xu, Zhangquan Chen, Yudong Zhang, Shilin Lu, Cheng Yang, Jiangning Zhang, Shuicheng Yan, Xiaobin Hu arXiv ↗ PDF ↗
Vocabulary Scaling Law: Tuning Open-vocabulary Predictors for Their Openness
Ziliang Chen, Yulu Li, Liangda Fang, Jusheng Zhang, Yongsen Zheng, Quanlong Guan, Xipeng Chen PDF ↗
VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation
Maximilian Rokuss, Moritz Langenberg, Yannick Kirchhoff, Fabian Isensee, Benjamin Hamm, Constantin Ulrich, Sebastian Regnery, Lukas Bauer, Efthimios Katsigiannopulos, Tobias Norajitra, Klaus Maier-Hein arXiv ↗ PDF ↗
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang arXiv ↗ PDF ↗
WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery
Chandrakanth Gudavalli, Tajuddin Manhar Mohammed, Abhay Yadav, Ananth Vishnu Bhaskar, Hardik Prajapati, Cheng Peng, Rama Chellappa, Shivkumar Chandrasekaran, B.S. Manjunath arXiv ↗ PDF ↗
WaDi: Weight Direction-aware Distillation for One-step Image Synthesis
Lei Wang, Yang Cheng, Senmao Li, Ge Wu, Yaxing Wang, Jian Yang arXiv ↗ PDF ↗
Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI
Xinhao Liu, Jiaqi Li, Youming Deng, Ruxin Chen, Yingjia Zhang, Yifei Ma, Li Guo, Yiming Li, Jing Zhang, Chen Feng arXiv ↗ PDF ↗
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng arXiv ↗ PDF ↗
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha arXiv ↗ PDF ↗
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen arXiv ↗ PDF ↗
What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models
Pascal Chang, Kai Lascheit, Jingwei Tang, Markus Gross, Vinicius C. Azevedo PDF ↗
What Is the Optimal Ranking Score Between Precision and Recall? We Can Always Find It and It Is Rarely F1
Sébastien Piérard, Adrien Deliège, Marc Van Droogenbroeck PDF ↗
When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters
Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng arXiv ↗ PDF ↗
When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models
Junrong Lian, Weijian Deng, Pengxu Wei, Yaqin Chen, Qixiang Ye, Liang Lin PDF ↗
When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators
Krzysztof Adamkiewicz, Brian B. Moser, Stanislav Frolov, Tobias Christian Nauen, Federico Raue, Andreas Dengel PDF ↗
When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection
Qiang Qi, Xiao Wang, Zongyuan Du, Yu Zhang PDF ↗
When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm
Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang arXiv ↗ PDF ↗
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Ma Jun, Jie Yu PDF ↗
White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation
Shuwei Li, Lei Tan, Robby T. Tan arXiv ↗ PDF ↗
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition
Shan Ning, Longtian Qiu, Jiaxuan Sun, Xuming He arXiv ↗ PDF ↗
WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering
Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu arXiv ↗ PDF ↗
WonderZoom: Multi-Scale 3D World Generation
Jin Cao, Hong-Xing Yu, Jiajun Wu arXiv ↗ PDF ↗
Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting
Nan Li, Yike Zeng, Qian Zhang, Qi Zhang, Zhiyi Pan, Wei Feng, Liang Wan PDF ↗
X-band Radar Non-Line-of-Sight Imaging
Dongyu Du, Mingkun Zhao, Yutong Yang, Dominik Scheuble, Xiaolong Huang, Zijian Shao, Mario Bijelic, Kaushik Sengupta, Felix Heide PDF ↗
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
Chenyang Wu, Lina Lei, Fan Li, Chunle Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Mingming Cheng, Chongyi Li arXiv ↗ PDF ↗
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong arXiv ↗ PDF ↗
Zero-Shot Depth Completion with Vision-Language Model
Zhiqiang Yan, Yuan Wu, Gim Hee Lee PDF ↗
Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation
Xiaole Zhao, Qingsong Pang, Xiaobo Zhang, Xun Xu, Xun Gong, Yan Yang, Tianrui Li PDF ↗
ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training
Haian Jin, Rundi Wu, Tianyuan Zhang, Ruiqi Gao, Jonathan T. Barron, Noah Snavely, Aleksander Hołyński arXiv ↗ PDF ↗