Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks Haijin Zeng, Xiangming Wang, Yongyong Chen, Jingyong Su, Jie Liu arXiv ↗ PDF ↗
Vision-Language Model IP Protection via Prompt-based Learning Lianyu Wang, Meng Wang, Huazhu Fu, Daoqiang Zhang arXiv ↗ PDF ↗
Vision-Language Models Do Not Understand Negation Kumail Alhamoud, Shaden Alshammari, Yonglong Tian, Guohao Li, Philip H.S. Torr, Yoon Kim, Marzyeh Ghassemi arXiv ↗ PDF ↗
VisionArena: 230k Real World User-VLM Conversations with Preference Labels Christopher Chou, Lisa Dunlap, Koki Mashita, Krishna Mandal, Trevor Darrell, Ion Stoica, Joseph E. Gonzalez, Wei-Lin Chiang arXiv ↗ PDF ↗
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving Haiming Zhang, Wending Zhou, Yiyao Zhu, Xu Yan, Jiantao Gao, Dongfeng Bai, Yingjie Cai, Bingbing Liu, Shuguang Cui, Zhen Li arXiv ↗ PDF ↗
VisionZip: Longer is Better but Not Necessary in Vision Language Models Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia arXiv ↗ PDF ↗
Visual Agentic AI for Spatial Reasoning with a Dynamic API Damiano Marsili, Rohun Agrawal, Yisong Yue, Georgia Gkioxari arXiv ↗ PDF ↗
Visual Consensus Prompting for Co-Salient Object Detection Jie Wang, Nana Yu, Zihao Zhang, Yahong Han arXiv ↗ PDF ↗
Visual Lexicon: Rich Image Features in Language Space XuDong Wang, Xingyi Zhou, Alireza Fathi, Trevor Darrell, Cordelia Schmid arXiv ↗ PDF ↗
Visual Persona: Foundation Model for Full-Body Human Customization Jisu Nam, Soowon Son, Zhan Xu, Jing Shi, Difan Liu, Feng Liu, Seungryong Kim, Yang Zhou arXiv ↗ PDF ↗
Visual Prompting for One-shot Controllable Video Editing without Inversion Zhengbo Zhang, Yuxi Zhou, Duo Peng, Joo-Hwee Lim, Zhigang Tu, De Wen Soh, Lin Geng Foo arXiv ↗ PDF ↗
Visual and Semantic Prompt Collaboration for Generalized Zero-Shot Learning Huajie Jiang, Zhengxian Li, Xiaohan Yu, Yongli Hu, Baocai Yin, Jian Yang, Yuankai Qi arXiv ↗ PDF ↗
Visual-Instructed Degradation Diffusion for All-in-One Image Restoration Wenyang Luo, Haina Qin, Zewen Chen, Libin Wang, Dandan Zheng, Yuming Li, Yufan Liu, Bing Li, Weiming Hu arXiv ↗ PDF ↗
VladVA: Discriminative Fine-tuning of LVLMs Yassine Ouali, Adrian Bulat, Alexandros Xenos, Anestis Zaganidis, Ioannis Maniadis Metaxas, Brais Martinez, Georgios Tzimiropoulos arXiv ↗ PDF ↗
VoCo-LLaMA: Towards Vision Compression with Large Language Models Xubing Ye, Yukang Gan, Xiaoke Huang, Yixiao Ge, Yansong Tang PDF ↗
VolFormer: Explore More Comprehensive Cube Interaction for Hyperspectral Image Restoration and Beyond Dabing Yu, Zheng Gao PDF ↗
Volumetric Surfaces: Representing Fuzzy Geometries with Layered Meshes Stefano Esposito, Anpei Chen, Christian Reiser, Samuel Rota Bulò, Lorenzo Porzi, Katja Schwarz, Christian Richardt, Michael Zollhöfer, Peter Kontschieder, Andreas Geiger arXiv ↗ PDF ↗
VoteFlow: Enforcing Local Rigidity in Self-Supervised Scene Flow Yancong Lin, Shiming Wang, Liangliang Nan, Julian Kooij, Holger Caesar arXiv ↗ PDF ↗
VoxelSplat: Dynamic Gaussian Splatting as an Effective Loss for Occupancy and Flow Prediction Ziyue Zhu, Shenlong Wang, Jin Xie, Jiang-jiang Liu, Jingdong Wang, Jian Yang arXiv ↗ PDF ↗
WAVE: Weight Templates for Adaptive Initialization of Variable-sized Models Fu Feng, Yucheng Xie, Jing Wang, Xin Geng arXiv ↗ PDF ↗
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model Zongjian Li, Bin Lin, Yang Ye, Liuhan Chen, Xinhua Cheng, Shenghai Yuan, Li Yuan PDF ↗
WISE: A Framework for Gigapixel Whole-Slide-Image Lossless Compression Yu Mao, Jun Wang, Nan Guan, Chun Jason Xue arXiv ↗ PDF ↗
WISNet: Pseudo Label Generation on Unbalanced and Patch Annotated Waste Images Shifan Zhang, Hongzi Zhu, Yinan He, Minyi Guo, Ziyang Lou, Shan Chang PDF ↗
Watermarking One for All: A Robust Watermarking Scheme Against Partial Image Theft Gaozhi Liu, Silu Cao, Zhenxing Qian, Xinpeng Zhang, Sheng Li, Wanli Peng PDF ↗
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation Hao Li, Ju Dai, Xin Zhao, Feng Zhou, Junjun Pan, Lei Li arXiv ↗ PDF ↗
Wavelet and Prototype Augmented Query-based Transformer for Pixel-level Surface Defect Detection Feng Yan, Xiaoheng Jiang, Yang Lu, Jiale Cao, Dong Chen, Mingliang Xu PDF ↗
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat Zhipeng Huang, Shaobin Zhuang, Canmiao Fu, Binxin Yang, Ying Zhang, Chong Sun, Zhizheng Zhang, Yali Wang, Chen Li, Zheng-Jun Zha arXiv ↗ PDF ↗
WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and Segmentation Silin Cheng, Yang Liu, Xinwei He, Sebastien Ourselin, Lei Tan, Gen Luo arXiv ↗ PDF ↗
Weakly Supervised Contrastive Adversarial Training for Learning Robust Features from Semi-supervised Data Lilin Zhang, Chengpei Wu, Ning Yang arXiv ↗ PDF ↗
Weakly Supervised Semantic Segmentation via Progressive Confidence Region Expansion Xiangfeng Xu, Pinyi Zhang, Wenxuan Huang, Yunhang Shen, Haosheng Chen, Jingzhong Lin, Wei Li, Gaoqi He, Jiao Xie, Shaohui Lin PDF ↗
Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models Quan Zhang, Jinwei Fang, Rui Yuan, Xi Tang, Yuxin Qi, Ke Zhang, Chun Yuan arXiv ↗ PDF ↗
WeatherGen: A Unified Diverse Weather Generator for LiDAR Point Clouds via Spider Mamba Diffusion Yang Wu, Yun Zhu, Kaihua Zhang, Jianjun Qian, Jin Xie, Jian Yang arXiv ↗ PDF ↗
What's in the Image? A Deep-Dive into the Vision of Vision Language Models Omri Kaduri, Shai Bagon, Tali Dekel PDF ↗
When Domain Generalization meets Generalized Category Discovery: An Adaptive Task-Arithmetic Driven Approach Vaibhav Rathore, Shubhranil B, Saikat Dutta, Sarthak Mehrotra, Zsolt Kira, Biplab Banerjee arXiv ↗ PDF ↗
When the Future Becomes the Past: Taming Temporal Correspondence for Self-supervised Video Representation Learning Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Qingming Huang arXiv ↗ PDF ↗
Where the Devil Hides: Deepfake Detectors Can No Longer Be Trusted Shuaiwei Yuan, Junyu Dong, Yuezun Li arXiv ↗ PDF ↗
Where's the Liability in the Generative Era? Recovery-based Black-Box Detection of AI-Generated Content Haoyue Bai, Yiyou Sun, Wei Cheng, Haifeng Chen PDF ↗
WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild Rolandos Alexandros Potamias, Jinglei Zhang, Jiankang Deng, Stefanos Zafeiriou arXiv ↗ PDF ↗
WildAvatar: Learning In-the-wild 3D Avatars from the Web Zihao Huang, Shoukang Hu, Guangcong Wang, Tianqi Liu, Yuhang Zang, Zhiguo Cao, Wei Li, Ziwei Liu arXiv ↗ PDF ↗
WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic Environments Jianhao Zheng, Zihan Zhu, Valentin Bieri, Marc Pollefeys, Songyou Peng, Iro Armeni PDF ↗
Wonderland: Navigating 3D Scenes from a Single Image Hanwen Liang, Junli Cao, Vidit Goel, Guocheng Qian, Sergei Korolev, Demetri Terzopoulos, Konstantinos N. Plataniotis, Sergey Tulyakov, Jian Ren arXiv ↗ PDF ↗
Words or Vision: Do Vision-Language Models Have Blind Faith in Text? Ailin Deng, Tri Cao, Zhirui Chen, Bryan Hooi arXiv ↗ PDF ↗
Yo'Chameleon: Personalized Vision and Language Generation Thao Nguyen, Krishna Kumar Singh, Jing Shi, Trung Bui, Yong Jae Lee, Yuheng Li PDF ↗
Your Scale Factors are My Weapon: Targeted Bit-Flip Attacks on Vision Transformers via Scale Factor Manipulation Jialai Wang, Yuxiao Wu, Weiye Xu, Yating Huang, Chao Zhang, Zongpeng Li, Mingwei Xu, Zhenkai Liang PDF ↗
Z-Magic: Zero-shot Multiple Attributes Guided Image Creator Yingying Deng, Xiangyu He, Fan Tang, Weiming Dong PDF ↗
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion Zhenglin Zhou, Fan Ma, Hehe Fan, Tat-Seng Chua PDF ↗
Zero-Shot 4D Lidar Panoptic Segmentation Yushan Zhang, Aljoša Ošep, Laura Leal-Taixé, Tim Meinhardt PDF ↗
Zero-Shot Blind-spot Image Denoising via Implicit Neural Sampling Yuhui Quan, Tianxiang Zheng, Zhiyuan Ma, Hui Ji PDF ↗
Zero-Shot Head Swapping in Real-World Scenarios Taewoong Kang, Sohyun Jeong, Hyojin Jang, Jaegul Choo arXiv ↗ PDF ↗
Zero-Shot Image Restoration Using Few-Step Guidance of Consistency Models (and Beyond) Tomer Garber, Tom Tirer arXiv ↗ PDF ↗
Zero-Shot Novel View and Depth Synthesis with Multi-View Geometric Diffusion Vitor Guizilini, Muhammad Zubair Irshad, Dian Chen, Greg Shakhnarovich, Rares Ambrus arXiv ↗ PDF ↗
Zero-Shot Styled Text Image Generation, but Make It Autoregressive Vittorio Pippi, Fabio Quattrini, Silvia Cascianelli, Alessio Tonioni, Rita Cucchiara arXiv ↗ PDF ↗
Zero-shot 3D Question Answering via Voxel-based Dynamic Token Compression Hsiang-Wei Huang, Fu-Chen Chen, Wenhao Chai, Che-Chun Su, Lu Xia, Sanghun Jung, Cheng-Yen Yang, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo PDF ↗
Zero-shot RGB-D Point Cloud Registration with Pre-trained Large Vision Model Haobo Jiang, Jin Xie, Jian Yang, Liang Yu, Jianmin Zheng PDF ↗
ZeroGrasp: Zero-Shot Shape Reconstruction Enabled Robotic Grasping Shun Iwase, Muhammad Zubair Irshad, Katherine Liu, Vitor Guizilini, Robert Lee, Takuya Ikeda, Ayako Amma, Koichi Nishiwaki, Kris Kitani, Rares Ambrus, Sergey Zakharov arXiv ↗ PDF ↗
ZoomLDM: Latent Diffusion Model for Multi-scale Image Generation Srikar Yellapragada, Alexandros Graikos, Kostas Triaridis, Prateek Prasanna, Rajarsi Gupta, Joel Saltz, Dimitris Samaras arXiv ↗ PDF ↗
beta-FFT: Nonlinear Interpolation and Differentiated Training Strategies for Semi-Supervised Medical Image Segmentation Ming Hu, Jianfu Yin, Zhuangzhuang Ma, Jianheng Ma, Feiyu Zhu, Bingbing Wu, Ya Wen, Meng Wu, Cong Hu, Bingliang Hu, Quan Wang PDF ↗
dFLMoE: Decentralized Federated Learning via Mixture of Experts for Medical Data Analysis Luyuan Xie, Tianyu Luan, Wenyuan Cai, Guochen Yan, Zhaoyu Chen, Nan Xi, Yuejian Fang, Qingni Shen, Zhonghai Wu, Junsong Yuan arXiv ↗ PDF ↗
h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-Transform Toan Nguyen, Kien Do, Duc Kieu, Thin Nguyen PDF ↗
iG-6DoF: Model-free 6DoF Pose Estimation for Unseen Object via Iterative 3D Gaussian Splatting Tuo Cao, Fei Luo, Jiongming Qin, Yu Jiang, Yusen Wang, Chunxia Xiao PDF ↗
iSegMan: Interactive Segment-and-Manipulate 3D Gaussians Yian Zhao, Wanshi Xu, Ruochong Zheng, Pengchong Qiao, Chang Liu, Jie Chen arXiv ↗ PDF ↗
nnWNet: Rethinking the Use of Transformers in Biomedical Image Segmentation and Calling for a Unified Evaluation Benchmark Yanfeng Zhou, Lingrui Li, Le Lu, Minfeng Xu PDF ↗
pFedMxF: Personalized Federated Class-Incremental Learning with Mixture of Frequency Aggregation Yifei Zhang, Hao Zhu, Alysa Ziying Tan, Dianzhi Yu, Longtao Huang, Han Yu PDF ↗
vesselFM: A Foundation Model for Universal 3D Blood Vessel Segmentation Bastian Wittmann, Yannick Wattenberg, Tamaz Amiranashvili, Suprosanna Shit, Bjoern Menze arXiv ↗ PDF ↗