CCF-A · IEEE/CVF Conference on Computer Vision and Pattern Recognition

CVPR 2026

Jun 3–7, 2026 · Denver, Colorado, United States · 850 papers · official site ↗

Posters 850 · page 4 of 5

Rectifying Latent Space for Generative Single-Image Reflection Removal
Mingjia Li, Jin Hu, Hainuo Wang, Qiming Hu, Jiarui Wang, Xiaojie Guo arXiv ↗ PDF ↗
Recurrent Video Masked Autoencoders
Daniel Zoran, Nikhil Parthasarathy, Yi Yang, Drew A Hudson, João Carreira, Andrew Zisserman arXiv ↗ PDF ↗
Refacade: Editing Object with Given Reference Texture
Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Jianan Wang, Rong Xiao PDF ↗
Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning
Ziyi Zhang, Li Shen, Deheng Ye, Yong Luo, Huangxuan Zhao, Meng Liu, Wei Yu, Lefei Zhang arXiv ↗ PDF ↗
Reflection Separation from a Single Image via Joint Latent Diffusion
Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang PDF ↗
Refracting Reality: Generating Images with Realistic Transparent Objects
Yue Yin, Enze Tao, Dylan Campbell arXiv ↗ PDF ↗
RegionFuse: Region-Adaptive Pixel Distribution Learning for Infrared and Visible Image Fusion
Jianghan Xia, Hong Song, Jinfu Li, Yucong Lin, Shihan Ma, Jingfan Fan, Danni Ai, Tianyu Fu, Deqiang Xiao, Jian Yang PDF ↗
Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference
Yushi Ye, Feng Hong, Huangjie Zheng, Xu Chen, Zhiyong Chen, Yanfeng Wang, Jiangchao Yao arXiv ↗ PDF ↗
Relational Visual Similarity
Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li arXiv ↗ PDF ↗
Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learning
Uddin Md. Borhan, Arif Raza, Zhiliang Lin, Lu Wang, Jianqiang Li, Jie Chen PDF ↗
Repurposing 3D Generative Model for Autoregressive Layout Generation
Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Chunchao Guo, Yuxin Peng, Lu Sheng arXiv ↗ PDF ↗
ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
Yiyang Ma, Feng Zhou, Xuedan Yin, Pu Cao, Yonghao Dang, Jianqin Yin arXiv ↗ PDF ↗
Residual Diffusion Bridge Model for Image Restoration
Hebaixu Wang, Jing Zhang, Haoyang Chen, Haonan Guo, Di Wang, Jiayi Ma, Bo Du arXiv ↗ PDF ↗
Resolving the Identity Crisis in Text-to-Image Generation
Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli arXiv ↗ PDF ↗
Resolving the Stability-Plasticity Dilemma in Reinforcement Learning via Complementary Continual Critics
Bo Sun, Peixi Peng, Guang Tan, Haoran Xu, Yaokun Li, Yiqian Chang, Shuaixian Wang, Luntong Li PDF ↗
Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
Minxing Luo, Linlong Fan, Qiushi Wang, Ge Wu, Yiyan Luo, Yuhang Yu, Jinwei Chen, Yaxing Wang, Qingnan Fan, Jian Yang arXiv ↗ PDF ↗
Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
I-Hsiang Chen, Isma Hadji, Enrique Sanchez, Adrian Bulat, Sy-Yen Kuo, Radu Timofte, Georgios Tzimiropoulos, Brais Martinez arXiv ↗ PDF ↗
RetFormer: Multimodal Retrieval for Enhancing Image Recognition
Tianrui Yu, Xiubo Liang, Hongzhi Wang PDF ↗
Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights
Masafumi Mori, Shinya Gongyo, Mitsuru Ambai PDF ↗
Rethinking Box Supervision: Bias-Free Weakly Supervised Medical Segmentation
Jun Wei, Hui Huang PDF ↗
Rethinking Intermediate Representation for VLM-based Robot Manipulation
Weiliang Tang, Jialin Gao, Jia-Hui Pan, Gang Wang, Li Erran Li, Yun-Hui Liu, Mingyu Ding, Pheng-Ann Heng, Chi-Wing Fu arXiv ↗ PDF ↗
Rethinking Occlusion Modeling for UAV Tracking
Jian Zhang, Xincheng Yu, Yi Lin PDF ↗
Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty
Mangyu Kong, Jaewon Lee, Seongwon Lee, Euntai Kim arXiv ↗ PDF ↗
Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation
Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang arXiv ↗ PDF ↗
Rethinking Token Reduction for Large Vision-Language Models
Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang arXiv ↗ PDF ↗
RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting
Xuezhen Wang, Li Ma, Yulin Shen, Zeyu Wang, Pedro V. Sander arXiv ↗ PDF ↗
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao arXiv ↗ PDF ↗
Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?
Tilemachos Aravanis, Vladan Stojnić, Bill Psomas, Nikos Komodakis, Giorgos Tolias PDF ↗
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
Han Liu, Bogdan Georgescu, Yanbo Zhang, Youngjin Yoo, Michael Baumgartner, Riqiang Gao, Jianing Wang, Gengyan Zhao, Eli Gibson, Dorin Comaniciu, Sasa Grbic arXiv ↗ PDF ↗
Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learning
Chen-Chen Zong, Yu-Qi Chi, Xie-Yang Wang, Yan Cui, Sheng-Jun Huang arXiv ↗ PDF ↗
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
Yifan Du, Kun Zhou, Yingqian Min, Yue Ling, Wayne Xin Zhao, Youbin Wu, Ji-Rong Wen arXiv ↗ PDF ↗
Reviving ConvNeXt for Efficient Convolutional Diffusion Models
Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius Azevedo arXiv ↗ PDF ↗
RewardFlow: Generate Images by Optimizing What You Reward
Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant Shah, Ayush Barik, Nabeel Bashir, Muntasir Wahed, Ritish Shrirao, Ismini Lourentzou arXiv ↗ PDF ↗
Rewis3d: Reconstruction Improves Weakly-Supervised Semantic Segmentation
Jonas Ernst, Wolfgang Boettcher, Lukas Hoyer, Jan Eric Lenssen, Bernt Schiele arXiv ↗ PDF ↗
RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations
Mochu Xiang, Zhelun Shen, Xuesong Li, Jiahui Ren, Jing Zhang, Chen Zhao, Shanshan Liu, Haocheng Feng, Jingdong Wang, Yuchao Dai arXiv ↗ PDF ↗
RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
Xiyan Liu, Han Wang, Yuhu Wang, Junjie Cai, Zhe Cao, Jianzhong Yang, Zhen Lu arXiv ↗ PDF ↗
Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation
Wenyu Sun, Hufei Li, Ruijin Jin, Xiangheng Kong, Yuning Jiang PDF ↗
S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs
Yuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang, Guangzhi Cao, Lizhuang Ma, Yuan Xie, Xin Tan arXiv ↗ PDF ↗
S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain
Baoquan Zhang, Zhehao Yu, Lisai Zhang, Kenghong Lin, Tianran Chen, Yuxi Sun, Yunming Ye, Yao He arXiv ↗ PDF ↗
SAM 3D Body: Robust Full-Body Human Mesh Recovery
Xitong Yang, Devansh Kukreja, Don Pinkus, Taosha Fan, Jinhyung Park, Soyong Shin, Jinkun Cao, Jia-Wei Liu, Nicolás Ugrinovic, Anushka Sagar, Jitendra Malik, Matt Feiszli, Piotr Dollár, Kris Kitani arXiv ↗ PDF ↗
SAMIX: Reinforcing SAM2 with Semantic Adapter and Reference Selecting Policy for Mix-Supervised Segmentation
Qiang Hu, Jiajie Wei, Zhenyu Yi, Zhifen Yan, Yingjie Guo, Hongkuan Shi, Ge-Peng Ji, Qiang Li, Zhiwei Wang PDF ↗
SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross-Subject EEG-to-Image Retrieval
Qunjie Huang, Weina Zhu arXiv ↗ PDF ↗
SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion
Xiang Li, Heqian Qiu, Lanxiao Wang, Benliu Qiu, Fanman Meng, Linfeng Xu, Hongliang Li arXiv ↗ PDF ↗
SDDF: Specificity-Driven Dynamic Focusing for Open-Vocabulary Camouflaged Object Detection
Jiaming Liang, Yifeng Zhan, Chunlin Liu, Weihua Zheng, Bingye Peng, Qiwei Liang, Boyang Cai, Xiaochun Mai, Qiang Nie arXiv ↗ PDF ↗
SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia
Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao arXiv ↗ PDF ↗
SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang arXiv ↗ PDF ↗
SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning
Tairan Huang, Yulin Jin, Junxu Liu, Qingqing Ye, Haibo Hu arXiv ↗ PDF ↗
SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving
Jingyu Li, Junjie Wu, Dongnan Hu, Xiangkai Huang, Bin Sun, Zhihui Hao, Xianpeng Lang, Xiatian Zhu, Li Zhang arXiv ↗ PDF ↗
SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting
Alexander Prutsch, Christian Fruhwirth-Reisinger, David Schinagl, Horst Possegger PDF ↗
SLARM: Streaming and Language-Aligned Reconstruction Model for Dynamic Scenes
Zhicheng Qiu, Jiarui Meng, Tong-an Luo, Yican Huang, Xuan Feng, Xuanfu Li, Zhan Xu arXiv ↗ PDF ↗
SMAP: Semantic Route Planning with Map-Grounded Multimodal Alignment
Wenjie Zhang, Chen Yang, Xin Lu, Zhen Wang, Yue Liu, Bobo Xi, Pengbo Zhang PDF ↗
SMVRT: Implicit Human 3D Modeling Using Sparse Multi-View Volumetric Reconstruction with Transformer Fusion
Chuanmao Fan, Chenxi Zhao, Ye Duan PDF ↗
SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection
Yifan Wang, Yian Zhao, Fanqi Pu, Xiaochen Yang, Yang Tang, Xi Chen, Wenming Yang arXiv ↗ PDF ↗
SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation
Xiaogang Du, Jiawei Zhang, Tongfei Liu, Tao Lei, Yingbo Wang arXiv ↗ PDF ↗
SRGCD: Stability-Driven Region Growth Framework for 3D Change Detection
Yue Wu, Tao Peng, Yongzhe Yuan, Kaiyuan Feng, Hao Li, Maoguo Gong, Qiguang Miao, Wenping Ma PDF ↗
ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting
Yuming Meng, Dong Wu, Hongbin Zha PDF ↗
STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction
Jiankuo Zhao, Xiangyu Zhu, Zidu Wang, Zhen Lei arXiv ↗ PDF ↗
STUR3D: Spatio-Temporal Unified Representation Learning for 3D Object Detection
Huijie Fan, Pengrui Huang, Qiang Wang, Baojie Fan, Jiahua Dong, Liangqiong Qu PDF ↗
Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning
Jingbo Sun, Qichao Zhang, Songjun Tu, Xing Fang, Yupeng Zheng, Haoran Li, Ke Chen, Dongbin Zhao arXiv ↗ PDF ↗
Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano arXiv ↗ PDF ↗
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu arXiv ↗ PDF ↗
Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers
Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen PDF ↗
Scaling Spatial Intelligence with Multimodal Foundation Models
Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Tongxi Zhou, Qingping Sun, Hui En Pang, Jiaqi Li, Oscar Qian, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang arXiv ↗ PDF ↗
Scaling View Synthesis Transformers
Evan Kim, Hyunwoo Ryu, Thomas W. Mitchel, Vincent Sitzmann arXiv ↗ PDF ↗
Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems
Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez arXiv ↗ PDF ↗
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky PDF ↗
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding arXiv ↗ PDF ↗
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
Ziqi Ni, Yuanzhi Liang, Rui Li, Yi Zhou, Haibin Huang, Chi Zhang, Xuelong Li arXiv ↗ PDF ↗
Seeing without Pixels: Perception from Camera Trajectories
Zihui Xue, Kristen Grauman, Dima Damen, Andrew Zisserman, Tengda Han arXiv ↗ PDF ↗
Self-Diffusion Driven Blind Imaging
Yanlong Yang, Guanxiong Luo arXiv ↗ PDF ↗
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
Xin Yu, Xiaojuan Qi, Zhengqi Li, Kai Zhang, Richard Zhang, Zhe Lin, Eli Shechtman, Tianyu Wang, Yotam Nitzan arXiv ↗ PDF ↗
Semantic Audio-Visual Navigation in Continuous Environments
Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang arXiv ↗ PDF ↗
SemanticVLA: Towards Semantic Reasoning over Action Memorization via Synergistic Explicit Trace and Latent Action Planning
Fei Ni, Zhuo Chen, Yifu Yuan, Zibin Dong, Xianze Yao, Shan Luo, Jianye Hao, Jiankang Deng, Stefanos Zafeiriou PDF ↗
Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
Yueming Pan, Ruoyu Feng, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng arXiv ↗ PDF ↗
SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching
Yasaman Haghighi, Alexandre Alahi arXiv ↗ PDF ↗
SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning
Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Lewei Lu PDF ↗
ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
Rundong Luo, Noah Snavely, Wei-Chiu Ma arXiv ↗ PDF ↗
ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration
Xiaolong Zeng, Yitong Yu, Shiyao Xiong, Jinhua Hao, Ming Sun, Chao Zhou, Bin Wang arXiv ↗ PDF ↗
Shoe Style-Invariant and Ground-Aware Learning for Dense Foot Contact Estimation
Daniel Sungho Jung, Kyoung Mu Lee arXiv ↗ PDF ↗
SineProject: Machine Unlearning for Stable Vision-Language Alignment
Arpit Garg, Hemanth Saratchandran, Simon Lucey arXiv ↗ PDF ↗
Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation
Divyanshu Daiya, Aniket Bera arXiv ↗ PDF ↗
Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu arXiv ↗ PDF ↗
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Yang Kuan, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang arXiv ↗ PDF ↗
Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction
Zhengbo Jiao, Zifan Zhang, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang PDF ↗
Solving Minimal Problems Without Matrix Inversion Using FFT-Based Interpolation
Haidong Wu, Snehal Bhayani, Janne Heikkila arXiv ↗ PDF ↗
Sparse Task Vector Mixup with Hypernetworks for Efficient Knowledge Transfer in Whole-Slide Image Prognosis
Pei Liu, Xiangxiang Zeng, Tengfei Ma, Yucheng Xing, Xuanbai Ren, Yiping Liu arXiv ↗ PDF ↗
Spatial Matters: Position-Guided 3D Referring Expression Segmentation
Yabing Wang, Zhuotao Tian, Le Wang, Zheng Qin, Sanping Zhou PDF ↗
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao arXiv ↗ PDF ↗
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan arXiv ↗ PDF ↗
Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists
Jiaqi Liu, Zhizhong Han arXiv ↗ PDF ↗
Spherical Voronoi: Directional Appearance as a Differentiable Partition of the Sphere
Francesco Di Sario, Daniel Rebain, Dor Verbin, Marco Grangetto, Andrea Tagliasacchi arXiv ↗ PDF ↗
SpiderCam: Low-Power Snapshot Depth from Differential Defocus
Marcos A. Ferreira, Tianao Li, John Mamish, Josiah Hester, Yaman Sangar, Qi Guo, Emma Alexander arXiv ↗ PDF ↗
Spk2VidNet: A Hierarchical Recurrent Architecture for High-Fidelity Video Reconstruction from Long Spike-Camera Streams
Yuanlin Wang, Ruiqin Xiong, Jiyu Xie, Zhenkun Zhu, Zhaofei Yu, Xiaopeng Fan, Tiejun Huang PDF ↗
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang arXiv ↗ PDF ↗
Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation
Jiahao Xu, Xiaohan Yuan, Xingchen Wu, Chongyang Xu, Kun Li, Buzhen Huang arXiv ↗ PDF ↗
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
Bowen Xue, Zheng-Peng Duan, Qixin Yan, Wenjing Wang, Hao Liu, Chun-Le Guo, Chongyi Li, Chen Li, Jing Lyu arXiv ↗ PDF ↗
Stereo World Model: Camera-Guided Stereo Video Generation
Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi arXiv ↗ PDF ↗
Stochastic Ray Tracing for the Reconstruction of 3D Gaussian Splatting
Peiyu Xu, Shuang Zhao, Xin Sun, Krishna Mullia, Raymond Fei, Iliyan Georgiev arXiv ↗ PDF ↗
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu arXiv ↗ PDF ↗
StreamRAG: Enhancing Real-Time Video Understanding with Retrieval Augmentation
Junlin Xie, Quanlong Zheng, Ruifei Zhang, Kuo Wang, Yanhao Zhang, Jinguo Luo, Haonan Lu, Xiang Wan, Guanbin Li PDF ↗
Streaming Diffusion Model for Fast Infrared and Visible Video Fusion
Jinyuan Liu, Ludan Sun, Tengyu Ma, Chunyan Yang, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan PDF ↗
Streaming Video Crime Anticipation with Spatio-Temporal Causal Reasoning
Yusong Wang, Zheyuan Gu, Keyu Mao, Minghao Shao, Mingkun Xu, Prayag Tiwari, Jiawei Shao, Qingsong Zhao PDF ↗
Streaming Video Instruction Tuning
Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou arXiv ↗ PDF ↗
Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation
Peiyang Ni, Longyu Yang, Lu Zhang, Kuniaki Saito, Yap-Peng Tan, Fumin Shen, Heng Tao Shen, Xiaofeng Zhu, Ping Hu PDF ↗
StyleDoctor: Towards Specialist Reward Model for Style-centric Generation Tasks
Xilin He, Xiaole Xian, Xiangyu Yue, Muhammad Haris Khan PDF ↗
Suppressing Non-Semantic Noise in Masked Image Modeling Representations
Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera PDF ↗
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu arXiv ↗ PDF ↗
SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception
Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng PDF ↗
Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos
Jialun Pei, Zhangjun Zhou, Diandian Guo, Zhixi Li, Jing Qin, Bo Du, Pheng-Ann Heng arXiv ↗ PDF ↗
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long arXiv ↗ PDF ↗
TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery
Yanan Wu, Yuhan Yan, Tailai Chen, Zhixiang Chi, ZiZhang Wu, Yi Jin, Yang Wang, Zhenbo Li arXiv ↗ PDF ↗
TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
Yifei Zeng, Yajie Bao, Jiachen Qian, Shuang Wu, Youtian Lin, Hao Zhu, Buyu Li, Feihu Zhang, Xun Cao, Yao Yao arXiv ↗ PDF ↗
TF-SSD: A Strong Pipeline via Synergic Mask Filter for Training-free Co-salient Object Detection
Zhijin He, Shuo Jin, Siyue Yu, Shuwei Wu, Bingfeng Zhang, Li Yu, Jimin Xiao arXiv ↗ PDF ↗
TGTrack: Temporal Generative Learning for Unified Single Object Tracking
Wanting Geng, Xin Chen, Chuanyu Sun, Jie Zhao, Ben Kang, Dong Wang, Huchuan Lu PDF ↗
TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models
Xiang Li, Ya-Li Li, Yuan Wang, Shengjin Wang PDF ↗
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
Jinlun Ye, Jiang Liao, Runhe Lai, Xinhua Lu, Jiaxin Zhuang, Zhiyong Gan, Ruixuan Wang arXiv ↗ PDF ↗
Tackling Alignment Ambiguity in Person Retrieval through Conversational Attribute Mining
Hao Zou, Runqing Zhang, Jin Ding, Xue Zhou, Jianxiao Zou, Mingzhu Cai PDF ↗
Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
Chubin Chen, Sujie Hu, Jiashu Zhu, Meiqi Wu, Jintao Chen, Yanxun Li, Nisha Huang, Chengyu Fang, Jiahong Wu, Xiangxiang Chu, Xiu Li arXiv ↗ PDF ↗
Task-Driven Implicit Representations for Automated Design of LiDAR Systems
Nikhil Behari, Aaron Young, Tzofi Klinghoffer, Akshat Dave, Ramesh Raskar arXiv ↗ PDF ↗
Teacher-Guided Routing for Sparse Vision Mixture-of-Experts
Masahiro Kada, Ryota Yoshihashi, Satoshi Ikehata, Rei Kawakami, Ikuro Sato arXiv ↗ PDF ↗
Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model
Yulong Shi, Shijie Li, Ziyi Li, Lin Qi arXiv ↗ PDF ↗
Temporal Interaction in Spiking Transformers with Multi-Delay Mixer
Kexin Shi, Hanwen Liu, Zeyang Song, Yang Liu, Jieyuan Zhang, Shuai Wang, Jibin Wu, Malu Zhang, Yang Yang PDF ↗
Temporal Representation Enhancement (TRE): Learning to Forget Dominant Patterns for Enhanced Temporal Spiking Features
Wei Liu, Li Yang, Yufei Wang, Han Xiao, Boyu Cai, Weiming Hu PDF ↗
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
Yan Shu, Bin Ren, Zhitong Xiong, Xiao Xiang Zhu, Begüm Demir, Nicu Sebe, Paolo Rota arXiv ↗ PDF ↗
TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR
Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Dariu M. Gavrila PDF ↗
Test-time Ego-Exo-centric Adaptation for Action Anticipation via Multi-Label Prototype Growing and Dual-Clue Consistency
Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Qingbo Wu, Fanman Meng, Lili Pan, Hongliang Li arXiv ↗ PDF ↗
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
Hanshen Zhu, Yuliang Liu, Xuecheng Wu, An-Lan Wang, Hao Feng, Dingkang Yang, Chao Feng, Can Huang, Jingqun Tang, Xiang Bai arXiv ↗ PDF ↗
The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models
Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang arXiv ↗ PDF ↗
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou arXiv ↗ PDF ↗
The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery
Haiyang Zheng, Nan Pu, Yaqi Cai, Teng Long, Wenjing Li, Nicu Sebe, Zhun Zhong arXiv ↗ PDF ↗
The Drift Kernel: Why Diffusion Models Change Even When Told Not To
Gokul Srinath Seetha Ram, Rashmi Elavazhagan PDF ↗
The Missing Point in Vision Transformers for Universal Image Segmentation
Sajjad Shahabodini, Mobina Mansoori, Farnoush Bayatmakou, Jamshid Abouei, Konstantinos Plataniotis, Arash Mohammadi arXiv ↗ PDF ↗
The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations
Kushal Vyas, Alper Kayabasi, Daniel Kim, Vishwanath Saragadam, Ashok Veeraraghavan, Guha Balakrishnan arXiv ↗ PDF ↗
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang arXiv ↗ PDF ↗
Think-Then-Generate: Structural Chain-of-Thought Reasoning for Consistent 3D Generation
Xinyue Liu, Jin Liu, Hongbo Wang, Ran He, Huaibo Huang PDF ↗
ThinkGen: Generalized Thinking for Visual Generation
Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei arXiv ↗ PDF ↗
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
Haoji Zhang, Xin Gu, Jiawen Li, Chixiang Ma, Sule Bai, Chubin Zhang, Bowen Zhang, Zhichao Zhou, Dongliang He, Yansong Tang arXiv ↗ PDF ↗
Thinking in 360deg: Humanoid Visual Search in the Wild
Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li PDF ↗
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
Pengfei Hu, Meng Cao, Yingyao Wang, Yi Wang, Jiahua Dong, Jun Song, Yu Cheng, Bo Zheng, Xiaodan Liang arXiv ↗ PDF ↗
TimeBridge: Self-Supervised Video Representation Learning via Start-End Joint Embedding and In-Between Frame Prediction
Qin Wang, Abigail Morrison, Hanno Scharr, Kai Krajsek PDF ↗
TokenSplat: Token-aligned 3D Gaussian Splatting for Feed-forward Pose-free Reconstruction
Yihui Li, Chengxin Lv, Zichen Tang, Hongyu Yang, Di Huang arXiv ↗ PDF ↗
TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery
Li Zhang, Shruti Agarwal, John Collomosse, Pengtao Xie, Vishal Asnani arXiv ↗ PDF ↗
Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans
Sizhong Qin, Ramon Elias Weber, Xinzheng Lu arXiv ↗ PDF ↗
TopoMA: Topology-Guided Multi-Agent Dense RGB 3D Reconstruction via Distributed Inference
Xuanxuan Zhang, ShuHui Shi, Tianxiang Zhang, Zhetao Guo, Huang Zixuan, You Li PDF ↗
TopoSlide: Topologically-Informed Histopathology Whole Slide Image Representation Learning
Shahira Abousamra, Asmita Sood, Sylvia Plevritis PDF ↗
Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
Bolin Lai, XuDong Wang, Saketh Rambhatla, James M. Rehg, Zsolt Kira, Rohit Girdhar, Ishan Misra arXiv ↗ PDF ↗
Toward Generalizable Whole Brain Representations with High-Resolution Light-Sheet Data
Minyoung E. Kim, Dae Hee Yun, Aditi V. Patel, Madeline Hon, Webster Guan, Taegeon Lee, Brian Nguyen arXiv ↗ PDF ↗
Toward Low-Cost yet Effective Temporal Learning for UAV Tracking
Chaocan Xue, Qihua Liang, Bineng Zhong, Yanting Zu, Yuanliang Xue, Haiying Xia, Shuxiang Song PDF ↗
Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers
Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong arXiv ↗ PDF ↗
Towards Human-Like Robot Handwriting via Contour-Aware Generation
Yutao Qin, Gang Dai, Yifan Zhang, Youwei Han, Qisheng He, Shuangping Huang PDF ↗
Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots
Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang arXiv ↗ PDF ↗
Towards Persistence: Learning Topological Constraints for Event-based Small Object Detection
Shiman He, Nuo Chen, Xinyi Ying, Yihang Luo, Yangsi Shi, Zaiping Lin, Miao Li PDF ↗
Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework
Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang arXiv ↗ PDF ↗
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou arXiv ↗ PDF ↗
Towards Robust Multi-Modal Semantic Segmentation with Teacher-Student Framework and Hybrid Prototype Distillation
Jiaqi Tan, Xu Zheng, Yang Liu PDF ↗
Towards Robust Vision Transformers: Path Dependency Analysis and a Simple Two-Stage Adversarial Training
Seongmin Kim, Byung Cheol Song PDF ↗
Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video
Yuting Tan, Xilong Cheng, Yunxiao Qin, Zhengnan Li, Jingjing Zhang arXiv ↗ PDF ↗
Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework
Li Xu, Yingfu Zhang, Kepeng Xu, Gang He, Yunsong Li PDF ↗
Towards Visual Query Localization in the 3D World
Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang arXiv ↗ PDF ↗
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
Seungjae Lee, Yoonkyo Jung, Inkook Chun, Yao-Chih Lee, Zikui Cai, Hongjia Huang, Aayush Talreja, Tan Dao, Yongyuan Liang, Jia-Bin Huang, Furong Huang arXiv ↗ PDF ↗
Tracking by Predicting 3-D Gaussians Over Time
Tanish Baranwal, Himanshu Gaurav Singh, Jathushan Rajasegaran, Jitendra Malik arXiv ↗ PDF ↗
Tracking through Severe Occlusion via Event-Derived Transient Cues
Hao Dong, Yujin Liu, Haoyue Liu, Zhenyu Wang, Shihan Peng, Zhiwei Shi, Yi Chang, Luxin Yan PDF ↗
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan arXiv ↗ PDF ↗
Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu arXiv ↗ PDF ↗
Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers
Wongi Jeong, Kyungryeol Lee, Hoigi Seo, Se Young Chun arXiv ↗ PDF ↗
Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models
Wongi Jeong, Hoigi Seo, Se Young Chun arXiv ↗ PDF ↗
Transform to Transfer: Boosting Adversarial Attack Transferability on Vision-Language Pre-training Models
Yang Li, Jia-Li Yin, Luojun Lin, Wei Lin PDF ↗
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
Chunxiao Li, Lijun Li, Jing Shao arXiv ↗ PDF ↗
Tri-Modal Fusion Transformers for UAV-based Object Detection
Craig Iaboni, Pramod Abichandani arXiv ↗ PDF ↗
Tunable Soft Equivariance with Guarantees
Md Ashiqur Rahman, Lim Jun Hao, Jeremiah Jiang, Teck-Yian Lim, Raymond A. Yeh arXiv ↗ PDF ↗
Twin-T & TwintVQA: A Reliable Structure-Detail Separating VLM and a Comprehensive Benchmark for Chart and Table Tasks
Jiahua Bao, Siyao Cheng, Jiaxing Du, Qingtao Xia, Changjiang He, Zeming Lang, Jie Liu PDF ↗
UAST: Unified Active Search and Tracking for Arbitrary Targets with UAVs
Liang Qin, Min Wang, Xingyu Lu, Aowen Qiu, Wengang Zhou, Houqiang Li PDF ↗
Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking from Sparse Inertial Sensors and Ranging-based Between-sensor Distances
Dominik Hollidt, Tommaso Bendinelli, Christian Holz PDF ↗
Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder
Tianyu Zhang, Dong Liu, Chang Wen Chen arXiv ↗ PDF ↗
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding
Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou arXiv ↗ PDF ↗
Understanding Counting Mechanisms in Large Language and Vision-Language Models
Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah arXiv ↗ PDF ↗
Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
Yara Bahram, Mélodie Desbos, Mohammadhadi Shateri, Eric Granger arXiv ↗ PDF ↗
Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities
Peibo Song, Xiaotian Xue, Jinshuo Zhang, Zihao Wang, Jinhua Liu, Shujun Fu, Fangxun Bao, Si Yong Yeo arXiv ↗ PDF ↗
UniComp: Rethinking Video Compression Through Informational Uniqueness
Chao Yuan, Shimin Chen, Minliang Lin, Limeng Qiao, Guanglu Wan, Lin Ma arXiv ↗ PDF ↗
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
Ziyao Wang, Chen Chen, Jingtao Li, Weiming Zhuang, Jiabo Huang, Ang Li, Lingjuan Lyu arXiv ↗ PDF ↗
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
Chengyu Bai, Jintao Chen, Xiang Bai, Yilong Chen, Qi She, Ming Lu, Shanghang Zhang arXiv ↗ PDF ↗
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in RL
Rui Tian, Mingfei Gao, Haiming Gang, Jiasen Lu, Zhe Gan, Yinfei Yang, Zuxuan Wu, Afshin Dehghan PDF ↗
UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
Shuo Ni, Di Wang, He Chen, Haonan Guo, Ning Zhang, Jing Zhang arXiv ↗ PDF ↗
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng arXiv ↗ PDF ↗
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu arXiv ↗ PDF ↗
UniVBench: Towards Unified Evaluation for Video Foundation Models
Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu arXiv ↗ PDF ↗
UniVerse: Empower Unified Generation with Reasoning and Knowledge
Kaiyue Sun, Weiyang Jin, Chengqi Duan, Rongyao Fang, Xian Liu, Yuwei Niu, Chunwei Wang, Aoxue Li, Xihui Liu PDF ↗
Unified Camera Positional Encoding for Controlled Video Generation
Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Gambardella, Dinh Phung, Jianfei Cai arXiv ↗ PDF ↗
Unified Personalized Understanding, Generating and Editing
Yu Zhong, Tianwei Lin, Ruike Zhu, Yuqian Yuan, Haoyu Zheng, Liang Liang, Wenqiao Zhang, Feifei Shao, Haoyuan Li, Wanggui He, Hao Jiang, Yueting Zhuang arXiv ↗ PDF ↗
Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation
Xiangkai Ma, Lekai Xing, Han Zhang, Wenzhong Li, Sanglu Lu arXiv ↗ PDF ↗
Unique Lives, Shared World: Learning from Single-Life Videos
Tengda Han, Sayna Ebrahimi, Dilara Gokay, Li Yang Ku, Maks Ovsjanikov, Iva Babukova, Daniel Zoran, Viorica Patraucean, Joao Carreira, Andrew Zisserman, Dima Damen arXiv ↗ PDF ↗
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
Hengzhuang Li, Xinsong Zhang, Qiming Peng, Bin Luo, Han Hu, Dengyang Jiang, Han-Jia Ye, Teng Zhang, Hai Jin arXiv ↗ PDF ↗
Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework
Yu Zhu, Kang Li, Zheng Li, Pheng-Ann Heng arXiv ↗ PDF ↗
Unlocking Token Rewards via Training-Free Reward Attribution
Sitong Wu, Haoru Tan, Bin Xia, Xichen Zhang, Jingyao Li, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia PDF ↗
Unstitching the Chimera: Frame-Level Risk and Train-Free Mitigation for Video Hallucination
Songyuan Yang, Guijian Tang, Kun Hu, Haotian Wang, Shixuan Liu, Wenjing Yang, Long Lan, Huibin Tan PDF ↗
V2U4Real: A Real-world Large-scale Dataset for Vehicle-to-UAV Cooperative Perception
Weijia Li, Haoen Xiang, Tianxu Wang, Shuaibing Wu, Qiming Xia, Cheng Wang, Chenglu Wen arXiv ↗ PDF ↗
VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging
Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang arXiv ↗ PDF ↗
VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation
Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang PDF ↗
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen arXiv ↗ PDF ↗
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
Weitai Kang, Jason Kuen, Mengwei Ren, Zijun Wei, Yan Yan, Kangning Liu arXiv ↗ PDF ↗