CCF-A · IEEE/CVF Conference on Computer Vision and Pattern Recognition

CVPR 2026

Jun 3–7, 2026 · Denver, Colorado, United States · 850 papers · official site ↗

Posters 850 · page 3 of 5

Leveraging Verifier-Based Reinforcement Learning in Image Editing
Hanzhong Guo, Jie Wu, Jie Liu, Yu Gao, Zilyu Ye, Linxiao Yuan, Xionghui Wang, Yizhou Yu, Weilin Huang arXiv ↗ PDF ↗
LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving
Qihao Sun, Jiarun Liu, Ziqian Ni, Jianyun Xu, Sheng Yang, Tao Xie, Lijun Zhao, Ruifeng Li arXiv ↗ PDF ↗
LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration
Aditya Ranjan Dash, Ramy Battrawy, René Schuster, Didier Stricker arXiv ↗ PDF ↗
Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment
Fanqi Yu, Matteo Tiezzi, Tommaso Apicella, Cigdem Beyan, Vittorio Murino arXiv ↗ PDF ↗
LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang arXiv ↗ PDF ↗
Linking Perception, Confidence and Accuracy in MLLMs
Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu arXiv ↗ PDF ↗
LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimation
Yusheng Li, Lizhi Lou, Yan Tang, Zekai Miao, Shaoming Zhang, Jianmei Wang PDF ↗
LiveGesture: Streamable Co-Speech Gesture Generation Model
Muhammad Usama Saleem, Mayur Jagdishbhai Patel, Ekkasit Pinyoanuntapong, Zhongxing Qin, Li Yang, Hongfei Xue, Ahmed Helmy, Chen Chen, Pu Wang arXiv ↗ PDF ↗
LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioning
Xinran Yang, Shuichang Lai, Jiangjing Lyu, Hongjie Li, Bowen Pan, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo arXiv ↗ PDF ↗
Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts
Xi Chen, Maojun Zhang, Yu Liu, Shen Yan arXiv ↗ PDF ↗
Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang arXiv ↗ PDF ↗
Long-Tail Internet Photo Reconstruction
Yuan Li, Yuanbo Xiangli, Hadar Averbuch-Elor, Noah Snavely, Ruojin Cai PDF ↗
LongStream: Long-Sequence Streaming Autoregressive Visual Geometry
Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang arXiv ↗ PDF ↗
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye arXiv ↗ PDF ↗
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li arXiv ↗ PDF ↗
LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes
Ruofan Liang, Norman Müller, Ethan Weber, Duncan Zauss, Nandita Vijaykumar, Peter Kontschieder, Christian Richardt PDF ↗
M3Grounder: Mask-Based Multi-Span and Multi-Granular Grounding for Document QA
Venkata Kesav Venna, Sai Madhusudan Gunda, Jyothi Swaroopa Jinka, Hrithik Sagar Rachakonda, Anirudh Srinivasan, Ravi Kiran Sarvadevabhatla PDF ↗
MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models
Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro arXiv ↗ PDF ↗
MAMMA: Markerless Accurate Multi-person Motion Acquisition
Hanz Cuevas Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Höschle, Joachim Tesch, Taylor Obersat, Tsvetelina Alexiadis, Eni Halilaj, Michael J. Black PDF ↗
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma arXiv ↗ PDF ↗
META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understanding
Jing Huang, Luyuan Chen, Zhijie Xu, Yadong Li, Xingzhong Xu, Siye Chen, Jie Liu, Ming Kong, Qiang Zhu PDF ↗
MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs
Xinyi Wang, Pengfei Ren, Haoyang Zhang, Hanling Zhan, Yingxi Li, Liang Xie, Yue Gao, Erwei Yin PDF ↗
MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registration
Yue Wu, Feng Xiao, Yongzhe Yuan, Hao Li, Kaiyuan Feng, Maoguo Gong, Qiguang Miao, Wenping Ma PDF ↗
MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restoration
Heng Li, Xingyuan Wang, Yang Fan, Yunan Zhang, Xiangping Wu, Qingcai Chen PDF ↗
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang arXiv ↗ PDF ↗
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang PDF ↗
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
Ruoxiang Huang, Zhen Yuan arXiv ↗ PDF ↗
MOMO: Mars Orbital MOdel Foundation Model for Mars Orbital Applications
Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner arXiv ↗ PDF ↗
MPL: Match-guided Prototype Learning for Few-shot Action Recognition
Feng Yang, Jie Zhao, Fulin Luo, Anyong Qin, Tiecheng Song, Yue Zhao, Chenqiang Gao, Junwei Han PDF ↗
MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior
Joshua Cho, Sara Aghajanzadeh, Zhen Zhu, David Forsyth PDF ↗
MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos
Arkaprava Sinha, Monish Soundar Raj, Pu Wang, Ahmed Helmy, Hieu Le, Srijan Das arXiv ↗ PDF ↗
MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting
Yongjian Liao, Xu Zou, Wenjun Chen, Huixuan Li, Xiaoen Xie, Chunxi Li, Shixiang Huang, Gang Zhang, Jiahuan Zhou, Sheng Zhong, Luxin Yan PDF ↗
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao arXiv ↗ PDF ↗
MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognition
Shenyin Xu, Yishan Wang, Xinyu Li, Rui Liu, Zhongyuan Wang, Xin Tian PDF ↗
MV-TAP: Tracking Any Point in Multi-View Videos
Jahyeok Koo, Inès Hyeonsu Kim, Mungyeom Kim, Junghyun Park, Seohyeon Park, Jaeyeong Kim, Jung Yi, Seokju Cho, Seungryong Kim arXiv ↗ PDF ↗
MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation
Yibo Zhao, Yigong Zhang, Jin Xie arXiv ↗ PDF ↗
MacTok: Robust Continuous Tokenization for Image Generation
Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu arXiv ↗ PDF ↗
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han arXiv ↗ PDF ↗
Make it SING: Analyzing Semantic Invariants in Classifiers
Harel Yadid, Meir Yossef Levi, Roy Betser, Guy Gilboa arXiv ↗ PDF ↗
MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures
Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valery Weber, Ahmed Nassar, Peter Staar arXiv ↗ PDF ↗
Masked Region Transformer for Layered Image Generation and Editing at Scale
Zhicong Tang, Jingye Chen, Zhao Zhang, Mohan Zhou, Yuchi Liu, Yifan Pu, Yalong Bai, Ethan Smith, Yuhui Yuan PDF ↗
MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator
Peiqing Yang, Shangchen Zhou, Kai Hao, Qingyi Tao arXiv ↗ PDF ↗
MatLat: Material Latent Space for PBR Texture Generation
Kyeongmin Yeo, Yunhong Min, Jaihoon Kim, Minhyuk Sung arXiv ↗ PDF ↗
MeToM: Metadata-Guided Token Merging for Efficient Video LLMs
Zhuojie Wu, Shijie Wang, Xin Yu PDF ↗
MeanFlow Transformers with Representation Autoencoders
Zheyuan Hu, Chieh-Hsin Lai, Ge Wu, Yuki Mitsufuji, Stefano Ermon arXiv ↗ PDF ↗
MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer
Weiyu Li, Antoine Toisoul, Tom Monnier, Roman Shapovalov, Rakesh Ranjan, Ping Tan, Andrea Vedaldi PDF ↗
MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation
Yinuo Wang, Yanbo Fan, Xuan Wang, Boyao Zhou, Yu Guo, Yujun Shen, Fei Wang PDF ↗
Mind the Gap: Transferring Labels to Align Object Detection Datasets
Mikhail Kennerley, Angelica I. Aviles-Rivero, Carola-Bibiane Schönlieb, Robby T. Tan PDF ↗
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang, Wenshuo Ma, Zhihui He, Tianchi Cai, Weize Chen, Yuxiang Huang, Ranchi Zhao, Bokai Xu, Junbo Cui, Yingjing Xu, Liqing Ruan, Luoyuan Zhang, Hanyu Liu, Jingkun Tang, Hongyuan Liu, Qining Guo, Wenhao Hu, Bingxiang He, Jie Zhou, Jie Cai, Ji Qi, Zonghao Guo, Chi Chen, Guoyang Zeng, Yuxuan Li, Ganqu Cui, Ning Ding, Xu Han, Yuan Yao, Zhiyuan Liu, Maosong Sun PDF ↗
Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models
Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Feng, Zhangyang Wang, Qixing Huang arXiv ↗ PDF ↗
Mitigating Error Amplification in Fast Adversarial Training
Mengnan Zhao, Lihe Zhang, Bo Wang, Tianhang Zheng, Hong Zhong, Geyong Min arXiv ↗ PDF ↗
Mitigating Instance Entanglement in Instance-Dependent Partial Label Learning
Rui Zhao, Bin Shi, Kai Sun, Bo Dong arXiv ↗ PDF ↗
Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation
Nikolay Kormushev, Josip Šarić, Matej Kristan PDF ↗
Mitigating The Distribution Shift of Diffusion-based Dataset Distillation
Yue Xu, Chenyu Hu, Pengyu An, Yong-Lu Li PDF ↗
MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention
Zilong Zhao, Zhengming Ding, Pei Niu, Wenhao Sun, Feng Guo arXiv ↗ PDF ↗
MoCha: End-to-End Video Character Replacement without Structural Guidance
Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li PDF ↗
MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation
Wenfeng Song, Xuehan Wang, Shuai Li, Yi Chen, Yuting Guo, Zhenyu Wu, Xingliang Jin, Chenglizhao Chen, Fei Hou, Hongyu Wu, Aimin Hao PDF ↗
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim arXiv ↗ PDF ↗
MoEActok: A MoE-based Action Tokenizer for Vision-Language-Action Models
Chunpu Xu, Zhixuan Liang, Tianshuo Yang, Chi-Min Chan, Yang Xiao, Jessie Wang, Xiaokang Yang, Yao Mu PDF ↗
MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection
Jun Yeong Park, JunYoung Seo, Minji Kang, Yu Rang Park arXiv ↗ PDF ↗
MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label
Junyoung Jung, Seokwon Kim, Jung Uk Kim arXiv ↗ PDF ↗
MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamics
Ian Noronha, Heather Neave, Upinder Kaur PDF ↗
More than the Sum: Panorama-Language Models for Adverse Omni-Scenes
Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen arXiv ↗ PDF ↗
Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis
Hongyuan Chen, Xingyu Chen, Zexiang Xu, Anpei Chen arXiv ↗ PDF ↗
MotionEdit: Benchmarking and Learning Motion-Centric Image Editing
Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu arXiv ↗ PDF ↗
MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models
Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen PDF ↗
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan arXiv ↗ PDF ↗
Moving Border Ownership for Event-based Motion Segmentation
Zhiyuan Hua, Cornelia Fermüller, Yiannis Aloimonos PDF ↗
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma arXiv ↗ PDF ↗
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang arXiv ↗ PDF ↗
Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment
Xiaodong Chen, Qian Bao, Xudong Liu, Jianping Fang, Jintao Fang, Yongdong Zhang, Tao Mei, Wu Liu PDF ↗
Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration
Jinglin Xu, Yi Li, Chuxiong Sun, Xiao Xu, Jiangmeng Li, Fanjiang Xu arXiv ↗ PDF ↗
MultiAnimate: Pose-Guided Image Animation Made Extensible
Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu arXiv ↗ PDF ↗
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li arXiv ↗ PDF ↗
Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening
Junfeng Li, Wenyang Zhou, Xueheng Li, Xuanhua He, Jianhou Gan, Wenqi Ren arXiv ↗ PDF ↗
Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation
Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang arXiv ↗ PDF ↗
Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation
Yukuan Min, Muli Yang, Jinhao Zhang, Yuxuan Wang, Yihang Zhu, Jiexi Yan, Cheng Deng PDF ↗
NIL: No-data Imitation Learning
Mert Albaba, Chenhao Li, Markos Diomataris, Omid Taheri, Andreas Krause, Michael J. Black arXiv ↗ PDF ↗
NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting
Brent Zoomers, Florian Hahlbohm, Joni Vanherck, Lode Jorissen, Marcus Magnor, Nick Michiels arXiv ↗ PDF ↗
NaTex: Seamless Texture Generation as Latent Color Diffusion
Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Xin Yang, Xin Huang, Jingwei Huang, Xiangyu Yue, Chunchao Guo arXiv ↗ PDF ↗
NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration
Subhajit Sanyal, Srinivas Soumitri Miriyala, Akshay Janardan Bankar, Manjunath Arveti, Sowmya Vajrala, Shreyas Pandith, Sravanth Kodavanti, Abhishek Ameta, Harshit Harshit, Amit Satish Unde arXiv ↗ PDF ↗
Negative Binomial Variational Autoencoders for Overdispersed Latent Modeling
Yixuan Zhang, Jinhao Sheng, Wenxin Zhang, Quyu Kong, Feng Zhou arXiv ↗ PDF ↗
NeuROK: Generative 4D Neural Object Kinematics
Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu PDF ↗
Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments
Jianhui Wu, Jian Zhou, Zhi Zhou, Zhangjin Huang, Chao Li arXiv ↗ PDF ↗
Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy
Shuo Chen, Yijin Li, Xi Zheng, Guofeng Zhang arXiv ↗ PDF ↗
NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
Fangzhou Lin, Yuping Wang, Yuliang Guo, Zixun Huang, Xinyu Huang, Haichong Zhang, Kazunori Yamada, Zhengzhong Tu, Liu Ren, Ziming Zhang arXiv ↗ PDF ↗
No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
Hai X. Pham, David T. Hoffmann, Ricardo Guerrero, Brais Martinez arXiv ↗ PDF ↗
OMG-Avatar: One-shot Multi-LOD Gaussian Head Avatar
Jianqiang Ren, Lin Liu, Steven Hoi arXiv ↗ PDF ↗
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
Aymen Lassoued, Mohamed Ali Souibgui, Yousri Kessentini arXiv ↗ PDF ↗
OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement
Rui Wang, Huisi Wu, Jing Qin arXiv ↗ PDF ↗
OVI-MAP: Open-Vocabulary Instance-Semantic Mapping
Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath PDF ↗
OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He arXiv ↗ PDF ↗
Object-Generalized Re-Identification: A Step Towards Universal Instance Perception
Shuoyi Chen, Yurui Wu, Mang Ye PDF ↗
OctoT2I: A Self-Evolving Agentic Text-to-Image Router
Xu Jiang, Bin Chen, Gehui Li, Yule Duan, Ronggang Wang, Jian Zhang PDF ↗
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
Yujia Yang, Yuanxiang Wang, Zhenyu Guan, Tiankun Yang, Chenxi Bao, Haopeng Jin, Jinwen Luo, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Xinming Wang, Ruiwen Tao, Hongzhu Yi arXiv ↗ PDF ↗
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu arXiv ↗ PDF ↗
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang arXiv ↗ PDF ↗
On the Role of Temporal Granularity in the Robustness of Spiking Neural Networks
Mengting Xu, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan PDF ↗
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi arXiv ↗ PDF ↗
One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation
Linghui Fu, Yuhan Liu, Hao Chen, Zhen Yang, Yongjian Deng PDF ↗
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
Han Li, Xinyu Peng, Yaoming Wang, Zelin Peng, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Wenrui Dai, Hongkai Xiong arXiv ↗ PDF ↗
OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery
Yiwen Zhao, Ce Zheng, Yufu Wang, Hsueh-Han Daniel Yang, Liting Wen, László A. Jeni arXiv ↗ PDF ↗
OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting
Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang arXiv ↗ PDF ↗
OntoAug: Rethinking Generative Data Augmentation via Ontology Guidance
Shuo Wang, Zhichuan Wang, Jun Luo PDF ↗
OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data
Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang arXiv ↗ PDF ↗
OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Data
Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu arXiv ↗ PDF ↗
OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness
Phuc Nguyen, Anh N. Nhu, Ming C. Lin arXiv ↗ PDF ↗
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
Yanqing Liu, Xianhang Li, Letian Zhang, Zirui Wang, Zeyu Zheng, Yuyin Zhou, Cihang Xie arXiv ↗ PDF ↗
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun arXiv ↗ PDF ↗
OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation
Yating Liu, Zhaoshuai Qi, Yang Zou, Yongnan Yang, Shizhou Zhang, Yanning Zhang PDF ↗
OrionEdit: Bridging Reference and Source Images for Generalized Cross-Image Editing
Zeyu Jiang, Lai Man Po, Xuyuan Xu, Yexin Wang, Guoping Gong, Haoxuan Wu, Chenbo Yan, Kun Li, Yuyang Liu PDF ↗
Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism
Xin Li, Shujun Tian, Tao Lu, Han Bao, Zonghui Wang, Wenzhi Chen PDF ↗
PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Models
Xuan Wang, Guiguang Ding, Jungong Han PDF ↗
PAF: Perturbation-Aware Filtering for Open-Set Semi-Supervised Learning
Yinan Han, Qing-Yuan Jiang PDF ↗
PAI-Bench: A Comprehensive Benchmark For Physical AI
Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi arXiv ↗ PDF ↗
PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation
Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao arXiv ↗ PDF ↗
PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects
Yan Di, Yuheng Li, Yaoxing Wang, Mengge Liu, Shan Gao, Xiangyang Ji PDF ↗
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang arXiv ↗ PDF ↗
PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Models
Nhat Hoang, Minh Vu, My T. Thai, Manish Bhattarai PDF ↗
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo arXiv ↗ PDF ↗
PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection
Xijun Lu, Hongying Liu, Fanhua Shang, Yanming Hui, Liang Wan arXiv ↗ PDF ↗
PGR-Net: Prior-Guided ROI Reasoning Network for Brain Tumor MRI Segmentation
Jiacheng Lu, Hui Ding, Shiyu Zhang, Guoping Huo arXiv ↗ PDF ↗
PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement
Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu arXiv ↗ PDF ↗
PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories
Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li PDF ↗
POUR: A Provably Optimal Method for Unlearning Representation via Neural Collapse
Anjie Le, Can Peng, Yuyuan Liu, J. Alison Noble arXiv ↗ PDF ↗
PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representation
Jiacheng Hao, Chunying Liu, Hao Guo, Ruohan Wang, Hongping Gan, Yilei Shi PDF ↗
PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction
Isaac Deutsch, Nicolas Moënne-Loccoz, Gavriel State, Zan Gojcic PDF ↗
PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis
Inseong Choi, Siwoo Lee, Seung-Hun Nam, Soohwan Song arXiv ↗ PDF ↗
PRISM: Prototype-based Reasoning with Inter-modal Semantic Mining for Interpretable Image Recognition
Anni Yu, Yu-Bin Yang PDF ↗
PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On
Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu arXiv ↗ PDF ↗
PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detection
Zhengjian Kang, Jun Zhuang, Kangtong Mo, Qi Chen, Rui Liu, Ye Zhang arXiv ↗ PDF ↗
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving
Yining Pan, Shijie Li, Yuchen Wu, Xulei Yang, Na Zhao arXiv ↗ PDF ↗
Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image
Zidian Qiu, Ancong Wu arXiv ↗ PDF ↗
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
Zekai Lin, Xu Zheng arXiv ↗ PDF ↗
Paparazzo: Active Mapping of Moving 3D Objects
Davide Allegro, Shiyao Li, Stefano Ghidoni, Vincent Lepetit arXiv ↗ PDF ↗
Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper
Siwei Han, Haonian Ji, Siyang Xin, Juanquan Shi, Shi Qiu, Xinyu Ye, Peng Xia, Jiaqi Liu, Zhaorun Chen, Yiyang Zhou, Linjie Li, Lijuan Wang, Huaxiu Yao PDF ↗
Parallel Jacobi Decoding for Fast Autoregressive Image Generation
Boya Liao, Ying Li, Siyong Jian, Huan Wang PDF ↗
Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection
Weihao Cao, Runqi Wang, Xiaoyue Duan, Jinchao Zhang, Ang Yang, Liping Jing arXiv ↗ PDF ↗
PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing
Antonio Oroz, Matthias Nießner, Tobias Kirschstein PDF ↗
PersonaLive! Expressive Portrait Image Animation for Live Streaming
Zhiyuan Li, Chi-Man Pun, Chen Fang, Jue Wang, Xiaodong Cun arXiv ↗ PDF ↗
PersonaVLM: Long-Term Personalized Multimodal LLMs
Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan arXiv ↗ PDF ↗
Personalized Federated Training of Diffusion Models with Privacy Guarantees
Kumar Kshitij Patel, Bingqing Jiang, A F M Mahfuzul Kabir, Weitong Zhang, Difan Zou, Lingxiao Wang PDF ↗
Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement
Xinyue Liang, Zhiyuan Ma, Lingchen Sun, Yanjun Guo, Lei Zhang arXiv ↗ PDF ↗
PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion
Qixiu Li, Xiang Zhu, Xiaoyong Li, Xiaolong Xu PDF ↗
PhysHead: Simulation-Ready Gaussian Head Avatars
Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll arXiv ↗ PDF ↗
PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting
Jingyuan Gao, Yumeng Hu, Fei Gao, Mingjin Zhang PDF ↗
PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinning
Yuanhang Lei, Tao Cheng, Xingxuan Li, Boming Zhao, Siyuan Huang, Ruizhen Hu, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui arXiv ↗ PDF ↗
PhysVid: Physics Aware Local Conditioning for Generative Video Models
Saurabh Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz arXiv ↗ PDF ↗
Physical Simulator In-the-Loop Video Generation
Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt arXiv ↗ PDF ↗
Physically-Grounded Turbulence Mitigation with Frame-Shared Degradation Parameters
Dongxin Xie, Yan Huang, Yong Xu, Hui Ji PDF ↗
PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization
Xiaoya Cheng, Long Wang, Yan Liu, Xinyi Liu, Hanlin Tan, Yu Liu, Maojun Zhang, Shen Yan arXiv ↗ PDF ↗
PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion
Hong-Phuc Lai, Phong Nguyen, Anh Tran arXiv ↗ PDF ↗
Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers
Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu arXiv ↗ PDF ↗
Point4Cast: Streaming Dynamic Scene Reconstruction and Forecasting
Xinhang Liu, Pedro Miraldo, Suhas Lohit, Huaizu Jiang, Naoko Sawada, Yu-Wing Tai, Chi-Keung Tang, Moitreya Chatterjee PDF ↗
PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Model
Zhengdong Hu, Chao Wang, Fengyun Rao, Jing LYU, Hehe Fan, Yi Yang PDF ↗
Polarization State Tracing for Reflection Removal and Color-Consistent Reconstruction
Dongyue Wang, Yang Lu, Jiandong Tian PDF ↗
Portable Active Learning for Object Detection
Rashi Sharma, Justin Timothy C. Bersamin, Karthikk Subramanian arXiv ↗ PDF ↗
Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identification
JooHyung Oh, Minyoung Oh, Sung Whan Yoon, Jae-Young Sim PDF ↗
PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation
Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu arXiv ↗ PDF ↗
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
Srikumar Sastry, Subash Khanal, Aayush Dhakal, Jiayu Lin, Dan Cher, Phoenix Jarosz, Nathan Jacobs arXiv ↗ PDF ↗
ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environments
Jiaxin Ai, Yukang Feng, Fanrui Zhang, Jianwen Sun, Zizhen Li, Chuanhao Li, Yifan Chang, Wenxiao Wu, Ruoxi Wang, Mingliang Zhai, Kaipeng Zhang PDF ↗
Probabilistic Prompt Adaptation for Unified Image Aesthetics and Quality Assessment
Takayuki Hara, Yuya Otsuka PDF ↗
Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models
Qing Zhang, Xuesong Li, Jing Zhang arXiv ↗ PDF ↗
Progressive Multi-cue Alignment for Unaligned RGBT Tracking
Jiandong Jin, Chenglong Li, Hao Feng, Andong Lu, Lili Huang, Jin Tang PDF ↗
Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification
Wen Wen, Hao Chen, Shiliang Zhang arXiv ↗ PDF ↗
Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensing
Abdullah Azeem, Ruisheng Wang, Qingquan Li, Abubakar Siddique PDF ↗
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng arXiv ↗ PDF ↗
Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives
Haoran Wang, Guoxi Huang, Fan Zhang, David Bull, Nantheera Anantrasirichai arXiv ↗ PDF ↗
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
Onkar Susladkar, Tushar Prakash, Adheesh Juvekar, Kiet A. Nguyen, Dong-Hwan Jang, Inderjit S Dhillon, Ismini Lourentzou arXiv ↗ PDF ↗
QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models
Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei-Fei, Ehsan Adeli arXiv ↗ PDF ↗
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
Chenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei, Bochen Lin, Hongbin Sun arXiv ↗ PDF ↗
Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models
Abhishek Kumar Sinha, Nitant Dube, Soma Biswas PDF ↗
QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidence
Weiyu Zhao, Ru Li, Jiaqi Liu, Sizhe Zhao, Qinglin Liu, Shengping Zhang PDF ↗
QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy
Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand arXiv ↗ PDF ↗
R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax arXiv ↗ PDF ↗
RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation
Hao Li, Yuhao Wang, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu arXiv ↗ PDF ↗
RAVEN: Erasing Invisible Watermarks via Novel View Synthesis
Fahad Shamshad, Nils Lukas, Karthik Nandakumar arXiv ↗ PDF ↗
RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space
Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan arXiv ↗ PDF ↗
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
Hanqing Liu, Mingjie Liu, Luoping Cui, Endian Lin, Donghong Jiang, Chuang Zhu arXiv ↗ PDF ↗
REACH: Explicit Recovery Behavior for Diffusion Policies
Zundong Ke, Junlin Chen, Jiayi Zhu, Kuanhao Xia, Boyi Zhao, Jiayuan Gu PDF ↗
REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting
Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu arXiv ↗ PDF ↗
REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting
Di Wu, Liu Liu, Anran Huang, Yuyan Liu, Qiaojun Yu, Shaofan Liu, Liangtu Song, Cewu Lu arXiv ↗ PDF ↗
RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes
Jiarui Zhang, Zhihao Li, Chong Wang, Bihan Wen PDF ↗
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
Xiao Wang, Haiyang Wang, Shiao Wang, Qiang Chen, Jiandong Jin, Haoyu Song, Bo Jiang, Chenglong Li arXiv ↗ PDF ↗
RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos
Lixin Xue, Chengwei Zheng, Georgios Paschalidis, Chen Guo, Manuel Kaufmann, Juan Zarate, Dimitrios Tzionas arXiv ↗ PDF ↗
RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval
Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian arXiv ↗ PDF ↗
RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting
Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue arXiv ↗ PDF ↗
RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning
Tongrui Su, Qingbin Li, Shengyu Zhu, Wei Chen, Xueqi Cheng arXiv ↗ PDF ↗
Rank-Guided Pseudo-Bias Learning for Robust Black-Box Adaptation
Rajeev Ranjan Dwivedi, Anshuman Dangwal, Vinod K Kurmi PDF ↗
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa arXiv ↗ PDF ↗
ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIP
Xin Niu, Manqi Zhao, Dongsheng Jiang, Yingying Wu, Bing Su PDF ↗
ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling
Hao Zhang, Shuhan Yang, Linfeng Tang, Xunpeng Yi, Jiayi Ma PDF ↗
ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understanding
Miao Xu, Xiangyu Zhu, Zidu Wang, Xusheng Liang, Bao Li, Jinlin Wu, Zelin Zang, Zhen Lei PDF ↗
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
Mohsen Ghafoorian, Amirhossein Habibian arXiv ↗ PDF ↗
ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformers
Qinghao Zhong, Bingzhi Chen, Yishu Liu, Minhua Lu, Guangming Lu PDF ↗
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura arXiv ↗ PDF ↗
Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMG
Zhenghao Huang, Huilin Yao, Kaikai Wang, Lin Shu PDF ↗
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo PDF ↗
Reallocating Attention Across Layers to Reduce Multimodal Hallucination
Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang arXiv ↗ PDF ↗
Reconstructing CLIP for Open-Vocabulary Dense Perception
Yajie Liu, Jinjin Zhang, Qingjie Liu, Di Huang PDF ↗