PanoContext-Former: Panoramic Total Scene Understanding with a Transformer Yuan Dong, Chuan Fang, Liefeng Bo, Zilong Dong, Ping Tan PDF ↗
PanoOcc: Unified Occupancy Representation for Camera-based 3D Panoptic Segmentation Yuqi Wang, Yuntao Chen, Xingyu Liao, Lue Fan, Zhaoxiang Zhang arXiv ↗ PDF ↗
PanoRecon: Real-Time Panoptic 3D Reconstruction from Monocular Video Dong Wu, Zike Yan, Hongbin Zha PDF ↗
ParamISP: Learned Forward and Inverse ISPs using Camera Parameters Woohyeok Kim, Geonu Kim, Junyong Lee, Seungyong Lee, Seung-Hwan Baek, Sunghyun Cho arXiv ↗ PDF ↗
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model Zelin Peng, Zhengqin Xu, Zhilin Zeng, Lingxi Xie, Qi Tian, Wei Shen arXiv ↗ PDF ↗
Parameter Efficient Self-Supervised Geospatial Domain Adaptation Linus Scheibenreif, Michael Mommert, Damian Borth PDF ↗
ParameterNet: Parameters Are All You Need for Large-scale Visual Pretraining of Mobile Networks Kai Han, Yunhe Wang, Jianyuan Guo, Enhua Wu PDF ↗
Part-aware Unified Representation of Language and Skeleton for Zero-shot Action Recognition Anqi Zhu, Qiuhong Ke, Mingming Gong, James Bailey PDF ↗
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation Ardian Umam, Cheng-Kun Yang, Min-Hung Chen, Jen-Hui Chuang, Yen-Yu Lin arXiv ↗ PDF ↗
Partial-to-Partial Shape Matching with Geometric Consistency Viktoria Ehm, Maolin Gao, Paul Roetzer, Marvin Eisenberger, Daniel Cremers, Florian Bernard arXiv ↗ PDF ↗
Passive Snapshot Coded Aperture Dual-Pixel RGB-D Imaging Bhargav Ghanekar, Salman Siddique Khan, Pranav Sharma, Shreyas Singh, Vivek Boominathan, Kaushik Mitra, Ashok Veeraraghavan PDF ↗
Patch2Self2: Self-supervised Denoising on Coresets via Matrix Sketching Shreyas Fadnavis, Agniva Chowdhury, Joshua Batson, Petros Drineas, Eleftherios Garyfallidis PDF ↗
PatchFusion: An End-to-End Tile-Based Framework for High-Resolution Monocular Metric Depth Estimation Zhenyu Li, Shariq Farooq Bhat, Peter Wonka arXiv ↗ PDF ↗
PeLK: Parameter-efficient Large Kernel ConvNets with Peripheral Convolution Honghao Chen, Xiangxiang Chu, Yongjian Ren, Xin Zhao, Kaiqi Huang arXiv ↗ PDF ↗
PeVL: Pose-Enhanced Vision-Language Model for Fine-Grained Human Action Recognition Haosong Zhang, Mei Chee Leong, Liyuan Li, Weisi Lin PDF ↗
PeerAiD: Improving Adversarial Distillation from a Specialized Peer Tutor Jaewon Jung, Hongsun Jang, Jaeyong Song, Jinho Lee arXiv ↗ PDF ↗
PerAda: Parameter-Efficient Federated Learning Personalization with Generalization Guarantees Chulin Xie, De-An Huang, Wenda Chu, Daguang Xu, Chaowei Xiao, Bo Li, Anima Anandkumar arXiv ↗ PDF ↗
Perception-Oriented Video Frame Interpolation via Asymmetric Blending Guangyang Wu, Xin Tao, Changlin Li, Wenyi Wang, Xiaohong Liu, Qingqing Zheng arXiv ↗ PDF ↗
Perceptual Assessment and Optimization of HDR Image Rendering Peibei Cao, Rafal K. Mantiuk, Kede Ma PDF ↗
Permutation Equivariance of Transformers and Its Applications Hengyuan Xu, Liyao Xiang, Hangyu Ye, Dixi Yao, Pengzhi Chu, Baochun Li arXiv ↗ PDF ↗
Person in Place: Generating Associative Skeleton-Guidance Maps for Human-Object Interaction Image Editing ChangHee Yang, ChanHee Kang, Kyeongbo Kong, Hanni Oh, Suk-Ju Kang PDF ↗
Person-in-WiFi 3D: End-to-End Multi-Person 3D Pose Estimation with Wi-Fi Kangwei Yan, Fei Wang, Bo Qian, Han Ding, Jinsong Han, Xing Wei PDF ↗
Personalized Residuals for Concept-Driven Text-to-Image Generation Cusuh Ham, Matthew Fisher, James Hays, Nicholas Kolkin, Yuchen Liu, Richard Zhang, Tobias Hinz arXiv ↗ PDF ↗
Perturbing Attention Gives You More Bang for the Buck: Subtle Imaging Perturbations That Efficiently Fool Customized Diffusion Models Jingyao Xu, Yuetong Lu, Yandong Li, Siyang Lu, Dongdong Wang, Xiang Wei arXiv ↗ PDF ↗
Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular Stereo and RGB-D Cameras Huajian Huang, Longwei Li, Hui Cheng, Sai-Kit Yeung PDF ↗
PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding Zhen Li, Mingdeng Cao, Xintao Wang, Zhongang Qi, Ming-Ming Cheng, Ying Shan arXiv ↗ PDF ↗
PhysPT: Physics-aware Pretrained Transformer for Estimating Human Dynamics from Monocular Videos Yufei Zhang, Jeffrey O. Kephart, Zijun Cui, Qiang Ji arXiv ↗ PDF ↗
Physical 3D Adversarial Attacks against Monocular Depth Estimation in Autonomous Driving Junhao Zheng, Chenhao Lin, Jiahao Sun, Zhengyu Zhao, Qian Li, Chao Shen arXiv ↗ PDF ↗
Physical Backdoor: Towards Temperature-based Backdoor Attacks in the Physical World Wen Yin, Jian Lou, Pan Zhou, Yulai Xie, Dan Feng, Yuhua Sun, Tailai Zhang, Lichao Sun arXiv ↗ PDF ↗
Physical Property Understanding from Language-Embedded Feature Fields Albert J. Zhai, Yuan Shen, Emily Y. Chen, Gloria X. Wang, Xinlei Wang, Sheng Wang, Kaiyu Guan, Shenlong Wang arXiv ↗ PDF ↗
Physics-guided Shape-from-Template: Monocular Video Perception through Neural Surrogate Models David Stotko, Nils Wandel, Reinhard Klein PDF ↗
Pick-or-Mix: Dynamic Channel Sampling for ConvNets Ashish Kumar, Daneul Kim, Jaesik Park, Laxmidhar Behera PDF ↗
PikeLPN: Mitigating Overlooked Inefficiencies of Low-Precision Neural Networks Marina Neseem, Conor McCullough, Randy Hsin, Chas Leichner, Shan Li, In Suk Chong, Andrew Howard, Lukasz Lew, Sherief Reda, Ville-Mikko Rautio, Daniele Moro arXiv ↗ PDF ↗
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs Shiyu Xuan, Qingpei Guo, Ming Yang, Shiliang Zhang arXiv ↗ PDF ↗
Pixel-Aligned Language Model Jiarui Xu, Xingyi Zhou, Shen Yan, Xiuye Gu, Anurag Arnab, Chen Sun, Xiaolong Wang, Cordelia Schmid arXiv ↗ PDF ↗
Pixel-level Semantic Correspondence through Layout-aware Representation Learning and Multi-scale Matching Integration Yixuan Sun, Zhangyue Yin, Haibo Wang, Yan Wang, Xipeng Qiu, Weifeng Ge, Wenqiang Zhang PDF ↗
PixelLM: Pixel Reasoning with Large Multimodal Model Zhongwei Ren, Zhicheng Huang, Yunchao Wei, Yao Zhao, Dongmei Fu, Jiashi Feng, Xiaojie Jin arXiv ↗ PDF ↗
PixelRNN: In-pixel Recurrent Neural Networks for End-to-end-optimized Perception with Neural Sensors Haley M. So, Laurie Bose, Piotr Dudek, Gordon Wetzstein arXiv ↗ PDF ↗
PlatoNeRF: 3D Reconstruction in Plato's Cave via Single-View Two-Bounce Lidar Tzofi Klinghoffer, Xiaoyu Xiang, Siddharth Somasundaram, Yuchen Fan, Christian Richardt, Ramesh Raskar, Rakesh Ranjan PDF ↗
Plug and Play Active Learning for Object Detection Chenhongyi Yang, Lichao Huang, Elliot J. Crowley arXiv ↗ PDF ↗
Plug-and-Play Diffusion Distillation Yi-Ting Hsiao, Siavash Khodadadeh, Kevin Duarte, Wei-An Lin, Hui Qu, Mingi Kwon, Ratheesh Kalarot PDF ↗
PoNQ: a Neural QEM-based Mesh Representation Nissim Maruani, Maks Ovsjanikov, Pierre Alliez, Mathieu Desbrun arXiv ↗ PDF ↗
Point Cloud Pre-training with Diffusion Models Xiao Zheng, Xiaoshui Huang, Guofeng Mei, Yuenan Hou, Zhaoyang Lyu, Bo Dai, Wanli Ouyang, Yongshun Gong arXiv ↗ PDF ↗
Point Segment and Count: A Generalized Framework for Object Counting Zhizhong Huang, Mingliang Dai, Yi Zhang, Junping Zhang, Hongming Shan arXiv ↗ PDF ↗
Point Transformer V3: Simpler Faster Stronger Xiaoyang Wu, Li Jiang, Peng-Shuai Wang, Zhijian Liu, Xihui Liu, Yu Qiao, Wanli Ouyang, Tong He, Hengshuang Zhao arXiv ↗ PDF ↗
Point-VOS: Pointing Up Video Object Segmentation Sabarinath Mahadevan, Idil Esen Zulfikar, Paul Voigtlaender, Bastian Leibe PDF ↗
Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point Supervision Yi Yu, Xue Yang, Qingyun Li, Feipeng Da, Jifeng Dai, Yu Qiao, Junchi Yan arXiv ↗ PDF ↗
PointBeV: A Sparse Approach for BeV Predictions Loick Chambon, Eloi Zablocki, Mickaël Chen, Florent Bartoccioni, Patrick Pérez, Matthieu Cord PDF ↗
PointInfinity: Resolution-Invariant Point Diffusion Models Zixuan Huang, Justin Johnson, Shoubhik Debnath, James M. Rehg, Chao-Yuan Wu arXiv ↗ PDF ↗
PointOBB: Learning Oriented Object Detection via Single Point Supervision Junwei Luo, Xue Yang, Yi Yu, Qingyun Li, Junchi Yan, Yansheng Li arXiv ↗ PDF ↗
PolarMatte: Fully Computational Ground-Truth-Quality Alpha Matte Extraction for Images and Video using Polarized Screen Matting Kenji Enomoto, TJ Rhodes, Brian Price, Gavin Miller PDF ↗
PolarRec: Improving Radio Interferometric Data Reconstruction Using Polar Coordinates Ruoqi Wang, Zhuoyang Chen, Jiayi Zhu, Qiong Luo, Feng Wang PDF ↗
Polarization Wavefront Lidar: Learning Large Scene Reconstruction from Polarized Wavefronts Dominik Scheuble, Chenyang Lei, Seung-Hwan Baek, Mario Bijelic, Felix Heide PDF ↗
Poly Kernel Inception Network for Remote Sensing Detection Xinhao Cai, Qiuxia Lai, Yuwei Wang, Wenguan Wang, Zeren Sun, Yazhou Yao arXiv ↗ PDF ↗
Portrait4D: Learning One-Shot 4D Head Avatar Synthesis using Synthetic Data Yu Deng, Duomin Wang, Xiaohang Ren, Xingyu Chen, Baoyuan Wang PDF ↗
PortraitBooth: A Versatile Portrait Model for Fast Identity-preserved Personalization Xu Peng, Junwei Zhu, Boyuan Jiang, Ying Tai, Donghao Luo, Jiangning Zhang, Wei Lin, Taisong Jin, Chengjie Wang, Rongrong Ji arXiv ↗ PDF ↗
Pose Adapted Shape Learning for Large-Pose Face Reenactment Gee-Sern Jison Hsu, Jie-Ying Zhang, Huang Yu Hsiang, Wei-Jie Hong PDF ↗
PoseIRM: Enhance 3D Human Pose Estimation on Unseen Camera Settings via Invariant Risk Minimization Yanlu Cai, Weizhong Zhang, Yuan Wu, Cheng Jin PDF ↗
Positive-Unlabeled Learning by Latent Group-Aware Meta Disambiguation Lin Long, Haobo Wang, Zhijie Jiang, Lei Feng, Chang Yao, Gang Chen, Junbo Zhao PDF ↗
PostureHMR: Posture Transformation for 3D Human Mesh Recovery Yu-Pei Song, Xiao Wu, Zhaoquan Yuan, Jian-Jun Qiao, Qiang Peng PDF ↗
PrPSeg: Universal Proposition Learning for Panoramic Renal Pathology Segmentation Ruining Deng, Quan Liu, Can Cui, Tianyuan Yao, Jialin Yue, Juming Xiong, Lining Yu, Yifei Wu, Mengmeng Yin, Yu Wang, Shilin Zhao, Yucheng Tang, Haichun Yang, Yuankai Huo arXiv ↗ PDF ↗
Practical Measurements of Translucent Materials with Inter-Pixel Translucency Prior Zhenyu Chen, Jie Guo, Shuichang Lai, Ruoyu Fu, Mengxun Kong, Chen Wang, Hongyu Sun, Zhebin Zhang, Chen Li, Yanwen Guo PDF ↗
PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization Zining Chen, Weiqiu Wang, Zhicheng Zhao, Fei Su, Aidong Men, Hongying Meng arXiv ↗ PDF ↗
Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial Robustness Sibo Wang, Jie Zhang, Zheng Yuan, Shiguang Shan arXiv ↗ PDF ↗
Pre-trained Vision and Language Transformers Are Few-Shot Incremental Learners Keon-Hee Park, Kyungwoo Song, Gyeong-Moon Park arXiv ↗ PDF ↗
Pre-training Vision Models with Mandelbulb Variations Benjamin Naoto Chiche, Yuto Horikawa, Ryo Fujita PDF ↗
PredToken: Predicting Unknown Tokens and Beyond with Coarse-to-Fine Iterative Decoding Xuesong Nie, Haoyuan Jin, Yunfeng Yan, Xi Chen, Zhihang Zhu, Donglian Qi PDF ↗
Preserving Fairness Generalization in Deepfake Detection Li Lin, Xinan He, Yan Ju, Xin Wang, Feng Ding, Shu Hu arXiv ↗ PDF ↗
Previously on ... From Recaps to Story Summarization Aditya Kumar Singh, Dhruv Srivastava, Makarand Tapaswi arXiv ↗ PDF ↗
Privacy-Preserving Face Recognition Using Trainable Feature Subtraction Yuxi Mi, Zhizhou Zhong, Yuge Huang, Jiazhen Ji, Jianqing Xu, Jun Wang, Shaoming Wang, Shouhong Ding, Shuigeng Zhou arXiv ↗ PDF ↗
Privacy-Preserving Optics for Enhancing Protection in Face De-Identification Jhon Lopez, Carlos Hinojosa, Henry Arguello, Bernard Ghanem arXiv ↗ PDF ↗
ProMark: Proactive Diffusion Watermarking for Causal Attribution Vishal Asnani, John Collomosse, Tu Bui, Xiaoming Liu, Shruti Agarwal arXiv ↗ PDF ↗
ProMotion: Prototypes As Motion Learners Yawen Lu, Dongfang Liu, Qifan Wang, Cheng Han, Yiming Cui, Zhiwen Cao, Xueling Zhang, Yingjie Victor Chen, Heng Fan PDF ↗
ProS: Prompting-to-simulate Generalized knowledge for Universal Cross-Domain Retrieval Kaipeng Fang, Jingkuan Song, Lianli Gao, Pengpeng Zeng, Zhi-Qi Cheng, Xiyao Li, Heng Tao Shen arXiv ↗ PDF ↗
ProTeCt: Prompt Tuning for Taxonomic Open Set Classification Tz-Ying Wu, Chih-Hui Ho, Nuno Vasconcelos arXiv ↗ PDF ↗
Probabilistic Sampling of Balanced K-Means using Adiabatic Quantum Computing Jan-Nico Zaech, Martin Danelljan, Tolga Birdal, Luc Van Gool PDF ↗
Probabilistic Speech-Driven 3D Facial Motion Synthesis: New Benchmarks Methods and Applications Karren D. Yang, Anurag Ranjan, Jen-Hao Rick Chang, Raviteja Vemulapalli, Oncel Tuzel arXiv ↗ PDF ↗
Probing Synergistic High-Order Interaction in Infrared and Visible Image Fusion Naishan Zheng, Man Zhou, Jie Huang, Junming Hou, Haoying Li, Yuan Xu, Feng Zhao PDF ↗
Probing the 3D Awareness of Visual Foundation Models Mohamed El Banani, Amit Raj, Kevis-Kokitsi Maninis, Abhishek Kar, Yuanzhen Li, Michael Rubinstein, Deqing Sun, Leonidas Guibas, Justin Johnson, Varun Jampani arXiv ↗ PDF ↗
Producing and Leveraging Online Map Uncertainty in Trajectory Prediction Xunjiang Gu, Guanyu Song, Igor Gilitschenski, Marco Pavone, Boris Ivanovic arXiv ↗ PDF ↗
Progress-Aware Online Action Segmentation for Egocentric Procedural Task Videos Yuhan Shen, Ehsan Elhamifar PDF ↗
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning Shiming Chen, Wenjin Hou, Salman Khan, Fahad Shahbaz Khan arXiv ↗ PDF ↗
Projecting Trackable Thermal Patterns for Dynamic Computer Vision Mark Sheinin, Aswin C. Sankaranarayanan, Srinivasa G. Narasimhan PDF ↗
Prompt Augmentation for Self-supervised Text-guided Image Manipulation Rumeysa Bodur, Binod Bhattarai, Tae-Kyun Kim PDF ↗
Prompt Highlighter: Interactive Control for Multi-Modal LLMs Yuechen Zhang, Shengju Qian, Bohao Peng, Shu Liu, Jiaya Jia arXiv ↗ PDF ↗
Prompt-Driven Dynamic Object-Centric Learning for Single Domain Generalization Deng Li, Aming Wu, Yaowei Wang, Yahong Han arXiv ↗ PDF ↗
Prompt-Driven Referring Image Segmentation with Instance Contrasting Chao Shang, Zichen Song, Heqian Qiu, Lanxiao Wang, Fanman Meng, Hongliang Li PDF ↗
Prompt-Enhanced Multiple Instance Learning for Weakly Supervised Video Anomaly Detection Junxi Chen, Liang Li, Li Su, Zheng-jun Zha, Qingming Huang PDF ↗
Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion Models Xingqian Xu, Jiayi Guo, Zhangyang Wang, Gao Huang, Irfan Essa, Humphrey Shi arXiv ↗ PDF ↗
Prompt3D: Random Prompt Assisted Weakly-Supervised 3D Object Detection Xiaohong Zhang, Huisheng Ye, Jingwen Li, Qinyu Tang, Yuanqi Li, Yanwen Guo, Jie Guo PDF ↗
PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection Xiaofan Li, Zhizhong Zhang, Xin Tan, Chengwei Chen, Yanyun Qu, Yuan Xie, Lizhuang Ma arXiv ↗ PDF ↗
PromptCoT: Align Prompt Distribution via Adapted Chain-of-Thought Junyi Yao, Yijiang Liu, Zhen Dong, Mingfei Guo, Helan Hu, Kurt Keutzer, Li Du, Daquan Zhou, Shanghang Zhang PDF ↗
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models Zheng Li, Xiang Li, Xinyi Fu, Xin Zhang, Weiqiang Wang, Shuo Chen, Jian Yang arXiv ↗ PDF ↗
Promptable Behaviors: Personalizing Multi-Objective Rewards from Human Preferences Minyoung Hwang, Luca Weihs, Chanwoo Park, Kimin Lee, Aniruddha Kembhavi, Kiana Ehsani arXiv ↗ PDF ↗
Prompting Hard or Hardly Prompting: Prompt Inversion for Text-to-Image Diffusion Models Shweta Mahajan, Tanzila Rahman, Kwang Moo Yi, Leonid Sigal arXiv ↗ PDF ↗
Prompting Vision Foundation Models for Pathology Image Analysis Chong Yin, Siqi Liu, Kaiyang Zhou, Vincent Wai-Sun Wong, Pong C. Yuen PDF ↗
ProxyCap: Real-time Monocular Full-body Capture in World Space via Human-Centric Proxy-to-Motion Learning Yuxiang Zhang, Hongwen Zhang, Liangxiao Hu, Jiajun Zhang, Hongwei Yi, Shengping Zhang, Yebin Liu arXiv ↗ PDF ↗
Pseudo Label Refinery for Unsupervised Domain Adaptation on Cross-dataset 3D Object Detection Zhanwei Zhang, Minghao Chen, Shuai Xiao, Liang Peng, Hengjia Li, Binbin Lin, Ping Li, Wenxiao Wang, Boxi Wu, Deng Cai arXiv ↗ PDF ↗
Psychometry: An Omnifit Model for Image Reconstruction from Human Brain Activity Ruijie Quan, Wenguan Wang, Zhibo Tian, Fan Ma, Yi Yang arXiv ↗ PDF ↗
Puff-Net: Efficient Style Transfer with Pure Content and Style Feature Fusion Network Sizhe Zheng, Pan Gao, Peng Zhou, Jie Qin PDF ↗
Purified and Unified Steganographic Network Guobiao Li, Sheng Li, Zicong Luo, Zhenxing Qian, Xinpeng Zhang arXiv ↗ PDF ↗
Q-Instruct: Improving Low-level Visual Abilities for Multi-modality Foundation Models Haoning Wu, Zicheng Zhang, Erli Zhang, Chaofeng Chen, Liang Liao, Annan Wang, Kaixin Xu, Chunyi Li, Jingwen Hou, Guangtao Zhai, Geng Xue, Wenxiu Sun, Qiong Yan, Weisi Lin PDF ↗
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition Xiang Li, Jinglu Wang, Xiaohao Xu, Xiulian Peng, Rita Singh, Yan Lu, Bhiksha Raj arXiv ↗ PDF ↗
QN-Mixer: A Quasi-Newton MLP-Mixer Model for Sparse-View CT Reconstruction Ishak Ayad, Nicolas Larue, Mai K. Nguyen PDF ↗
Quantifying Uncertainty in Motion Prediction with Variational Bayesian Mixture Juanwu Lu, Can Cui, Yunsheng Ma, Aniket Bera, Ziran Wang arXiv ↗ PDF ↗
Querying as Prompt: Parameter-Efficient Learning for Multimodal Language Model Tian Liang, Jing Huang, Ming Kong, Luyuan Chen, Qiang Zhu PDF ↗
Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology Videos Mehmet Saygin Seyfioglu, Wisdom O. Ikezogwo, Fatemeh Ghezloo, Ranjay Krishna, Linda Shapiro PDF ↗
R-Cyclic Diffuser: Reductive and Cyclic Latent Diffusion for 3D Clothed Human Digitalization Kennard Yanting Chan, Fayao Liu, Guosheng Lin, Chuan Sheng Foo, Weisi Lin PDF ↗
RAM-Avatar: Real-time Photo-Realistic Avatar from Monocular Videos with Full-body Control Xiang Deng, Zerong Zheng, Yuxiang Zhang, Jingxiang Sun, Chao Xu, Xiaodong Yang, Lizhen Wang, Yebin Liu PDF ↗
RCBEVDet: Radar-camera Fusion in Bird's Eye View for 3D Object Detection Zhiwei Lin, Zhe Liu, Zhongyu Xia, Xinhao Wang, Yongtao Wang, Shengxiang Qi, Yang Dong, Nan Dong, Le Zhang, Ce Zhu PDF ↗
RCL: Reliable Continual Learning for Unified Failure Detection Fei Zhu, Zhen Cheng, Xu-Yao Zhang, Cheng-Lin Liu, Zhaoxiang Zhang PDF ↗
RCooper: A Real-world Large-scale Dataset for Roadside Cooperative Perception Ruiyang Hao, Siqi Fan, Yingru Dai, Zhenlin Zhang, Chenxi Li, Yuntian Wang, Haibao Yu, Wenxian Yang, Jirui Yuan, Zaiqing Nie arXiv ↗ PDF ↗
REACTO: Reconstructing Articulated Objects from a Single Video Chaoyue Song, Jiacheng Wei, Chuan Sheng Foo, Guosheng Lin, Fayao Liu arXiv ↗ PDF ↗
READ: Retrieval-Enhanced Asymmetric Diffusion for Motion Planning Takeru Oba, Matthew Walter, Norimichi Ukita PDF ↗
RELI11D: A Comprehensive Multimodal Human Motion Dataset and Method Ming Yan, Yan Zhang, Shuqiang Cai, Shuqi Fan, Xincheng Lin, Yudi Dai, Siqi Shen, Chenglu Wen, Lan Xu, Yuexin Ma, Cheng Wang arXiv ↗ PDF ↗
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos Hongchi Xia, Yang Fu, Sifei Liu, Xiaolong Wang PDF ↗
RILA: Reflective and Imaginative Language Agent for Zero-Shot Semantic Audio-Visual Navigation Zeyuan Yang, Jiageng Liu, Peihao Chen, Anoop Cherian, Tim K. Marks, Jonathan Le Roux, Chuang Gan PDF ↗
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback Tianyu Yu, Yuan Yao, Haoye Zhang, Taiwen He, Yifeng Han, Ganqu Cui, Jinyi Hu, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun, Tat-Seng Chua PDF ↗
RMT: Retentive Networks Meet Vision Transformers Qihang Fan, Huaibo Huang, Mingrui Chen, Hongmin Liu, Ran He arXiv ↗ PDF ↗
RMem: Restricted Memory Banks Improve Video Object Segmentation Junbao Zhou, Ziqi Pang, Yu-Xiong Wang PDF ↗
RNb-NeuS: Reflectance and Normal-based Multi-View 3D Reconstruction Baptiste Brument, Robin Bruneau, Yvain Quéau, Jean Mélou, François Bernard Lauze, Jean-Denis Durou, Lilian Calvet PDF ↗
RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation Peng Lu, Tao Jiang, Yining Li, Xiangtai Li, Kai Chen, Wenming Yang arXiv ↗ PDF ↗
RTracker: Recoverable Tracking via PN Tree Structured Memory Yuqing Huang, Xin Li, Zikun Zhou, Yaowei Wang, Zhenyu He, Ming-Hsuan Yang arXiv ↗ PDF ↗
RadSimReal: Bridging the Gap Between Synthetic and Real Data in Radar Object Detection With Simulation Oded Bialer, Yuval Haitman arXiv ↗ PDF ↗
RadarDistill: Boosting Radar-based Object Detection Performance via Knowledge Distillation from LiDAR Features Geonho Bang, Kwangjin Choi, Jisong Kim, Dongsuk Kum, Jun Won Choi arXiv ↗ PDF ↗
Random Entangled Tokens for Adversarially Robust Vision Transformer Huihui Gong, Minjing Dong, Siqi Ma, Seyit Camtepe, Surya Nepal, Chang Xu PDF ↗
RankED: Addressing Imbalance and Uncertainty in Edge Detection Using Ranking-based Losses Bedrettin Cetinkaya, Sinan Kalkan, Emre Akbas arXiv ↗ PDF ↗
RankMatch: Exploring the Better Consistency Regularization for Semi-supervised Semantic Segmentation Huayu Mai, Rui Sun, Tianzhu Zhang, Feng Wu PDF ↗
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels Tianming Liang, Chaolei Tan, Beihao Xia, Wei-Shi Zheng, Jian-Fang Hu arXiv ↗ PDF ↗
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following Yutong Feng, Biao Gong, Di Chen, Yujun Shen, Yu Liu, Jingren Zhou arXiv ↗ PDF ↗
Rapid Motor Adaptation for Robotic Manipulator Arms Yichao Liang, Kevin Ellis, João Henriques arXiv ↗ PDF ↗
Re-thinking Data Availability Attacks Against Deep Neural Networks Bin Fang, Bo Li, Shuang Wu, Shouhong Ding, Ran Yi, Lizhuang Ma PDF ↗
ReCoRe: Regularized Contrastive Representation Learning of World Model Rudra P.K. Poudel, Harit Pandya, Stephan Liwicki, Roberto Cipolla arXiv ↗ PDF ↗
ReGenNet: Towards Human Action-Reaction Synthesis Liang Xu, Yizhou Zhou, Yichao Yan, Xin Jin, Wenhan Zhu, Fengyun Rao, Xiaokang Yang, Wenjun Zeng arXiv ↗ PDF ↗
Real-IAD: A Real-World Multi-View Dataset for Benchmarking Versatile Industrial Anomaly Detection Chengjie Wang, Wenbing Zhu, Bin-Bin Gao, Zhenye Gan, Jiangning Zhang, Zhihao Gu, Shuguang Qian, Mingang Chen, Lizhuang Ma PDF ↗
Real-Time Exposure Correction via Collaborative Transformations and Adaptive Sampling Ziwen Li, Feng Zhang, Meng Cao, Jinpu Zhang, Yuanjie Shao, Yuehuan Wang, Nong Sang PDF ↗
Real-Time Neural BRDF with Spherically Distributed Primitives Yishun Dou, Zhong Zheng, Qiaoqiao Jin, Bingbing Ni, Yugang Chen, Junxiang Ke arXiv ↗ PDF ↗
Real-World Efficient Blind Motion Deblurring via Blur Pixel Discretization Insoo Kim, Jae Seok Choi, Geonseok Seo, Kinam Kwon, Jinwoo Shin, Hyong-Euk Lee arXiv ↗ PDF ↗
Real-World Mobile Image Denoising Dataset with Efficient Baselines Roman Flepp, Andrey Ignatov, Radu Timofte, Luc Van Gool PDF ↗
Real-time Acquisition and Reconstruction of Dynamic Volumes with Neural Structured Illumination Yixin Zeng, Zoubin Bi, Mingrui Yin, Xiang Feng, Kun Zhou, Hongzhi Wu PDF ↗
RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image Customization Mengqi Huang, Zhendong Mao, Mingcong Liu, Qian He, Yongdong Zhang arXiv ↗ PDF ↗
RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly Detection Ximiao Zhang, Min Xu, Xiuzhuang Zhou arXiv ↗ PDF ↗
Realigning Confidence with Temporal Saliency Information for Point-Level Weakly-Supervised Temporal Action Localization Ziying Xia, Jian Cheng, Siyu Liu, Yongxiang Hu, Shiguang Wang, Yijie Zhang, Liwan Dang PDF ↗
RecDiffusion: Rectangling for Image Stitching with Diffusion Models Tianhao Zhou, Haipeng Li, Ziyi Wang, Ao Luo, Chen-Lin Zhang, Jiajun Li, Bing Zeng, Shuaicheng Liu arXiv ↗ PDF ↗
ReconFusion: 3D Reconstruction with Diffusion Priors Rundi Wu, Ben Mildenhall, Philipp Henzler, Keunhong Park, Ruiqi Gao, Daniel Watson, Pratul P. Srinivasan, Dor Verbin, Jonathan T. Barron, Ben Poole, Aleksander Ho?y?ski arXiv ↗ PDF ↗
Reconstructing Hands in 3D with Transformers Georgios Pavlakos, Dandan Shan, Ilija Radosavovic, Angjoo Kanazawa, David Fouhey, Jitendra Malik arXiv ↗ PDF ↗
Referring Image Editing: Object-level Image Editing via Referring Expressions Chang Liu, Xiangtai Li, Henghui Ding PDF ↗
Reg-PTQ: Regression-specialized Post-training Quantization for Fully Quantized Object Detector Yifu Ding, Weilun Feng, Chuyan Chen, Jinyang Guo, Xianglong Liu PDF ↗
Region-Based Representations Revisited Michal Shlapentokh-Rothman, Ansel Blume, Yao Xiao, Yuqun Wu, Sethuraman TV, Heyi Tao, Jae Yong Lee, Wilfredo Torres, Yu-Xiong Wang, Derek Hoiem arXiv ↗ PDF ↗
RegionGPT: Towards Region Understanding Vision Language Model Qiushan Guo, Shalini De Mello, Hongxu Yin, Wonmin Byeon, Ka Chun Cheung, Yizhou Yu, Ping Luo, Sifei Liu arXiv ↗ PDF ↗
RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding Jihan Yang, Runyu Ding, Weipeng Deng, Zhe Wang, Xiaojuan Qi arXiv ↗ PDF ↗
Regressor-Segmenter Mutual Prompt Learning for Crowd Counting Mingyue Guo, Li Yuan, Zhaoyi Yan, Binghui Chen, Yaowei Wang, Qixiang Ye arXiv ↗ PDF ↗
Regularized Parameter Uncertainty for Improving Generalization in Reinforcement Learning Pehuen Moure, Longbiao Cheng, Joachim Ott, Zuowen Wang, Shih-Chii Liu PDF ↗
Relational Matching for Weakly Semi-Supervised Oriented Object Detection Wenhao Wu, Hau-San Wong, Si Wu, Tianyou Zhang PDF ↗
Relaxed Contrastive Learning for Federated Learning Seonguk Seo, Jinkyu Kim, Geeho Kim, Bohyung Han arXiv ↗ PDF ↗
Relightable Gaussian Codec Avatars Shunsuke Saito, Gabriel Schwartz, Tomas Simon, Junxuan Li, Giljoo Nam arXiv ↗ PDF ↗
Relightful Harmonization: Lighting-aware Portrait Background Replacement Mengwei Ren, Wei Xiong, Jae Shin Yoon, Zhixin Shu, Jianming Zhang, HyunJoon Jung, Guido Gerig, He Zhang arXiv ↗ PDF ↗
RepAn: Enhanced Annealing through Re-parameterization Xiang Fei, Xiawu Zheng, Yan Wang, Fei Chao, Chenglin Wu, Liujuan Cao PDF ↗
RepKPU: Point Cloud Upsampling with Kernel Point Representation and Deformation Yi Rong, Haoran Zhou, Kang Xia, Cheng Mei, Jiahao Wang, Tong Lu PDF ↗
RepViT: Revisiting Mobile CNN From ViT Perspective Ao Wang, Hui Chen, Zijia Lin, Jungong Han, Guiguang Ding arXiv ↗ PDF ↗
Representing Part-Whole Hierarchies in Foundation Models by Learning Localizability Composability and Decomposability from Anatomy via Self Supervision Mohammad Reza Hosseinzadeh Taher, Michael B. Gotway, Jianming Liang arXiv ↗ PDF ↗
Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation Bingxin Ke, Anton Obukhov, Shengyu Huang, Nando Metzger, Rodrigo Caye Daudt, Konrad Schindler arXiv ↗ PDF ↗
Residual Denoising Diffusion Models Jiawei Liu, Qiang Wang, Huijie Fan, Yinong Wang, Yandong Tang, Liangqiong Qu arXiv ↗ PDF ↗
Resolution Limit of Single-Photon LiDAR Stanley H. Chan, Hashan K. Weerasooriya, Weijian Zhang, Pamela Abshire, Istvan Gyongy, Robert K. Henderson arXiv ↗ PDF ↗
Resource-Efficient Transformer Pruning for Finetuning of Large Models Fatih Ilhan, Gong Su, Selim Furkan Tekin, Tiansheng Huang, Sihao Hu, Ling Liu PDF ↗
Resurrecting Old Classes with New Data for Exemplar-Free Continual Learning Dipam Goswami, Albin Soutif-Cormerais, Yuyang Liu, Sandesh Kamath, Bart?omiej Twardowski, Joost van de Weijer PDF ↗
Rethinking Boundary Discontinuity Problem for Oriented Object Detection Hang Xu, Xinyuan Liu, Haonan Xu, Yike Ma, Zunjie Zhu, Chenggang Yan, Feng Dai arXiv ↗ PDF ↗
Rethinking Diffusion Model for Multi-Contrast MRI Super-Resolution Guangyuan Li, Chen Rao, Juncheng Mo, Zhanjie Zhang, Wei Xing, Lei Zhao arXiv ↗ PDF ↗
Rethinking Few-shot 3D Point Cloud Semantic Segmentation Zhaochong An, Guolei Sun, Yun Liu, Fayao Liu, Zongwei Wu, Dan Wang, Luc Van Gool, Serge Belongie arXiv ↗ PDF ↗
Rethinking Human Motion Prediction with Symplectic Integral Haipeng Chen, Kedi Lyu, Zhenguang Liu, Yifang Yin, Xun Yang, Yingda Lyu PDF ↗
Rethinking Inductive Biases for Surface Normal Estimation Gwangbin Bae, Andrew J. Davison arXiv ↗ PDF ↗
Rethinking Interactive Image Segmentation with Low Latency High Quality and Diverse Prompts Qin Liu, Jaemin Cho, Mohit Bansal, Marc Niethammer arXiv ↗ PDF ↗
Rethinking Multi-domain Generalization with A General Learning Objective Zhaorui Tan, Xi Yang, Kaizhu Huang arXiv ↗ PDF ↗
Rethinking Multi-view Representation Learning via Distilled Disentangling Guanzhou Ke, Bo Wang, Xiaoli Wang, Shengfeng He arXiv ↗ PDF ↗
Rethinking Prior Information Generation with CLIP for Few-Shot Segmentation Jin Wang, Bingfeng Zhang, Jian Pang, Honglong Chen, Weifeng Liu arXiv ↗ PDF ↗
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery Mubashir Noman, Muzammal Naseer, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Shahbaz Khan arXiv ↗ PDF ↗
Rethinking the Evaluation Protocol of Domain Generalization Han Yu, Xingxuan Zhang, Renzhe Xu, Jiashuo Liu, Yue He, Peng Cui arXiv ↗ PDF ↗
Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis Yuchao Gu, Xintao Wang, Yixiao Ge, Ying Shan, Mike Zheng Shou arXiv ↗ PDF ↗
Rethinking the Representation in Federated Unsupervised Learning with Non-IID Data Xinting Liao, Weiming Liu, Chaochao Chen, Pengyang Zhou, Fengyuan Yu, Huabin Zhu, Binhui Yao, Tao Wang, Xiaolin Zheng, Yanchao Tan arXiv ↗ PDF ↗
Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance Dazhong Shen, Guanglu Song, Zeyue Xue, Fu-Yun Wang, Yu Liu arXiv ↗ PDF ↗
Rethinking the Up-Sampling Operations in CNN-based Generative Network for Generalizable Deepfake Detection Chuangchuang Tan, Yao Zhao, Shikui Wei, Guanghua Gu, Ping Liu, Yunchao Wei arXiv ↗ PDF ↗
Retraining-Free Model Quantization via One-Shot Weight-Coupling Learning Chen Tang, Yuan Meng, Jiacheng Jiang, Shuzhao Xie, Rongwei Lu, Xinzhu Ma, Zhi Wang, Wenwu Zhu arXiv ↗ PDF ↗
Retrieval-Augmented Egocentric Video Captioning Jilan Xu, Yifei Huang, Junlin Hou, Guo Chen, Yuejie Zhang, Rui Feng, Weidi Xie arXiv ↗ PDF ↗
Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation Daichi Horita, Naoto Inoue, Kotaro Kikuchi, Kota Yamaguchi, Kiyoharu Aizawa arXiv ↗ PDF ↗
Retrieval-Augmented Open-Vocabulary Object Detection Jooyeon Kim, Eulrang Cho, Sehyung Kim, Hyunwoo J. Kim arXiv ↗ PDF ↗
Revamping Federated Learning Security from a Defender's Perspective: A Unified Defense with Homomorphic Encrypted Data Space K Naveen Kumar, Reshmi Mitra, C Krishna Mohan PDF ↗
Revisiting Adversarial Training Under Long-Tailed Distributions Xinli Yue, Ningping Mou, Qian Wang, Lingchen Zhao arXiv ↗ PDF ↗
Revisiting Adversarial Training at Scale Zeyu Wang, Xianhang Li, Hongru Zhu, Cihang Xie arXiv ↗ PDF ↗
Revisiting Global Translation Estimation with Feature Tracks Peilin Tao, Hainan Cui, Mengqi Rong, Shuhan Shen PDF ↗
Revisiting Non-Autoregressive Transformers for Efficient Image Synthesis Zanlin Ni, Yulin Wang, Renping Zhou, Jiayi Guo, Jinyi Hu, Zhiyuan Liu, Shiji Song, Yuan Yao, Gao Huang PDF ↗
Revisiting Sampson Approximations for Geometric Estimation Problems Felix Rydell, Angélica Torres, Viktor Larsson arXiv ↗ PDF ↗