Leveraging Verifier-Based Reinforcement Learning in Image Editing Hanzhong Guo, Jie Wu, Jie Liu, Yu Gao, Zilyu Ye, Linxiao Yuan, Xionghui Wang, Yizhou Yu, Weilin Huang arXiv ↗ PDF ↗
LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving Qihao Sun, Jiarun Liu, Ziqian Ni, Jianyun Xu, Sheng Yang, Tao Xie, Lijun Zhao, Ruifeng Li arXiv ↗ PDF ↗
LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration Aditya Ranjan Dash, Ramy Battrawy, René Schuster, Didier Stricker arXiv ↗ PDF ↗
Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment Fanqi Yu, Matteo Tiezzi, Tommaso Apicella, Cigdem Beyan, Vittorio Murino arXiv ↗ PDF ↗
LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang arXiv ↗ PDF ↗
Linking Perception, Confidence and Accuracy in MLLMs Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu arXiv ↗ PDF ↗
LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimation Yusheng Li, Lizhi Lou, Yan Tang, Zekai Miao, Shaoming Zhang, Jianmei Wang PDF ↗
LiveGesture: Streamable Co-Speech Gesture Generation Model Muhammad Usama Saleem, Mayur Jagdishbhai Patel, Ekkasit Pinyoanuntapong, Zhongxing Qin, Li Yang, Hongfei Xue, Ahmed Helmy, Chen Chen, Pu Wang arXiv ↗ PDF ↗
LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioning Xinran Yang, Shuichang Lai, Jiangjing Lyu, Hongjie Li, Bowen Pan, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo arXiv ↗ PDF ↗
Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts Xi Chen, Maojun Zhang, Yu Liu, Shen Yan arXiv ↗ PDF ↗
Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang arXiv ↗ PDF ↗
Long-Tail Internet Photo Reconstruction Yuan Li, Yuanbo Xiangli, Hadar Averbuch-Elor, Noah Snavely, Ruojin Cai PDF ↗
LongStream: Long-Sequence Streaming Autoregressive Visual Geometry Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang arXiv ↗ PDF ↗
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye arXiv ↗ PDF ↗
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li arXiv ↗ PDF ↗
LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes Ruofan Liang, Norman Müller, Ethan Weber, Duncan Zauss, Nandita Vijaykumar, Peter Kontschieder, Christian Richardt PDF ↗
M3Grounder: Mask-Based Multi-Span and Multi-Granular Grounding for Document QA Venkata Kesav Venna, Sai Madhusudan Gunda, Jyothi Swaroopa Jinka, Hrithik Sagar Rachakonda, Anirudh Srinivasan, Ravi Kiran Sarvadevabhatla PDF ↗
MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro arXiv ↗ PDF ↗
MAMMA: Markerless Accurate Multi-person Motion Acquisition Hanz Cuevas Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Höschle, Joachim Tesch, Taylor Obersat, Tsvetelina Alexiadis, Eni Halilaj, Michael J. Black PDF ↗
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma arXiv ↗ PDF ↗
META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understanding Jing Huang, Luyuan Chen, Zhijie Xu, Yadong Li, Xingzhong Xu, Siye Chen, Jie Liu, Ming Kong, Qiang Zhu PDF ↗
MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs Xinyi Wang, Pengfei Ren, Haoyang Zhang, Hanling Zhan, Yingxi Li, Liang Xie, Yue Gao, Erwei Yin PDF ↗
MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registration Yue Wu, Feng Xiao, Yongzhe Yuan, Hao Li, Kaiyuan Feng, Maoguo Gong, Qiguang Miao, Wenping Ma PDF ↗
MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restoration Heng Li, Xingyuan Wang, Yang Fan, Yunan Zhang, Xiangping Wu, Qingcai Chen PDF ↗
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang arXiv ↗ PDF ↗
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang PDF ↗
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models Ruoxiang Huang, Zhen Yuan arXiv ↗ PDF ↗
MOMO: Mars Orbital MOdel Foundation Model for Mars Orbital Applications Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner arXiv ↗ PDF ↗
MPL: Match-guided Prototype Learning for Few-shot Action Recognition Feng Yang, Jie Zhao, Fulin Luo, Anyong Qin, Tiecheng Song, Yue Zhao, Chenqiang Gao, Junwei Han PDF ↗
MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior Joshua Cho, Sara Aghajanzadeh, Zhen Zhu, David Forsyth PDF ↗
MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos Arkaprava Sinha, Monish Soundar Raj, Pu Wang, Ahmed Helmy, Hieu Le, Srijan Das arXiv ↗ PDF ↗
MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting Yongjian Liao, Xu Zou, Wenjun Chen, Huixuan Li, Xiaoen Xie, Chunxi Li, Shixiang Huang, Gang Zhang, Jiahuan Zhou, Sheng Zhong, Luxin Yan PDF ↗
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao arXiv ↗ PDF ↗
MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognition Shenyin Xu, Yishan Wang, Xinyu Li, Rui Liu, Zhongyuan Wang, Xin Tian PDF ↗
MV-TAP: Tracking Any Point in Multi-View Videos Jahyeok Koo, Inès Hyeonsu Kim, Mungyeom Kim, Junghyun Park, Seohyeon Park, Jaeyeong Kim, Jung Yi, Seokju Cho, Seungryong Kim arXiv ↗ PDF ↗
MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation Yibo Zhao, Yigong Zhang, Jin Xie arXiv ↗ PDF ↗
MacTok: Robust Continuous Tokenization for Image Generation Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu arXiv ↗ PDF ↗
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han arXiv ↗ PDF ↗
Make it SING: Analyzing Semantic Invariants in Classifiers Harel Yadid, Meir Yossef Levi, Roy Betser, Guy Gilboa arXiv ↗ PDF ↗
MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valery Weber, Ahmed Nassar, Peter Staar arXiv ↗ PDF ↗
Masked Region Transformer for Layered Image Generation and Editing at Scale Zhicong Tang, Jingye Chen, Zhao Zhang, Mohan Zhou, Yuchi Liu, Yifan Pu, Yalong Bai, Ethan Smith, Yuhui Yuan PDF ↗
MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator Peiqing Yang, Shangchen Zhou, Kai Hao, Qingyi Tao arXiv ↗ PDF ↗
MatLat: Material Latent Space for PBR Texture Generation Kyeongmin Yeo, Yunhong Min, Jaihoon Kim, Minhyuk Sung arXiv ↗ PDF ↗
MeanFlow Transformers with Representation Autoencoders Zheyuan Hu, Chieh-Hsin Lai, Ge Wu, Yuki Mitsufuji, Stefano Ermon arXiv ↗ PDF ↗
MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer Weiyu Li, Antoine Toisoul, Tom Monnier, Roman Shapovalov, Rakesh Ranjan, Ping Tan, Andrea Vedaldi PDF ↗
MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation Yinuo Wang, Yanbo Fan, Xuan Wang, Boyao Zhou, Yu Guo, Yujun Shen, Fei Wang PDF ↗
Mind the Gap: Transferring Labels to Align Object Detection Datasets Mikhail Kennerley, Angelica I. Aviles-Rivero, Carola-Bibiane Schönlieb, Robby T. Tan PDF ↗
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang, Wenshuo Ma, Zhihui He, Tianchi Cai, Weize Chen, Yuxiang Huang, Ranchi Zhao, Bokai Xu, Junbo Cui, Yingjing Xu, Liqing Ruan, Luoyuan Zhang, Hanyu Liu, Jingkun Tang, Hongyuan Liu, Qining Guo, Wenhao Hu, Bingxiang He, Jie Zhou, Jie Cai, Ji Qi, Zonghao Guo, Chi Chen, Guoyang Zeng, Yuxuan Li, Ganqu Cui, Ning Ding, Xu Han, Yuan Yao, Zhiyuan Liu, Maosong Sun PDF ↗
Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Feng, Zhangyang Wang, Qixing Huang arXiv ↗ PDF ↗
Mitigating Error Amplification in Fast Adversarial Training Mengnan Zhao, Lihe Zhang, Bo Wang, Tianhang Zheng, Hong Zhong, Geyong Min arXiv ↗ PDF ↗
Mitigating Instance Entanglement in Instance-Dependent Partial Label Learning Rui Zhao, Bin Shi, Kai Sun, Bo Dong arXiv ↗ PDF ↗
Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation Nikolay Kormushev, Josip Šarić, Matej Kristan PDF ↗
Mitigating The Distribution Shift of Diffusion-based Dataset Distillation Yue Xu, Chenyu Hu, Pengyu An, Yong-Lu Li PDF ↗
MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention Zilong Zhao, Zhengming Ding, Pei Niu, Wenhao Sun, Feng Guo arXiv ↗ PDF ↗
MoCha: End-to-End Video Character Replacement without Structural Guidance Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li PDF ↗
MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation Wenfeng Song, Xuehan Wang, Shuai Li, Yi Chen, Yuting Guo, Zhenyu Wu, Xingliang Jin, Chenglizhao Chen, Fei Hou, Hongyu Wu, Aimin Hao PDF ↗
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim arXiv ↗ PDF ↗
MoEActok: A MoE-based Action Tokenizer for Vision-Language-Action Models Chunpu Xu, Zhixuan Liang, Tianshuo Yang, Chi-Min Chan, Yang Xiao, Jessie Wang, Xiaokang Yang, Yao Mu PDF ↗
MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection Jun Yeong Park, JunYoung Seo, Minji Kang, Yu Rang Park arXiv ↗ PDF ↗
MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label Junyoung Jung, Seokwon Kim, Jung Uk Kim arXiv ↗ PDF ↗
MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamics Ian Noronha, Heather Neave, Upinder Kaur PDF ↗
More than the Sum: Panorama-Language Models for Adverse Omni-Scenes Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen arXiv ↗ PDF ↗
Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis Hongyuan Chen, Xingyu Chen, Zexiang Xu, Anpei Chen arXiv ↗ PDF ↗
MotionEdit: Benchmarking and Learning Motion-Centric Image Editing Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu arXiv ↗ PDF ↗
MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen PDF ↗
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan arXiv ↗ PDF ↗
Moving Border Ownership for Event-based Motion Segmentation Zhiyuan Hua, Cornelia Fermüller, Yiannis Aloimonos PDF ↗
Multi-Modal Image Fusion via Intervention-Stable Feature Learning Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma arXiv ↗ PDF ↗
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang arXiv ↗ PDF ↗
Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment Xiaodong Chen, Qian Bao, Xudong Liu, Jianping Fang, Jintao Fang, Yongdong Zhang, Tao Mei, Wu Liu PDF ↗
Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration Jinglin Xu, Yi Li, Chuxiong Sun, Xiao Xu, Jiangmeng Li, Fanjiang Xu arXiv ↗ PDF ↗
MultiAnimate: Pose-Guided Image Animation Made Extensible Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu arXiv ↗ PDF ↗
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li arXiv ↗ PDF ↗
Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening Junfeng Li, Wenyang Zhou, Xueheng Li, Xuanhua He, Jianhou Gan, Wenqi Ren arXiv ↗ PDF ↗
Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang arXiv ↗ PDF ↗
Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation Yukuan Min, Muli Yang, Jinhao Zhang, Yuxuan Wang, Yihang Zhu, Jiexi Yan, Cheng Deng PDF ↗
NIL: No-data Imitation Learning Mert Albaba, Chenhao Li, Markos Diomataris, Omid Taheri, Andreas Krause, Michael J. Black arXiv ↗ PDF ↗
NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting Brent Zoomers, Florian Hahlbohm, Joni Vanherck, Lode Jorissen, Marcus Magnor, Nick Michiels arXiv ↗ PDF ↗
NaTex: Seamless Texture Generation as Latent Color Diffusion Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Xin Yang, Xin Huang, Jingwei Huang, Xiangyu Yue, Chunchao Guo arXiv ↗ PDF ↗
NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration Subhajit Sanyal, Srinivas Soumitri Miriyala, Akshay Janardan Bankar, Manjunath Arveti, Sowmya Vajrala, Shreyas Pandith, Sravanth Kodavanti, Abhishek Ameta, Harshit Harshit, Amit Satish Unde arXiv ↗ PDF ↗
Negative Binomial Variational Autoencoders for Overdispersed Latent Modeling Yixuan Zhang, Jinhao Sheng, Wenxin Zhang, Quyu Kong, Feng Zhou arXiv ↗ PDF ↗
NeuROK: Generative 4D Neural Object Kinematics Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu PDF ↗
Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments Jianhui Wu, Jian Zhou, Zhi Zhou, Zhangjin Huang, Chao Li arXiv ↗ PDF ↗
Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy Shuo Chen, Yijin Li, Xi Zheng, Guofeng Zhang arXiv ↗ PDF ↗
NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks Fangzhou Lin, Yuping Wang, Yuliang Guo, Zixun Huang, Xinyu Huang, Haichong Zhang, Kazunori Yamada, Zhengzhong Tu, Liu Ren, Ziming Zhang arXiv ↗ PDF ↗
No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models Hai X. Pham, David T. Hoffmann, Ricardo Guerrero, Brais Martinez arXiv ↗ PDF ↗
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering Aymen Lassoued, Mohamed Ali Souibgui, Yousri Kessentini arXiv ↗ PDF ↗
OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement Rui Wang, Huisi Wu, Jing Qin arXiv ↗ PDF ↗
OVI-MAP: Open-Vocabulary Instance-Semantic Mapping Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath PDF ↗
OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He arXiv ↗ PDF ↗
Object-Generalized Re-Identification: A Step Towards Universal Instance Perception Shuoyi Chen, Yurui Wu, Mang Ye PDF ↗
OctoT2I: A Self-Evolving Agentic Text-to-Image Router Xu Jiang, Bin Chen, Gehui Li, Yule Duan, Ronggang Wang, Jian Zhang PDF ↗
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models Yujia Yang, Yuanxiang Wang, Zhenyu Guan, Tiankun Yang, Chenxi Bao, Haopeng Jin, Jinwen Luo, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Xinming Wang, Ruiwen Tao, Hongzhu Yi arXiv ↗ PDF ↗
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu arXiv ↗ PDF ↗
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang arXiv ↗ PDF ↗
On the Role of Temporal Granularity in the Robustness of Spiking Neural Networks Mengting Xu, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan PDF ↗
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi arXiv ↗ PDF ↗
One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation Linghui Fu, Yuhan Liu, Hao Chen, Zhen Yang, Yongjian Deng PDF ↗
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation Han Li, Xinyu Peng, Yaoming Wang, Zelin Peng, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Wenrui Dai, Hongkai Xiong arXiv ↗ PDF ↗
OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery Yiwen Zhao, Ce Zheng, Yufu Wang, Hsueh-Han Daniel Yang, Liting Wen, László A. Jeni arXiv ↗ PDF ↗
OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang arXiv ↗ PDF ↗
OntoAug: Rethinking Generative Data Augmentation via Ontology Guidance Shuo Wang, Zhichuan Wang, Jun Luo PDF ↗
OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang arXiv ↗ PDF ↗
OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Data Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu arXiv ↗ PDF ↗
OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness Phuc Nguyen, Anh N. Nhu, Ming C. Lin arXiv ↗ PDF ↗
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning Yanqing Liu, Xianhang Li, Letian Zhang, Zirui Wang, Zeyu Zheng, Yuyin Zhou, Cihang Xie arXiv ↗ PDF ↗
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun arXiv ↗ PDF ↗
OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation Yating Liu, Zhaoshuai Qi, Yang Zou, Yongnan Yang, Shizhou Zhang, Yanning Zhang PDF ↗
OrionEdit: Bridging Reference and Source Images for Generalized Cross-Image Editing Zeyu Jiang, Lai Man Po, Xuyuan Xu, Yexin Wang, Guoping Gong, Haoxuan Wu, Chenbo Yan, Kun Li, Yuyang Liu PDF ↗
Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism Xin Li, Shujun Tian, Tao Lu, Han Bao, Zonghui Wang, Wenzhi Chen PDF ↗
PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Models Xuan Wang, Guiguang Ding, Jungong Han PDF ↗
PAF: Perturbation-Aware Filtering for Open-Set Semi-Supervised Learning Yinan Han, Qing-Yuan Jiang PDF ↗
PAI-Bench: A Comprehensive Benchmark For Physical AI Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi arXiv ↗ PDF ↗
PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao arXiv ↗ PDF ↗
PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects Yan Di, Yuheng Li, Yaoxing Wang, Mengge Liu, Shan Gao, Xiangyang Ji PDF ↗
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang arXiv ↗ PDF ↗
PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Models Nhat Hoang, Minh Vu, My T. Thai, Manish Bhattarai PDF ↗
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo arXiv ↗ PDF ↗
PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection Xijun Lu, Hongying Liu, Fanhua Shang, Yanming Hui, Liang Wan arXiv ↗ PDF ↗
PGR-Net: Prior-Guided ROI Reasoning Network for Brain Tumor MRI Segmentation Jiacheng Lu, Hui Ding, Shiyu Zhang, Guoping Huo arXiv ↗ PDF ↗
PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu arXiv ↗ PDF ↗
PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li PDF ↗
POUR: A Provably Optimal Method for Unlearning Representation via Neural Collapse Anjie Le, Can Peng, Yuyuan Liu, J. Alison Noble arXiv ↗ PDF ↗
PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representation Jiacheng Hao, Chunying Liu, Hao Guo, Ruohan Wang, Hongping Gan, Yilei Shi PDF ↗
PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction Isaac Deutsch, Nicolas Moënne-Loccoz, Gavriel State, Zan Gojcic PDF ↗
PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis Inseong Choi, Siwoo Lee, Seung-Hun Nam, Soohwan Song arXiv ↗ PDF ↗
PRISM: Prototype-based Reasoning with Inter-modal Semantic Mining for Interpretable Image Recognition Anni Yu, Yu-Bin Yang PDF ↗
PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu arXiv ↗ PDF ↗
PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detection Zhengjian Kang, Jun Zhuang, Kangtong Mo, Qi Chen, Rui Liu, Ye Zhang arXiv ↗ PDF ↗
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving Yining Pan, Shijie Li, Yuchen Wu, Xulei Yang, Na Zhao arXiv ↗ PDF ↗
Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image Zidian Qiu, Ancong Wu arXiv ↗ PDF ↗
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning Zekai Lin, Xu Zheng arXiv ↗ PDF ↗
Paparazzo: Active Mapping of Moving 3D Objects Davide Allegro, Shiyao Li, Stefano Ghidoni, Vincent Lepetit arXiv ↗ PDF ↗
Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper Siwei Han, Haonian Ji, Siyang Xin, Juanquan Shi, Shi Qiu, Xinyu Ye, Peng Xia, Jiaqi Liu, Zhaorun Chen, Yiyang Zhou, Linjie Li, Lijuan Wang, Huaxiu Yao PDF ↗
Parallel Jacobi Decoding for Fast Autoregressive Image Generation Boya Liao, Ying Li, Siyong Jian, Huan Wang PDF ↗
Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection Weihao Cao, Runqi Wang, Xiaoyue Duan, Jinchao Zhang, Ang Yang, Liping Jing arXiv ↗ PDF ↗
PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing Antonio Oroz, Matthias Nießner, Tobias Kirschstein PDF ↗
PersonaLive! Expressive Portrait Image Animation for Live Streaming Zhiyuan Li, Chi-Man Pun, Chen Fang, Jue Wang, Xiaodong Cun arXiv ↗ PDF ↗
PersonaVLM: Long-Term Personalized Multimodal LLMs Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan arXiv ↗ PDF ↗
Personalized Federated Training of Diffusion Models with Privacy Guarantees Kumar Kshitij Patel, Bingqing Jiang, A F M Mahfuzul Kabir, Weitong Zhang, Difan Zou, Lingxiao Wang PDF ↗
Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement Xinyue Liang, Zhiyuan Ma, Lingchen Sun, Yanjun Guo, Lei Zhang arXiv ↗ PDF ↗
PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion Qixiu Li, Xiang Zhu, Xiaoyong Li, Xiaolong Xu PDF ↗
PhysHead: Simulation-Ready Gaussian Head Avatars Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll arXiv ↗ PDF ↗
PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting Jingyuan Gao, Yumeng Hu, Fei Gao, Mingjin Zhang PDF ↗
PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinning Yuanhang Lei, Tao Cheng, Xingxuan Li, Boming Zhao, Siyuan Huang, Ruizhen Hu, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui arXiv ↗ PDF ↗
PhysVid: Physics Aware Local Conditioning for Generative Video Models Saurabh Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz arXiv ↗ PDF ↗
Physical Simulator In-the-Loop Video Generation Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt arXiv ↗ PDF ↗
Physically-Grounded Turbulence Mitigation with Frame-Shared Degradation Parameters Dongxin Xie, Yan Huang, Yong Xu, Hui Ji PDF ↗
PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization Xiaoya Cheng, Long Wang, Yan Liu, Xinyi Liu, Hanlin Tan, Yu Liu, Maojun Zhang, Shen Yan arXiv ↗ PDF ↗
PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion Hong-Phuc Lai, Phong Nguyen, Anh Tran arXiv ↗ PDF ↗
Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu arXiv ↗ PDF ↗
Point4Cast: Streaming Dynamic Scene Reconstruction and Forecasting Xinhang Liu, Pedro Miraldo, Suhas Lohit, Huaizu Jiang, Naoko Sawada, Yu-Wing Tai, Chi-Keung Tang, Moitreya Chatterjee PDF ↗
PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Model Zhengdong Hu, Chao Wang, Fengyun Rao, Jing LYU, Hehe Fan, Yi Yang PDF ↗
Polarization State Tracing for Reflection Removal and Color-Consistent Reconstruction Dongyue Wang, Yang Lu, Jiandong Tian PDF ↗
Portable Active Learning for Object Detection Rashi Sharma, Justin Timothy C. Bersamin, Karthikk Subramanian arXiv ↗ PDF ↗
Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identification JooHyung Oh, Minyoung Oh, Sung Whan Yoon, Jae-Young Sim PDF ↗
PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu arXiv ↗ PDF ↗
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology Srikumar Sastry, Subash Khanal, Aayush Dhakal, Jiayu Lin, Dan Cher, Phoenix Jarosz, Nathan Jacobs arXiv ↗ PDF ↗
ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environments Jiaxin Ai, Yukang Feng, Fanrui Zhang, Jianwen Sun, Zizhen Li, Chuanhao Li, Yifan Chang, Wenxiao Wu, Ruoxi Wang, Mingliang Zhai, Kaipeng Zhang PDF ↗
Probabilistic Prompt Adaptation for Unified Image Aesthetics and Quality Assessment Takayuki Hara, Yuya Otsuka PDF ↗
Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models Qing Zhang, Xuesong Li, Jing Zhang arXiv ↗ PDF ↗
Progressive Multi-cue Alignment for Unaligned RGBT Tracking Jiandong Jin, Chenglong Li, Hao Feng, Andong Lu, Lili Huang, Jin Tang PDF ↗
Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification Wen Wen, Hao Chen, Shiliang Zhang arXiv ↗ PDF ↗
Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensing Abdullah Azeem, Ruisheng Wang, Qingquan Li, Abubakar Siddique PDF ↗
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng arXiv ↗ PDF ↗
Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives Haoran Wang, Guoxi Huang, Fan Zhang, David Bull, Nantheera Anantrasirichai arXiv ↗ PDF ↗
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation Onkar Susladkar, Tushar Prakash, Adheesh Juvekar, Kiet A. Nguyen, Dong-Hwan Jang, Inderjit S Dhillon, Ismini Lourentzou arXiv ↗ PDF ↗
QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei-Fei, Ehsan Adeli arXiv ↗ PDF ↗
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization Chenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei, Bochen Lin, Hongbin Sun arXiv ↗ PDF ↗
Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models Abhishek Kumar Sinha, Nitant Dube, Soma Biswas PDF ↗
QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidence Weiyu Zhao, Ru Li, Jiaqi Liu, Sizhe Zhao, Qinglin Liu, Shengping Zhang PDF ↗
QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand arXiv ↗ PDF ↗
R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax arXiv ↗ PDF ↗
RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation Hao Li, Yuhao Wang, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu arXiv ↗ PDF ↗
RAVEN: Erasing Invisible Watermarks via Novel View Synthesis Fahad Shamshad, Nils Lukas, Karthik Nandakumar arXiv ↗ PDF ↗
RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan arXiv ↗ PDF ↗
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding Hanqing Liu, Mingjie Liu, Luoping Cui, Endian Lin, Donghong Jiang, Chuang Zhu arXiv ↗ PDF ↗
REACH: Explicit Recovery Behavior for Diffusion Policies Zundong Ke, Junlin Chen, Jiayi Zhu, Kuanhao Xia, Boyi Zhao, Jiayuan Gu PDF ↗
REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu arXiv ↗ PDF ↗
REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting Di Wu, Liu Liu, Anran Huang, Yuyan Liu, Qiaojun Yu, Shaofan Liu, Liangtu Song, Cewu Lu arXiv ↗ PDF ↗
RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes Jiarui Zhang, Zhihao Li, Chong Wang, Bihan Wen PDF ↗
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework Xiao Wang, Haiyang Wang, Shiao Wang, Qiang Chen, Jiandong Jin, Haoyu Song, Bo Jiang, Chenglong Li arXiv ↗ PDF ↗
RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos Lixin Xue, Chengwei Zheng, Georgios Paschalidis, Chen Guo, Manuel Kaufmann, Juan Zarate, Dimitrios Tzionas arXiv ↗ PDF ↗
RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian arXiv ↗ PDF ↗
RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue arXiv ↗ PDF ↗
RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning Tongrui Su, Qingbin Li, Shengyu Zhu, Wei Chen, Xueqi Cheng arXiv ↗ PDF ↗
Rank-Guided Pseudo-Bias Learning for Robust Black-Box Adaptation Rajeev Ranjan Dwivedi, Anshuman Dangwal, Vinod K Kurmi PDF ↗
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa arXiv ↗ PDF ↗
ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIP Xin Niu, Manqi Zhao, Dongsheng Jiang, Yingying Wu, Bing Su PDF ↗
ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling Hao Zhang, Shuhan Yang, Linfeng Tang, Xunpeng Yi, Jiayi Ma PDF ↗
ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understanding Miao Xu, Xiangyu Zhu, Zidu Wang, Xusheng Liang, Bao Li, Jinlin Wu, Zelin Zang, Zhen Lei PDF ↗
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers Mohsen Ghafoorian, Amirhossein Habibian arXiv ↗ PDF ↗
ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformers Qinghao Zhong, Bingzhi Chen, Yishu Liu, Minhua Lu, Guangming Lu PDF ↗
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura arXiv ↗ PDF ↗
Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMG Zhenghao Huang, Huilin Yao, Kaikai Wang, Lin Shu PDF ↗
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo PDF ↗
Reallocating Attention Across Layers to Reduce Multimodal Hallucination Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang arXiv ↗ PDF ↗
Reconstructing CLIP for Open-Vocabulary Dense Perception Yajie Liu, Jinjin Zhang, Qingjie Liu, Di Huang PDF ↗