3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding Xiaoye Wang, Chen Tang, Xiangyu Yue, Wei-Hong Li arXiv ↗ PDF ↗
A Causal Marriage between VLM and IRM from Understanding to Reasoning Ziliang Chen, Tianang Xiao, Jusheng Zhang, Yongsen Zheng, Yang Liu, Zhao-rong Lai, Liang Lin PDF ↗
A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan arXiv ↗ PDF ↗
A Faster Path to Continual Learning Wei Li, Hangjie Yuan, Zixiang Zhao, Borui Kang, Ziwei Liu, Tao Feng arXiv ↗ PDF ↗
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen arXiv ↗ PDF ↗
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu arXiv ↗ PDF ↗
A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation Wentao Qu, Guofeng Mei, Yang Wu, YongShun Gong, Xiaoshui Huang, Liang Xiao arXiv ↗ PDF ↗
A Training-Free Style-Personalization via SVD-Based Feature Decomposition Kyoungmin Lee, Jihun Park, Jongmin Gim, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Sunghoon Im arXiv ↗ PDF ↗
A Unified Framework for Knowledge Transfer in Bidirectional Model Scaling Jianlu Shen, Fu Feng, Jiaze Xu, Yucheng Xie, Jiaqi Lv, Xin Geng arXiv ↗ PDF ↗
AD-GBC: Anisotropic Granular-Ball Skip-Connection Refiner for UNet-Based Medical Image Segmentation Xiya Shen, Qinglin Zhao, Li Feng PDF ↗
ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang arXiv ↗ PDF ↗
AE2VID: Event-based Video Reconstruction via Aperture Modulation Chenxu Bai, Boyu Li, Peiqi Duan, Xinyu Zhou, Hanyue Lou, Boxin Shi PDF ↗
AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM Zhiyu Zhou, Feng Hui, Yu Liu PDF ↗
AKCMamba-YOLO: Selective State Space Models For Real-Time Object Detection Long Chen, Hui Wang, Man Xu, Zexuan Li, Zizhu Fan PDF ↗
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang arXiv ↗ PDF ↗
APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation Daoxuan Zhang, Ping Chen, Xiaobo Xia, Xiu Su, Ruichen Zhen, Jianqiang Xiao, Shuo Yang arXiv ↗ PDF ↗
APPO: Attention-guided Perception Policy Optimization for Video Reasoning Henghui Du, Chang Zhou, Xi Chen, Di Hu arXiv ↗ PDF ↗
AURA: Multi-modal Shared Autonomy for Urban Navigation Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou PDF ↗
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs Lidong Lu, Guo Chen, Zhu Wei, Zhiqi Li, Yicheng Liu, Tong Lu PDF ↗
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Jihyung Kil, Wei-Lun Chao arXiv ↗ PDF ↗
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video Yogesh Kulkarni, Pooyan Fazli arXiv ↗ PDF ↗
AVGGT: Rethinking Global Attention for Accelerating VGGT Xianbing Sun, Zhikai Zhu, Zhengyu Lou, Bo Yang, Jinyang Tang, Liqing Zhang, He Wang, Jianfu Zhang arXiv ↗ PDF ↗
AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi arXiv ↗ PDF ↗
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister arXiv ↗ PDF ↗
Accelerating Autoregressive Video Diffusion via History-Guided Cache and Residual Correction Kepan Nan, Wangbo Zhao, Penghao Zhou, Jun Li, Zhenheng Yang, Jian Yang, Ying Tai PDF ↗
Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling Euisoo Jung, Byunghyun Kim, Hyunjin Kim, Seonghye Cho, Jae-Gil Lee arXiv ↗ PDF ↗
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang arXiv ↗ PDF ↗
Act Like a Pathologist: Tissue-Aware Whole Slide Image Reasoning Wentao Huang, Weimin Lyu, Peiliang Lou, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Wenchao Han, Ruifeng Guo, Jiawei Zhou, Chao Chen, Chen Wang arXiv ↗ PDF ↗
Action Motifs: Self-Supervised Hierarchical Representation of Human Body Movements Genki Kinoshita, Shu Nakamura, Ryo Kawahara, Shohei Nobuhara, Yasutomo Kawanishi, Ko Nishino arXiv ↗ PDF ↗
Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation Chongyang Xu, Haipeng Li, Shen Cheng, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu arXiv ↗ PDF ↗
Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models Yabin Zhang, Maya Varma, Yunhe Gao, Jean-Benoit Delbrouck, Jiaming Liu, Chong Wang, Curtis Langlotz arXiv ↗ PDF ↗
ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang arXiv ↗ PDF ↗
AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks Irene Tenison, Soumyajit Chatterjee, Fahim Kawsar, Mohammad Malekzadeh arXiv ↗ PDF ↗
AdaSpot: Spend Resolution Where It Matters for Precise Event Spotting Artur Xarles, Sergio Escalera, Thomas B. Moeslund, Albert Clapés arXiv ↗ PDF ↗
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li PDF ↗
Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding PDF ↗
AeroAgent: A Vision-Physics-Decision Framework for Aerodynamic Vehicle Design Ye Liu, Shouyi Liu, Huiyu Yang, Jianghang Gu, Wenhao Fan, Zhongxin Yang, Ding Wang, Simeng Chen, Zirun Jiang, Yuanwei Bin, Shiyi Chen, Yuntian Chen PDF ↗
AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction Hanyang Liu, Rongjun Qin arXiv ↗ PDF ↗
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He arXiv ↗ PDF ↗
Agile Deliberation: Concept Deliberation for Subjective Visual Classification Leijie Wang, Otilia Stretcu, Wei Qiao, Thomas Denby, Krishnamurthy Viswanathan, Enming Luo, Chun-Ta Lu, Tushar Dogra, Ranjay Krishna, Ariel Fuxman arXiv ↗ PDF ↗
AirSim360: A Panoramic Simulation Platform within Drone View Xian Ge, Yuling Pan, Yuhang Zhang, Xiang Li, Weijun Zhang, Dizhe Zhang, Zhaoliang Wan, Xin Lin, Xiangkai Zhang, Juntao Liang, Xiangtai Li, WenJie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi arXiv ↗ PDF ↗
Aligning Multi-Character Narrative Image Generation with Multi-Aspect Human Preferences Ziyi Gao, Zhipeng Wei, Jingjing Chen, Zhiyu Tan, Hao Li, Yi-Ping Phoebe Chen PDF ↗
Aligning Text, Images and 3D Structure Token-by-Token Aadarsh Sahoo, Vansh Tibrewal, Georgia Gkioxari arXiv ↗ PDF ↗
Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow Chengxin Liu, Wonseok Choi, Chenshuang Zhang, Tae-Hyun Oh arXiv ↗ PDF ↗
All in One: Unifying Deepfake Detection, Tampering Localization, and Source Tracing with a Robust Landmark-Identity Watermark Junjiang Wu, Liejun Wang, Zhiqing Guo arXiv ↗ PDF ↗
An Efficient Token Compression Framework for Visual Object Tracking Weijing Wu, Qihua Liang, Bineng Zhong, Haiying Xia, Zhiyi Mo, Shuxiang Song arXiv ↗ PDF ↗
Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models Karim Kadry, Abdalla Abdelwahed, Ajay Manicka, Naravich Chutisilp, Farhad R. Nezami, Elazer R. Edelman arXiv ↗ PDF ↗
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows Zhenglin Zhou, Fan Ma, Chengzhuo Gui, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua arXiv ↗ PDF ↗
Anchoring and Rescaling Attention for Semantically Coherent Inbetweening Tae Eun Choi, Sumin Shim, Junhyeok Kim, Seong Jae Hwang arXiv ↗ PDF ↗
AniMimic: Imitating 3D Animation from Video Priors Tianyi Xie, Yunuo Chen, Yaowei Guo, Yin Yang, Bolei Zhou, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang PDF ↗
Anomaly as Non-Conformity via Training-Free Graph Laplacian Energy Minimization Jungwook Seo, Minjeong Kim, Younkwan Lee, Seungho Shin, Sungyong Baik PDF ↗
Anomaly-Related Residual Fields for Cross-domain Anomaly Detection Kewei Gao, Jiayi Xie, Zhengda Shen, Weijun Qin, Lingxiang Jia, Kejia Chen, Zunlei Feng, Yijun Bei PDF ↗
AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj PDF ↗
Any Resolution Any Geometry: From Multi-View To Multi-Patch Wenqing Cui, Zhenyu Li, Mykola Lavreniuk, Jian Shi, Ramzi Idoughi, Xiangjun Tang, Peter Wonka arXiv ↗ PDF ↗
AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion Hongjie Li, Heng Yu, Jiaman Li, Hong-Xing Yu, Ehsan Adeli, C. Karen Liu, Jiajun Wu arXiv ↗ PDF ↗
Archon: A Unified Multimodal Model for Holistic Digital Human Generation Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang PDF ↗
Are Image-to-Video Models Good Zero-Shot Image Editors? Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang arXiv ↗ PDF ↗
ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo arXiv ↗ PDF ↗
ArtLLM: Generating Articulated Assets via 3D LLM Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu arXiv ↗ PDF ↗
AstraNav-Memory: Contexts Compression for Long Memory Junjun Hu, Xinda Xue, Botao Ren, Minghua Luo, Jintao Chen, Haochen Bai, Liangliang You, Mu Xu arXiv ↗ PDF ↗
Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim arXiv ↗ PDF ↗
AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models Hongyi Cai, Mohammad Mahdinur Rahman, MingKang Dong, Muxin Pu, Moayad Aloqaily, Jie Li, Xinfeng Li, Jialie Shen, Meikang Qiu, Qingsong Wen PDF ↗
BEV-SLD: Self-Supervised Scene Landmark Detection for Global Localization with LiDAR Bird's-Eye View Images David Skuddis, Vincent Ress, Wei Zhang, Vincent Ofosu Nyako, Norbert Haala PDF ↗
Balanced Hierarchical Contrastive Learning with Decoupled Queries for Fine-grained Object Detection in Remote Sensing Images Jingzhou Chen, Dexin Chen, Fengchao Xiong, Yuntao Qian, Liang Xiao arXiv ↗ PDF ↗
Basis-Oriented Low-rank Transfer for Few-Shot and Test-Time Adaptation Junghwan Park, Woojin Cho, Junhyuk Heo, Darongsae Kwon, Kookjin Lee arXiv ↗ PDF ↗
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao arXiv ↗ PDF ↗
Beyond Caption-Based Queries in Video Moment Retrieval David Pujol-Perich, Albert Clapés, Dima Damen, Sergio Escalera, Michael Wray PDF ↗
Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction Wenfei Guan, Jilin Mei, Tong Shen, Xumin Wu, Shuo Wang, Chen Min, Yu Hu arXiv ↗ PDF ↗
Beyond Euclidean Gossip: KL-Barycentric Consensus on Heterogeneous and Imbalanced Images Lu Xu, Guosheng Yin PDF ↗
Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter Bo Jiang, Xueyang Ze, Beibei Wang, Xixi Wang, Xixi Wan, Bin Luo arXiv ↗ PDF ↗
Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition Hui Liu, Kecheng Chen, Jialiang Wang, Xianming Liu, Wenya Wang, Haoliang Li arXiv ↗ PDF ↗
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation Kejia Liu, Haoyang Zhou, Ruoyu Xu, Peicheng Wang, Mingli Song, Haofei Zhang arXiv ↗ PDF ↗
Beyond Mimicry: Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations Wei-Jin Huang, Yue-Yi Zhang, Yi-Lin Wei, Zhi-Wei Xia, Juantao Tan, Yuan-Ming Li, Zhilin Zhao, Wei-Shi Zheng PDF ↗
Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion Honglin Xiong, Chenjie Zhu, Jianbiao Ding, Zixuan Ni, Wei Li, Zhenpeng Mi, Qian Wang PDF ↗
Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation Hongwei Fang, Jiahang Cai, Xun Wang, Wenwu Yang arXiv ↗ PDF ↗
Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration Jun Li, Lizhi Xiong, Ziqiang Li, Weiwei Jiang, Zhangjie Fu, Yong Li, Guo-Sen Xie arXiv ↗ PDF ↗
Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang arXiv ↗ PDF ↗
Beyond the Ground Truth: Enhanced Supervision for Image Restoration Donghun Ryou, Inju Ha, Sanghyeok Chu, Bohyung Han arXiv ↗ PDF ↗
BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation Miaowei Wang, Qingxuan Yan, Zhi Cao, Yayuan Li, Oisin Mac Aodha, Jason J Corso, Amir Vaxman arXiv ↗ PDF ↗
Bidirectional Query-Driven Generation of Parametric CAD Sketch Yang Liu, Daxuan Ren, Yijie Ding, Jianmin Zheng, Fang Deng PDF ↗
Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models Tao Qi, Huili Wang, Yuanhong Huang, Wendan Wang, Lianchao Zhao, Jinrui Wang, Zichen Qin, Shangguang Wang, Yongfeng Huang PDF ↗
BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer Changzhou Han, Wanlun Ma, Xi Tang, Kun Hu, Sheng Wen, Yang Xiang PDF ↗
Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting Da Zhang, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao arXiv ↗ PDF ↗
Boosting Reasoning in Large Multimodal Models via Activation Replay Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang arXiv ↗ PDF ↗
Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation Jihun Kim, Hoyong Kwon, Hyeokjun Kweon, Kuk-Jin Yoon arXiv ↗ PDF ↗
Boundary-Responsive Differentiable Gating for Superpixel-Based Segmentation Fatmaelzahraa Ahmed, Zhihe Lu, Gianni Caro, Diram Tabaa, Mohamed Hamdy, Muraam Abdel-Ghani, Abdulaziz Al-Ali, Muhammad Arsalan, Shidin Balakrishnan PDF ↗
Breaking Smooth-Motion Assumptions: A UAV Benchmark for Multi-Object Tracking in Complex and Adverse Conditions Jingtao Ye, Kexin Zhang, Xunchi Ma, Yuechan Li, Guangming Zhu, Peiyi Shen, Linhua Jiang, Xiangdong Zhang, Liang Zhang arXiv ↗ PDF ↗
Breaking Spurious Correlations: Uncertainty-Driven Causal Transformers for AU Detection Yuru Wang, Yue Zhou PDF ↗
Breaking the Regional Perception Bottleneck of Multimodal Large Language Models via External Reasoning Framework Jinrong Zhang, Zhaoyang Xu, Xusheng He, Xinrui Li, Na Zheng, Jianlong Wu PDF ↗
Bridging Human Evaluation to Infrared and Visible Image Fusion Jinyuan Liu, Xingyuan Li, Qingyun Mei, Haoyuan Xu, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan arXiv ↗ PDF ↗
Building Robust Vision Encoders for Cross-Dataset Evaluation in Immunofluorescent Microscopy Umar Marikkar, Syed Sameed Husain, Muhammad Awais, Sara Atito PDF ↗
C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion Yuval Haitman, Amit Efraim, Joseph M. Francos arXiv ↗ PDF ↗
CAD-Refiner: A Unified Framework for CAD Generation and Iterative Editing Meng Yuan, Dawei Lin, Hongxia Xie, Tieru Wu, Rui Ma PDF ↗
CADC: Content Adaptive Diffusion-Based Generative Image Compression Xihua Sheng, Lingyu Zhu, Tianyu Zhang, Dong Liu, Shiqi Wang, Jing Wang arXiv ↗ PDF ↗
CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment Maoyuan Shao, Yutong Gao, Xinyang Huang, Lijuan Sun, Guoshun Nan, Chuang Zhu arXiv ↗ PDF ↗
CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval Xuanzuo Lin, Min Zhang, Daizong Liu, Zhiwen Zuo, Xun Yang, Changting Lin, Xun Wang, Jianfeng Dong PDF ↗
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning Zhijiang Tang, Linhua Wang, Jiaxin Qi, Weihao Jiang, Peng Hou, Anxiang Zeng, Jianqiang Huang arXiv ↗ PDF ↗
CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection Yuchen Wu, Kun Wang, Yining Pan, Na Zhao arXiv ↗ PDF ↗
CDICS: Delving Into Fine-Grained Attribute for In-Context Segmentation via Compositional Prompts and Phased Decoupling Zhiyu Li, Dianmo Sheng, Qi Chu, Shilong Chen, Tao Gong, Zhou Wei, Nenghai Yu PDF ↗
CGU-Bayes: Causal Graph Uncertainty-Guided Bayesian Inference for Domain Generalization Naiyu Yin, Hanjing Wang, Yue Yu, Tian Gao, Amit Dhurandhar, Chung-Hao Lee, Qiang Ji PDF ↗
CHEEM: Continual Learning by Reuse, New, Adapt and Skip - A Hierarchical Exploration-Exploitation Approach Chinmay Savadikar, Michelle Dai, Tianfu Wu arXiv ↗ PDF ↗
CICA: Coupling Confidence-Aware Pretraining with Confidence-Informed Attention for Robust Multimodal Sentiment Analysis Haoyu Jiang, Xiaoliang Chen, Duoqian Miao, Xiaolin Qin, Xianyong Li, Yajun Du PDF ↗
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space Sohwi Lim, Lee Hyoseok, Jungjoon Park, Tae-Hyun Oh arXiv ↗ PDF ↗
CLEP: Contrastive Language-Pose Pretraining Sen Jia, Huayu Wang, Hsiang-Wei Huang, Zhaochong An, Jenq-Neng Hwang, Huaping Zhang, Lei Li PDF ↗
CLP: A Real-World Dataset of Contaminated Lens Protectors for Robust Semantic Segmentation Sungyong Park, Sooyoung Choi, Hyunsuh Koh, Youngjae Choi, Heewon Kim PDF ↗
CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation Ke Niu, Haiyang Yu, Zhuofan Chen, Zhengtao Yao, Weitao Jia, Xiaodong Ge, Jingqun Tang, Benlei Cui, Bin Li, Xiangyang Xue arXiv ↗ PDF ↗
COG: Confidence-aware Optimal Geometric Correspondence for Unsupervised Single-reference Novel Object Pose Estimation Yuchen Che, Jingtu Wu, Hao Zheng, Asako Kanezaki arXiv ↗ PDF ↗
CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs Jingyu Lei, Gaoang Wang, Der-Horng Lee arXiv ↗ PDF ↗
CVA: Context-aware Video-text Alignment for Video Temporal Grounding Sungho Moon, Seunghun Lee, Jiwan Seo, Sunghoon Im arXiv ↗ PDF ↗
CamDirector: Towards Long-Term Coherent Video Trajectory Editing Kejia Yin, Zhihao Shi, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu arXiv ↗ PDF ↗
Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens Xinxuan Lu, Charless Fowlkes, Alexander C. Berg arXiv ↗ PDF ↗
Camouflage-aware Image-Text Retrieval via Expert Collaboration Yao Jiang, Zhongkuan Mao, Xuan Wu, Keren Fu, Qijun Zhao arXiv ↗ PDF ↗
Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching Xin Hu, Ke Qin, Wen Yin, Yuan-Fang Li, Ming Li, Tao He arXiv ↗ PDF ↗
CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation Jinwon Ko, Keunsoo Ko, Chang-Su Kim PDF ↗
Captain Safari: A World Engine with Pose-Aligned 3D Memory Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, Junfei Xiao arXiv ↗ PDF ↗
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects Gabriel Fiastre, Antoine Yang, Cordelia Schmid PDF ↗
CaptionQA: Is Your Caption as Useful as the Image Itself? Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu arXiv ↗ PDF ↗
Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation Shifeng Chen, Yihui Li, Jun Liao, Hongyu Yang, Di Huang arXiv ↗ PDF ↗
CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention Jiacheng Tang, Zhiyuan Zhou, Zhuolin He, Jia Zhang, Kai Zhang, Jian Pu arXiv ↗ PDF ↗
Chain-of-Thought Guided Multi-Modal Object Re-Identification Ya Gao, Shihao Li, Zhaojun Liu, Aihua Zheng, Chenglong Li, Jin Tang PDF ↗
Choreographing a World of Dynamic Objects Yanzhe Lyu, Chen Geng, Karthik Dharmarajan, Yunzhi Zhang, Hadi Alzayer, Shangzhe Wu, Jiajun Wu arXiv ↗ PDF ↗
Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding Yue Li, Qi Ma, Runyi Yang, Mengjiao Ma, Bin Ren, Nikola Popovic, Nicu Sebe, Theo Gevers, Luc Van Gool, Danda Pani Paudel, Martin R. Oswald arXiv ↗ PDF ↗
CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation Kaiyi Huang, Yukun Huang, Yu Li, Jianhong Bai, Xintao Wang, Zinan Lin, Xuefei Ning, Jiwen Yu, Yu Wang, Xihui Liu arXiv ↗ PDF ↗
Cleaning the Pool: Progressive Filtering of Unlabeled Pools in Deep Active Learning Denis Huseljic, Marek Herde, Lukas Rauch, Paul Hahn, Bernhard Sick arXiv ↗ PDF ↗
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis Jianzhe Gao, Churan Wang, Weiyi Zhang, Jianghua Li, Li-An Li, Wenguan Wang, Yixin Zhu, Yizhou Wang PDF ↗
Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models Zaishuo Xia, Yukuan Lu, Xinyi Li, Yifan Xu, Yubei Chen arXiv ↗ PDF ↗
Co-Me: Confidence Guided Token Merging for Visual Geometric Transformers Yutian Chen, Yuheng Qiu, Ruogu Li, Jay Patrikar, Sebastian Scherer arXiv ↗ PDF ↗
CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua arXiv ↗ PDF ↗
CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models Chenxi Du, Yongheng Deng, Jiani Liu, Yujia Zhang, Xi Chen, Ju Ren PDF ↗
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang arXiv ↗ PDF ↗
CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving Pei Liu, Qingtian Ning, Xinyan Lu, Haipeng Liu, Weiliang Ma, Dangen She, Xianpeng Lang, Jun Ma arXiv ↗ PDF ↗
CompBench: Benchmarking Complex Instruction-guided Image Editing Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Zihan Wang, Yuan Xie, Shaohui Lin arXiv ↗ PDF ↗
Complet4R: Geometric Complete 4D Reconstruction Weibang Wang, Kenan Li, Zhuoguang Chen, Yijun Yuan, Hang Zhao arXiv ↗ PDF ↗
Computation and Communication Efficient Federated Unlearning via On-server Gradient Conflict Mitigation and Expression Minh-Duong Nguyen, Senura Wanasekara, Le-Tuan Nguyen, Quoc-Viet Pham, Ken-Tye Yong, Nguyen H. Tran, Dung D. Le PDF ↗
Concept Regions Matter: Benchmarking CLIP with a New Cluster-Importance Approach Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi arXiv ↗ PDF ↗
Concept-Aware Batch Sampling Improves Language-Image Pretraining Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge arXiv ↗ PDF ↗
ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam arXiv ↗ PDF ↗
Condensed Test-Time Adaptation of VLMs for Action Recognition Wenxuan Ge, Hongyu Qu, Rui Yan, Guo-Sen Xie, Yazhou Yao, Xiangbo Shu, Jinhui Tang PDF ↗
Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning Bozhao Li, Shaocong Wu, Tong Shao, Senqiao Yang, Qiben Shan, Zhuotao Tian, Jingyong Su arXiv ↗ PDF ↗
Continual Distillation of Teachers from Different Domains Nicolas Michel, Maorong Wang, Jiangpeng He, Toshihiko Yamasaki arXiv ↗ PDF ↗
Coordinate Denoising for Non-Equilibrium Molecular Representation Learning Qianwei Tang, Baile Xu, Jian Zhao, Furao Shen PDF ↗
CrackSSM: Reviving SSMs for Crack Segmentation via Dynamic Scanning Yubin Gu, Boyang Hou, Yuan Meng, Wenting Luo, Jiayi Ji, Xiaoshuai Sun PDF ↗
Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing Gyojin Han, Junmo Kim PDF ↗
Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo arXiv ↗ PDF ↗
Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation Jiahao Nie, Guanqiao Fu, Wenbin An, Yap-Peng Tan, Alex C. Kot, Shijian Lu arXiv ↗ PDF ↗
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation Jiaming Li, Jiacheng Zhang, Zequn Jie, Lin Ma, Ming Li, Xiaonan Luo, Guanbin Li PDF ↗
Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video Chanhyuk Choi, Taesoo Kim, Donggyu Lee, Siyeol Jung, Taehwan Kim arXiv ↗ PDF ↗
Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang arXiv ↗ PDF ↗
Cross-modal Representation Learning for Diffusion-generated Image Detection Tao Gong, Dayong Wang, Qi Chu, Bin Liu, Nenghai Yu PDF ↗
CrossHOI: Learning Cross-View Representations for Monocular 3D Human-Object Interaction Reconstruction Pei Geng, Shanshan Zhang, Jian Yang PDF ↗
Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu arXiv ↗ PDF ↗
D$^2$-FOSA: Dual-Diffusion Guided EEG-to-Image Reconstruction with Frequency-Oriented Semantic Alignment Chenglong Yu, Shuai Shen, Xiangsheng Li, Yang Li PDF ↗
DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs Nikhil Behari, Diego Rivero, Luke Apostolides, Suman Ghosh, Paul Pu Liang, Ramesh Raskar arXiv ↗ PDF ↗
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities Jueqing Lu, Yuanyuan Qi, Xiaohao Yang, Shuaicheng Niu, Fucai Ke, Shujie Zhou, Wei Tan, Jionghao Lin, Wray Buntine, Hamid Rezatofighi, Lan Du arXiv ↗ PDF ↗
DREAM: Document Recognition with Explicit Adaptive Memory Tianqi Zhao, Di Wu, Liangrui Peng, Yifan Huang, Kemeng Zhao, Shuo Li, Zhiyu Li, Yizhu Wang, Borui Jiang, Yuyang Li PDF ↗
Dark3R: Learning Structure from Motion in the Dark Andrew Y. Guo, Anagh Malik, SaiKiran Tedla, Yutong Dai, Yiqian Qin, Zach Salehe, Benjamin Attal, Sotiris Nousias, Kiriakos N. Kutulakos, David B. Lindell arXiv ↗ PDF ↗
DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition Yuanjun Tan, Aoran Xiao, Liqian Deng, Zhigang Tu PDF ↗
Dataset Distillation by Influence Matching Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yang-Tian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi PDF ↗
Deconstructing the Failure of Ideal Noise Correction: A Three-Pillar Diagnosis Chen Feng, Zhuo Zhi, Zhao Huang, Jiawei Ge, Ling Xiao, Nicu Sebe, Georgios Tzimiropoulos, Ioannis Patras arXiv ↗ PDF ↗
Decoupled Generative Modeling for Human-Object Interaction Synthesis Hwanhee Jung, Seunggwan Lee, Jeongyoon Yoon, SeungHyeon Kim, Giljoo Nam, Qixing Huang, Sangpil Kim arXiv ↗ PDF ↗
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu arXiv ↗ PDF ↗
Defending Unauthorized Model Merging via Dual-Stage Weight Protection Wei-Jia Chen, Min-Yan Tsai, Cheng-Yi Lee, Chia-Mu Yu arXiv ↗ PDF ↗
Dehallu3D: Hallucination-Mitigated 3D Generation from a Single Image via Cyclic View Consistency Refinement Xiwen Wang, Shichao Zhang, Ruowei Wang, Mao Li, Chenyu Zhou, Ji-Zhe Zhou, Qijun Zhao, Hailun Zhang PDF ↗
Dejavu: Towards Experience Feedback Learning for Embodied Intelligence Shaokai Wu, Yanbiao Ji, Qiuchang Li, Zhiyi Zhang, Qichen He, Wenyuan Xie, Guodong Zhang, Bayram Bayramli, Yue Ding, Hongtao Lu arXiv ↗ PDF ↗
Delta Rectified Flow Sampling for Text-to-Image Editing Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang arXiv ↗ PDF ↗
DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing Xingyang Li, Samuel Tesfai, Zhekai Zhang, Haocheng Xi, Shuo Yang, Lvmin Zhang, Yufei Sun, Kelly Peng, Maneesh Agrawala, Ion Stoica, Kurt Keutzer, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li PDF ↗
Delving Aleatoric Uncertainty in Medical Image Segmentation via Vision Foundation Models Ruiyang Li, Fang Liu, Licheng Jiao, Xinglin Xie, Jiayao Hao, Shuo Li, Xu Liu, Jingyi Yang, Lingling Li, Puhua Chen, Wenping Ma arXiv ↗ PDF ↗
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer arXiv ↗ PDF ↗
DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video Jiawei Hou, Shenghao Zhang, Can Wang, Zheng Gu, Yonggen Ling, Taiping Zeng, Xiangyang Xue, Jingbo Zhang arXiv ↗ PDF ↗
Detecting AI-Generated Forgeries via Iterative Manifold Deviation Amplification Jiangling Zhang, Shuxuan Gao, Bofan Liu, Siqiang Feng, Jirui Huang, Yaxiong Chen, Ziyu Chen arXiv ↗ PDF ↗
Detecting Compressed AI-Generated Images via Phase Spectrum Robustness Kai Li, Wenqi Ren, Wei Wang, Xiaochun Cao PDF ↗
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Models Zhou Tao, Shida Wang, YongXiang Hua, Haoyu Cao, Linli Xu arXiv ↗ PDF ↗
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training Haoran Feng, Dizhe Zhang, Xiangtai Li, Bo Du, Lu Qi arXiv ↗ PDF ↗
Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li arXiv ↗ PDF ↗
Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Sen Su arXiv ↗ PDF ↗
Diagram2Structure: Unlocking LLMs' Diagram Comprehension through DiagramDiff, a Framework for Structuring Offline Diagrams Haoxiang Hu, Yaokun Li, Zeyuan Huang, Cangjun Gao, Qiang He, Qingkun Li, Xiaoming Deng, Cuixia Ma, Yu-Kun Lai, Yong-Jin Liu, Hongan Wang PDF ↗
Diffusion Probe: Generated Image Result Prediction Using CNN Probes Bukun Huang, Benlei Cui, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Haiwen Hong, Jingqun Tang arXiv ↗ PDF ↗
Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu arXiv ↗ PDF ↗
DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization Zhengxian Yang, Fei Xie, Xutao Xue, Rui Zhang, Taicheng Huang, Yang Liu, Mengqi Ji, Tao Yu arXiv ↗ PDF ↗
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO Henglin Liu, Huijuan Huang, Jing Wang, Chang Liu, Xiu Li, Xiangyang Ji arXiv ↗ PDF ↗
DocPrune: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim PDF ↗
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai arXiv ↗ PDF ↗
Does YOLO Really Need to See Every Training Image in Every Epoch? Xingxing Xie, Jiahua Dong, Junwei Han, Gong Cheng arXiv ↗ PDF ↗
Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv arXiv ↗ PDF ↗
Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround-View Cameras for Autonomous Driving Xubo Zhu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Wen Yang, Huai Yu PDF ↗
Drainage: A Unifying Framework for Addressing Class Uncertainty Yasser Taha, Grégoire Montavon, Nils Körber PDF ↗
DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer Qingji Dong, Hang Dong, Mingqin Chen, Rui Zhang, Yitong Wang arXiv ↗ PDF ↗
DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos Yuan Huang, Sijie Zhao, Jing Cheng, Hao Xu, Shaohui Jiao arXiv ↗ PDF ↗
DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance Shreedhar Govil, Didier Stricker, Jason Rambach arXiv ↗ PDF ↗
Driving on Registers Ellington Kirby, Alexandre Boulch, Yihong Xu, Yuan Yin, Gilles Puy, Éloi Zablocki, Andrei Bursuc, Spyros Gidaris, Renaud Marlet, Florent Bartoccioni, Anh-Quan Cao, Nermin Samet, Tuan-Hung VU, Matthieu Cord arXiv ↗ PDF ↗
Dual Graph Regularized Deep Unfolding Network for Guided Depth Map Super-resolution Zhiwei Zhong, Peilin Chen, Qiangqiang Shen, Bo Li, Shiqi Wang PDF ↗
Dual-Estimator: Decoupling Global and Local Semantic Shift for Drift Compensation in Class-Incremental Learning Fankang Xu, Lu Jin, Yanpeng Sun, Shiyu Xuan, Zechao Li PDF ↗
Dynamic Label Noise Suppression with Optimal Teacher Pool for Facial Expression Recognition Yuzhuang Yang, Xiaolin Tian, Qigong Sun PDF ↗
Dynamic Token Reweighting for Robust Vision-Language Models Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang arXiv ↗ PDF ↗
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs Yanbin Wei, Jiangyue Yan, Chun Kang, Yang Chen, Hua Liu, James Kwok, Yu Zhang arXiv ↗ PDF ↗