Continuous Space-Time Video Resampling with Invertible Motion Steganography Yuantong Zhang, Zhenzhong Chen PDF ↗
Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions Stefan Andreas Baumann, Felix Krause, Michael Neumayr, Nick Stracke, Melvin Sevi, Vincent Tao Hu, Björn Ommer arXiv ↗ PDF ↗
ControlFace: Harnessing Facial Parametric Control for Face Rigging Wooseok Jang, Youngjun Hong, Geonho Cha, Seungryong Kim arXiv ↗ PDF ↗
Controllable Human Image Generation with Personalized Multi-Garments Yisol Choi, Sangkyung Kwak, Sihyun Yu, Hyungwon Choi, Jinwoo Shin arXiv ↗ PDF ↗
Convex Combination Star Shape Prior for Data-driven Image Semantic Segmentation Xinyu Zhao, Jun Xie, Shengzhe Chen, Jun Liu PDF ↗
CorrBEV: Multi-View 3D Object Detection by Correlation Learning with Multi-modal Prototypes Ziteng Xue, Mingzhe Guo, Heng Fan, Shihui Zhang, Zhipeng Zhang PDF ↗
Correcting Deviations from Normality: A Reformulated Diffusion Model for Multi-Class Unsupervised Anomaly Detection Farzad Beizaee, Gregory A. Lodygensky, Christian Desrosiers, Jose Dolz arXiv ↗ PDF ↗
Correlative and Discriminative Label Grouping for Multi-Label Visual Prompt Tuning Lei-Lei Ma, Shuo Xu, Ming-Kun Xie, Lei Wang, Dengdi Sun, Haifeng Zhao arXiv ↗ PDF ↗
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model Ziyu Yao, Xuxin Cheng, Zhiqi Huang, Lei Li arXiv ↗ PDF ↗
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation Henghui Du, Guangyao Li, Chang Zhou, Chunjie Zhang, Alan Zhao, Di Hu arXiv ↗ PDF ↗
CraftsMan3D: High-fidelity Mesh Generation with 3D Native Diffusion and Interactive Geometry Refiner Weiyu Li, Jiarui Liu, Hongyu Yan, Rui Chen, Yixun Liang, Xuelin Chen, Ping Tan, Xiaoxiao Long PDF ↗
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning Di Zhang, Jingdi Lei, Junxian Li, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, Peng Ye, Wanli Ouyang, Dongzhan Zhou PDF ↗
CroCoDL: Cross-device Collaborative Dataset for Localization Hermann Blum, Alessandro Mercurio, Joshua O'Reilly, Tim Engelbracht, Mihai Dusmanu, Marc Pollefeys, Zuria Bauer PDF ↗
Cropper: Vision-Language Model for Image Cropping through In-Context Learning Seung Hyun Lee, Jijun Jiang, Yiran Xu, Zhuofang Li, Junjie Ke, Yinxiao Li, Junfeng He, Steven Hickson, Katie Datsenko, Sangpil Kim, Ming-Hsuan Yang, Irfan Essa, Feng Yang arXiv ↗ PDF ↗
Cross-Modal 3D Representation with Multi-View Images and Point Clouds Ziyang Zhou, Pinghui Wang, Zi Liang, Haitao Bai, Ruofei Zhang PDF ↗
Cross-Modal Distillation for 2D/3D Multi-Object Discovery from 2D Motion Saad Lahlali, Sandra Kara, Hejer Ammar, Florian Chabot, Nicolas Granger, Hervé Le Borgne, Quoc-Cuong Pham PDF ↗
Cross-Modal Interactive Perception Network with Mamba for Lung Tumor Segmentation in PET-CT Images Jie Mei, Chenyu Lin, Yu Qiu, Yaonan Wang, Hui Zhang, Ziyang Wang, Dong Dai arXiv ↗ PDF ↗
Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding Jinlong Li, Cristiano Saltori, Fabio Poiesi, Nicu Sebe arXiv ↗ PDF ↗
Cross-Rejective Open-Set SAR Image Registration Shasha Mao, Shiming Lu, Zhaolong Du, Licheng Jiao, Shuiping Gou, Luntian Mou, Xuequan Lu, Lin Xiong, Yimeng Zhang PDF ↗
Cross-modal Information Flow in Multimodal Large Language Models Zhi Zhang, Srishti Yadav, Fengze Han, Ekaterina Shutova arXiv ↗ PDF ↗
CrossSDF: 3D Reconstruction of Thin Structures From Cross-Sections Thomas Walker, Salvatore Esposito, Daniel Rebain, Amir Vaxman, Arno Onken, Changjian Li, Oisin Mac Aodha arXiv ↗ PDF ↗
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation Yanda Chen, Gongwei Chen, Miao Zhang, Weili Guan, Liqiang Nie arXiv ↗ PDF ↗
Curriculum Direct Preference Optimization for Diffusion and Consistency Models Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu, Nicu Sebe, Mubarak Shah arXiv ↗ PDF ↗
CustAny: Customizing Anything from A Single Example Lingjie Kong, Kai Wu, Chengming Xu, Xiaobin Hu, Wenhui Han, Jinlong Peng, Donghao Luo, Mengtian Li, Jiangning Zhang, Chengjie Wang, Yanwei Fu arXiv ↗ PDF ↗
CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge Distillation Jungsoo Lee, Debasmit Das, Munawar Hayat, Sungha Choi, Kyuwoong Hwang, Fatih Porikli arXiv ↗ PDF ↗
Customized Condition Controllable Generation for Video Soundtrack Fan Qi, Kunsheng Ma, Changsheng Xu PDF ↗
D2SP: Dynamic Dual-Stage Purification Framework for Dual Noise Mitigation in Vision-based Affective Recognition. Haoran Wang, Xinji Mai, Zeng Tao, Xuan Tong, Junxiong Lin, Yan Wang, Jiawen Yu, Shaoqi Yan, Ziheng Zhou, Wenqiang Zhang arXiv ↗ PDF ↗
DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers Li Ren, Chen Chen, Liqiang Wang, Kien Hua PDF ↗
DAGSM: Disentangled Avatar Generation with GS-enhanced Mesh Jingyu Zhuang, Di Kang, Linchao Bao, Liang Lin, Guanbin Li arXiv ↗ PDF ↗
DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation Sang-Jun Park, Keun-Soo Heo, Dong-Hee Shin, Young-Han Son, Ji-Hye Oh, Tae-Eui Kam arXiv ↗ PDF ↗
DCEvo: Discriminative Cross-Dimensional Evolutionary Learning for Infrared and Visible Image Fusion Jinyuan Liu, Bowei Zhang, Qingyun Mei, Xingyuan Li, Yang Zou, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan arXiv ↗ PDF ↗
DEAL: Data-Efficient Adversarial Learning for High-Quality Infrared Imaging Zhu Liu, Zijun Wang, Jinyuan Liu, Fanqi Meng, Long Ma, Risheng Liu arXiv ↗ PDF ↗
DEFOM-Stereo: Depth Foundation Model Based Stereo Matching Hualie Jiang, Zhiqiang Lou, Laiyan Ding, Rui Xu, Minglang Tan, Wenjie Jiang, Rui Huang PDF ↗
DEIM: DETR with Improved Matching for Fast Convergence Shihua Huang, Zhichao Lu, Xiaodong Cun, Yongjun Yu, Xiao Zhou, Xi Shen arXiv ↗ PDF ↗
DELT: A Simple Diversity-driven EarlyLate Training for Dataset Distillation Zhiqiang Shen, Ammar Sherif, Zeyuan Yin, Shitong Shao arXiv ↗ PDF ↗
DFM: Differentiable Feature Matching for Anomaly Detection Sheng Wu, Yimi Wang, Xudong Liu, Yuguang Yang, Runqi Wang, Guodong Guo, David Doermann, Baochang Zhang PDF ↗
DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation Bo-Wen Yin, Jiao-Long Cao, Ming-Ming Cheng, Qibin Hou arXiv ↗ PDF ↗
DH-Set: Improving Vision-Language Alignment with Diverse and Hybrid Set-Embeddings Learning Kun Zhang, Jingyu Li, Zhe Li, S.Kevin Zhou PDF ↗
DI-PCG: Diffusion-based Efficient Inverse Procedural Content Generation for High-quality 3D Asset Creation Wang Zhao, Yan-Pei Cao, Jiale Xu, Yuejiang Dong, Ying Shan PDF ↗
DIFFER: Disentangling Identity Features via Semantic Cues for Clothes-Changing Person Re-ID Xin Liang, Yogesh S Rawat arXiv ↗ PDF ↗
DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment Cijo Jose, Théo Moutakanni, Dahyun Kang, Federico Baldassarre, Timothée Darcet, Hu Xu, Daniel Li, Marc Szafraniec, Michaël Ramamonjisoa, Maxime Oquab, Oriane Siméoni, Huy V. Vo, Patrick Labatut, Piotr Bojanowski PDF ↗
DIO: Decomposable Implicit 4D Occupancy-Flow World Model Christopher Diehl, Quinlan Sykora, Ben Agro, Thomas Gilles, Sergio Casas, Raquel Urtasun PDF ↗
DKC: Differentiated Knowledge Consolidation for Cloth-Hybrid Lifelong Person Re-identification Zhenyu Cui, Jiahuan Zhou, Yuxin Peng PDF ↗
DKDM: Data-Free Knowledge Distillation for Diffusion Models with Any Architecture Qianlong Xiang, Miao Zhang, Yuzhang Shang, Jianlong Wu, Yan Yan, Liqiang Nie arXiv ↗ PDF ↗
DL2G: Degradation-guided Local-to-Global Restoration for Eyeglass Reflection Removal Zhilv Yi, Xiao Lu, Hong Ding, Jingbo Hu, Zhi Jiang, Chunxia Xiao PDF ↗
DNF: Unconditional 4D Generation with Dictionary-based Neural Fields Xinyi Zhang, Naiqi Li, Angela Dai arXiv ↗ PDF ↗
DOF-GS: Adjustable Depth-of-Field 3D Gaussian Splatting for Post-Capture Refocusing, Defocus Rendering and Blur Removal Yujie Wang, Praneeth Chakravarthula, Baoquan Chen PDF ↗
DORNet: A Degradation Oriented and Regularized Network for Blind Depth Super-Resolution Zhengxue Wang, Zhiqiang Yan, Jinshan Pan, Guangwei Gao, Kai Zhang, Jian Yang arXiv ↗ PDF ↗
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models Haoyang Li, Liang Wang, Chao Wang, Jing Jiang, Yan Peng, Guodong Long arXiv ↗ PDF ↗
DPFlow: Adaptive Optical Flow Estimation with a Dual-Pyramid Framework Henrique Morimitsu, Xiaobin Zhu, Roberto M. Cesar, Xiangyang Ji, Xu-Cheng Yin arXiv ↗ PDF ↗
DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation Ziyu Zhao, Xiaoguang Li, Lingjia Shi, Nasrin Imanpour, Song Wang arXiv ↗ PDF ↗
DRAWER: Digital Reconstruction and Articulation With Environment Realism Hongchi Xia, Entong Su, Marius Memmel, Arhan Jain, Raymond Yu, Numfor Mbiziwo-Tiapo, Ali Farhadi, Abhishek Gupta, Shenlong Wang, Wei-Chiu Ma arXiv ↗ PDF ↗
DRiVE: Diffusion-based Rigging Empowers Generation of Versatile and Expressive Characters Mingze Sun, Junhao Chen, Junting Dong, Yurun Chen, Xinyu Jiang, Shiwei Mao, Puhua Jiang, Jingbo Wang, Bo Dai, Ruqi Huang arXiv ↗ PDF ↗
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering Jingzhou Luo, Yang Liu, Weixing Chen, Zhen Li, Yaowei Wang, Guanbin Li, Liang Lin arXiv ↗ PDF ↗
DSV-LFS: Unifying LLM-Driven Semantic Cues with Visual Features for Robust Few-Shot Segmentation Amin Karimi, Charalambos Poullis PDF ↗
DTGBrepGen: A Novel B-rep Generative Model through Decoupling Topology and Geometry Jing Li, Yihang Fu, Falai Chen PDF ↗
DTOS: Dynamic Time Object Sensing with Large Multimodal Model Jirui Tian, Jinrong Zhang, Shenglan Liu, Luhao Xu, Zhixiong Huang, Gao Huang PDF ↗
DUNE: Distilling a Universal Encoder from Heterogeneous 2D and 3D Teachers Mert Bülent Sarıyıldız, Philippe Weinzaepfel, Thomas Lucas, Pau de Jorge, Diane Larlus, Yannis Kalantidis PDF ↗
DV-Matcher: Deformation-based Non-rigid Point Cloud Matching Guided by Pre-trained Visual Features Zhangquan Chen, Puhua Jiang, Ruqi Huang PDF ↗
DVHGNN: Multi-Scale Dilated Vision HGNN for Efficient Vision Recognition Caoshuo Li, Tanzhe Li, Xiaobin Hu, Donghao Luo, Taisong Jin arXiv ↗ PDF ↗
DViN: Dynamic Visual Routing Network for Weakly Supervised Referring Expression Comprehension Xiaofu Chen, Yaxin Luo, Gen Luo, Jiayi Ji, Henghui Ding, Yiyi Zhou PDF ↗
D^2iT: Dynamic Diffusion Transformer for Accurate Image Generation Weinan Jia, Mengqi Huang, Nan Chen, Lei Zhang, Zhendong Mao PDF ↗
D^3-Human: Dynamic Disentangled Digital Human from Monocular Video Honghu Chen, Bo Peng, Yunfan Tao, Juyong Zhang PDF ↗
D^3: Scaling Up Deepfake Detection by Learning from Discrepancy Yongqi Yang, Zhihao Qian, Ye Zhu, Olga Russakovsky, Yu Wu PDF ↗
D^3CTTA: Domain-Dependent Decorrelation for Continual Test-Time Adaption of 3D LiDAR Segmentation Jichun Zhao, Haiyong Jiang, Haoxuan Song, Jun Xiao, Dong Gong PDF ↗
DaCapo: Score Distillation as Stacked Bridge for Fast and High-quality 3D Editing Yufei Huang, Bangyan Liao, Yuqi Hu, Haitao Lin, Lirong Wu, Siyuan Li, Cheng Tan, Zicheng Liu, Yunfan Liu, Zelin Zang, Chang Yu, Zhen Lei PDF ↗
DarkIR: Robust Low-Light Image Restoration Daniel Feijoo, Juan C. Benito, Alvaro Garcia, Marcos V. Conde arXiv ↗ PDF ↗
Data Distributional Properties As Inductive Bias for Systematic Generalization Felipe del Rio, Alain Raymond-Saez, Daniel Florea, Rodrigo Toro Icarte, Julio Hurtado, Cristian B. Calderon, Alvaro Soto arXiv ↗ PDF ↗
Data Synthesis with Diverse Styles for Face Recognition via 3DMM-Guided Diffusion Yuxi Mi, Zhizhou Zhong, Yuge Huang, Qiuyang Yuan, Xuan Zhao, Jianqing Xu, Shouhong Ding, Shaoming Wang, Rizen Guo, Shuigeng Zhou arXiv ↗ PDF ↗
Data-Free Group-Wise Fully Quantized Winograd Convolution via Learnable Scales Shuokai Pan, Gerti Tuzi, Sudarshan Sreeram, Dibakar Gope arXiv ↗ PDF ↗
Data-free Universal Adversarial Perturbation with Pseudo-semantic Prior Chanhui Lee, Yeonghwan Song, Jeany Son arXiv ↗ PDF ↗
DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception Junjie Wang, Bin Chen, Yulin Li, Bin Kang, Yichi Chen, Zhuotao Tian arXiv ↗ PDF ↗
DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos Zijia Lu, A S M Iftekhar, Gaurav Mittal, Tianjian Meng, Xiawei Wang, Cheng Zhao, Rohith Kukkala, Ehsan Elhamifar, Mei Chen arXiv ↗ PDF ↗
DeClotH: Decomposable 3D Cloth and Human Body Reconstruction from a Single Image Hyeongjin Nam, Donghwan Kim, Jeongtaek Oh, Kyoung Mu Lee arXiv ↗ PDF ↗
DeDe: Detecting Backdoor Samples for SSL Encoders via Decoders Sizai Hou, Songze Li, Duanyi Yao arXiv ↗ PDF ↗
DeNVeR: Deformable Neural Vessel Representations for Unsupervised Video Vessel Segmentation Chun-Hung Wu, Shih-Hong Chen, Chih-Yao Hu, Hsin-Yu Wu, Kai-Hsin Chen, Yu-You Chen, Chih-Hai Su, Chih-Kuo Lee, Yu-Lun Liu arXiv ↗ PDF ↗
DeRS: Towards Extremely Efficient Upcycled Mixture-of-Experts Models Yongqi Huang, Peng Ye, Chenyu Huang, Jianjian Cao, Lin Zhang, Baopu Li, Gang Yu, Tao Chen arXiv ↗ PDF ↗
DeSiRe-GS: 4D Street Gaussians for Static-Dynamic Decomposition and Surface Reconstruction for Urban Driving Scenes Chensheng Peng, Chengwei Zhang, Yixiao Wang, Chenfeng Xu, Yichen Xie, Wenzhao Zheng, Kurt Keutzer, Masayoshi Tomizuka, Wei Zhan PDF ↗
DeSplat: Decomposed Gaussian Splatting for Distractor-Free Rendering Yihao Wang, Marcus Klasson, Matias Turkulainen, Shuzhe Wang, Juho Kannala, Arno Solin arXiv ↗ PDF ↗
De^2Gaze: Deformable and Decoupled Representation Learning for 3D Gaze Estimation Yunfeng Xiao, Xiaowei Bai, Baojun Chen, Hao Su, Hao He, Liang Xie, Erwei Yin PDF ↗
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization Zefeng Zhang, Hengzhu Tang, Jiawei Sheng, Zhenyu Zhang, Yiming Ren, Zhenyang Li, Dawei Yin, Duohe Ma, Tingwen Liu arXiv ↗ PDF ↗
Decentralized Diffusion Models David McAllister, Matthew Tancik, Jiaming Song, Angjoo Kanazawa arXiv ↗ PDF ↗
Decision SpikeFormer: Spike-Driven Transformer for Decision Making Wei Huang, Qinying Gu, Nanyang Ye arXiv ↗ PDF ↗
Decoder Gradient Shield: Provable and High-Fidelity Prevention of Gradient-Based Box-Free Watermark Removal Haonan An, Guang Hua, Zhengru Fang, Guowen Xu, Susanto Rahardja, Yuguang Fang arXiv ↗ PDF ↗
Decompositional Neural Scene Reconstruction with Generative Diffusion Prior Junfeng Ni, Yu Liu, Ruijie Lu, Zirui Zhou, Song-Chun Zhu, Yixin Chen, Siyuan Huang arXiv ↗ PDF ↗
Decouple Distortion from Perception: Region Adaptive Diffusion for Extreme-low Bitrate Perception Image Compression Jinchang Xu, Shaokang Wang, Jintao Chen, Zhe Li, Peidong Jia, Fei Zhao, Guoqing Xiang, Zhijian Hao, Shanghang Zhang, Xiaodong Xie PDF ↗
Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning Qianli Ma, Xuefei Ning, Dongrui Liu, Li Niu, Linfeng Zhang PDF ↗
Decoupled Motion Expression Video Segmentation Hao Fang, Runmin Cong, Xiankai Lu, Xiaofei Zhou, Sam Kwong, Wei Zhang PDF ↗
DecoupledGaussian: Object-Scene Decoupling for Physics-Based Interaction Miaowei Wang, Yibo Zhang, Weiwei Xu, Rui Ma, Changqing Zou, Daniel Morris arXiv ↗ PDF ↗
Decoupling Fine Detail and Global Geometry for Compressed Depth Map Super-Resolution Huan Zheng, Wencheng Han, Jianbing Shen arXiv ↗ PDF ↗
Decoupling Training-Free Guided Diffusion by ADMM Youyuan Zhang, Zehua Liu, Zenan Li, Zhaoyu Li, James J. Clark, Xujie Si arXiv ↗ PDF ↗
DeepCompress-ViT: Rethinking Model Compression to Enhance Efficiency of Vision Transformers at the Edge Sabbir Ahmed, Abdullah Al Arafat, Deniz Najafi, Akhlak Mahmood, Mamshad Nayeem Rizve, Mohaiminul Al Nahian, Ranyang Zhou, Shaahin Angizi, Adnan Siraj Rakin PDF ↗
DeepLA-Net: Very Deep Local Aggregation Networks for Point Cloud Analysis Ziyin Zeng, Mingyue Dong, Jian Zhou, Huan Qiu, Zhen Dong, Man Luo, Bijun Li PDF ↗
DefMamba: Deformable Visual State Space Model Leiye Liu, Miao Zhang, Jihao Yin, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu arXiv ↗ PDF ↗
DeformCL: Learning Deformable Centerline Representation for Vessel Extraction in 3D Medical Image Ziwei Zhao, Zhixing Zhang, Yuhang Liu, Zhao Zhang, Haojun Yu, Dong Wang, Liwei Wang arXiv ↗ PDF ↗
Deformable Radial Kernel Splatting Yi-Hua Huang, Ming-Xian Lin, Yang-Tian Sun, Ziyi Yang, Xiaoyang Lyu, Yan-Pei Cao, Xiaojuan Qi arXiv ↗ PDF ↗
Degradation-Aware Feature Perturbation for All-in-One Image Restoration Xiangpeng Tian, Xiangyu Liao, Xiao Liu, Meng Li, Chao Ren arXiv ↗ PDF ↗
DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification Darryl Ho, Samuel Madden arXiv ↗ PDF ↗
Denoising Functional Maps: Diffusion Models for Shape Correspondence Aleksei Zhuravlev, Zorah Lähner, Vladislav Golyanik PDF ↗
Dense Dispersed Structured Light for Hyperspectral 3D Imaging of Dynamic Scenes Suhyun Shin, Seungwoo Yoon, Ryota Maeda, Seung-Hwan Baek arXiv ↗ PDF ↗
Dense Match Summarization for Faster Two-view Estimation Jonathan Astermark, Anders Heyden, Viktor Larsson arXiv ↗ PDF ↗
Depth Any Camera: Zero-Shot Metric Depth Estimation from Any Camera Yuliang Guo, Sparsh Garg, S. Mahdi H. Miangoleh, Xinyu Huang, Liu Ren arXiv ↗ PDF ↗
Depth-Guided Bundle Sampling for Efficient Generalizable Neural Radiance Field Reconstruction Li Fang, Hao Zhu, Longlong Chen, Fei Hu, Long Ye, Zhan Ma arXiv ↗ PDF ↗
DepthCues: Evaluating Monocular Depth Perception in Large Vision Models Duolikun Danier, Mehmet Aygün, Changjian Li, Hakan Bilen, Oisin Mac Aodha PDF ↗
DepthSplat: Connecting Gaussian Splatting and Depth Haofei Xu, Songyou Peng, Fangjinhua Wang, Hermann Blum, Daniel Barath, Andreas Geiger, Marc Pollefeys arXiv ↗ PDF ↗
Derivative-Free Diffusion Manifold-Constrained Gradient for Unified XAI Won Jun Kim, Hyungjin Chung, Jaemin Kim, Sangmin Lee, Byeongsu Sim, Jong Chul Ye arXiv ↗ PDF ↗
Design2GarmentCode: Turning Design Concepts to Tangible Garments Through Program Synthesis Feng Zhou, Ruiyang Liu, Chen Liu, Gaofeng He, Yong-Lu Li, Xiaogang Jin, Huamin Wang arXiv ↗ PDF ↗
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models Zhendong Wang, Jianmin Bao, Shuyang Gu, Dong Chen, Wengang Zhou, Houqiang Li arXiv ↗ PDF ↗
Detail-Preserving Latent Diffusion for Stable Shadow Removal Jiamin Xu, Yuxin Zheng, Zelong Li, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu arXiv ↗ PDF ↗
Detect Any Mirrors: Boosting Learning Reliability on Large-Scale Unlabeled Data with an Iterative Data Engine Zhaohu Xing, Lihao Liu, Yijun Yang, Hongqiu Wang, Tian Ye, Sixiang Chen, Wenxue Li, Guang Liu, Lei Zhu PDF ↗
Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token Optimization Feifei Li, Mi Zhang, Yiming Sun, Min Yang PDF ↗
Detecting Adversarial Data Using Perturbation Forgery Qian Wang, Chen Li, Yuchen Luo, Hefei Ling, Shijuan Huang, Ruoxi Jia, Ning Yu arXiv ↗ PDF ↗
Detecting Open World Objects via Partial Attribute Assignment Muli Yang, Gabriel James Goenawan, Huaiyuan Qin, Kai Han, Xi Peng, Yanhua Yang, Hongyuan Zhu PDF ↗
Deterministic Certification of Graph Neural Networks against Graph Poisoning Attacks with Arbitrary Perturbations Jiate Li, Meng Pang, Yun Dong, Binghui Wang arXiv ↗ PDF ↗
Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators Bohan Xiao, Peiyong Wang, Qisheng He, Ming Dong PDF ↗
Deterministic-to-Stochastic Diverse Latent Feature Mapping for Human Motion Synthesis Yu Hua, Weiming Liu, Gui Xu, Yaqing Hou, Yew-Soon Ong, Qiang Zhang arXiv ↗ PDF ↗
Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention Kyungmin Jo, Jooyeol Yun, Jaegul Choo PDF ↗
Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens Zhangqi Jiang, Junkai Chen, Beier Zhu, Tingjin Luo, Yankun Shen, Xu Yang arXiv ↗ PDF ↗
DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation Zhixuan Liang, Yao Mu, Yixiao Wang, Tianxing Chen, Wenqi Shao, Wei Zhan, Masayoshi Tomizuka, Ping Luo, Mingyu Ding arXiv ↗ PDF ↗
DiC: Rethinking Conv3x3 Designs in Diffusion Models Yuchuan Tian, Jing Han, Chengcheng Wang, Yuchen Liang, Chao Xu, Hanting Chen arXiv ↗ PDF ↗
DiET-GS: Diffusion Prior and Event Stream-Assisted Motion Deblurring 3D Gaussian Splatting Seungjun Lee, Gim Hee Lee PDF ↗
DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention Lianghui Zhu, Zilong Huang, Bencheng Liao, Jun Hao Liew, Hanshu Yan, Jiashi Feng, Xinggang Wang arXiv ↗ PDF ↗
DiGIT: Multi-Dilated Gated Encoder and Central-Adjacent Region Integrated Decoder for Temporal Action Detection Transformer Ho-Joong Kim, Yearang Lee, Jung-Ho Hong, Seong-Whan Lee arXiv ↗ PDF ↗
DiN: Diffusion Model for Robust Medical VQA with Semantic Noisy Labels Erjian Guo, Zhen Zhao, Zicheng Wang, Tong Chen, Yunyi Liu, Luping Zhou arXiv ↗ PDF ↗
DiSRT-In-Bed: Diffusion-Based Sim-to-Real Transfer Framework for In-Bed Human Mesh Recovery Jing Gao, Ce Zheng, Laszlo A. Jeni, Zackory Erickson PDF ↗
DiSciPLE: Learning Interpretable Programs for Scientific Visual Discovery Utkarsh Mall, Cheng Perng Phoo, Mia Chiquier, Bharath Hariharan, Kavita Bala, Carl Vondrick arXiv ↗ PDF ↗
DiTASK: Multi-Task Fine-Tuning with Diffeomorphic Transformations Krishna Sri Ipsit Mantri, Carola-Bibiane Schönlieb, Bruno Ribeiro, Chaim Baskin, Moshe Eliasof PDF ↗
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue arXiv ↗ PDF ↗
DifIISR: A Diffusion Model with Gradient Guidance for Infrared Image Super-Resolution Xingyuan Li, Zirui Wang, Yang Zou, Zhixin Chen, Jun Ma, Zhiying Jiang, Long Ma, Jinyuan Liu arXiv ↗ PDF ↗
Diff-Palm: Realistic Palmprint Generation with Polynomial Creases and Intra-Class Variation Controllable Diffusion Models Jianlong Jin, Chenglong Zhao, Ruixin Zhang, Sheng Shang, Jianqing Xu, Jingyun Zhang, ShaoMing Wang, Yang Zhao, Shouhong Ding, Wei Jia, Yunsheng Wu PDF ↗
Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment Johannes Schusterbauer, Ming Gui, Frank Fundel, Björn Ommer arXiv ↗ PDF ↗
DiffLO: Semantic-Aware LiDAR Odometry with Diffusion-Based Refinement Yongshu Huang, Chen Liu, Minghang Zhu, Sheng Ao, Chenglu Wen, Cheng Wang PDF ↗
DiffLocks: Generating 3D Hair from a Single Image using Diffusion Models Radu Alexandru Rosu, Keyu Wu, Yao Feng, Youyi Zheng, Michael J. Black arXiv ↗ PDF ↗
DiffPortrait360: Consistent Portrait Diffusion for 360 View Synthesis Yuming Gu, Phong Tran, Yujian Zheng, Hongyi Xu, Heyuan Li, Adilbek Karmanov, Hao Li arXiv ↗ PDF ↗
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation Jianzong Wu, Chao Tang, Jingbo Wang, Yanhong Zeng, Xiangtai Li, Yunhai Tong arXiv ↗ PDF ↗
DiffVsgg: Diffusion-Driven Online Video Scene Graph Generation Mu Chen, Liulei Li, Wenguan Wang, Yi Yang arXiv ↗ PDF ↗
Difference Inversion: Interpolate and Isolate the Difference with Token Consistency for Image Analogy Generation Hyunsoo Kim, Donghyun Kim, Suhyun Kim arXiv ↗ PDF ↗
Differentiable Inverse Rendering with Interpretable Basis BRDFs Hoon-Gyu Chung, Seokjun Choi, Seung-Hwan Baek arXiv ↗ PDF ↗
Diffusion Bridge: Leveraging Diffusion Model to Reduce the Modality Gap Between Text and Vision for Zero-Shot Image Captioning Jeong Ryong Lee, Yejee Shin, Geonhui Son, Dosik Hwang PDF ↗
Diffusion Model is Effectively Its Own Teacher Xinyin Ma, Runpeng Yu, Songhua Liu, Gongfan Fang, Xinchao Wang PDF ↗
Diffusion Renderer: Neural Inverse and Forward Rendering with Video Diffusion Models Ruofan Liang, Zan Gojcic, Huan Ling, Jacob Munkberg, Jon Hasselgren, Chih-Hao Lin, Jun Gao, Alexander Keller, Nandita Vijaykumar, Sanja Fidler, Zian Wang PDF ↗
Diffusion Self-Distillation for Zero-Shot Customized Image Generation Shengqu Cai, Eric Ryan Chan, Yunzhi Zhang, Leonidas Guibas, Jiajun Wu, Gordon Wetzstein arXiv ↗ PDF ↗
Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models Jinjin Zhang, Qiuyu Huang, Junjie Liu, Xiefan Guo, Di Huang PDF ↗
Diffusion-based Event Generation for High-Quality Image Deblurring Xinan Xie, Qing Zhang, Wei-Shi Zheng PDF ↗
DiffusionSfM: Predicting Structure and Motion via Ray Origin and Endpoint Diffusion Qitao Zhao, Amy Lin, Jeff Tan, Jason Y. Zhang, Deva Ramanan, Shubham Tulsiani arXiv ↗ PDF ↗
Dinomaly: The Less Is More Philosophy in Multi-Class Unsupervised Anomaly Detection Jia Guo, Shuai Lu, Weihang Zhang, Fang Chen, Huiqi Li, Hongen Liao arXiv ↗ PDF ↗
DirectTriGS: Triplane-based Gaussian Splatting Field Representation for 3D Generation Xiaoliang Ju, Hongsheng Li arXiv ↗ PDF ↗
Directional Label Diffusion Model for Learning from Noisy Labels Senyu Hou, Gaoxia Jiang, Jia Zhang, Shangrong Yang, Husheng Guo, Yaqing Guo, Wenjian Wang PDF ↗
Disco4D: Disentangled 4D Human Generation and Animation from a Single Image Hui En Pang, Shuai Liu, Zhongang Cai, Lei Yang, Tianwei Zhang, Ziwei Liu arXiv ↗ PDF ↗
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval Leqi Shen, Guoqiang Gong, Tianxiang Hao, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Jungong Han, Guiguang Ding arXiv ↗ PDF ↗
Discovering Fine-Grained Visual-Concept Relations by Disentangled Optimal Transport Concept Bottleneck Models Yan Xie, Zequn Zeng, Hao Zhang, Yucheng Ding, Yi Wang, Zhengjue Wang, Bo Chen, Hongwei Liu arXiv ↗ PDF ↗
Discovering Hidden Visual Concepts Beyond Linguistic Input in Infant Learning Xueyi Ke, Satoshi Tsutsui, Yayun Zhang, Bihan Wen arXiv ↗ PDF ↗
Discrete to Continuous: Generating Smooth Transition Poses from Sign Language Observations Shengeng Tang, Jiayi He, Lechao Cheng, Jingjing Wu, Dan Guo, Richang Hong arXiv ↗ PDF ↗
Disentangled Pose and Appearance Guidance for Multi-Pose Generation Tengfei Xiao, Yue Wu, Yuelong Li, Can Qin, Maoguo Gong, Qiguang Miao, Wenping Ma PDF ↗
Disentangling Safe and Unsafe Image Corruptions via Anisotropy and Locality Ramchandran Muthukumar, Ambar Pal, Jeremias Sulam, Rene Vidal PDF ↗
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang arXiv ↗ PDF ↗
Dissecting and Mitigating Diffusion Bias via Mechanistic Interpretability Yingdong Shi, Changming Li, Yifan Wang, Yongxiang Zhao, Anqi Pang, Sibei Yang, Jingyi Yu, Kan Ren arXiv ↗ PDF ↗
Distilled Prompt Learning for Incomplete Multimodal Survival Prediction Yingxue Xu, Fengtao Zhou, Chenyu Zhao, Yihui Wang, Can Yang, Hao Chen arXiv ↗ PDF ↗
Distilling Long-tailed Datasets Zhenghao Zhao, Haoxuan Wang, Yuzhang Shang, Kai Wang, Yan Yan arXiv ↗ PDF ↗
Distilling Monocular Foundation Model for Fine-grained Depth Completion Yingping Liang, Yutao Hu, Wenqi Shao, Ying Fu arXiv ↗ PDF ↗
Distilling Multi-modal Large Language Models for Autonomous Driving Deepti Hegde, Rajeev Yasarla, Hong Cai, Shizhong Han, Apratim Bhattacharyya, Shweta Mahajan, Litian Liu, Risheek Garrepalli, Vishal M. Patel, Fatih Porikli arXiv ↗ PDF ↗
Distilling Spatially-Heterogeneous Distortion Perception for Blind Image Quality Assessment Xudong Li, Wenjie Nie, Yan Zhang, Runze Hu, Ke Li, Xiawu Zheng, Liujuan Cao PDF ↗
Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic Segmentation Chanyoung Kim, Dayun Ju, Woojung Han, Ming-Hsuan Yang, Seong Jae Hwang arXiv ↗ PDF ↗
Distinguish Then Exploit: Source-free Open Set Domain Adaptation via Weight Barcode Estimation and Sparse Label Assignment Weiming Liu, Jun Dan, Fan Wang, Xinting Liao, Junhao Dong, Hua Yu, Shunjie Dong, Lianyong Qi PDF ↗
Distribution Prototype Diffusion Learning for Open-set Supervised Anomaly Detection Fuyun Wang, Tong Zhang, Yuanzhi Wang, Yide Qiu, Xin Liu, Xu Guo, Zhen Cui arXiv ↗ PDF ↗
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models Saeed Ranjbar Alvar, Gursimran Singh, Mohammad Akbari, Yong Zhang arXiv ↗ PDF ↗
DiverseFlow: Sample-Efficient Diverse Mode Coverage in Flows Mashrur M. Morshed, Vishnu Boddeti arXiv ↗ PDF ↗
Divide and Conquer: Heterogeneous Noise Integration for Diffusion-based Adversarial Purification Gaozheng Pei, Shaojie Lyu, Gong Chen, Ke Ma, Qianqian Xu, Yingfei Sun, Qingming Huang arXiv ↗ PDF ↗
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation Yuying Ge, Yizhuo Li, Yixiao Ge, Ying Shan arXiv ↗ PDF ↗
DnLUT: Ultra-Efficient Color Image Denoising via Channel-Aware Lookup Tables Sidi Yang, Binxiao Huang, Yulun Zhang, Dahai Yu, Yujiu Yang, Ngai Wong arXiv ↗ PDF ↗
Do ImageNet-trained Models Learn Shortcuts? The Impact of Frequency Shortcuts on Generalization Shunxin Wang, Raymond Veldhuis, Nicola Strisciuglio arXiv ↗ PDF ↗
Do Visual Imaginations Improve Vision-and-Language Navigation Agents? Akhil Perincherry, Jacob Krantz, Stefan Lee arXiv ↗ PDF ↗
Do We Always Need the Simplicity Bias? Looking for Optimal Inductive Biases in the Wild Damien Teney, Liangze Jiang, Florin Gogianu, Ehsan Abbasnejad arXiv ↗ PDF ↗
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models? Yanbo Wang, Jiyang Guan, Jian Liang, Ran He arXiv ↗ PDF ↗
Do Your Best and Get Enough Rest for Continual Learning Hankyul Kang, Gregor Seifer, Donghyun Lee, Jongbin Ryu arXiv ↗ PDF ↗
DoF-Gaussian: Controllable Depth-of-Field for 3D Gaussian Splatting Liao Shen, Tianqi Liu, Huiqiang Sun, Jiaqi Li, Zhiguo Cao, Wei Li, Chen Change Loy PDF ↗
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding Wenhui Liao, Jiapeng Wang, Hongliang Li, Chengyu Wang, Jun Huang, Lianwen Jin arXiv ↗ PDF ↗
DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed Learning Xiao-Hui Li, Fei Yin, Cheng-Lin Liu arXiv ↗ PDF ↗
DocVLM: Make Your VLM an Efficient Reader Mor Shpigel Nacson, Aviad Aberdam, Roy Ganz, Elad Ben Avraham, Alona Golts, Yair Kittenplon, Shai Mazor, Ron Litman arXiv ↗ PDF ↗
Docopilot: Improving Multimodal Models for Document-Level Understanding Yuchen Duan, Zhe Chen, Yusong Hu, Weiyun Wang, Shenglong Ye, Botian Shi, Lewei Lu, Qibin Hou, Tong Lu, Hongsheng Li, Jifeng Dai, Wenhai Wang PDF ↗
Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents Jun Chen, Dannong Xu, Junjie Fei, Chun-Mei Feng, Mohamed Elhoseiny PDF ↗
Domain Adaptive Diabetic Retinopathy Grading with Model Absence and Flowing Data Wenxin Su, Song Tang, Xiaofeng Liu, Xiaojing Yi, Mao Ye, Chunxiao Zu, Jiahao Li, Xiatian Zhu arXiv ↗ PDF ↗
Domain Generalization in CLIP via Learning with Diverse Text Prompts Changsong Wen, Zelin Peng, Yu Huang, Xiaokang Yang, Wei Shen PDF ↗
Don't Shake the Wheel: Momentum-Aware Planning in End-to-End Autonomous Driving Ziying Song, Caiyan Jia, Lin Liu, Hongyu Pan, Yongchang Zhang, Junming Wang, Xingyu Zhang, Shaoqing Xu, Lei Yang, Yadan Luo PDF ↗
Dora: Sampling and Benchmarking for 3D Shape Variational Auto-Encoders Rui Chen, Jianfeng Zhang, Yixun Liang, Guan Luo, Weiyu Li, Jiarui Liu, Xiu Li, Xiaoxiao Long, Jiashi Feng, Ping Tan arXiv ↗ PDF ↗
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles Rui Zhao, Weijia Mao, Mike Zheng Shou arXiv ↗ PDF ↗
DrVideo: Document Retrieval Based Long Video Understanding Ziyu Ma, Chenhui Gou, Hengcan Shi, Bin Sun, Shutao Li, Hamid Rezatofighi, Jianfei Cai arXiv ↗ PDF ↗
Dragin3D: Image Editing by Dragging in 3D Space Weiran Guang, Xiaoguang Gu, Mengqi Huang, Zhendong Mao PDF ↗
DreamCache: Finetuning-Free Lightweight Personalized Image Generation via Feature Caching Emanuele Aiello, Umberto Michieli, Diego Valsesia, Mete Ozay, Enrico Magli arXiv ↗ PDF ↗
DreamOmni: Unified Image Generation and Editing Bin Xia, Yuechen Zhang, Jingyao Li, Chengyao Wang, Yitong Wang, Xinglong Wu, Bei Yu, Jiaya Jia arXiv ↗ PDF ↗
DreamRelation: Bridging Customization and Relation Generation Qingyu Shi, Lu Qi, Jianzong Wu, Jinbin Bai, Jingbo Wang, Yunhai Tong, Xiangtai Li arXiv ↗ PDF ↗
DreamText: High Fidelity Scene Text Synthesis Yibin Wang, Weizhong Zhang, Honghui Xu, Cheng Jin arXiv ↗ PDF ↗
DreamTrack: Dreaming the Future for Multimodal Visual Object Tracking Mingzhe Guo, Weiping Tan, Wenyu Ran, Liping Jing, Zhipeng Zhang PDF ↗
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation Guosheng Zhao, Chaojun Ni, Xiaofeng Wang, Zheng Zhu, Xueyang Zhang, Yida Wang, Guan Huang, Xinze Chen, Boyuan Wang, Youyi Zhang, Wenjun Mei, Xingang Wang arXiv ↗ PDF ↗