CCF-A · IEEE/CVF Conference on Computer Vision and Pattern Recognition

CVPR 2025

Jun 10–17, 2025 · Nashville, Tennessee, USA · 2,871 papers · official site ↗

Best papers & awards 7

3D Student Splatting and Scooping
Honorable Mention Oral Jialin Zhu, Jiangbei Yue, Feixiang He, He Wang arXiv ↗ PDF ↗
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
Honorable Mention Oral Kaihang Pan, Wang Lin, Zhongqi Yue, Tenglong Ao, Liyu Jia, Wei Zhao, Juncheng Li, Siliang Tang, Hanwang Zhang arXiv ↗ PDF ↗
MegaSaM: Accurate, Fast and Robust Structure and Motion from Casual Dynamic Videos
Honorable Mention Oral Zhengqi Li, Richard Tucker, Forrester Cole, Qianqian Wang, Linyi Jin, Vickie Ye, Angjoo Kanazawa, Aleksander Holynski, Noah Snavely arXiv ↗ PDF ↗
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
Honorable Mention Oral Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, YenSung Chen, Ajay Patel, Mark Yatskar, Chris Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Chris Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, Aniruddha Kembhavi arXiv ↗ PDF ↗
Navigation World Models
Honorable Mention Oral Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun arXiv ↗ PDF ↗
Neural Inverse Rendering from Propagating Light
Best Student Paper Oral Anagh Malik, Benjamin Attal, Andrew Xie, Matthew O'Toole, David B. Lindell arXiv ↗ PDF ↗
VGGT: Visual Geometry Grounded Transformer
Best Paper Oral Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, David Novotny arXiv ↗ PDF ↗

Highlights & orals 397

Convex Relaxation for Robust Vanishing Point Estimation in Manhattan World
Award Candidate Oral Bangyan Liao, Zhenjun Zhao, Haoang Li, Yi Zhou, Yingping Zeng, Hao Li, Peidong Liu arXiv ↗ PDF ↗
DIFIX3D+: Improving 3D Reconstructions with Single-Step Diffusion Models
Award Candidate Oral Jay Zhangjie Wu, Yuxuan Zhang, Haithem Turki, Xuanchi Ren, Jun Gao, Mike Zheng Shou, Sanja Fidler, Zan Gojcic, Huan Ling PDF ↗
Descriptor-In-Pixel : Point-Feature Tracking For Pixel Processor Arrays
Award Candidate Oral Laurie Bose, Jianing Chen, Piotr Dudek PDF ↗
FoundationStereo: Zero-Shot Stereo Matching
Award Candidate Oral Bowen Wen, Matthew Trepte, Joseph Aribido, Jan Kautz, Orazio Gallo, Stan Birchfield arXiv ↗ PDF ↗
Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
Award Candidate Oral Jingfeng Yao, Bin Yang, Xinggang Wang arXiv ↗ PDF ↗
TacoDepth: Towards Efficient Radar-Camera Depth Estimation with One-stage Fusion
Award Candidate Oral Yiran Wang, Jiaqi Li, Chaoyi Hong, Ruibo Li, Liusheng Sun, Xiao Song, Zhe Wang, Zhiguo Cao, Guosheng Lin arXiv ↗ PDF ↗
The PanAf-FGBG Dataset: Understanding the Impact of Backgrounds in Wildlife Behaviour Recognition
Award Candidate Oral Otto Brookes, Maksim Kukushkin, Majid Mirmehdi, Colleen Stephens, Paula Dieguez, Thurston C. Hicks, Sorrel Jones, Kevin Lee, Maureen S. McCarthy, Amelia Meier, Emmanuelle Normand, Erin G. Wessling, Roman M. Wittig, Kevin Langergraber, Klaus Zuberbühler, Lukas Boesch, Thomas Schmid, Mimi Arandjelovic, Hjalmar Kühl, Tilo Burghardt arXiv ↗ PDF ↗
UniAP: Unifying Inter- and Intra-Layer Automatic Parallelism by Mixed Integer Quadratic Programming
Award Candidate Oral Hao Lin, Ke Wu, Jie Li, Jun Li, Wu-Jun Li PDF ↗
Zero-Shot Monocular Scene Flow Estimation in the Wild
Award Candidate Oral Yiqing Liang, Abhishek Badki, Hang Su, James Tompkin, Orazio Gallo arXiv ↗ PDF ↗
3D Convex Splatting: Radiance Field Rendering with 3D Smooth Convexes
Highlight Jan Held, Renaud Vandeghen, Abdullah Hamdi, Adrien Deliege, Anthony Cioppa, Silvio Giancola, Andrea Vedaldi, Bernard Ghanem, Marc Van Droogenbroeck arXiv ↗ PDF ↗
3DTopia-XL: Scaling High-quality 3D Asset Generation via Primitive Diffusion
Highlight Zhaoxi Chen, Jiaxiang Tang, Yuhao Dong, Ziang Cao, Fangzhou Hong, Yushi Lan, Tengfei Wang, Haozhe Xie, Tong Wu, Shunsuke Saito, Liang Pan, Dahua Lin, Ziwei Liu PDF ↗
4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion
Highlight Chaoyang Wang, Peiye Zhuang, Tuan Duc Ngo, Willi Menapace, Aliaksandr Siarohin, Michael Vasilkovsky, Ivan Skorokhodov, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee PDF ↗
A Polarization-Aided Transformer for Image Deblurring via Motion Vector Decomposition
Highlight Duosheng Chen, Shihao Zhou, Jinshan Pan, Jinglei Shi, Lishen Qu, Jufeng Yang PDF ↗
A Unified Approach to Interpreting Self-supervised Pre-training Methods for 3D Point Clouds via Interactions
Highlight Qiang Li, Jian Ruan, Fanghao Wu, Yuchi Chen, Zhihua Wei, Wen Shen PDF ↗
AIpparel: A Multimodal Foundation Model for Digital Garments
Highlight Kiyohiro Nakayama, Jan Ackermann, Timur Levent Kesdogan, Yang Zheng, Maria Korosteleva, Olga Sorkine-Hornung, Leonidas J. Guibas, Guandao Yang, Gordon Wetzstein arXiv ↗ PDF ↗
ALIEN: Implicit Neural Representations for Human Motion Prediction under Arbitrary Latency
Highlight Dong Wei, Xiaoning Sun, Xizhan Gao, Shengxiang Hu, Huaijiang Sun PDF ↗
ARM: Appearance Reconstruction Model for Relightable 3D Generation
Highlight Xiang Feng, Chang Yu, Zoubin Bi, Yintong Shang, Feng Gao, Hongzhi Wu, Kun Zhou, Chenfanfu Jiang, Yin Yang arXiv ↗ PDF ↗
Active Hyperspectral Imaging Using an Event Camera
Highlight Bohan Yu, Jinxiu Liang, Zhuofeng Wang, Bin Fan, Art Subpa-asa, Boxin Shi, Imari Sato PDF ↗
AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction
Highlight Yuanbin Man, Ying Huang, Chengming Zhang, Bingzhe Li, Wei Niu, Miao Yin PDF ↗
Advancing Multiple Instance Learning with Continual Learning for Whole Slide Imaging
Highlight Xianrui Li, Yufei Cui, Jun Li, Antoni B. Chan arXiv ↗ PDF ↗
Align3R: Aligned Monocular Depth Estimation for Dynamic Videos
Highlight Jiahao Lu, Tianyu Huang, Peng Li, Zhiyang Dou, Cheng Lin, Zhiming Cui, Zhen Dong, Sai-Kit Yeung, Wenping Wang, Yuan Liu arXiv ↗ PDF ↗
All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages
Highlight Ashmal Vayani, Dinura Dissanayake, Hasindri Watawana, Noor Ahsan, Nevasini Sasikumar, Omkar Thawakar, Henok Biadglign Ademtew, Yahya Hmaiti, Amandeep Kumar, Kartik Kukreja, Mykola Maslych, Wafa Al Ghallabi, Mihail Minkov Mihaylov, Chao Qin, Abdelrahman M. Shaker, Mike Zhang, Mahardika Krisna Ihsani, Amiel Gian Esplana, Monil Gokani, Shachar Mirkin, Harsh Singh, Ashay Srivastava, Endre Hamerlik, Fathinah Asma Izzati, Fadillah Adamsyah Maani, Sebastian Cavada, Jenny Chim, Rohit Gupta, Sanjay Manjunath, Kamila Zhumakhanova, Feno Heriniaina Rabevohitra, Azril Hafizi Amirudin, Muhammad Ridzuan, Daniya Najiha Abdul Kareem, Ketan Pravin More, Kunyang Li, Pramesh Shakya, Muhammad Saad, Amirpouya Ghasemaghaei, Amirbek Djanibekov, Dilshod Azizov, Branislava Jankovic, Naman Bhatia, Alvaro Cabrera, Johan Obando-Ceron, Olympiah Otieno, Febian Farestam, Muztoba Rabbani, Sanoojan Ballah, Santosh Sanjeev, Abduragim Shtanchaev, Maheen Fatima, Thao Nguyen, Amrin Kareem, Toluwani Aremu, Nathan Augusto Zacarias Xavier, Amit Bhatkal, Hawau Olamide Toyin, Aman Chadha, Hisham Cholakkal, Rao Muhammad Anwer, Michael Felsberg, Jorma Laaksonen, Thamar Solorio, Monojit Choudhury, Ivan Laptev, Mubarak Shah, Salman Khan, Fahad Shahbaz Khan arXiv ↗ PDF ↗
All-Optical Nonlinear Diffractive Deep Network for Ultrafast Image Denoising
Highlight Xiaoling Zhou, Zhemg Lee, Wei Ye, Rui Xie, Wenbo Zhang, Guanju Peng, Zongze Li, Shikun Zhang PDF ↗
All-directional Disparity Estimation for Real-world QPD Images
Highlight Hongtao Yu, Shaohui Song, Lihu Sun, Wenkai Su, Xiaodong Yang, Chengming Liu PDF ↗
Annotation Ambiguity Aware Semi-Supervised Medical Image Segmentation
Highlight Suruchi Kumari, Pravendra Singh PDF ↗
AnySat: One Earth Observation Model for Many Resolutions, Scales, and Modalities
Highlight Guillaume Astruc, Nicolas Gonthier, Clément Mallet, Loic Landrieu arXiv ↗ PDF ↗
ArcPro: Architectural Programs for Structured 3D Abstraction of Sparse Points
Highlight Qirui Huang, Runze Zhang, Kangjun Liu, Minglun Gong, Hao Zhang, Hui Huang arXiv ↗ PDF ↗
Assessing and Learning Alignment of Unimodal Vision and Language Models
Highlight Le Zhang, Qian Yang, Aishwarya Agrawal arXiv ↗ PDF ↗
Augmented Deep Contexts for Spatially Embedded Video Coding
Highlight Yifan Bian, Chuanbo Tang, Li Li, Dong Liu arXiv ↗ PDF ↗
BADGR: Bundle Adjustment Diffusion Conditioned by Gradients for Wide-Baseline Floor Plan Reconstruction
Highlight Yuguang Li, Ivaylo Boyadzhiev, Zixuan Liu, Linda Shapiro, Alex Colburn arXiv ↗ PDF ↗
BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance
Highlight Xin Ye, Burhaneddin Yaman, Sheng Cheng, Feng Tao, Abhirup Mallik, Liu Ren arXiv ↗ PDF ↗
BWFormer: Building Wireframe Reconstruction from Airborne LiDAR Point Cloud with Transformer
Highlight Yuzhou Liu, Lingjie Zhu, Hanqiao Ye, Shangfeng Huang, Xiang Gao, Xianwei Zheng, Shuhan Shen PDF ↗
Balanced Rate-Distortion Optimization in Learned Image Compression
Highlight Yichi Zhang, Zhihao Duan, Yuning Huang, Fengqing Zhu arXiv ↗ PDF ↗
BlenderGym: Benchmarking Foundational Model Systems for Graphics Editing
Highlight Yunqi Gu, Ian Huang, Jihyeon Je, Guandao Yang, Leonidas Guibas arXiv ↗ PDF ↗
Blurred LiDAR for Sharper 3D: Robust Handheld 3D Scanning with Diffuse LiDAR and RGB
Highlight Nikhil Behari, Aaron Young, Siddharth Somasundaram, Tzofi Klinghoffer, Akshat Dave, Ramesh Raskar arXiv ↗ PDF ↗
Boost Your Human Image Generation Model via Direct Preference Optimization
Highlight Sanghyeon Na, Yonggyu Kim, Hyunjoon Lee arXiv ↗ PDF ↗
Breaking the Memory Barrier of Contrastive Loss via Tile-Based Strategy
Highlight Zesen Cheng, Hang Zhang, Kehan Li, Sicong Leng, Zhiqiang Hu, Fei Wu, Deli Zhao, Xin Li, Lidong Bing PDF ↗
CADDreamer: CAD Object Generation from Single-view Images
Highlight Yuan Li, Cheng Lin, Yuan Liu, Xiaoxiao Long, Chenxu Zhang, Ningna Wang, Xin Li, Wenping Wang, Xiaohu Guo arXiv ↗ PDF ↗
CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image
Highlight Jingshun Huang, Haitao Lin, Tianyu Wang, Yanwei Fu, Xiangyang Xue, Yi Zhu PDF ↗
CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
Highlight Yuan Zhou, Qingshan Xu, Jiequan Cui, Junbao Zhou, Jing Zhang, Richang Hong, Hanwang Zhang arXiv ↗ PDF ↗
CASAGPT: Cuboid Arrangement and Scene Assembly for Interior Design
Highlight Weitao Feng, Hang Zhou, Jing Liao, Li Cheng, Wenbo Zhou arXiv ↗ PDF ↗
CASP: Compression of Large Multimodal Models Based on Attention Sparsity
Highlight Mohsen Gholami, Mohammad Akbari, Kevin Cannons, Yong Zhang arXiv ↗ PDF ↗
CCIN: Compositional Conflict Identification and Neutralization for Composed Image Retrieval
Highlight Likai Tian, Jian Zhao, Zechao Hu, Zhengwei Yang, Hao Li, Lei Jin, Zheng Wang, Xuelong Li PDF ↗
CH3Depth: Efficient and Flexible Depth Foundation Model with Flow Matching
Highlight Jiaqi Li, Yiran Wang, Jinghong Zheng, Junrui Zhang, Liao Shen, Tianqi Liu, Zhiguo Cao PDF ↗
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
Highlight Tianyu Huai, Jie Zhou, Xingjiao Wu, Qin Chen, Qingchun Bai, Ze Zhou, Liang He PDF ↗
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
Highlight Jiansheng Li, Xingxuan Zhang, Hao Zou, Yige Guo, Renzhe Xu, Yilong Liu, Chuzhao Zhu, Yue He, Peng Cui arXiv ↗ PDF ↗
CRISP: Object Pose and Shape Estimation with Test-Time Adaptation
Highlight Jingnan Shi, Rajat Talak, Harry Zhang, David Jin, Luca Carlone arXiv ↗ PDF ↗
Can Generative Video Models Help Pose Estimation?
Highlight Ruojin Cai, Jason Y. Zhang, Philipp Henzler, Zhengqi Li, Noah Snavely, Ricardo Martin-Brualla arXiv ↗ PDF ↗
Can Machines Understand Composition? Dataset and Benchmark for Photographic Image Composition Embedding and Understanding
Highlight Zhaoran Zhao, Peng Lu, Anran Zhang, Peipei Li, Xia Li, Xuannan Liu, Yang Hu, Shiyi Chen, Liwei Wang, Wenhao Guo PDF ↗
Change3D: Revisiting Change Detection and Captioning from A Video Modeling Perspective
Highlight Duowang Zhu, Xiaohu Huang, Haiyan Huang, Hao Zhou, Zhenfeng Shao arXiv ↗ PDF ↗
CheckManual: A New Challenge and Benchmark for Manual-based Appliance Manipulation
Highlight Yuxing Long, Jiyao Zhang, Mingjie Pan, Tianshu Wu, Taewhan Kim, Hao Dong arXiv ↗ PDF ↗
Circumventing Shortcuts in Audio-visual Deepfake Detection Datasets with Unsupervised Learning
Highlight Stefan Smeu, Dragos-Alexandru Boldisor, Dan Oneata, Elisabeta Oneata arXiv ↗ PDF ↗
ClimbingCap: Multi-Modal Dataset and Method for Rock Climbing in World Coordinate
Highlight Ming Yan, Xincheng Lin, Yuhua Luo, Shuqi Fan, Yudi Dai, Qixin Zhong, Lincai Zhong, Yuexin Ma, Lan Xu, Chenglu Wen, Siqi Shen, Cheng Wang arXiv ↗ PDF ↗
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
Highlight Wei Chen, Lin Li, Yongqi Yang, Bin Wen, Fan Yang, Tingting Gao, Yu Wu, Long Chen arXiv ↗ PDF ↗
CoSER: Towards Consistent Dense Multiview Text-to-Image Generator for 3D Creation
Highlight Bonan Li, Zicheng Zhang, Xingyi Yang, Xinchao Wang PDF ↗
Coeff-Tuning: A Graph Filter Subspace View for Tuning Attention-Based Large Models
Highlight Zichen Miao, Wei Chen, Qiang Qiu PDF ↗
Compositional Caching for Training-free Open-vocabulary Attribute Detection
Highlight Marco Garosi, Alessandro Conti, Gaowen Liu, Elisa Ricci, Massimiliano Mancini arXiv ↗ PDF ↗
Comprehensive Information Bottleneck for Unveiling Universal Attribution to Interpret Vision Transformers
Highlight Jung-Ho Hong, Ho-Joong Kim, Kyu-Sung Jeon, Seong-Whan Lee arXiv ↗ PDF ↗
Context-Aware Multimodal Pretraining
Highlight Karsten Roth, Zeynep Akata, Dima Damen, Ivana Balazevic, Olivier J. Henaff arXiv ↗ PDF ↗
Creating Your Editable 3D Photorealistic Avatar with Tetrahedron-constrained Gaussian Splatting
Highlight Hanxi Liu, Yifang Men, Zhouhui Lian arXiv ↗ PDF ↗
Cross-View Completion Models are Zero-shot Correspondence Estimators
Highlight Honggyu An, Jin Hyeon Kim, Seonghoon Park, Jaewoo Jung, Jisang Han, Sunghwan Hong, Seungryong Kim arXiv ↗ PDF ↗
Cross-modal Causal Relation Alignment for Video Question Grounding
Highlight Weixing Chen, Yang Liu, Binglin Chen, Jiandong Su, Yongsen Zheng, Liang Lin arXiv ↗ PDF ↗
CrossOver: 3D Scene Cross-Modal Alignment
Highlight Sayan Deb Sarkar, Ondrej Miksik, Marc Pollefeys, Daniel Barath, Iro Armeni arXiv ↗ PDF ↗
Cubify Anything: Scaling Indoor 3D Object Detection
Highlight Justin Lazarow, David Griffiths, Gefen Kohavi, Francisco Crespo, Afshin Dehghan arXiv ↗ PDF ↗
DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution Prediction
Highlight Junjie Zhou, Shouju Wang, Yuxia Tang, Qi Zhu, Daoqiang Zhang, Wei Shao PDF ↗
DIV-FF: Dynamic Image-Video Feature Fields For Environment Understanding in Egocentric Videos
Highlight Lorenzo Mur-Labadia, Josechu Guerrero, Ruben Martinez-Cantin PDF ↗
DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution Detection
Highlight Shawn Li, Huixian Gong, Hao Dong, Tiankai Yang, Zhengzhong Tu, Yue Zhao arXiv ↗ PDF ↗
DashGaussian: Optimizing 3D Gaussian Splatting in 200 Seconds
Highlight Youyu Chen, Junjun Jiang, Kui Jiang, Xiao Tang, Zhihao Li, Xianming Liu, Yinyu Nie arXiv ↗ PDF ↗
Dataset Distillation with Neural Characteristic Function: A Minmax Perspective
Highlight Shaobo Wang, Yicun Yang, Zhiyuan Liu, Chenghao Sun, Xuming Hu, Conghui He, Linfeng Zhang arXiv ↗ PDF ↗
Decoupled Distillation to Erase: A General Unlearning Method for Any Class-centric Tasks
Highlight Yu Zhou, Dian Zheng, Qijie Mo, Renjie Lu, Kun-Yu Lin, Wei-Shi Zheng arXiv ↗ PDF ↗
Deep Change Monitoring: A Hyperbolic Representative Learning Framework and a Dataset for Long-term Fine-grained Tree Change Detection
Highlight Yante Li, Hanwen Qi, Haoyu Chen, Xinlian Liang, Guoying Zhao arXiv ↗ PDF ↗
Deep Fair Multi-View Clustering with Attention KAN
Highlight HaiMing Xu, Qianqian Wang, Boyue Wang, Quanxue Gao PDF ↗
DefectFill: Realistic Defect Generation with Inpainting Diffusion Model for Visual Inspection
Highlight Jaewoo Song, Daemin Park, Kanghyun Baek, Sangyub Lee, Jooyoung Choi, Eunji Kim, Sungroh Yoon arXiv ↗ PDF ↗
DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
Highlight Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun, Yong Zhang, Long Quan, Ying Shan arXiv ↗ PDF ↗
Detecting Backdoor Attacks in Federated Learning via Direction Alignment Inspection
Highlight Jiahao Xu, Zikai Zhang, Rui Hu arXiv ↗ PDF ↗
Detection-Friendly Nonuniformity Correction: A Union Framework for Infrared UAV Target Detection
Highlight Houzhang Fang, Xiaolin Wang, Zengyang Li, Lu Wang, Qingshan Li, Yi Chang, Luxin Yan PDF ↗
DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics Awareness
Highlight Yiming Zhong, Qi Jiang, Jingyi Yu, Yuexin Ma arXiv ↗ PDF ↗
DiffCAM: Data-Driven Saliency Maps by Capturing Feature Differences
Highlight Xingjian Li, Qiming Zhao, Neelesh Bisht, Mostofa Rafid Uddin, Jin Yu Kim, Bryan Zhang, Min Xu PDF ↗
Diffusion-based Realistic Listening Head Generation via Hybrid Motion Modeling
Highlight Yinuo Wang, Yanbo Fan, Xuan Wang, Guo Yu, Fei Wang PDF ↗
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
Highlight Bencheng Liao, Shaoyu Chen, Haoran Yin, Bo Jiang, Cheng Wang, Sixu Yan, Xinbang Zhang, Xiangyu Li, Ying Zhang, Qian Zhang, Xinggang Wang arXiv ↗ PDF ↗
Digital Twin Catalog: A Large-Scale Photorealistic 3D Object Digital Twin Dataset
Highlight Zhao Dong, Ka Chen, Zhaoyang Lv, Hong-Xing Yu, Yunzhi Zhang, Cheng Zhang, Yufeng Zhu, Stephen Tian, Zhengqin Li, Geordie Moffatt, Sean Christofferson, James Fort, Xiaqing Pan, Mingfei Yan, Jiajun Wu, Carl Yuheng Ren, Richard Newcombe arXiv ↗ PDF ↗
DistinctAD: Distinctive Audio Description Generation in Contexts
Highlight Bo Fang, Wenhao Wu, Qiangqiang Wu, Yuxin Song, Antoni B. Chan arXiv ↗ PDF ↗
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
Highlight Zuopeng Yang, Jiluan Fan, Anli Yan, Erdun Gao, Xin Lin, Tao Li, Kanghua Mo, Changyu Dong arXiv ↗ PDF ↗
Do Computer Vision Foundation Models Learn the Low-level Characteristics of the Human Visual System?
Highlight Yancheng Cai, Fei Yin, Dounia Hammou, Rafal Mantiuk arXiv ↗ PDF ↗
Doppelgangers and Adversarial Vulnerability
Highlight George Kamberov arXiv ↗ PDF ↗
Doppelgangers++: Improved Visual Disambiguation with Geometric 3D Features
Highlight Yuanbo Xiangli, Ruojin Cai, Hanyu Chen, Jeffrey Byrne, Noah Snavely PDF ↗
Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
Highlight Kim Jun-Seong, GeonU Kim, Kim Yu-Ji, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh arXiv ↗ PDF ↗
DriveGPT4-V2: Harnessing Large Language Model Capabilities for Enhanced Closed-Loop Autonomous Driving
Highlight Zhenhua Xu, Yan Bai, Yujia Zhang, Zhuoling Li, Fei Xia, Kwan-Yee K. Wong, Jianqiang Wang, Hengshuang Zhao PDF ↗
Driving by the Rules: A Benchmark for Integrating Traffic Sign Regulations into Vectorized HD Map
Highlight Xinyuan Chang, Maixuan Xue, Xinran Liu, Zheng Pan, Xing Wei arXiv ↗ PDF ↗
DroneSplat: 3D Gaussian Splatting for Robust 3D Reconstruction from In-the-Wild Drone Imagery
Highlight Jiadong Tang, Yu Gao, Dianyi Yang, Liqi Yan, Yufeng Yue, Yi Yang arXiv ↗ PDF ↗
DualPM: Dual Posed-Canonical Point Maps for 3D Shape and Pose Reconstruction
Highlight Ben Kaye, Tomas Jakab, Shangzhe Wu, Christian Ruprecht, Andrea Vedaldi arXiv ↗ PDF ↗
DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding
Highlight Geng Li, Jinglin Xu, Yunzhen Zhao, Yuxin Peng arXiv ↗ PDF ↗
Dyn-HaMR: Recovering 4D Interacting Hand Motion from a Dynamic Camera
Highlight Zhengdi Yu, Stefanos Zafeiriou, Tolga Birdal PDF ↗
EBS-EKF: Accurate and High Frequency Event-based Star Tracking
Highlight Albert W. Reed, Connor Hashemi, Dennis Melamed, Nitesh Menon, Keigo Hirakawa, Scott McCloskey PDF ↗
ESC: Erasing Space Concept for Knowledge Deletion
Highlight Tae-Young Lee, Sundong Park, Minwoo Jeon, Hyoseok Hwang, Gyeong-Moon Park arXiv ↗ PDF ↗
ETAP: Event-based Tracking of Any Point
Highlight Friedhelm Hamann, Daniel Gehrig, Filbert Febryanto, Kostas Daniilidis, Guillermo Gallego arXiv ↗ PDF ↗
EffiDec3D: An Optimized Decoder for High-Performance and Efficient 3D Medical Image Segmentation
Highlight Md Mostafijur Rahman, Radu Marculescu PDF ↗
Efficient Motion-Aware Video MLLM
Highlight Zijia Zhao, Yuqi Huo, Tongtian Yue, Longteng Guo, Haoyu Lu, Bingning Wang, Weipeng Chen, Jing Liu arXiv ↗ PDF ↗
EgoPressure: A Dataset for Hand Pressure and Pose Estimation in Egocentric Vision
Highlight Yiming Zhao, Taein Kwon, Paul Streli, Marc Pollefeys, Christian Holz arXiv ↗ PDF ↗
Electromyography-Informed Facial Expression Reconstruction for Physiological-Based Synthesis and Analysis
Highlight Tim Büchner, Christoph Anders, Orlando Guntinas-Lichius, Joachim Denzler PDF ↗
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
Highlight Gaoxiang Cong, Jiadong Pan, Liang Li, Yuankai Qi, Yuxin Peng, Anton van den Hengel, Jian Yang, Qingming Huang arXiv ↗ PDF ↗
Empowering Vector Graphics with Consistently Arbitrary Viewing and View-dependent Visibility
Highlight Yidi Li, Jun Xiao, Zhengda Lu, Yiqun Wang, Haiyong Jiang arXiv ↗ PDF ↗
End-to-End HOI Reconstruction Transformer with Graph-based Encoding
Highlight Zhenrong Wang, Qi Zheng, Sihan Ma, Maosheng Ye, Yibing Zhan, Dongjiang Li arXiv ↗ PDF ↗
Enduring, Efficient and Robust Trajectory Prediction Attack in Autonomous Driving via Optimization-Driven Multi-Frame Perturbation Framework
Highlight Yi Yu, Weizhen Han, Libing Wu, Bingyi Liu, Enshu Wang, Zhuangzhuang Zhang PDF ↗
EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
Highlight Jianrong Zhang, Hehe Fan, Yi Yang arXiv ↗ PDF ↗
Enhanced Visual-Semantic Interaction with Tailored Prompts for Pedestrian Attribute Recognition
Highlight Junyi Wu, Yan Huang, Min Gao, Yuzhen Niu, Yuzhong Chen, Qiang Wu PDF ↗
Erase Diffusion: Empowering Object Removal Through Calibrating Diffusion Pathways
Highlight Yi Liu, Hao Zhou, Benlei Cui, Wenxiang Shang, Ran Lin arXiv ↗ PDF ↗
Estimating Body and Hand Motion in an Ego-sensed World
Highlight Brent Yi, Vickie Ye, Maya Zheng, Yunqi Li, Lea Müller, Georgios Pavlakos, Yi Ma, Jitendra Malik, Angjoo Kanazawa arXiv ↗ PDF ↗
Ev-3DOD: Pushing the Temporal Boundaries of 3D Object Detection with Event Cameras
Highlight Hoonhee Cho, Jae-Young Kang, Youngho Kim, Kuk-Jin Yoon PDF ↗
EvEnhancer: Empowering Effectiveness, Efficiency and Generalizability for Continuous Space-Time Video Super-Resolution with Events
Highlight Shuoyan Wei, Feng Li, Shengeng Tang, Yao Zhao, Huihui Bai arXiv ↗ PDF ↗
Event Ellipsometer: Event-based Mueller-Matrix Video Imaging
Highlight Ryota Maeda, Yunseong Moon, Seung-Hwan Baek arXiv ↗ PDF ↗
Event Fields: Capturing Light Fields at High Speed, Resolution, and Dynamic Range
Highlight Ziyuan Qu, Zihao Zou, Vivek Boominathan, Praneeth Chakravarthula, Adithya Pediredla arXiv ↗ PDF ↗
EventPSR: Surface Normal and Reflectance Estimation from Photometric Stereo Using an Event Camera
Highlight Bohan Yu, Jin Han, Boxin Shi, Imari Sato PDF ↗
Exact: Exploring Space-Time Perceptive Clues for Weakly Supervised Satellite Image Time Series Semantic Segmentation
Highlight Hao Zhu, Yan Zhu, Jiayu Xiao, Tianxiang Xiao, Yike Ma, Yucheng Zhang, Feng Dai arXiv ↗ PDF ↗
Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think
Highlight Jie Tian, Xiaoye Qu, Zhenyi Lu, Wei Wei, Sichen Liu, Yu Cheng arXiv ↗ PDF ↗
FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximation
Highlight Zhuguanyu Wu, Shihe Wang, Jiayi Zhang, Jiaxin Chen, Yunhong Wang PDF ↗
FIction: 4D Future Interaction Prediction from Video
Highlight Kumar Ashutosh, Georgios Pavlakos, Kristen Grauman arXiv ↗ PDF ↗
FRAME: Floor-aligned Representation for Avatar Motion from Egocentric Video
Highlight Andrea Boscolo Camiletto, Jian Wang, Eduardo Alvarado, Rishabh Dabral, Thabo Beeler, Marc Habermann, Christian Theobalt arXiv ↗ PDF ↗
FRESA: Feedforward Reconstruction of Personalized Skinned Avatars from Few Images
Highlight Rong Wang, Fabian Prada, Ziyan Wang, Zhongshi Jiang, Chengxiang Yin, Junxuan Li, Shunsuke Saito, Igor Santesteban, Javier Romero, Rohan Joshi, Hongdong Li, Jason Saragih, Yaser Sheikh arXiv ↗ PDF ↗
F^3OCUS - Federated Finetuning of Vision-Language Foundation Models with Optimal Client Layer Updating Strategy via Multi-objective Meta-Heuristics
Highlight Pramit Saha, Felix Wagner, Divyanshu Mishra, Can Peng, Anshul Thakur, David A. Clifton, Konstantinos Kamnitsas, J. Alison Noble PDF ↗
Few-shot Implicit Function Generation via Equivariance
Highlight Suizhi Huang, Xingyi Yang, Hongtao Lu, Xinchao Wang arXiv ↗ PDF ↗
Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning
Highlight Bardia Safaei, Faizan Siddiqui, Jiacong Xu, Vishal M. Patel, Shao-Yuan Lo arXiv ↗ PDF ↗
FineVQ: Fine-Grained User Generated Content Video Quality Assessment
Highlight Huiyu Duan, Qiang Hu, Jiarui Wang, Liu Yang, Zitong Xu, Lu Liu, Xiongkuo Min, Chunlei Cai, Tianxiao Ye, Xiaoyun Zhang, Guangtao Zhai arXiv ↗ PDF ↗
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement
Highlight Ian Huang, Yanan Bao, Karen Truong, Howard Zhou, Cordelia Schmid, Leonidas Guibas, Alireza Fathi arXiv ↗ PDF ↗
Flash3D: Super-scaling Point Transformers through Joint Hardware-Geometry Locality
Highlight Liyan Chen, Gregory P. Meyer, Zaiwei Zhang, Eric M. Wolff, Paul Vernaza arXiv ↗ PDF ↗
FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less Compute
Highlight Sotiris Anagnostidis, Gregor Bachmann, Yeongmin Kim, Jonas Kohler, Markos Georgopoulos, Artsiom Sanakoyeu, Yuming Du, Albert Pumarola, Ali Thabet, Edgar Schönfeld arXiv ↗ PDF ↗
Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution
Highlight Qihao Liu, Xi Yin, Alan Yuille, Andrew Brown, Mannat Singh arXiv ↗ PDF ↗
Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation
Highlight Xiaoying Xing, Avinab Saha, Junfeng He, Susan Hao, Paul Vicol, Moonkyung Ryu, Gang Li, Sahil Singla, Sarah Young, Yinxiao Li, Feng Yang, Deepak Ramachandran PDF ↗
ForestLPR: LiDAR Place Recognition in Forests Attentioning Multiple BEV Density Images
Highlight Yanqing Shen, Turcan Tuna, Marco Hutter, Cesar Cadena, Nanning Zheng arXiv ↗ PDF ↗
FoundHand: Large-Scale Domain-Specific Learning for Controllable Hand Image Generation
Highlight Kefan Chen, Chaerin Min, Linguang Zhang, Shreyas Hampali, Cem Keskin, Srinath Sridhar arXiv ↗ PDF ↗
Free-viewpoint Human Animation with Pose-correlated Reference Selection
Highlight Fa-Ting Hong, Zhan Xu, Haiyang Liu, Qinjie Lin, Luchuan Song, Zhixin Shu, Yang Zhou, Duygu Ceylan, Dan Xu arXiv ↗ PDF ↗
FreeCloth: Free-form Generation Enhances Challenging Clothed Human Modeling
Highlight Hang Ye, Xiaoxuan Ma, Hai Ci, Wentao Zhu, Yizhou Wang arXiv ↗ PDF ↗
FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
Highlight Jiangtong Tan, Hu Yu, Jie Huang, Jie Xiao, Feng Zhao arXiv ↗ PDF ↗
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
Highlight Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung arXiv ↗ PDF ↗
From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing
Highlight Jingxuan Wei, Cheng Tan, Qi Chen, Gaowei Wu, Siyuan Li, Zhangyang Gao, Linzhuang Sun, Bihui Yu, Ruifeng Guo arXiv ↗ PDF ↗
Full-DoF Egomotion Estimation for Event Cameras Using Geometric Solvers
Highlight Ji Zhao, Banglei Guan, Zibin Liu, Laurent Kneip arXiv ↗ PDF ↗
Functionality Understanding and Segmentation in 3D Scenes
Highlight Jaime Corsetti, Francesco Giuliari, Alice Fasoli, Davide Boscaini, Fabio Poiesi arXiv ↗ PDF ↗
GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control
Highlight Xuanchi Ren, Tianchang Shen, Jiahui Huang, Huan Ling, Yifan Lu, Merlin Nimier-David, Thomas Müller, Alexander Keller, Sanja Fidler, Jun Gao arXiv ↗ PDF ↗
Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding
Highlight Tianyu Chen, Xingcheng Fu, Yisen Gao, Haodong Qian, Yuecen Wei, Kun Yan, Haoyi Zhou, Jianxin Li arXiv ↗ PDF ↗
GaussianUDF: Inferring Unsigned Distance Functions through 3D Gaussian Splatting
Highlight Shujuan Li, Yu-Shen Liu, Zhizhong Han arXiv ↗ PDF ↗
Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders
Highlight Fiona Ryan, Ajay Bati, Sangmin Lee, Daniel Bolya, Judy Hoffman, James M. Rehg PDF ↗
GenVDM: Generating Vector Displacement Maps From a Single Image
Highlight Yuezhi Yang, Qimin Chen, Vladimir G. Kim, Siddhartha Chaudhuri, Qixing Huang, Zhiqin Chen arXiv ↗ PDF ↗
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
Highlight Tomoya Yoshida, Shuhei Kurita, Taichi Nishimura, Shinsuke Mori arXiv ↗ PDF ↗
Generative Densification: Learning to Densify Gaussians for High-Fidelity Generalizable 3D Reconstruction
Highlight Seungtae Nam, Xiangyu Sun, Gyeongjin Kang, Younggeun Lee, Seungjun Oh, Eunbyung Park arXiv ↗ PDF ↗
Generative Modeling of Class Probability for Multi-Modal Representation Learning
Highlight JungKyoo Shin, Bumsoo Kim, Eunwoo Kim arXiv ↗ PDF ↗
Generative Multiview Relighting for 3D Reconstruction under Extreme Illumination Variation
Highlight Hadi Alzayer, Philipp Henzler, Jonathan T. Barron, Jia-Bin Huang, Pratul P. Srinivasan, Dor Verbin arXiv ↗ PDF ↗
Generative Omnimatte: Learning to Decompose Video into Layers
Highlight Yao-Chih Lee, Erika Lu, Sarah Rumbley, Michal Geyer, Jia-Bin Huang, Tali Dekel, Forrester Cole arXiv ↗ PDF ↗
Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis
Highlight Yu Yuan, Xijun Wang, Yichen Sheng, Prateek Chennuri, Xingguang Zhang, Stanley Chan arXiv ↗ PDF ↗
GigaHands: A Massive Annotated Dataset of Bimanual Hand Activities
Highlight Rao Fu, Dingxi Zhang, Alex Jiang, Wanjia Fu, Austin Funk, Daniel Ritchie, Srinath Sridhar arXiv ↗ PDF ↗
Glossy Object Reconstruction with Cost-effective Polarized Acquisition
Highlight Bojian Wu, Yifan Peng, Ruizhen Hu, Xiaowei Zhou arXiv ↗ PDF ↗
Goku: Flow Based Video Generative Foundation Models
Highlight Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu arXiv ↗ PDF ↗
Good, Cheap, and Fast: Overfitted Image Compression with Wasserstein Distortion
Highlight Jona Ballé, Luca Versari, Emilien Dupont, Hyunjik Kim, Matthias Bauer PDF ↗
Gradient-Guided Annealing for Domain Generalization
Highlight Aristotelis Ballas, Christos Diou arXiv ↗ PDF ↗
Graph Neural Network Combining Event Stream and Periodic Aggregation for Low-Latency Event-based Vision
Highlight Manon Dampfhoffer, Thomas Mesquida, Damien Joubert, Thomas Dalgaty, Pascal Vivet, Christoph Posch PDF ↗
GroundingFace: Fine-grained Face Understanding via Pixel Grounding Multimodal Large Language Model
Highlight Yue Han, Jiangning Zhang, Junwei Zhu, Runze Hou, Xiaozhong Ji, Chuming Lin, Xiaobin Hu, Zhucun Xue, Yong Liu PDF ↗
H-MoRe: Learning Human-centric Motion Representation for Action Analysis
Highlight Zhanbo Huang, Xiaoming Liu, Yu Kong PDF ↗
HELVIPAD: A Real-World Dataset for Omnidirectional Stereo Depth Estimation
Highlight Mehdi Zayene, Jannik Endres, Albias Havolli, Charles Corbière, Salim Cherkaoui, Alexandre Kontouli, Alexandre Alahi arXiv ↗ PDF ↗
HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos
Highlight Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon, Shreyas Hampali, Shangchen Han, Fan Zhang, Linguang Zhang, Jade Fountain, Edward Miller, Selen Basol, Richard Newcombe, Robert Wang, Jakob Julian Engel, Tomas Hodan arXiv ↗ PDF ↗
HSI-GPT: A General-Purpose Large Scene-Motion-Language Model for Human Scene Interaction
Highlight Yuan Wang, Yali Li, Xiang Li, Shengjin Wang PDF ↗
HaWoR: World-Space Hand Motion Reconstruction from Egocentric Videos
Highlight Jinglei Zhang, Jiankang Deng, Chao Ma, Rolandos Alexandros Potamias arXiv ↗ PDF ↗
Hardware-Rasterized Ray-Based Gaussian Splatting
Highlight Samuel Rota Bulò, Nemanja Bartolovic, Lorenzo Porzi, Peter Kontschieder PDF ↗
High-Fidelity Lightweight Mesh Reconstruction from Point Clouds
Highlight Chen Zhang, Wentao Wang, Ximeng Li, Xinyao Liao, Wanjuan Su, Wenbing Tao PDF ↗
High-fidelity 3D Object Generation from Single Image with RGBN-Volume Gaussian Reconstruction Model
Highlight Yiyang Shen, Kun Zhou, He Wang, Yin Yang, Tianjia Shao arXiv ↗ PDF ↗
Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
Highlight Huaxin Zhang, Xiaohao Xu, Xiang Wang, Jialong Zuo, Xiaonan Huang, Changxin Gao, Shanjun Zhang, Li Yu, Nong Sang PDF ↗
HotSpot: Signed Distance Function Optimization with an Asymptotically Sufficient Condition
Highlight Zimo Wang, Cheng Wang, Taiki Yoshino, Sirui Tao, Ziyang Fu, Tzu-Mao Li arXiv ↗ PDF ↗
How Do I Do That? Synthesizing 3D Hand Motion and Contacts for Everyday Interactions
Highlight Aditya Prakash, Benjamin Lundell, Dmitry Andreychuk, David Forsyth, Saurabh Gupta, Harpreet Sawhney arXiv ↗ PDF ↗
HuPerFlow: A Comprehensive Benchmark for Human vs. Machine Motion Estimation Comparison
Highlight Yung-Hao Yang, Zitang Sun, Taiki Fukiage, Shin'ya Nishida PDF ↗
HumanRig: Learning Automatic Rigging for Humanoid Character in a Large Scale Dataset
Highlight Zedong Chu, Feng Xiong, Meiduo Liu, Jinzhi Zhang, Mingqi Shao, Zhaoxu Sun, Di Wang, Mu Xu arXiv ↗ PDF ↗
HyperLoRA: Parameter-Efficient Adaptive Generation for Portrait Synthesis
Highlight Mengtian Li, Jinshu Chen, Wanquan Feng, Bingchuan Li, Fei Dai, Songtao Zhao, Qian He arXiv ↗ PDF ↗
Hyperbolic Safety-Aware Vision-Language Models
Highlight Tobia Poppi, Tejaswi Kasarla, Pascal Mettes, Lorenzo Baraldi, Rita Cucchiara arXiv ↗ PDF ↗
ICE: Intrinsic Concept Extraction from a Single Image via Diffusion Models
Highlight Fernando Julio Cendra, Kai Han arXiv ↗ PDF ↗
ICP: Immediate Compensation Pruning for Mid-to-high Sparsity
Highlight Xin Luo, Xueming Fu, Zihang Jiang, S. Kevin Zhou PDF ↗
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
Highlight Shenghai Yuan, Jinfa Huang, Xianyi He, Yunyang Ge, Yujun Shi, Liuhan Chen, Jiebo Luo, Li Yuan arXiv ↗ PDF ↗
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement
Highlight Zhengxian Yang, Shi Pan, Shengqi Wang, Haoxiang Wang, Li Lin, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu arXiv ↗ PDF ↗
Image Quality Assessment: From Human to Machine Preference
Highlight Chunyi Li, Yuan Tian, Xiaoyue Ling, Zicheng Zhang, Haodong Duan, Haoning Wu, Ziheng Jia, Xiaohong Liu, Xiongkuo Min, Guo Lu, Weisi Lin, Guangtao Zhai arXiv ↗ PDF ↗
Image Reconstruction from Readout-Multiplexed Single-Photon Detector Arrays
Highlight Shashwath Bharadwaj, Ruangrawee Kitichotkul, Akshay Agarwal, Vivek K Goyal arXiv ↗ PDF ↗
ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning
Highlight Haoyuan Yang, Xiaoou Li, Jiaming Lv, Xianjun Cheng, Qilong Wang, Peihua Li PDF ↗
Implicit Correspondence Learning for Image-to-Point Cloud Registration
Highlight Xinjun Li, Wenfei Yang, Jiacheng Deng, Zhixin Cheng, Xu Zhou, Tianzhu Zhang PDF ↗
Improving Gaussian Splatting with Localized Points Management
Highlight Haosen Yang, Chenhao Zhang, Wenqing Wang, Marco Volino, Adrian Hilton, Li Zhang, Xiatian Zhu arXiv ↗ PDF ↗
Improving Personalized Search with Regularized Low-Rank Parameter Updates
Highlight Fiona Ryan, Josef Sivic, Fabian Caba Heilbron, Judy Hoffman, James M. Rehg, Bryan Russell arXiv ↗ PDF ↗
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment
Highlight Yunhong Lu, Qichao Wang, Hengyuan Cao, Xierui Wang, Xiaoyin Xu, Min Zhang arXiv ↗ PDF ↗
IncEventGS: Pose-Free Gaussian Splatting from a Single Event Camera
Highlight Jian Huang, Chengrui Dong, Xuanhua Chen, Peidong Liu arXiv ↗ PDF ↗
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
Highlight Yuhao Dong, Zuyan Liu, Hai-Long Sun, Jingkang Yang, Winston Hu, Yongming Rao, Ziwei Liu PDF ↗
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
Highlight Hanxun Yu, Wentong Li, Song Wang, Junbo Chen, Jianke Zhu PDF ↗
Instant Gaussian Stream: Fast and Generalizable Streaming of Dynamic Scene Reconstruction via Gaussian Splatting
Highlight Jinbo Yan, Rui Peng, Zhiyan Wang, Luyang Tang, Jiayu Yang, Jie Liang, Jiahao Wu, Ronggang Wang arXiv ↗ PDF ↗
Instruction-based Image Manipulation by Watching How Things Move
Highlight Mingdeng Cao, Xuaner Zhang, Yinqiang Zheng, Zhihao Xia arXiv ↗ PDF ↗
InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions
Highlight Sirui Xu, Hung Yu Ling, Yu-Xiong Wang, Liang-Yan Gui arXiv ↗ PDF ↗
InteractAnything: Zero-shot Human Object Interaction Synthesis via LLM Feedback and Object Affordance Parsing
Highlight Jinlu Zhang, Yixin Chen, Zan Wang, Jie Yang, Yizhou Wang, Siyuan Huang arXiv ↗ PDF ↗
Interpreting Object-level Foundation Models via Visual Precision Search
Highlight Ruoyu Chen, Siyuan Liang, Jingzhi Li, Shiming Liu, Maosen Li, Zhen Huang, Hua Zhang, Xiaochun Cao arXiv ↗ PDF ↗
Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body
Highlight Zeqing Wang, Qingyang Ma, Wentao Wan, Haojie Li, Keze Wang, Yonghong Tian arXiv ↗ PDF ↗
Just Dance with pi! A Poly-modal Inductor for Weakly-supervised Video Anomaly Detection
Highlight Snehashis Majhi, Giacomo D'Amicantonio, Antitza Dantcheva, Quan Kong, Lorenzo Garattoni, Gianpiero Francesca, Egor Bondarev, Francois Bremond arXiv ↗ PDF ↗
KAC: Kolmogorov-Arnold Classifier for Continual Learning
Highlight Yusong Hu, Zichen Liang, Fei Yang, Qibin Hou, Xialei Liu, Ming-Ming Cheng arXiv ↗ PDF ↗
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
Highlight Shenghao Fu, Qize Yang, Qijie Mo, Junkai Yan, Xihan Wei, Jingke Meng, Xiaohua Xie, Wei-Shi Zheng arXiv ↗ PDF ↗
LP-Diff: Towards Improved Restoration of Real-World Degraded License Plate
Highlight Haoyan Gong, Zhenrong Zhang, Yuzheng Feng, Anh Nguyen, Hongbin Liu PDF ↗
LaTexBlend: Scaling Multi-concept Customized Generation with Latent Textual Blending
Highlight Jian Jin, Zhenbo Yu, Yang Shen, Zhenyong Fu, Jian Yang arXiv ↗ PDF ↗
Label Shift Meets Online Learning: Ensuring Consistent Adaptation with Universal Dynamic Regret
Highlight Yucong Dai, Shilin Gu, Ruidong Fan, Chao Xu, Chenping Hou PDF ↗
Latent Drifting in Diffusion Models for Counterfactual Medical Image Synthesis
Highlight Yousef Yeganeh, Azade Farshad, Ioannis Charisiadis, Marta Hasny, Martin Hartenberger, Björn Ommer, Nassir Navab, Ehsan Adeli arXiv ↗ PDF ↗
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
Highlight Shengqiong Wu, Hao Fei, Jingkang Yang, Xiangtai Li, Juncheng Li, Hanwang Zhang, Tat-seng Chua arXiv ↗ PDF ↗
Learning Class Prototypes for Unified Sparse-Supervised 3D Object Detection
Highlight Yun Zhu, Le Hui, Hang Yang, Jianjun Qian, Jin Xie, Jian Yang arXiv ↗ PDF ↗
Learning Conditional Space-Time Prompt Distributions for Video Class-Incremental Learning
Highlight Xiaohan Zou, Wenchao Ma, Shu Zhao PDF ↗
Learning Phase Distortion with Selective State Space Models for Video Turbulence Mitigation
Highlight Xingguang Zhang, Nicholas Chimitt, Xijun Wang, Yu Yuan, Stanley H. Chan arXiv ↗ PDF ↗
Learning to Filter Outlier Edges in Global SfM
Highlight Nicole Damblon, Marc Pollefeys, Daniel Barath PDF ↗
Less is More: Efficient Model Merging with Binary Task Switch
Highlight Biqing Qi, Fangyuan Li, Zhen Wang, Junqi Gao, Dong Li, Peng Ye, Bowen Zhou arXiv ↗ PDF ↗
Lessons and Insights from a Unifying Study of Parameter-Efficient Fine-Tuning (PEFT) in Visual Recognition
Highlight Zheda Mai, Ping Zhang, Cheng-Hao Tu, Hong-You Chen, Quang-Huy Nguyen, Li Zhang, Wei-Lun Chao arXiv ↗ PDF ↗
LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis
Highlight Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Qifeng Chen, Yujun Shen, Limin Wang arXiv ↗ PDF ↗
Lifting Motion to the 3D World via 2D Diffusion
Highlight Jiaman Li, C. Karen Liu, Jiajun Wu arXiv ↗ PDF ↗
Light Transport-aware Diffusion Posterior Sampling for Single-View Reconstruction of 3D Volumes
Highlight Ludwic Leonard, Nils Thurey, Rüdiger Westermann PDF ↗
Light3R-SfM: Towards Feed-forward Structure-from-Motion
Highlight Sven Elflein, Qunjie Zhou, Laura Leal-Taixé PDF ↗
Locally Orderless Images for Optimization in Differentiable Rendering
Highlight Ishit Mehta, Manmohan Chandraker, Ravi Ramamoorthi arXiv ↗ PDF ↗
MAR-3D: Progressive Masked Auto-regressor for High-Resolution 3D Generation
Highlight Jinnan Chen, Lingting Zhu, Zeyu Hu, Shengju Qian, Yugang Chen, Xin Wang, Gim Hee Lee PDF ↗
MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal Representations
Highlight Kyungho Bae, Jinhyung Kim, Sihaeng Lee, Soonyoung Lee, Gunhee Lee, Jinwoo Choi PDF ↗
MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction Priors
Highlight Riku Murai, Eric Dexheimer, Andrew J. Davison PDF ↗
MATCHA: Towards Matching Anything
Highlight Fei Xue, Sven Elflein, Laura Leal-Taixé, Qunjie Zhou PDF ↗
MAtCha Gaussians: Atlas of Charts for High-Quality Geometry and Photorealism From Sparse Views
Highlight Antoine Guedon, Tomoki Ichikawa, Kohei Yamashita, Ko Nishino arXiv ↗ PDF ↗
MITracker: Multi-View Integration for Visual Object Tracking
Highlight Mengjie Xu, Yitao Zhu, Haotian Jiang, Jiaming Li, Zhenrong Shen, Sheng Wang, Haolin Huang, Xinyu Wang, Han Zhang, Qing Yang, Qian Wang arXiv ↗ PDF ↗
MLLM-as-a-Judge for Image Safety without Human Labeling
Highlight Zhenting Wang, Shuming Hu, Shiyu Zhao, Xiaowen Lin, Felix Juefei-Xu, Zhuowei Li, Ligong Han, Harihar Subramanyam, Li Chen, Jianfa Chen, Nan Jiang, Lingjuan Lyu, Shiqing Ma, Dimitris N. Metaxas, Ankit Jain PDF ↗
MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
Highlight Zhiyuan Zhang, Xiaofan Li, Zhihao Xu, Wenjie Peng, Zijian Zhou, Miaojing Shi, Shuangping Huang arXiv ↗ PDF ↗
MUSt3R: Multi-view Network for Stereo 3D Reconstruction
Highlight Yohann Cabon, Lucas Stoffl, Leonid Antsfeld, Gabriela Csurka, Boris Chidlovskii, Jerome Revaud, Vincent Leroy arXiv ↗ PDF ↗
Make-It-Animatable: An Efficient Framework for Authoring Animation-Ready 3D Characters
Highlight Zhiyang Guo, Jinxu Xiang, Kai Ma, Wengang Zhou, Houqiang Li, Ran Zhang PDF ↗
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
Highlight Xin Zhang, Robby T. Tan arXiv ↗ PDF ↗
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
Highlight Xinqi Liu, Li Zhou, Zikun Zhou, Jianqiu Chen, Zhenyu He arXiv ↗ PDF ↗
MammAlps: A Multi-view Video Behavior Monitoring Dataset of Wild Mammals in the Swiss Alps
Highlight Valentin Gabeff, Haozhe Qi, Brendan Flaherty, Gencer Sumbul, Alexander Mathis, Devis Tuia arXiv ↗ PDF ↗
MangaNinja: Line Art Colorization with Precise Reference Following
Highlight Zhiheng Liu, Ka Leong Cheng, Xi Chen, Jie Xiao, Hao Ouyang, Kai Zhu, Yu Liu, Yujun Shen, Qifeng Chen, Ping Luo arXiv ↗ PDF ↗
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
Highlight Youxin Pang, Ruizhi Shao, Jiajun Zhang, Hanzhang Tu, Yun Liu, Boyao Zhou, Hongwen Zhang, Yebin Liu arXiv ↗ PDF ↗
Material Anything: Generating Materials for Any 3D Object via Diffusion
Highlight Xin Huang, Tengfei Wang, Ziwei Liu, Qing Wang arXiv ↗ PDF ↗
Matrix3D: Large Photogrammetry Model All-in-One
Highlight Yuanxun Lu, Jingyang Zhang, Tian Fang, Jean-Daniel Nahmias, Yanghai Tsin, Long Quan, Xun Cao, Yao Yao, Shiwei Li arXiv ↗ PDF ↗
Memories of Forgotten Concepts
Highlight Matan Rusanovsky, Shimon Malnick, Amir Jevnisek, Ohad Fried, Shai Avidan arXiv ↗ PDF ↗
MeshGen: Generating PBR Textured Mesh with Render-Enhanced Auto-Encoder and Generative Data Augmentation
Highlight Zilong Chen, Yikai Wang, Wenqiang Sun, Feng Wang, Yiwen Chen, Huaping Liu arXiv ↗ PDF ↗
Meta-Learning Hyperparameters for Parameter Efficient Fine-Tuning
Highlight Zichen Tian, Yaoyao Liu, Qianru Sun PDF ↗
MetricGrids: Arbitrary Nonlinear Approximation with Elementary Metric Grids based Implicit Neural Representation
Highlight Shu Wang, Yanbo Gao, Shuai Li, Chong Lv, Xun Cai, Chuankun Li, Hui Yuan, Jinglin Zhang arXiv ↗ PDF ↗
Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking
Highlight Junxi Chen, Junhao Dong, Xiaohua Xie arXiv ↗ PDF ↗
MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion Scaffolds
Highlight Jiahui Lei, Yijia Weng, Adam W. Harley, Leonidas Guibas, Kostas Daniilidis arXiv ↗ PDF ↗
Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification
Highlight Jiayu Jiang, Changxing Ding, Wentao Tan, Junhong Wang, Jin Tao, Xiangmin Xu arXiv ↗ PDF ↗
MonSter: Marry Monodepth to Stereo Unleashes Power
Highlight Junda Cheng, Longliang Liu, Gangwei Xu, Xianqi Wang, Zhaoxing Zhang, Yong Deng, Jinliang Zang, Yurui Chen, Zhipeng Cai, Xin Yang arXiv ↗ PDF ↗
MotionPRO: Exploring the Role of Pressure in Human MoCap and Beyond
Highlight Shenghao Ren, Yi Lu, Jiayi Huang, Jiayi Zhao, He Zhang, Tao Yu, Qiu Shen, Xun Cao arXiv ↗ PDF ↗
Multi-Label Prototype Visual Spatial Search for Weakly Supervised Semantic Segmentation
Highlight Songsong Duan, Xi Yang, Nannan Wang PDF ↗
Multi-modal Vision Pre-training for Medical Image Analysis
Highlight Shaohao Rui, Lingzhi Chen, Zhenyu Tang, Lilong Wang, Mianxin Liu, Shaoting Zhang, Xiaosong Wang arXiv ↗ PDF ↗
Multimodal Autoregressive Pre-training of Large Vision Encoders
Highlight Enrico Fini, Mustafa Shukor, Xiujun Li, Philipp Dufter, Michal Klein, David Haldimann, Sai Aitharaju, Victor G. Turrisi da Costa, Louis Béthune, Zhe Gan, Alexander Toshev, Marcin Eichner, Moin Nabi, Yinfei Yang, Joshua Susskind, Alaaeldin El-Nouby arXiv ↗ PDF ↗
Multirate Neural Image Compression with Adaptive Lattice Vector Quantization
Highlight Hao Xu, Xiaolin Wu, Xi Zhang PDF ↗
Multitwine: Multi-Object Compositing with Text and Layout Control
Highlight Gemma Canet Tarrés, Zhe Lin, Zhifei Zhang, He Zhang, Andrew Gilbert, John Collomosse, Soo Ye Kim PDF ↗
NLPrompt: Noise-Label Prompt Learning for Vision-Language Models
Highlight Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi arXiv ↗ PDF ↗
NSD-Imagery: A Benchmark Dataset for Extending fMRI Vision Decoding Methods to Mental Imagery
Highlight Reese Kneeland, Paul S. Scotti, Ghislain St-Yves, Jesse Breedlove, Kendrick Kay, Thomas Naselaris PDF ↗
NTClick: Achieving Precise Interactive Segmentation With Noise-tolerant Clicks
Highlight Chenyi Zhang, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei PDF ↗
NeRFPrior: Learning Neural Radiance Field as a Prior for Indoor Scene Reconstruction
Highlight Wenyuan Zhang, Emily Yue-ting Jia, Junsheng Zhou, Baorui Ma, Kanle Shi, Yu-Shen Liu, Zhizhong Han arXiv ↗ PDF ↗
NexusGS: Sparse View Synthesis with Epipolar Depth Priors in 3D Gaussian Splatting
Highlight Yulong Zheng, Zicheng Jiang, Shengfeng He, Yandu Sun, Junyu Dong, Huaidong Zhang, Yong Du arXiv ↗ PDF ↗
No Pains, More Gains: Recycling Sub-Salient Patches for Efficient High-Resolution Image Recognition
Highlight Rong Qin, Xin Liu, Xingyu Liu, Jiaxuan Liu, Jinglei Shi, Liang Lin, Jufeng Yang PDF ↗
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
Highlight Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci, Nicola Strisciuglio arXiv ↗ PDF ↗
O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models
Highlight Ashshak Sharifdeen, Muhammad Akhtar Munir, Sanoojan Baliah, Salman Khan, Muhammad Haris Khan PDF ↗
OPTICAL: Leveraging Optimal Transport for Contribution Allocation in Dataset Distillation
Highlight Xiao Cui, Yulei Qin, Wengang Zhou, Hongsheng Li, Houqiang Li PDF ↗
Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding
Highlight Wei Suo, Lijun Zhang, Mengyang Sun, Lin Yuanbo Wu, Peng Wang, Yanning Zhang arXiv ↗ PDF ↗
Olympus: A Universal Task Router for Computer Vision Tasks
Highlight Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip Torr arXiv ↗ PDF ↗
OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints
Highlight Mingjie Pan, Jiyao Zhang, Tianshu Wu, Yinghao Zhao, Wenlong Gao, Hao Dong arXiv ↗ PDF ↗
OmniSplat: Taming Feed-Forward 3D Gaussian Splatting for Omnidirectional Images with Editable Capabilities
Highlight Suyoung Lee, Jaeyoung Chung, Kihoon Kim, Jaeyoo Huh, Gunhee Lee, Minsoo Lee, Kyoung Mu Lee arXiv ↗ PDF ↗
One-Step Event-Driven High-Speed Autofocus
Highlight Yuhan Bao, Shaohua Gao, Wenyong Li, Kaiwei Wang arXiv ↗ PDF ↗
One-shot 3D Object Canonicalization based on Geometric and Semantic Consistency
Highlight Li Jin, Yujie Wang, Wenzheng Chen, Qiyu Dai, Qingzhe Gao, Xueying Qin, Baoquan Chen PDF ↗
Open-Canopy: Towards Very High Resolution Forest Monitoring
Highlight Fajwel Fogel, Yohann Perron, Nikola Besic, Laurent Saint-André, Agnès Pellissier-Tanon, Martin Schwartz, Thomas Boudras, Ibrahim Fayad, Alexandre d'Aspremont, Loic Landrieu, Philippe Ciais PDF ↗
Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces
Highlight Chenyangguang Zhang, Alexandros Delitzas, Fangjinhua Wang, Ruida Zhang, Xiangyang Ji, Marc Pollefeys, Francis Engelmann arXiv ↗ PDF ↗
OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation
Highlight Hui Li, Mingwang Xu, Yun Zhan, Shan Mu, Jiaye Li, Kaihui Cheng, Yuxuan Chen, Tan Chen, Mao Ye, Jingdong Wang, Siyu Zhu arXiv ↗ PDF ↗
OpticalNet: An Optical Imaging Dataset and Benchmark Beyond the Diffraction Limit
Highlight Benquan Wang, Ruyi An, Jin-Kyu So, Sergei Kurdiumov, Eng Aik Chan, Giorgio Adamo, Yuhan Peng, Yewen Li, Bo An PDF ↗
Optimizing for the Shortest Path in Denoising Diffusion Model
Highlight Ping Chen, Xingpeng Zhang, Zhaoxiang Liu, Huan Hu, Xiang Liu, Kai Wang, Min Wang, Yanlin Qian, Shiguo Lian arXiv ↗ PDF ↗
Order-One Rolling Shutter Cameras
Highlight Marvin Anas Hahn, Kathlén Kohn, Orlando Marigliano, Tomas Pajdla arXiv ↗ PDF ↗
Overcoming Shortcut Problem in VLM for Robust Out-of-Distribution Detection
Highlight Zhuo Xu, Xiang Xiang, Yifan Liang PDF ↗
PGC: Physics-Based Gaussian Cloth from a Single Pose
Highlight Michelle Guo, Matt Jen-Yuan Chiang, Igor Santesteban, Nikolaos Sarafianos, Hsiao-yu Chen, Oshri Halimi, Aljaž Božič, Shunsuke Saito, Jiajun Wu, C. Karen Liu, Tuur Stuyck, Egor Larionov arXiv ↗ PDF ↗
Panorama Generation From NFoV Image Done Right
Highlight Dian Zheng, Cheng Zhang, Xiao-Ming Wu, Cao Li, Chengfei Lv, Jian-Fang Hu, Wei-Shi Zheng arXiv ↗ PDF ↗
Parallelized Autoregressive Visual Generation
Highlight Yuqing Wang, Shuhuai Ren, Zhijie Lin, Yujin Han, Haoyuan Guo, Zhenheng Yang, Difan Zou, Jiashi Feng, Xihui Liu arXiv ↗ PDF ↗
PartGen: Part-level 3D Generation and Reconstruction with Multi-view Diffusion Models
Highlight Minghao Chen, Roman Shapovalov, Iro Laina, Tom Monnier, Jianyuan Wang, David Novotny, Andrea Vedaldi arXiv ↗ PDF ↗
Perceptually Accurate 3D Talking Head Generation: New Definitions, Speech-Mesh Representation, and Evaluation Metrics
Highlight Lee Chae-Yeon, Oh Hyun-Bin, Han EunGi, Kim Sung-Bin, Suekyeong Nam, Tae-Hyun Oh arXiv ↗ PDF ↗
PhD: A ChatGPT-Prompted Visual Hallucination Evaluation Dataset
Highlight Jiazhen Liu, Yuhan Fu, Ruobing Xie, Runquan Xie, Xingwu Sun, Fengzong Lian, Zhanhui Kang, Xirong Li arXiv ↗ PDF ↗
Pippo: High-Resolution Multi-View Humans from a Single Image
Highlight Yash Kant, Ethan Weber, Jin Kyu Kim, Rawal Khirodkar, Su Zhaoen, Julieta Martinez, Igor Gilitschenski, Shunsuke Saito, Timur Bagautdinov arXiv ↗ PDF ↗
PlanarSplatting: Accurate Planar Surface Reconstruction in 3 Minutes
Highlight Bin Tan, Rui Yu, Yujun Shen, Nan Xue arXiv ↗ PDF ↗
Point-to-Region Loss for Semi-Supervised Point-Based Crowd Counting
Highlight Wei Lin, Chenyang Zhao, Antoni B. Chan arXiv ↗ PDF ↗
Polarized Color Screen Matting
Highlight Kenji Enomoto, Scott Cohen, Brian Price, TJ Rhodes PDF ↗
Prior-free 3D Object Tracking
Highlight Xiuqiang Song, Li Jin, Zhengxian Zhang, Jiachen Li, Fan Zhong, Guofeng Zhang, Xueying Qin PDF ↗
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
Highlight Beier Zhu, Jiequan Cui, Hanwang Zhang, Chi Zhang PDF ↗
QuCOOP: A Versatile Framework for Solving Composite and Binary-Parametrised Problems on Quantum Annealers
Highlight Natacha Kuete Meli, Vladislav Golyanik, Marcel Seelbach Benkner, Michael Moeller arXiv ↗ PDF ↗
Question-Aware Gaussian Experts for Audio-Visual Question Answering
Highlight Hongyeob Kim, Inyoung Jung, Dayoon Suh, Youjia Zhang, Sangmin Lee, Sungeun Hong arXiv ↗ PDF ↗
RGBAvatar: Reduced Gaussian Blendshapes for Online Modeling of Head Avatars
Highlight Linzhou Li, Yumeng Li, Yanlin Weng, Youyi Zheng, Kun Zhou arXiv ↗ PDF ↗
RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness
Highlight Tianyu Yu, Haoye Zhang, Qiming Li, Qixin Xu, Yuan Yao, Da Chen, Xiaoman Lu, Ganqu Cui, Yunkai Dang, Taiwen He, Xiaocheng Feng, Jun Song, Bo Zheng, Zhiyuan Liu, Tat-Seng Chua, Maosong Sun PDF ↗
ROLL: Robust Noisy Pseudo-label Learning for Multi-View Clustering with Noisy Correspondence
Highlight Yuan Sun, Yongxiang Li, Zhenwen Ren, Guiduo Duan, Dezhong Peng, Peng Hu PDF ↗
ReNeg: Learning Negative Embedding with Reward Guidance
Highlight Xiaomin Li, Yixuan Liu, Takashi Isobe, Xu Jia, Qinpeng Cui, Dong Zhou, Dong Li, You He, Huchuan Lu, Zhongdao Wang, Emad Barsoum arXiv ↗ PDF ↗
Real-time Free-view Human Rendering from Sparse-view RGB Videos using Double Unprojected Textures
Highlight Guoxing Sun, Rishabh Dabral, Heming Zhu, Pascal Fua, Christian Theobalt, Marc Habermann arXiv ↗ PDF ↗
Real-time High-fidelity Gaussian Human Avatars with Position-based Interpolation of Spatially Distributed MLPs
Highlight Youyi Zhan, Tianjia Shao, Yin Yang, Kun Zhou arXiv ↗ PDF ↗
Realistic Test-Time Adaptation of Vision-Language Models
Highlight Maxime Zanella, Clément Fuchs, Christophe De Vleeschouwer, Ismail Ben Ayed arXiv ↗ PDF ↗
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
Highlight Yuanmin Tang, Jue Zhang, Xiaoting Qin, Jing Yu, Gaopeng Gou, Gang Xiong, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Wu PDF ↗
Reasoning in Visual Navigation of End-to-end Trained Agents: A Dynamical Systems Approach
Highlight Steeven Janny, Hervé Poirier, Leonid Antsfeld, Guillaume Bono, Gianluca Monaci, Boris Chidlovskii, Francesco Giuliari, Alessio Del Bue, Christian Wolf arXiv ↗ PDF ↗
Reconstructing People, Places, and Cameras
Highlight Lea Müller, Hongsuk Choi, Anthony Zhang, Brent Yi, Jitendra Malik, Angjoo Kanazawa PDF ↗
Reference-Based 3D-Aware Image Editing with Triplanes
Highlight Bahri Batuhan Bilecen, Yigit Yalin, Ning Yu, Aysegul Dundar arXiv ↗ PDF ↗
Relative Pose Estimation through Affine Corrections of Monocular Depth Priors
Highlight Yifan Yu, Shaohui Liu, Rémi Pautrat, Marc Pollefeys, Viktor Larsson arXiv ↗ PDF ↗
Rethinking Personalized Aesthetics Assessment: Employing Physique Aesthetics Assessment as An Exemplification
Highlight Haobin Zhong, Shuai He, Anlong Ming, Huadong Ma PDF ↗
Revealing Key Details to See Differences: A Novel Prototypical Perspective for Skeleton-based Action Recognition
Highlight Hongda Liu, Yunfan Liu, Min Ren, Hao Wang, Yunlong Wang, Zhenan Sun arXiv ↗ PDF ↗
Revisiting MAE Pre-training for 3D Medical Image Segmentation
Highlight Tassilo Wald, Constantin Ulrich, Stanislav Lukyanenko, Andrei Goncharov, Alberto Paderno, Maximilian Miller, Leander Maerkisch, Paul Jaeger, Klaus Maier-Hein arXiv ↗ PDF ↗
RoboPEPP: Vision-Based Robot Pose and Joint Angle Estimation through Embedding Predictive Pre-Training
Highlight Raktim Gautam Goswami, Prashanth Krishnamurthy, Yann LeCun, Farshad Khorrami arXiv ↗ PDF ↗
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
Highlight Yao Mu, Tianxing Chen, Zanxin Chen, Shijia Peng, Zhiqian Lan, Zeyu Gao, Zhixuan Liang, Qiaojun Yu, Yude Zou, Mingkun Xu, Lunkai Lin, Zhiqiang Xie, Mingyu Ding, Ping Luo PDF ↗
SACB-Net: Spatial-awareness Convolutions for Medical Image Registration
Highlight Xinxing Cheng, Tianyang Zhang, Wenqi Lu, Qingjie Meng, Alejandro F. Frangi, Jinming Duan PDF ↗
SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation
Highlight Claudia Cuttano, Gabriele Trivigno, Gabriele Rosi, Carlo Masone, Giuseppe Averta arXiv ↗ PDF ↗
SCSA: A Plug-and-Play Semantic Continuous-Sparse Attention for Arbitrary Semantic Style Transfer
Highlight Chunnan Shang, Zhizhong Wang, Hongwei Wang, Xiangming Meng arXiv ↗ PDF ↗
SKDream: Controllable Multi-view and 3D Generation with Arbitrary Skeletons
Highlight Yuanyou Xu, Zongxin Yang, Yi Yang PDF ↗
SLAM3R: Real-Time Dense Scene Reconstruction from Monocular RGB Videos
Highlight Yuzheng Liu, Siyan Dong, Shuzhe Wang, Yingda Yin, Yanchao Yang, Qingnan Fan, Baoquan Chen arXiv ↗ PDF ↗
SP3D: Boosting Sparsely-Supervised 3D Object Detection via Accurate Cross-Modal Semantic Prompts
Highlight Shijia Zhao, Qiming Xia, Xusheng Guo, Pufan Zou, Maoji Zheng, Hai Wu, Chenglu Wen, Cheng Wang arXiv ↗ PDF ↗
SSHNet: Unsupervised Cross-modal Homography Estimation via Problem Reformulation and Split Optimization
Highlight Junchen Yu, Si-Yuan Cao, Runmin Zhang, Chenghao Zhang, Zhu Yu, Shujie Chen, Bailin Yang, Hui-Liang Shen arXiv ↗ PDF ↗
STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion Models
Highlight Koushik Srivatsan, Fahad Shamshad, Muzammal Naseer, Vishal M. Patel, Karthik Nandakumar arXiv ↗ PDF ↗
STING-BEE: Towards Vision-Language Model for Real-World X-ray Baggage Security Inspection
Highlight Divya Velayudhan, Abdelfatah Ahmed, Mohamad Alansari, Neha Gour, Abderaouf Behouch, Taimur Hassan, Syed Talal Wasim, Nabil Maalej, Muzammal Naseer, Juergen Gall, Mohammed Bennamoun, Ernesto Damiani, Naoufel Werghi PDF ↗
SURGEON: Memory-Adaptive Fully Test-Time Adaptation via Dynamic Activation Sparsity
Highlight Ke Ma, Jiaqi Tang, Bin Guo, Fan Dang, Sicong Liu, Zhui Zhu, Lei Wu, Cheng Fang, Ying-Cong Chen, Zhiwen Yu, Yunhao Liu arXiv ↗ PDF ↗
SaMam: Style-aware State Space Model for Arbitrary Image Style Transfer
Highlight Hongda Liu, Longguang Wang, Ye Zhang, Ziru Yu, Yulan Guo arXiv ↗ PDF ↗
Samba: A Unified Mamba-based Framework for General Salient Object Detection
Highlight Jiahao He, Keren Fu, Xiaohong Liu, Qijun Zhao PDF ↗
Satellite Observations Guided Diffusion Model for Accurate Meteorological States at Arbitrary Resolution
Highlight Siwei Tu, Ben Fei, Weidong Yang, Fenghua Ling, Hao Chen, Zili Liu, Kun Chen, Hang Fan, Wanli Ouyang, Lei Bai arXiv ↗ PDF ↗
Scaling Inference Time Compute for Diffusion Models
Highlight Nanye Ma, Shangyuan Tong, Haolin Jia, Hexiang Hu, Yu-Chuan Su, Mingda Zhang, Xuan Yang, Yandong Li, Tommi Jaakkola, Xuhui Jia, Saining Xie PDF ↗
Scaling Vision Pre-Training to 4K Resolution
Highlight Baifeng Shi, Boyi Li, Han Cai, Yao Lu, Sifei Liu, Marco Pavone, Jan Kautz, Song Han, Trevor Darrell, Pavlo Molchanov, Hongxu Yin arXiv ↗ PDF ↗
Scene-Centric Unsupervised Panoptic Segmentation
Highlight Oliver Hahn, Christoph Reich, Nikita Araslanov, Daniel Cremers, Christian Rupprecht, Stefan Roth arXiv ↗ PDF ↗
SeCap: Self-Calibrating and Adaptive Prompts for Cross-view Person Re-Identification in Aerial-Ground Networks
Highlight Shining Wang, Yunlong Wang, Ruiqi Wu, Bingliang Jiao, Wenxuan Wang, Peng Wang arXiv ↗ PDF ↗
SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration
Highlight Jianyi Wang, Zhijie Lin, Meng Wei, Yang Zhao, Ceyuan Yang, Chen Change Loy, Lu Jiang arXiv ↗ PDF ↗
Seeing More with Less: Human-like Representations in Vision Models
Highlight Andrey Gizdov, Shimon Ullman, Daniel Harari PDF ↗
Self-Supervised Cross-View Correspondence with Predictive Cycle Consistency
Highlight Alan Baade, Changan Chen PDF ↗
Seurat: From Moving Points to Depth
Highlight Seokju Cho, Jiahui Huang, Seungryong Kim, Joon-Young Lee arXiv ↗ PDF ↗
Shape Abstraction via Marching Differentiable Support Functions
Highlight Sunkyung Park, Jeongmin Lee, Dongjun Lee PDF ↗
Show and Tell: Visually Explainable Deep Neural Nets via Spatially-Aware Concept Bottleneck Models
Highlight Itay Benou, Tammy Riklin Raviv arXiv ↗ PDF ↗
SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
Highlight Katrin Renz, Long Chen, Elahe Arani, Oleg Sinavski arXiv ↗ PDF ↗
Simulator HC: Regression-based Online Simulation of Starting Problem-Solution Pairs for Homotopy Continuation in Geometric Vision
Highlight Xinyue Zhang, Zijia Dai, Wanting Xu, Laurent Kneip arXiv ↗ PDF ↗
SkillMimic: Learning Basketball Interaction Skills from Demonstrations
Highlight Yinhuai Wang, Qihan Zhao, Runyi Yu, Hok Wai Tsui, Ailing Zeng, Jing Lin, Zhengyi Luo, Jiwen Yu, Xiu Li, Qifeng Chen, Jian Zhang, Lei Zhang, Ping Tan arXiv ↗ PDF ↗
SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
Highlight Shaoan Xie, Lingjing Lingjing, Yujia Zheng, Yu Yao, Zeyu Tang, Eric P. Xing, Guangyi Chen, Kun Zhang PDF ↗
SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training
Highlight Jierun Chen, Dongting Hu, Xijie Huang, Huseyin Coskun, Arpit Sahni, Aarush Gupta, Anujraaj Goyal, Dishani Lahiri, Rajesh Singh, Yerlan Idelbayev, Junli Cao, Yanyu Li, Kwang-Ting Cheng, S.-H. Gary Chan, Mingming Gong, Sergey Tulyakov, Anil Kag, Yanwu Xu, Jian Ren arXiv ↗ PDF ↗
SoMA: Singular Value Decomposed Minor Components Adaptation for Domain Generalizable Representation Learning
Highlight Seokju Yun, Seunghye Chae, Dongheon Lee, Youngmin Ro arXiv ↗ PDF ↗
Sonata: Self-Supervised Learning of Reliable Point Representations
Highlight Xiaoyang Wu, Daniel DeTone, Duncan Frost, Tianwei Shen, Chris Xie, Nan Yang, Jakob Engel, Richard Newcombe, Hengshuang Zhao, Julian Straub arXiv ↗ PDF ↗
SoundVista: Novel-View Ambient Sound Synthesis via Visual-Acoustic Binding
Highlight Mingfei Chen, Israel D. Gebru, Ishwarya Ananthabhotla, Christian Richardt, Dejan Markovic, Jake Sandakly, Steven Krenn, Todd Keebler, Eli Shlizerman, Alexander Richard arXiv ↗ PDF ↗
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Mutimodal Models
Highlight Xingrui Wang, Wufei Ma, Tiezheng Zhang, Celso M de Melo, Jieneng Chen, Alan Yuille PDF ↗
SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models
Highlight Wufei Ma, Luoxin Ye, Celso M de Melo, Alan Yuille, Jieneng Chen arXiv ↗ PDF ↗
SpecTRe-GS: Modeling Highly Specular Surfaces with Reflected Nearby Objects by Tracing Rays in 3D Gaussian Splatting
Highlight Jiajun Tang, Fan Fei, Zhihao Li, Xiao Tang, Shiyong Liu, Youyu Chen, Binxiao Huang, Zhenyu Chen, Xiaofei Wu, Boxin Shi PDF ↗
SplatFlow: Self-Supervised Dynamic Gaussian Splatting in Neural Motion Flow Field for Autonomous Driving
Highlight Su Sun, Cheng Zhao, Zhuoyang Sun, Yingjie Victor Chen, Mei Chen arXiv ↗ PDF ↗
Structure from Collision
Highlight Takuhiro Kaneko arXiv ↗ PDF ↗
Structure-Aware Correspondence Learning for Relative Pose Estimation
Highlight Yihan Chen, Wenfei Yang, Huan Ren, Shifeng Zhang, Tianzhu Zhang, Feng Wu arXiv ↗ PDF ↗
Structure-from-Motion with a Non-Parametric Camera Model
Highlight Yihan Wang, Linfei Pan, Marc Pollefeys, Viktor Larsson PDF ↗
Structured 3D Latents for Scalable and Versatile 3D Generation
Highlight Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, Jiaolong Yang arXiv ↗ PDF ↗
Style Evolving along Chain-of-Thought for Unknown-Domain Object Detection
Highlight Zihao Zhang, Aming Wu, Yahong Han arXiv ↗ PDF ↗
Style-Editor: Text-driven Object-centric Style Editing
Highlight Jihun Park, Jongmin Gim, Kyoungmin Lee, Seunghun Lee, Sunghoon Im PDF ↗
StyleSSP: Sampling StartPoint Enhancement for Training-free Diffusion-based Method for Style Transfer
Highlight Ruojun Xu, Weijie Xi, XiaoDi Wang, Yongbo Mao, Zach Cheng arXiv ↗ PDF ↗
Supervising Sound Localization by In-the-wild Egomotion
Highlight Anna Min, Ziyang Chen, Hang Zhao, Andrew Owens PDF ↗
Symmetry Strikes Back: From Single-Image Symmetry Detection to 3D Generation
Highlight Xiang Li, Zixuan Huang, Anh Thai, James M. Rehg arXiv ↗ PDF ↗
T2ICount: Enhancing Cross-modal Understanding for Zero-Shot Counting
Highlight Yifei Qian, Zhongliang Guo, Bowen Deng, Chun Tong Lei, Shuai Zhao, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound arXiv ↗ PDF ↗
TFCustom: Customized Image Generation with Time-Aware Frequency Feature Guidance
Highlight Mushui Liu, Dong She, Jingxuan Pang, Qihan Huang, Jiacheng Ying, Wanggui He, Yuanlei Hou, Siming Fu PDF ↗
TIDE: Training Locally Interpretable Domain Generalization Models Enables Test-time Correction
Highlight Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi arXiv ↗ PDF ↗
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
Highlight Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Takahiro Shirakawa, Ko Watanabe, Andreas Dengel, Jinjia Zhou PDF ↗
Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs
Highlight Yingji Zhong, Zhihao Li, Dave Zhenyu Chen, Lanqing Hong, Dan Xu arXiv ↗ PDF ↗
TaoAvatar: Real-Time Lifelike Full-Body Talking Avatars for Augmented Reality via 3D Gaussian Splatting
Highlight Jianchuan Chen, Jingchuan Hu, Gaige Wang, Zhonghua Jiang, Tiansong Zhou, Zhiwen Chen, Chengfei Lv arXiv ↗ PDF ↗
Task-driven Image Fusion with Learnable Fusion Loss
Highlight Haowen Bai, Jiangshe Zhang, Zixiang Zhao, Yichen Wu, Lilun Deng, Yukun Cui, Tao Feng, Shuang Xu arXiv ↗ PDF ↗
Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
Highlight Wenxuan Guo, Xiuwei Xu, Ziwei Wang, Jianjiang Feng, Jie Zhou, Jiwen Lu arXiv ↗ PDF ↗
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
Highlight Yunzhi Zhang, Zizhang Li, Matt Zhou, Shangzhe Wu, Jiajun Wu arXiv ↗ PDF ↗
Theoretical Insights in Model Inversion Robustness and Conditional Entropy Maximization for Collaborative Inference Systems
Highlight Song Xia, Yi Yu, Wenhan Yang, Meiwen Ding, Zhuo Chen, Ling-Yu Duan, Alex C. Kot, Xudong Jiang arXiv ↗ PDF ↗
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
Highlight Feng Liu, Shiwei Zhang, Xiaofeng Wang, Yujie Wei, Haonan Qiu, Yuzhong Zhao, Yingya Zhang, Qixiang Ye, Fang Wan PDF ↗
TinyFusion: Diffusion Transformers Learned Shallow
Highlight Gongfan Fang, Kunjun Li, Xinyin Ma, Xinchao Wang arXiv ↗ PDF ↗
Towards Autonomous Micromobility through Scalable Urban Simulation
Highlight Wayne Wu, Honglin He, Chaoyuan Zhang, Jack He, Seth Z. Zhao, Ran Gong, Quanyi Li, Bolei Zhou arXiv ↗ PDF ↗
Towards Enhanced Image Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
Highlight Yikai Wang, Chenjie Cao, Junqiu Yu, Ke Fan, Xiangyang Xue, Yanwei Fu arXiv ↗ PDF ↗
Towards Explainable and Unprecedented Accuracy in Matching Challenging Finger Crease Patterns
Highlight Zhenyu Zhou, Chengdong Dong, Ajay Kumar PDF ↗
Towards Improved Text-Aligned Codebook Learning: Multi-Hierarchical Codebook-Text Alignment with Long Text
Highlight Guotao Liang, Baoquan Zhang, Zhiyuan Wen, Junteng Zhao, Yunming Ye, Kola Ye, Yao He arXiv ↗ PDF ↗
Towards In-the-wild 3D Plane Reconstruction from a Single Image
Highlight Jiachen Liu, Rui Yu, Sili Chen, Sharon X. Huang, Hengkai Guo arXiv ↗ PDF ↗
Towards RAW Object Detection in Diverse Conditions
Highlight Zhong-Yu Li, Xin Jin, Bo-Yuan Sun, Chun-Le Guo, Ming-Ming Cheng arXiv ↗ PDF ↗
Towards Scalable Human-aligned Benchmark for Text-guided Image Editing
Highlight Suho Ryu, Kihyun Kim, Eugene Baek, Dongsoo Shin, Joonseok Lee arXiv ↗ PDF ↗
Towards Unbiased and Robust Spatio-Temporal Scene Graph Generation and Anticipation
Highlight Rohith Peddi, Saurabh Saurabh, Ayush Abhay Shrivastava, Parag Singla, Vibhav Gogate arXiv ↗ PDF ↗
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
Highlight Jiacong Xu, Shao-Yuan Lo, Bardia Safaei, Vishal M. Patel, Isht Dwivedi arXiv ↗ PDF ↗
Tracktention: Leveraging Point Tracking to Attend Videos Faster and Better
Highlight Zihang Lai, Andrea Vedaldi arXiv ↗ PDF ↗
Tuning the Frequencies: Robust Training for Sinusoidal Neural Networks
Highlight Tiago Novello, Diana Aldana, Andre Araujo, Luiz Velho arXiv ↗ PDF ↗
Type-R: Automatically Retouching Typos for Text-to-Image Generation
Highlight Wataru Shimoda, Naoto Inoue, Daichi Haraguchi, Hayato Mitani, Seiichi Uchida, Kota Yamaguchi PDF ↗
UCOD-DPL: Unsupervised Camouflaged Object Detection via Dynamic Pseudo-label Learning
Highlight Weiqi Yan, Lvhai Chen, Huaijia Kou, Shengchuan Zhang, Yan Zhang, Liujuan Cao PDF ↗
UIBDiffusion: Universal Imperceptible Backdoor Attack for Diffusion Models
Highlight Yuning Han, Bingyin Zhao, Rui Chu, Feng Luo, Biplab Sikdar, Yingjie Lao arXiv ↗ PDF ↗
UMotion: Uncertainty-driven Human Motion Estimation from Inertial and Ultra-wideband Units
Highlight Huakun Liu, Hiroki Ota, Xin Wei, Yutaro Hirao, Monica Perusquia-Hernandez, Hideaki Uchiyama, Kiyoshi Kiyokawa arXiv ↗ PDF ↗
USP-Gaussian: Unifying Spike-based Image Reconstruction, Pose Correction and Gaussian Splatting
Highlight Kang Chen, Jiyuan Zhang, Zecheng Hao, Yajing Zheng, Tiejun Huang, Zhaofei Yu PDF ↗
UltraFusion: Ultra High Dynamic Imaging using Exposure Fusion
Highlight Zixuan Chen, Yujin Wang, Xin Cai, Zhiyuan You, Zheming Lu, Fan Zhang, Shi Guo, Tianfan Xue arXiv ↗ PDF ↗
Understanding Multi-Task Activities from Single-Task Videos
Highlight Yuhan Shen, Ehsan Elhamifar PDF ↗
Understanding Multi-layered Transmission Matrices
Highlight Anat Levin, Marina Alterman arXiv ↗ PDF ↗
Uni4D: Unifying Visual Foundation Models for 4D Modeling from a Single Video
Highlight David Yifan Yao, Albert J. Zhai, Shenlong Wang arXiv ↗ PDF ↗
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
Highlight Yiheng Li, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen arXiv ↗ PDF ↗
UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics
Highlight Xi Chen, Zhifei Zhang, He Zhang, Yuqian Zhou, Soo Ye Kim, Qing Liu, Yijun Li, Jianming Zhang, Nanxuan Zhao, Yilin Wang, Hui Ding, Zhe Lin, Hengshuang Zhao arXiv ↗ PDF ↗
UniRestore: Unified Perceptual and Task-Oriented Image Restoration Model Using Diffusion Prior
Highlight I-Hsiang Chen, Wei-Ting Chen, Yu-Wei Liu, Yuan-Chun Chiang, Sy-Yen Kuo, Ming-Hsuan Yang arXiv ↗ PDF ↗
Unified Reconstruction of Static and Dynamic Scenes from Events
Highlight Qiyao Gao, Peiqi Duan, Hanyue Lou, Minggui Teng, Ziqi Cai, Xu Chen, Boxin Shi PDF ↗
Universal Scene Graph Generation
Highlight Shengqiong Wu, Hao Fei, Tat-seng Chua arXiv ↗ PDF ↗
Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation
Highlight Bolin Lai, Felix Juefei-Xu, Miao Liu, Xiaoliang Dai, Nikhil Mehta, Chenguang Zhu, Zeyi Huang, James M. Rehg, Sangmin Lee, Ning Zhang, Tong Xiao arXiv ↗ PDF ↗
Unlocking Generalization Power in LiDAR Point Cloud Registration
Highlight Zhenxuan Zeng, Qiao Wu, Xiyu Zhang, Lin Yuanbo Wu, Pei An, Jiaqi Yang, Ji Wang, Peng Wang arXiv ↗ PDF ↗
Unsupervised Continual Domain Shift Learning with Multi-Prototype Modeling
Highlight Haopeng Sun, Yingwei Zhang, Lumin Xu, Sheng Jin, Ping Luo, Chen Qian, Wentao Liu, Yiqiang Chen PDF ↗
Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach
Highlight Jingwei Zhang, Mohammad Jalali, Cheuk Ting Li, Farzan Farnia arXiv ↗ PDF ↗
VEU-Bench: Towards Comprehensive Understanding of Video Editing
Highlight Bozheng Li, Yongliang Wu, Yi Lu, Jiashuo Yu, Licheng Tang, Jiawang Cao, Wenqing Zhu, Yuyang Sun, Jay Wu, Wenbo Zhu PDF ↗
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
Highlight Vishwesh Nath, Wenqi Li, Dong Yang, Andriy Myronenko, Mingxin Zheng, Yao Lu, Zhijian Liu, Hongxu Yin, Yee Man Law, Yucheng Tang, Pengfei Guo, Can Zhao, Ziyue Xu, Yufan He, Stephanie Harmon, Benjamin Simon, Greg Heinrich, Stephen Aylward, Marc Edgar, Michael Zephyr, Pavlo Molchanov, Baris Turkbey, Holger Roth, Daguang Xu PDF ↗
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
Highlight Lei Li, Yuancheng Wei, Zhihui Xie, Xuqing Yang, Yifan Song, Peiyi Wang, Chenxin An, Tianyu Liu, Sujian Li, Bill Yuchen Lin, Lingpeng Kong, Qi Liu PDF ↗
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
Highlight Sili Chen, Hengkai Guo, Shengnan Zhu, Feihu Zhang, Zilong Huang, Jiashi Feng, Bingyi Kang arXiv ↗ PDF ↗
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
Highlight Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, Peixian Chen, Yanwei Li, Shaohui Lin, Sirui Zhao, Ke Li, Tong Xu, Xiawu Zheng, Enhong Chen, Caifeng Shan, Ran He, Xing Sun PDF ↗
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
Highlight Hanyang Wang, Fangfu Liu, Jiawei Chi, Yueqi Duan arXiv ↗ PDF ↗
Visual Representation Learning through Causal Intervention for Controllable Image Editing
Highlight Shanshan Huang, Haoxuan Li, Chunyuan Zheng, Lei Wang, Guorui Liao, Zhili Gong, Huayi Yang, Li Liu PDF ↗
Volume Tells: Dual Cycle-Consistent Diffusion for 3D Fluorescence Microscopy De-noising and Super-Resolution
Highlight Zelin Li, Chenwei Wang, Zhaoke Huang, Yiming Ma, Cunming Zhao, Zhongying Zhao, Hong Yan arXiv ↗ PDF ↗
Volumetrically Consistent 3D Gaussian Rasterization
Highlight Chinmay Talegaonkar, Yash Belhe, Ravi Ramamoorthi, Nicholas Antipa arXiv ↗ PDF ↗
WISH: Weakly Supervised Instance Segmentation using Heterogeneous Labels
Highlight Hyeokjun Kweon, Kuk-Jin Yoon PDF ↗
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
Highlight Sagnik Majumder, Tushar Nagarajan, Ziad Al-Halah, Reina Pradhan, Kristen Grauman arXiv ↗ PDF ↗
WonderWorld: Interactive 3D Scene Generation from a Single Image
Highlight Hong-Xing Yu, Haoyi Duan, Charles Herrmann, William T. Freeman, Jiajun Wu arXiv ↗ PDF ↗
World-consistent Video Diffusion with Explicit 3D Modeling
Highlight Qihang Zhang, Shuangfei Zhai, Miguel Ángel Bautista Martin, Kevin Miao, Alexander Toshev, Joshua Susskind, Jiatao Gu PDF ↗
X-Dyna: Expressive Dynamic Human Image Animation
Highlight Di Chang, Hongyi Xu, You Xie, Yipeng Gao, Zhengfei Kuang, Shengqu Cai, Chenxu Zhang, Guoxian Song, Chao Wang, Yichun Shi, Zeyuan Chen, Shijie Zhou, Linjie Luo, Gordon Wetzstein, Mohammad Soleymani PDF ↗
XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?
Highlight Fengxiang Wang, Hongzhen Wang, Zonghao Guo, Di Wang, Yulin Wang, Mingshuo Chen, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, Zhiyuan Liu, Maosong Sun PDF ↗
You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale
Highlight Baorui Ma, Huachen Gao, Haoge Deng, Zhengxiong Luo, Tiejun Huang, Lulu Tang, Xinlong Wang arXiv ↗ PDF ↗
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
Highlight Seil Kang, Jinyeong Kim, Junhyeok Kim, Seong Jae Hwang arXiv ↗ PDF ↗
Your ViT is Secretly an Image Segmentation Model
Highlight Tommie Kerssies, Niccolò Cavagnero, Alexander Hermans, Narges Norouzi, Giuseppe Averta, Bastian Leibe, Gijs Dubbelman, Daan de Geus arXiv ↗ PDF ↗
v-CLR: View-Consistent Learning for Open-World Instance Segmentation
Highlight Chang-Bin Zhang, Jinhong Ni, Yujie Zhong, Kai Han PDF ↗

Posters 2,467 · page 1 of 13

2DMamba: Efficient State Space Model for Image Representation with Applications on Giga-Pixel Whole Slide Image Classification
Jingwei Zhang, Anh Tien Nguyen, Xi Han, Vincent Quoc-Huy Trinh, Hong Qin, Dimitris Samaras, Mahdi S. Hosseini arXiv ↗ PDF ↗
3D Dental Model Segmentation with Geometrical Boundary Preserving
Shufan Xi, Zexian Liu, Junlin Chang, Hongyu Wu, Xiaogang Wang, Aimin Hao arXiv ↗ PDF ↗
3D Gaussian Head Avatars with Expressive Dynamic Appearances by Compact Tensorial Representations
Yating Wang, Xuan Wang, Ran Yi, Yanbo Fan, Jichen Hu, Jingcheng Zhu, Lizhuang Ma arXiv ↗ PDF ↗
3D Gaussian Inpainting with Depth-Guided Cross-View Consistency
Sheng-Yu Huang, Zi-Ting Chou, Yu-Chiang Frank Wang arXiv ↗ PDF ↗
3D Occupancy Prediction with Low-Resolution Queries via Prototype-aware View Transformation
Gyeongrok Oh, Sungjune Kim, Heeju Ko, Hyung-gun Chi, Jinkyu Kim, Dongwook Lee, Daehyun Ji, Sungjoon Choi, Sujin Jang, Sangpil Kim arXiv ↗ PDF ↗
3D Prior Is All You Need: Cross-Task Few-shot 2D Gaze Estimation
Yihua Cheng, Hengfei Wang, Zhongqun Zhang, Yang Yue, Boeun Kim, Feng Lu, Hyung Jin Chang arXiv ↗ PDF ↗
3D-AVS: LiDAR-based 3D Auto-Vocabulary Segmentation
Weijie Wei, Osman Ülger, Fatemeh Karimi Nejadasl, Theo Gevers, Martin R. Oswald PDF ↗
3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination
Jianing Yang, Xuweiyi Chen, Nikhil Madaan, Madhavan Iyengar, Shengyi Qian, David F. Fouhey, Joyce Chai PDF ↗
3D-GSW: 3D Gaussian Splatting for Robust Watermarking
Youngdong Jang, Hyunje Park, Feng Yang, Heeju Ko, Euijin Choo, Sangpil Kim PDF ↗
3D-HGS: 3D Half-Gaussian Splatting
Haolin Li, Jinyang Liu, Mario Sznaier, Octavia Camps PDF ↗
3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer
Jiajun Deng, Tianyu He, Li Jiang, Tianyu Wang, Feras Dayoub, Ian Reid PDF ↗
3D-MVP: 3D Multiview Pretraining for Manipulation
Shengyi Qian, Kaichun Mo, Valts Blukis, David F. Fouhey, Dieter Fox, Ankit Goyal PDF ↗
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
Yuncong Yang, Han Yang, Jiachen Zhou, Peihao Chen, Hongxin Zhang, Yilun Du, Chuang Gan PDF ↗
3D-SLNR: A Super Lightweight Neural Representation for Large-scale 3D Mapping
Chenhui Shi, Fulin Tang, Ning An, Yihong Wu PDF ↗
3DEnhancer: Consistent Multi-View Diffusion for 3D Enhancement
Yihang Luo, Shangchen Zhou, Yushi Lan, Xingang Pan, Chen Change Loy arXiv ↗ PDF ↗
3DGUT: Enabling Distorted Cameras and Secondary Rays in Gaussian Splatting
Qi Wu, Janick Martinez Esturo, Ashkan Mirzaei, Nicolas Moënne-Loccoz, Zan Gojcic arXiv ↗ PDF ↗
4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models
Wanhua Li, Renping Zhou, Jiawei Zhou, Yingwei Song, Johannes Herter, Minghan Qin, Gao Huang, Hanspeter Pfister arXiv ↗ PDF ↗
4D-Fly: Fast 4D Reconstruction from a Single Monocular Video
Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yue Qian, Xiaohang Zhan, Yueqi Duan PDF ↗
4DGC: Rate-Aware 4D Gaussian Compression for Efficient Streamable Free-Viewpoint Video
Qiang Hu, Zihan Zheng, Houqiang Zhong, Sihua Fu, Li Song, Xiaoyun Zhang, Guangtao Zhai, Yanfeng Wang arXiv ↗ PDF ↗
4DTAM: Non-Rigid Tracking and Mapping via Dynamic Surface Gaussians
Hidenobu Matsuki, Gwangbin Bae, Andrew J. Davison arXiv ↗ PDF ↗
4Deform: Neural Surface Deformation for Robust Shape Interpolation
Lu Sang, Zehranaz Canfes, Dongliang Cao, Riccardo Marin, Florian Bernard, Daniel Cremers arXiv ↗ PDF ↗
5%>100%: Breaking Performance Shackles of Full Fine-Tuning on Visual Recognition Tasks
Dongshuo Yin, Leiyi Hu, Bin Li, Youqun Zhang, Xue Yang arXiv ↗ PDF ↗
A Bias-Free Training Paradigm for More General AI-generated Image Detection
Fabrizio Guillaro, Giada Zingarini, Ben Usman, Avneesh Sud, Davide Cozzolino, Luisa Verdoliva arXiv ↗ PDF ↗
A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training
Kai Wang, Mingjia Shi, Yukun Zhou, Zekai Li, Zhihang Yuan, Yuzhang Shang, Xiaojiang Peng, Hanwang Zhang, Yang You arXiv ↗ PDF ↗
A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation
Andrew Z. Wang, Songwei Ge, Tero Karras, Ming-Yu Liu, Yogesh Balaji arXiv ↗ PDF ↗
A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning
Xin Wen, Bingchen Zhao, Yilun Chen, Jiangmiao Pang, Xiaojuan Qi arXiv ↗ PDF ↗
A Dataset for Semantic Segmentation in the Presence of Unknowns
Zakaria Laskar, Tomas Vojir, Matej Grcic, Iaroslav Melekhov, Shankar Gangisetty, Juho Kannala, Jiri Matas, Giorgos Tolias, C.V. Jawahar arXiv ↗ PDF ↗
A Distractor-Aware Memory for Visual Object Tracking with SAM2
Jovana Videnovic, Alan Lukezic, Matej Kristan arXiv ↗ PDF ↗
A Flag Decomposition for Hierarchical Datasets
Nathan Mankovich, Ignacio Santamaria, Gustau Camps-Valls, Tolga Birdal arXiv ↗ PDF ↗
A Focused Human Body Model for Accurate Anthropometric Measurements Extraction
Shuhang Chen, Xianliang Huang, Zhizhou Zhong, Juhong Guan, Shuigeng Zhou PDF ↗
A General Adaptive Dual-level Weighting Mechanism for Remote Sensing Pansharpening
Jie Huang, Haorui Chen, Jiaxuan Ren, Siran Peng, Liangjian Deng arXiv ↗ PDF ↗
A Hubness Perspective on Representation Learning for Graph-Based Multi-View Clustering
Zheming Xu, He Liu, Congyan Lang, Tao Wang, Yidong Li, Michael C. Kampffmeyer PDF ↗
A Lightweight UDF Learning Framework for 3D Reconstruction Based on Local Shape Functions
Jiangbei Hu, Yanggeng Li, Fei Hou, Junhui Hou, Zhebin Zhang, Shengfa Wang, Na Lei, Ying He arXiv ↗ PDF ↗
A New Statistical Model of Star Speckles for Learning to Detect and Characterize Exoplanets in Direct Imaging Observations
Théo Bodrito, Olivier Flasseur, Julien Mairal, Jean Ponce, Maud Langlois, Anne-Marie Lagrange arXiv ↗ PDF ↗
A Physics-Informed Blur Learning Framework for Imaging Systems
Liqun Chen, Yuxuan Li, Jun Dai, Jinwei Gu, Tianfan Xue arXiv ↗ PDF ↗
A Regularization-Guided Equivariant Approach for Image Restoration
Yulu Bai, Jiahong Fu, Qi Xie, Deyu Meng arXiv ↗ PDF ↗
A Selective Re-learning Mechanism for Hyperspectral Fusion Imaging
Yuanye Liu, Jinyang Liu, Renwei Dian, Shutao Li PDF ↗
A Semantic Knowledge Complementarity based Decoupling Framework for Semi-supervised Class-imbalanced Medical Image Segmentation
Zheng Zhang, Guanchun Yin, Bo Zhang, Wu Liu, Xiuzhuang Zhou, Wendong Wang PDF ↗
A Simple Data Augmentation for Feature Distribution Skewed Federated Learning
Yunlu Yan, Huazhu Fu, Yuexiang Li, Jinheng Xie, Jun Ma, Guang Yang, Lei Zhu arXiv ↗ PDF ↗
A Simple yet Effective Layout Token in Large Language Models for Document Understanding
Zhaoqing Zhu, Chuwei Luo, Zirui Shao, Feiyu Gao, Hangdi Xing, Qi Zheng, Ji Zhang arXiv ↗ PDF ↗
A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs
Wangbo Zhao, Yizeng Han, Jiasheng Tang, Zhikai Li, Yibing Song, Kai Wang, Zhangyang Wang, Yang You arXiv ↗ PDF ↗
A Tale of Two Classes: Adapting Supervised Contrastive Learning to Binary Imbalanced Datasets
David Mildenberger, Paul Hager, Daniel Rueckert, Martin J. Menten arXiv ↗ PDF ↗
A Theory of Learning Unified Model via Knowledge Integration from Label Space Varying Domains
Dexuan Zhang, Thomas Westfechtel, Tatsuya Harada PDF ↗
A Unified Framework for Heterogeneous Semi-supervised Learning
Marzi Heidari, Abdullah Alchihabi, Hao Yan, Yuhong Guo arXiv ↗ PDF ↗
A Unified Image-Dense Annotation Generation Model for Underwater Scenes
Hongkai Lin, Dingkang Liang, Zhenghao Qi, Xiang Bai arXiv ↗ PDF ↗
A Unified Latent Schrodinger Bridge Diffusion Model for Unsupervised Anomaly Detection and Localization
Shilhora Akshay, Niveditha Lakshmi Narasimhan, Jacob George, Vineeth N Balasubramanian PDF ↗
A Unified Model for Compressed Sensing MRI Across Undersampling Patterns
Armeet Singh Jatyani, Jiayun Wang, Aditi Chandrashekar, Zihui Wu, Miguel Liu-Schiaffini, Bahareh Tolooshams, Anima Anandkumar arXiv ↗ PDF ↗
A Unified, Resilient, and Explainable Adversarial Patch Detector
Vishesh Kumar, Akshay Agarwal PDF ↗
A Universal Scale-Adaptive Deformable Transformer for Image Restoration across Diverse Artifacts
Xuyi He, Yuhui Quan, Ruotao Xu, Hui Ji PDF ↗
A3: Few-shot Prompt Learning of Unlearnable Examples with Cross-Modal Adversarial Feature Alignment
Xuan Wang, Xitong Gao, Dongping Liao, Tianrui Qin, Yu-liang Lu, Cheng-zhong Xu PDF ↗
A4A: Adapter for Adapter Transfer via All-for-All Mapping for Cross-Architecture Models
Keyu Tu, Mengqi Huang, Zhuowei Chen, Zhendong Mao PDF ↗
AA-CLIP: Enhancing Zero-Shot Anomaly Detection via Anomaly-Aware CLIP
Wenxin Ma, Xu Zhang, Qingsong Yao, Fenghe Tang, Chenxu Wu, Yingtai Li, Rui Yan, Zihang Jiang, S.Kevin Zhou PDF ↗
ABBSPO: Adaptive Bounding Box Scaling and Symmetric Prior based Orientation Prediction for Detecting Aerial Image Objects
Woojin Lee, Hyugjae Chang, Jaeho Moon, Jaehyup Lee, Munchurl Kim PDF ↗
ABC-Former: Auxiliary Bimodal Cross-domain Transformer with Interactive Channel Attention for White Balance
Yu-Cheng Chiu, Guan-Rong Chen, Zihao Chen, Yan-Tsung Peng PDF ↗
AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers
Sherwin Bahmani, Ivan Skorokhodov, Guocheng Qian, Aliaksandr Siarohin, Willi Menapace, Andrea Tagliasacchi, David B. Lindell, Sergey Tulyakov arXiv ↗ PDF ↗
ACAttack: Adaptive Cross Attacking RGB-T Tracker via Multi-Modal Response Decoupling
Xinyu Xiang, Qinglong Yan, Hao Zhang, Jiayi Ma PDF ↗
ACE: Anti-Editing Concept Erasure in Text-to-Image Models
Zihao Wang, Yuxiang Wei, Fan Li, Renjing Pei, Hang Xu, Wangmeng Zuo arXiv ↗ PDF ↗
ACL: Activating Capability of Linear Attention for Image Restoration
Yubin Gu, Yuan Meng, Jiayi Ji, Xiaoshuai Sun PDF ↗
ADD: Attribution-Driven Data Augmentation Framework for Boosting Image Super-Resolution
Ze-Yu Mi, Yu-Bin Yang PDF ↗
ADU: Adaptive Detection of Unknown Categories in Black-Box Domain Adaptation
Yushan Lai, Guowen Li, Haoyuan Liang, Juepeng Zheng, Zhiyu Ye PDF ↗
AFL: A Single-Round Analytic Approach for Federated Learning with Pre-trained Models
Run He, Kai Tong, Di Fang, Han Sun, Ziqian Zeng, Haoran Li, Tianyi Chen, Huiping Zhuang arXiv ↗ PDF ↗
AG-VPReID: A Challenging Large-Scale Benchmark for Aerial-Ground Video-based Person Re-Identification
Huy Nguyen, Kien Nguyen, Akila Pemasiri, Feng Liu, Sridha Sridharan, Clinton Fookes PDF ↗
AI-Face: A Million-Scale Demographically Annotated AI-Generated Face Dataset and Fairness Benchmark
Li Lin, Santosh Santosh, Mingyang Wu, Xin Wang, Shu Hu PDF ↗
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
Jiarui Wang, Huiyu Duan, Guangtao Zhai, Juntong Wang, Xiongkuo Min PDF ↗
AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data
Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Ioannis Patras PDF ↗
AKiRa: Augmentation Kit on Rays for Optical Video Generation
Xi Wang, Robin Courant, Marc Christie, Vicky Kalogeiton arXiv ↗ PDF ↗
AMO Sampler: Enhancing Text Rendering with Overshooting
Xixi Hu, Keyang Xu, Bo Liu, Qiang Liu, Hongliang Fei arXiv ↗ PDF ↗
AMR-Transformer: Enabling Efficient Long-range Interaction for Complex Neural Fluid Simulation
Zeyi Xu, Jinfan Liu, Kuangxu Chen, Ye Chen, Zhangli Hu, Bingbing Ni PDF ↗
ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction
Yuejiao Su, Yi Wang, Qiongyang Hu, Chuang Yang, Lap-Pui Chau arXiv ↗ PDF ↗
APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformers
Zhuguanyu Wu, Jiayi Zhang, Jiaxin Chen, Jinyang Guo, Di Huang, Yunhong Wang PDF ↗
APT: Adaptive Personalized Training for Diffusion Models with Limited Data
JungWoo Chae, Jiyoon Kim, JaeWoong Choi, Kyungyul Kim, Sangheum Hwang arXiv ↗ PDF ↗
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
Mingzhen Sun, Weining Wang, Gen Li, Jiawei Liu, Jiahui Sun, Wanquan Feng, Shanshan Lao, Siyu Zhou, Qian He, Jing Liu PDF ↗
ARKit LabelMaker: A New Scale for Indoor 3D Scene Understanding
Guangda Ji, Silvan Weder, Francis Engelmann, Marc Pollefeys, Hermann Blum arXiv ↗ PDF ↗
ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
Yifan Pu, Yiming Zhao, Zhicong Tang, Ruihong Yin, Haoxing Ye, Yuhui Yuan, Dong Chen, Jianmin Bao, Sirui Zhang, Yanbin Wang, Lin Liang, Lijuan Wang, Ji Li, Xiu Li, Zhouhui Lian, Gao Huang, Baining Guo arXiv ↗ PDF ↗
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
Zhenxing Zhang, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Dan Guo, Meng Wang arXiv ↗ PDF ↗
ASHiTA: Automatic Scene-grounded HIerarchical Task Analysis
Yun Chang, Leonor Fermoselle, Duy Ta, Bernadette Bucher, Luca Carlone, Jiuguang Wang arXiv ↗ PDF ↗
ASIGN: An Anatomy-aware Spatial Imputation Graphic Network for 3D Spatial Transcriptomics
Junchao Zhu, Ruining Deng, Tianyuan Yao, Juming Xiong, Chongyu Qu, Junlin Guo, Siqi Lu, Mengmeng Yin, Yu Wang, Shilin Zhao, Haichun Yang, Yuankai Huo arXiv ↗ PDF ↗
ATA: Adaptive Transformation Agent for Text-Guided Subject-Position Variable Background Inpainting
Yizhe Tang, Zhimin Sun, Yuzhen Du, Ran Yi, Guangben Lu, Teng Hu, Luying Li, Lizhuang Ma, Fangyuan Zou PDF ↗
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
Xubing Ye, Yukang Gan, Yixiao Ge, Xiao-Ping Zhang, Yansong Tang PDF ↗
ATP: Adaptive Threshold Pruning for Efficient Data Encoding in Quantum Neural Networks
Mohamed Afane, Gabrielle Ebbrecht, Ying Wang, Juntao Chen, Junaid Farooq arXiv ↗ PDF ↗
AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward
Haonan Han, Xiangzuo Wu, Huan Liao, Zunnan Xu, Zhongyuan Hu, Ronghui Li, Yachao Zhang, Xiu Li arXiv ↗ PDF ↗
AVF-MAE++: Scaling Affective Video Facial Masked Autoencoders via Efficient Audio-Visual Self-Supervised Learning
Xuecheng Wu, Heli Sun, Yifan Wang, Jiayu Nie, Jie Zhang, Yabing Wang, Junxiao Xue, Liang He PDF ↗
AVQACL: A Novel Benchmark for Audio-Visual Question Answering Continual Learning
Kaixuan Wu, Xinde Li, Xinling Li, Chuanfei Hu, Guoliang Wu PDF ↗
Acc3D: Accelerating Single Image to 3D Diffusion Models via Edge Consistency Guided Score Distillation
Kendong Liu, Zhiyu Zhu, Hui Liu, Junhui Hou arXiv ↗ PDF ↗
Accelerating Diffusion Transformer via Increment-Calibrated Caching with Channel-Aware Singular Value Decomposition
Zhiyuan Chen, Keyi Li, Yifan Jia, Le Ye, Yufei Ma arXiv ↗ PDF ↗
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
Shiyu Zhao, Zhenting Wang, Felix Juefei-Xu, Xide Xia, Miao Liu, Xiaofang Wang, Mingfu Liang, Ning Zhang, Dimitris N. Metaxas, Licheng Yu arXiv ↗ PDF ↗
Accurate Differential Operators for Hybrid Neural Fields
Aditya Chetan, Guandao Yang, Zichen Wang, Steve Marschner, Bharath Hariharan arXiv ↗ PDF ↗
Accurate Scene Text Recognition with Efficient Model Scaling and Cloze Self-Distillation
Andrea Maracani, Savas Ozkan, Sijun Cho, Hyowon Kim, Eunchung Noh, Jeongwon Min, Cho Jung Min, Dookun Park, Mete Ozay arXiv ↗ PDF ↗
Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration
Junyuan Deng, Xinyi Wu, Yongxing Yang, Congchao Zhu, Song Wang, Zhenyao Wu arXiv ↗ PDF ↗
Action Detail Matters: Refining Video Recognition with Local Action Queries
Mengmeng Wang, Zeyi Huang, Xiangjie Kong, Guojiang Shen, Guang Dai, Jingdong Wang, Yong Liu PDF ↗
Activating Sparse Part Concepts for 3D Class Incremental Learning
Zhenya Tian, Jun Xiao, Lupeng Liu, Haiyong Jiang PDF ↗
Active Data Curation Effectively Distills Large-Scale Multimodal Models
Vishaal Udandarao, Nikhil Parthasarathy, Muhammad Ferjad Naeem, Talfan Evans, Samuel Albanie, Federico Tombari, Yongqin Xian, Alessio Tonioni, Olivier J. Henaff arXiv ↗ PDF ↗
Active Event-based Stereo Vision
Jianing Li, Yunjian Zhang, Haiqian Han, Xiangyang Ji PDF ↗
ActiveGAMER: Active GAussian Mapping through Efficient Rendering
Liyan Chen, Huangying Zhan, Kevin Chen, Xiangyu Xu, Qingan Yan, Changjiang Cai, Yi Xu arXiv ↗ PDF ↗
AdMiT: Adaptive Multi-Source Tuning in Dynamic Environments
Xiangyu Chang, Fahim Faisal Niloy, Sk Miraj Ahmed, Srikanth V. Krishnamurthy, Basak Guler, Ananthram Swami, Samet Oymak, Amit Roy-Chowdhury PDF ↗
AdaDARE-gamma: Balancing Stability and Plasticity in Multi-modal LLMs through Efficient Adaptation
Jingyi Xie, Jintao Yang, Zhunchen Luo, Yunbo Cao, Qiang Gao, Mengyuan Zhang, Wenpeng Hu PDF ↗
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu arXiv ↗ PDF ↗
AdaptCMVC: Robust Adaption to Incremental Views in Continual Multi-view Clustering
Jing Wang, Songhe Feng, Kristoffer Knutsen Wickstrøm, Michael C. Kampffmeyer PDF ↗
Adapter Merging with Centroid Prototype Mapping for Scalable Class-Incremental Learning
Takuma Fukuda, Hiroshi Kera, Kazuhiko Kawamoto arXiv ↗ PDF ↗
Adapting Dense Matching for Homography Estimation with Grid-based Acceleration
Kaining Zhang, Yuxin Deng, Jiayi Ma, Paolo Favaro PDF ↗
Adapting Pre-trained 3D Models for Point Cloud Video Understanding via Cross-frame Spatio-temporal Perception
Baixuan Lv, Yaohua Zha, Tao Dai, Xue Yuerong, Ke Chen, Shu-Tao Xia PDF ↗
Adapting Text-to-Image Generation with Feature Difference Instruction for Generic Image Restoration
Chao Wang, Hehe Fan, Huichen Yang, Sarvnaz Karimi, Lina Yao, Yi Yang PDF ↗
Adapting to Observation Length of Trajectory Prediction via Contrastive Learning
Ruiqi Qiu, Jun Gong, Xinyu Zhang, Siqi Luo, Bowen Zhang, Yi Cen PDF ↗
Adapting to the Unknown: Training-Free Audio-Visual Event Perception with Dynamic Thresholds
Eitan Shaar, Ariel Shaulov, Gal Chechik, Lior Wolf arXiv ↗ PDF ↗
Adaptive Dropout: Unleashing Dropout across Layers for Generalizable Image Super-Resolution
Hang Xu, Jie Huang, Wei Yu, Jiangtong Tan, Zhen Zou, Feng Zhao PDF ↗
Adaptive Keyframe Sampling for Long Video Understanding
Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye arXiv ↗ PDF ↗
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
Han Xiao, Yina Xie, Guanxin Tan, Yinghao Chen, Rui Hu, Ke Wang, Aojun Zhou, Hao Li, Hao Shao, Xudong Lu, Peng Gao, Yafei Wen, Xiaoxin Chen, Shuai Ren, Hongsheng Li arXiv ↗ PDF ↗
Adaptive Non-Uniform Timestep Sampling for Accelerating Diffusion Model Training
Myunsoo Kim, Donghyeon Ki, Seong-Woong Shim, Byung-Jun Lee PDF ↗
Adaptive Parameter Selection for Tuning Vision-Language Models
Yi Zhang, Yi-Xuan Deng, Meng-Hao Guo, Shi-Min Hu PDF ↗
Adaptive Part Learning for Fine-Grained Generalized Category Discovery: A Plug-and-Play Enhancement
Qiyuan Dai, Hanzhuo Huang, Yu Wu, Sibei Yang arXiv ↗ PDF ↗
Adaptive Rectangular Convolution for Remote Sensing Pansharpening
Xueyang Wang, Zhixin Zheng, Jiandong Shao, Yule Duan, Liang-Jian Deng arXiv ↗ PDF ↗
Adaptive Unimodal Regulation for Balanced Multimodal Information Acquisition
Chengxiang Huang, Yake Wei, Zequn Yang, Di Hu arXiv ↗ PDF ↗
Adv-CPG: A Customized Portrait Generation Framework with Facial Adversarial Attacks
Junying Wang, Hongyuan Zhang, Yuan Yuan PDF ↗
Advancing Adversarial Robustness in GNeRFs: The IL2-NeRF Attack
Nicole Meng, Caleb Manicke, Ronak Sahu, Caiwen Ding, Yingjie Lao PDF ↗
Advancing Generalizable Tumor Segmentation with Anomaly-Aware Open-Vocabulary Attention Maps and Frozen Foundation Diffusion Models
Yankai Jiang, Peng Zhang, Donglin Yang, Yuan Tian, Hai Lin, Xiaosong Wang arXiv ↗ PDF ↗
Advancing Manga Analysis: Comprehensive Segmentation Annotations for the Manga109 Dataset
Minshan Xie, Jian Lin, Hanyuan Liu, Chengze Li, Tien-Tsin Wong PDF ↗
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training
Haicheng Wang, Chen Ju, Weixiong Lin, Shuai Xiao, Mengting Chen, Yixuan Huang, Chang Liu, Mingshuai Yao, Jinsong Lan, Ying Chen, Qingwen Liu, Yanfeng Wang arXiv ↗ PDF ↗
Advancing Semantic Future Prediction through Multimodal Visual Sequence Transformers
Efstathios Karypidis, Ioannis Kakogeorgiou, Spyros Gidaris, Nikos Komodakis arXiv ↗ PDF ↗
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
Feng Wang, Timing Yang, Yaodong Yu, Sucheng Ren, Guoyizhe Wei, Angtian Wang, Wei Shao, Yuyin Zhou, Alan Yuille, Cihang Xie arXiv ↗ PDF ↗
Adversarial Diffusion Compression for Real-World Image Super-Resolution
Bin Chen, Gehui Li, Rongyuan Wu, Xindong Zhang, Jie Chen, Jian Zhang, Lei Zhang arXiv ↗ PDF ↗
Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization
Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao PDF ↗
AeSPa : Attention-guided Self-supervised Parallel Imaging for MRI Reconstruction
Jinho Joo, Hyeseong Kim, Hyeyeon Won, Deukhee Lee, Taejoon Eo, Dosik Hwang PDF ↗
AerialMegaDepth: Learning Aerial-Ground Reconstruction and View Synthesis
Khiem Vuong, Anurag Ghosh, Deva Ramanan, Srinivasa Narasimhan, Shubham Tulsiani arXiv ↗ PDF ↗
AeroGen: Enhancing Remote Sensing Object Detection with Diffusion-Driven Data Generation
Datao Tang, Xiangyong Cao, Xuan Wu, Jialin Li, Jing Yao, Xueru Bai, Dongsheng Jiang, Yin Li, Deyu Meng arXiv ↗ PDF ↗
AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models
Sohan Patnaik, Rishabh Jain, Balaji Krishnamurthy, Mausoom Sarkar arXiv ↗ PDF ↗
Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization
Zhanhao Liang, Yuhui Yuan, Shuyang Gu, Bohan Chen, Tiankai Hang, Mingxi Cheng, Ji Li, Liang Zheng arXiv ↗ PDF ↗
AffordDP: Generalizable Diffusion Policy with Transferable Affordance
Shijie Wu, Yihang Zhu, Yunao Huang, Kaizhen Zhu, Jiayuan Gu, Jingyi Yu, Ye Shi, Jingya Wang arXiv ↗ PDF ↗
AirRoom: Objects Matter in Room Reidentification
Runmao Yao, Yi Du, Zhuoqun Chen, Haoze Zheng, Chen Wang arXiv ↗ PDF ↗
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
Yifan Zhou, Zeqi Xiao, Shuai Yang, Xingang Pan arXiv ↗ PDF ↗
Align-A-Video: Deterministic Reward Tuning of Image Diffusion Models for Consistent Video Editing
Shengzhi Wang, Yingkang Zhong, Jiangchuan Mu, Kai Wu, Mingliang Xiong, Wen Fang, Mingqing Liu, Hao Deng, Bin He, Gang Li, Qingwen Liu PDF ↗
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Large Model Enhancement
Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen PDF ↗
AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment
Yan Li, Yifei Xing, Xiangyuan Lan, Xin Li, Haifeng Chen, Dongmei Jiang arXiv ↗ PDF ↗
Alignment, Mining and Fusion: Representation Alignment with Hard Negative Mining and Selective Knowledge Fusion for Medical Visual Question Answering
Yuanhao Zou, Zhaozheng Yin PDF ↗
All-Day Multi-Camera Multi-Target Tracking
Huijie Fan, Yu Qiao, Yihao Zhen, Tinghui Zhao, Baojie Fan, Qiang Wang PDF ↗
AlphaPre: Amplitude-Phase Disentanglement Model for Precipitation Nowcasting
Kenghong Lin, Baoquan Zhang, Demin Yu, Wenzhi Feng, Shidong Chen, Feifan Gao, Xutao Li, Yunming Ye PDF ↗
An End-to-End Robust Point Cloud Semantic Segmentation Network with Single-Step Conditional Diffusion Models
Wentao Qu, Jing Wang, YongShun Gong, Xiaoshui Huang, Liang Xiao arXiv ↗ PDF ↗
An Image-like Diffusion Method for Human-Object Interaction Detection
Xiaofei Hui, Haoxuan Qu, Hossein Rahmani, Jun Liu arXiv ↗ PDF ↗
Analyzing the Synthetic-to-Real Domain Gap in 3D Hand Pose Estimation
Zhuoran Zhao, Linlin Yang, Pengzhan Sun, Pan Hui, Angela Yao arXiv ↗ PDF ↗
Anatomical Consistency and Adaptive Prior-informed Transformation for Multi-contrast MR Image Synthesis via Diffusion Model
Yejee Shin, Yeeun Lee, Hanbyol Jang, Geonhui Son, Hyeongyu Kim, Dosik Hwang PDF ↗
Anchor-Aware Similarity Cohesion in Target Frames Enables Predicting Temporal Moment Boundaries in 2D
Jiawei Tan, Hongxing Wang, Junwu Weng, Jiaxin Li, Zhilong Ou, Kang Dang PDF ↗
AniDoc: Animation Creation Made Easier
Yihao Meng, Hao Ouyang, Hanlin Wang, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Zhiheng Liu, Yujun Shen, Huamin Qu arXiv ↗ PDF ↗
AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian Reconstruction
Lingteng Qiu, Shenhao Zhu, Qi Zuo, Xiaodong Gu, Yuan Dong, Junfei Zhang, Chao Xu, Zhe Li, Weihao Yuan, Liefeng Bo, Guanying Chen, Zilong Dong arXiv ↗ PDF ↗
AniGrad: Anisotropic Gradient-Adaptive Sampling for 3D Reconstruction From Monocular Video
Noah Stier, Alex Rich, Pradeep Sen, Tobias Höllerer PDF ↗
AniMer: Animal Pose and Shape Estimation Using Family Aware Transformer
Jin Lyu, Tianyi Zhu, Yi Gu, Li Lin, Pujin Cheng, Yebin Liu, Xiaoying Tang, Liang An arXiv ↗ PDF ↗
AniMo: Species-Aware Model for Text-Driven Animal Motion Generation
Xuan Wang, Kai Ruan, Xing Zhang, Gaoang Wang PDF ↗
Animate and Sound an Image
Xihua Wang, Ruihua Song, Chongxuan Li, Xin Cheng, Boyuan Li, Yihan Wu, Yuyue Wang, Hongteng Xu, Yunfeng Wang PDF ↗
AnimateAnything: Consistent and Controllable Animation for Video Generation
Guojun Lei, Chi Wang, Rong Zhang, Yikai Wang, Hong Li, Weiwei Xu arXiv ↗ PDF ↗
AnomalyNCD: Towards Novel Anomaly Class Discovery in Industrial Scenarios
Ziming Huang, Xurui Li, Haotian Liu, Feng Xue, Yuzhe Wang, Yu Zhou arXiv ↗ PDF ↗
Anomize: Better Open Vocabulary Video Anomaly Detection
Fei Li, Wenxuan Liu, Jingjing Chen, Ruixu Zhang, Yuran Wang, Xian Zhong, Zheng Wang arXiv ↗ PDF ↗
Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception
Yuanchen Wu, Lu Zhang, Hang Yao, Junlong Du, Ke Yan, Shouhong Ding, Yunsheng Wu, Xiaoqiang Li arXiv ↗ PDF ↗
Any-Resolution AI-Generated Image Detection by Spectral Learning
Dimitrios Karageorgiou, Symeon Papadopoulos, Ioannis Kompatsiaris, Efstratios Gavves arXiv ↗ PDF ↗
Any3DIS: Class-Agnostic 3D Instance Segmentation by 2D Mask Tracking
Phuc Nguyen, Minh Luu, Anh Tran, Cuong Pham, Khoi Nguyen arXiv ↗ PDF ↗
Any6D: Model-free 6D Pose Estimation of Novel Objects
Taeyeop Lee, Bowen Wen, Minjun Kang, Gyuree Kang, In So Kweon, Kuk-Jin Yoon arXiv ↗ PDF ↗
AnyCam: Learning to Recover Camera Poses and Intrinsics from Casual Videos
Felix Wimbauer, Weirong Chen, Dominik Muhle, Christian Rupprecht, Daniel Cremers arXiv ↗ PDF ↗
AnyDressing: Customizable Multi-Garment Virtual Dressing via Latent Diffusion Models
Xinghui Li, Qichao Sun, Pengze Zhang, Fulong Ye, Zhichao Liao, Wanquan Feng, Songtao Zhao, Qian He arXiv ↗ PDF ↗
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
Qifan Yu, Wei Chow, Zhongqi Yue, Kaihang Pan, Yang Wu, Xiaoyang Wan, Juncheng Li, Siliang Tang, Hanwang Zhang, Yueting Zhuang arXiv ↗ PDF ↗
AnyMap: Learning a General Camera Model for Structure-from-Motion with Unknown Distortion in Dynamic Scenes
Andrea Porfiri Dal Cin, Georgi Dikov, Jihong Ju, Mohsen Ghafoorian PDF ↗
AnyMoLe: Any Character Motion In-betweening Leveraging Video Diffusion Models
Kwan Yun, Seokhyeon Hong, Chaelin Kim, Junyong Noh arXiv ↗ PDF ↗
Anyattack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models
Jiaming Zhang, Junhong Ye, Xingjun Ma, Yige Li, Yunfan Yang, Yunhao Chen, Jitao Sang, Dit-Yan Yeung arXiv ↗ PDF ↗
Apollo: An Exploration of Video Understanding in Large Multimodal Models
Orr Zohar, Xiaohan Wang, Yann Dubois, Nikhil Mehta, Tong Xiao, Philippe Hansen-Estruch, Licheng Yu, Xiaofang Wang, Felix Juefei-Xu, Ning Zhang, Serena Yeung-Levy, Xide Xia arXiv ↗ PDF ↗
Apply Hierarchical-Chain-of-Generation to Complex Attributes Text-to-3D Generation
Yiming Qin, Zhu Xu, Yang Liu arXiv ↗ PDF ↗
Arbitrary-steps Image Super-resolution via Diffusion Inversion
Zongsheng Yue, Kang Liao, Chen Change Loy arXiv ↗ PDF ↗
Arc2Avatar: Generating Expressive 3D Avatars from a Single Image via ID Guidance
Dimitrios Gerogiannis, Foivos Paraperas Papantoniou, Rolandos Alexandros Potamias, Alexandros Lattas, Stefanos Zafeiriou arXiv ↗ PDF ↗
Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?
Zebin You, Xinyu Zhang, Hanzhong Guo, Jingdong Wang, Chongxuan Li arXiv ↗ PDF ↗
Are Spatial-Temporal Graph Convolution Networks for Human Action Recognition Over-Parameterized?
Jianyang Xie, Yitian Zhao, Yanda Meng, He Zhao, Anh Nguyen, Yalin Zheng arXiv ↗ PDF ↗
Argus: A Compact and Versatile Foundation Model for Vision
Weiming Zhuang, Chen Chen, Zhizhong Li, Sina Sajadmanesh, Jingtao Li, Jiabo Huang, Vikash Sehwag, Vivek Sharma, Hirotaka Shinozaki, Felan Carlo Garcia, Yihao Zhan, Naohiro Adachi, Ryoji Eki, Michael Spranger, Peter Stone, Lingjuan Lyu PDF ↗
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
Yunze Man, De-An Huang, Guilin Liu, Shiwei Sheng, Shilong Liu, Liang-Yan Gui, Jan Kautz, Yu-Xiong Wang, Zhiding Yu arXiv ↗ PDF ↗
Around the World in 80 Timesteps: A Generative Approach to Global Visual Geolocation
Nicolas Dufour, Vicky Kalogeiton, David Picard, Loic Landrieu arXiv ↗ PDF ↗
ArtFormer: Controllable Generation of Diverse 3D Articulated Objects
Jiayi Su, Youhe Feng, Zheng Li, Jinhua Song, Yangfan He, Botao Ren, Botian Xu arXiv ↗ PDF ↗
ArtiFade: Learning to Generate High-quality Subject from Blemished Images
Shuya Yang, Shaozhe Hao, Yukang Cao, Kwan-Yee K. Wong arXiv ↗ PDF ↗
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
Zeqi Gu, Yin Cui, Zhaoshuo Li, Fangyin Wei, Yunhao Ge, Jinwei Gu, Ming-Yu Liu, Abe Davis, Yifan Ding arXiv ↗ PDF ↗
Articulated Kinematics Distillation from Video Diffusion Models
Xuan Li, Qianli Ma, Tsung-Yi Lin, Yongxin Chen, Chenfanfu Jiang, Ming-Yu Liu, Donglai Xiang arXiv ↗ PDF ↗
ArticulatedGS: Self-supervised Digital Twin Modeling of Articulated Objects using 3D Gaussian Splatting
Junfu Guo, Yu Xin, Gaoyi Liu, Kai Xu, Ligang Liu, Ruizhen Hu arXiv ↗ PDF ↗
Associative Transformer
Yuwei Sun, Hideya Ochiai, Zhirong Wu, Stephen Lin, Ryota Kanai arXiv ↗ PDF ↗
Asynchronous Collaborative Graph Representation for Frames and Events
Dianze Li, Jianing Li, Xu Liu, Xiaopeng Fan, Yonghong Tian PDF ↗
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
Haipeng Fang, Sheng Tang, Juan Cao, Enshuo Zhang, Fan Tang, Tong-Yee Lee arXiv ↗ PDF ↗
Attention Distillation: A Unified Approach to Visual Characteristics Transfer
Yang Zhou, Xu Gao, Zichong Chen, Hui Huang arXiv ↗ PDF ↗
Attention IoU: Examining Biases in CelebA using Attention Maps
Aaron Serianni, Tyler Zhu, Olga Russakovsky, Vikram V. Ramaswamy arXiv ↗ PDF ↗
Attraction Diminishing and Distributing for Few-Shot Class-Incremental Learning
Li-Jun Zhao, Zhen-Duo Chen, Yongxin Wang, Xin Luo, Xin-Shun Xu PDF ↗
Attribute-Missing Multi-view Graph Clustering
Bowen Zhao, Qianqian Wang, Zhengming Ding, Quanxue Gao PDF ↗
Attribute-formed Class-specific Concept Space: Endowing Language Bottleneck Model with Better Interpretability and Scalability
Jianyang Zhang, Qianli Luo, Guowu Yang, Wenjing Yang, Weide Liu, Guosheng Lin, Fengmao Lv arXiv ↗ PDF ↗
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
Jiazhi Guan, Kaisiyuan Wang, Zhiliang Xu, Quanwei Yang, Yasheng Sun, Shengyi He, Borong Liang, Yukang Cao, Yingying Li, Haocheng Feng, Errui Ding, Jingdong Wang, Youjian Zhao, Hang Zhou, Ziwei Liu arXiv ↗ PDF ↗
Audio-Visual Instance Segmentation
Ruohao Guo, Xianghua Ying, Yaru Chen, Dantong Niu, Guangyao Li, Liao Qu, Yanyu Qi, Jinxing Zhou, Bowei Xing, Wenzhen Yue, Ji Shi, Qixun Wang, Peiliang Zhang, Buwen Liang arXiv ↗ PDF ↗
Audio-Visual Semantic Graph Network for Audio-Visual Event Localization
Liang Liu, Shuaiyong Li, Yongqiang Zhu PDF ↗
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
Federico Cocchi, Nicholas Moratelli, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara arXiv ↗ PDF ↗
Augmenting Perceptual Super-Resolution via Image Quality Predictors
Fengjia Zhang, Samrudhdhi B. Rangrej, Tristan Aumentado-Armstrong, Afsaneh Fazly, Alex Levinshtein arXiv ↗ PDF ↗
AuraFusion360: Augmented Unseen Region Alignment for Reference-based 360deg Unbounded Scene Inpainting
Chung-Ho Wu, Yang-Jung Chen, Ying-Huan Chen, Jie-Ying Lee, Bo-Hsu Ke, Chun-Wei Tuan Mu, Yi-Chuan Huang, Chin-Yang Lin, Min-Hung Chen, Yen-Yu Lin, Yu-Lun Liu PDF ↗
Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language
Yicheng Chen, Xiangtai Li, Yining Li, Yanhong Zeng, Jianzong Wu, Xiangyu Zhao, Kai Chen PDF ↗
Auto-Encoded Supervision for Perceptual Image Super-Resolution
MinKyu Lee, Sangeek Hyun, Woojin Jun, Jae-Pil Heo arXiv ↗ PDF ↗
AutoLUT: LUT-Based Image Super-Resolution with Automatic Sampling and Adaptive Residual Learning
Yuheng Xu, Shijie Yang, Xin Liu, Jie Liu, Jie Tang, Gangshan Wu arXiv ↗ PDF ↗
AutoPresent: Designing Structured Visuals from Scratch
Jiaxin Ge, Zora Zhiruo Wang, Xuhui Zhou, Yi-Hao Peng, Sanjay Subramanian, Qinyue Tan, Maarten Sap, Alane Suhr, Daniel Fried, Graham Neubig, Trevor Darrell arXiv ↗ PDF ↗
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
Niu Lian, Jun Li, Jinpeng Wang, Ruisheng Luo, Yaowei Wang, Shu-Tao Xia, Bin Chen arXiv ↗ PDF ↗
AutoURDF: Unsupervised Robot Modeling from Point Cloud Frames Using Cluster Registration
Jiong Lin, Lechen Zhang, Kwansoo Lee, Jialong Ning, Judah Goldfeder, Hod Lipson arXiv ↗ PDF ↗
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
Yuhui Zhang, Yuchang Su, Yiming Liu, Xiaohan Wang, James Burgess, Elaine Sui, Chenyu Wang, Josiah Aklilu, Alejandro Lozano, Anjiang Wei, Ludwig Schmidt, Serena Yeung-Levy arXiv ↗ PDF ↗
Automated Proof of Polynomial Inequalities via Reinforcement Learning
Banglong Liu, Niuniu Qi, Xia Zeng, Lydia Dehbi, Zhengfeng Yang arXiv ↗ PDF ↗
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
Xiaoyi Qu, David Aponte, Colby Banbury, Daniel P. Robinson, Tianyu Ding, Kazuhito Koishida, Ilya Zharkov, Tianyi Chen arXiv ↗ PDF ↗
Automatic Spectral Calibration of Hyperspectral Images: Method, Dataset and Benchmark
Zhuoran Du, Shaodi You, Cheng Cheng, Shikui Wei arXiv ↗ PDF ↗
Autoregressive Distillation of Diffusion Transformers
Yeongmin Kim, Sotiris Anagnostidis, Yuming Du, Edgar Schönfeld, Jonas Kohler, Markos Georgopoulos, Albert Pumarola, Ali Thabet, Artsiom Sanakoyeu arXiv ↗ PDF ↗
Autoregressive Sequential Pretraining for Visual Tracking
Shiyi Liang, Yifan Bai, Yihong Gong, Xing Wei PDF ↗
AvatarArtist: Open-Domain 4D Avatarization
Hongyu Liu, Xuan Wang, Ziyu Wan, Yue Ma, Jingye Chen, Yanbo Fan, Yujun Shen, Yibing Song, Qifeng Chen arXiv ↗ PDF ↗