CCF-A · IEEE/CVF Conference on Computer Vision and Pattern Recognition

CVPR 2024

Jun 17–21, 2024 · Seattle, USA · 2,713 papers · official site ↗

Best papers & awards 10

BioCLIP: A Vision Foundation Model for the Tree of Life
Best Student Paper Oral Samuel Stevens, Jiaman Wu, Matthew J Thompson, Elizabeth G Campolongo, Chan Hee Song, David Edward Carlyn, Li Dong, Wasila M Dahdul, Charles Stewart, Tanya Berger-Wolf, Wei-Lun Chao, Yu Su arXiv ↗ PDF ↗
Comparing the Decision-Making Mechanisms by Transformers and CNNs via Explanation Methods
Honorable Mention Oral Mingqi Jiang, Saeed Khorram, Li Fuxin arXiv ↗ PDF ↗
EventPS: Real-Time Photometric Stereo Using an Event Camera
Honorable Mention Oral Bohan Yu, Jieji Ren, Jin Han, Feishi Wang, Jinxiu Liang, Boxin Shi PDF ↗
Generative Image Dynamics
Best Paper Oral Zhengqi Li, Richard Tucker, Noah Snavely, Aleksander Holynski arXiv ↗ PDF ↗
Image Processing GNN: Breaking Rigidity in Super-Resolution
Honorable Mention Oral Yuchuan Tian, Hanting Chen, Chao Xu, Yunhe Wang PDF ↗
Mip-Splatting: Alias-free 3D Gaussian Splatting
Best Student Paper Oral Zehao Yu, Anpei Chen, Binbin Huang, Torsten Sattler, Andreas Geiger PDF ↗
Objects as Volumes: A Stochastic Geometry View of Opaque Solids
Honorable Mention Oral Bailey Miller, Hanyu Chen, Alice Lai, Ioannis Gkioulekas arXiv ↗ PDF ↗
Rich Human Feedback for Text-to-Image Generation
Best Paper Oral Youwei Liang, Junfeng He, Gang Li, Peizhao Li, Arseniy Klimovskiy, Nicholas Carolan, Jiao Sun, Jordi Pont-Tuset, Sarah Young, Feng Yang, Junjie Ke, Krishnamurthy Dj Dvijotham, Katherine M. Collins, Yiwen Luo, Yang Li, Kai J Kohlhoff, Deepak Ramachandran, Vidhya Navalpakkam arXiv ↗ PDF ↗
SpiderMatch: 3D Shape Matching with Global Optimality and Geometric Consistency
Honorable Mention Oral Paul Roetzer, Florian Bernard PDF ↗
pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction
Honorable Mention Oral David Charatan, Sizhe Lester Li, Andrea Tagliasacchi, Vincent Sitzmann arXiv ↗ PDF ↗

Highlights & orals 324

3D Face Reconstruction with the Geometric Guidance of Facial Part Segmentation
Highlight Zidu Wang, Xiangyu Zhu, Tianshuo Zhang, Baiqin Wang, Zhen Lei arXiv ↗ PDF ↗
3D Human Pose Perception from Egocentric Stereo Videos
Highlight Hiroyasu Akada, Jian Wang, Vladislav Golyanik, Christian Theobalt arXiv ↗ PDF ↗
3DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint Videos
Highlight Jiakai Sun, Han Jiao, Guangyuan Li, Zhanjie Zhang, Lei Zhao, Wei Xing arXiv ↗ PDF ↗
3DInAction: Understanding Human Actions in 3D Point Clouds
Highlight Yizhak Ben-Shabat, Oren Shrout, Stephen Gould arXiv ↗ PDF ↗
4D-DRESS: A 4D Dataset of Real-World Human Clothing With Semantic Annotations
Highlight Wenbo Wang, Hsuan-I Ho, Chen Guo, Boxiang Rong, Artur Grigorev, Jie Song, Juan Jose Zarate, Otmar Hilliges PDF ↗
A Pedestrian is Worth One Prompt: Towards Language Guidance Person Re-Identification
Highlight Zexian Yang, Dayan Wu, Chenming Wu, Zheng Lin, Jingzi Gu, Weiping Wang PDF ↗
A Vision Check-up for Language Models
Highlight Pratyusha Sharma, Tamar Rott Shaham, Manel Baradad, Stephanie Fu, Adrian Rodriguez-Munoz, Shivam Duggal, Phillip Isola, Antonio Torralba arXiv ↗ PDF ↗
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
Highlight Jeongsoo Choi, Se Jin Park, Minsu Kim, Yong Man Ro arXiv ↗ PDF ↗
Abductive Ego-View Accident Video Understanding for Safe Driving Perception
Highlight Jianwu Fang, Lei-lei Li, Junfei Zhou, Junbin Xiao, Hongkai Yu, Chen Lv, Jianru Xue, Tat-Seng Chua arXiv ↗ PDF ↗
Absolute Pose from One or Two Scaled and Oriented Features
Highlight Jonathan Ventura, Zuzana Kukelova, Torsten Sattler, Dániel Baráth PDF ↗
Accept the Modality Gap: An Exploration in the Hyperbolic Space
Highlight Sameera Ramasinghe, Violetta Shevchenko, Gil Avraham, Ajanthan Thalaiyasingam PDF ↗
Active Domain Adaptation with False Negative Prediction for Object Detection
Highlight Yuzuru Nakamura, Yasunori Ishii, Takayoshi Yamashita PDF ↗
Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images
Highlight Chaoqin Huang, Aofan Jiang, Jinghao Feng, Ya Zhang, Xinchao Wang, Yanfeng Wang arXiv ↗ PDF ↗
Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models
Highlight Huan Ling, Seung Wook Kim, Antonio Torralba, Sanja Fidler, Karsten Kreis arXiv ↗ PDF ↗
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
Highlight Tang Tao, Guangrun Wang, Yixing Lao, Peng Chen, Jie Liu, Liang Lin, Kaicheng Yu, Xiaodan Liang arXiv ↗ PDF ↗
Amodal Completion via Progressive Mixed Context Diffusion
Highlight Katherine Xu, Lingzhi Zhang, Jianbo Shi arXiv ↗ PDF ↗
Are Conventional SNNs Really Efficient? A Perspective from Network Quantization
Highlight Guobin Shen, Dongcheng Zhao, Tenglong Li, Jindong Li, Yi Zeng PDF ↗
Atlantis: Enabling Underwater Depth Estimation with Stable Diffusion
Highlight Fan Zhang, Shaodi You, Yu Li, Ying Fu arXiv ↗ PDF ↗
Attention-Propagation Network for Egocentric Heatmap to 3D Pose Lifting
Highlight Taeho Kang, Youngki Lee arXiv ↗ PDF ↗
BEHAVIOR Vision Suite: Customizable Dataset Generation via Simulation
Highlight Yunhao Ge, Yihe Tang, Jiashu Xu, Cem Gokmen, Chengshu Li, Wensi Ai, Benjamin Jose Martinez, Arman Aydin, Mona Anvari, Ayush K Chakravarthy, Hong-Xing Yu, Josiah Wong, Sanjana Srivastava, Sharon Lee, Shengxin Zha, Laurent Itti, Yunzhu Li, Roberto Martín-Martín, Miao Liu, Pengchuan Zhang, Ruohan Zhang, Li Fei-Fei, Jiajun Wu arXiv ↗ PDF ↗
BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning
Highlight Siyuan Liang, Mingli Zhu, Aishan Liu, Baoyuan Wu, Xiaochun Cao, Ee-Chien Chang arXiv ↗ PDF ↗
Bayes' Rays: Uncertainty Quantification for Neural Radiance Fields
Highlight Lily Goli, Cody Reading, Silvia Sellán, Alec Jacobson, Andrea Tagliasacchi PDF ↗
Boosting Neural Representations for Videos with a Conditional Decoder
Highlight Xinjie Zhang, Ren Yang, Dailan He, Xingtong Ge, Tongda Xu, Yan Wang, Hongwei Qin, Jun Zhang arXiv ↗ PDF ↗
Brain Decodes Deep Nets
Highlight Huzheng Yang, James Gee, Jianbo Shi arXiv ↗ PDF ↗
Breathing Life Into Sketches Using Text-to-Video Priors
Highlight Rinon Gal, Yael Vinker, Yuval Alaluf, Amit Bermano, Daniel Cohen-Or, Ariel Shamir, Gal Chechik arXiv ↗ PDF ↗
C2KD: Bridging the Modality Gap for Cross-Modal Knowledge Distillation
Highlight Fushuo Huo, Wenchao Xu, Jingcai Guo, Haozhao Wang, Song Guo PDF ↗
CAD-SIGNet: CAD Language Inference from Point Clouds using Layer-wise Sketch Instance Guided Attention
Highlight Mohammad Sadil Khan, Elona Dupont, Sk Aziz Ali, Kseniya Cherenkova, Anis Kacem, Djamila Aouada PDF ↗
CADTalk: An Algorithm and Benchmark for Semantic Commenting of CAD Programs
Highlight Haocheng Yuan, Jing Xu, Hao Pan, Adrien Bousseau, Niloy J. Mitra, Changjian Li arXiv ↗ PDF ↗
CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation
Highlight Seokju Cho, Heeseong Shin, Sunghwan Hong, Anurag Arnab, Paul Hongsuck Seo, Seungryong Kim PDF ↗
CFAT: Unleashing Triangular Windows for Image Super-resolution
Highlight Abhisek Ray, Gaurav Kumar, Maheshkumar H. Kolekar PDF ↗
CFPL-FAS: Class Free Prompt Learning for Generalizable Face Anti-spoofing
Highlight Ajian Liu, Shuai Xue, Jianwen Gan, Jun Wan, Yanyan Liang, Jiankang Deng, Sergio Escalera, Zhen Lei PDF ↗
CLIP-Driven Open-Vocabulary 3D Scene Graph Generation via Cross-Modality Contrastive Learning
Highlight Lianggangxu Chen, Xuejiao Wang, Jiale Lu, Shaohui Lin, Changbo Wang, Gaoqi He PDF ↗
CLiC: Concept Learning in Context
Highlight Mehdi Safaee, Aryan Mikaeili, Or Patashnik, Daniel Cohen-Or, Ali Mahdavi-Amiri arXiv ↗ PDF ↗
COLMAP-Free 3D Gaussian Splatting
Highlight Yang Fu, Sifei Liu, Amey Kulkarni, Jan Kautz, Alexei A. Efros, Xiaolong Wang arXiv ↗ PDF ↗
Can I Trust Your Answer? Visually Grounded Video Question Answering
Highlight Junbin Xiao, Angela Yao, Yicong Li, Tat-Seng Chua arXiv ↗ PDF ↗
Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language Models
Highlight Shitian Zhao, Zhuowan Li, Yadong Lu, Alan Yuille, Yan Wang PDF ↗
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
Highlight Peng Jin, Ryuichi Takanobu, Wancai Zhang, Xiaochun Cao, Li Yuan PDF ↗
Clockwork Diffusion: Efficient Generation With Model-Step Distillation
Highlight Amirhossein Habibian, Amir Ghodrati, Noor Fathima, Guillaume Sautiere, Risheek Garrepalli, Fatih Porikli, Jens Petersen arXiv ↗ PDF ↗
CoDeF: Content Deformation Fields for Temporally Consistent Video Processing
Highlight Hao Ouyang, Qiuyu Wang, Yuxi Xiao, Qingyan Bai, Juntao Zhang, Kecheng Zheng, Xiaowei Zhou, Qifeng Chen, Yujun Shen arXiv ↗ PDF ↗
CoDi-2: In-Context Interleaved and Interactive Any-to-Any Generation
Highlight Zineng Tang, Ziyi Yang, Mahmoud Khademi, Yang Liu, Chenguang Zhu, Mohit Bansal PDF ↗
Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image Synthesis
Highlight Yanzuo Lu, Manlin Zhang, Andy J Ma, Xiaohua Xie, Jianhuang Lai arXiv ↗ PDF ↗
CogAgent: A Visual Language Model for GUI Agents
Highlight Wenyi Hong, Weihan Wang, Qingsong Lv, Jiazheng Xu, Wenmeng Yu, Junhui Ji, Yan Wang, Zihan Wang, Yuxiao Dong, Ming Ding, Jie Tang arXiv ↗ PDF ↗
Coherence As Texture - Passive Textureless 3D Reconstruction by Self-interference
Highlight Wei-Yu Chen, Aswin C. Sankaranarayanan, Anat Levin, Matthew O'Toole PDF ↗
Compact 3D Gaussian Representation for Radiance Field
Highlight Joo Chan Lee, Daniel Rho, Xiangyu Sun, Jong Hwan Ko, Eunbyung Park arXiv ↗ PDF ↗
Continual Self-supervised Learning: Towards Universal Multi-modal Medical Data Representation Learning
Highlight Yiwen Ye, Yutong Xie, Jianpeng Zhang, Ziyang Chen, Qi Wu, Yong Xia arXiv ↗ PDF ↗
Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation
Highlight Qi Yang, Xing Nie, Tong Li, Pengfei Gao, Ying Guo, Cheng Zhen, Pengfei Yan, Shiming Xiang arXiv ↗ PDF ↗
CoralSCOP: Segment any COral Image on this Planet
Highlight Ziqiang Zheng, Haixin Liang, Binh-Son Hua, Yue Him Wong, Put Ang, Apple Pui Yi Chui, Sai-Kit Yeung PDF ↗
Correcting Diffusion Generation through Resampling
Highlight Yujian Liu, Yang Zhang, Tommi Jaakkola, Shiyu Chang arXiv ↗ PDF ↗
Correspondence-Free Non-Rigid Point Set Registration Using Unsupervised Clustering Analysis
Highlight Mingyang Zhao, Jingen Jiang, Lei Ma, Shiqing Xin, Gaofeng Meng, Dong-Ming Yan PDF ↗
CosmicMan: A Text-to-Image Foundation Model for Humans
Highlight Shikai Li, Jianglin Fu, Kaiyuan Liu, Wentao Wang, Kwan-Yee Lin, Wayne Wu arXiv ↗ PDF ↗
Cross-spectral Gated-RGB Stereo Depth Estimation
Highlight Samuel Brucker, Stefanie Walz, Mario Bijelic, Felix Heide arXiv ↗ PDF ↗
DEADiff: An Efficient Stylization Diffusion Model with Disentangled Representations
Highlight Tianhao Qi, Shancheng Fang, Yanze Wu, Hongtao Xie, Jiawei Liu, Lang Chen, Qian He, Yongdong Zhang arXiv ↗ PDF ↗
Data-Efficient Multimodal Fusion on a Single GPU
Highlight Noël Vouitsis, Zhaoyan Liu, Satya Krishna Gorti, Valentin Villecroze, Jesse C. Cresswell, Guangwei Yu, Gabriel Loaiza-Ganem, Maksims Volkovs arXiv ↗ PDF ↗
Deciphering 'What' and 'Where' Visual Pathways from Spectral Clustering of Layer-Distributed Neural Representations
Highlight Xiao Zhang, David Yunis, Michael Maire arXiv ↗ PDF ↗
Dense Optical Tracking: Connecting the Dots
Highlight Guillaume Le Moing, Jean Ponce, Cordelia Schmid arXiv ↗ PDF ↗
Detours for Navigating Instructional Videos
Highlight Kumar Ashutosh, Zihui Xue, Tushar Nagarajan, Kristen Grauman arXiv ↗ PDF ↗
DiVa-360: The Dynamic Visual Dataset for Immersive Neural Fields
Highlight Cheng-You Lu, Peisen Zhou, Angela Xing, Chandradeep Pokhariya, Arnab Dey, Ishaan Nikhil Shah, Rugved Mavidipalli, Dylan Hu, Andrew I. Comport, Kefan Chen, Srinath Sridhar PDF ↗
DiffPortrait3D: Controllable Diffusion for Zero-Shot Portrait View Synthesis
Highlight Yuming Gu, Hongyi Xu, You Xie, Guoxian Song, Yichun Shi, Di Chang, Jing Yang, Linjie Luo arXiv ↗ PDF ↗
Diffeomorphic Template Registration for Atmospheric Turbulence Mitigation
Highlight Dong Lao, Congli Wang, Alex Wong, Stefano Soatto arXiv ↗ PDF ↗
Diffusion Handles Enabling 3D Edits for Diffusion Models by Lifting Activations to 3D
Highlight Karran Pandey, Paul Guerrero, Matheus Gadelha, Yannick Hold-Geoffroy, Karan Singh, Niloy J. Mitra arXiv ↗ PDF ↗
Diffusion Reflectance Map: Single-Image Stochastic Inverse Rendering of Illumination and Reflectance
Highlight Yuto Enyo, Ko Nishino arXiv ↗ PDF ↗
Diffusion-EDFs: Bi-equivariant Denoising Generative Modeling on SE(3) for Visual Robotic Manipulation
Highlight Hyunwoo Ryu, Jiwoo Kim, Hyunseok An, Junwoo Chang, Joohwan Seo, Taehan Kim, Yubin Kim, Chaewon Hwang, Jongeun Choi, Roberto Horowitz PDF ↗
Discovering and Mitigating Visual Biases through Keyword Explanation
Highlight Younghyun Kim, Sangwoo Mo, Minkyu Kim, Kyungmin Lee, Jaeho Lee, Jinwoo Shin arXiv ↗ PDF ↗
Distraction is All You Need: Memory-Efficient Image Immunization against Diffusion-Based Image Editing
Highlight Ling Lo, Cheng Yu Yeo, Hong-Han Shuai, Wen-Huang Cheng PDF ↗
DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion Models
Highlight Muyang Li, Tianle Cai, Jiaxin Cao, Qinsheng Zhang, Han Cai, Junjie Bai, Yangqing Jia, Kai Li, Song Han arXiv ↗ PDF ↗
Diversified and Personalized Multi-rater Medical Image Segmentation
Highlight Yicheng Wu, Xiangde Luo, Zhe Xu, Xiaoqing Guo, Lie Ju, Zongyuan Ge, Wenjun Liao, Jianfei Cai arXiv ↗ PDF ↗
Domain Prompt Learning with Quaternion Networks
Highlight Qinglong Cao, Zhengqin Xu, Yuntian Chen, Chao Ma, Xiaokang Yang arXiv ↗ PDF ↗
Don't Drop Your Samples! Coherence-Aware Training Benefits Conditional Diffusion
Highlight Nicolas Dufour, Victor Besnier, Vicky Kalogeiton, David Picard PDF ↗
Dr.Hair: Reconstructing Scalp-Connected Hair Strands without Pre-Training via Differentiable Rendering of Line Segments
Highlight Yusuke Takimoto, Hikari Takehara, Hiroyuki Sato, Zihao Zhu, Bo Zheng PDF ↗
DragDiffusion: Harnessing Diffusion Models for Interactive Point-based Image Editing
Highlight Yujun Shi, Chuhui Xue, Jun Hao Liew, Jiachun Pan, Hanshu Yan, Wenqing Zhang, Vincent Y. F. Tan, Song Bai arXiv ↗ PDF ↗
DreamPropeller: Supercharge Text-to-3D Generation with Parallel Sampling
Highlight Linqi Zhou, Andy Shih, Chenlin Meng, Stefano Ermon arXiv ↗ PDF ↗
Dynamic Cues-Assisted Transformer for Robust Point Cloud Registration
Highlight Hong Chen, Pei Yan, Sihe Xiang, Yihua Tan PDF ↗
Dynamic LiDAR Re-simulation using Compositional Neural Fields
Highlight Hanfeng Wu, Xingxing Zuo, Stefan Leutenegger, Or Litany, Konrad Schindler, Shengyu Huang arXiv ↗ PDF ↗
Dynamic Policy-Driven Adaptive Multi-Instance Learning for Whole Slide Image Classification
Highlight Tingting Zheng, Kui Jiang, Hongxun Yao arXiv ↗ PDF ↗
EAGLE: Eigen Aggregation Learning for Object-Centric Unsupervised Semantic Segmentation
Highlight Chanyoung Kim, Woojung Han, Dayun Ju, Seong Jae Hwang arXiv ↗ PDF ↗
Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents
Highlight Yuxi Wei, Zi Wang, Yifan Lu, Chenxin Xu, Changxing Liu, Hao Zhao, Siheng Chen, Yanfeng Wang arXiv ↗ PDF ↗
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
Highlight Yuwen Xiong, Zhiqi Li, Yuntao Chen, Feng Wang, Xizhou Zhu, Jiapeng Luo, Wenhai Wang, Tong Lu, Hongsheng Li, Yu Qiao, Lewei Lu, Jie Zhou, Jifeng Dai arXiv ↗ PDF ↗
Efficient LoFTR: Semi-Dense Local Feature Matching with Sparse-Like Speed
Highlight Yifan Wang, Xingyi He, Sida Peng, Dongli Tan, Xiaowei Zhou arXiv ↗ PDF ↗
Efficient Solution of Point-Line Absolute Pose
Highlight Petr Hruby, Timothy Duff, Marc Pollefeys arXiv ↗ PDF ↗
EfficientSAM: Leveraged Masked Image Pretraining for Efficient Segment Anything
Highlight Yunyang Xiong, Bala Varadarajan, Lemeng Wu, Xiaoyu Xiang, Fanyi Xiao, Chenchen Zhu, Xiaoliang Dai, Dilin Wang, Fei Sun, Forrest Iandola, Raghuraman Krishnamoorthi, Vikas Chandra arXiv ↗ PDF ↗
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
Highlight Sijie Cheng, Zhicheng Guo, Jingwen Wu, Kechen Fang, Peng Li, Huaping Liu, Yang Liu arXiv ↗ PDF ↗
Emu Edit: Precise Image Editing via Recognition and Generation Tasks
Highlight Shelly Sheynin, Adam Polyak, Uriel Singer, Yuval Kirstain, Amit Zohar, Oron Ashual, Devi Parikh, Yaniv Taigman arXiv ↗ PDF ↗
Enhancing Video Super-Resolution via Implicit Resampling-based Alignment
Highlight Kai Xu, Ziwei Yu, Xin Wang, Michael Bi Mi, Angela Yao arXiv ↗ PDF ↗
Enhancing Vision-Language Pre-training with Rich Supervisions
Highlight Yuan Gao, Kunyu Shi, Pengkai Zhu, Edouard Belval, Oren Nuriel, Srikar Appalaraju, Shabnam Ghadar, Zhuowen Tu, Vijay Mahadevan, Stefano Soatto arXiv ↗ PDF ↗
Event-based Structure-from-Orbit
Highlight Ethan Elms, Yasir Latif, Tae Ha Park, Tat-Jun Chin arXiv ↗ PDF ↗
ExACT: Language-guided Conceptual Reasoning and Uncertainty Estimation for Event-based Action Recognition and More
Highlight Jiazhou Zhou, Xu Zheng, Yuanhuiyi Lyu, Lin Wang arXiv ↗ PDF ↗
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
Highlight Yichi Zhang, Yinpeng Dong, Siyuan Zhang, Tianzan Min, Hang Su, Jun Zhu arXiv ↗ PDF ↗
F3Loc: Fusion and Filtering for Floorplan Localization
Highlight Changan Chen, Rui Wang, Christoph Vogel, Marc Pollefeys PDF ↗
FAR: Flexible Accurate and Robust 6DoF Relative Camera Pose Estimation
Highlight Chris Rockwell, Nilesh Kulkarni, Linyi Jin, Jeong Joon Park, Justin Johnson, David F. Fouhey arXiv ↗ PDF ↗
Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAM
Highlight Pingping Zhang, Tianyu Yan, Yang Liu, Huchuan Lu arXiv ↗ PDF ↗
Fast ODE-based Sampling for Diffusion Models in Around 5 Steps
Highlight Zhenyu Zhou, Defang Chen, Can Wang, Chun Chen arXiv ↗ PDF ↗
Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature Fields
Highlight Shijie Zhou, Haoran Chang, Sicheng Jiang, Zhiwen Fan, Zehao Zhu, Dejia Xu, Pradyumna Chari, Suya You, Zhangyang Wang, Achuta Kadambi arXiv ↗ PDF ↗
Feedback-Guided Autonomous Driving
Highlight Jimuyang Zhang, Zanming Huang, Arijit Ray, Eshed Ohn-Bar PDF ↗
FinePOSE: Fine-Grained Prompt-Driven 3D Human Pose Estimation via Diffusion Models
Highlight Jinglin Xu, Yijie Guo, Yuxin Peng arXiv ↗ PDF ↗
FlowDiffuser: Advancing Optical Flow Estimation with Diffusion Models
Highlight Ao Luo, Xin Li, Fan Yang, Jiangyu Liu, Haoqiang Fan, Shuaicheng Liu PDF ↗
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
Highlight Feng Liang, Bichen Wu, Jialiang Wang, Licheng Yu, Kunpeng Li, Yinan Zhao, Ishan Misra, Jia-Bin Huang, Peizhao Zhang, Peter Vajda, Diana Marculescu arXiv ↗ PDF ↗
FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects
Highlight Bowen Wen, Wei Yang, Jan Kautz, Stan Birchfield arXiv ↗ PDF ↗
Frequency-Adaptive Dilated Convolution for Semantic Segmentation
Highlight Linwei Chen, Lin Gu, Dezhi Zheng, Ying Fu PDF ↗
From Activation to Initialization: Scaling Insights for Optimizing Neural Fields
Highlight Hemanth Saratchandran, Sameera Ramasinghe, Simon Lucey arXiv ↗ PDF ↗
From Correspondences to Pose: Non-minimal Certifiably Optimal Relative Pose without Disambiguation
Highlight Javier Tirado-Garín, Javier Civera PDF ↗
From Feature to Gaze: A Generalizable Replacement of Linear Layer for Gaze Estimation
Highlight Yiwei Bao, Feng Lu PDF ↗
From Isolated Islands to Pangea: Unifying Semantic Space for Human Action Understanding
Highlight Yong-Lu Li, Xiaoqian Wu, Xinpeng Liu, Zehao Wang, Yiming Dou, Yikun Ji, Junyi Zhang, Yixing Li, Xudong Lu, Jingru Tan, Cewu Lu arXiv ↗ PDF ↗
Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic Segmentation
Highlight Bingfeng Zhang, Siyue Yu, Yunchao Wei, Yao Zhao, Jimin Xiao PDF ↗
GART: Gaussian Articulated Template Models
Highlight Jiahui Lei, Yufu Wang, Georgios Pavlakos, Lingjie Liu, Kostas Daniilidis arXiv ↗ PDF ↗
GAvatar: Animatable 3D Gaussian Avatars with Implicit Mesh Learning
Highlight Ye Yuan, Xueting Li, Yangyi Huang, Shalini De Mello, Koki Nagano, Jan Kautz, Umar Iqbal arXiv ↗ PDF ↗
GP-NeRF: Generalized Perception NeRF for Context-Aware 3D Scene Understanding
Highlight Hao Li, Dingwen Zhang, Yalun Dai, Nian Liu, Lechao Cheng, Jingfeng Li, Jingdong Wang, Junwei Han PDF ↗
GPS-Gaussian: Generalizable Pixel-wise 3D Gaussian Splatting for Real-time Human Novel View Synthesis
Highlight Shunyuan Zheng, Boyao Zhou, Ruizhi Shao, Boning Liu, Shengping Zhang, Liqiang Nie, Yebin Liu PDF ↗
GPT4Point: A Unified Framework for Point-Language Understanding and Generation
Highlight Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao arXiv ↗ PDF ↗
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
Highlight Chi Yan, Delin Qu, Dan Xu, Bin Zhao, Zhigang Wang, Dong Wang, Xuelong Li PDF ↗
Gaussian Splatting SLAM
Highlight Hidenobu Matsuki, Riku Murai, Paul H.J. Kelly, Andrew J. Davison arXiv ↗ PDF ↗
Gaussian-Flow: 4D Reconstruction with Dynamic 3D Gaussian Particle
Highlight Youtian Lin, Zuozhuo Dai, Siyu Zhu, Yao Yao PDF ↗
GaussianAvatars: Photorealistic Head Avatars with Rigged 3D Gaussians
Highlight Shenhan Qian, Tobias Kirschstein, Liam Schoneveld, Davide Davoli, Simon Giebenhain, Matthias Nießner arXiv ↗ PDF ↗
Gear-NeRF: Free-Viewpoint Rendering and Tracking with Motion-aware Spatio-Temporal Sampling
Highlight Xinhang Liu, Yu-Wing Tai, Chi-Keung Tang, Pedro Miraldo, Suhas Lohit, Moitreya Chatterjee PDF ↗
General Object Foundation Model for Images and Videos at Scale
Highlight Junfeng Wu, Yi Jiang, Qihao Liu, Zehuan Yuan, Xiang Bai, Song Bai arXiv ↗ PDF ↗
Generalized Large-Scale Data Condensation via Various Backbone and Statistical Matching
Highlight Shitong Shao, Zeyuan Yin, Muxin Zhou, Xindong Zhang, Zhiqiang Shen arXiv ↗ PDF ↗
Generalized Predictive Model for Autonomous Driving
Highlight Jiazhi Yang, Shenyuan Gao, Yihang Qiu, Li Chen, Tianyu Li, Bo Dai, Kashyap Chitta, Penghao Wu, Jia Zeng, Ping Luo, Jun Zhang, Andreas Geiger, Yu Qiao, Hongyang Li arXiv ↗ PDF ↗
Generative Powers of Ten
Highlight Xiaojuan Wang, Janne Kontkanen, Brian Curless, Steven M. Seitz, Ira Kemelmacher-Shlizerman, Ben Mildenhall, Pratul Srinivasan, Dor Verbin, Aleksander Holynski arXiv ↗ PDF ↗
Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding
Highlight Guofeng Mei, Luigi Riz, Yiming Wang, Fabio Poiesi arXiv ↗ PDF ↗
GraCo: Granularity-Controllable Interactive Segmentation
Highlight Yian Zhao, Kehan Li, Zesen Cheng, Pengchong Qiao, Xiawu Zheng, Rongrong Ji, Chang Liu, Li Yuan, Jie Chen arXiv ↗ PDF ↗
H-ViT: A Hierarchical Vision Transformer for Deformable Image Registration
Highlight Morteza Ghahremani, Mohammad Khateri, Bailiang Jian, Benedikt Wiestler, Ehsan Adeli, Christian Wachinger PDF ↗
HHMR: Holistic Hand Mesh Recovery by Enhancing the Multimodal Controllability of Graph Diffusion Models
Highlight Mengcheng Li, Hongwen Zhang, Yuxiang Zhang, Ruizhi Shao, Tao Yu, Yebin Liu PDF ↗
HOI-M^3: Capture Multiple Humans and Objects Interaction within Contextual Environment
Highlight Juze Zhang, Jingyan Zhang, Zining Song, Zhanhe Shi, Chengfeng Zhao, Ye Shi, Jingyi Yu, Lan Xu, Jingya Wang PDF ↗
HOLD: Category-agnostic 3D Reconstruction of Interacting Hands and Objects from Video
Highlight Zicong Fan, Maria Parelli, Maria Eleni Kadoglou, Xu Chen, Muhammed Kocabas, Michael J. Black, Otmar Hilliges arXiv ↗ PDF ↗
HandDiff: 3D Hand Pose Estimation with Diffusion on Image-Point Cloud
Highlight Wencan Cheng, Hao Tang, Luc Van Gool, Jong Hwan Ko arXiv ↗ PDF ↗
HashPoint: Accelerated Point Searching and Sampling for Neural Rendering
Highlight Jiahao Ma, Miaomiao Liu, David Ahmedt-Aristizabal, Chuong Nguyen PDF ↗
Honeybee: Locality-enhanced Projector for Multimodal LLM
Highlight Junbum Cha, Wooyoung Kang, Jonghwan Mun, Byungseok Roh arXiv ↗ PDF ↗
Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation
Highlight Wenhao Li, Mengyuan Liu, Hong Liu, Pichao Wang, Jialun Cai, Nicu Sebe arXiv ↗ PDF ↗
HouseCat6D - A Large-Scale Multi-Modal Category Level 6D Object Perception Dataset with Household Objects in Realistic Scenarios
Highlight HyunJun Jung, Shun-Cheng Wu, Patrick Ruhkamp, Guangyao Zhai, Hannah Schieber, Giulia Rizzoli, Pengyuan Wang, Hongcheng Zhao, Lorenzo Garattoni, Sven Meier, Daniel Roth, Nassir Navab, Benjamin Busam PDF ↗
Human Motion Prediction Under Unexpected Perturbation
Highlight Jiangbei Yue, Baiyi Li, Julien Pettré, Armin Seyfried, He Wang PDF ↗
HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting
Highlight Xian Liu, Xiaohang Zhan, Jiaxiang Tang, Ying Shan, Gang Zeng, Dahua Lin, Xihui Liu, Ziwei Liu arXiv ↗ PDF ↗
HybridNeRF: Efficient Neural Rendering via Adaptive Volumetric Surfaces
Highlight Haithem Turki, Vasu Agrawal, Samuel Rota Bulò, Lorenzo Porzi, Peter Kontschieder, Deva Ramanan, Michael Zollhöfer, Christian Richardt PDF ↗
IPoD: Implicit Field Learning with Point Diffusion for Generalizable 3D Object Reconstruction from Single RGB-D Images
Highlight Yushuang Wu, Luyue Shi, Junhao Cai, Weihao Yuan, Lingteng Qiu, Zilong Dong, Liefeng Bo, Shuguang Cui, Xiaoguang Han PDF ↗
IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection
Highlight Junbo Yin, Jianbing Shen, Runnan Chen, Wei Li, Ruigang Yang, Pascal Frossard, Wenguan Wang PDF ↗
Image Neural Field Diffusion Models
Highlight Yinbo Chen, Oliver Wang, Richard Zhang, Eli Shechtman, Xiaolong Wang, Michael Gharbi PDF ↗
ImageNet-D: Benchmarking Neural Network Robustness on Diffusion Synthetic Object
Highlight Chenshuang Zhang, Fei Pan, Junmo Kim, In So Kweon, Chengzhi Mao PDF ↗
Implicit Event-RGBD Neural SLAM
Highlight Delin Qu, Chi Yan, Dong Wang, Jie Yin, Qizhi Chen, Dan Xu, Yiting Zhang, Bin Zhao, Xuelong Li arXiv ↗ PDF ↗
Improved Baselines with Visual Instruction Tuning
Highlight Haotian Liu, Chunyuan Li, Yuheng Li, Yong Jae Lee arXiv ↗ PDF ↗
In-Context Matting
Highlight He Guo, Zixuan Ye, Zhiguo Cao, Hao Lu arXiv ↗ PDF ↗
Insect-Foundation: A Foundation Model and Large-scale 1M Dataset for Visual Insect Understanding
Highlight Hoang-Quan Nguyen, Thanh-Dat Truong, Xuan Bac Nguyen, Ashley Dowling, Xin Li, Khoa Luu PDF ↗
Investigating Compositional Challenges in Vision-Language Models for Visual Grounding
Highlight Yunan Zeng, Yan Huang, Jinjin Zhang, Zequn Jie, Zhenhua Chai, Liang Wang PDF ↗
Jack of All Tasks Master of Many: Designing General-Purpose Coarse-to-Fine Vision-Language Model
Highlight Shraman Pramanick, Guangxing Han, Rui Hou, Sayan Nag, Ser-Nam Lim, Nicolas Ballas, Qifan Wang, Rama Chellappa, Amjad Almahairi arXiv ↗ PDF ↗
Koala: Key Frame-Conditioned Long Video-LLM
Highlight Reuben Tan, Ximeng Sun, Ping Hu, Jui-hsien Wang, Hanieh Deilamsalehy, Bryan A. Plummer, Bryan Russell, Kate Saenko arXiv ↗ PDF ↗
LORS: Low-rank Residual Structure for Parameter-Efficient Network Stacking
Highlight Jialin Li, Qiang Nie, Weifu Fu, Yuhuan Lin, Guangpin Tao, Yong Liu, Chengjie Wang arXiv ↗ PDF ↗
LUWA Dataset: Learning Lithic Use-Wear Analysis on Microscopic Images
Highlight Jing Zhang, Irving Fang, Hao Wu, Akshat Kaushik, Alice Rodriguez, Hanwen Zhao, Juexiao Zhang, Zhuo Zheng, Radu Iovita, Chen Feng arXiv ↗ PDF ↗
LangSplat: 3D Language Gaussian Splatting
Highlight Minghan Qin, Wanhua Li, Jiawei Zhou, Haoqian Wang, Hanspeter Pfister arXiv ↗ PDF ↗
Latent Modulated Function for Computational Optimal Continuous Image Representation
Highlight Zongyao He, Zhi Jin arXiv ↗ PDF ↗
LeGO: Leveraging a Surface Deformation Network for Animatable Stylized Face Generation with One Example
Highlight Soyeon Yoon, Kwan Yun, Kwanggyoon Seo, Sihun Cha, Jung Eun Yoo, Junyong Noh arXiv ↗ PDF ↗
Learning Adaptive Spatial Coherent Correlations for Speech-Preserving Facial Expression Manipulation
Highlight Tianshui Chen, Jianman Lin, Zhijing Yang, Chunmei Qing, Liang Lin PDF ↗
Learning Diffusion Texture Priors for Image Restoration
Highlight Tian Ye, Sixiang Chen, Wenhao Chai, Zhaohu Xing, Jing Qin, Ge Lin, Lei Zhu PDF ↗
Learning without Exact Guidance: Updating Large-scale High-resolution Land Cover Maps from Low-resolution Historical Labels
Highlight Zhuohong Li, Wei He, Jiepan Li, Fangxiao Lu, Hongyan Zhang arXiv ↗ PDF ↗
LiSA: LiDAR Localization with Semantic Awareness
Highlight Bochun Yang, Zijun Li, Wen Li, Zhipeng Cai, Chenglu Wen, Yu Zang, Matthias Muller, Cheng Wang PDF ↗
LidaRF: Delving into Lidar for Neural Radiance Field on Street Scenes
Highlight Shanlin Sun, Bingbing Zhuang, Ziyu Jiang, Buyu Liu, Xiaohui Xie, Manmohan Chandraker arXiv ↗ PDF ↗
LiveHPS: LiDAR-based Scene-level Human Pose and Shape Estimation in Free Environment
Highlight Yiming Ren, Xiao Han, Chengfeng Zhao, Jingya Wang, Lan Xu, Jingyi Yu, Yuexin Ma arXiv ↗ PDF ↗
Living Scenes: Multi-object Relocalization and Reconstruction in Changing 3D Environments
Highlight Liyuan Zhu, Shengyu Huang, Konrad Schindler, Iro Armeni arXiv ↗ PDF ↗
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
Highlight Dongkai Wang, Shiyu Xuan, Shiliang Zhang PDF ↗
Logit Standardization in Knowledge Distillation
Highlight Shangquan Sun, Wenqi Ren, Jingzhi Li, Rui Wang, Xiaochun Cao arXiv ↗ PDF ↗
Look-Up Table Compression for Efficient Image Restoration
Highlight Yinglong Li, Jiacheng Li, Zhiwei Xiong PDF ↗
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
Highlight Zihan Wang, Xiangyang Li, Jiahao Yang, Yeqi Liu, Junjie Hu, Ming Jiang, Shuqiang Jiang arXiv ↗ PDF ↗
LucidDreamer: Towards High-Fidelity Text-to-3D Generation via Interval Score Matching
Highlight Yixun Liang, Xin Yang, Jiantao Lin, Haodong Li, Xiaogang Xu, Yingcong Chen arXiv ↗ PDF ↗
M&M VTO: Multi-Garment Virtual Try-On and Editing
Highlight Luyang Zhu, Yingwei Li, Nan Liu, Hao Peng, Dawei Yang, Ira Kemelmacher-Shlizerman PDF ↗
MCD: Diverse Large-Scale Multi-Campus Dataset for Robot Perception
Highlight Thien-Minh Nguyen, Shenghai Yuan, Thien Hoang Nguyen, Pengyu Yin, Haozhi Cao, Lihua Xie, Maciej Wozniak, Patric Jensfelt, Marko Thiel, Justin Ziegenbein, Noel Blunder arXiv ↗ PDF ↗
MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
Highlight Dewei Zhou, You Li, Fan Ma, Xiaoting Zhang, Yi Yang arXiv ↗ PDF ↗
MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning
Highlight Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang PDF ↗
MMM: Generative Masked Motion Model
Highlight Ekkasit Pinyoanuntapong, Pu Wang, Minwoo Lee, Chen Chen arXiv ↗ PDF ↗
MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos
Highlight Jielin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar, Karthik Mittal, Claire Jin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Ding Zhao, Bo Li, Lijuan Wang arXiv ↗ PDF ↗
MTLoRA: Low-Rank Adaptation Approach for Efficient Multi-Task Learning
Highlight Ahmed Agiza, Marina Neseem, Sherief Reda PDF ↗
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
Highlight Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Luo, Limin Wang, Yu Qiao arXiv ↗ PDF ↗
Map-Relative Pose Regression for Visual Re-Localization
Highlight Shuai Chen, Tommaso Cavallari, Victor Adrian Prisacariu, Eric Brachmann arXiv ↗ PDF ↗
Masked Autoencoders for Microscopy are Scalable Learners of Cellular Biology
Highlight Oren Kraus, Kian Kenyon-Dean, Saber Saberian, Maryam Fallah, Peter McLean, Jess Leung, Vasudev Sharma, Ayla Khan, Jia Balakrishnan, Safiye Celik, Dominique Beaini, Maciej Sypetkowski, Chi Vicky Cheng, Kristen Morse, Maureen Makes, Ben Mabey, Berton Earnshaw arXiv ↗ PDF ↗
Matching Anything by Segmenting Anything
Highlight Siyuan Li, Lei Ke, Martin Danelljan, Luigi Piccinelli, Mattia Segu, Luc Van Gool, Fisher Yu PDF ↗
MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models
Highlight Sanjoy Chowdhury, Sayan Nag, K J Joseph, Balaji Vasan Srinivasan, Dinesh Manocha PDF ↗
MemoNav: Working Memory Model for Visual Navigation
Highlight Hongxin Li, Zeyu Wang, Xu Yang, Yuran Yang, Shuqi Mei, Zhaoxiang Zhang arXiv ↗ PDF ↗
MeshGPT: Generating Triangle Meshes with Decoder-Only Transformers
Highlight Yawar Siddiqui, Antonio Alliegro, Alexey Artemov, Tatiana Tommasi, Daniele Sirigatti, Vladislav Rosov, Angela Dai, Matthias Nießner arXiv ↗ PDF ↗
MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation
Highlight Yanhui Wang, Jianmin Bao, Wenming Weng, Ruoyu Feng, Dacheng Yin, Tao Yang, Jingxu Zhang, Qi Dai, Zhiyuan Zhao, Chunyu Wang, Kai Qiu, Yuhui Yuan, Xiaoyan Sun, Chong Luo, Baining Guo arXiv ↗ PDF ↗
MindBridge: A Cross-Subject Brain Decoding Framework
Highlight Shizun Wang, Songhua Liu, Zhenxiong Tan, Xinchao Wang arXiv ↗ PDF ↗
MirageRoom: 3D Scene Segmentation with 2D Pre-trained Models by Mirage Projection
Highlight Haowen Sun, Yueqi Duan, Juncheng Yan, Yifan Liu, Jiwen Lu PDF ↗
Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding
Highlight Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, Lidong Bing arXiv ↗ PDF ↗
Modality-Agnostic Structural Image Representation Learning for Deformable Multi-Modality Medical Image Registration
Highlight Tony C. W. Mok, Zi Li, Yunhao Bai, Jianpeng Zhang, Wei Liu, Yan-Jie Zhou, Ke Yan, Dakai Jin, Yu Shi, Xiaoli Yin, Le Lu, Ling Zhang arXiv ↗ PDF ↗
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
Highlight Zhang Li, Biao Yang, Qiang Liu, Zhiyin Ma, Shuo Zhang, Jingxu Yang, Yabo Sun, Yuliang Liu, Xiang Bai arXiv ↗ PDF ↗
MonoNPHM: Dynamic Head Reconstruction from Monocular Videos
Highlight Simon Giebenhain, Tobias Kirschstein, Markos Georgopoulos, Martin Rünz, Lourdes Agapito, Matthias Nießner arXiv ↗ PDF ↗
Move as You Say Interact as You Can: Language-guided Human Motion Generation with Scene Affordance
Highlight Zan Wang, Yixin Chen, Baoxiong Jia, Puhao Li, Jinlu Zhang, Jingze Zhang, Tengyu Liu, Yixin Zhu, Wei Liang, Siyuan Huang arXiv ↗ PDF ↗
Mudslide: A Universal Nuclear Instance Segmentation Method
Highlight Jun Wang PDF ↗
Multi-Scale Video Anomaly Detection by Multi-Grained Spatio-Temporal Representation Learning
Highlight Menghao Zhang, Jingyu Wang, Qi Qi, Haifeng Sun, Zirui Zhuang, Pengfei Ren, Ruilong Ma, Jianxin Liao PDF ↗
Multi-agent Long-term 3D Human Pose Forecasting via Interaction-aware Trajectory Conditioning
Highlight Jaewoo Jeong, Daehee Park, Kuk-Jin Yoon arXiv ↗ PDF ↗
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
Highlight Junwen He, Yifan Wang, Lijun Wang, Huchuan Lu, Jun-Yan He, Jin-Peng Lan, Bin Luo, Xuansong Xie arXiv ↗ PDF ↗
Multi-view Aggregation Network for Dichotomous Image Segmentation
Highlight Qian Yu, Xiaoqi Zhao, Youwei Pang, Lihe Zhang, Huchuan Lu arXiv ↗ PDF ↗
MuseChat: A Conversational Music Recommendation System for Videos
Highlight Zhikang Dong, Xiulong Liu, Bin Chen, Pawel Polak, Peng Zhang arXiv ↗ PDF ↗
NC-TTT: A Noise Constrastive Approach for Test-Time Training
Highlight David Osowiechi, Gustavo A. Vargas Hakim, Mehrdad Noori, Milad Cheraghalikhani, Ali Bahri, Moslem Yazdanpanah, Ismail Ben Ayed, Christian Desrosiers PDF ↗
NRDF: Neural Riemannian Distance Fields for Learning Articulated Pose Priors
Highlight Yannan He, Garvita Tiwari, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll arXiv ↗ PDF ↗
Navigate Beyond Shortcuts: Debiased Learning Through the Lens of Neural Collapse
Highlight Yining Wang, Junjie Sun, Chenyue Wang, Mi Zhang, Min Yang arXiv ↗ PDF ↗
NeISF: Neural Incident Stokes Field for Geometry and Material Estimation
Highlight Chenhao Li, Taishi Ono, Takeshi Uemori, Hajime Mihara, Alexander Gatto, Hajime Nagahara, Yusuke Moriuchi arXiv ↗ PDF ↗
NeuRAD: Neural Rendering for Autonomous Driving
Highlight Adam Tonderski, Carl Lindström, Georg Hess, William Ljungbergh, Lennart Svensson, Christoffer Petersson PDF ↗
Neural Directional Encoding for Efficient and Accurate View-Dependent Appearance Modeling
Highlight Liwen Wu, Sai Bi, Zexiang Xu, Fujun Luan, Kai Zhang, Iliyan Georgiev, Kalyan Sunkavalli, Ravi Ramamoorthi arXiv ↗ PDF ↗
No Time to Train: Empowering Non-Parametric Networks for Few-shot 3D Scene Segmentation
Highlight Xiangyang Zhu, Renrui Zhang, Bowei He, Ziyu Guo, Jiaming Liu, Han Xiao, Chaoyou Fu, Hao Dong, Peng Gao arXiv ↗ PDF ↗
Novel Class Discovery for Ultra-Fine-Grained Visual Categorization
Highlight Yu Liu, Yaqi Cai, Qi Jia, Binglin Qiu, Weimin Wang, Nan Pu arXiv ↗ PDF ↗
ODIN: A Single Model for 2D and 3D Segmentation
Highlight Ayush Jain, Pushkal Katara, Nikolaos Gkanatsios, Adam W. Harley, Gabriel Sarch, Kriti Aggarwal, Vishrav Chaudhary, Katerina Fragkiadaki arXiv ↗ PDF ↗
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
Highlight Qidong Huang, Xiaoyi Dong, Pan Zhang, Bin Wang, Conghui He, Jiaqi Wang, Dahua Lin, Weiming Zhang, Nenghai Yu arXiv ↗ PDF ↗
Object Pose Estimation via the Aggregation of Diffusion Features
Highlight Tianfu Wang, Guosheng Hu, Hongguang Wang arXiv ↗ PDF ↗
Object Recognition as Next Token Prediction
Highlight Kaiyu Yue, Bor-Chun Chen, Jonas Geiping, Hengduo Li, Tom Goldstein, Ser-Nam Lim arXiv ↗ PDF ↗
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
Highlight Jialin Wu, Xia Hu, Yaqing Wang, Bo Pang, Radu Soricut PDF ↗
On the Estimation of Image-matching Uncertainty in Visual Place Recognition
Highlight Mubariz Zaffar, Liangliang Nan, Julian F. P. Kooij arXiv ↗ PDF ↗
One-dimensional Adapter to Rule Them All: Concepts Diffusion Models and Erasing Applications
Highlight Mengyao Lyu, Yuhong Yang, Haiwen Hong, Hui Chen, Xuan Jin, Yuan He, Hui Xue, Jungong Han, Guiguang Ding arXiv ↗ PDF ↗
OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning
Highlight Lingyi Hong, Shilin Yan, Renrui Zhang, Wanyun Li, Xinyu Zhou, Pinxue Guo, Kaixun Jiang, Yiting Chen, Jinglun Li, Zhaoyu Chen, Wenqiang Zhang arXiv ↗ PDF ↗
Open-Vocabulary 3D Semantic Segmentation with Foundation Models
Highlight Li Jiang, Shaoshuai Shi, Bernt Schiele PDF ↗
Open-Vocabulary Object 6D Pose Estimation
Highlight Jaime Corsetti, Davide Boscaini, Changjae Oh, Andrea Cavallaro, Fabio Poiesi arXiv ↗ PDF ↗
OpenBias: Open-set Bias Detection in Text-to-Image Generative Models
Highlight Moreno D'Incà, Elia Peruzzo, Massimiliano Mancini, Dejia Xu, Vidit Goel, Xingqian Xu, Zhangyang Wang, Humphrey Shi, Nicu Sebe PDF ↗
OpenESS: Event-based Semantic Scene Understanding with Open Vocabularies
Highlight Lingdong Kong, Youquan Liu, Lai Xing Ng, Benoit R. Cottereau, Wei Tsang Ooi arXiv ↗ PDF ↗
OrCo: Towards Better Generalization via Orthogonality and Contrast for Few-Shot Class-Incremental Learning
Highlight Noor Ahmed, Anna Kukleva, Bernt Schiele arXiv ↗ PDF ↗
Orthogonal Adaptation for Modular Customization of Diffusion Models
Highlight Ryan Po, Guandao Yang, Kfir Aberman, Gordon Wetzstein arXiv ↗ PDF ↗
Outdoor Scene Extrapolation with Hierarchical Generative Cellular Automata
Highlight Dongsu Zhang, Francis Williams, Zan Gojcic, Karsten Kreis, Sanja Fidler, Young Min Kim, Amlan Kar PDF ↗
PAPR in Motion: Seamless Point-level 3D Scene Interpolation
Highlight Shichong Peng, Yanshu Zhang, Ke Li PDF ↗
PIGEON: Predicting Image Geolocations
Highlight Lukas Haas, Michal Skreta, Silas Alberti, Chelsea Finn arXiv ↗ PDF ↗
PLACE: Adaptive Layout-Semantic Fusion for Semantic Image Synthesis
Highlight Zhengyao Lv, Yuxiang Wei, Wangmeng Zuo, Kwan-Yee K. Wong arXiv ↗ PDF ↗
PanoPose: Self-supervised Relative Pose Estimation for Panoramic Images
Highlight Diantao Tu, Hainan Cui, Xianwei Zheng, Shuhan Shen PDF ↗
PerceptionGPT: Effectively Fusing Visual Perception into LLM
Highlight Renjie Pi, Lewei Yao, Jiahui Gao, Jipeng Zhang, Tong Zhang arXiv ↗ PDF ↗
PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI
Highlight Yandan Yang, Baoxiong Jia, Peiyuan Zhi, Siyuan Huang arXiv ↗ PDF ↗
PhysGaussian: Physics-Integrated 3D Gaussians for Generative Dynamics
Highlight Tianyi Xie, Zeshun Zong, Yuxing Qiu, Xuan Li, Yutao Feng, Yin Yang, Chenfanfu Jiang arXiv ↗ PDF ↗
Point2CAD: Reverse Engineering CAD Models from 3D Point Clouds
Highlight Yujia Liu, Anton Obukhov, Jan Dirk Wegner, Konrad Schindler arXiv ↗ PDF ↗
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
Highlight Yuiga Wada, Kanta Kaneda, Daichi Saito, Komei Sugiura arXiv ↗ PDF ↗
Pose-Guided Self-Training with Two-Stage Clustering for Unsupervised Landmark Discovery
Highlight Siddharth Tourani, Ahmed Alwheibi, Arif Mahmood, Muhammad Haris Khan arXiv ↗ PDF ↗
Predicated Diffusion: Predicate Logic-Based Attention Guidance for Text-to-Image Diffusion Models
Highlight Kota Sueyoshi, Takashi Matsubara arXiv ↗ PDF ↗
Programmable Motion Generation for Open-Set Motion Control Tasks
Highlight Hanchao Liu, Xiaohang Zhan, Shaoli Huang, Tai-Jiang Mu, Ying Shan arXiv ↗ PDF ↗
Progressive Divide-and-Conquer via Subsampling Decomposition for Accelerated MRI
Highlight Chong Wang, Lanqing Guo, Yufei Wang, Hao Cheng, Yi Yu, Bihan Wen arXiv ↗ PDF ↗
Putting the Object Back into Video Object Segmentation
Highlight Ho Kei Cheng, Seoung Wug Oh, Brian Price, Joon-Young Lee, Alexander Schwing arXiv ↗ PDF ↗
QUADify: Extracting Meshes with Pixel-level Details and Materials from Images
Highlight Maximilian Frühauf, Hayko Riemenschneider, Markus Gross, Christopher Schroers PDF ↗
Question Aware Vision Transformer for Multimodal Reasoning
Highlight Roy Ganz, Yair Kittenplon, Aviad Aberdam, Elad Ben Avraham, Oren Nuriel, Shai Mazor, Ron Litman arXiv ↗ PDF ↗
RAVE: Randomized Noise Shuffling for Fast and Consistent Video Editing with Diffusion Models
Highlight Ozgur Kara, Bariscan Kurtkaya, Hidir Yesiltepe, James M. Rehg, Pinar Yanardag arXiv ↗ PDF ↗
Rapid 3D Model Generation with Intuitive 3D Input
Highlight Tianrun Chen, Chaotao Ding, Shangzhan Zhang, Chunan Yu, Ying Zang, Zejian Li, Sida Peng, Lingyun Sun PDF ↗
Readout Guidance: Learning Control from Diffusion Features
Highlight Grace Luo, Trevor Darrell, Oliver Wang, Dan B Goldman, Aleksander Holynski arXiv ↗ PDF ↗
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
Highlight Ziyang Chen, Israel D. Gebru, Christian Richardt, Anurag Kumar, William Laney, Andrew Owens, Alexander Richard arXiv ↗ PDF ↗
Real-Time Simulated Avatar from Head-Mounted Sensors
Highlight Zhengyi Luo, Jinkun Cao, Rawal Khirodkar, Alexander Winkler, Kris Kitani, Weipeng Xu arXiv ↗ PDF ↗
Real-time 3D-aware Portrait Video Relighting
Highlight Ziqi Cai, Kaiwen Jiang, Shu-Yu Chen, Yu-Kun Lai, Hongbo Fu, Boxin Shi, Lin Gao PDF ↗
Referring Expression Counting
Highlight Siyang Dai, Jun Liu, Ngai-Man Cheung PDF ↗
Relightable and Animatable Neural Avatar from Sparse-View Video
Highlight Zhen Xu, Sida Peng, Chen Geng, Linzhan Mou, Zihan Yan, Jiaming Sun, Hujun Bao, Xiaowei Zhou arXiv ↗ PDF ↗
Residual Learning in Diffusion Models
Highlight Junyu Zhang, Daochang Liu, Eunbyung Park, Shichao Zhang, Chang Xu PDF ↗
Restoration by Generation with Constrained Priors
Highlight Zheng Ding, Xuaner Zhang, Zhuowen Tu, Zhihao Xia arXiv ↗ PDF ↗
Rethinking FID: Towards a Better Evaluation Metric for Image Generation
Highlight Sadeep Jayasumana, Srikumar Ramalingam, Andreas Veit, Daniel Glasner, Ayan Chakrabarti, Sanjiv Kumar arXiv ↗ PDF ↗
Rethinking Generalizable Face Anti-spoofing via Hierarchical Prototype-guided Distribution Refinement in Hyperbolic Space
Highlight Chengyang Hu, Ke-Yue Zhang, Taiping Yao, Shouhong Ding, Lizhuang Ma PDF ↗
RichDreamer: A Generalizable Normal-Depth Diffusion Model for Detail Richness in Text-to-3D
Highlight Lingteng Qiu, Guanying Chen, Xiaodong Gu, Qi Zuo, Mutian Xu, Yushuang Wu, Weihao Yuan, Zilong Dong, Liefeng Bo, Xiaoguang Han arXiv ↗ PDF ↗
RobustSAM: Segment Anything Robustly on Degraded Images
Highlight Wei-Ting Chen, Yu-Jiet Vong, Sy-Yen Kuo, Sizhou Ma, Jian Wang PDF ↗
SCEdit: Efficient and Controllable Image Diffusion Generation via Skip Connection Editing
Highlight Zeyinzi Jiang, Chaojie Mao, Yulin Pan, Zhen Han, Jingfeng Zhang arXiv ↗ PDF ↗
SCINeRF: Neural Radiance Fields from a Snapshot Compressive Image
Highlight Yunhao Li, Xiaodong Wang, Ping Wang, Xin Yuan, Peidong Liu arXiv ↗ PDF ↗
SDDGR: Stable Diffusion-based Deep Generative Replay for Class Incremental Object Detection
Highlight Junsu Kim, Hoseong Cho, Jihyeon Kim, Yihalem Yimolal Tiruneh, Seungryul Baek arXiv ↗ PDF ↗
SG-BEV: Satellite-Guided BEV Fusion for Cross-View Semantic Segmentation
Highlight Junyan Ye, Qiyan Luo, Jinhua Yu, Huaping Zhong, Zhimeng Zheng, Conghui He, Weijia Li PDF ↗
SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object Detection
Highlight Mingxuan Liu, Tyler L. Hayes, Elisa Ricci, Gabriela Csurka, Riccardo Volpi arXiv ↗ PDF ↗
SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction
Highlight Zechuan Zhang, Zongxin Yang, Yi Yang arXiv ↗ PDF ↗
SLICE: Stabilized LIME for Consistent Explanations for Image Classification
Highlight Revoti Prasad Bora, Philipp Terhörst, Raymond Veldhuis, Raghavendra Ramachandra, Kiran Raja PDF ↗
SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers
Highlight Ioannis Kakogeorgiou, Spyros Gidaris, Konstantinos Karantzalos, Nikos Komodakis arXiv ↗ PDF ↗
SVDinsTN: A Tensor Network Paradigm for Efficient Structure Search from Regularized Modeling Perspective
Highlight Yu-Bang Zheng, Xi-Le Zhao, Junhua Zeng, Chao Li, Qibin Zhao, Heng-Chao Li, Ting-Zhu Huang arXiv ↗ PDF ↗
Sat2Scene: 3D Urban Scene Generation from Satellite Images with Diffusion
Highlight Zuoyue Li, Zhenqiang Li, Zhaopeng Cui, Marc Pollefeys, Martin R. Oswald arXiv ↗ PDF ↗
Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering
Highlight Tao Lu, Mulin Yu, Linning Xu, Yuanbo Xiangli, Limin Wang, Dahua Lin, Bo Dai PDF ↗
Scaling Up Dynamic Human-Scene Interaction Modeling
Highlight Nan Jiang, Zhiyuan Zhang, Hongjie Li, Xiaoxuan Ma, Zan Wang, Yixin Chen, Tengyu Liu, Yixin Zhu, Siyuan Huang arXiv ↗ PDF ↗
SceneTex: High-Quality Texture Synthesis for Indoor Scenes via Diffusion Priors
Highlight Dave Zhenyu Chen, Haoxuan Li, Hsin-Ying Lee, Sergey Tulyakov, Matthias Nießner arXiv ↗ PDF ↗
Selective-Stereo: Adaptive Frequency Information Selection for Stereo Matching
Highlight Xianqi Wang, Gangwei Xu, Hao Jia, Xin Yang PDF ↗
Self-Supervised Dual Contouring
Highlight Ramana Sundararaman, Roman Klokov, Maks Ovsjanikov arXiv ↗ PDF ↗
Self-Supervised Multi-Object Tracking with Path Consistency
Highlight Zijia Lu, Bing Shuai, Yanbei Chen, Zhenlin Xu, Davide Modolo arXiv ↗ PDF ↗
Semantic-aware SAM for Point-Prompted Instance Segmentation
Highlight Zhaoyang Wei, Pengfei Chen, Xuehui Yu, Guorong Li, Jianbin Jiao, Zhenjun Han arXiv ↗ PDF ↗
SleepVST: Sleep Staging from Near-Infrared Video Signals using Pre-Trained Transformers
Highlight Jonathan F. Carter, João Jorge, Oliver Gibson, Lionel Tarassenko arXiv ↗ PDF ↗
SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models
Highlight Yuzhou Huang, Liangbin Xie, Xintao Wang, Ziyang Yuan, Xiaodong Cun, Yixiao Ge, Jiantao Zhou, Chao Dong, Rui Huang, Ruimao Zhang, Ying Shan arXiv ↗ PDF ↗
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
Highlight Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov, Ekaterina Deyneka, Tsai-Shien Chen, Anil Kag, Yuwei Fang, Aleksei Stoliar, Elisa Ricci, Jian Ren, Sergey Tulyakov arXiv ↗ PDF ↗
Spatial-Aware Regression for Keypoint Localization
Highlight Dongkai Wang, Shiliang Zhang PDF ↗
SpatialTracker: Tracking Any 2D Pixels in 3D Space
Highlight Yuxi Xiao, Qianqian Wang, Shangzhan Zhang, Nan Xue, Sida Peng, Yujun Shen, Xiaowei Zhou arXiv ↗ PDF ↗
SpecNeRF: Gaussian Directional Encoding for Specular Reflections
Highlight Li Ma, Vasu Agrawal, Haithem Turki, Changil Kim, Chen Gao, Pedro Sander, Michael Zollhöfer, Christian Richardt arXiv ↗ PDF ↗
Spectral and Polarization Vision: Spectro-polarimetric Real-world Dataset
Highlight Yujin Jeon, Eunsue Choi, Youngchan Kim, Yunseong Moon, Khalid Omer, Felix Heide, Seung-Hwan Baek arXiv ↗ PDF ↗
Stationary Representations: Optimally Approximating Compatibility and Implications for Improved Model Replacements
Highlight Niccolò Biondi, Federico Pernici, Simone Ricci, Alberto Del Bimbo arXiv ↗ PDF ↗
StreamingFlow: Streaming Occupancy Forecasting with Asynchronous Multi-modal Data Streams via Neural Ordinary Differential Equation
Highlight Yining Shi, Kun Jiang, Ke Wang, Jiusi Li, Yunlong Wang, Mengmeng Yang, Diange Yang PDF ↗
Strong Transferable Adversarial Attacks via Ensembled Asymptotically Normal Distribution Learning
Highlight Zhengwei Fang, Rui Wang, Tao Huang, Liping Jing arXiv ↗ PDF ↗
Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style Transfer
Highlight Jiwoo Chung, Sangeek Hyun, Jae-Pil Heo arXiv ↗ PDF ↗
Suppress and Rebalance: Towards Generalized Multi-Modal Face Anti-Spoofing
Highlight Xun Lin, Shuai Wang, Rizhao Cai, Yizhong Liu, Ying Fu, Wenzhong Tang, Zitong Yu, Alex Kot arXiv ↗ PDF ↗
SurroundSDF: Implicit 3D Scene Understanding Based on Signed Distance Field
Highlight Lizhe Liu, Bohua Wang, Hongwei Xie, Daqi Liu, Li Liu, Zhiqiang Tian, Kuiyuan Yang, Bing Wang arXiv ↗ PDF ↗
SwitchLight: Co-design of Physics-driven Architecture and Pre-training Framework for Human Portrait Relighting
Highlight Hoon Kim, Minje Jang, Wonjun Yoon, Jisoo Lee, Donghyun Na, Sanghyun Woo arXiv ↗ PDF ↗
TFMQ-DM: Temporal Feature Maintenance Quantization for Diffusion Models
Highlight Yushi Huang, Ruihao Gong, Jing Liu, Tianlong Chen, Xianglong Liu PDF ↗
Tackling the Singularities at the Endpoints of Time Intervals in Diffusion Models
Highlight Pengze Zhang, Hubery Yin, Chen Li, Xiaohua Xie arXiv ↗ PDF ↗
Taming Stable Diffusion for Text to 360 Panorama Image Generation
Highlight Cheng Zhang, Qianyi Wu, Camilo Cruz Gambardella, Xiaoshui Huang, Dinh Phung, Wanli Ouyang, Jianfei Cai PDF ↗
Task2Box: Box Embeddings for Modeling Asymmetric Task Relationships
Highlight Rangel Daroya, Aaron Sun, Subhransu Maji arXiv ↗ PDF ↗
Template Free Reconstruction of Human-object Interaction with Procedural Interaction Generation
Highlight Xianghui Xie, Bharat Lal Bhatnagar, Jan Eric Lenssen, Gerard Pons-Moll arXiv ↗ PDF ↗
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
Highlight Jiamian Wang, Guohao Sun, Pichao Wang, Dongfang Liu, Sohail Dianat, Majid Rabbani, Raghuveer Rao, Zhiqiang Tao arXiv ↗ PDF ↗
The Devil is in the Fine-Grained Details: Evaluating Open-Vocabulary Object Detectors for Fine-Grained Understanding
Highlight Lorenzo Bianchi, Fabio Carrara, Nicola Messina, Claudio Gennaro, Fabrizio Falchi arXiv ↗ PDF ↗
The More You See in 2D the More You Perceive in 3D
Highlight Xinyang Han, Zelin Gao, Angjoo Kanazawa, Shubham Goel, Yossi Gandelsman arXiv ↗ PDF ↗
The Unreasonable Effectiveness of Pre-Trained Features for Camera Pose Refinement
Highlight Gabriele Trivigno, Carlo Masone, Barbara Caputo, Torsten Sattler arXiv ↗ PDF ↗
Time- Memory- and Parameter-Efficient Visual Adaptation
Highlight Otniel-Bogdan Mercea, Alexey Gritsenko, Cordelia Schmid, Anurag Arnab PDF ↗
Total Selfie: Generating Full-Body Selfies
Highlight Bowei Chen, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz arXiv ↗ PDF ↗
Total-Decom: Decomposed 3D Scene Reconstruction with Minimal Interaction
Highlight Xiaoyang Lyu, Chirui Chang, Peng Dai, Yang-Tian Sun, Xiaojuan Qi PDF ↗
Towards Accurate Post-training Quantization for Diffusion Models
Highlight Changyuan Wang, Ziwei Wang, Xiuwei Xu, Yansong Tang, Jie Zhou, Jiwen Lu arXiv ↗ PDF ↗
Towards Learning a Generalist Model for Embodied Navigation
Highlight Duo Zheng, Shijia Huang, Lin Zhao, Yiwu Zhong, Liwei Wang arXiv ↗ PDF ↗
Towards a Simultaneous and Granular Identity-Expression Control in Personalized Face Generation
Highlight Renshuai Liu, Bowen Ma, Wei Zhang, Zhipeng Hu, Changjie Fan, Tangjie Lv, Yu Ding, Xuan Cheng arXiv ↗ PDF ↗
Transductive Zero-Shot and Few-Shot CLIP
Highlight Ségolène Martin, Yunshi Huang, Fereshteh Shakeri, Jean-Christophe Pesquet, Ismail Ben Ayed arXiv ↗ PDF ↗
Tri-Modal Motion Retrieval by Learning a Joint Embedding Space
Highlight Kangning Yin, Shihao Zou, Yuxuan Ge, Zheng Tian arXiv ↗ PDF ↗
Tune-An-Ellipse: CLIP Has Potential to Find What You Want
Highlight Jinheng Xie, Songhe Deng, Bing Li, Haozhe Liu, Yawen Huang, Yefeng Zheng, Jurgen Schmidhuber, Bernard Ghanem, Linlin Shen, Mike Zheng Shou PDF ↗
TutteNet: Injective 3D Deformations by Composition of 2D Mesh Deformations
Highlight Bo Sun, Thibault Groueix, Chen Song, Qixing Huang, Noam Aigerman PDF ↗
Tyche: Stochastic In-Context Learning for Medical Image Segmentation
Highlight Marianne Rakic, Hallee E. Wong, Jose Javier Gonzalez Ortiz, Beth A. Cimini, John V. Guttag, Adrian V. Dalca arXiv ↗ PDF ↗
UFOGen: You Forward Once Large Scale Text-to-Image Generation via Diffusion GANs
Highlight Yanwu Xu, Yang Zhao, Zhisheng Xiao, Tingbo Hou arXiv ↗ PDF ↗
Unbiased Estimator for Distorted Conics in Camera Calibration
Highlight Chaehyeon Song, Jaeho Shin, Myung-Hwan Jeon, Jongwoo Lim, Ayoung Kim arXiv ↗ PDF ↗
Unbiased Faster R-CNN for Single-source Domain Generalized Object Detection
Highlight Yajing Liu, Shijun Zhou, Xiyao Liu, Chunhui Hao, Baojie Fan, Jiandong Tian PDF ↗
Uncertainty-aware Action Decoupling Transformer for Action Anticipation
Highlight Hongji Guo, Nakul Agarwal, Shao-Yuan Lo, Kwonjoon Lee, Qiang Ji PDF ↗
Understanding Video Transformers via Universal Concept Discovery
Highlight Matthew Kowal, Achal Dave, Rares Ambrus, Adrien Gaidon, Konstantinos G. Derpanis, Pavel Tokmakov arXiv ↗ PDF ↗
UniDepth: Universal Monocular Metric Depth Estimation
Highlight Luigi Piccinelli, Yung-Hsu Yang, Christos Sakaridis, Mattia Segu, Siyuan Li, Luc Van Gool, Fisher Yu arXiv ↗ PDF ↗
UniMODE: Unified Monocular 3D Object Detection
Highlight Zhuoling Li, Xiaogang Xu, SerNam Lim, Hengshuang Zhao arXiv ↗ PDF ↗
Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and Action
Highlight Jiasen Lu, Christopher Clark, Sangho Lee, Zichen Zhang, Savya Khosla, Ryan Marten, Derek Hoiem, Aniruddha Kembhavi arXiv ↗ PDF ↗
Unifying Correspondence Pose and NeRF for Generalized Pose-Free Novel View Synthesis
Highlight Sunghwan Hong, Jaewoo Jung, Heeseong Shin, Jiaolong Yang, Seungryong Kim, Chong Luo PDF ↗
Unsupervised Keypoints from Pretrained Diffusion Models
Highlight Eric Hedlin, Gopal Sharma, Shweta Mahajan, Xingzhe He, Hossam Isack, Abhishek Kar, Helge Rhodin, Andrea Tagliasacchi, Kwang Moo Yi arXiv ↗ PDF ↗
Unsupervised Occupancy Learning from Sparse Point Cloud
Highlight Amine Ouasfi, Adnane Boukhayma arXiv ↗ PDF ↗
Upscale-A-Video: Temporal-Consistent Diffusion Model for Real-World Video Super-Resolution
Highlight Shangchen Zhou, Peiqing Yang, Jianyi Wang, Yihang Luo, Chen Change Loy PDF ↗
VA3: Virtually Assured Amplification Attack on Probabilistic Copyright Protection for Text-to-Image Generative Models
Highlight Xiang Li, Qianli Shen, Kenji Kawaguchi arXiv ↗ PDF ↗
VBench: Comprehensive Benchmark Suite for Video Generative Models
Highlight Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, Yaohui Wang, Xinyuan Chen, Limin Wang, Dahua Lin, Yu Qiao, Ziwei Liu arXiv ↗ PDF ↗
VGGSfM: Visual Geometry Grounded Deep Structure From Motion
Highlight Jianyuan Wang, Nikita Karaev, Christian Rupprecht, David Novotny PDF ↗
VMINer: Versatile Multi-view Inverse Rendering with Near- and Far-field Light Sources
Highlight Fan Fei, Jiajun Tang, Ping Tan, Boxin Shi PDF ↗
VTimeLLM: Empower LLM to Grasp Video Moments
Highlight Bin Huang, Xin Wang, Hong Chen, Zihan Song, Wenwu Zhu arXiv ↗ PDF ↗
Vanishing-Point-Guided Video Semantic Segmentation of Driving Scenes
Highlight Diandian Guo, Deng-Ping Fan, Tongyu Lu, Christos Sakaridis, Luc Van Gool arXiv ↗ PDF ↗
VecFusion: Vector Font Generation with Diffusion
Highlight Vikas Thamizharasan, Difan Liu, Shantanu Agarwal, Matthew Fisher, Michael Gharbi, Oliver Wang, Alec Jacobson, Evangelos Kalogerakis arXiv ↗ PDF ↗
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
Highlight Chunlong Xia, Xinliang Wang, Feng Lv, Xin Hao, Yifeng Shi PDF ↗
ViVid-1-to-3: Novel View Synthesis with Video Diffusion Models
Highlight Jeong-gi Kwak, Erqun Dong, Yuhe Jin, Hanseok Ko, Shweta Mahajan, Kwang Moo Yi PDF ↗
View-Category Interactive Sharing Transformer for Incomplete Multi-View Multi-Label Learning
Highlight Shilong Ou, Zhe Xue, Yawen Li, Meiyu Liang, Yuanqiang Cai, Junjiang Wu PDF ↗
Visual Concept Connectome (VCC): Open World Concept Discovery and their Interlayer Connections in Deep Models
Highlight Matthew Kowal, Richard P. Wildes, Konstantinos G. Derpanis arXiv ↗ PDF ↗
Visual Objectification in Films: Towards a New AI Task for Video Interpretation
Highlight Julie Tores, Lucile Sassatelli, Hui-Yin Wu, Clement Bergman, Léa Andolfi, Victor Ecrement, Frédéric Precioso, Thierry Devars, Magali Guaresi, Virginie Julliard, Sarah Lecossais arXiv ↗ PDF ↗
Visual Point Cloud Forecasting enables Scalable Autonomous Driving
Highlight Zetong Yang, Li Chen, Yanan Sun, Hongyang Li arXiv ↗ PDF ↗
Volumetric Environment Representation for Vision-Language Navigation
Highlight Rui Liu, Wenguan Wang, Yi Yang arXiv ↗ PDF ↗
Wonder3D: Single Image to 3D using Cross-Domain Diffusion
Highlight Xiaoxiao Long, Yuan-Chen Guo, Cheng Lin, Yuan Liu, Zhiyang Dou, Lingjie Liu, Yuexin Ma, Song-Hai Zhang, Marc Habermann, Christian Theobalt, Wenping Wang arXiv ↗ PDF ↗
XCube: Large-Scale 3D Generative Modeling using Sparse Voxel Hierarchies
Highlight Xuanchi Ren, Jiahui Huang, Xiaohui Zeng, Ken Museth, Sanja Fidler, Francis Williams PDF ↗
Your Transferability Barrier is Fragile: Free-Lunch for Transferring the Non-Transferable Learning
Highlight Ziming Hong, Li Shen, Tongliang Liu PDF ↗
Zero-Shot Structure-Preserving Diffusion Model for High Dynamic Range Tone Mapping
Highlight Ruoxi Zhu, Shusong Xu, Peiye Liu, Sicheng Li, Yanheng Lu, Dimin Niu, Zihao Liu, Zihao Meng, Zhiyong Li, Xinhua Chen, Yibo Fan PDF ↗
eTraM: Event-based Traffic Monitoring Dataset
Highlight Aayush Atul Verma, Bharatesh Chakravarthi, Arpitsinh Vaghela, Hua Wei, Yezhou Yang arXiv ↗ PDF ↗
mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration
Highlight Qinghao Ye, Haiyang Xu, Jiabo Ye, Ming Yan, Anwen Hu, Haowei Liu, Qi Qian, Ji Zhang, Fei Huang PDF ↗
pix2gestalt: Amodal Segmentation by Synthesizing Wholes
Highlight Ege Ozguroglu, Ruoshi Liu, Dídac Surís, Dian Chen, Achal Dave, Pavel Tokmakov, Carl Vondrick PDF ↗

Posters 2,379 · page 1 of 12

1-Lipschitz Layers Compared: Memory Speed and Certifiable Robustness
Bernd Prach, Fabio Brau, Giorgio Buttazzo, Christoph H. Lampert PDF ↗
2S-UDF: A Novel Two-stage UDF Learning Method for Robust Non-watertight Model Reconstruction from Multi-view Images
Junkai Deng, Fei Hou, Xuhui Chen, Wencheng Wang, Ying He PDF ↗
360+x: A Panoptic Multi-modal Scene Understanding Dataset
Hao Chen, Yuqi Hou, Chenyuan Qu, Irene Testini, Xiaohan Hong, Jianbo Jiao PDF ↗
360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model
Qian Wang, Weiqi Li, Chong Mou, Xinhua Cheng, Jian Zhang arXiv ↗ PDF ↗
360Loc: A Dataset and Benchmark for Omnidirectional Visual Localization with Cross-device Queries
Huajian Huang, Changkun Liu, Yipeng Zhu, Hui Cheng, Tristan Braud, Sai-Kit Yeung arXiv ↗ PDF ↗
3D Building Reconstruction from Monocular Remote Sensing Images with Multi-level Supervisions
Weijia Li, Haote Yang, Zhenghao Hu, Juepeng Zheng, Gui-Song Xia, Conghui He arXiv ↗ PDF ↗
3D Face Tracking from 2D Video through Iterative Dense UV to Image Flow
Felix Taubner, Prashant Raina, Mathieu Tuli, Eu Wern Teh, Chul Lee, Jinmiao Huang arXiv ↗ PDF ↗
3D Facial Expressions through Analysis-by-Neural-Synthesis
George Retsinas, Panagiotis P. Filntisis, Radek Danecek, Victoria F. Abrevaya, Anastasios Roussos, Timo Bolkart, Petros Maragos arXiv ↗ PDF ↗
3D Feature Tracking via Event Camera
Siqi Li, Zhikuan Zhou, Zhou Xue, Yipeng Li, Shaoyi Du, Yue Gao PDF ↗
3D Geometry-Aware Deformable Gaussian Splatting for Dynamic View Synthesis
Zhicheng Lu, Xiang Guo, Le Hui, Tianrui Chen, Min Yang, Xiao Tang, Feng Zhu, Yuchao Dai arXiv ↗ PDF ↗
3D LiDAR Mapping in Dynamic Environments using a 4D Implicit Neural Representation
Xingguang Zhong, Yue Pan, Cyrill Stachniss, Jens Behley arXiv ↗ PDF ↗
3D Multi-frame Fusion for Video Stabilization
Zhan Peng, Xinyi Ye, Weiyue Zhao, Tianqi Liu, Huiqiang Sun, Baopu Li, Zhiguo Cao arXiv ↗ PDF ↗
3D Neural Edge Reconstruction
Lei Li, Songyou Peng, Zehao Yu, Shaohui Liu, Rémi Pautrat, Xiaochuan Yin, Marc Pollefeys arXiv ↗ PDF ↗
3D Paintbrush: Local Stylization of 3D Shapes with Cascaded Score Distillation
Dale Decatur, Itai Lang, Kfir Aberman, Rana Hanocka arXiv ↗ PDF ↗
3D-Aware Face Editing via Warping-Guided Latent Direction Learning
Yuhao Cheng, Zhuo Chen, Xingyu Ren, Wenhan Zhu, Zhengqin Xu, Di Xu, Changpeng Yang, Yichao Yan PDF ↗
3D-LFM: Lifting Foundation Model
Mosam Dabhi, László A. Jeni, Simon Lucey PDF ↗
3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation
Songchun Zhang, Yibo Zhang, Quan Zheng, Rui Ma, Wei Hua, Hujun Bao, Weiwei Xu, Changqing Zou PDF ↗
3DFIRES: Few Image 3D REconstruction for Scenes with Hidden Surfaces
Linyi Jin, Nilesh Kulkarni, David F. Fouhey arXiv ↗ PDF ↗
3DGS-Avatar: Animatable Avatars via Deformable 3D Gaussian Splatting
Zhiyin Qian, Shaofei Wang, Marko Mihajlovic, Andreas Geiger, Siyu Tang PDF ↗
3DSFLabelling: Boosting 3D Scene Flow Estimation by Pseudo Auto-labelling
Chaokang Jiang, Guangming Wang, Jiuming Liu, Hesheng Wang, Zhuang Ma, Zhenqiang Liu, Zhujin Liang, Yi Shan, Dalong Du arXiv ↗ PDF ↗
3DToonify: Creating Your High-Fidelity 3D Stylized Avatar Easily from 2D Portrait Images
Yifang Men, Hanxi Liu, Yuan Yao, Miaomiao Cui, Xuansong Xie, Zhouhui Lian PDF ↗
3DiffTection: 3D Object Detection with Geometry-Aware Diffusion Features
Chenfeng Xu, Huan Ling, Sanja Fidler, Or Litany arXiv ↗ PDF ↗
4D Gaussian Splatting for Real-Time Dynamic Scene Rendering
Guanjun Wu, Taoran Yi, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Qi Tian, Xinggang Wang arXiv ↗ PDF ↗
4D-fy: Text-to-4D Generation Using Hybrid Score Distillation Sampling
Sherwin Bahmani, Ivan Skorokhodov, Victor Rong, Gordon Wetzstein, Leonidas Guibas, Peter Wonka, Sergey Tulyakov, Jeong Joon Park, Andrea Tagliasacchi, David B. Lindell PDF ↗
4K4D: Real-Time 4D View Synthesis at 4K Resolution
Zhen Xu, Sida Peng, Haotong Lin, Guangzhao He, Jiaming Sun, Yujun Shen, Hujun Bao, Xiaowei Zhou arXiv ↗ PDF ↗
6D-Diff: A Keypoint Diffusion Framework for 6D Object Pose Estimation
Li Xu, Haoxuan Qu, Yujun Cai, Jun Liu PDF ↗
A Backpack Full of Skills: Egocentric Video Understanding with Diverse Task Perspectives
Simone Alberto Peirone, Francesca Pistilli, Antonio Alliegro, Giuseppe Averta arXiv ↗ PDF ↗
A Bayesian Approach to OOD Robustness in Image Classification
Prakhar Kaushik, Adam Kortylewski, Alan Yuille arXiv ↗ PDF ↗
A Call to Reflect on Evaluation Practices for Age Estimation: Comparative Analysis of the State-of-the-Art and a Unified Benchmark
Jakub Paplhám, Vojt?ch Franc PDF ↗
A Category Agnostic Model for Visual Rearrangment
Yuyi Liu, Xinhang Song, Weijie Li, Xiaohan Wang, Shuqiang Jiang PDF ↗
A Closer Look at the Few-Shot Adaptation of Large Vision-Language Models
Julio Silva-Rodríguez, Sina Hajimiri, Ismail Ben Ayed, Jose Dolz PDF ↗
A Conditional Denoising Diffusion Probabilistic Model for Point Cloud Upsampling
Wentao Qu, Yuantian Shao, Lingwu Meng, Xiaoshui Huang, Liang Xiao arXiv ↗ PDF ↗
A Dual-Augmentor Framework for Domain Generalization in 3D Human Pose Estimation
Qucheng Peng, Ce Zheng, Chen Chen arXiv ↗ PDF ↗
A Dynamic Kernel Prior Model for Unsupervised Blind Image Super-Resolution
Zhixiong Yang, Jingyuan Xia, Shengxi Li, Xinghua Huang, Shuanghui Zhang, Zhen Liu, Yaowen Fu, Yongxiang Liu arXiv ↗ PDF ↗
A General and Efficient Training for Transformer via Token Expansion
Wenxuan Huang, Yunhang Shen, Jiao Xie, Baochang Zhang, Gaoqi He, Ke Li, Xing Sun, Shaohui Lin arXiv ↗ PDF ↗
A Generative Approach for Wikipedia-Scale Visual Entity Recognition
Mathilde Caron, Ahmet Iscen, Alireza Fathi, Cordelia Schmid arXiv ↗ PDF ↗
A Noisy Elephant in the Room: Is Your Out-of-Distribution Detector Robust to Label Noise?
Galadrielle Humblot-Renaux, Sergio Escalera, Thomas B. Moeslund arXiv ↗ PDF ↗
A Physics-informed Low-rank Deep Neural Network for Blind and Universal Lens Aberration Correction
Jin Gong, Runzhao Yang, Weihang Zhang, Jinli Suo, Qionghai Dai PDF ↗
A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions
Jack Urbanek, Florian Bordes, Pietro Astolfi, Mary Williamson, Vasu Sharma, Adriana Romero-Soriano arXiv ↗ PDF ↗
A Recipe for Scaling up Text-to-Video Generation with Text-free Videos
Xiang Wang, Shiwei Zhang, Hangjie Yuan, Zhiwu Qing, Biao Gong, Yingya Zhang, Yujun Shen, Changxin Gao, Nong Sang arXiv ↗ PDF ↗
A Semi-supervised Nighttime Dehazing Baseline with Spatial-Frequency Aware and Realistic Brightness Constraint
Xiaofeng Cong, Jie Gui, Jing Zhang, Junming Hou, Hao Shen arXiv ↗ PDF ↗
A Simple Baseline for Efficient Hand Mesh Reconstruction
Zhishan Zhou, Shihao Zhou, Zhi Lv, Minqiang Zou, Yao Tang, Jiajun Liang arXiv ↗ PDF ↗
A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Frames
Pinelopi Papalampidi, Skanda Koppula, Shreya Pathak, Justin Chiu, Joe Heyward, Viorica Patraucean, Jiajun Shen, Antoine Miech, Andrew Zisserman, Aida Nematzdeh arXiv ↗ PDF ↗
A Simple Recipe for Language-guided Domain Generalized Segmentation
Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette arXiv ↗ PDF ↗
A Simple and Effective Point-based Network for Event Camera 6-DOFs Pose Relocalization
Hongwei Ren, Jiadong Zhu, Yue Zhou, Haotian Fu, Yulong Huang, Bojun Cheng PDF ↗
A Stealthy Wrongdoer: Feature-Oriented Reconstruction Attack against Split Learning
Xiaoyang Xu, Mengda Yang, Wenzhe Yi, Ziang Li, Juan Wang, Hongxin Hu, Yong Zhuang, Yaxin Liu arXiv ↗ PDF ↗
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
Yusheng Dai, Hang Chen, Jun Du, Ruoyu Wang, Shihao Chen, Haotian Wang, Chin-Hui Lee arXiv ↗ PDF ↗
A Subspace-Constrained Tyler's Estimator and its Applications to Structure from Motion
Feng Yu, Teng Zhang, Gilad Lerman arXiv ↗ PDF ↗
A Theory of Joint Light and Heat Transport for Lambertian Scenes
Mani Ramanagopal, Sriram Narayanan, Aswin C. Sankaranarayanan, Srinivasa G. Narasimhan PDF ↗
A Unified Approach for Text- and Image-guided 4D Scene Generation
Yufeng Zheng, Xueting Li, Koki Nagano, Sifei Liu, Otmar Hilliges, Shalini De Mello PDF ↗
A Unified Diffusion Framework for Scene-aware Human Motion Estimation from Sparse Signals
Jiangnan Tang, Jingya Wang, Kaiyang Ji, Lan Xu, Jingyi Yu, Ye Shi arXiv ↗ PDF ↗
A Unified Framework for Human-centric Point Cloud Video Understanding
Yiteng Xu, Kecheng Ye, Xiao Han, Yiming Ren, Xinge Zhu, Yuexin Ma arXiv ↗ PDF ↗
A Unified Framework for Microscopy Defocus Deblur with Multi-Pyramid Transformer and Contrastive Learning
Yuelin Zhang, Pengyu Zheng, Wanquan Yan, Chengyu Fang, Shing Shin Cheng arXiv ↗ PDF ↗
A Unified and Interpretable Emotion Representation and Expression Generation
Reni Paskaleva, Mykyta Holubakha, Andela Ilic, Saman Motamed, Luc Van Gool, Danda Paudel arXiv ↗ PDF ↗
A Versatile Framework for Continual Test-Time Domain Adaptation: Balancing Discriminability and Generalizability
Xu Yang, Xuan Chen, Moqi Li, Kun Wei, Cheng Deng PDF ↗
A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video Editing
Maomao Li, Yu Li, Tianyu Yang, Yunfei Liu, Dongxu Yue, Zhihui Lin, Dong Xu arXiv ↗ PDF ↗
A&B BNN: Add&Bit-Operation-Only Hardware-Friendly Binary Neural Network
Ruichen Ma, Guanchao Qiao, Yian Liu, Liwei Meng, Ning Ning, Yang Liu, Shaogang Hu PDF ↗
A-Teacher: Asymmetric Network for 3D Semi-Supervised Object Detection
Hanshi Wang, Zhipeng Zhang, Jin Gao, Weiming Hu PDF ↗
A2XP: Towards Private Domain Generalization
Geunhyeok Yu, Hyoseok Hwang arXiv ↗ PDF ↗
AAMDM: Accelerated Auto-regressive Motion Diffusion Model
Tianyu Li, Calvin Qiao, Guanqiao Ren, KangKang Yin, Sehoon Ha arXiv ↗ PDF ↗
ACT-Diffusion: Efficient Adversarial Consistency Training for One-step Diffusion Models
Fei Kong, Jinhao Duan, Lichao Sun, Hao Cheng, Renjing Xu, Hengtao Shen, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu PDF ↗
ADA-Track: End-to-End Multi-Camera 3D Multi-Object Tracking with Alternating Detection and Association
Shuxiao Ding, Lukas Schneider, Marius Cordts, Juergen Gall PDF ↗
ADFactory: An Effective Framework for Generalizing Optical Flow with NeRF
Han Ling, Quansen Sun, Yinghui Sun, Xian Xu, Xinfeng Li PDF ↗
AEROBLADE: Training-Free Detection of Latent Diffusion Images Using Autoencoder Reconstruction Error
Jonas Ricker, Denis Lukovnikov, Asja Fischer arXiv ↗ PDF ↗
AETTA: Label-Free Accuracy Estimation for Test-Time Adaptation
Taeckyung Lee, Sorn Chottananurak, Taesik Gong, Sung-Ju Lee arXiv ↗ PDF ↗
AHIVE: Anatomy-aware Hierarchical Vision Encoding for Interactive Radiology Report Retrieval
Sixing Yan, William K. Cheung, Ivor W. Tsang, Keith Chiu, Terence M. Tong, Ka Chun Cheung, Simon See PDF ↗
AIDE: An Automatic Data Engine for Object Detection in Autonomous Driving
Mingfu Liang, Jong-Chyi Su, Samuel Schulter, Sparsh Garg, Shiyu Zhao, Ying Wu, Manmohan Chandraker arXiv ↗ PDF ↗
ALGM: Adaptive Local-then-Global Token Merging for Efficient Semantic Segmentation with Plain Vision Transformers
Narges Norouzi, Svetlana Orlova, Daan de Geus, Gijs Dubbelman PDF ↗
AM-RADIO: Agglomerative Vision Foundation Model Reduce All Domains Into One
Mike Ranzinger, Greg Heinrich, Jan Kautz, Pavlo Molchanov PDF ↗
AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning
Yuwei Tang, Zhenyi Lin, Qilong Wang, Pengfei Zhu, Qinghua Hu PDF ↗
ANIM: Accurate Neural Implicit Model for Human Reconstruction from a single RGB-D Image
Marco Pesavento, Yuanlu Xu, Nikolaos Sarafianos, Robert Maier, Ziyan Wang, Chun-Han Yao, Marco Volino, Edmond Boyer, Adrian Hilton, Tony Tung PDF ↗
APISR: Anime Production Inspired Real-World Anime Super-Resolution
Boyang Wang, Fengyu Yang, Xihang Yu, Chao Zhang, Hanbin Zhao arXiv ↗ PDF ↗
APSeg: Auto-Prompt Network for Cross-Domain Few-Shot Semantic Segmentation
Weizhao He, Yang Zhang, Wei Zhuo, Linlin Shen, Jiaqi Yang, Songhe Deng, Liang Sun PDF ↗
ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe
Yifan Bai, Zeyang Zhao, Yihong Gong, Xing Wei arXiv ↗ PDF ↗
ASAM: Boosting Segment Anything Model with Adversarial Tuning
Bo Li, Haoke Xiao, Lv Tang arXiv ↗ PDF ↗
ASH: Animatable Gaussian Splats for Efficient and Photoreal Human Rendering
Haokai Pang, Heming Zhu, Adam Kortylewski, Christian Theobalt, Marc Habermann arXiv ↗ PDF ↗
AUEditNet: Dual-Branch Facial Action Unit Intensity Manipulation with Implicit Disentanglement
Shiwei Jin, Zhen Wang, Lei Wang, Peng Liu, Ning Bi, Truong Nguyen arXiv ↗ PDF ↗
AV-RIR: Audio-Visual Room Impulse Response Estimation
Anton Ratnarajah, Sreyan Ghosh, Sonal Kumar, Purva Chiniya, Dinesh Manocha PDF ↗
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
Trevine Oorloff, Surya Koppisetti, Nicolò Bonettini, Divyaraj Solanki, Ben Colman, Yaser Yacoob, Ali Shahriyari, Gaurav Bharaj PDF ↗
AVID: Any-Length Video Inpainting with Diffusion Model
Zhixing Zhang, Bichen Wu, Xiaoyan Wang, Yaqiao Luo, Luxin Zhang, Yinan Zhao, Peter Vajda, Dimitris Metaxas, Licheng Yu arXiv ↗ PDF ↗
AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture Search
Junghyup Lee, Bumsub Ham PDF ↗
Accelerating Diffusion Sampling with Optimized Time Steps
Shuchen Xue, Zhaoqiang Liu, Fei Chen, Shifeng Zhang, Tianyang Hu, Enze Xie, Zhenguo Li arXiv ↗ PDF ↗
Accelerating Neural Field Training via Soft Mining
Shakiba Kheradmand, Daniel Rebain, Gopal Sharma, Hossam Isack, Abhishek Kar, Andrea Tagliasacchi, Kwang Moo Yi arXiv ↗ PDF ↗
Accurate Spatial Gene Expression Prediction by Integrating Multi-Resolution Features
Youngmin Chung, Ji Hun Ha, Kyeong Chan Im, Joo Sang Lee arXiv ↗ PDF ↗
Accurate Training Data for Occupancy Map Prediction in Automated Driving Using Evidence Theory
Jonas Kälble, Sascha Wirges, Maxim Tatarchenko, Eddy Ilg PDF ↗
Action Detection via an Image Diffusion Process
Lin Geng Foo, Tianjiao Li, Hossein Rahmani, Jun Liu arXiv ↗ PDF ↗
Action Scene Graphs for Long-Form Understanding of Egocentric Videos
Ivan Rodin, Antonino Furnari, Kyle Min, Subarna Tripathi, Giovanni Maria Farinella arXiv ↗ PDF ↗
Action-slot: Visual Action-centric Representations for Multi-label Atomic Activity Recognition in Traffic Scenes
Chi-Hsi Kung, Shu-Wei Lu, Yi-Hsuan Tsai, Yi-Ting Chen PDF ↗
Active Generalized Category Discovery
Shijie Ma, Fei Zhu, Zhun Zhong, Xu-Yao Zhang, Cheng-Lin Liu arXiv ↗ PDF ↗
Active Object Detection with Knowledge Aggregation and Distillation from Large Models
Dejie Yang, Yang Liu arXiv ↗ PDF ↗
Active Open-Vocabulary Recognition: Let Intelligent Moving Mitigate CLIP Limitations
Lei Fan, Jianxiong Zhou, Xiaoying Xing, Ying Wu arXiv ↗ PDF ↗
Active Prompt Learning in Vision Language Models
Jihwan Bang, Sumyeong Ahn, Jae-Gil Lee arXiv ↗ PDF ↗
ActiveDC: Distribution Calibration for Active Finetuning
Wenshuai Xu, Zhenghui Hu, Yu Lu, Jinzhou Meng, Qingjie Liu, Yunhong Wang arXiv ↗ PDF ↗
Activity-Biometrics: Person Identification from Daily Activities
Shehreen Azad, Yogesh Singh Rawat PDF ↗
AdaBM: On-the-Fly Adaptive Bit Mapping for Image Super-Resolution
Cheeun Hong, Kyoung Mu Lee arXiv ↗ PDF ↗
AdaRevD: Adaptive Patch Exiting Reversible Decoder Pushes the Limit of Image Deblurring
Xintian Mao, Qingli Li, Yan Wang PDF ↗
AdaShift: Learning Discriminative Self-Gated Neural Feature Activation With an Adaptive Shift Factor
Sudong Cai PDF ↗
Adapt Before Comparison: A New Perspective on Cross-Domain Few-Shot Segmentation
Jonas Herzog arXiv ↗ PDF ↗
Adapt or Perish: Adaptive Sparse Transformer with Attentive Feature Refinement for Image Restoration
Shihao Zhou, Duosheng Chen, Jinshan Pan, Jinglei Shi, Jufeng Yang PDF ↗
Adapters Strike Back
Jan-Martin O. Steitz, Stefan Roth PDF ↗
Adapting Short-Term Transformers for Action Detection in Untrimmed Videos
Min Yang, Huan Gao, Ping Guo, Limin Wang arXiv ↗ PDF ↗
Adapting to Length Shift: FlexiLength Network for Trajectory Prediction
Yi Xu, Yun Fu arXiv ↗ PDF ↗
Adaptive Bidirectional Displacement for Semi-Supervised Medical Image Segmentation
Hanyang Chi, Jian Pang, Bingfeng Zhang, Weifeng Liu arXiv ↗ PDF ↗
Adaptive Fusion of Single-View and Multi-View Depth for Autonomous Driving
Junda Cheng, Wei Yin, Kaixuan Wang, Xiaozhi Chen, Shijie Wang, Xin Yang arXiv ↗ PDF ↗
Adaptive Hyper-graph Aggregation for Modality-Agnostic Federated Learning
Fan Qi, Shuai Li PDF ↗
Adaptive Multi-Modal Cross-Entropy Loss for Stereo Matching
Peng Xu, Zhiyu Xiang, Chengyu Qiao, Jingyun Fu, Tianyu Pu arXiv ↗ PDF ↗
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
Shin'ya Yamaguchi, Sekitoshi Kanai, Kazuki Adachi, Daiki Chijiwa arXiv ↗ PDF ↗
Adaptive Slot Attention: Object Discovery with Dynamic Slot Number
Ke Fan, Zechen Bai, Tianjun Xiao, Tong He, Max Horn, Yanwei Fu, Francesco Locatello, Zheng Zhang PDF ↗
Adaptive Softassign via Hadamard-Equipped Sinkhorn
Binrui Shen, Qiang Niu, Shengxin Zhu arXiv ↗ PDF ↗
Adaptive VIO: Deep Visual-Inertial Odometry with Online Continual Learning
Youqi Pan, Wugen Zhou, Yingdian Cao, Hongbin Zha arXiv ↗ PDF ↗
Addressing Background Context Bias in Few-Shot Segmentation through Iterative Modulation
Lanyun Zhu, Tianrun Chen, Jianxiong Yin, Simon See, Jun Liu PDF ↗
Advancing Saliency Ranking with Human Fixations: Dataset Models and Benchmarks
Bowen Deng, Siyang Song, Andrew P. French, Denis Schluppeck, Michael P. Pound PDF ↗
Adversarial Backdoor Attack by Naturalistic Data Poisoning on Trajectory Prediction in Autonomous Driving
Mozhgan Pourkeshavarz, Mohammad Sabokrou, Amir Rasouli arXiv ↗ PDF ↗
Adversarial Distillation Based on Slack Matching and Attribution Region Alignment
Shenglin Yin, Zhen Xiao, Mingxuan Song, Jieyi Long PDF ↗
Adversarial Score Distillation: When score distillation meets GAN
Min Wei, Jingkai Zhou, Junyao Sun, Xuesong Zhang arXiv ↗ PDF ↗
Adversarial Text to Continuous Image Generation
Kilichbek Haydarov, Aashiq Muhamed, Xiaoqian Shen, Jovana Lazarevic, Ivan Skorokhodov, Chamuditha Jayanga Galappaththige, Mohamed Elhoseiny PDF ↗
Adversarially Robust Few-shot Learning via Parameter Co-distillation of Similarity and Class Concept Learners
Junhao Dong, Piotr Koniusz, Junxi Chen, Xiaohua Xie, Yew-Soon Ong PDF ↗
Aerial Lifting: Neural Urban Semantic and Building Instance Lifting from Aerial Imagery
Yuqi Zhang, Guanying Chen, Jiaxing Chen, Shuguang Cui arXiv ↗ PDF ↗
Affine Equivariant Networks Based on Differential Invariants
Yikang Li, Yeqing Qiu, Yuxuan Chen, Lingshen He, Zhouchen Lin PDF ↗
AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation
Qingping Sun, Yanjun Wang, Ailing Zeng, Wanqi Yin, Chen Wei, Wenjia Wang, Haiyi Mei, Chi-Sing Leung, Ziwei Liu, Lei Yang, Zhongang Cai arXiv ↗ PDF ↗
AirPlanes: Accurate Plane Estimation via 3D-Consistent Embeddings
Jamie Watson, Filippo Aleotti, Mohamed Sayed, Zawar Qureshi, Oisin Mac Aodha, Gabriel Brostow, Michael Firman, Sara Vicente PDF ↗
Alchemist: Parametric Control of Material Properties with Diffusion Models
Prafull Sharma, Varun Jampani, Yuanzhen Li, Xuhui Jia, Dmitry Lagun, Fredo Durand, Bill Freeman, Mark Matthews arXiv ↗ PDF ↗
Align Before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition
Yifei Chen, Dapeng Chen, Ruijin Liu, Sai Zhou, Wenyuan Xue, Wei Peng arXiv ↗ PDF ↗
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
Zhaohe Liao, Jiangtong Li, Li Niu, Liqing Zhang PDF ↗
AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
Duojun Huang, Xinyu Xiong, Jie Ma, Jichang Li, Zequn Jie, Lin Ma, Guanbin Li PDF ↗
Aligning Logits Generatively for Principled Black-Box Knowledge Distillation
Jing Ma, Xiang Xiang, Ke Wang, Yuchuan Wu, Yongbin Li arXiv ↗ PDF ↗
Aligning and Prompting Everything All at Once for Universal Visual Perception
Yunhang Shen, Chaoyou Fu, Peixian Chen, Mengdan Zhang, Ke Li, Xing Sun, Yunsheng Wu, Shaohui Lin, Rongrong Ji arXiv ↗ PDF ↗
All Rivers Run to the Sea: Private Learning with Asymmetric Flows
Yue Niu, Ramy E. Ali, Saurav Prakash, Salman Avestimehr arXiv ↗ PDF ↗
All in One Framework for Multimodal Re-identification in the Wild
He Li, Mang Ye, Ming Zhang, Bo Du arXiv ↗ PDF ↗
AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic Segmentation
Haonan Wang, Qixiang Zhang, Yi Li, Xiaomeng Li arXiv ↗ PDF ↗
Alpha Invariance: On Inverse Scaling Between Distance and Volume Density in Neural Radiance Fields
Joshua Ahn, Haochen Wang, Raymond A. Yeh, Greg Shakhnarovich arXiv ↗ PDF ↗
Alpha-CLIP: A CLIP Model Focusing on Wherever You Want
Zeyi Sun, Ye Fang, Tong Wu, Pan Zhang, Yuhang Zang, Shu Kong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang PDF ↗
Amodal Ground Truth and Completion in the Wild
Guanqi Zhan, Chuanxia Zheng, Weidi Xie, Andrew Zisserman arXiv ↗ PDF ↗
An Aggregation-Free Federated Learning for Tackling Data Heterogeneity
Yuan Wang, Huazhu Fu, Renuga Kanagavelu, Qingsong Wei, Yong Liu, Rick Siow Mong Goh arXiv ↗ PDF ↗
An Asymmetric Augmented Self-Supervised Learning Method for Unsupervised Fine-Grained Image Hashing
Feiran Hu, Chenlin Zhang, Jiangliang Guo, Xiu-Shen Wei, Lin Zhao, Anqi Xu, Lingyan Gao PDF ↗
An Edit Friendly DDPM Noise Space: Inversion and Manipulations
Inbar Huberman-Spiegelglas, Vladimir Kulikov, Tomer Michaeli arXiv ↗ PDF ↗
An Empirical Study of Scaling Law for Scene Text Recognition
Miao Rang, Zhenni Bi, Chuanjian Liu, Yunhe Wang, Kai Han PDF ↗
An Empirical Study of the Generalization Ability of Lidar 3D Object Detectors to Unseen Domains
George Eskandar arXiv ↗ PDF ↗
An Interactive Navigation Method with Effect-oriented Affordance
Xiaohan Wang, Yuehu Liu, Xinhang Song, Yuyi Liu, Sixian Zhang, Shuqiang Jiang PDF ↗
An N-Point Linear Solver for Line and Motion Estimation with Event Cameras
Ling Gao, Daniel Gehrig, Hang Su, Davide Scaramuzza, Laurent Kneip PDF ↗
An Upload-Efficient Scheme for Transferring Knowledge From a Server-Side Pre-trained Generator to Clients in Heterogeneous Federated Learning
Jianqing Zhang, Yang Liu, Yang Hua, Jian Cao arXiv ↗ PDF ↗
Analyzing and Improving the Training Dynamics of Diffusion Models
Tero Karras, Miika Aittala, Jaakko Lehtinen, Janne Hellsten, Timo Aila, Samuli Laine arXiv ↗ PDF ↗
Anatomically Constrained Implicit Face Models
Prashanth Chandran, Gaspard Zoss arXiv ↗ PDF ↗
Anchor-based Robust Finetuning of Vision-Language Models
Jinwei Han, Zhiwen Lin, Zhongyisun Sun, Yingguo Gao, Ke Yan, Shouhong Ding, Yuan Gao, Gui-Song Xia arXiv ↗ PDF ↗
Animatable Gaussians: Learning Pose-dependent Gaussian Maps for High-fidelity Human Avatar Modeling
Zhe Li, Zerong Zheng, Lizhen Wang, Yebin Liu PDF ↗
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation
Animating General Image with Large Visual Motion Model
Dengsheng Chen, Xiaoming Wei, Xiaolin Wei PDF ↗
Anomaly Heterogeneity Learning for Open-set Supervised Anomaly Detection
Jiawen Zhu, Choubo Ding, Yu Tian, Guansong Pang arXiv ↗ PDF ↗
Anomaly Score: Evaluating Generative Models and Individual Generated Images based on Complexity and Vulnerability
Jaehui Hwang, Junghyuk Lee, Jong-Seok Lee arXiv ↗ PDF ↗
Any-Shift Prompting for Generalization over Distributions
Zehao Xiao, Jiayi Shen, Mohammad Mahdi Derakhshani, Shengcai Liao, Cees G. M. Snoek arXiv ↗ PDF ↗
AnyDoor: Zero-shot Object-level Image Customization
Xi Chen, Lianghua Huang, Yu Liu, Yujun Shen, Deli Zhao, Hengshuang Zhao arXiv ↗ PDF ↗
AnyScene: Customized Image Synthesis with Composited Foreground
Ruidong Chen, Lanjun Wang, Weizhi Nie, Yongdong Zhang, An-An Liu PDF ↗
AnySkill: Learning Open-Vocabulary Physical Skill for Interactive Agents
Jieming Cui, Tengyu Liu, Nian Liu, Yaodong Yang, Yixin Zhu, Siyuan Huang arXiv ↗ PDF ↗
ArGue: Attribute-Guided Prompt Tuning for Vision-Language Models
Xinyu Tian, Shu Zou, Zhaoyuan Yang, Jing Zhang arXiv ↗ PDF ↗
Arbitrary Motion Style Transfer with Multi-condition Motion Latent Diffusion Model
Wenfeng Song, Xingliang Jin, Shuai Li, Chenglizhao Chen, Aimin Hao, Xia Hou, Ning Li, Hong Qin PDF ↗
Arbitrary-Scale Image Generation and Upsampling using Latent Diffusion Model and Implicit Neural Decoder
Jinseok Kim, Tae-Kyun Kim arXiv ↗ PDF ↗
ArtAdapter: Text-to-Image Style Transfer using Multi-Level Style Encoder and Explicit Adaptation
Dar-Yen Chen, Hamish Tennent, Ching-Wen Hsu arXiv ↗ PDF ↗
Artist-Friendly Relightable and Animatable Neural Heads
Yingyan Xu, Prashanth Chandran, Sebastian Weiss, Markus Gross, Gaspard Zoss, Derek Bradley arXiv ↗ PDF ↗
As-Plausible-As-Possible: Plausibility-Aware Mesh Deformation Using 2D Diffusion Priors
Seungwoo Yoo, Kunho Kim, Vladimir G. Kim, Minhyuk Sung PDF ↗
AssistGUI: Task-Oriented PC Graphical User Interface Automation
Difei Gao, Lei Ji, Zechen Bai, Mingyu Ouyang, Peiran Li, Dongxing Mao, Qinchen Wu, Weichen Zhang, Peiyi Wang, Xiangwu Guo, Hengxu Wang, Luowei Zhou, Mike Zheng Shou PDF ↗
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
Zhiyu Zhao, Bingkun Huang, Sen Xing, Gangshan Wu, Yu Qiao, Limin Wang arXiv ↗ PDF ↗
Atom-Level Optical Chemical Structure Recognition with Limited Supervision
Martijn Oldenhof, Edward De Brouwer, Adam Arany, Yves Moreau arXiv ↗ PDF ↗
Attack To Defend: Exploiting Adversarial Attacks for Detecting Poisoned Models
Samar Fares, Karthik Nandakumar PDF ↗
Attention Calibration for Disentangled Text-to-Image Personalization
Yanbing Zhang, Mengping Yang, Qin Zhou, Zhe Wang arXiv ↗ PDF ↗
Attention-Driven Training-Free Efficiency Enhancement of Diffusion Models
Hongjie Wang, Difan Liu, Yan Kang, Yijun Li, Zhe Lin, Niraj K. Jha, Yuchen Liu arXiv ↗ PDF ↗
Attentive Illumination Decomposition Model for Multi-Illuminant White Balancing
Dongyoung Kim, Jinwoo Kim, Junsang Yu, Seon Joo Kim arXiv ↗ PDF ↗
AttriHuman-3D: Editable 3D Human Avatar Generation with Attribute Decomposition and Indexing
Fan Yang, Tianyi Chen, Xiaosheng He, Zhongang Cai, Lei Yang, Si Wu, Guosheng Lin PDF ↗
Attribute-Guided Pedestrian Retrieval: Bridging Person Re-ID with Internal Attribute Variability
Yan Huang, Zhang Zhang, Qiang Wu, Yi Zhong, Liang Wang PDF ↗
Audio-Visual Segmentation via Unlabeled Frame Exploitation
Jinxiang Liu, Yikun Liu, Fei Zhang, Chen Ju, Ya Zhang, Yanfeng Wang arXiv ↗ PDF ↗
Authentic Hand Avatar from a Phone Scan via Universal Hand Model
Gyeongsik Moon, Weipeng Xu, Rohan Joshi, Chenglei Wu, Takaaki Shiratori arXiv ↗ PDF ↗
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
Hao Li, Xue Yang, Zhaokai Wang, Xizhou Zhu, Jie Zhou, Yu Qiao, Xiaogang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai PDF ↗
Auto-Train-Once: Controller Network Guided Automatic Network Pruning from Scratch
Xidong Wu, Shangqian Gao, Zeyu Zhang, Zhenzhen Li, Runxue Bao, Yanfu Zhang, Xiaoqian Wang, Heng Huang PDF ↗
AutoAD III: The Prequel - Back to the Pixels
Tengda Han, Max Bain, Arsha Nagrani, Gül Varol, Weidi Xie, Andrew Zisserman PDF ↗
Automatic Controllable Colorization via Imagination
Xiaoyan Cong, Yue Wu, Qifeng Chen, Chenyang Lei arXiv ↗ PDF ↗
Autoregressive Queries for Adaptive Tracking with Spatio-Temporal Transformers
Jinxia Xie, Bineng Zhong, Zhiyi Mo, Shengping Zhang, Liangtao Shi, Shuxiang Song, Rongrong Ji PDF ↗
AvatarGPT: All-in-One Framework for Motion Understanding Planning Generation and Beyond
Zixiang Zhou, Yu Wan, Baoyuan Wang arXiv ↗ PDF ↗
BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything Model
Yiran Song, Qianyu Zhou, Xiangtai Li, Deng-Ping Fan, Xuequan Lu, Lizhuang Ma PDF ↗
BANF: Band-Limited Neural Fields for Levels of Detail Reconstruction
Akhmedkhan Shabanov, Shrisudhan Govindarajan, Cody Reading, Lily Goli, Daniel Rebain, Kwang Moo Yi, Andrea Tagliasacchi arXiv ↗ PDF ↗
BEM: Balanced and Entropy-based Mix for Long-Tailed Semi-Supervised Learning
Hongwei Zheng, Linyuan Zhou, Han Li, Jinming Su, Xiaoming Wei, Xiaoming Xu arXiv ↗ PDF ↗
BEVNeXt: Reviving Dense BEV Frameworks for 3D Object Detection
Zhenxin Li, Shiyi Lan, Jose M. Alvarez, Zuxuan Wu arXiv ↗ PDF ↗
BEVSpread: Spread Voxel Pooling for Bird's-Eye-View Representation in Vision-based Roadside 3D Object Detection
Wenjie Wang, Yehao Lu, Guangcong Zheng, Shuigen Zhan, Xiaoqing Ye, Zichang Tan, Jingdong Wang, Gaoang Wang, Xi Li PDF ↗
BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models
Fengyuan Shi, Jiaxi Gu, Hang Xu, Songcen Xu, Wei Zhang, Limin Wang arXiv ↗ PDF ↗
BOTH2Hands: Inferring 3D Hands from Both Text Prompts and Body Dynamics
Wenqian Zhang, Molin Huang, Yuxuan Zhou, Juze Zhang, Jingyi Yu, Jingya Wang, Lan Xu arXiv ↗ PDF ↗
BSNet: Box-Supervised Simulation-assisted Mean Teacher for 3D Instance Segmentation
Jiahao Lu, Jiacheng Deng, Tianzhu Zhang arXiv ↗ PDF ↗
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
Ruyang Liu, Chen Li, Yixiao Ge, Thomas H. Li, Ying Shan, Ge Li PDF ↗
Back to 3D: Few-Shot 3D Keypoint Detection with Back-Projected 2D Features
Thomas Wimmer, Peter Wonka, Maks Ovsjanikov arXiv ↗ PDF ↗
Backdoor Defense via Test-Time Detecting and Repairing
Jiyang Guan, Jian Liang, Ran He PDF ↗
Backpropagation-free Network for 3D Test-time Adaptation
Yanshuo Wang, Ali Cheraghian, Zeeshan Hayder, Jie Hong, Sameera Ramasinghe, Shafin Rahman, David Ahmedt-Aristizabal, Xuesong Li, Lars Petersson, Mehrtash Harandi arXiv ↗ PDF ↗
BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIP
Jiawang Bai, Kuofeng Gao, Shaobo Min, Shu-Tao Xia, Zhifeng Li, Wei Liu arXiv ↗ PDF ↗
Balancing Act: Distribution-Guided Debiasing in Diffusion Models
Rishubh Parihar, Abhijnya Bhat, Abhipsa Basu, Saswat Mallick, Jogendra Nath Kundu, R. Venkatesh Babu arXiv ↗ PDF ↗
Batch Normalization Alleviates the Spectral Bias in Coordinate Networks
Zhicheng Cai, Hao Zhu, Qiu Shen, Xinran Wang, Xun Cao PDF ↗
Bayesian Differentiable Physics for Cloth Digitalization
Deshan Gong, Ningtao Mao, He Wang arXiv ↗ PDF ↗
Bayesian Diffusion Models for 3D Shape Reconstruction
Haiyang Xu, Yu Lei, Zeyuan Chen, Xiang Zhang, Yue Zhao, Yilin Wang, Zhuowen Tu arXiv ↗ PDF ↗
Bayesian Exploration of Pre-trained Models for Low-shot Image Classification
Yibo Miao, Yu Lei, Feng Zhou, Zhijie Deng arXiv ↗ PDF ↗
Behind the Veil: Enhanced Indoor 3D Scene Reconstruction with Occluded Surfaces Completion
Su Sun, Cheng Zhao, Yuliang Guo, Ruoyu Wang, Xinyu Huang, Yingjie Victor Chen, Liu Ren arXiv ↗ PDF ↗
Benchmarking Audio Visual Segmentation for Long-Untrimmed Videos
Chen Liu, Peike Patrick Li, Qingtao Yu, Hongwei Sheng, Dadong Wang, Lincheng Li, Xin Yu PDF ↗
Benchmarking Implicit Neural Representation and Geometric Rendering in Real-Time RGB-D SLAM
Tongyan Hua, Lin Wang PDF ↗
Benchmarking Segmentation Models with Mask-Preserved Attribute Editing
Zijin Yin, Kongming Liang, Bing Li, Zhanyu Ma, Jun Guo arXiv ↗ PDF ↗
Benchmarking the Robustness of Temporal Action Detection Models Against Temporal Corruptions
Runhao Zeng, Xiaoyong Chen, Jiaming Liang, Huisi Wu, Guangzhong Cao, Yong Guo arXiv ↗ PDF ↗
BerfScene: Bev-conditioned Equivariant Radiance Fields for Infinite 3D Scene Generation
Qihang Zhang, Yinghao Xu, Yujun Shen, Bo Dai, Bolei Zhou, Ceyuan Yang arXiv ↗ PDF ↗