FreePoint: Unsupervised Point Cloud Instance Segmentation Zhikai Zhang, Jian Ding, Li Jiang, Dengxin Dai, Guisong Xia arXiv ↗ PDF ↗
Frequency Decoupling for Motion Magnification via Multi-Level Isomorphic Architecture Fei Wang, Dan Guo, Kun Li, Zhun Zhong, Meng Wang arXiv ↗ PDF ↗
Frequency-aware Event-based Video Deblurring for Real-World Motion Blur Taewoo Kim, Hoonhee Cho, Kuk-Jin Yoon PDF ↗
Friendly Sharpness-Aware Minimization Tao Li, Pan Zhou, Zhengbao He, Xinwen Cheng, Xiaolin Huang arXiv ↗ PDF ↗
From Audio to Photoreal Embodiment: Synthesizing Humans in Conversations Evonne Ng, Javier Romero, Timur Bagautdinov, Shaojie Bai, Trevor Darrell, Angjoo Kanazawa, Alexander Richard arXiv ↗ PDF ↗
From Coarse to Fine-Grained Open-Set Recognition Nico Lang, Vésteinn Snæbjarnarson, Elijah Cole, Oisin Mac Aodha, Christian Igel, Serge Belongie PDF ↗
From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models Rongjie Li, Songyang Zhang, Dahua Lin, Kai Chen, Xuming He arXiv ↗ PDF ↗
From SAM to CAMs: Exploring Segment Anything Model for Weakly Supervised Semantic Segmentation Hyeokjun Kweon, Kuk-Jin Yoon PDF ↗
From Variance to Veracity: Unbundling and Mitigating Gradient Variance in Differentiable Bundle Adjustment Layers Swaminathan Gurumurthy, Karnik Ram, Bingqing Chen, Zachary Manchester, Zico Kolter PDF ↗
From a Bird's Eye View to See: Joint Camera and Subject Registration without the Camera Calibration Zekun Qian, Ruize Han, Wei Feng, Song Wang PDF ↗
From-Ground-To-Objects: Coarse-to-Fine Self-supervised Monocular Depth Estimation of Dynamic Objects with Ground Contact Prior Jaeho Moon, Juan Luis Gonzalez Bello, Byeongjun Kwon, Munchurl Kim PDF ↗
Frozen Feature Augmentation for Few-Shot Image Classification Andreas Bär, Neil Houlsby, Mostafa Dehghani, Manoj Kumar PDF ↗
Fully Convolutional Slice-to-Volume Reconstruction for Single-Stack MRI Sean I. Young, Yael Balbastre, Bruce Fischl, Polina Golland, Juan Eugenio Iglesias arXiv ↗ PDF ↗
Fully Exploiting Every Real Sample: SuperPixel Sample Gradient Model Stealing Yunlong Zhao, Xiaoheng Deng, Yijing Liu, Xinjun Pei, Jiazhi Xia, Wei Chen PDF ↗
Fun with Flags: Robust Principal Directions via Flag Manifolds Nathan Mankovich, Gustau Camps-Valls, Tolga Birdal arXiv ↗ PDF ↗
Fusing Personal and Environmental Cues for Identification and Segmentation of First-Person Camera Wearers in Third-Person Views Ziwei Zhao, Yuchen Wang, Chuhua Wang PDF ↗
FutureHuman3D: Forecasting Complex Long-Term 3D Human Behavior from Video Observations Christian Diller, Thomas Funkhouser, Angela Dai arXiv ↗ PDF ↗
G-FARS: Gradient-Field-based Auto-Regressive Sampling for 3D Part Grouping Junfeng Cheng, Tania Stathaki PDF ↗
G-HOP: Generative Hand-Object Prior for Interaction Reconstruction and Grasp Synthesis Yufei Ye, Abhinav Gupta, Kris Kitani, Shubham Tulsiani PDF ↗
G-NeRF: Geometry-enhanced Novel View Synthesis from Single-View Images Zixiong Huang, Qi Chen, Libo Sun, Yifan Yang, Naizhou Wang, Qi Wu, Mingkui Tan PDF ↗
G3DR: Generative 3D Reconstruction in ImageNet Pradyumna Reddy, Ismail Elezi, Jiankang Deng arXiv ↗ PDF ↗
GAFusion: Adaptive Fusing LiDAR and Camera with Multiple Guidance for 3D Object Detection Xiaotian Li, Baojie Fan, Jiandong Tian, Huijie Fan PDF ↗
GALA: Generating Animatable Layered Assets from a Single Scan Taeksoo Kim, Byungjun Kim, Shunsuke Saito, Hanbyul Joo arXiv ↗ PDF ↗
GARField: Group Anything with Radiance Fields Chung Min Kim, Mingxuan Wu, Justin Kerr, Ken Goldberg, Matthew Tancik, Angjoo Kanazawa arXiv ↗ PDF ↗
GDA: Generalized Diffusion for Robust Test-time Adaptation Yun-Yun Tsai, Fu-Chen Chen, Albert Y. C. Chen, Junfeng Yang, Che-Chun Su, Min Sun, Cheng-Hao Kuo arXiv ↗ PDF ↗
GEARS: Local Geometry-aware Hand-object Interaction Synthesis Keyang Zhou, Bharat Lal Bhatnagar, Jan Eric Lenssen, Gerard Pons-Moll arXiv ↗ PDF ↗
GES : Generalized Exponential Splatting for Efficient Radiance Field Rendering Abdullah Hamdi, Luke Melas-Kyriazi, Jinjie Mai, Guocheng Qian, Ruoshi Liu, Carl Vondrick, Bernard Ghanem, Andrea Vedaldi arXiv ↗ PDF ↗
GLACE: Global Local Accelerated Coordinate Encoding Fangjinhua Wang, Xudong Jiang, Silvano Galliani, Christoph Vogel, Marc Pollefeys PDF ↗
GLID: Pre-training a Generalist Encoder-Decoder Vision Model Jihao Liu, Jinliang Zheng, Yu Liu, Hongsheng Li arXiv ↗ PDF ↗
GLaMM: Pixel Grounding Large Multimodal Model Hanoona Rasheed, Muhammad Maaz, Sahal Shaji, Abdelrahman Shaker, Salman Khan, Hisham Cholakkal, Rao M. Anwer, Eric Xing, Ming-Hsuan Yang, Fahad S. Khan arXiv ↗ PDF ↗
GLiDR: Topologically Regularized Graph Generative Network for Sparse LiDAR Point Clouds Prashant Kumar, Kshitij Madhav Bhat, Vedang Bhupesh Shenvi Nadkarni, Prem Kalra arXiv ↗ PDF ↗
GOAT-Bench: A Benchmark for Multi-Modal Lifelong Navigation Mukul Khanna, Ram Ramrakhya, Gunjan Chhablani, Sriram Yenamandra, Theophile Gervet, Matthew Chang, Zsolt Kira, Devendra Singh Chaplot, Dhruv Batra, Roozbeh Mottaghi PDF ↗
GOV-NeSF: Generalizable Open-Vocabulary Neural Semantic Fields Yunsong Wang, Hanlin Chen, Gim Hee Lee PDF ↗
GPLD3D: Latent Diffusion of 3D Shape Generative Models by Enforcing Geometric and Physical Priors Yuan Dong, Qi Zuo, Xiaodong Gu, Weihao Yuan, Zhengyi Zhao, Zilong Dong, Liefeng Bo, Qixing Huang PDF ↗
GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D Generation Tong Wu, Guandao Yang, Zhibing Li, Kai Zhang, Ziwei Liu, Leonidas Guibas, Dahua Lin, Gordon Wetzstein arXiv ↗ PDF ↗
GRAM: Global Reasoning for Multi-Page VQA Tsachi Blau, Sharon Fogel, Roi Ronen, Alona Golts, Roy Ganz, Elad Ben Avraham, Aviad Aberdam, Shahar Tsiper, Ron Litman arXiv ↗ PDF ↗
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation Yichi Zhang, Ziqiao Ma, Xiaofeng Gao, Suhaila Shakiah, Qiaozi Gao, Joyce Chai arXiv ↗ PDF ↗
GS-IR: 3D Gaussian Splatting for Inverse Rendering Zhihao Liang, Qi Zhang, Ying Feng, Ying Shan, Kui Jia PDF ↗
GSNeRF: Generalizable Semantic Neural Radiance Fields with Enhanced 3D Scene Understanding Zi-Ting Chou, Sheng-Yu Huang, I-Jieh Liu, Yu-Chiang Frank Wang arXiv ↗ PDF ↗
GSVA: Generalized Segmentation via Multimodal Large Language Models Zhuofan Xia, Dongchen Han, Yizeng Han, Xuran Pan, Shiji Song, Gao Huang arXiv ↗ PDF ↗
G^3-LQ: Marrying Hyperbolic Alignment with Explicit Semantic-Geometric Modeling for 3D Visual Grounding Yuan Wang, Yali Li, Shengjin Wang PDF ↗
Garment Recovery with Shape and Deformation Priors Ren Li, Corentin Dumery, Benoît Guillard, Pascal Fua arXiv ↗ PDF ↗
Gated Fields: Learning Scene Reconstruction from Gated Videos Andrea Ramazzina, Stefanie Walz, Pragyan Dahal, Mario Bijelic, Felix Heide arXiv ↗ PDF ↗
GauHuman: Articulated Gaussian Splatting from Monocular Human Videos Shoukang Hu, Tao Hu, Ziwei Liu arXiv ↗ PDF ↗
Gaussian Head Avatar: Ultra High-fidelity Head Avatar via Dynamic Gaussians Yuelang Xu, Benwang Chen, Zhe Li, Hongwen Zhang, Lizhen Wang, Zerong Zheng, Yebin Liu arXiv ↗ PDF ↗
Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models Zijin Yang, Kai Zeng, Kejiang Chen, Han Fang, Weiming Zhang, Nenghai Yu arXiv ↗ PDF ↗
Gaussian Shell Maps for Efficient 3D Human Generation Rameen Abdal, Wang Yifan, Zifan Shi, Yinghao Xu, Ryan Po, Zhengfei Kuang, Qifeng Chen, Dit-Yan Yeung, Gordon Wetzstein arXiv ↗ PDF ↗
GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D Gaussians Liangxiao Hu, Hongwen Zhang, Yuxiang Zhang, Boyao Zhou, Boning Liu, Shengping Zhang, Liqiang Nie arXiv ↗ PDF ↗
GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models Taoran Yi, Jiemin Fang, Junjie Wang, Guanjun Wu, Lingxi Xie, Xiaopeng Zhang, Wenyu Liu, Qi Tian, Xinggang Wang arXiv ↗ PDF ↗
GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions Junjie Wang, Jiemin Fang, Xiaopeng Zhang, Lingxi Xie, Qi Tian arXiv ↗ PDF ↗
GaussianEditor: Swift and Controllable 3D Editing with Gaussian Splatting Yiwen Chen, Zilong Chen, Chi Zhang, Feng Wang, Xiaofeng Yang, Yikai Wang, Zhongang Cai, Lei Yang, Huaping Liu, Guosheng Lin arXiv ↗ PDF ↗
GaussianShader: 3D Gaussian Splatting with Shading Functions for Reflective Surfaces Yingwenqi Jiang, Jiadong Tu, Yuan Liu, Xifeng Gao, Xiaoxiao Long, Wenping Wang, Yuexin Ma arXiv ↗ PDF ↗
GenFlow: Generalizable Recurrent Flow for 6D Pose Refinement of Novel Objects Sungphill Moon, Hyeontae Son, Dongcheol Hur, Sangwook Kim arXiv ↗ PDF ↗
GenH2R: Learning Generalizable Human-to-Robot Handover via Scalable Simulation Demonstration and Imitation Zifan Wang, Junyu Chen, Ziqing Chen, Pengwei Xie, Rui Chen, Li Yi arXiv ↗ PDF ↗
GenN2N: Generative NeRF2NeRF Translation Xiangyue Liu, Han Xue, Kunming Luo, Ping Tan, Li Yi arXiv ↗ PDF ↗
GenNBV: Generalizable Next-Best-View Policy for Active 3D Reconstruction Xiao Chen, Quanyi Li, Tai Wang, Tianfan Xue, Jiangmiao Pang arXiv ↗ PDF ↗
GenTron: Diffusion Transformers for Image and Video Generation Shoufa Chen, Mengmeng Xu, Jiawei Ren, Yuren Cong, Sen He, Yanping Xie, Animesh Sinha, Ping Luo, Tao Xiang, Juan-Manuel Perez-Rua PDF ↗
GeneAvatar: Generic Expression-Aware Volumetric Head Avatar Editing from a Single Image Chong Bao, Yinda Zhang, Yuan Li, Xiyu Zhang, Bangbang Yang, Hujun Bao, Marc Pollefeys, Guofeng Zhang, Zhaopeng Cui arXiv ↗ PDF ↗
General Point Model Pretraining with Autoencoding and Autoregressive Zhe Li, Zhangyang Gao, Cheng Tan, Bocheng Ren, Laurence T. Yang, Stan Z. Li PDF ↗
Generalizable Face Landmarking Guided by Conditional Face Warping Jiayi Liang, Haotian Liu, Hongteng Xu, Dixin Luo arXiv ↗ PDF ↗
Generalizable Novel-View Synthesis using a Stereo Camera Haechan Lee, Wonjoon Jin, Seung-Hwan Baek, Sunghyun Cho arXiv ↗ PDF ↗
Generalizable Whole Slide Image Classification with Fine-Grained Visual-Semantic Interaction Hao Li, Ying Chen, Yifei Chen, Rongshan Yu, Wenxian Yang, Liansheng Wang, Bowen Ding, Yuchen Han arXiv ↗ PDF ↗
Generalized Event Cameras Varun Sundar, Matthew Dutson, Andrei Ardelean, Claudio Bruschini, Edoardo Charbon, Mohit Gupta PDF ↗
Generalizing 6-DoF Grasp Detection via Domain Prior Knowledge Haoxiang Ma, Modi Shi, Boyang Gao, Di Huang PDF ↗
Generate Like Experts: Multi-Stage Font Generation by Incorporating Font Transfer Process into Diffusion Models Bin Fu, Fanghua Yu, Anran Liu, Zixuan Wang, Jie Wen, Junjun He, Yu Qiao PDF ↗
Generate Subgoal Images before Act: Unlocking the Chain-of-Thought Reasoning in Diffusion Model for Robot Manipulation with Multimodal Prompts Fei Ni, Jianye Hao, Shiguang Wu, Longxin Kou, Jiashun Liu, Yan Zheng, Bin Wang, Yuzheng Zhuang PDF ↗
Generating Content for HDR Deghosting from Frequency View Tao Hu, Qingsen Yan, Yuankai Qi, Yanning Zhang arXiv ↗ PDF ↗
Generating Enhanced Negatives for Training Language-Based Object Detectors Shiyu Zhao, Long Zhao, Vijay Kumar B G, Yumin Suh, Dimitris N. Metaxas, Manmohan Chandraker, Samuel Schulter arXiv ↗ PDF ↗
Generating Handwritten Mathematical Expressions From Symbol Graphs: An End-to-End Pipeline Yu Chen, Fei Gao, Yanguang Zhang, Maoying Qiao, Nannan Wang PDF ↗
Generating Human Motion in 3D Scenes from Text Descriptions Zhi Cen, Huaijin Pi, Sida Peng, Zehong Shen, Minghui Yang, Shuai Zhu, Hujun Bao, Xiaowei Zhou arXiv ↗ PDF ↗
Generating Non-Stationary Textures using Self-Rectification Yang Zhou, Rongjun Xiao, Dani Lischinski, Daniel Cohen-Or, Hui Huang arXiv ↗ PDF ↗
Generative 3D Part Assembly via Part-Whole-Hierarchy Message Passing Bi'an Du, Xiang Gao, Wei Hu, Renjie Liao arXiv ↗ PDF ↗
Generative Latent Coding for Ultra-Low Bitrate Image Compression Zhaoyang Jia, Jiahao Li, Bin Li, Houqiang Li, Yan Lu PDF ↗
Generative Multi-modal Models are Good Class Incremental Learners Xusheng Cao, Haori Lu, Linlan Huang, Xialei Liu, Ming-Ming Cheng arXiv ↗ PDF ↗
Generative Multimodal Models are In-Context Learners Quan Sun, Yufeng Cui, Xiaosong Zhang, Fan Zhang, Qiying Yu, Yueze Wang, Yongming Rao, Jingjing Liu, Tiejun Huang, Xinlong Wang arXiv ↗ PDF ↗
Generative Proxemics: A Prior for 3D Social Interaction from Images Lea Müller, Vickie Ye, Georgios Pavlakos, Michael Black, Angjoo Kanazawa PDF ↗
Generative Quanta Color Imaging Vishal Purohit, Junjie Luo, Yiheng Chi, Qi Guo, Stanley H. Chan, Qiang Qiu arXiv ↗ PDF ↗
Generative Region-Language Pretraining for Open-Ended Object Detection Chuang Lin, Yi Jiang, Lizhen Qu, Zehuan Yuan, Jianfei Cai arXiv ↗ PDF ↗
Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion Models Shengqu Cai, Duygu Ceylan, Matheus Gadelha, Chun-Hao Paul Huang, Tuanfeng Yang Wang, Gordon Wetzstein arXiv ↗ PDF ↗
Generative Unlearning for Any Identity Juwon Seo, Sung-Hoon Lee, Tae-Young Lee, Seungjun Moon, Gyeong-Moon Park arXiv ↗ PDF ↗
GenesisTex: Adapting Image Denoising Diffusion to Texture Space Chenjian Gao, Boyan Jiang, Xinghui Li, Yingpeng Zhang, Qian Yu arXiv ↗ PDF ↗
Genuine Knowledge from Practice: Diffusion Test-Time Adaptation for Video Adverse Weather Removal Yijun Yang, Hongtao Wu, Angelica I. Aviles-Rivero, Yulun Zhang, Jing Qin, Lei Zhu arXiv ↗ PDF ↗
GeoAuxNet: Towards Universal 3D Representation Learning for Multi-sensor Point Clouds Shengjun Zhang, Xin Fei, Yueqi Duan arXiv ↗ PDF ↗
GeoChat: Grounded Large Vision-Language Model for Remote Sensing Kartik Kuckreja, Muhammad Sohail Danish, Muzammal Naseer, Abhijit Das, Salman Khan, Fahad Shahbaz Khan arXiv ↗ PDF ↗
GeoReF: Geometric Alignment Across Shape Variation for Category-level Object Pose Refinement Linfang Zheng, Tze Ho Elden Tse, Chen Wang, Yinghan Sun, Hua Chen, Ales Leonardis, Wei Zhang, Hyung Jin Chang arXiv ↗ PDF ↗
Geometry Transfer for Stylizing Radiance Fields Hyunyoung Jung, Seonghyeon Nam, Nikolaos Sarafianos, Sungjoo Yoo, Alexander Sorkine-Hornung, Rakesh Ranjan arXiv ↗ PDF ↗
Geometry-aware Reconstruction and Fusion-refined Rendering for Generalizable Neural Radiance Fields Tianqi Liu, Xinyi Ye, Min Shi, Zihao Huang, Zhiyu Pan, Zhan Peng, Zhiguo Cao arXiv ↗ PDF ↗
GigaPose: Fast and Robust Novel Object Pose Estimation via One Correspondence Van Nguyen Nguyen, Thibault Groueix, Mathieu Salzmann, Vincent Lepetit arXiv ↗ PDF ↗
GigaTraj: Predicting Long-term Trajectories of Hundreds of Pedestrians in Gigapixel Complex Scenes Haozhe Lin, Chunyu Wei, Li He, Yuchen Guo, Yunqi Zhao, Shanglong Li, Lu Fang PDF ↗
GlitchBench: Can Large Multimodal Models Detect Video Game Glitches? Mohammad Reza Taesiri, Tianjun Feng, Cor-Paul Bezemer, Anh Nguyen arXiv ↗ PDF ↗
Global and Hierarchical Geometry Consistency Priors for Few-shot NeRFs in Indoor Scenes Xiaotian Sun, Qingshan Xu, Xinjie Yang, Yu Zang, Cheng Wang PDF ↗
Global and Local Prompts Cooperation via Optimal Transport for Federated Learning Hongxia Li, Wei Huang, Jingya Wang, Ye Shi arXiv ↗ PDF ↗
GoMAvatar: Efficient Animatable Human Modeling from Monocular Video Using Gaussians-on-Mesh Jing Wen, Xiaoming Zhao, Zhongzheng Ren, Alexander G. Schwing, Shenlong Wang arXiv ↗ PDF ↗
GoMVS: Geometrically Consistent Cost Aggregation for Multi-View Stereo Jiang Wu, Rui Li, Haofei Xu, Wenxun Zhao, Yu Zhu, Jinqiu Sun, Yanning Zhang arXiv ↗ PDF ↗
Going Beyond Multi-Task Dense Prediction with Synergy Embedding Models Huimin Huang, Yawen Huang, Lanfen Lin, Ruofeng Tong, Yen-Wei Chen, Hao Zheng, Yuexiang Li, Yefeng Zheng PDF ↗
GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic Segmentation Weiming Zhang, Yexin Liu, Xu Zheng, Lin Wang arXiv ↗ PDF ↗
Gradient-based Parameter Selection for Efficient Fine-Tuning Zhi Zhang, Qizhe Zhang, Zijun Gao, Renrui Zhang, Ekaterina Shutova, Shiji Zhou, Shanghang Zhang arXiv ↗ PDF ↗
GraphDreamer: Compositional 3D Scene Synthesis from Scene Graphs Gege Gao, Weiyang Liu, Anpei Chen, Andreas Geiger, Bernhard Schölkopf arXiv ↗ PDF ↗
GreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNs Mustafa Munir, William Avery, Md Mostafijur Rahman, Radu Marculescu arXiv ↗ PDF ↗
Grid Diffusion Models for Text-to-Video Generation Taegyeong Lee, Soyeong Kwon, Taehwan Kim arXiv ↗ PDF ↗
Grounded Text-to-Image Synthesis with Attention Refocusing Quynh Phung, Songwei Ge, Jia-Bin Huang arXiv ↗ PDF ↗
Grounding Everything: Emerging Localization Properties in Vision-Language Transformers Walid Bousselham, Felix Petersen, Vittorio Ferrari, Hilde Kuehne arXiv ↗ PDF ↗
Grounding and Enhancing Grid-based Models for Neural Fields Zelin Zhao, Fenglei Fan, Wenlong Liao, Junchi Yan arXiv ↗ PDF ↗
GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D Understanding Chengyao Wang, Li Jiang, Xiaoyang Wu, Zhuotao Tian, Bohao Peng, Hengshuang Zhao, Jiaya Jia arXiv ↗ PDF ↗
Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection Jongha Kim, Jihwan Park, Jinyoung Park, Jinyoung Kim, Sehyung Kim, Hyunwoo J. Kim arXiv ↗ PDF ↗
Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D Glimpses Inhee Lee, Byungjun Kim, Hanbyul Joo arXiv ↗ PDF ↗
Guided Slot Attention for Unsupervised Video Object Segmentation Minhyeok Lee, Suhwan Cho, Dogyoon Lee, Chaewon Park, Jungho Lee, Sangyoun Lee arXiv ↗ PDF ↗
HAVE-FUN: Human Avatar Reconstruction from Few-Shot Unconstrained Images Xihe Yang, Xingyu Chen, Daiheng Gao, Shaohui Wang, Xiaoguang Han, Baoyuan Wang PDF ↗
HDQMF: Holographic Feature Decomposition Using Quantum Algorithms Prathyush Prasanth Poduval, Zhuowen Zou, Mohsen Imani PDF ↗
HDRFlow: Real-Time HDR Video Reconstruction with Large Motions Gangwei Xu, Yujin Wang, Jinwei Gu, Tianfan Xue, Xin Yang arXiv ↗ PDF ↗
HEAL-SWIN: A Vision Transformer On The Sphere Oscar Carlsson, Jan E. Gerken, Hampus Linander, Heiner Spieß, Fredrik Ohlsson, Christoffer Petersson, Daniel Persson PDF ↗
HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding Trong-Thuan Nguyen, Pha Nguyen, Khoa Luu arXiv ↗ PDF ↗
HIMap: HybrId Representation Learning for End-to-end Vectorized HD Map Construction Yi Zhou, Hui Zhang, Jiaqian Yu, Yifan Yang, Sangil Jung, Seung-In Park, ByungIn Yoo arXiv ↗ PDF ↗
HINTED: Hard Instance Enhanced Detector with Mixed-Density Feature Fusion for Sparsely-Supervised 3D Object Detection Qiming Xia, Wei Ye, Hai Wu, Shijia Zhao, Leyuan Xing, Xun Huang, Jinhao Deng, Xin Li, Chenglu Wen, Cheng Wang PDF ↗
HIPTrack: Visual Tracking with Historical Prompts Wenrui Cai, Qingjie Liu, Yunhong Wang arXiv ↗ PDF ↗
HIR-Diff: Unsupervised Hyperspectral Image Restoration Via Improved Diffusion Models Li Pang, Xiangyu Rui, Long Cui, Hongzhong Wang, Deyu Meng, Xiangyong Cao PDF ↗
HIT: Estimating Internal Human Implicit Tissues from the Body Surface Marilyn Keller, Vaibhav Arora, Abdelmouttaleb Dakri, Shivam Chandhok, Jürgen Machann, Andreas Fritsche, Michael J. Black, Sergi Pujades PDF ↗
HIVE: Harnessing Human Feedback for Instructional Visual Editing Shu Zhang, Xinyi Yang, Yihao Feng, Can Qin, Chia-Chih Chen, Ning Yu, Zeyuan Chen, Huan Wang, Silvio Savarese, Stefano Ermon, Caiming Xiong, Ran Xu arXiv ↗ PDF ↗
HMD-Poser: On-Device Real-time Human Motion Tracking from Scalable Sparse Observations Peng Dai, Yang Zhang, Tao Liu, Zhen Fan, Tianyuan Du, Zhuo Su, Xiaozheng Zheng, Zeming Li PDF ↗
HOIAnimator: Generating Text-prompt Human-object Animations using Novel Perceptive Diffusion Models Wenfeng Song, Xinyu Zhang, Shuai Li, Yang Gao, Aimin Hao, Xia Hou, Chenglizhao Chen, Ning Li, Hong Qin PDF ↗
HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data Mengqi Zhang, Yang Fu, Zheng Ding, Sifei Liu, Zhuowen Tu, Xiaolong Wang arXiv ↗ PDF ↗
HOISDF: Constraining 3D Hand-Object Pose Estimation with Global Signed Distance Fields Haozhe Qi, Chen Zhao, Mathieu Salzmann, Alexander Mathis arXiv ↗ PDF ↗
HOIST-Former: Hand-held Objects Identification Segmentation and Tracking in the Wild Supreeth Narasimhaswamy, Huy Anh Nguyen, Lihan Huang, Minh Hoai PDF ↗
HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic Segmentation Linglin Jing, Yiming Ding, Yunpeng Gao, Zhigang Wang, Xu Yan, Dong Wang, Gerald Schaefer, Hui Fang, Bin Zhao, Xuelong Li PDF ↗
HPNet: Dynamic Trajectory Forecasting with Historical Prediction Attention Xiaolong Tang, Meina Kan, Shiguang Shan, Zhilong Ji, Jinfeng Bai, Xilin Chen arXiv ↗ PDF ↗
HRVDA: High-Resolution Visual Document Assistant Chaohu Liu, Kun Yin, Haoyu Cao, Xinghua Jiang, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Linli Xu arXiv ↗ PDF ↗
HUGS: Holistic Urban 3D Scene Understanding via Gaussian Splatting Hongyu Zhou, Jiahao Shao, Lu Xu, Dongfeng Bai, Weichao Qiu, Bingbing Liu, Yue Wang, Andreas Geiger, Yiyi Liao arXiv ↗ PDF ↗
HUGS: Human Gaussian Splats Muhammed Kocabas, Jen-Hao Rick Chang, James Gabriel, Oncel Tuzel, Anurag Ranjan arXiv ↗ PDF ↗
HUNTER: Unsupervised Human-centric 3D Detection via Transferring Knowledge from Synthetic Instances to Real Scenes Yichen Yao, Zimo Jiang, Yujing Sun, Zhencai Zhu, Xinge Zhu, Runnan Chen, Yuexin Ma arXiv ↗ PDF ↗
Habitat Synthetic Scenes Dataset (HSSD-200): An Analysis of 3D Scene Scale and Realism Tradeoffs for ObjectGoal Navigation Mukul Khanna, Yongsen Mao, Hanxiao Jiang, Sanjay Haresh, Brennan Shacklett, Dhruv Batra, Alexander Clegg, Eric Undersander, Angel X. Chang, Manolis Savva arXiv ↗ PDF ↗
HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data Qifan Yu, Juncheng Li, Longhui Wei, Liang Pang, Wentao Ye, Bosheng Qin, Siliang Tang, Qi Tian, Yueting Zhuang arXiv ↗ PDF ↗
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model Chaoya Jiang, Haiyang Xu, Mengfan Dong, Jiaxing Chen, Wei Ye, Ming Yan, Qinghao Ye, Ji Zhang, Fei Huang, Shikun Zhang arXiv ↗ PDF ↗
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models Tianrui Guan, Fuxiao Liu, Xiyang Wu, Ruiqi Xian, Zongxia Li, Xiaoyu Liu, Xijun Wang, Lichang Chen, Furong Huang, Yaser Yacoob, Dinesh Manocha, Tianyi Zhou arXiv ↗ PDF ↗
HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances Supreeth Narasimhaswamy, Uttaran Bhattacharya, Xiang Chen, Ishita Dasgupta, Saayan Mitra, Minh Hoai arXiv ↗ PDF ↗
HandBooster: Boosting 3D Hand-Mesh Reconstruction by Conditional Synthesis and Sampling of Hand-Object Interactions Hao Xu, Haipeng Li, Yinqiao Wang, Shuaicheng Liu, Chi-Wing Fu arXiv ↗ PDF ↗
HardMo: A Large-Scale Hardcase Dataset for Motion Capture Jiaqi Liao, Chuanchen Luo, Yinuo Du, Yuxi Wang, Xucheng Yin, Man Zhang, Zhaoxiang Zhang, Junran Peng PDF ↗
HarmonyView: Harmonizing Consistency and Diversity in One-Image-to-3D Sangmin Woo, Byeongjun Park, Hyojun Go, Jin-Young Kim, Changick Kim arXiv ↗ PDF ↗
Harnessing Large Language Models for Training-free Video Anomaly Detection Luca Zanella, Willi Menapace, Massimiliano Mancini, Yiming Wang, Elisa Ricci arXiv ↗ PDF ↗
Harnessing Meta-Learning for Improving Full-Frame Video Stabilization Muhammad Kashif Ali, Eun Woo Im, Dongjin Kim, Tae Hyun Kim arXiv ↗ PDF ↗
Harnessing the Power of MLLMs for Transferable Text-to-Image Person ReID Wentan Tan, Changxing Ding, Jiayu Jiang, Fei Wang, Yibing Zhan, Dapeng Tao PDF ↗
Hearing Anything Anywhere Mason Long Wang, Ryosuke Sawata, Samuel Clarke, Ruohan Gao, Shangzhe Wu, Jiajun Wu PDF ↗
HiFi4G: High-Fidelity Human Performance Rendering via Compact Gaussian Splatting Yuheng Jiang, Zhehao Shen, Penghao Wang, Zhuo Su, Yu Hong, Yingliang Zhang, Jingyi Yu, Lan Xu arXiv ↗ PDF ↗
HiKER-SGG: Hierarchical Knowledge Enhanced Robust Scene Graph Generation Ce Zhang, Simon Stepputtis, Joseph Campbell, Katia Sycara, Yaqi Xie PDF ↗
HiLo: Detailed and Robust 3D Clothed Human Reconstruction with High-and Low-Frequency Information of Parametric Models Yifan Yang, Dong Liu, Shuhai Zhang, Zeshuai Deng, Zixiong Huang, Mingkui Tan arXiv ↗ PDF ↗
HiPose: Hierarchical Binary Surface Encoding and Correspondence Pruning for RGB-D 6DoF Object Pose Estimation Yongliang Lin, Yongzhi Su, Praveen Nathan, Sandeep Inuganti, Yan Di, Martin Sundermeyer, Fabian Manhardt, Didier Stricker, Jason Rambach, Yu Zhang PDF ↗
Hide in Thicket: Generating Imperceptible and Rational Adversarial Perturbations on 3D Point Clouds Tianrui Lou, Xiaojun Jia, Jindong Gu, Li Liu, Siyuan Liang, Bangyan He, Xiaochun Cao arXiv ↗ PDF ↗
Hierarchical Correlation Clustering and Tree Preserving Embedding Morteza Haghir Chehreghani, Mostafa Haghir Chehreghani arXiv ↗ PDF ↗
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation Xiao Ma, Sumit Patidar, Iain Haughton, Stephen James arXiv ↗ PDF ↗
Hierarchical Histogram Threshold Segmentation - Auto-terminating High-detail Oversegmentation Thomas V. Chang, Simon Seibt, Bartosz von Rymon Lipinski PDF ↗
Hierarchical Intra-modal Correlation Learning for Label-free 3D Semantic Segmentation Xin Kang, Lei Chu, Jiahao Li, Xuejin Chen, Yan Lu PDF ↗
Hierarchical Patch Diffusion Models for High-Resolution Video Generation Ivan Skorokhodov, Willi Menapace, Aliaksandr Siarohin, Sergey Tulyakov PDF ↗
Hierarchical Spatio-temporal Decoupling for Text-to-Video Generation Zhiwu Qing, Shiwei Zhang, Jiayu Wang, Xiang Wang, Yujie Wei, Yingya Zhang, Changxin Gao, Nong Sang arXiv ↗ PDF ↗
High-Quality Facial Geometry and Appearance Capture at Home Yuxuan Han, Junfeng Lyu, Feng Xu arXiv ↗ PDF ↗
High-fidelity Person-centric Subject-to-Image Synthesis Yibin Wang, Weizhong Zhang, Jianwei Zheng, Cheng Jin arXiv ↗ PDF ↗
Higher-order Relational Reasoning for Pedestrian Trajectory Prediction Sungjune Kim, Hyung-gun Chi, Hyerin Lim, Karthik Ramani, Jinkyu Kim, Sangpil Kim PDF ↗
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models Xinpeng Ding, Jianhua Han, Hang Xu, Xiaodan Liang, Wei Zhang, Xiaomeng Li PDF ↗
Holistic Features are almost Sufficient for Text-to-Video Retrieval Kaibin Tian, Ruixiang Zhao, Zijie Xin, Bangxiang Lan, Xirong Li PDF ↗
Holo-Relighting: Controllable Volumetric Portrait Relighting from a Single Image Yiqun Mei, Yu Zeng, He Zhang, Zhixin Shu, Xuaner Zhang, Sai Bi, Jianming Zhang, HyunJoon Jung, Vishal M. Patel PDF ↗
HoloVIC: Large-scale Dataset and Benchmark for Multi-Sensor Holographic Intersection and Vehicle-Infrastructure Cooperative Cong Ma, Lei Qiao, Chengkai Zhu, Kai Liu, Zelong Kong, Qing Li, Xueqi Zhou, Yuheng Kan, Wei Wu arXiv ↗ PDF ↗
Holodeck: Language Guided Generation of 3D Embodied AI Environments Yue Yang, Fan-Yun Sun, Luca Weihs, Eli VanderBilt, Alvaro Herrasti, Winson Han, Jiajun Wu, Nick Haber, Ranjay Krishna, Lingjie Liu, Chris Callison-Burch, Mark Yatskar, Aniruddha Kembhavi, Christopher Clark arXiv ↗ PDF ↗
Holoported Characters: Real-time Free-viewpoint Rendering of Humans from Sparse RGB Cameras Ashwath Shetty, Marc Habermann, Guoxing Sun, Diogo Luvizon, Vladislav Golyanik, Christian Theobalt arXiv ↗ PDF ↗
HomoFormer: Homogenized Transformer for Image Shadow Removal Jie Xiao, Xueyang Fu, Yurui Zhu, Dong Li, Jie Huang, Kai Zhu, Zheng-Jun Zha PDF ↗
How Far Can We Compress Instant-NGP-Based NeRF? Yihang Chen, Qianyi Wu, Mehrtash Harandi, Jianfei Cai PDF ↗
How to Configure Good In-Context Sequence for Visual Question Answering Li Li, Jiawei Peng, Huiyi Chen, Chongyang Gao, Xu Yang arXiv ↗ PDF ↗
How to Handle Sketch-Abstraction in Sketch-Based Image Retrieval? Subhadeep Koley, Ayan Kumar Bhunia, Aneeshan Sain, Pinaki Nath Chowdhury, Tao Xiang, Yi-Zhe Song arXiv ↗ PDF ↗
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval? Yuxin Chen, Zongyang Ma, Ziqi Zhang, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Ying Shan, Xiaojuan Qi, Weiming Hu PDF ↗
How to Train Neural Field Representations: A Comprehensive Study and Benchmark Samuele Papa, Riccardo Valperga, David Knigge, Miltiadis Kofinas, Phillip Lippe, Jan-Jakob Sonke, Efstratios Gavves arXiv ↗ PDF ↗
HumMUSS: Human Motion Understanding using State Space Models Arnab Mondal, Stefano Alletto, Denis Tome arXiv ↗ PDF ↗
Human Gaussian Splatting: Real-time Rendering of Animatable Avatars Arthur Moreau, Jifei Song, Helisa Dhamo, Richard Shaw, Yiren Zhou, Eduardo Pérez-Pellitero arXiv ↗ PDF ↗
HumanNeRF-SE: A Simple yet Effective Approach to Animate HumanNeRF with Diverse Poses Caoyuan Ma, Yu-Lun Liu, Zhixiang Wang, Wu Liu, Xinchen Liu, Zheng Wang PDF ↗
HumanNorm: Learning Normal Diffusion Model for High-quality and Realistic 3D Human Generation Xin Huang, Ruizhi Shao, Qi Zhang, Hongwen Zhang, Ying Feng, Yebin Liu, Qing Wang arXiv ↗ PDF ↗
HumanRef: Single Image to 3D Human Generation via Reference-Guided Diffusion Jingbo Zhang, Xiaoyu Li, Qi Zhang, Yanpei Cao, Ying Shan, Jing Liao arXiv ↗ PDF ↗
Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic Segmentation Feilong Tang, Zhongxing Xu, Zhaojun Qu, Wei Feng, Xingjian Jiang, Zongyuan Ge arXiv ↗ PDF ↗
Hybrid Functional Maps for Crease-Aware Non-Isometric Shape Matching Lennart Bastian, Yizheng Xie, Nassir Navab, Zorah Lähner arXiv ↗ PDF ↗
Hybrid Proposal Refiner: Revisiting DETR Series from the Faster R-CNN Perspective Jinjing Zhao, Fangyun Wei, Chang Xu PDF ↗
Hyper-MD: Mesh Denoising with Customized Parameters Aware of Noise Intensity and Geometric Characteristics Xingtao Wang, Hongliang Wei, Xiaopeng Fan, Debin Zhao PDF ↗
HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image Models Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Wei Wei, Tingbo Hou, Yael Pritch, Neal Wadhwa, Michael Rubinstein, Kfir Aberman arXiv ↗ PDF ↗
HyperSDFusion: Bridging Hierarchical Structures in Language and Geometry for Enhanced 3D Text2Shape Generation Zhiying Leng, Tolga Birdal, Xiaohui Liang, Federico Tombari arXiv ↗ PDF ↗
Hyperbolic Learning with Synthetic Captions for Open-World Detection Fanjie Kong, Yanbei Chen, Jiarui Cai, Davide Modolo arXiv ↗ PDF ↗
Hyperspherical Classification with Dynamic Label-to-Prototype Assignment Mohammad Saeed Ebrahimi Saadabadi, Ali Dabouei, Sahar Rahimi Malakshan, Nasser M. Nasrabadi arXiv ↗ PDF ↗
I'M HOI: Inertia-aware Monocular Capture of 3D Human-Object Interactions Chengfeng Zhao, Juze Zhang, Jiashen Du, Ziwei Shan, Junye Wang, Jingyi Yu, Jingya Wang, Lan Xu PDF ↗
IBD-SLAM: Learning Image-Based Depth Fusion for Generalizable SLAM Minghao Yin, Shangzhe Wu, Kai Han PDF ↗
ICON: Incremental CONfidence for Joint Pose and Radiance Field Optimization Weiyao Wang, Pierre Gleize, Hao Tang, Xingyu Chen, Kevin J Liang, Matt Feiszli arXiv ↗ PDF ↗
ID-Blau: Image Deblurring by Implicit Diffusion-based reBLurring AUgmentation Jia-Hao Wu, Fu-Jen Tsai, Yan-Tsung Peng, Chung-Chi Tsai, Chia-Wen Lin, Yen-Yu Lin PDF ↗
ID-like Prompt Learning for Few-Shot Out-of-Distribution Detection Yichen Bai, Zongbo Han, Bing Cao, Xiaoheng Jiang, Qinghua Hu, Changqing Zhang arXiv ↗ PDF ↗
IDGuard: Robust General Identity-centric POI Proactive Defense Against Face Editing Abuse Yunshu Dai, Jianwei Fei, Fangjun Huang PDF ↗
IIRP-Net: Iterative Inference Residual Pyramid Network for Enhanced Image Registration Tai Ma, Suwei Zhang, Jiafeng Li, Ying Wen PDF ↗