CCF-A · IEEE/CVF Conference on Computer Vision and Pattern Recognition

CVPR 2026

Jun 3–7, 2026 · Denver, Colorado, United States · 850 papers · official site ↗

Posters 850 · page 2 of 5

DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving
Zhuolin He, Jing Li, Guanghao Li, Xiaolei Chen, Jiacheng Tang, Siyang Zhang, Zhounan Jin, Feipeng Cai, Bin Li, Jian Pu, Jia Cai, Xiangyang Xue arXiv ↗ PDF ↗
Dynamics-Aware Preference Optimization for Vision-Language Models
Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Keze Wang PDF ↗
EE-RL: Vision Language Guided Reinforcement Learning with Explorer and Expert model for End-to-End Autonomous Driving
Xiaolong Li, Lan Yang, Ruyang Li, Shan Fang, Yang Liu, Xiangmo Zhao PDF ↗
EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding
GwangWook Park, Hyo-Jun Lee, Jong-Hyeon Baek, Hanul Kim, Yeong Jun Koh PDF ↗
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong PDF ↗
EMMA: Extracting Multiple physical parameters from Multimodal Data
Farhat Shaikh, Ayan Banerjee, Sandeep Gupta PDF ↗
EReCu: Pseudo-label Evolution Fusion and Refinement with Multi-Cue Learning for Unsupervised Camouflage Detection
Shuo Jiang, Gaojia Zhang, Min Tan, Yufei Yin, Gang Pan arXiv ↗ PDF ↗
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan Duan, Hao Lu, Hanming Deng, Lewei Lu arXiv ↗ PDF ↗
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
Tianwei Xiong, Jun Hao Liew, Zilong Huang, Zhijie Lin, Jiashi Feng, Xihui Liu arXiv ↗ PDF ↗
EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval
Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao arXiv ↗ PDF ↗
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu arXiv ↗ PDF ↗
EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment
Ruoxi Cheng, Hao-Xuan Ma, Teng Ma, Hongyi Zhang arXiv ↗ PDF ↗
EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images
Jongmin Park, Minh-Quan Viet Bui, Juan Luis Gonzalez, Jaeho Moon, Jihyong Oh, Munchurl Kim arXiv ↗ PDF ↗
Efficient Equivariant Transformer for Self-Driving Agent Modeling
Scott Xu, Dian Chen, Kelvin Wong, Chris Zhang, Kion Fallah, Raquel Urtasun arXiv ↗ PDF ↗
Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodel
Weidong Tang, Zhiyuan Liang, Xinyan Wan, Chen Zhu, Zhaopan Xu, Pengfei Zhou, Yan Song, Yang You, Wangbo Zhao PDF ↗
Efficient and High-Fidelity Omni Modality Retrieval
Chuong Huynh, Manh Luong, Abhinav Shrivastava arXiv ↗ PDF ↗
Efficient and Training-Free Single-Image Diffusion Models
Haojun Qiu, Kiriakos N. Kutulakos, David B. Lindell PDF ↗
EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy
Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu PDF ↗
Electromagnetic Inverse Scattering from a Single Transmitter
Yizhe Cheng, Chunxun Tian, Haoru Wang, Wentao Zhu, Xiaoxuan Ma, Yizhou Wang arXiv ↗ PDF ↗
End-to-End Language-Action Model for Humanoid Whole Body Control
Yuxuan Wang, Haobin Jiang, Shiqing Yao, Ziluo Ding, Zongqing Lu arXiv ↗ PDF ↗
EnergyAction: Unimanual to Bimanual Composition with Energy-Based Models
Mingchen Song, Xiang Deng, Jie Wei, Dongmei Jiang, Liqiang Nie, Weili Guan arXiv ↗ PDF ↗
Enhancing Part-Level Point Grounding for Any Open-Source MLLMs
Jin-Cheng Jhang, Fu-En Wang, Xin Yang, Nan Qiao, Lu Xia, Min Sun, Cheng-Hao Kuo PDF ↗
Enhancing the Security of Visual Speaker Authentication Based on Dynamic Lip-Print Analysis
Yi He, Lei Yang, Bofan Chen, Shilin Wang PDF ↗
Envisioning the Future, One Step at a Time
Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh, Björn Ommer arXiv ↗ PDF ↗
Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models
Hoigi Seo, Byung Hyun Lee, Jaehyun Cho, Sungjin Lim, Se Young Chun arXiv ↗ PDF ↗
Event Structural Valley: A Unified Theoretical and Practical Framework for Event Camera Autofocus
Xijie Xiang, Lin Zhu, Wei Zhang, Yonghong Tian PDF ↗
Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Dataset
Senyan Xu, Zhijing Sun, Kean Liu, Xin Lu, Ruixuan Jiang, Xueyang Fu, Zheng-Jun Zha arXiv ↗ PDF ↗
Every Error has Its Magnitude: Asymmetric Mistake Severity Training for Multiclass Multiple Instance Learning
Sungrae Hong, Jiwon Jeong, Jisu Shin, Donghee Han, Sol Lee, Kyungeun Kim, Mun Yong Yi arXiv ↗ PDF ↗
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao arXiv ↗ PDF ↗
Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval
Weiqing Li, Jinyue Guo, Yaqi Wang, Haiyang Xiao, Yuewei Zhang, Guohua Liu, Hao Henry Wang arXiv ↗ PDF ↗
ExPose: Reinforcing Video Generation Models for Extreme Pose Estimation
Youngho Yoon, Wonjune Cho, Hyunho Ha, Sujung Kim, Kuk-Jin Yoon PDF ↗
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration
Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan arXiv ↗ PDF ↗
Exploring Spatial Intelligence from a Generative Perspective
Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen arXiv ↗ PDF ↗
Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmark
Lijing Cai, Zhan Shi, Chenglong Huang, Jinyao Wu, Qiping Li, Zikang Huo, Linsen Chen, Chongde Zi, Xun Cao arXiv ↗ PDF ↗
Exploring the Underwater World Segmentation without Extra Training
Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li arXiv ↗ PDF ↗
Exposing and Evaluating Hallucinations for GUI Grounding
Zicheng Zhang, Hongyi Jing, Rui Lv, Shuo Fang, Shiai Zhu, Junying Wang, Chunyi Li, Xiaohong Liu, Chenguang Ma, Guangtao Zhai PDF ↗
ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting
Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li arXiv ↗ PDF ↗
F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentation
Hengzhi Chen, Liqian Feng, Wenhua Wu, Xiaogang Zhu, Qiuxia Wu, Lianlei Shan, Kun Hu arXiv ↗ PDF ↗
FARMER: Flow AutoRegressive Transformer over Pixels
Guangting Zheng, Qinyu Zhao, Tao Yang, Fei Xiao, Zhijie Lin, Jie Wu, Jiajun Deng, Yanyong Zhang, Rui Zhu arXiv ↗ PDF ↗
FBTA: Enabling Single-GPU End-to-End Gigapixel WSI Classification with Feature Bridging and Translation Alignment
Jiuyang Dong, Jiahan Li, Junjun Jiang, Yongbing Zhang PDF ↗
FUN REC * Reconstructing Functional 3D Scenes from Egocentric Interaction Videos
Alexandros Delitzas, Chenyangguang Zhang, Alexey Gavryushin, Tommaso Di Mario, Boyang Sun, Rishabh Dabral, Leonidas Guibas, Christian Theobalt, Marc Pollefeys, Francis Engelmann, Daniel Barath PDF ↗
FailureAtlas: Mapping the Failure Landscape of T2I Models via Active Exploration
Muxi Chen, Zhaohua Zhang, Chenchen Zhao, Mingyang Chen, Wenyu Jiang, Tianwen Jiang, Jianhuan Zhuo, Yu Tang, Qiuyong Xiao, Jihong Zhang, Qiang Xu PDF ↗
Faster-GS: Analyzing and Improving Gaussian Splatting Optimization
Florian Hahlbohm, Linus Franke, Martin Eisemann, Marcus Magnor arXiv ↗ PDF ↗
FedCART: Tackling Long-Tailed Distributions in Federated Adversarial Training via Classifier Refinement
Yuchen Qin, Yizhi Zhou, Junxiao Wang, Xin Xie, Heng Qi PDF ↗
FedMPT: Federated Multi-Label Prompt Tuning of Vision-Language Models
Xucong Wang, Pengkun Wang, Zhe Zhao, Liheng Yu, Shuang Wang, Yang Wang PDF ↗
Federated Active Learning Under Extreme Non-IID and Global Class Imbalance
Chen-Chen Zong, Sheng-Jun Huang arXiv ↗ PDF ↗
Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction
Yisheng He arXiv ↗ PDF ↗
Few-shot Acoustic Synthesis with Multimodal Flow Matching
Amandine Brunetto arXiv ↗ PDF ↗
Fine-Grained GRPO for Precise Preference Alignment in Flow Models
Yujie Zhou, Pengyang Ling, Jiazi Bu, Yibin Wang, Yuhang Zang, Jiaqi Wang, Li Niu, Guangtao Zhai arXiv ↗ PDF ↗
Fine-Grained Multi Image Object Hallucination Benchmark
Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee PDF ↗
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang arXiv ↗ PDF ↗
Fine-VAD: Towards Fine-Grained Video Anomaly Detection via Progressive Cross-Granularity Learning
Menghao Zhang, Yiyan Zhu, Pengfei Ren, Haifeng Sun, Qi Qi, Zirui Zhuang, Huazheng Wang, Lei Zhang, Jianxin Liao, Jingyu Wang PDF ↗
Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks
Zhichao Yang, Jianjie Wang, Zhixianhe Zhang, Pangu Xie, Xiangfei Sheng, Pengfei Chen, Leida Li arXiv ↗ PDF ↗
First Frame Is the Place to Go for Video Content Customization
Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermüller, Brandon Y. Feng, Yiannis Aloimonos arXiv ↗ PDF ↗
FisherPoser: Human Motion Estimation from Sparse Observations with Hierarchical Region-Wise Fisher-Matrix Uncertainty Modeling
Songpengcheng Xia, Qingyu Zhang, Zhuo Su, Jiarui Yang, Zengyuan Lai, Qi Wu, Ling Pei PDF ↗
FlashIn: Fast and Accurate Image Inversion for Real-time Image Editing
Guangzhi Wang PDF ↗
FloVerse: Floor Plan-Guided Multi-Modal Navigation
Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang PDF ↗
FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing
Yilei Jiang, Zhen Wang, Yanghao Wang, Jun Yu, Yueting Zhuang, Jun Xiao, Long Chen arXiv ↗ PDF ↗
FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching
Fengyuan Zuo, Haiyan Jin, Yuanlin Zhang, Zhaolin Xiao, Bin Wang, Yuerong Mu PDF ↗
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
Zhen Wang, Youcan Xu, Jun Xiao, Long Chen arXiv ↗ PDF ↗
FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstruction
Yuqiu Liu, Jialin Song, Marissa Ramirez de Chanlatte, Rochishnu Chowdhury, Rushil Paresh Desai, Wuyang Chen, Daniel Martin, Michael W. Mahoney arXiv ↗ PDF ↗
FoV-Net: Rotation-Invariant CAD B-rep Learning via Field-of-View Ray Casting
Matteo Ballegeer, Dries F. Benoit arXiv ↗ PDF ↗
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
You Li, Dewei Zhou, Fan Ma, Fu Li, Dongliang He, Yi Yang arXiv ↗ PDF ↗
ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videos
Yuantao Chen, Jiahao Chang, Chongjie Ye, Chaoran Zhang, Zhaojie Fang, Chenghong Li, Xiaoguang Han arXiv ↗ PDF ↗
Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction
Jiahao Tian, Chenxi Song, Wei Cheng, Chi Zhang PDF ↗
FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario
Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong arXiv ↗ PDF ↗
FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Model
Shiyu Qin, Yongkang Lu, Yimin Zhou, Jiawei Li, Yifan Ren, Yuerong Xue, Shu-Tao Xia, Bin Chen PDF ↗
Frequency Switching Mechanism for Parameter-Efficient Multi-Task Learning
Shih-Wen Liu, Yen-Chang Chen, Wei-Ta Chu, Fu-En Yang, Yu-Chiang Frank Wang PDF ↗
Frequency-Aware Affinity for Weakly Supervised Semantic Segmentation
Ziqian Yang, Xianglin Qiu, Xinqiao Zhao, Xiaolei Wang, Quan Zhang, Jimin Xiao PDF ↗
From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
Ling Wang, Yunfan Lu, Wenzong Ma, Huizai Yao, Pengteng Li, Hui Xiong arXiv ↗ PDF ↗
From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu arXiv ↗ PDF ↗
From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos arXiv ↗ PDF ↗
From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesis
Ranran Huang, Weixun Luo, Ye Mao, Krystian Mikolajczyk arXiv ↗ PDF ↗
From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings
Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner arXiv ↗ PDF ↗
From Rays to Projections: Better Inputs for Feed-Forward View Synthesis
Zirui Wu, Zeren Jiang, Martin R. Oswald, Jie Song arXiv ↗ PDF ↗
From Spots to Pixels: Dense Spatial Gene Expression Prediction from Histology Images
Ruikun Zhang, Yan Yang, Liyuan Pan arXiv ↗ PDF ↗
Functional Mean Flow in Hilbert Space
Zhiqi Li, Yuchen Sun, Greg Turk, Bo Zhu arXiv ↗ PDF ↗
Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization
Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang arXiv ↗ PDF ↗
G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval
Jiyoung Lim, Heejae Yang, Jee-Hyong Lee arXiv ↗ PDF ↗
GDFA: Geometry-Driven Federated Unlearning with Directional Task Vector Alignment
Xiuting Weng, Ruizhi Pu, Yuanhang Yao, Kun Yue, Zhiwen Tang, Lixing Yu PDF ↗
GR-Gauge: Cost-efficient Training Configuration By Gauging the Gradient Redundancy
Guanjie Wang, Chen Chen PDF ↗
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang arXiv ↗ PDF ↗
GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents
Mengtian Li, Fan Yang, Ruixue Xiong, Yiyan Fan, Zhifeng Xie, Zeyu Wang arXiv ↗ PDF ↗
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
Yuanzhe Li, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Sheng Lu arXiv ↗ PDF ↗
Gated KalmaNet: A Fading Memory Layer through Test-time Ridge Regression
Liangzu Peng, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez, Wei Xia, Stefano Soatto arXiv ↗ PDF ↗
GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression
Ruoke Yan, Mingjia Yang, Xinfeng Zhang, Haocheng Tang, Qian Yin, Zhipin Deng, Kai Zhang, Li Zhang, Siwei Ma PDF ↗
GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic Segmentation
Qi Zang, Dong Zhao, Nan Pu, Wenjing Li, Zhun Zhong, Meng Wang PDF ↗
Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction
Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, Yiyi Liao arXiv ↗ PDF ↗
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
Yuhuan Yang, Xianwei Zhuang, Yuxuan Cai, Chaofan Ma, Shuai Bai, Jiangchao Yao, Ya Zhang, Junyang Lin, Yanfeng Wang arXiv ↗ PDF ↗
Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Tracking
Jie Xiao, Yinchao Ma, Yuyang Tang, Dengqing Yang, Jianpeng Yang, Xu Zhou, Qiao Li, Wenfei Yang, Tianzhu Zhang PDF ↗
Generalizable Video Quality Assessment via Weak-to-Strong Learning
Linhan Cao, Wei Sun, Xiangyang Zhu, Kaiwei Zhang, Jun Jia, Yicong Peng, Dandan Zhu, Guangtao Zhai, Xiongkuo Min PDF ↗
Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization
Ray Zhang, Marcus Greiff, Thomas Lew, John Subosits arXiv ↗ PDF ↗
Generative Modeling of Weights: Generalization or Memorization?
Boya Zeng, Yida Yin, Zhiqiu Xu, Zhuang Liu arXiv ↗ PDF ↗
Generative Video Compression with One-Dimensional Latent Representation
Zihan Zheng, Zhaoyang Jia, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Zhenghao Chen, Houqiang Li, Yan Lu arXiv ↗ PDF ↗
GeoFree-CoSeg: Unsupervised Point Cloud-Image Cross-Modal Co-Segmentation Without Geometric Alignment
Xin Duan, Xiabi Liu, Liyuan Pan PDF ↗
GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Acceleration
Chaoqun Sun, Zongjing Fu, Powei Chang, Jinpeng Zhang, Jianxiang Xiang, Yukang Gao, Chenyu Wang PDF ↗
Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
Jingxuan Wei, Caijun Jia, Qi Chen, Honghao He, Linzhuang Sun, Conghui He, Lijun Wu, Bihui Yu, Cheng Tan arXiv ↗ PDF ↗
Geometric Neural Distance Fields for Learning Human Motion Priors
Zhengdi Yu, Simone Foti, Linguang Zhang, Amy Zhao, Cem Keskin, Stefanos Zafeiriou, Tolga Birdal arXiv ↗ PDF ↗
Geometry-Aligned and Anomaly-Aware Reconstruction for 3D Anomaly Detection
Linchun Wu, Qin Zou, Yuanhao Yue, Zhongyuan Wang PDF ↗
Global Information Thresholding for Sufficient and Necessary Circuits
Jegyeong Cho PDF ↗
Globally Optimal Pose from Orthographic Silhouettes
Agniva Sengupta, Dilara Kus, Jianning Li, Stefan Zachow arXiv ↗ PDF ↗
Gloria: Consistent Character Video Generation via Content Anchors
Yuhang Yang, Fan Zhang, Huaijin Pi, Ailing Zeng, Shuai Guo, Guowei Xu, Wei Zhai, Yang Cao, Zheng-Jun Zha arXiv ↗ PDF ↗
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao arXiv ↗ PDF ↗
Goldilocks Test Sets for Face Verification
Haiyu Wu, Sicong Tian, Aman Bhatta, Jacob Gutierrez, Grace Bezold, Genesis Argueta, Karl Ricanek, Michael C. King, Kevin Bowyer arXiv ↗ PDF ↗
GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologies
Uzair Shah, Marco Agus, Mahmoud Gamal, Mahmood Alzubaidi, Corrado Cali, Pierre J. Magistretti, Abdesselam Bouzerdoum, Mowafa Househ arXiv ↗ PDF ↗
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan arXiv ↗ PDF ↗
Grounded 3D-Aware Spatial Vision-Language Modeling
An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu PDF ↗
GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu arXiv ↗ PDF ↗
Guiding a Diffusion Transformer with the Internal Dynamics of Itself
Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu arXiv ↗ PDF ↗
HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning
Xuerui Zhang, Xuehao Wang, Zhan Zhuang, Linglan Zhao, Ziyue Li, Xinmin Zhang, Zhihuan Song, Yu Zhang arXiv ↗ PDF ↗
HAVE-Bench: Hierarchical Audio-Visual Evaluation from Perception to Interaction
Muyan Zhong, Erfei Cui, Sen Xing, Weiyun Wang, Wen Wu, Yuchen Hu, Yanting Zhang, Xiaowei Hu, Wenhai Wang, Chao Zhang, Jifeng Dai PDF ↗
HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm
Jie-En Yao, Hong-En Chen, C.-C. Jay Kuo PDF ↗
HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading
Hao Yuan, Jiabin Zhang, Yajing Wu, Ruixuan Pang, Jing Li PDF ↗
HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
Chao Yang, Boqian Zhang, Jinghao Xu, Guang Jiang arXiv ↗ PDF ↗
HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps
Xuchang Zhong, Xu Cao, Jinke Feng, Hao Fang arXiv ↗ PDF ↗
HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement
Xinlong Li, Di Lin, Shaoyiyi Gao, Yaxuan Liu, Jixian He, Jiaxin Li, Ruonan Liu, Qing Guo, Kairui Yang, Wei Feng PDF ↗
HP-Edit: A Human-Preference Post-Training Framework for Image Editing
Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo arXiv ↗ PDF ↗
HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation
Chengjie Fan, Cong Pan, Zijian Liu, Ningzhong Liu, Jie Qin arXiv ↗ PDF ↗
HTTM: Head-wise Temporal Token Merging for Faster VGGT
Weitian Wang, Lukas Meiner, Rai Shubham, Cecilia De La Parra, Akash Kumar arXiv ↗ PDF ↗
HamiPose: Hamiltonian Optimization for Unsupervised Domain Adaptive Pose Estimation
Jiawen Li, Fei Jiang, Dandan Zhu, Aimin Zhou PDF ↗
Harmonic Canvas: Inversion-Free Editing for Visually-Guided Music Style Transfer
Yue Lei, Siqi Yang, Ting Zhong, Fan Zhou PDF ↗
Harmonized Feature Conditioning and Frequency-Prompt Personalization for Multi-Rater Medical Segmentation
Sanaz Karimijafarbigloo, Armin Khosravi, Alireza Kheyrkhah, Reza Azad, Mauricio Reyes, Dorit Merhof arXiv ↗ PDF ↗
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi arXiv ↗ PDF ↗
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
Honglu Zhang, Zhiqin Fang, Ningning Zhao, Saihui Hou, Long Ma, Renwang Pei, Zhaofeng He arXiv ↗ PDF ↗
Harnessing the Power of Foundation Models for Accurate Material Classification
Qingran Lin, Fengwei Yang, Chaolun Zhu arXiv ↗ PDF ↗
HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
Jiashu Li, Xumeng Han, Zhaoyang Wei, Zipeng Wang, Kuiran Wang, Guorong Li, Zhenjun Han, Jianbin Jiao arXiv ↗ PDF ↗
Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphs
Pei An, Junfeng Ding, Jiaqi Yang, Yulong Wang, Jie Ma, Liangliang Nan arXiv ↗ PDF ↗
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
Hongji Yang, Yucheng Zhou, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen arXiv ↗ PDF ↗
Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation
Wenhan Lv, Shaopan Wang, Xiangyu Wu, Tianchu Hang, Zhongquan Jian, Qingqiang Wu PDF ↗
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu arXiv ↗ PDF ↗
Hierarchically Robust Zero-shot Vision-language Models
Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz arXiv ↗ PDF ↗
High-Fidelity Mobile Avatars with Pruned Local Blendshapes
Youyi Zhan, He Wang, Tianjia Shao, Kun Zhou arXiv ↗ PDF ↗
High-Quality and Efficient Turbulence Mitigation with Events
Xiaoran Zhang, Jian Ding, Yuxing Duan, Haoyue Liu, Gang Chen, Yi Chang, Luxin Yan arXiv ↗ PDF ↗
Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning
Ruoran Xu, Haoyu Cheng, Bin Dong, Qiufeng Wang arXiv ↗ PDF ↗
Hint2Gen: Bridging Understanding and Generation via Code-structured Hints
Yuanpeng Tu, Yunpeng Chen, Xi Chen, Liang Li, Hengshuang Zhao PDF ↗
HoneyBee: Data Recipes for Vision-Language Reasoners
Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru arXiv ↗ PDF ↗
HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles
Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang arXiv ↗ PDF ↗
HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models
Yangguang Lin, Quan Fang, Yufei Li, Jiachen Sun, Junyu Gao, Jitao Sang arXiv ↗ PDF ↗
Human Geometry Distribution for 3D Animation Generation
Xiangjun Tang, Biao Zhang, Peter Wonka arXiv ↗ PDF ↗
HumanBA: Human-Aware Bundle Adjustment via Global Human-Camera Decoupling
Fengyuan Yang, Tanuj Sur, Tze Ho Elden Tse, Angela Yao PDF ↗
Humanoid Generative Pre-Training for Zero-Shot Motion Tracking
Zekun Qi, Xuchuan Chen, Jilong Wang, Chenghuai Lin, Yunrui Lian, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi PDF ↗
HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning
Eunju Lee, MiHyeon Kim, JuneHyoung Kwon, Yoonji Lee, JiHyun Kim, Soojin Jang, YoungBin Kim arXiv ↗ PDF ↗
HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving
Yipene Cedric Francois Bassole, Sungwoo Kim, Jiwoo Jung, Yunsick Sung PDF ↗
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
Jindi Lv, Yuhao Zhou, Yuxin Tian, Qing Ye, Wentao Feng, Jiancheng Lv arXiv ↗ PDF ↗
Hyperbolic Gramian Volumes for Multimodal Alignment
Saiyang Na, Feng Jiang, Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Yuzhi Guo, Hehuan Ma, Chunyuan Li, Weizhi An, Junzhou Huang PDF ↗
I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers
Youngjun Jun, Seil Kang, Woojung Han, Seong Jae Hwang PDF ↗
I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
Lu Ling, Yunhao Ge, Yichen Sheng, Aniket Bera arXiv ↗ PDF ↗
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai, Xuhong Zhang, Jianwei Yin arXiv ↗ PDF ↗
ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects
Jing Yang, Krithika Dharanikota, Emily Jia, Haiwei Chen, Yajie Zhao arXiv ↗ PDF ↗
ID-Sim: An Identity-Focused Similarity Metric
Julia Chae, Nicholas Kolkin, Jui-Hsien Wang, Richard Zhang, Sara Beery, Cusuh Ham arXiv ↗ PDF ↗
IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splatting
Wei Long, Haifeng Wu, Shiyin Jiang, Jinhua Zhang, Xinchun Ji, Shuhang Gu arXiv ↗ PDF ↗
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan arXiv ↗ PDF ↗
Illustrator's Depth: Monocular Layer Index Prediction for Image Decomposition
Nissim Maruani, Peiying Zhang, Siddhartha Chaudhuri, Matthew Fisher, Nanxuan Zhao, Vladimir G. Kim, Pierre Alliez, Mathieu Desbrun, Wang Yifan PDF ↗
Image Diffusion Preview with Consistency Solver
Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao arXiv ↗ PDF ↗
Imbalanced View Contribution Evaluation and Refinement for Deep Incomplete Multi-View Clustering
Taichun Zhou, Zhibin Dong, Hao Tan, Siwei Wang, Xinwang Liu, En Zhu, Di Hu, Tianrui Liu, Chuankun Li, Kunlun He PDF ↗
Immunizing Models Against Harmful Long-Horizon Fine-Tuning via Contractive Optimization Dynamics
Najibul Haque Sarker, Zaber Ibn Abdul Hakim, Ali Asgarov, Chia-Wei Tang, Alvi Md Ishmam, Chris Thomas PDF ↗
Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining
Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee arXiv ↗ PDF ↗
Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee arXiv ↗ PDF ↗
Improving Vision-language Models with Perception-centric Process Reward Models
Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen arXiv ↗ PDF ↗
Inconsistency-aware Multimodal Schrodinger Bridge for Deepfake Localization
Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue PDF ↗
InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation
Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law arXiv ↗ PDF ↗
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings
Yunxiang Peng, Mengmeng Ma, Ziyu Yao, Xi Peng arXiv ↗ PDF ↗
InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding
Ashutosh Kumar, Rajat Saini, Jingjing Pan, Mustafa Erdogan, Mingfang Zhang, Betty Le Dem, Norimasa Kobori, Quan Kong arXiv ↗ PDF ↗
InterRVOS: Interaction-Aware Referring Video Object Segmentation
Woojeong Jin, Seongchan Kim, Jaeho Lee, Seungryong Kim arXiv ↗ PDF ↗
Intrinsic Concept Extraction Based on Compositional Interpretability
Hanyu Shi, Hong Tao, Guoheng Huang, Jianbin Jiang, Xuhang Chen, Chi-Man Pun, Shanhu Wang, Pan Pan arXiv ↗ PDF ↗
Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting
Kaiqiang Xiong, Rui Peng, Jiahao Wu, Zhanke Wang, Jie Liang, Xiaoyun Zheng, Feng Gao, Ronggang Wang arXiv ↗ PDF ↗
InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models
Shunsuke Sakai, Xiangteng He, Chunzhi Gu, Leonid Sigal, Tatsuhito Hasegawa arXiv ↗ PDF ↗
Investigating Self-Supervised Representations for Audio-Visual Deepfake Detection
Dragos-Alexandru Boldisor, Stefan Smeu, Dan Oneata, Elisabeta Oneata arXiv ↗ PDF ↗
Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation
Xinhao Cai, Gensheng Pei, Zeren Sun, Yazhou Yao, Fumin Shen, Wenguan Wang arXiv ↗ PDF ↗
Is the Modality Gap a Bug or a Feature? A Robustness Perspective
Rhea Chowers, Oshri Naparstek, Udi Barzelay, Yair Weiss arXiv ↗ PDF ↗
It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models
Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik, Trevor Darrell, Alexei A. Efros PDF ↗
JRM: Joint Reconstruction Model for Multiple Objects without Alignment
Qirui Wu, Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Richard Newcombe, Angel X. Chang, Jakob Engel, Henry Howard-Jenkins arXiv ↗ PDF ↗
Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injection
Jiacheng Pi, Zhiguo Yang, Xingxing Huang, Dongsheng Xu, Ruizhi Zhong, Wenjie Ruan PDF ↗
JoPPO: Hierarchical Photography Assessment via Contrastive Joint Conditional Probabilistic Reinforcement Learning
Yifan Yang, Juntuo Wang, Yuming Qiao, Xudong Zhang, Chunyang Yu, Yan Li, Xiao Lin, Liang Luo, Dan Meng PDF ↗
KaLOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks
David Tschirschwitz, Volker Rodehorst PDF ↗
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models
Jaeyun Jang, Seunghui Shin, Taeho Park, Hyoseok Hwang arXiv ↗ PDF ↗
Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
Rishubh Parihar, Or Patashnik, Daniil Ostashev, Venkatesh Babu Radhakrishnan, Daniel Cohen-Or, Kuan-Chieh Jackson Wang arXiv ↗ PDF ↗
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map
Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang arXiv ↗ PDF ↗
LATTICE: Democratize High-Fidelity 3D Generation at Scale
Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Haolin Liu, Qingxiang Lin, Jingwei Huang, Chunchao Guo, Xiangyu Yue arXiv ↗ PDF ↗
LIBERO-Plus: A Progressive Robustness Benchmark for Visual-Language-Action Models
Senyu Fei, Siyin Wang, Junhao Shi, Zihao Dai, Jikun Cai, Pengfang Qian, Li Ji, Xinzhe He, Shiduo Zhang, Zhaoye Fei, Jinlan Fu, Jingjing Gong, Xipeng Qiu PDF ↗
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
Zebin You, Shen Nie, Xiaolu Zhang, JUN ZHOU, Zhiwu Lu, Ji-Rong Wen, Chongxuan Li arXiv ↗ PDF ↗
LNEM: Lunar Neural Elevation Model
Suwan Lee, Jo Ryeong Yim, Kibaek Park, Dong-Gyu Kim, Eunhyeuk Kim, Minsup Jeong, Chae Kyung Sim, Seokju Lee PDF ↗
LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imaging
He Huang, Yujun Guo, Wei He arXiv ↗ PDF ↗
LRHDR: Learning Representation-enhanced HDR Video Reconstruction
Chenzhuo Liao, Xin Chen, Bingchen Li, Yu Meng, Tao Yue, Xuemei Hu PDF ↗
LUMINA: A Multi-Vendor Mammography Benchmark with Energy Harmonization Protocol
Hongyi Pan, Gorkem Durak, Halil Ertugrul Aktas, Andrea M. Bejar, Baver Tutun, Emre Uysal, Ezgi Bulbul, Mehmet Fatih Dogan, Berrin Erok, Berna Akkus Yildirim, Sukru Mehmet Erturk, Ulas Bagci arXiv ↗ PDF ↗
LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokens
Qingsong Xie, Luyuan Zhang, Zhao Zhang, Siyuan Li, Zhe Huang, Zhenyu Yang, Haonan Lu PDF ↗
Language Models Can Explain Visual Features via Steering
Javier Ferrando, Enrique Lopez-Cuena, Pablo Agustin Martin-Torres, Daniel Hinjos, Anna Arias-Duart, Dario Garcia-Gasulla PDF ↗
Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction
Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing LYU, Chun Yuan, Fengyun Rao arXiv ↗ PDF ↗
Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularization
Mohammadjavad Matinkia, Nilanjan Ray PDF ↗
Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision
Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz arXiv ↗ PDF ↗
Learning Latent Concepts for Detecting Out-of-Distribution Objects
Ting Peng, Junhao Dong, Yew-Soon Ong PDF ↗
Learning What Helps: Task-Aligned Context Selection for Vision Tasks
Jingyu Guo, Emir Konuk, Fredrik Strand, Christos Matsoukas, Kevin Smith arXiv ↗ PDF ↗
Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency
Hakan Emre Gedik, Shashank Gupta, Alan Bovik PDF ↗
Learning and Aligning Click-Aware Shape Prior for Interactive Amodal Instance Segmentation
Junjie Chen, Junwei Lin, Ren Hong, Shengjie Liu, Yuming Fang, Feng Qian, Yifan Zuo PDF ↗
Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation
Imanol G. Estepa, Jesús M. Rodríguez-de-Vera, Bhalaji Nagarajan, Petia Radeva PDF ↗
Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation
Simone Mosco, Daniel Fusaro, Alberto Pretto arXiv ↗ PDF ↗
Learning to Infer Parameterized Representations of Plants from 3D Scans
Samara Ghrer, Christophe Godin, Stefanie Wuhrer arXiv ↗ PDF ↗
Lens Component Deletion based on Differentiable Ray Tracing
Wenguan Zhang, Qirun Zhang, Tuo Sun, Jiajian He, Jiahui Xu, Huajun Feng, Qi Li PDF ↗
Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation
Shihan Cheng, Nilesh Kulkarni, David Hyde, Dmitriy Smirnov arXiv ↗ PDF ↗
Leveraging Multispectral Sensors for Color Correction in Mobile Cameras
Luca Cogo, Marco Buzzelli, Simone Bianco, Javier Vazquez-Corral, Raimondo Schettini arXiv ↗ PDF ↗