CVPR2026 Notes TODO¶
Total: 4068 | Completed: 4068 | Pending: 0
- \(\alpha\)Matte4K & \(\mu\)Matting: Dataset and Model for Ultra-Micro Precision Alpha Video Matting
- \(\varphi\)-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models | arXiv: 2602.22601
- \(L^{2}DGS\): Low-Light Dynamic Gaussian Splatting
- 2-Shots in the Dark: Low-Light Denoising with Minimal Data Acquisition
- 240FPS Stereo Vision from Monocular Mixed Spikes
- 2D-LFM: Lifting Foundation Model without 3D Supervision
- 2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching | arXiv: 2506.05398
- 3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors
- 3D Gaussian Splatting with Self-Constrained Priors for High Fidelity Surface Reconstruction | arXiv: 2603.19682
- 3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds | arXiv: 2512.23042
- 3D Space as a Scratchpad for Editable Text-to-Image Generation
- 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation
- 3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding
- 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image | arXiv: 2604.04406
- 3D-IDE: 3D Implicit Depth Emergent | arXiv: 2604.03296
- 3D-LATTE: Latent Space 3D Editing from Textual Instructions
- 3D-Object Perception Transformer (3PT)
- 3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
- 3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience | arXiv: 2604.08042
- 3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects | arXiv: 2605.10204
- 3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion | arXiv: 2511.19117
- 4C4D: 4 Camera 4D Gaussian Splatting | arXiv: 2604.04063
- 4D Local Modeling Toward Dynamic Global Perception for Ambiguity-free Rotation-Invariant Point Cloud Analysis
- 4D Primitive-Mâché: Glueing Primitives for Persistent 4D Scene Reconstruction
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation | arXiv: 2512.17012
- 4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video | arXiv: 2603.10125
- 4DP-QA: Scalable QA for 4D Perception in Vision Language Models
- 4DSurf: High-Fidelity Dynamic Scene Surface Reconstruction | arXiv: 2603.28064
- 4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models
- A Bit is All You Need! Efficient Video Capture via Single Bit Imaging
- A Causal Marriage between VLM and IRM from Understanding to Reasoning
- A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks | arXiv: 2603.12998
- A Closer Look at Cross-Domain Few-Shot Object Detection: Fine-Tuning Matters and Parallel Decoder Helps | arXiv: 2603.28182
- A Combination of Noise and Bilateral Filters Achieve Supralinear and Scalable Adversarial Robustness in CNNs
- A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation
- A Debiased Reconstruction-based Framework for Training-Free Detection of AI-Generated Images
- A Difference-in-Difference Approach to Detecting AI-Generated Images
- A Faster Path to Continual Learning
- A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens | arXiv: 2604.04913
- A Mixed Diet Makes DINO An Omnivorous Vision Encoder | arXiv: 2602.24181
- A More Word-like Image Tokenization for MLLMs
- A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning | arXiv: 2603.14052
- A Polynomial Chaos Framework for Causal Discovery in Nonlinear Uncertain Systems
- A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models
- A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World
- A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- A Semantically Disentangled Unified Model for Multi-category 3D Anomaly Detection | arXiv: 2603.25159
- A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking | arXiv: 2511.17805
- A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- A Supervised Multi-task Framework for Joint cryo-ET Restoration Enabled by Generative Physical Simulation
- A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation
- A Training-Free Style-Personalization via SVD-Based Feature Decomposition
- A Unified Framework for Knowledge Transfer in Bidirectional Model Scaling
- A Unified Perspective on Adversarial Membership Manipulation in Vision Models | arXiv: 2604.02780
- A2GC: Asymmetric Aggregation with Geometric Constraints for Locally Aggregated Descriptors
- A3: Towards Advertising Aesthetic Assessment | arXiv: 2603.24037
- Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
- Accelerating Autoregressive Video Diffusion via History-Guided Cache and Residual Correction
- Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling
- Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep
- Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
- ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation | arXiv: 2603.02945
- AceTone: Bridging Words and Colors for Conditional Image Grading | arXiv: 2604.00530
- ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
- ACPV-Net: All-Class Polygonal Vectorization for Seamless Vector Map Generation from Aerial Imagery | arXiv: 2603.16616
- Act Like a Pathologist: Tissue-Aware Whole Slide Image Reasoning | arXiv: 2603.00667
- Act2See: Emergent Active Visual Perception for Video Reasoning | arXiv: 2605.01657
- ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars
- Action Motifs: Self-Supervised Hierarchical Representation of Human Body Movements
- Action-Sketcher: From Reasoning to Action via Visual Sketches for Robotic Manipulation
- ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion | arXiv: 2601.16148
- Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models | arXiv: 2603.25250
- Active Inference for Micro-Gesture Recognition: EFE-Guided Temporal Sampling and Adaptive Learning | arXiv: 2603.07559
- Active Intelligence in Video Avatars via Closed-loop World Modeling
- Active Perceptual Inference: A Corticothalamic-Inspired Dynamic Nested Recurrent Network for Multimodal Sentiment Analysis with Incomplete Data
- ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving
- ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-based Model | arXiv: 2511.12795
- ActivePolicy: Active Gaussian Reconstruction and Optimization Strategy Based on Global-Local Information Gain
- ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
- ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos | arXiv: 2604.03819
- AcTTA: Rethinking Test-Time Adaptation via Dynamic Activation | arXiv: 2603.26096
- AD-GBC: Anisotropic Granular-Ball Skip-Connection Refiner for UNet-Based Medical Image Segmentation
- AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks | arXiv: 2510.03101
- AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation | arXiv: 2604.18348
- AdaDexTrack: Dynamic Modulation for Adaptive and Generalizable Dexterous Manipulation Tracking
- AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM
- AdapAction: Adaptive Target Action Backdoor Attack against GUI Agents
- AdaPrior: Bayesian-Inspired Adaptive Prior Correction for Long-Tailed Continual Learning
- Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation
- Adapting In-context Generation for Enhanced Composed Image Retrieval
- Adapting Lightweight Image-based Counting Models for Video Crowd Counting
- Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning | arXiv: 2603.22070
- Adaptive 3D Perception for Small Aerial Targets Under Sparse Sampling via Reinforcement Learning
- Adaptive Action Chunking at Inference-time for Vision-Language-Action Models | arXiv: 2604.04161
- Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance
- Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation | arXiv: 2603.19158
- Adaptive Bayesian Early-Exit Networks for Efficient Non-Transferable Learning
- Adaptive Capacity Autoregressive Visual Tracking
- Adaptive Confidence Regularization for Multimodal Failure Detection | arXiv: 2603.02200
- Adaptive Data Augmentation with Multi-armed Bandit: Sample-Efficient Embedding Calibration for Implicit Pattern Recognition
- Adaptive Depth Lightweight RGB-T Tracking with Holistic Token Routing
- Adaptive Learned Image Compression with Graph Neural Networks | arXiv: 2603.25316
- Adaptive Spatial-Temporal Window: Unlocking the Potential of Event Cameras in Heterogeneous Velocity Scenarios
- Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration | arXiv: 2603.01623
- Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation
- AdapTok: Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space
- AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition | arXiv: 2512.03794
- AdaRadar: Rate Adaptive Spectral Compression for Radar-based Perception | arXiv: 2603.17979
- AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments | arXiv: 2603.25494
- AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding | arXiv: 2604.08077
- AdaSpot: Spend Resolution Where It Matters for Precise Event Spotting
- AdaSVD: Singular Value Decomposition with Adaptive Mechanisms for Large Multimodal Models
- Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning | arXiv: 2605.25799
- ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning
- Advancing Cancer Prognosis with Hierarchical Fusion of Genomic, Proteomic and Pathology Imaging Data from a Systems Biology Perspective
- Advancing Image Classification with Discrete Diffusion Classification Modeling
- Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
- AdvFM: Lookahead Flow-Matching Velocity-Field Attacks for Imperceptible and Transferable Adversarial Examples
- AdvMark: Decoupling Defense Strategies for Robust Image Watermarking | arXiv: 2602.20053
- AE2VID: Event-based Video Reconstruction via Aperture Modulation
- AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM
- AeroAgent: A Vision-Physics-Decision Framework for Aerodynamic Vehicle Design
- AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction | arXiv: 2602.22376
- AeroGS: Scale-Aware Gaussian Splatting for Pose-Free Dynamic UAV Scene Reconstruction
- Aesthetic Camera Viewpoint Suggestion with 3D Aesthetic Field
- Affine Perspective-Three-Point Problem
- Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
- Affordance-First Decomposition for Continual Learning in Video–Language Understanding
- AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
- AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis | arXiv: 2603.08021
- AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers | arXiv: 2603.27970
- Affostruction: 3D Affordance Grounding with Generative Reconstruction | arXiv: 2601.09211
- AFRO: Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning | arXiv: 2512.00074
- AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models
- Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection
- AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection
- Agentic Retoucher for Text-To-Image Generation | arXiv: 2601.02046
- Agentic Video Summarization via Self-Reflecting Multimodal Understanding
- AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions
- AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models | arXiv: 2603.29410
- Agile Deliberation: Concept Deliberation for Subjective Visual Classification
- AGiLe: Learning Robust Long-Horizon Manipulation via Affordance-Grounded Bidirectional Latent Planning
- AHS: Adaptive Head Synthesis via Synthetic Data Augmentations | arXiv: 2604.15857
- AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth Estimation
- Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval | arXiv: 2604.19386
- AirSim360: A Panoramic Simulation Platform within Drone View
- AKCMamba-YOLO: Selective State Space Models For Real-Time Object Detection
- AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
- Alert-CLIP: Abnormality-aware Latent-Enhanced Representation Tuning of CLIP for Video Anomaly Detection
- Align Images Before You Generate
- Align Once to Explain: Feature Alignment for Scalable B-cosification of Foundational Vision Transformers
- Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents
- Aligning Multi-Character Narrative Image Generation with Multi-Aspect Human Preferences
- Aligning Text, Images and 3D Structure Token-by-Token
- Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow | arXiv: 2604.15809
- AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment | arXiv: 2512.20538
- All in One: Unifying Deepfake Detection, Tampering Localization, and Source Tracing with a Robust Landmark-Identity Watermark | arXiv: 2602.23523
- All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
- All Vehicles Can Lie: Efficient Adversarial Defense in Fully Untrusted-Vehicle Collaborative Perception via Pseudo-Random Bayesian Inference | arXiv: 2603.08498
- All-in-One Slider for Attribute Manipulation in Diffusion Models | arXiv: 2508.19195
- ALLNet: Multi-task Dense Prediction for Degraded Images
- AMap: Distilling Future Priors for Ahead-Aware Online HD Map Construction
- AMB3R: Accurate Feed-forward Metric-scale 3D Reconstruction with Backend
- AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding
- An Efficient Token Compression Framework for Visual Object Tracking
- An Empirical Study on How Video-LLMs Answer Video Questions
- An Instance-Centric Panoptic Occupancy Prediction Benchmark for Autonomous Driving | arXiv: 2603.27238
- An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning | arXiv: 2211.16780
- Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models
- Anatomical Domain Shifts: Test-time Heterogeneous Adaptation for 3D Human Pose Prediction
- Anchor-Guided Gradient Alignment for Incomplete Multimodal Learning
- AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
- Anchoring and Rescaling Attention for Semantically Coherent Inbetweening | arXiv: 2603.17651
- Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks
- AnchorSplat: Feed-Forward 3D Gaussian Splatting with 3D Geometric Priors | arXiv: 2604.07053
- Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling | arXiv: 2602.19089
- Animator-Centric Skeleton Generation on Objects with Fine-Grained Details
- AniMimic: Imitating 3D Animation from Video Priors
- Annotation-Efficient Coreset Selection for Context-dependent Segmentation
- Anomaly as Non-Conformity via Training-Free Graph Laplacian Energy Minimization | arXiv: 2605.28428
- Anomaly-Related Residual Fields for Cross-domain Anomaly Detection
- AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors | arXiv: 2601.20524
- AnthroTAP: Learning Point Tracking with Real-World Motion | arXiv: 2507.06233
- Anti-Degradation Lifelong Multi-View Clustering
- Anti-I2V: Safeguarding your photos from malicious image-to-video generation | arXiv: 2603.24570
- AntiStyler: Defending Object Detection Models Against Adversarial Patch Attacks Using Style Removal
- ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning
- Any Resolution Any Geometry: From Multi-View To Multi-Patch
- Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study | arXiv: 2605.09622
- Any4D: Unified Feed-Forward Metric 4D Reconstruction
- AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization | arXiv: 2603.25118
- AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References
- AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion | arXiv: 2604.17818
- AnyPcc: Compressing Any Point Cloud with a Single Universal Model | arXiv: 2510.20331
- ApET: Approximation-Error Guided Token Compression for Efficient VLMs | arXiv: 2602.19870
- APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation
- APPO: Attention-guided Perception Policy Optimization for Video Reasoning
- Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation | arXiv: 2511.22690
- ARC Is a Vision Problem!
- Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning
- Archon: A Unified Multimodal Model for Holistic Digital Human Generation | arXiv: 2605.30311
- ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
- AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
- ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation
- ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
- ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
- ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation
- ART: Articulated Reconstruction Transformer
- ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions | arXiv: 2603.25791
- ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
- Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects
- ArtLLM: Generating Articulated Assets via 3D LLM | arXiv: 2603.01142
- ArtPro: Self-Supervised Articulated Object Reconstruction with Adaptive Integration of Mobility Proposals
- AR²-4FV: Anchored Referring and Re-identification for Long-Term Grounding in Fixed-View Videos | arXiv: 2603.07758
- Asking like Socrates: Socrates helps VLMs understand remote sensing images | arXiv: 2511.22396
- AssemblyBench: Physics-Aware Assembly of Complex Industrial Objects | arXiv: 2605.12845
- Assignment-Driven Hash Learning in a Hyper-Semantic Space for On-the-Fly Category Discovery
- AstraNav-Memory: Contexts Compression for Long Memory
- AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual Localization
- Asynchronous Temporal Modeling with Two-Agent Framework for Streaming Dense Video Captioning
- AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
- AToken: A Unified Tokenizer for Vision
- AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots | arXiv: 2603.07648
- Attack for Defense: Adversarial Agents for Point Prompt Optimization Empowering Segment Anything Model
- Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing | arXiv: 2603.12254
- Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
- Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models | arXiv: 2604.06052
- Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
- Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping
- Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution | arXiv: 2603.10583
- Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors | arXiv: 2603.15656
- Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
- AudioAvatar: Personalized Audio-driven Whole-body Talking Avatars
- AudioStory: Generating Long-Form Narrative Audio with Large Language Models
- AURA: Multi-modal Shared Autonomy for Urban Navigation
- Authorize-on-Demand: Dynamic Authorization with Legality-Aware Intellectual Property Protection for VLMs
- AutoCut: End-to-end Advertisement Video Editing Based on Multimodal Discretization and Controllable Generation | arXiv: 2603.28366
- AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models | arXiv: 2508.00445
- AutoRegressive Generation with B-rep Holistic Token Sequence Representation
- AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models
- AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
- AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models | arXiv: 2506.09082
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention | arXiv: 2511.18960
- Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation | arXiv: 2601.00664
- AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video | arXiv: 2508.03100
- AvatarPointillist: AutoRegressive 4D Gaussian Avatarization | arXiv: 2604.04787
- AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
- AVGGT: Rethinking Global Attention for Accelerating VGGT
- AviaSafe: A Physics-Informed Data-Driven Model for Aviation Safety-Critical Cloud Forecasts
- AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network | arXiv: 2603.12659
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation | arXiv: 2605.22816
- AXG-Reasoner: Error Detection and Explanation in Long Task Videos with Vision-Language Models
- BA-GS: Bayesian Adaptive Gaussian Splatting for SFM-Free 3D Reconstruction
- BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models | arXiv: 2512.10932
- Back to Basics: Let Denoising Generative Models Denoise
- Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection | arXiv: 2603.21511
- Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation | arXiv: 2604.21772
- Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations
- BackSplit: The Importance of Sub-dividing the Background in Biomedical Lesion Segmentation | arXiv: 2511.19394
- BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
- Balanced Dataset Distillation via Modeling Multiple Visual Pattern Distribution
- Balanced Hierarchical Contrastive Learning with Decoupled Queries for Fine-grained Object Detection in Remote Sensing Images
- BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates | arXiv: 2603.19718
- BAMI: Training-Free Bias Mitigation in GUI Grounding | arXiv: 2605.06664
- BarbieGait: An Identity-Consistent Synthetic Human Dataset with Versatile Cloth-Changing for Gait Recognition | arXiv: 2604.12221
- Basis-Oriented Low-rank Transfer for Few-Shot and Test-Time Adaptation
- Batch Loss Score for Dynamic Data Pruning | arXiv: 2604.04681
- Batman: Benign Knowledge Alignment Through Malicious Null Space in Federated Backdoor Attack
- Bayesian Decomposition and Semantic Completion for Few-shot Semantic Segmentation
- BD-Merging: Bias-Aware Dynamic Model Merging with Evidence-Guided Contrastive Learning | arXiv: 2603.03920
- BDNet: Bio-Inspired Dual-Backbone Small Object Detection Network
- BEA-GS: BEyond RAdiance Supervision in 3DGS for Precise Object Extraction | arXiv: 2605.09662
- BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling | arXiv: 2603.01163
- Benchmarking Endoscopic Surgical Image Restoration and Beyond | arXiv: 2505.19161
- Benchmarking Single-Factor Physical Video-to-Audio Generation | arXiv: 2605.30339
- Best Segmentation Buddies for Image-Shape Correspondence | arXiv: 2605.18193
- Better than Average: Spatially-Aware Aggregation of Segmentation Uncertainty Improves Downstream Performance | arXiv: 2603.29941
- Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
- BEV-CAR: Enhancing Monocular Bird's Eye View Segmentation with Context-Aware Rasterization
- BEV-SLD: Self-Supervised Scene Landmark Detection for Global Localization with LiDAR Bird's-Eye View Images | arXiv: 2603.17159
- Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning | arXiv: 2605.30231
- Beyond [CLS] Token: Query-Driven Token-Level Forgery Purification for Generalizable Deepfake Detection
- Beyond Appearance: Camouflaged Object Detection via Geometric Structure
- Beyond Binary Contrast: Modeling Continuous Skeleton Action Spaces with Transitional Anchors
- Beyond Caption-Based Queries for Video Moment Retrieval | arXiv: 2603.02363
- Beyond Duality: A Hybrid Framework of Leveraging Shared and Private Features for RGB-Event Object Detection
- Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction
- Beyond Euclidean Gossip: KL-Barycentric Consensus on Heterogeneous and Imbalanced Images
- Beyond Explicit Language: Plug-and-Play Visual-to-Linguistic Modeling Toward General Object Tracking
- Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models | arXiv: 2604.26365
- Beyond Geometry: Artistic Disparity Synthesis for Immersive 2D-to-3D | arXiv: 2603.05906
- Beyond Global Similarity: Multi-Conditional Retrieval for Fine-Grained Cross-Modal Understanding
- Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter
- Beyond Ground-Truth: Leveraging Image Quality Priors for Real-World Image Restoration | arXiv: 2603.29773
- Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition | arXiv: 2603.07911
- Beyond Layer-Wise Merging: Chain-of-Merging for Vision-Language Models
- Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation
- Beyond Mimicry: Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations
- Beyond Missing Modalities: Hypergraph Guided Diffusion for Uncertainty-Aware Multimodal Emotion Recognition
- Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
- Beyond Myopic Alignment: Lookahead Optimization for Online Class-Incremental Learning
- Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification | arXiv: 2510.24078
- Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation | arXiv: 2601.01593
- Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs | arXiv: 2605.01324
- Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control | arXiv: 2512.21058
- Beyond Prompt Degradation: Prototype-Guided Dual-Pool Prompting for Incremental Object Detection | arXiv: 2603.02286
- Beyond Reassembly: Fractured Object Recovery with Missing Parts
- Beyond Rule-Based Agents: Active Markov Games for Realistic Multi-Agent Interaction in Autonomous Driving
- Beyond Scanpaths: Graph-Based Gaze Simulation in Dynamic Scenes
- Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval | arXiv: 2604.05393
- Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion
- Beyond Single Images: A Comprehensive Benchmark for Album-Level Vision-Language Understanding
- Beyond Single Solution: Multi-Hypothesis Collaborative Deep Unfolding Network for Image Compressive Sensing | arXiv: 2606.03666
- Beyond Single-View Sufficiency: CVBench for Cross-View Human Understanding
- Beyond Soft Label: Dataset Distillation via Orthogonal Gradient Matching
- Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation
- Beyond Strict Pairing: Arbitrarily Paired Training for High-Performance Infrared and Visible Image Fusion
- Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention
- Beyond Text Prompts: Precise Concept Erasure through Text–Image Collaboration | arXiv: 2604.15829
- Beyond Text: Visual Description Assembly by Probabilistic Model for CLIP-based Weakly Supervised Semantic Segmentation
- Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations | arXiv: 2604.04863
- Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training | arXiv: 2603.25527
- Beyond the Ground Truth: Enhanced Supervision for Image Restoration | arXiv: 2512.03932
- Beyond the Static World: Continual Category Discovery under Visual Drift
- Beyond the Static-World: Lifelong Learning for All-in-One Medical Image Restoration
- Beyond Tie Points: Satellite Image Block Adjustment based on Dense Feature Consistency
- Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability
- Beyond Weak Supervision: MLLMs-Guided Graded Knowledge Distillation for Unsupervised Camouflaged Object Detection
- Beyond What's Shared: Recovering Lost Unique Information from Intermediate Layers to Boost Multimodal Geo-Foundation Models
- Bezier Degradation Modeling for LiDAR-based Human Motion Capture
- BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting | arXiv: 2603.26777
- Bi-Bridge: Bidirectional Diffusion Bridges for Low-Light Image Enhancement
- Bi-directional Autoregressive Diffusion for Large Complex Motion Interpolation
- Bias at the End of the Score
- Bias In, Bias Out? Finding Unbiased Subnetworks in Vanilla Models
- Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models
- Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo
- Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection | arXiv: 2408.13516
- Bidirectional Normalizing Flow: From Data to Noise and Back
- Bidirectional Query-Driven Generation of Parametric CAD Sketch
- BiEvLight: Bi-level Learning of Task-Aware Event Refinement for Low-Light Image Enhancement
- BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation
- BiGain: Unified Token Compression for Joint Generation and Classification | arXiv: 2603.12240
- BiGMINT: Biologically-guided Hierarchical Multimodal Integration for Modeling Multiple Compound Activities in Drug Discovery
- Bilevel Layer-Positioning LoRA for Real Image Dehazing | arXiv: 2603.10872
- BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation | arXiv: 2602.18873
- BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers | arXiv: 2603.09582
- BiomedCCPL: Causal Conditional Prompt Learning for Biomedical Vision-Language Models
- BiOTPrompt: Bidirectional Optimal Transport Guided Prompting for Disease Evolution-aware Radiology Report Generation
- BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment | arXiv: 2603.23883
- BiPA: Bilevel Prompt Adaptation for Underwater Instance Segmentation
- BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration | arXiv: 2603.21679
- BiProLoRA: Bilevel Prompt LoRA for Real Scene Recovery
- BIT: Matching-based Bi-directional Interaction Transformation Network for Visible-Infrared Person Re-Identification
- Black-Box Domain Adaptation for Object Detection with Retention-Driven Knowledge Compression
- Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models | arXiv: 2605.27020
- BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation | arXiv: 2603.05921
- Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding | arXiv: 2512.10548
- Block-based Learned Image Compression without Blocking Artifacts
- Block-Sparse Global Attention for Efficient Multi-View Geometry Transformers
- BluRef: Unsupervised Image Deblurring with Dense-Matching References | arXiv: 2603.14176
- Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
- Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting | arXiv: 2603.16129
- Boosting Reasoning in Large Multimodal Models via Activation Replay | arXiv: 2511.19972
- Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning | arXiv: 2605.06092
- Boosting Vision-Language Models Towards Cross-Domain Incremental Object Detection
- Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior | arXiv: 2604.01570
- Boosting Visual Reprogramming for CLIP with Dual Granularity Alignment
- BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer
- Bootstrap Your Own AV-Proxies: Adaptive Contrastive and Prototype Learning for Audio-Visual Segmentation
- Bootstrapping Multi-view Learning for Test-time Noisy Correspondence
- Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation | arXiv: 2604.10950
- BOP-Ask: Object-Interaction Reasoning for Vision-Language Models | arXiv: 2511.16857
- Boundary-Responsive Differentiable Gating for Superpixel-Based Segmentation
- Breaking Multimodal LLM Safety via Video-Driven Prompting
- Breaking Semantic Boundaries: Distribution-Guided Semantic Exploration for Creative Generation
- Breaking Smooth-Motion Assumptions: A UAV Benchmark for Multi-Object Tracking in Complex and Adverse Conditions
- Breaking Spurious Correlations: Uncertainty-Driven Causal Transformers for AU Detection
- Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping
- Breaking the Continuum: Discrete Distribution Learning for Structural MRI Reconstruction
- Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding | arXiv: 2605.06679
- Breaking the Regional Perception Bottleneck of Multimodal Large Language Models via External Reasoning Framework
- Breaking the Scalability Limit of Multi-Projector Calibration with Embedded Cameras
- BRepGaussian: CAD Reconstruction from Multi-View Images with Gaussian Splatting | arXiv: 2602.21105
- BrepVGAE: Variational Graph Autoencoder with Unified Latent Representation for B-rep
- Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation | arXiv: 2602.19863
- BrickNet: Graph-Backed Generative Brick Assembly | arXiv: 2604.22984
- Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization | arXiv: 2604.26820
- BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections
- Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction | arXiv: 2605.14569
- Bridging Domain Expertise and Generalization for Performance Estimation
- Bridging Domains through Subspace-Aware Model Merging
- Bridging Facial Understanding and Animation via Language Models
- Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- Bridging Human Evaluation to Infrared and Visible Image Fusion
- Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification | arXiv: 2603.26052
- Bridging Privacy and Provenance: Traceable Virtual Identity Generation
- Bridging RGB and Hematoxylin Components: An Interleaved Guidance and Fusion Framework for Point Supervised Nuclei Segmentation
- Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
- Bridging the Modality Gap in Compositional Zero-Shot Learning via Sparse Alignment and Unimodal Memory Bank
- Bridging the Perception Gap in Image Super-Resolution Evaluation | arXiv: 2503.13074
- BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment | arXiv: 2602.19170
- Bringing Your Portrait to 3D Presence
- BuildAnyPoint: 3D Building Structured Abstraction from Diverse Point Clouds | arXiv: 2602.23645
- Building a Precise Video Language with Human-AI Oversight | arXiv: 2604.21718
- Building Robust Vision Encoders for Cross-Dataset Evaluation in Immunofluorescent Microscopy
- BuildingGPT: Auto-Regressive Building Wireframe Reconstruction Model with Reinforcement Learning
- Bulk RNA-seq Guided Multi-modal Detection of Anomalous Regions in Human Cancer via Spatial Transcriptomics
- BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection | arXiv: 2603.16645
- Bypassing the Transport Plan: Dynamic Reweighting for Out-of-Distribution Detection with Optimal Transport
- B³-Seg: Camera-Free, Training-Free 3DGS Segmentation via Analytic EIG and Beta-Bernoulli Bayesian Updates
- C\(^2\)FG: Control Classifier-Free Guidance via Score Discrepancy Analysis | arXiv: 2603.08155
- C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion | arXiv: 2604.16680
- C-LaV: Conditional Latent Velocity Field Denoising for Weather-Robust LiDAR Place Recognition
- CAD-Refiner: A Unified Framework for CAD Generation and Iterative Editing
- CADC: Content Adaptive Diffusion-Based Generative Image Compression
- CADFS: A Big CAD Program Dataset and Framework for Computer-Aided Design with Large Language Models | arXiv: 2605.01925
- CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation
- CamDirector: Towards Long-Term Coherent Video Trajectory Editing
- Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens
- Camouflage-aware Image-Text Retrieval via Expert Collaboration
- CamPI: Physical Adversarial Examples through Camera Power Signal Injection
- Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection
- Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling? | arXiv: 2604.03619
- Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching
- Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers
- CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation | arXiv: 2606.01638
- CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
- CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment | arXiv: 2603.02557
- Captain Safari: A World Engine with Pose-Aligned 3D Memory
- CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
- CaptionQA: Is Your Caption as Useful as the Image Itself?
- CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model
- CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography | arXiv: 2605.05014
- CARD: Correlation Aware Restoration with Diffusion
- CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
- CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing | arXiv: 2603.08589
- CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis | arXiv: 2602.21637
- CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion | arXiv: 2602.19140
- CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction | arXiv: 2512.11988
- CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis
- CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale
- CASPA: Graph-Structured Concept Anchors for Modality-Agnostic Adaptation in Vision-Language Models
- CASR: A Robust Cyclic Framework for Arbitrary Large-Scale Super-Resolution with Distribution Alignment and Self-Similarity Awareness
- CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering | arXiv: 2605.23216
- CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval
- CaT-GS: Efficient 3DGS Rendering for Large-Scale Scenes with Inter-frame Caching and Tile Scheduling
- Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation | arXiv: 2603.12766
- CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception
- CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
- Causal Motion Diffusion Models for Autoregressive Motion Generation | arXiv: 2602.22594
- Causality in Video Diffusers is Separable from Denoising
- CausalLens: Sensitivity-Guided Multi-Head Causal Intervention for Hallucination Mitigation in Large Vision-Language Models
- CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention | arXiv: 2603.18561
- CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering | arXiv: 2602.23952
- CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning | arXiv: 2602.21655
- CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection | arXiv: 2603.23276
- CD-Buffer: Complementary Dual-Buffer Framework for Test-Time Adaptation in Adverse Weather Object Detection | arXiv: 2603.26092
- CDICS: Delving Into Fine-Grained Attribute for In-Context Segmentation via Compositional Prompts and Phased Decoupling
- Cell-Type Prototype-Informed Neural Network for Gene Expression Estimation from Pathology Images | arXiv: 2603.18461
- CF-IPT: Cross-Modal Fusion Interactive Prompt Tuning of Vision-Language Pre-Trained Model for Multisource Remote Sensing Data Classification
- CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance | arXiv: 2603.03281
- CG-Floor: Centroid-Guided Diffusion for Large-Scale Floorplan Generation
- CG-Reasoner: Centroid-Guided Positional Reasoning Segmentation for Medical Imaging with a Robust Visual-Text Consistency Metric
- CGHair: Compact Gaussian Hair Reconstruction with Card Clustering | arXiv: 2604.03716
- CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning
- CGU-Bayes: Causal Graph Uncertainty-Guided Bayesian Inference for Domain Generalization
- Chain of Event-Centric Causal Thought for Physically Plausible Video Generation | arXiv: 2603.09094
- Chain of World: World Model Thinking in Latent Motion (CoWVLA) | arXiv: 2603.03195
- Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
- Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models | arXiv: 2604.12391
- Chain-of-Thought Guided Multi-Modal Object Re-Identification
- CHAL: Causal-guided Hierarchical Anomaly-aware Learning for Moving Infrared Small Target Detection
- ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing | arXiv: 2507.04678
- Changes in Real Time: Online Scene Change Detection with Multi-View Fusion | arXiv: 2511.12370
- Charge: A Comprehensive Novel View Synthesis Benchmark and Dataset to Bind Them All
- Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
- ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding | arXiv: 2603.27064
- ChartR: Evaluating Reasoning Accuracy and Robustness in Chart Question Answering
- CHEEM: Continual Learning by Reuse, New, Adapt and Skip -- A Hierarchical Exploration-Exploitation Approach | arXiv: 2303.08250
- ChimeraLoRA: Multi-Head LoRA-Guided Synthetic Datasets
- CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection | arXiv: 2511.18519
- CHIRP dataset: towards long-term, individual-level, behavioral monitoring of bird populations in the wild
- ChordEdit: One-Step Low-Energy Transport for Image Editing | arXiv: 2602.19083
- Choreographing a World of Dynamic Objects
- Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding
- ChronoGS: Disentangling Invariants and Changes in Multi-Period Scenes
- CI-VID: A Coherent Interleaved Text-Video Dataset
- CICA: Coupling Confidence-Aware Pretraining with Confidence-Informed Attention for Robust Multimodal Sentiment Analysis
- CIGMA: Causal Information-Gain Mechanistic Attribution of Attention Heads in Vision Transformers
- CIGPose: Causal Intervention Graph Neural Network for Whole-Body Pose Estimation | arXiv: 2603.09418
- CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video Generation
- Cinematic Audio Source Separation Using Visual Cues | arXiv: 2603.26113
- CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation
- CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization | arXiv: 2603.16966
- Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers | arXiv: 2601.06338
- Circular-DPO: Aligning Multi-Stage 3D Generative Models via Preference Feedback Loop
- CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics
- Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization
- Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling
- CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space | arXiv: 2604.11539
- CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning | arXiv: 2602.19605
- Cleaning the Pool: Progressive Filtering of Unlabeled Pools in Deep Active Learning | arXiv: 2511.22344
- CLEP: Contrastive Language-Pose Pretraining
- CLEX: Complementary Label Exchange Learning for Noisy Facial Expression Recognition
- ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data | arXiv: 2512.02686
- Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis
- CLIP-like Model as a Foundational Density Ratio Estimator | arXiv: 2506.22881
- ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction | arXiv: 2604.13746
- CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation | arXiv: 2602.20409
- CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
- Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models
- Closed-Form Concept Erasure via Double Projections
- Clothe and Pose
- CLP: A Real-World Dataset of Contaminated Lens Protectors for Robust Semantic Segmentation
- Cluster-aware Anchor Learning for Multi-View Clustering
- Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models
- Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining | arXiv: 2603.22953
- ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering | arXiv: 2508.06656
- CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
- CMR-RD: Long-Tailed Adaptive VLM for Explainable CMR Diagnosis
- Co-Me: Confidence Guided Token Merging for Visual Geometric Transformers
- CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection | arXiv: 2606.00101
- CoD: A Diffusion Foundation Model for Image Compression | arXiv: 2511.18706
- Coded-E2LF: Coded Aperture Light Field Imaging from Events | arXiv: 2602.22620
- CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning | arXiv: 2512.17312
- CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval
- CodePercept: Code-Grounded Visual STEM Perception for MLLMs | arXiv: 2603.10757
- CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization
- CoFiDA-M: Concept-Aware Feature Modulation for Cross-Domain Adaptation with Image-Only Inference | arXiv: 2605.31591
- COG: Confidence-aware Optimal Geometric Correspondence for Unsupervised Single-reference Novel Object Pose Estimation | arXiv: 2603.00493
- CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving
- CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning | arXiv: 2605.29602
- CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection | arXiv: 2603.05042
- CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models
- ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving | arXiv: 2512.22939
- CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion | arXiv: 2603.00682
- Collaborative Multi-Mode Pruning for Vision-Language Models
- CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation | arXiv: 2602.22150
- Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing | arXiv: 2603.22466
- Color-Encoded Illumination for High-Speed Volumetric Scene Reconstruction | arXiv: 2604.26920
- CoLoR: The Devil is in Scene Coordinate Regression for Large-Scale Visual Localization
- ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization
- Common Inpainted Objects In-N-Out of Context
- CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning | arXiv: 2505.17006
- CompBench: Benchmarking Complex Instruction-guided Image Editing
- CompetitorFormer: Mitigating Query Conflicts for 3D Instance Segmentation via Competitive Strategy
- Complementary Prototype Mapping for Efficient Multimodal Anomaly Detection
- Complet4R: Geometric Complete 4D Reconstruction
- ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation | arXiv: 2605.25553
- Composing Concepts from Images and Videos via Concept-prompt Binding | arXiv: 2512.09824
- Composite-Attribute Person Re-Identification via Pose-Guided Disentanglement
- Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
- Compositional Transformation Reasoning for Composed Video Retrieval
- Compressed-Domain-Aware Online Video Super-Resolution | arXiv: 2603.07694
- Computation and Communication Efficient Federated Unlearning via On-server Gradient Conflict Mitigation and Expression | arXiv: 2603.13795
- Computational Speckle Pattern Interferometry
- Computer Vision with a Superpixelation Camera
- Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
- Concept Regions Matter: Benchmarking CLIP with a New Cluster-Importance Approach
- Concept-Aware Batch Sampling Improves Language-Image Pretraining
- Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation
- Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness | arXiv: 2603.08309
- ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors
- ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization | arXiv: 2602.19575
- Condensed Test-Time Adaptation of VLMs for Action Recognition
- Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling | arXiv: 2603.27403
- ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval | arXiv: 2604.20358
- Confidence-Guided Multi-Scale Aggregation for Sparse-View High-Resolution 3D Gaussian Splatting
- Conflict-Aware Adaptive Cross-Reconstruction for Multimodal Sentiment Analysis
- Confusion-Aware Spectral Regularizer for Long-Tailed Recognition
- Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
- Consensus vs. Controversy: Mapping the Decision Space Where Architectures Diverge
- ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation
- ConsistCompose: Unified Multimodal Layout Control for Image Composition | arXiv: 2511.18333
- Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning
- Consistent Instance Field for Dynamic Scene Understanding
- ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation | arXiv: 2605.05126
- Contact-Aware Neural Dynamics
- Content-Adaptive Hierarchical Hyperprior for Neural Video Coding
- Content-Aware Dynamic Patchification for Efficient Video Diffusion
- Content-Aware Frequency Encoding for Implicit Neural Representations with Fourier-Chebyshev Features
- Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation | arXiv: 2603.09506
- Continual Distillation of Teachers from Different Domains | arXiv: 2605.04059
- Continual Learning for fMRI-Based Brain Disorder Diagnosis via Functional Connectivity Matrices Generative Replay | arXiv: 2604.14259
- Continuous Exposure-Time Modeling for Realistic Atmospheric Turbulence Synthesis | arXiv: 2603.01398
- Contrastive Cross-Bag Augmentation for Multiple Instance Learning-based Whole Slide Image Classification
- Controllable Federated Prompt Learning at Test Time
- Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision
- Convexity-Aware Noise Calibration: A Self-Supervised Framework for Noise-Level-Unknown Image Denoising
- Convolutional Neural Networks Driven by Content Similarity
- CoopDiff: A Diffusion-Guided Approach for Cooperation under Corruptions
- Coordinate Denoising for Non-Equilibrium Molecular Representation Learning
- CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
- COPE: Consistent Occlusion and Prompt Enhancement Network for Occluded Person Re-identification
- COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs
- Copy-Transform-Paste: Zero-Shot Object-Object Alignment Guided by Vision-Language and Geometric Constraints
- COPYLENS: Towards Copyrighted Characters Infringement Detection via Copyright-Aware Prompt Learning
- CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs
- CoRiM: Conflict-driven Risk Minimization for Dynamic Multimodal Fusion
- CoRoGS: Contextual Gaussian Splatting for Robust Large-Deviation View Synthesis
- Correspondence-Attention Alignment for Multi-View Diffusion Models
- CoSMo3D: Open-World Promptable 3D Semantic Segmentation through LLM-Guided Canonical Spatial Modeling
- CoT-Edit: Let CoT Guide Instruction Video Editing
- COT-FM: Cluster-wise Optimal Transport Flow Matching | arXiv: 2603.13395
- Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
- CountGD++: Generalized Prompting for Open-World Counting | arXiv: 2512.23351
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Coupling Liquid Time-Constant Encoders with Modern Hopfield Memory
- CoV-Align: Efficient Fine-grained Cross-Modal Alignment with Cohesive Visual Semantics Priority
- Cov2Pose: Leveraging Spatial Covariance for Direct Manifold-aware 6-DoF Object Pose Estimation
- Coverage Optimization for Camera View Selection
- CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models | arXiv: 2603.21077
- CoWTracker: Tracking by Warping instead of Correlation
- CrackSSM: Reviving SSMs for Crack Segmentation via Dynamic Scanning
- CRAFT-LoRA: Content-Style Personalization via Rank-Constrained Adaptation and Training-Free Fusion
- CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think | arXiv: 2603.18991
- CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion
- CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions
- CREward: A Type-Specific Creativity Reward Model | arXiv: 2511.19995
- CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration | arXiv: 2604.05689
- CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning | arXiv: 2604.01634
- Critical Patch-Aware Sparse Prompting with Decoupled Training for Continual Learning on the Edge | arXiv: 2604.07399
- Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
- Cross-Architecture Adaptation: Cloud-Edge Continual Test-Time Adaptation with Dynamic Sampling and Heterogeneous Distillation
- Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing | arXiv: 2606.01014
- Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning | arXiv: 2603.18495
- Cross-domain Dual-stream Feature Disentanglement for Brain Disorder Prediction with Sparsely Labeled PET
- Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation | arXiv: 2602.05217
- Cross-Hand Latent Representation for Vision-Language-Action Models
- Cross-Instance Gaussian Splatting Registration via Geometry-Aware Feature-Guided Alignment | arXiv: 2603.21936
- Cross-Modal Attention Calibration for LVLM Hallucination Mitigation
- Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video | arXiv: 2604.07786
- Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark | arXiv: 2603.20721
- Cross-Modal Guided Visual Synthesis for Data-Efficient Multimodal Depression Recognition
- Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning | arXiv: 2603.01696
- Cross-modal Representation Learning for Diffusion-generated Image Detection
- Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark | arXiv: 2603.00543
- Cross-Slice Knowledge Transfer via Masked Multi-Modal Heterogeneous Graph Contrastive Learning for Spatial Gene Expression Inference | arXiv: 2603.22821
- Cross-Subject EEG-to-Video Reconstruction and Beyond
- Cross-View Distillation and Adaptive Masking for Incomplete Multi-View Multi-Label Classification
- Cross-View Splatter: Feed-Forward View Synthesis with Georeferenced Images | arXiv: 2605.19656
- CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation
- CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods | arXiv: 2508.18753
- CrossHOI: Learning Cross-View Representations for Monocular 3D Human-Object Interaction Reconstruction
- CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection | arXiv: 2605.09802
- CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image | arXiv: 2603.17779
- CROWn: A Unified 3D Medical Segmentation Framework Integrating Anti-Aliased Downsampling and Phase-Calibrated Fusion
- CryoHype: Reconstructing a Thousand Cryo-EM Structures with Transformer-Based Hypernetworks | arXiv: 2512.06332
- CryoKRAQEN: Kernel-Regularized Annealing for Quantized Embedding Networks in Cryo-EM Heterogeneous Reconstruction
- cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold | arXiv: 2511.12931
- CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models | arXiv: 2604.16363
- CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration | arXiv: 2603.20741
- CUBE: Representing 3D Faces with Learnable B-Spline Volumes | arXiv: 2604.12894
- CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video | arXiv: 2603.04291
- Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens | arXiv: 2603.19232
- CUBic: Coordinated Unified Bimanual Perception and Control Framework
- CUE: Concept-Aware Multi-Label Expansion to Mitigate Concept Confusion in Long-Tailed Learning | arXiv: 2605.01309
- CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling
- CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation | arXiv: 2601.15408
- Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
- Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding
- Curvature-Aware Zeroth-Order Optimization for Memory-Efficient Test-Time Adaptation
- Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion | arXiv: 2604.08924
- CustomTex: High-fidelity Indoor Scene Texturing via Multi-Reference Customization | arXiv: 2603.19121
- Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events | arXiv: 2603.06213
- CVA: Context-aware Video-text Alignment for Video Temporal Grounding | arXiv: 2603.24934
- Cycle-Consistent Tuning for Layered Image Decomposition | arXiv: 2602.20989
- CycleBEV: Regularizing View Transformation Networks via View Cycle Consistency for Bird's-Eye-View Semantic Segmentation | arXiv: 2602.23575
- CycleManip: Enabling Cycle-based Manipulation via Effective History Perception and Understanding
- D\(^2\)-FOSA: Dual-Diffusion Guided EEG-to-Image Reconstruction with Frequency-Oriented Semantic Alignment
- D-Convexity: A Unified Differentiable Convex Shape Prior via Quasi-Concavity for Data-driven Image Segmentation | arXiv: 2605.19210
- D-Prism: Differentiable Primitives for Structured Dynamic Modeling | arXiv: 2604.17082
- D2C: Accelerating Diffusion Model Training under Minimal Budgets via Condensation | arXiv: 2507.05914
- D2Cache: Second-Order Delta Caching for Higher Video Diffusion Acceleration
- D2Dewarp: Dual Dimensions Geometric Representation Learning Based Document Image Dewarping | arXiv: 2507.08492
- D2FANet: Enhancing Video Object Detection with Dual-Domain Feature Aggregation Network
- D2T2 - Multimodal Automated Planning for Brachytherapy
- D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
- DA-Mamba: Learning Domain-Aware State Space Model for Global-Local Alignment in Domain Adaptive Object Detection | arXiv: 2603.18757
- DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment | arXiv: 2603.22125
- DABO: Difficulty-Aware Bayesian Optimization with Diffusion-Learned Priors
- DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation | arXiv: 2603.03744
- Dance Across Shifts: Forward-Facilitation Continual Test-Time Adaptation through Dynamic Style Bridging | arXiv: 2605.18608
- DARC: Dual Adjustment Reasoning with Counterfactuals for Trustworthy Chest X-ray Classification
- Dark3R: Learning Structure from Motion in the Dark | arXiv: 2603.05330
- DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition
- DarkShake-DVS: Event-based Human Action Recognition under Low-light and Shaking Camera Conditions
- DASH: A Meta-Attack Framework for Synthesizing Effective and Stealthy Adversarial Examples | arXiv: 2508.13309
- Data Leakage Detection and De-duplication in Large Scale Geospatial Image Datasets | arXiv: 2304.02296
- Data-Centric Meta-Learning for Robust Few-Shot Generalization
- Dataset Distillation by Influence Matching
- DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation | arXiv: 2605.05889
- DC-Merge: Improving Model Merging with Directional Consistency | arXiv: 2603.06242
- DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
- DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
- DDSF: Robust Few-Shot Learning via Disentangled Subspaces with Determinantal Point Process
- DDT: Decoupled Diffusion Transformer
- DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles | arXiv: 2603.01111
- DeBias-CLIP: CLIP Is Shortsighted — Paying Attention Beyond the First Sentence | arXiv: 2602.22419
- Debiased Sample Selection for Learning with Noisy Labels
- Deciphering Genotype-Phenotype Mechanisms from High-Content Profiling via Knowledge-Guided Multi-modal Graph Learning
- Decision Boundary-aware Generation for Long-tailed Learning | arXiv: 2605.01468
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation | arXiv: 2511.19365
- Decoding 3D Perception via BrainSSD: Synergistic Fusion of EEG Representations from Static and Dynamic Visual Streams
- Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection | arXiv: 2603.24030
- Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression
- Deconstructing the Failure of Ideal Noise Correction: A Three-Pillar Diagnosis | arXiv: 2603.12997
- Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
- Decouple Your Discovery and Memory in Continual Generalized Category Discovery
- Decoupled and Reusable Adaptation for Efficient Cross-Modal Transfer
- Decoupled Generative Modeling for Human-Object Interaction Synthesis
- Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation | arXiv: 2606.01048
- Decoupling Bias, Aligning Distributions: Synergistic Fairness Optimization for Deepfake Detection
- Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation | arXiv: 2603.00574
- Decoupling Vision and Language: Codebook Anchored Visual Adaptation | arXiv: 2602.19449
- DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation | arXiv: 2603.13133
- DeDelayed: Deleting Remote Inference Delay via On-Device Correction | arXiv: 2510.13714
- Deep Feature Deformation Weights
- DeepAlign: Mitigating Modality Conflict through Modality-Specific Alignment
- Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models
- DeepfakeImpact: A Two-Stage Benchmark with Real-World Impact in Deepfake Detection
- DeepProtect: Proactive Face-Swapping Defense using Identity Blending and Attribute Distortion
- DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
- Defect Cue-Preserved Structural Feature Refinement for Few-Shot Anomaly Detection
- Defending Unauthorized Model Merging via Dual-Stage Weight Protection | arXiv: 2511.11851
- Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation | arXiv: 2605.28587
- Deformation-based In-Context Learning for Point Cloud Understanding | arXiv: 2604.02845
- Degradation-Consistent Test-Time Adaptation for All-in-One Image Restoration
- Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios
- Dehallu3D: Hallucination-Mitigated 3D Generation from a Single Image via Cyclic View Consistency Refinement
- Dejavu: Towards Experience Feedback Learning for Embodied Intelligence
- Delta Rectified Flow Sampling for Text-to-Image Editing
- DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing
- Delving Aleatoric Uncertainty in Medical Image Segmentation via Vision Foundation Models
- Demo2Tutorial: From Human Experience to Multimodal Software Tutorials | arXiv: 2606.03951
- DemoFunGrasp: Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning
- Den-TP: A Density-Balanced Data Curation and Evaluation Framework for Trajectory Prediction | arXiv: 2409.17385
- DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs
- Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation
- Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache | arXiv: 2602.22654
- Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation | arXiv: 2604.19141
- Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors
- Depth Any Endoscopy: Towards Self-Supervised Generalizable Depth Estimation in Monocular Endoscopy
- Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
- Depth Hypothesis Guided Iterative Refinement for Event-Image Monocular Depth Estimation
- Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering
- DepthFocus: Controllable Depth Estimation for See-Through Scenes
- DeRVOS: Decoupling Consistent Trajectory Generation and Multimodal Understanding for Referring Video Object Segmentation
- Describe Anything Anywhere At Any Moment
- Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models | arXiv: 2605.12138
- Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage | arXiv: 2511.22177
- Designing to Forget: Deep Semi-parametric Models for Unlearning | arXiv: 2603.22870
- DeSpike: Defocus Deblurring and Image Reconstruction for Spike Camera
- DETACH: Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning
- DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video
- Detect Any AI-Counterfeited Text Image
- Detect Anything via Next Point Prediction
- Detecting AI-Generated Forgeries via Iterative Manifold Deviation Amplification | arXiv: 2602.18842
- Detecting Compressed AI-Generated Images via Phase Spectrum Robustness
- Detecting Unknown Objects via Energy-Based Separation for Open World Object Detection | arXiv: 2603.29954
- DetectSCI: Toward Object-Guided ROI Reconstruction for High-Resolution Video Snapshot Compressive Imaging
- DEVA: Fine-tuning Multimodal Large Language Models for Visual Perception Tasks
- DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations
- DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning | arXiv: 2601.16046
- Dexterous World Models
- DFD-HR: Generalizable Deepfake Detection via Hierarchical Routing Learning
- DF²-VB: Dual-level Fuzzy Fusion with View-specific Boosting for Multi-view Multi-label Classification
- DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images
- DGS: Dual Gradient and Semantic-Shift Guided Low-Rank Adaptation for Class Incremental Learning
- Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols | arXiv: 2512.02787
- Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection | arXiv: 2603.27240
- Diagram2Structure: Unlocking LLMs' Diagram Comprehension through DiagramDiff, a Framework for Structuring Offline Diagrams
- DialogueVPR: Towards Conversational Visual Place Recognition
- DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces
- Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs | arXiv: 2604.08846
- Diff-SemiER: Transparency-Aware Adaptive Fusion Diffusion Model with Generative Prior for Semi-Transparent Eyeglasses Removal
- Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation | arXiv: 2511.00503
- DiffBMP: Differentiable Rendering with Bitmap Primitives | arXiv: 2602.22625
- DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers
- Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
- Differentiable Adaptive 4D Structured Illumination for Joint Capture of Shape and Reflectance | arXiv: 2605.06214
- Differentiable Laplacian Matrix Guided Superpixel Segmentation
- Differentiable Stroke Planning with Dual Parameterization for Efficient and High-Fidelity Painting Creation
- Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression
- Differentially Private 2D Human Pose Estimation
- DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation
- DiffSoup: Direct Differentiable Rasterization of Triangle Soup for Extreme Radiance Field Simplification
- Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving
- Diffusion Guided Chain-of-Vision for Large Autoregressive Vision Models
- Diffusion Mental Averages | arXiv: 2603.29239
- Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
- Diffusion Probe: Generated Image Result Prediction Using CNN Probes | arXiv: 2602.23783
- Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering
- Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction
- Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features
- Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization
- DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization
- DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer
- DiffuView: Multi-View Diffusion Pretraining for 3D-Aware Robotic Manipulation
- DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Models
- DiGraphHal-Bench: Evaluating Multimodal Large Language Models on Complex Directed Graphs
- DIMOS: Disentangling Instance-level Moving Object Segmentation
- DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval | arXiv: 2604.19432
- DiP: Taming Diffusion Models in Pixel Space | arXiv: 2511.18822
- Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation | arXiv: 2604.07723
- DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization | arXiv: 2604.00648
- Direction-aware 3D Large Multimodal Models
- DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching | arXiv: 2602.05449
- Disco-GS: Gaussian Splatting in Dynamic Color Lighting
- Discovering Adaptive Task Dependencies for Efficient Multi-Task Representation Compression
- Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement | arXiv: 2603.19623
- Disentangled Textual Priors for Diffusion-based Image Super-Resolution | arXiv: 2603.07430
- Disentanglement-wise Image Dehazing through Cross-Domain Manifold Consensus
- Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation | arXiv: 2604.00849
- Distilling Balanced Knowledge from a Biased Teacher | arXiv: 2506.18496
- Distilling Quasi-Conformal Mapping: A Generalizable and Efficient Solution for Wide-Angle Correction
- Distilling Unsigned Distance Function for Surface Reconstruction from 3D Gaussian Splatting
- Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates
- Distribution-Aligned Multimodal Fusion for Robust Object Detection
- DiT-Distill: Open-Set Fine-Grained Retrieval via Generative Curriculum Knowledge
- DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression | arXiv: 2603.13162
- DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
- Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
- DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers | arXiv: 2603.04239
- DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
- Diversity over Uniformity: Rethinking Representation in Generated Image Detection | arXiv: 2603.00717
- Divide, Conquer, and Aggregate: Asymmetric Experts for Class-Imbalanced Semi-Supervised Medical Image Segmentation
- DIvide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding | arXiv: 2512.04000
- DK-DDIL: Adaptive Knowledge Retention for Dynamic Domain-Incremental Learning in Medical Imaging
- DLVP-CLIP: Enhancing Fine-Grained Zero-Shot Anomaly Detection via Dynamic Local Visual Prompting
- DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving | arXiv: 2604.00969
- DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis | arXiv: 2602.23022
- DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models
- dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
- DNF-SR: Dual-Input and Negative-Aware Feature Fine-Tuning for Real-World Image Super-Resolution
- Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?
- Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks | arXiv: 2508.04097
- Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
- Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
- Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control
- Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering | arXiv: 2603.12533
- DocPrune: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning | arXiv: 2604.22281
- DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding | arXiv: 2604.12812
- Does YOLO Really Need to See Every Training Image in Every Epoch? | arXiv: 2603.17684
- Domain Sensitive Federated Learning with Fisher-Informed Pruning
- Domain-Skewed Federated Learning with Feature Decoupling and Calibration | arXiv: 2603.14238
- Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs
- Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small VLMs | arXiv: 2511.17487
- DP-FedAdamW: An Efficient Optimizer for Differentially Private Federated Large Models
- DPAD: Discriminative Perception via Anchored Description for Reasoning Segmentation | arXiv: 2603.04002
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- DPGF-Net: Dual-Prior Guided Fusion Network for Joint Assessment of Perceptual Quality and Semantic Consistency in AI-Generated Images
- DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities
- Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
- Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround-View Cameras for Autonomous Driving | arXiv: 2603.01007
- Draft and Refine with Visual Experts | arXiv: 2511.11005
- Drainage: A Unifying Framework for Addressing Class Uncertainty
- DRAMA: Next-Gen Dynamic Orchestration for Resilient Multi-Agent Ecosystems in Flux
- DREAM: Document Recognition with Explicit Adaptive Memory
- DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models
- DreamOmni2: Multimodal Instruction-based Generation and Editing
- DreamSAC: Learning Hamiltonian World Models via Symmetry Exploration
- DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior | arXiv: 2604.17195
- DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer
- DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos
- DreamStyle: A Unified Framework for Video Stylization
- DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease
- Drift-Resilient Temporal Priors for Visual Tracking | arXiv: 2604.02654
- Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving | arXiv: 2603.25740
- DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving
- DriveLaW: Unifying Planning and Video Generation in a Latent Driving World | arXiv: 2512.23421
- DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving | arXiv: 2505.16278
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation
- DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance | arXiv: 2512.14266
- DriveVLN: Towards Mapless Vision-and-Language Navigation in Autonomous Driving
- Driving on Registers (DrivoR)
- DRM: Diffusion-based Reward Model With Step-wise Guidance
- DROID-W: DROID-SLAM in the Wild | arXiv: 2603.19076
- DropAnSH-GS: Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting | arXiv: 2602.20933
- DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
- DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing | arXiv: 2604.07965
- DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR
- DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime | arXiv: 2603.10538
- DSO: Direct Steering Optimization for Bias Mitigation
- DSS: Discover, Segment, and Select for Zero-shot Camouflaged Object Segmentation | arXiv: 2602.19944
- DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
- Dual Ascent Diffusion for Inverse Problems
- Dual Graph Regularized Deep Unfolding Network for Guided Depth Map Super-resolution
- Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry | arXiv: 2511.21083
- Dual-Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions | arXiv: 2509.11334
- Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking
- Dual-Estimator: Decoupling Global and Local Semantic Shift for Drift Compensation in Class-Incremental Learning
- Dual-Granularity Memory for Efficient Video Generation
- Dual-level Adaptation for Multi-Object Tracking: Building Test-Time Calibration from Experience and Intuition | arXiv: 2603.21629
- Dual-level Adapter Boosting Prompt-free Curvilinear Structure Segmentation
- Dual-Level Confidence based Implicit Self-Refinement for Medical Visual Question Answering
- Dual-Level Hypergraph Generation for Addressing Feature Scarcity in Whole-Slide Image Classification
- Dual-Prototype-Guided Multi-task Learning for Unsupervised Anomaly Detection and Classification
- Duala: Dual-Level Alignment of Subjects and Stimuli for Cross-Subject fMRI Decoding
- DualMirage: Hunting Stealthy Multimodal LLM Agents via CAPTCHAs with Contour and Adversarial Illusions
- DualPrim: Compact 3D Reconstruction with Positive and Negative Primitives
- DualReg: Dual-Space Filtering and Reinforcement for Rigid Registration | arXiv: 2508.17034
- DualSplat: Robust 3D Gaussian Splatting via Pseudo-Mask Bootstrapping from Reconstruction Failures
- DUET-VLM: Dual Stage Unified Efficient Token Reduction for VLM Training and Inference | arXiv: 2602.18846
- DuetMerging: Synergizing Dynamic and Static Strategies for Mitigating Task Interference in Model Merging
- DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance
- DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution | arXiv: 2603.22271
- DuoGen: Towards Autonomous Interleaved Multimodal Generation
- DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction | arXiv: 2603.03265
- DVAR: Dynamic Visual Autoregressive Modeling for Image Super-Resolution
- DVGT: Driving Visual Geometry Transformer
- DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation
- DyFCLT: Dynamic Frequency-Decoupled Cross-Modal Learning Transformer for Multimodal Tiny Object Detection
- Dynamic Black-hole Emission Tomography with Physics-informed Neural Fields | arXiv: 2602.08029
- Dynamic Exposure Burst Image Restoration
- Dynamic Important Example Mining for Reinforcement Finetuning
- Dynamic Label Noise Suppression with Optimal Teacher Pool for Facial Expression Recognition
- Dynamic Logits Adjustment and Exploration for Test-Time Adaptation in Vision Language Models
- Dynamic Magic: Unleashing Restricted Knowledge for Lifelong Person Re-Identification
- Dynamic Momentum Recalibration in Online Gradient Learning | arXiv: 2603.06120
- Dynamic Stream Network for Combinatorial Explosion Problem in Deformable Medical Image Registration
- Dynamic Token Reweighting for Robust Vision-Language Models | arXiv: 2505.17132
- Dynamic Visual SLAM using a General 3D Prior
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- Dynamic-Static Decomposition for Novel View Synthesis of Dynamic Scenes with Spiking Neurons
- DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs | arXiv: 2602.21864
- Dynamics-Aware Preference Optimization for Vision-Language Models
- Dynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
- DynamicsBoost: Dynamic Plausible Video Generation via Annotation-Free Continuation Preference Optimization
- DynamicTree: Interactive Real Tree Animation via Sparse Voxel Spectrum
- DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving
- DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data | arXiv: 2604.01666
- DynBridge: Bridging Imagination and Control through Interaction Dynamics for Robot Manipulation
- DynFusion: Rethinking Condition Fusion for Adaptive Multi-Conditional Text-to-Image Generation
- D³FER: Dual Channel and Dual Branch Network for Robust Facial Expression Recognition under Dual Challenges
- E\(^2\)-SCI: Elastic Edge-Cloud Speculative Decoding via Credit Inertia
- E-3DPSM: A State Machine for Event-Based Egocentric 3D Human Pose Estimation | arXiv: 2604.08543
- E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought | arXiv: 2602.21698
- E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training | arXiv: 2512.10950
- E2EGS: Event-to-Edge Gaussian Splatting for Pose-Free 3D Reconstruction | arXiv: 2603.14684
- E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
- EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval | arXiv: 2603.25267
- EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence | arXiv: 2512.15160
- EarlyTom: Early Token Compression Completes Fast Video Understanding | arXiv: 2605.30010
- Easy2Hard: From Partially to Fully Unmatched Modalities as Negative Samples in Contrastive Learning
- Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow | arXiv: 2602.21499
- EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- Echoes of Ownership: Adversarial-Guided Dual Injection for Copyright Protection in MLLMs | arXiv: 2602.18845
- Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models | arXiv: 2602.20981
- EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
- EchoPOSE: 6D Pose Estimation of Sparse Echocardiograms for Left-Ventricular 3D Shape Reconstruction
- EchoVDiff: Cardiac-Cycle Echocardiography Video Generation from Arbitrary Single Frame
- ECKConv: Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant Point Cloud Analysis | arXiv: 2603.17538
- EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment
- EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images
- Edge-Focused Super-Resolution for Omnidirectional Images with Spherical Geometric Augmentation
- Edge-RecViT: Efficient Vision Transformer via Semantic-Refined Dynamic Recursion
- Edges Compete for Trust: Group Relative Edge Optimization for Building Reconstruction from Point Clouds
- EDGS: Eliminating Densification for Efficient Convergence of 3DGS
- Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing | arXiv: 2603.17583
- Edit-aware RAW Reconstruction | arXiv: 2512.05859
- Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
- EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Editprint: General Digital Image Forensics via Editing Fingerprint with Self-Augmentation Training
- EduDiag: A Benchmark for Educational Diagnostic Reasoning with Error Tracing and Correction on Large Multimodal Models
- EE-RL: Vision Language Guided Reinforcement Learning with Explorer and Expert model for End-to-End Autonomous Driving
- EEGiT: Teaching Vision Transformers to Understand the EEG signal
- EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing | arXiv: 2603.19224
- EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation
- Efficiency Follows Global-Local Decoupling
- Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation | arXiv: 2505.16942
- Efficient and Training-Free Single-Image Diffusion Models | arXiv: 2606.04299
- Efficient Encoder-Free Fourier-based 3D Large Multimodal Model
- Efficient Equivariant Transformer for Self-Driving Agent Modeling | arXiv: 2604.01466
- Efficient Frame Selection for Long Video Understanding via Reinforcement Learning
- Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics | arXiv: 2603.23227
- Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices
- Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning
- Efficient Unrolled Networks for Large-Scale 3D Inverse Problems
- Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodel
- Efficient Weighted Sampling via Score-based Generative Models
- Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
- EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion
- EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancement
- EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding
- Ego-1K: A Large-Scale Multiview Video Dataset for Egocentric Vision | arXiv: 2603.13741
- Ego-Grounding for Personalized Question-Answering in Egocentric Videos
- Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
- Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos | arXiv: 2603.22529
- Ego: Embedding-Guided Personalization of Vision-Language Models
- EgoAVU: Egocentric Audio-Visual Understanding
- Egocentric Visibility-Aware Human Pose Estimation
- EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
- EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation | arXiv: 2604.01421
- EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs | arXiv: 2604.03318
- EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VR | arXiv: 2603.04090
- EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy | arXiv: 2605.24456
- EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignment
- EgoSound: Benchmarking Sound Understanding in Egocentric Videos | arXiv: 2602.14122
- EgoX: Egocentric Video Generation from a Single Exocentric Video
- EgoXtreme: A Dataset for Robust Object Pose Estimation in Egocentric Views under Extreme Conditions | arXiv: 2603.25135
- EHETM: High-Quality and Efficient Turbulence Mitigation with Events | arXiv: 2603.20708
- EI-Part: Explode for Completion and Implode for Refinement
- Elastic Weight Consolidation Done Right for Continual Learning | arXiv: 2603.18596
- Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding
- ElasticFormer: Detecting Objects in HRW Shots via Elastic Computing Vision Transformer
- Electromagnetic Inverse Scattering from a Single Transmitter
- ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders | arXiv: 2511.14070
- Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching | arXiv: 2606.03577
- Eliminate Distance Differences Induced by Backdoor Attacks: Layer-Selective Training and Clipping to Mask Backdoor Models
- ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and Test-time Generative Adaptation
- Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models | arXiv: 2507.18534
- Elucidating the SNR-t Bias of Diffusion Probabilistic Models | arXiv: 2604.16044
- ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Video Understanding
- ELVIS: Enhance Low-Light for Video Instance Segmentation in the Dark | arXiv: 2512.01495
- EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease | arXiv: 2602.19178
- EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding | arXiv: 2603.04254
- EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents
- EMDUL: Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasets | arXiv: 2603.14507
- Emergent Extreme-View Geometry in 3D Foundation Models
- Emergent Outlier View Rejection in Visual Geometry Grounded Transformers
- EMGauss: Continuous Slice-to-3D Reconstruction via Dynamic Gaussian Modeling in Volume Electron Microscopy | arXiv: 2512.06684
- EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories | arXiv: 2512.17320
- EMMA: Extracting Multiple physical parameters from Multimodal Data | arXiv: 2605.24047
- EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models | arXiv: 2602.23802
- EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head
- EmoStyle: Emotion-Driven Image Stylization
- EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization | arXiv: 2603.21332
- EmoThinker: Advancing Visual-Acoustic Emotion Analysis via Structural Token Selection and Chain-of-Thought Reasoning
- EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution
- Enabling Supervised Learning of Generative Signatures for Generalized AI-Generated Images Detection
- ENC-Bench: A Benchmark for Evaluating MLLMs in Electronic Navigational Chart Understanding | arXiv: 2603.22763
- End-to-End Hyper-Relational Information Extraction for Engineering Diagrams via Dynamically Tokenized Relation Transformer
- End-to-End Language-Action Model for Humanoid Whole Body Control
- Endless World: Real-Time 3D-Aware Long Video Generation
- Energy Waveify and Redistribution for Test-Time Adaptation: A Control System Perspective
- Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flow
- EnergyAction: Unimanual to Bimanual Composition with Energy-Based Models
- Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis
- Enhancing Accuracy of Uncertainty Estimation in Appearance-based Gaze Tracking with Probabilistic Evaluation and Calibration | arXiv: 2501.14894
- Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting | arXiv: 2604.18075
- Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
- Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulator | arXiv: 2603.14726
- Enhancing Mixture-of-Experts Specialization via Cluster-Aware Upcycling | arXiv: 2604.13508
- Enhancing Out-of-Distribution Detection with Extended Logit Normalization | arXiv: 2504.11434
- Enhancing Part-Level Point Grounding for Any Open-Source MLLMs
- Enhancing Spatial Understanding in Image Generation via Reward Modeling | arXiv: 2602.24233
- Enhancing the Security of Visual Speaker Authentication Based on Dynamic Lip-Print Analysis
- Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learning
- Enhancing Video Vision Language Model with Hippocampal Sensing
- Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learning | arXiv: 2503.13543
- Envision, Attend, Then Respond: Counterfactual Hallucination Mitigation in Large Vision-Language Models
- Envisioning the Future, One Step at a Time | arXiv: 2604.09527
- EpiAgent: An Agent-Centric System for Ancient Inscription Restoration | arXiv: 2604.09367
- Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models
- EReCu: Pseudo-label Evolution Fusion and Refinement with Multi-Cue Learning for Unsupervised Camouflage Detection | arXiv: 2603.11521
- eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting
- ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization | arXiv: 2511.10971
- ESAM++: Efficient Online 3D Perception on the Edge
- EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding
- Eulerian Gaussian Splatting using Hashed Probability Pyramids | arXiv: 2605.29136
- EV-CGNet: Co-visible Focused 3D-guided 2D Event Keypoint Detection Network
- EVA: Efficient Reinforcement Learning for End-to-End Video Agent
- Evaluating and Easing Hallucinations for GUI Grounding
- Evaluating Generative Models via One-Dimensional Code Distributions
- EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation | arXiv: 2603.12267
- Event Stream Filtering via Probability Flux Estimation
- Event Structural Valley: A Unified Theoretical and Practical Framework for Event Camera Autofocus
- Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations
- Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations
- Event-based Visual Deformation Measurement
- Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Dataset
- Event6D: Event-based Novel Object 6D Pose Tracking | arXiv: 2603.28045
- EventDrive: Event Cameras for Vision-Language Driving Intelligence
- EventGait: Towards Robust Gait Recognition with Event Streams
- EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensors | arXiv: 2604.02331
- Every Error has Its Magnitude: Asymmetric Mistake Severity Training for Multiclass Multiple Instance Learning | arXiv: 2603.13682
- Evidential Deep Partial Label Learning to Quantify Disambiguation Uncertainty
- Evidential Neural Radiance Fields
- Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimation | arXiv: 2604.08627
- EVLF: Early Vision-Language Fusion for Generative Dataset Distillation | arXiv: 2603.07476
- Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
- Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval
- EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision | arXiv: 2605.13152
- EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling | arXiv: 2604.17087
- EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
- EvoID: Reinforced Evolution for Identity-Preserving Video Generation
- Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition | arXiv: 2603.03827
- Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory | arXiv: 2603.15800
- EW-DETR: Evolving World Object Detection via Incremental Low-Rank DEtection TRansformer | arXiv: 2602.20985
- Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstruction
- Exemplar-Free Class Incremental Learning via Preserving Class-Discriminative Structure
- Exemplar-Free Continual Learning for State Space Models | arXiv: 2505.18604
- ExMesh: EXplicit Mesh Reconstruction with Topology Adaptation | arXiv: 2606.07288
- EXOTIC: External Vision-driven Incomplete Multi-view Classification
- Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
- Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs
- Experience Transfer for Multimodal LLM Agents in Minecraft Game
- Expert-Teacher-Student Collaborative Learning for Domain Adaptive Object Detection
- Explaining CLIP Zero-shot Predictions Through Concepts | arXiv: 2603.28211
- Explaining Object Detectors via Collective Contribution of Pixels | arXiv: 2412.00666
- Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration | arXiv: 2601.10744
- Exploring 6D Object Pose Estimation with Deformation | arXiv: 2604.06720
- Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognition
- Exploring Conditions for Diffusion Models in Robotic Control | arXiv: 2510.15510
- Exploring Spatial Intelligence from a Generative Perspective | arXiv: 2604.20570
- Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction | arXiv: 2603.00611
- Exploring the Underwater World Segmentation without Extra Training
- Exploring Visual Pretraining for Learning Language Intelligence
- ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstruction
- ExPose: Reinforcing Video Generation Models for Extreme Pose Estimation
- Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architectures
- ExpPortrait: Expressive Portrait Generation via Personalized Representation | arXiv: 2602.19900
- Extend3D: Town-Scale 3D Generation | arXiv: 2603.29387
- Extending Embodied Question Answering from Perception to Decision
- Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation | arXiv: 2604.18168
- ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting | arXiv: 2509.22225
- F\(^2\)-Assist: Multi-Phase Fetal Growth Forecast and Report Generation from Ultrasound Examination
- F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentation
- FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection | arXiv: 2603.20403
- FabricGen: Microstructure-Aware Woven Fabric Generation
- Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization
- Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration | arXiv: 2603.16570
- FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation
- FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning | arXiv: 2603.05506
- FaceCoT: Chain-of-Thought Reasoning in MLLMs for Face Anti-Spoofing | arXiv: 2506.01783
- Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysis
- Factorized Context Aggregation for Robust Cancer Risk Estimation via Soft Re-Ranked Retrieval and Hierarchical Anchors
- Failure Modes for Deep Learning-Based Online Mapping: How to Measure and Address Them | arXiv: 2603.19852
- FailureAtlas: Mapping the Failure Landscape of T2I Models via Active Exploration
- FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Models | arXiv: 2603.26008
- Faithful Contouring: Near-Lossless 3D Voxel Representation Free from Iso-surface
- FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain
- FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment | arXiv: 2505.11192
- FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-and-Language Navigation
- FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration
- FARMER: Flow AutoRegressive Transformer over Pixels
- Fast Markov Random Field Optimisation for Topologically Noisy 3D Shape Matching
- Fast Reasoning Segmentation for Images and Videos
- Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction | arXiv: 2512.05597
- Fast Spatial Tracking with Visual Geometry Transformer
- Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching
- Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning | arXiv: 2601.09708
- Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration | arXiv: 2511.22533
- FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selection
- Faster-GS: Analyzing and Improving Gaussian Splatting Optimization
- FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Camera
- FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mapping
- FastGS: Training 3D Gaussian Splatting in 100 Seconds | arXiv: 2511.04283
- FastHybrid: Accelerating Hybrid Autoregressive Image Generation with Lookahead and Guided Decoding
- FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters | arXiv: 2603.01685
- FastRef: Fast Prototype Refinement for Few-shot Industrial Anomaly Detection
- FAVE: A Structured Benchmark for Fine-Grained Audio-Visual Temporal Evaluation in Multimodal LLMs
- FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement
- FBTA: Enabling Single-GPU End-to-End Gigapixel WSI Classification with Feature Bridging and Translation Alignment
- FE2E: From Editor to Dense Geometry Estimator | arXiv: 2509.04338
- FEAST: Fully Connected Expressive Attention for Spatial Transcriptomics
- FEAT: Fashion Editing and Try-On from Any Design
- FeatureFool: Zero-Query Fooling of Video Models via Feature Map
- Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners | arXiv: 2604.26488
- Fed-ADE: Adaptive Learning Rate for Federated Post-adaptation under Distribution Shift | arXiv: 2603.01040
- FedAdamom: Adaptive Momentum for Improved Generalization in Federated Optimization
- FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation | arXiv: 2603.04890
- FedAlign: Differentially Private Distribution Alignment for Non-IID Federated Learning
- FedARA: Resource-adaptive Low-rank Personalized Federated Learning via Anchor-driven Representation Alignment on Heterogeneous Edge Devices
- FedBPrompt: Federated Domain Generalization Person Re-Identification via Body Distribution Aware Visual Prompts | arXiv: 2603.12912
- FedCART: Tackling Long-Tailed Distributions in Federated Adversarial Training via Classifier Refinement
- FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shift | arXiv: 2604.06795
- Federated Active Learning Under Extreme Non-IID and Global Class Imbalance | arXiv: 2603.10341
- FedHarmony: Harmonizing Heterogeneous Label Correlations in Federated Multi-Label Learning | arXiv: 2604.28024
- FedMOP: Achieving Enhanced Privacy and Performance in Federated Learning via Momentum Orthogonal Projection
- FedMPT: Federated Multi-Label Prompt Tuning of Vision-Language Models
- FedRAC: Rolling Submodel Allocation for Collaborative Fairness in Federated Learning
- FedRE: A Representation Entanglement Framework for Model-Heterogeneous Federated Learning | arXiv: 2511.22265
- FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clients
- FedSDR: Federated Graph Learning with Structural Noise Detection and Reconstruction
- FedSST: Rethinking Fair Federated Graph Learning under Structural Shift
- Feed-forward Gaussian Registration for Head Avatar Creation and Editing
- Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction
- Few-for-Many Personalized Federated Learning
- Few-shot Acoustic Synthesis with Multimodal Flow Matching | arXiv: 2603.19176
- Few-Shot Hybrid Incremental Learning: Continually Learning under Data Scarcity and Task Uncertainty
- Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments | arXiv: 2604.07997
- Few-Step Diffusion Sampling Through Instance-Aware Discretizations
- FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
- FG-Portrait: 3D Flow Guided Editable Portrait Animation | arXiv: 2603.23381
- FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution | arXiv: 2603.02692
- Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression | arXiv: 2603.10470
- FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splatting
- FILTR: Extracting Topological Features from Pretrained 3D Models
- Finding Distributed Object-Centric Properties in Self-Supervised Transformers
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks | arXiv: 2603.03907
- Fine-Grained Multi-Image Object Hallucination Benchmark
- Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients | arXiv: 2603.17809
- Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learning | arXiv: 2605.02247
- Fine-VAD: Towards Fine-Grained Video Anomaly Detection via Progressive Cross-Granularity Learning
- FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models
- FINER: MLLMs Hallucinate under Fine-grained Negative Queries | arXiv: 2603.17662
- FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution | arXiv: 2512.22647
- FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle | arXiv: 2511.17171
- First Frame Is the Place to Go for Video Content Customization | arXiv: 2511.15700
- First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
- FisherPoser: Human Motion Estimation from Sparse Observations with Hierarchical Region-Wise Fisher-Matrix Uncertainty Modeling
- FISHuman: Fine-grained Single-image 3D Human Reconstruction via Multi-view 4D Remeshing
- Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation | arXiv: 2602.24144
- FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation
- Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
- FlashCache: Frequency-Domain-Guided Outlier-KV-Aware Multimodal KV Cache Compression | arXiv: 2511.16786
- FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Vision | arXiv: 2603.19770
- FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers
- FlashIn: Fast and Accurate Image Inversion for Real-time Image Editing
- FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
- FlashMesh: Faster and Better Autoregressive Mesh Synthesis via Structured Speculation
- FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance | arXiv: 2603.12146
- FlashPortrait: 6× Faster Infinite Portrait Animation with Adaptive Latent Prediction
- FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention | arXiv: 2512.01540
- FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution
- Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly | arXiv: 2605.21625
- FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformation
- FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision | arXiv: 2512.15599
- FlexHook: Rethinking Two-Stage Referring-by-Tracking in RMOT | arXiv: 2503.07516
- FlexiVideo: Variation-Aware Temporal Dynamics Modeling for Efficient Video Understanding
- FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control
- Flickerformer: A Duet of Periodicity and Directionality for Burst Flicker Removal | arXiv: 2603.22794
- FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation
- FloVerse: Floor Plan-Guided Multi-Modal Navigation
- Flow Map Distillation Without Data
- Flow Matching for Multimodal Distributions
- Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning | arXiv: 2602.20157
- Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM
- FLOW: Optimal Transport-Driven Feature Warping for Generalized Remote Physiological Measurement
- Flowception: Temporally Expansive Flow Matching for Video Generation
- FlowComposer: Composable Flows for Compositional Zero-Shot Learning | arXiv: 2603.16641
- FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing
- FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing
- FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching | arXiv: 2605.05077
- FlowFixer: Towards Detail-Preserving Subject-Driven Generation
- FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching
- FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
- FlowMotion: Training-Free Flow Guidance for Video Motion Transfer | arXiv: 2603.06289
- FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generation
- FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement
- FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
- FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstruction | arXiv: 2603.21356
- FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopy | arXiv: 2602.23791
- FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding | arXiv: 2603.02096
- FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoising
- FMPose3D: monocular 3D pose estimation via flow matching
- fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding
- Focal–General Diffusion Model with Semantic Consistent Guidance for Sign Language Production
- Focus on Background: Exploring SAM's Potential in Few-shot Medical Image Segmentation with Background-centric Prompting
- Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis | arXiv: 2603.25778
- FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
- FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
- FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
- Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning | arXiv: 2603.11460
- FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation | arXiv: 2603.22054
- FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction | arXiv: 2509.21029
- ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation | arXiv: 2603.15169
- ForeAct: Steering Your VLA with Efficient Visual Foresight Planning
- Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformers
- Forecasting 3D Scanpaths in Egocentric Video
- ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videos
- Forensic-Friendly Image Manipulation via Controllable Latent Diffusion
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
- FoSS: Modeling Long-Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier–State Space Integration | arXiv: 2603.01284
- Foundation Encoders Are All You Need for Preference-Aware Personalization
- Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection | arXiv: 2512.17514
- FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model
- Foundry: Distilling 3D Foundation Models for the Edge | arXiv: 2511.20721
- Fourier Angle Alignment for Oriented Object Detection in Remote Sensing | arXiv: 2602.23790
- FoV-Net: Rotation-Invariant CAD B-rep Learning via Field-of-View Ray Casting | arXiv: 2602.24084
- FOZO: Forward-Only Zeroth-Order Prompt Optimization for Test-Time Adaptation | arXiv: 2603.04733
- FPS-Bench: A Benchmark for High Frame-Rate Video Understanding
- Fractal Camouflage: A Bio-Inspired Approach for Multi-Scale Adversarial Attacks in the Infrared Domain
- Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding | arXiv: 2602.18977
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution | arXiv: 2512.01390
- Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning
- FrankenMotion: Part-level Human Motion Generation and Composition
- Free-Grained Hierarchical Visual Recognition | arXiv: 2510.14737
- Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction | arXiv: 2603.25209
- FreeArtGS: Articulated Gaussian Splatting Under Free-Moving Scenario | arXiv: 2603.22102
- FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes | arXiv: 2605.29318
- FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation | arXiv: 2604.10512
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Model
- Frequency Switching Mechanism for Parameter-Efficient Multi-Task Learning | arXiv: 2603.21111
- Frequency-Aware Affinity for Weakly Supervised Semantic Segmentation
- Frequency-Aware Flow Matching for High-Quality Image Generation | arXiv: 2604.15521
- Frequency-domain Manipulation for Face Obfuscation
- Fresco: Frequency-Spatial Consistent Optimization for Fine-Grained Head Avatar Modeling
- From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction | arXiv: 2503.17788
- From 3D Pose to Prose: Biomechanics-Grounded Vision-Language Coaching
- From Attraction to Equilibrium: Physics-Inspired Semantic Gravitons for Zero-Shot Anomaly Detection
- From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation | arXiv: 2605.25570
- From Corners to Fiducial Tags: Revisiting Checkerboard Calibration for Event Cameras
- From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking
- From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
- From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
- From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
- From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matching
- From Few-way to Many-way: Rethinking Few-shot Fine-grained Image Classification
- From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
- From Infusion to Assimilation Distillation for Medical Image Segmentation
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition | arXiv: 2511.20996
- From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing | arXiv: 2103.01038
- From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
- From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removal
- From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesis
- From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings | arXiv: 2511.21428
- From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detection | arXiv: 2602.20630
- From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
- From Pixel to Precision: Enhancing Handwritten Mathematical Expression Recognition with Image-Level Reward
- From Rays to Projections: Better Inputs for Feed-Forward View Synthesis
- From Scale to Speed: Adaptive Test-Time Scaling for Image Editing
- From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity
- From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution
- From Softmax to Dirichlet: Evidential Learning for Semi-supervised Semantic Segmentation
- From Spots to Pixels: Dense Spatial Gene Expression Prediction from Histology Images
- From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning | arXiv: 2603.26597
- From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition | arXiv: 2603.24653
- From Where Things Are to What They Are For: Benchmarking Spatial–Functional Intelligence in Multimodal LLMs | arXiv: 2605.02130
- FSFSplatter: Geometrically Accurate Reconstruction with Free Sparse-view Images within 2 minutes
- FSLoRA: Harmonizing Detection and Re-Identification via Freq-Spatial Low-Rank Adapter for One-Stage Person Search
- Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models
- Fully Decentralized Certified Unlearning
- Functional Mean Flow in Hilbert Space
- FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning
- FunREC: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos | arXiv: 2604.05621
- FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery
- FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)\(^N\) Diffusion Refinement | arXiv: 2512.09373
- Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization | arXiv: 2605.06049
- Fusion of Depth and Semantics for Probabilistic Floorplan Localization
- FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition | arXiv: 2603.26908
- FusionRegister: Every Infrared and Visible Image Fusion Deserves Registration
- FVAR: Next-Focus Prediction for Visual Autoregressive Modeling
- FVBench: Benchmarking Deepfake Video Detection Capability of Large Multimodal Models
- F²HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling | arXiv: 2603.14920
- G\(^2\)VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
- G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval | arXiv: 2604.14710
- GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
- GAI-GS: A Wireless Channel Prediction Framework Injecting Ray-Object Interaction into 3DGS via Geometric Algebra Attention | arXiv: 2605.19065
- Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3D Constrained Terrains
- Gamba: Mamba-based Graph Convolutional Network with Dynamic Graph Topology Learning for Action Recognition
- GAP: Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation | arXiv: 2602.23814
- GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents | arXiv: 2604.01777
- Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories | arXiv: 2603.14153
- Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
- Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
- Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression | arXiv: 2511.21016
- Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction
- GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression
- GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator | arXiv: 2603.25053
- Gaussian Mapping for Evolving Scenes
- Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recovery
- Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation | arXiv: 2512.23180
- GaussianFluent: Gaussian Simulation for Dynamic Scenes with Mixed Materials
- GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance | arXiv: 2604.05721
- GaussianMatch: Semi-Supervised Regression with Pseudo-Label Filtering via Multi-View Gaussian Consistency
- GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction | arXiv: 2603.20611
- GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
- GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance
- Gaze Target Estimation Anywhere with Concepts
- GazeOnce360: Fisheye-Based 360° Multi-Person Gaze Estimation with Global-Local Feature Fusion
- GazeShift: Unsupervised Gaze Estimation and Dataset for VR
- GDFA: Geometry-Driven Federated Unlearning with Directional Task Vector Alignment
- GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution
- GDRO: Group-level Reward Post-training Suitable for Diffusion Models
- GeCo-SRT: Geometry-aware Continual Adaptation for Cross-Task Sim-to-Real Transfer
- GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic Segmentation
- GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization | arXiv: 2603.05095
- GEM: Generating LiDAR World Model via Deformable Mamba
- Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction
- GenBreak: Red Teaming Text-to-Image Generation Using Large Language Models
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation
- General Process Reward Modeling for Robotic Reinforcement Learning
- Generalizable Co-Salient Object Detection via Mixed Content-Style Modulation
- Generalizable Radio-Frequency Radiance Fields for Spatial Spectrum Synthesis
- Generalizable Sparse-View 3D Reconstruction from Unconstrained Images
- Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Tracking
- Generalizable Video Quality Assessment via Weak-to-Strong Learning | arXiv: 2505.03631
- Generalized and Personalized Federated Learning with Black-Box Foundation Models via Orthogonal Transformations
- Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization
- Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction | arXiv: 2602.21552
- GenErase: Generalizable and Semantically-Aware Concept Erasure in Diffusion Models
- Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning | arXiv: 2604.06824
- Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos
- Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Counting | arXiv: 2603.24821
- Generative Diffusion Priors for 3D Mapping of the Dark Universe | arXiv: 2606.00803
- Generative Modeling of Weights: Generalization or Memorization?
- Generative Neural Video Compression via Video Diffusion Prior | arXiv: 2512.05016
- Generative Point Tracking and Forecasting
- Generative Video Compression with One-Dimensional Latent Representation | arXiv: 2603.15302
- Generative Video Motion Editing with 3D Point Tracks
- Generative Vision-Language Multiple Instance Learning for Weakly Supervised Neonatal Fundus Screening and Reporting
- GeneVAR: Causal MeanFlow for Autoregressive Gene-to-WSI Tile Synthesis
- GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching
- GenMask: Adapting DiT for Segmentation via Direct Mask Generation | arXiv: 2603.23906
- GenMatter: Perceiving Physical Objects with Generative Matter Models | arXiv: 2604.22160
- GenSplat: Bridging the Generalization Gap in 3DGS Language Comprehension
- GenTract: Generative Global Tractography
- Geo2: Geometry-Guided Cross-view Geo-Localization and Image Synthesis
- GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics
- GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization
- GeoCodeBench: Benchmarking PhD-Level Coding in 3D Geometric Computer Vision | arXiv: 2603.30038
- GeoCoT: Towards Reliable Remote Sensing Reasoning with Manifold Perspective
- GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis | arXiv: 2603.01010
- GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Grasping
- GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction
- GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
- GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction | arXiv: 2603.21943
- GeoFree-CoSeg: Unsupervised Point Cloud-Image Cross-Modal Co-Segmentation Without Geometric Alignment
- GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation | arXiv: 2603.26260
- Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
- Geometric Neural Distance Fields for Learning Human Motion Priors
- Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentation
- Geometric-Photometric Event-based 3D Gaussian Ray Tracing
- Geometrically-Constrained Agent for Spatial Reasoning
- Geometry-Aligned and Anomaly-Aware Reconstruction for 3D Anomaly Detection
- Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context | arXiv: 2602.21929
- Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splatting
- Geometry-driven OOD Detectors Are Class-Incremental Learners
- Geometry-Guided 3D Visual Token Pruning for Video-Language Models | arXiv: 2604.18260
- GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing | arXiv: 2604.08896
- GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry
- GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
- GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers | arXiv: 2604.20715
- GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Acceleration
- GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation
- GeoSANE: Learning Geospatial Representations from Models, Not Data
- GeoSemba: Reconstructing State Space Model for Cross Paradigm Representation in Medical Image Segmentation
- GeoSURGE: Geo-localization using Semantic Fusion with Hierarchy of Geographic Embeddings | arXiv: 2510.01448
- GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning | arXiv: 2603.22687
- GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
- GeoWorld: Geometric World Models | arXiv: 2602.23058
- GFRRN: Explore the Gaps in Single Image Reflection Removal
- GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
- GGPT: Geometry-Grounded Point Transformer | arXiv: 2603.11174
- GH-NAF: Grid-Adaptive Hash-Level-Attended Neural Attenuation Fields for Discrepancy-Aware CBCT
- Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal | arXiv: 2603.28224
- Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain | arXiv: 2605.24753
- GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracing
- GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views
- GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
- GKD: Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation | arXiv: 2603.02554
- GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transport | arXiv: 2603.26181
- Global Information Thresholding for Sufficient and Necessary Circuits
- Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation | arXiv: 2602.20200
- Global Structure-from-Motion Meets Feedforward Reconstruction | arXiv: 2605.26103
- Global Underwater Geolocation from Time-Lapse Polarization Imagery
- Global-Aware Edge Prioritization for Pose Graph Initialization | arXiv: 2602.21963
- Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Data
- Globally Optimal Pose from Orthographic Silhouettes
- Globscope: Toward a Global View of the Loss Landscape
- Gloria: Consistent Character Video Generation via Content Anchors | arXiv: 2603.29931
- Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves | arXiv: 2603.20850
- GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering | arXiv: 2603.15616
- GM-R²: Generative Matching Learning for Unsupervised Geometric Representation and Registration
- GMT: Effective Global Framework for Multi-Camera Multi-Target Tracking
- Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning | arXiv: 2512.00961
- GoalForce: Teaching Video Models to Accomplish Physics-Conditioned Goals | arXiv: 2601.05848
- Goldilocks Test Sets for Face Verification
- Good Can Sometimes be Bad: A Unified Attack against 3D Point Cloud Classifier by a Flexible Isotropic Resampling
- GOR-IS: 3D Gaussian Object Removal In the Intrinsic Space
- GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes | arXiv: 2604.02915
- GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection
- gQIR: Generative Quanta Image Reconstruction | arXiv: 2602.20417
- GR-Gauge: Cost-efficient Training Configuration By Gauging the Gradient Redundancy
- Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolution
- Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM
- Graph Attention Prototypical Network for Robust Few-Shot Classification
- Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning | arXiv: 2604.04372
- Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs | arXiv: 2510.00507
- GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologies
- GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning | arXiv: 2603.13370
- GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions
- GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
- GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion | arXiv: 2602.22862
- Gravitation-Driven Semantic Alignment for Text Video Retrieval
- Grid Distillation: Compositional Image Distillation via Structured Generative Grids
- GrOCE: Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models | arXiv: 2511.12968
- Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensors
- Grounded 3D-Aware Spatial Vision-Language Modeling | arXiv: 2605.30307
- Grounded Chain-of-Thought for Multimodal Large Language Models
- Grounded Latents for Entity-Centric 4D Scene Generation
- Grounding Everything in Tokens for Multimodal Large Language Models
- GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
- GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding | arXiv: 2604.02093
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Group Editing: Edit Multiple Images in One Go | arXiv: 2603.22883
- GROW: Watermark Generation with Progressive Guidance for Diffusion Models
- GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- GS-ASM: 2DGS-Supervised Active Stereo Matching
- GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning | arXiv: 2602.19206
- GSNR: Graph Smooth Null-Space Representation for Inverse Problems | arXiv: 2602.20328
- GSV2X: Geometry-Aware Uncertainty Modeling and Orthogonal Fusion for Robust Roadside Perception
- GS²: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting
- GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
- GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
- GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training | arXiv: 2512.13043
- Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Views
- GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
- GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents | arXiv: 2603.15039
- GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learning
- GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks | arXiv: 2603.25864
- GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- Guiding a Diffusion Model by Swapping Its Tokens | arXiv: 2604.08048
- Guiding a Diffusion Transformer with the Internal Dynamics of Itself | arXiv: 2512.24176
- Guiding Diffusion Models with Fine-Grained Conditions and Semantics-Preserving Sampling for One-Shot Federated Learning
- Guiding Diffusion Models with Semantically Degraded Conditions | arXiv: 2603.10780
- Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation
- Guiding Token-Sparse Diffusion Models
- GVIS: Generative Vector Image Steganography
- Gyro-based Deep Video Deblurring
- H-Sets: Hessian-Guided Discovery of Set-Level Feature Interactions in Image Classifiers | arXiv: 2604.22045
- H2-Surv: Hierarchical Hyperbolic Multimodal Representation Learning for Survival Prediction
- HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction | arXiv: 2605.16873
- HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning
- HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration
- HamiPose: Hamiltonian Optimization for Unsupervised Domain Adaptive Pose Estimation
- HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding | arXiv: 2603.02329
- HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance
- HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models | arXiv: 2603.26362
- HandWorld: Hand-Centric Unified Video Action Generation
- HandX: Scaling Bimanual Motion and Interaction Generation | arXiv: 2603.28766
- HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics
- Haptic Neural Fields: Bringing Tactile Interactions to 3D Rendered Scenes
- Harmonic Canvas: Inversion-Free Editing for Visually-Guided Music Style Transfer
- Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs
- Harmonized Feature Conditioning and Frequency-Prompt Personalization for Multi-Rater Medical Segmentation | arXiv: 2605.08210
- Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
- HarmoVid: Relightful Video Portrait Harmonization | arXiv: 2605.28811
- Harnessing the Power of Foundation Models for Accurate Material Classification
- HATS: Hardness-Aware Trajectory Synthesis for GUI Agents | arXiv: 2603.12138
- HAVE-Bench: Hierarchical Audio-Visual Evaluation from Perception to Interaction
- HAVEN: Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search | arXiv: 2601.13719
- HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models | arXiv: 2604.07812
- HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
- HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm | arXiv: 2605.24797
- HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading
- HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
- Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
- Hear What Matters! Text-conditioned Selective Video-to-Audio Generation | arXiv: 2512.02650
- Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization
- Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound
- Hearing the Room Through the Shape of the Drum: Modal-Guided Sound Recovery from Multi-Point Surface Vibrations
- HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering | arXiv: 2512.14870
- Hermite Radial Basis Function for Surface Reconstruction via Differentiable Rendering
- HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
- HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
- HeSS: Head Sensitivity Score for Sparsity Redistribution in VGGT | arXiv: 2603.25336
- Heterogeneous Decentralized Diffusion Models | arXiv: 2603.06741
- Heuristic Self-Paced Learning for Domain Adaptive Semantic Segmentation under Adverse Conditions | arXiv: 2603.24322
- Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection
- HFedATM: Hierarchical Federated Domain Generalization via Optimal Transport and Regularized Mean Aggregation
- HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filter
- Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphs | arXiv: 2603.27969
- HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation | arXiv: 2603.10128
- Hi-Lo Prune: Look at What You'll Lose before Pruning with Hierarchical Token Selection
- HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- HiconAgent: History Context-aware Policy Optimization for GUI Agents
- Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Models
- Hidden Monotonicity: Explaining Deep Neural Networks via their DC Decomposition
- HiDRA: Hierarchical Degradation Representation and Adaptation with Generative Priors for Enhancing Infrared Vision
- Hier-COS: Making Deep Features Hierarchy-aware via Composition of Orthogonal Subspaces | arXiv: 2503.07853
- HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling | arXiv: 2510.23043
- HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation | arXiv: 2603.06932
- Hierarchical Action Learning for Weakly-Supervised Action Segmentation
- Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning | arXiv: 2605.13213
- Hierarchical Codec Diffusion for Video-to-Speech Generation | arXiv: 2604.15923
- Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification
- Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation
- Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection
- Hierarchical Process Reward Models are Symbolic Vision Learners
- Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splatting | arXiv: 2603.29185
- Hierarchically Robust Zero-shot Vision-language Models
- HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing
- HierUQ: Hierarchical Uncertainty Quantification with Adaptive Granularity Reconciliation for Degraded Image Classification
- HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models | arXiv: 2512.09928
- HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation
- HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images | arXiv: 2603.02210
- HiFICL: High-Fidelity In-Context Learning for Multimodal Tasks | arXiv: 2603.12760
- High Resolution Neural Video Coding with Bi-directional Confidence-Guided Reference Information Modeling
- High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning | arXiv: 2503.22179
- High-Fidelity Mobile Avatars with Pruned Local Blendshapes | arXiv: 2605.01854
- High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learning
- High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy
- Hilbert Curve-Based Attention Enabling Topology-Preserving Image Tensor Representation for Semantic Segmentation Network
- Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning
- HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learning
- HINGE: Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images | arXiv: 2603.19766
- Hint2Gen: Bridging Understanding and Generation via Code-structured Hints
- HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models | arXiv: 2603.25411
- Hist2Style: Histogram-Guided Stylization with Bilateral Grids
- History to Future: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language Navigation
- HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models | arXiv: 2604.10772
- Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation
- HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- Homaloidal parametrization for detecting critical two-view configurations
- HoneyBee: Data Recipes for Vision-Language Reasoners | arXiv: 2510.12225
- HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement
- HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles | arXiv: 2602.21333
- HouseMind: Tokenization Allows MLLMs to Understand, Generate and Edit Architectural Floor Plans | arXiv: 2603.11640
- How Far Can We Go With Synthetic Data for Audio-Visual Sound Source Localization?
- How Much 3D Do Video Foundation Models Encode?
- How to Take a Memorable Picture? Empowering Users with Actionable Feedback | arXiv: 2102.21877
- HP-Edit: A Human-Preference Post-Training Framework for Image Editing
- HQC-NBV: A Hybrid Quantum-Classical View Planning Approach
- HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interaction
- HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation
- HTTM: Head-wise Temporal Token Merging for Faster VGGT
- Hugging Visual Prompt and Segmentation Tokens: Consistency Learning for Fine-Grained Visual Understanding in MLLMs
- HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models | arXiv: 2602.22727
- Human Geometry Distribution for 3D Animation Generation
- Human Interaction-Aware 3D Reconstruction from a Single Image | arXiv: 2604.05436
- Human-Centric Multi-Exposure Fusion: Benchmark and Bi-level Cognition Distillation Framework
- Human-like Abstract Visual Reasoning via Understanding and Solving Reasoning Loop
- HumanBA: Human-Aware Bundle Adjustment via Global Human-Camera Decoupling
- HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image | arXiv: 2606.02573
- Humanoid Generative Pre-Training for Zero-Shot Motion Tracking
- HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks | arXiv: 2412.17574
- HUMAPS-4D: A Multimodal Dataset for HUman Motion Analysis with Physiological and Semantic informations
- HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation
- Hunting Normality from Query Sample via Residual Learning for Generalist Anomaly Detection
- HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis
- Hybrid Agents for Image Restoration
- Hybrid Robust Collaborative Perception with LiDAR-4D Radar Fusion under Adverse Weather Conditions
- Hybrid Token Compression for Vision-Language Models
- HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving
- HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning | arXiv: 2604.15678
- Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modeling
- Hyperbolic Busemann Neural Networks | arXiv: 2602.18858
- Hyperbolic Defect Feature Synthesis for Few-Shot Defect Classification
- Hyperbolic Gramian Volumes for Multimodal Alignment
- Hyperbolic Prototype Learning with Uncertainty-Aware Consistency for Continual Test-Time Segmentation
- Hyperbolic Relational Prompts for Intersectional Fairness in Medical VLMs
- HyperGait: Unleashing the Power of Parsing for Gait Recognition in the Wild via Hypergraph
- HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatars | arXiv: 2507.02803
- Hypergraph-State Collaborative Reasoning for Multi-Object Tracking
- HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
- HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Prediction
- HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognition | arXiv: 2506.04764
- HySeg: Learning Generative Priors for Structure-Aware Remote Sensing Segmentation
- H²A²: Homogeneity-Aware and Heterogeneity-Aware Feature Perception for Unified Indoor 3D Object Detection
- I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers | arXiv: 2603.02919
- I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
- I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
- IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolution
- IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding | arXiv: 2508.09456
- IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
- ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects | arXiv: 2603.24912
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- ID-Sim: An Identity-Focused Similarity Metric
- Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization | arXiv: 2510.14255
- IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splatting
- IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbations | arXiv: 2602.18831
- IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semantics
- IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
- IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Models
- IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution
- IGen: Scalable Data Generation for Robot Learning from Open-World Images | arXiv: 2512.01773
- Illuminating Visual Identity in Universal Multimodal Embeddings
- Illumination-Consistent Human-Scene Reconstruction from Monocular Video
- Illustrator's Depth: Monocular Layer Index Prediction for Image Decomposition
- iLRM: An Iterative Large 3D Reconstruction Model
- Image Diffusion Preview with Consistency Solver | arXiv: 2512.13592
- Image Generation from Contextually-Contradictory Prompts
- Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidance
- Image-based Outlier Synthesis With Training Data
- Image-Guided Geometric Stylization of 3D Meshes
- Image-to-Point Cloud Feature Back-Projection for Multimodal Training of 3D Semantic Segmentation
- ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models
- Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval | arXiv: 2604.03653
- IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence
- Imbalanced View Contribution Evaluation and Refinement for Deep Incomplete Multi-View Clustering
- ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applications | arXiv: 2510.10113
- Immunizing Models Against Harmful Long-Horizon Fine-Tuning via Contractive Optimization Dynamics
- iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- Improving Adversarial Transferability with Local Perturbation Augmentation
- Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining | arXiv: 2604.27715
- Improving Controllable Generation: Faster Training and Better Performance via x0-Supervision
- Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance
- Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
- Improving Sparse Autoencoder with Dynamic Attention
- Improving Vision-language Models with Perception-centric Process Reward Models
- IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation
- IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion
- In Pursuit of Pixel Supervision for Visual Pre-training
- Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
- Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learning
- Inconsistency-aware Multimodal Schrodinger Bridge for Deepfake Localization
- IncreFA: Breaking the Static Wall of Generative Model Attribution | arXiv: 2604.17736
- Incremental Object Detection via Future-Aware Decoupled Cross-Head Distillation
- Inference-time Physics Alignment of Video Generative Models with Latent World Models
- Inferring Compositional 4D Scenes without Ever Seeing One
- InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
- InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields
- Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout | arXiv: 2511.20649
- InfinityHuman: Towards Long-Term Audio-Driven Human Animation
- Information-Theoretic Decomposition for Multimodal Interaction Learning | arXiv: 2606.11614
- InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation | arXiv: 2603.05898
- InsCal: Calibrated Multi-Source Fully Test-Time Prompt Tuning for Object Detection
- INSID3: Training-Free In-Context Segmentation with DINOv3 | arXiv: 2603.28480
- Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings | arXiv: 2604.08192
- INSIGHT Bench: Towards Grounded IN-SItu Guidance for Robotic Manipulation
- Instance-level Visual Active Tracking with Occlusion-Aware Planning | arXiv: 2604.21453
- InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space
- InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
- InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding
- Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset | arXiv: 2511.15186
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization
- Inter-Edit: First Benchmark for Interactive Instruction-Based Image Editing
- Inter-Photon-Limited Videography
- Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models
- Interactive Episodic Memory with User Feedback | arXiv: 2604.24893
- Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptation
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy
- InternVideo-Next: Towards World-Understanding Video Models
- InterPhys: Physics-aware Human Motion Synthesis in a Dynamic Scene
- Interpretable and Steerable Concept Bottleneck Sparse Autoencoders | arXiv: 2512.10805
- Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment | arXiv: 2603.17655
- Interpretable Debiasing of Vision-Language Models for Social Fairness | arXiv: 2602.24014
- Interpretable Prompts made Edit-Friendly: Token-to-Token Similarity Reduction in dLLMs for Edit-Friendly Hard Prompt Inversion
- InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions
- InterRVOS: Interaction-Aware Referring Video Object Segmentation
- Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics | arXiv: 2604.22832
- Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrieval
- InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Search
- Intrinsic Concept Extraction Based on Compositional Interpretability | arXiv: 2603.11795
- Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting
- Intrinsic Image Fusion for Multi-View 3D Material Reconstruction
- IntrinsicWeather: Controllable Weather Editing in Intrinsic Space | arXiv: 2508.06982
- IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework
- InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models | arXiv: 2504.05662
- InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-training
- InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting
- Investigating Self-Supervised Representations for Audio-Visual Deepfake Detection
- IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
- IPR-1: Interactive Physical Reasoner | arXiv: 2511.15407
- IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priors
- Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation | arXiv: 2603.16340
- Iris: Integrating Language into Diffusion-based Monocular Depth Estimation
- IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustness | arXiv: 2603.24996
- Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspective
- Is Parameter Isolation Better for Prompt-Based Continual Learning?
- Is the Modality Gap a Bug or a Feature? A Robustness Perspective
- Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
- iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception
- IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment | arXiv: 2603.19862
- iSplat: Iterative Learning for Fine-Grained Gaussian Splatting
- It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models | arXiv: 2601.00090
- Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control
- IVAAN: Instance-level Vision-Language Alignment via Attribute-Guided Text Prompts Generation for Nuclei Analysis
- Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injection
- JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization
- JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization
- Joint Learning of General and Diverse Patterns with Mixture of Memory Experts for Weakly-Supervised Video Anomaly Detection
- Joint Spectral Image Reconstruction and Semantic Segmentation with Cooperative Unfolding
- Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild | arXiv: 2602.21736
- JoPPO: Hierarchical Photography Assessment via Contrastive Joint Conditional Probabilistic Reinforcement Learning
- JRM: Joint Reconstruction Model for Multiple Objects without Alignment
- JUMP-Hand: Learning Joint-wise Uncertainty to Gate Mixture of View Experts for Multi-View 3D Hand Reconstruction
- Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers | arXiv: 2603.10744
- Kaleidoscopic Scintillation Event Imaging
- KAMP: Knowledge-Anchored Multimodal Pretraining Framework for Medical Image Representation
- KASALv2: Fully Automatic 3D Rotational Symmetry Classification and Axis Localization
- Keep It Frozen: Domain-Routed Conditional Residual Modulation for Multi-Domain Vision Transformers
- Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models
- KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems | arXiv: 2605.31596
- KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System | arXiv: 2512.20299
- Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
- KV-Tracker: Real-Time Pose Tracking with Transformers
- KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing | arXiv: 2602.04268
- Kαlos finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks | arXiv: 2603.27197
- L3DR: 3D-aware LiDAR Diffusion and Rectification
- LA-Pose: Latent Action Pretraining Meets Pose Estimation
- Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning
- Label-Free Cross-Task LoRA Merging with Null-Space Compression | arXiv: 2603.26317
- LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokens
- LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulation
- Lafite: A Generative Latent Field for 3D Native Texturing
- LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis
- LAM: Language Articulated Object Modelers
- LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference | arXiv: 2603.11605
- LAMP: Language-Assisted Motion Planning for Controllable Video Generation | arXiv: 2512.03619
- LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World | arXiv: 2605.05390
- Landscape-Awareness for Geometric View Diffusion Model
- LangField4D: Learning Identity-Adaptive and Spatio-Temporal Continuous 4D Language Fields for Dynamic Scenes
- LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splatting
- Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancement
- Language Models Can Explain Visual Features via Steering | arXiv: 2603.22593
- Language-driven Fine-grained Retrieval
- Language-Free Generative Editing from One Visual Example | arXiv: 2603.25441
- Language-Grounded Decoupled Action Representation for Robotic Manipulation (LaDA) | arXiv: 2603.12967
- Language-guided Frequency Modulation for Large Vision-Language Models
- Language-Guided One-Step Diffusion Model for Nighttime Flare Removal
- LAOF: Robust Latent Action Learning with Optical Flow Constraints | arXiv: 2511.16407
- Large-scale Robust Enhanced Ensemble Clustering via Outlier Decoupling
- LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priors
- LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency | arXiv: 2602.18735
- LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map
- LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstruction | arXiv: 2512.13680
- LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents
- LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs
- Latent Chain-of-Thought World Modeling for End-to-End Autonomous Driving | arXiv: 2512.10226
- Latent Diffusion Inversion Requires Understanding the Latent Space
- Latent Implicit Visual Reasoning
- LATTICE: Democratize High-Fidelity 3D Generation at Scale
- LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models
- Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detection | arXiv: 2603.10598
- Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
- Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenes
- LayoutAD: Exploring Semantic-Geometric Misalignment Reasoning for Scene Layout Anomaly Detection
- LazyVAR: Accelerating Visual Autoregressive Models via Scale-wise Token Pruning and Parallel Group Decoding
- LCA: Large-scale Codec Avatars - The Unreasonable Effectiveness of Large-scale Avatar Pretraining | arXiv: 2604.02320
- LDP-Slicing: Local Differential Privacy for Images via Randomized Bit-Plane Slicing
- LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving | arXiv: 2512.20563
- LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization | arXiv: 2604.11355
- LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories | arXiv: 2604.15311
- Learnability-Driven Submodular Optimization for Active Roadside 3D Detection | arXiv: 2601.01695
- Learnability-Guided Diffusion for Dataset Distillation | arXiv: 2604.00519
- Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation
- Learned Image Compression via Sparse Attention and Adaptive Frequency
- Learning 3D Reconstruction with Priors in Test Time | arXiv: 2604.03878
- Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images
- Learning 3D Shape Fidelity Metric from Real-world Distortions
- Learning a Unified Latent Action Space from Videos with Action-centric Cycle Consistency
- Learning Anchor in Dual Orthogonal Space for Fast Multi-view Clustering
- Learning and Aligning Click-Aware Shape Prior for Interactive Amodal Instance Segmentation
- Learning by Analogy: A Causal Framework for Compositional Generalization
- Learning Compact 3D Representations from Feed-Forward Novel View Synthesis
- Learning complete and explainable visual representations from itemized text supervision
- Learning Convex Decomposition via Feature Fields
- Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction | arXiv: 2602.18996
- Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularization
- Learning Differentiable Hierarchies in 3D Gaussian Splatting
- Learning Effective Sign Features without Text for Gloss-free Sign Language Translation
- Learning Eigenstructures of Unstructured Data Manifolds
- Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos | arXiv: 2603.25058
- Learning Forgery-Aware Lip Representations Without Forgery Priors
- Learning from Itself: Mining Internal Knowledge from Vision Language Models for Continual Learning
- Learning from Noisy Supervision: A Denoising-Debiasing Framework for Weakly Supervised Video Anomaly Detection
- Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgetting | arXiv: 2508.05059
- Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation
- Learning from Synthetic Data via Provenance-Based Input Gradient Guidance | arXiv: 2604.02946
- Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision | arXiv: 2603.13660
- Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generation
- Learning Latent Concepts for Detecting Out-of-Distribution Objects
- Learning Latent Proxies for Controllable Single-Image Relighting | arXiv: 2603.15555
- Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removal | arXiv: 2511.17353
- Learning Like Humans: Analogical Concept Learning for Generalized Category Discovery | arXiv: 2603.19918
- Learning Long-term Motion Embeddings for Efficient Kinematics Generation
- Learning Multi-View Spatial Reasoning from Cross-View Relations | arXiv: 2603.27967
- Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perception | arXiv: 2602.19596
- Learning Personalized Photographic Style from Pairwise User Preferences
- Learning Scene Coordinate Reconstruction from Unposed Images via Pose Graph Optimization
- Learning Spatial-Temporal Consistency for 3D Semantic Scene Completion
- Learning Straight Flows: Variational Flow Matching for Efficient Generation
- Learning Surgical Robotic Manipulation with 3D Spatial Priors
- Learning to Act Robustly with View-Invariant Latent Actions
- Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
- Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning | arXiv: 2603.11346
- Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions
- Learning to Diversify and Focus: A Reinforcement Framework for Open-Vocabulary HOI Detection
- Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos | arXiv: 2602.22091
- Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
- Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models | arXiv: 2603.06043
- Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation
- Learning to Infer Parameterized Representations of Plants from 3D Scans
- Learning to Learn Weight Generation via Local Consistency Diffusion
- Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
- Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding
- Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation | arXiv: 2508.05186
- Learning to See Through a Baby's Eyes: Early Visual Diets Enable Robust Visual Intelligence in Humans and Machines
- Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models
- Learning to Select Visual Tools from Experience
- Learning to Solve PDEs on Neural Shape Representations | arXiv: 2512.21311
- Learning to Track Instance from Single Nature Language Description | arXiv: 2605.07064
- Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
- Learning What Helps: Task-Aligned Context Selection for Vision Tasks
- Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection | arXiv: 2506.01085
- Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation
- Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency
- LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings | arXiv: 2503.19740
- Lens Component Deletion based on Differentiable Ray Tracing
- Lenses: Toward Polysemous Vision-Language Understanding
- LensWalk: Agentic Video Understanding by Planning How You See in Videos | arXiv: 2603.24558
- LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration | arXiv: 2602.20497
- Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation
- Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation | arXiv: 2504.05296
- Let VLMs Grade Their Own Thoughts: A Self-Quantification Approach to Reasoning-Aware Reward Modeling
- Let Your Image Move with Your Motion! – Implicit Multi-Object Multi-Motion Transfer | arXiv: 2603.01000
- Leveraging Class Distributions in CLIP for Weakly Supervised Semantic Segmentation
- Leveraging Multispectral Sensors for Color Correction in Mobile Cameras | arXiv: 2512.08441
- Leveraging Verifier-Based Reinforcement Learning in Image Editing
- LF-BVN: Blind-View Network for Self-Supervised Light Field Denoising
- LIBERO-Plus: A Progressive Robustness Benchmark for Visual-Language-Action Models
- LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving
- LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Space
- LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception
- LiDeRe: A Lightweight Readout for Fast and Data-Efficient Dense Prediction
- Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decoupling
- LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks
- Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment | arXiv: 2603.10929
- LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models | arXiv: 2605.19729
- Lifting Unlabeled Internet-level Data for 3D Scene Understanding | arXiv: 2604.01907
- Lighting in Motion: Spatiotemporal HDR Lighting Estimation
- Lighting-grounded Video Generation with Renderer-based Agent Reasoning | arXiv: 2604.07966
- LightMover: Generative Light Movement with Color and Intensity Controls | arXiv: 2603.27209
- LightRR: A Lightweight Network for Single Image Reflection Removal
- LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds | arXiv: 2603.24146
- Linear Fundamental Matrix Estimation from 7 or 5 Points
- Linear Image Generation by Synthesizing Exposure Brackets
- Linguistic Priors for Visual Decoupling: Towards Symmetric Vision-Brain Alignment
- Linking Modality Isolation in Heterogeneous Collaborative Perception | arXiv: 2603.00609
- Linking Perception, Confidence and Accuracy in MLLMs | arXiv: 2603.12149
- LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation | arXiv: 2510.08318
- Lipschitz Optimization for Formal Verification of Homographies | arXiv: 2605.23203
- LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration | arXiv: 2602.21754
- Lite Any Stereo: Efficient Zero-Shot Stereo Matching | arXiv: 2511.16555
- LitePT: Lighter Yet Stronger Point Transformer | arXiv: 2512.13689
- LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimation
- LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
- Live Interactive Training for Video Segmentation | arXiv: 2603.26929
- LiveGesture: Streamable Co-Speech Gesture Generation Model
- LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
- LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
- LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens
- LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models | arXiv: 2509.25896
- LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysis
- LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models | arXiv: 2603.14882
- LNEM: Lunar Neural Elevation Model
- Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos
- Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts
- LocalDPO: Direct Localized Detail Preference Optimization for Video Diffusion Models | arXiv: 2601.04068
- Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation
- Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
- Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigation | arXiv: 2603.16284
- LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
- LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment | arXiv: 2603.19609
- LoFA: Learning to Predict Personalized Prior for Fast Adaptation of Visual Generative Models
- LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioning
- LogCD: Local-to-global Consistency Distillation for Few-step Image Generation
- Logit-Margin Repulsion for Backdoor Defense
- LoL: Longer than Longer, Scaling Video Generation to Hour
- Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
- Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception | arXiv: 2604.09206
- Long-Tail Internet Photo Reconstruction
- LongStream: Long-Sequence Streaming Autoregressive Visual Geometry | arXiv: 2602.13172
- LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding | arXiv: 2602.20913
- LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling | arXiv: 2511.20785
- Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection | arXiv: 2507.16861
- LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation | arXiv: 2604.17190
- Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation | arXiv: 2603.23030
- LoPrune: Efficient Data Pruning for LoRA-Based Fine-Tuning of Vision Transformer
- LOREAL: Mitigating Low-Resolution Challenges in Vision-Language Models with Attribute-driven Prompt Self-Distillation
- LoST: Level of Semantics Tokenization for 3D Shapes | arXiv: 2603.17995
- LottieGPT: Tokenizing Vector Animation for Autoregressive Generation | arXiv: 2604.11792
- Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning | arXiv: 2604.03657
- Low-Rank Residual Diffusion Models
- Low-Rank Test-Time Training for Pre-Trained Point Cloud Models
- Low-Resolution Editing is All You Need for High-Resolution Editing | arXiv: 2511.19945
- LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imaging
- LRHDR: Learning Representation-enhanced HDR Video Reconstruction
- LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformers
- LumiMotion: Improving Gaussian Relighting with Scene Dynamics | arXiv: 2604.10994
- LUMINA: A Multi-Vendor Mammography Benchmark with Energy Harmonization Protocol | arXiv: 2603.14644
- LumiX: Structured and Coherent Text-to-Intrinsic Generation
- Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixels | arXiv: 2602.22140
- LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes | arXiv: 2601.15283
- LVLM-Aided Alignment of Task-Specific Vision Models | arXiv: 2512.21985
- Lyapunov Probes for Hallucination Detection in Large Foundation Models
- Lynx: Towards High-Fidelity Personalized Video Generation
- M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation | arXiv: 2509.23728
- M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
- M3Grounder: Mask-Based Multi-Span and Multi-Granular Grounding for Document QA
- M3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation | arXiv: 2512.20136
- M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG | arXiv: 2512.05959
- M4-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection
- M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction
- M4V: Multimodal Mamba for Efficient Text-to-Video Generation
- MA-Bench: Towards Fine-grained Micro-Action Understanding | arXiv: 2603.26586
- Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
- Machine Unlearning via Adaptive Gradient Reweighting and Multi-stage Objective Optimization
- MacTok: Robust Continuous Tokenization for Image Generation
- MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models
- MAD: Motion Appearance Decoupling for Efficient Driving World Models
- MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement | arXiv: 2602.01760
- MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mapping | arXiv: 2603.22650
- MagicQuill V2: Precise and Interactive Image Editing with Layered Visual Cues
- MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
- Make it SING: Analyzing Semantic Invariants in Classifiers
- MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
- Making the Classification Explanation Faithful to the Confidence Score
- Making Training-Free Diffusion Segmentors Scale with the Generative Power | arXiv: 2603.06178
- Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding | arXiv: 2603.20739
- MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentation | arXiv: 2604.20286
- MambaSIC: Mamba-based Stereo Image Compression with Bi-directional Multi-reference Entropy Model
- MAMMA: Markerless Accurate Multi-person Motion Acquisition
- MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning
- ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillation
- ManifoldNeuS: Manifold-aware View Optimizability for Pose-Free Neural Surface Reconstruction
- MANSION: Multi-floor Language-to-3D Scene Generation for Long-horizon Tasks
- Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
- MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction
- Mapping Networks
- MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models | arXiv: 2511.20629
- MapRoute: Semantic Routing for Precise Concept Erasure with Mapper
- MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization
- MARCO: Navigating the Unseen Space of Semantic Correspondence | arXiv: 2604.18267
- Mario: Multimodal Graph Reasoning with Large Language Models | arXiv: 2603.05181
- MARIS: Marine Open-Vocabulary Instance Segmentation
- Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splatting
- Markovian Scale Prediction: A New Era of Visual Autoregressive Generation | arXiv: 2511.23334
- MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures | arXiv: 2603.28550
- MARSS: Radar Semantic Segmentation via Modular Attention and State Space Models
- Mask to Align, Weight to Disambiguate: Reliable Unsupervised Cross-Modal Hashing with Masked-Weight Contrast
- MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters | arXiv: 2603.29272
- MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesis
- MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations | arXiv: 2602.18792
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- Masked Representation Modeling for Domain-Adaptive Segmentation | arXiv: 2509.13801
- Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learning
- MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation
- Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding | arXiv: 2512.02487
- Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
- MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models | arXiv: 2603.04800
- MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator | arXiv: 2512.11782
- Match-and-Fuse: Consistent Generation from Unstructured Image Sets | arXiv: 2511.22287
- MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervision | arXiv: 2602.20689
- Matching Every Pair to Track Every Point: PairFormer for All-Pairs Tracking and Video Trajectory Fields
- MatchMask: Mask-Centric Generative Data Augmentation for Label-Scarce Semantic Segmentation
- MatE: Material Extraction from Single-Image via Geometric Prior
- Material Magic Wand: Material-Aware Grouping of 3D Parts in Untextured Meshes
- MatLat: Material Latent Space for PBR Texture Generation
- MatMart: Material Reconstruction of 3D Objects via Diffusion
- MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis
- MatSpray: Fusing 2D Material World Knowledge on 3D Geometry
- MaxMark: High-Capacity Diffusion-Native Watermarking via Robust and Invertible Latent Embedding
- MCHDoc: A Comprehensive Benchmark for Reading Multi-Carrier Chinese Historical Documents
- MD2E: Modeling Depth-to-Edge Cues for Monocular Metric Depth Estimation
- MDCS-MoAME: Multi-directional Composite Scanning with Mixture of Attention and Mamba Experts for Cancer Survival Prediction
- MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
- MeanFlow Transformers with Representation Autoencoders
- MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving | arXiv: 2602.20060
- Measure The Feature Universe: Topology-based Pseudo Labeling and Gravity Consistency for Source-Free Domain Adaptation
- Measuring the (Un)Faithfulness of Concept-Based Explanations | arXiv: 2504.10833
- Mechanisms of Object Localization in Vision-Language Models | arXiv: 2605.19792
- Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
- MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation | arXiv: 2602.20423
- MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA
- MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding | arXiv: 2512.06581
- Medic-AD: Towards Medical Vision-Language Model's Clinical Intelligence | arXiv: 2603.27176
- MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration | arXiv: 2603.09101
- MedLIME: A Distribution-Aligned and Evidence-Supported Framework for Medical Saliency Explanations
- MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
- MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
- MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis
- MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mapping
- MEMO: Human-like Crisp Edge Detection Using Masked Edge Prediction | arXiv: 2603.20782
- Memory Matters: Boosting Training-Free Zero-Shot Temporal Action Localization with a Learnable Lookup Table
- Memory-Augmented Scene Understanding and Exploration for Open-World Aerial Object-Goal Navigation
- Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping | arXiv: 2603.20755
- Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation | arXiv: 2604.09088
- MER-Tracker: Towards High-Speed 3D Point Tracking via Multi-View Event-RGB Hybrid Cameras
- MERG3R: A Divide-and-Conquer Approach to Large-Scale Neural Visual Geometry
- Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Merging
- MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent | arXiv: 2511.18810
- MERIT: Multi-domain Efficient RAW Image Translation
- MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals
- Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation | arXiv: 2603.00526
- Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video
- MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer
- MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assembly
- MeshRipple: Structured Autoregressive Generation of Artist-Meshes
- MeshSplatting: Differentiable Rendering with Opaque Meshes
- MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation | arXiv: 2606.04688
- Meta-CoT: Enhancing Granularity and Generalization in Image Editing
- Meta-FC: Meta-Learning with Feature Consistency for Robust and Generalizable Watermarking
- Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding | arXiv: 2604.08537
- META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understanding
- MetaSpectra+: A Compact Broadband Metasurface Camera for Snapshot Hyperspectral+ Imaging | arXiv: 2603.09116
- MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction
- MeToM: Metadata-Guided Token Merging for Efficient Video LLMs
- MetricHMSR: Metric Human Mesh and Scene Recovery from Monocular Images
- MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes
- MFEN: Multi-Frequency Expert Network for Visible-Infrared Person Re-ID
- MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs
- MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registration
- Miburi: Towards Expressive Interactive Gesture Synthesis | arXiv: 2603.03282
- MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition
- MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models | arXiv: 2602.19497
- MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction
- Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding
- MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer | arXiv: 2511.18370
- MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation
- Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning | arXiv: 2603.13341
- Mind the Gap: Transferring Labels to Align Object Detection Datasets
- Mind the Hitch: Dynamic Calibration and Articulated Perception for Autonomous Trucks | arXiv: 2603.23711
- Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs | arXiv: 2603.02618
- MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving | arXiv: 2602.21952
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents | arXiv: 2511.23055
- MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning | arXiv: 2601.10649
- Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
- MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data and Training Recipes
- Minimal Constraint Relaxation for Multiview Autocalibration
- Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models
- Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection | arXiv: 2604.02071
- Mirai: Autoregressive Visual Generation Needs Foresight
- Mirror Illusion Art
- Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared | arXiv: 2603.08018
- Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos | arXiv: 2511.20525
- Mitigating Error Amplification in Fast Adversarial Training
- Mitigating Instance Entanglement in Instance-Dependent Partial Label Learning | arXiv: 2603.04825
- Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection | arXiv: 2509.03113
- Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation
- Mitigating Simplicity Bias in OOD Detection through Object Co-occurrence Analysis
- Mitigating The Distribution Shift of Diffusion-based Dataset Distillation
- MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention | arXiv: 2603.01361
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- Mixture of Prototypes for Test-time Adaptive Segmentation
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation | arXiv: 2511.12207
- Mixture of Style Experts for Diverse Image Stylization
- Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation
- MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
- MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editing
- MM-ACT: Learn from Multimodal Parallel Generation to Act
- MM-OVSeg: Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing
- MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction | arXiv: 2604.01600
- MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning
- MMBench-GUI: A Unified Hierarchical Evaluation Framework for Multi-Platform GUI Agents
- MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation
- MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restoration
- MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation
- MMGait: Towards Multi-Modal Gait Recognition | arXiv: 2604.15979
- MMLandmarks: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding | arXiv: 2512.17492
- MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with MLLMs | arXiv: 2604.10971
- MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
- MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation | arXiv: 2603.23896
- MMVIP: A Visible-infrared Paired Dataset for Multi-weather Marine Vision
- mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds
- Mobile-VTON: High-Fidelity On-Device Virtual Try-On | arXiv: 2603.00947
- MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignment
- Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining
- MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos | arXiv: 2512.10881
- MoCha: End-to-End Video Character Replacement without Structural Guidance
- MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation
- MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization | arXiv: 2603.03192
- Model Merging in the Essential Subspace | arXiv: 2602.20208
- Modeling Cross-vision Synergy for Unified Large Vision Model
- Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamics | arXiv: 2603.24176
- Modeling the Brain's Grammar: ROI-Guided fMRI Pretraining for Transferable and Interpretable Vision Decoding
- Modeling the Visual Ambiguity of Human Sketches
- Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints
- MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping | arXiv: 2511.15690
- MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
- ModularAgent: A Task-Aware Modular Framework for Joint Optimization of Multimodal Large Language Models and World Models
- MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models | arXiv: 2603.24984
- MoEActok: A MoE-based Action Tokenizer for Vision-Language-Action Models
- MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection | arXiv: 2603.03101
- MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-On | arXiv: 2606.11148
- MOGeo: Beyond One-to-One Cross-View Object Geo-localization
- MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation | arXiv: 2512.13840
- Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
- Momentum Memory for Knowledge Distillation in Computational Pathology | arXiv: 2602.21395
- MOMO: Mars Orbital Model — Foundation Model for Mars Orbital Applications | arXiv: 2604.02719
- Monet: Reasoning in Latent Visual Space Beyond Image and Language
- Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes (LegoOcc) | arXiv: 2602.22667
- MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label | arXiv: 2604.01646
- MonoVLM: Monocular 3D Visual Grounding with Vision Language Models
- MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamics
- MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding
- More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brain
- More Than Meets the Eye: A Unified Image Fusion Framework via Semantic-Pixel Entropy Trade-off for Zero-Shot Generalization
- More than the Sum: Panorama-Language Models for Adverse Omni-Scenes | arXiv: 2603.09573
- MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentation
- MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Experts
- MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer | arXiv: 2603.05078
- MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
- MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectional Blending with Hierarchical Densification
- MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenes
- MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing | arXiv: 2601.00204
- MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration
- MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re-Identification | arXiv: 2512.03404
- MOSAIC-GS: Monocular Scene Reconstruction via Advanced Initialization for Complex Dynamic Environments
- Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models | arXiv: 2603.16001
- Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis
- Motion-Aware Animatable Gaussian Avatars Deblurring | arXiv: 2411.16758
- MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE
- MotionEdit: Benchmarking and Learning Motion-Centric Image Editing
- MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models | arXiv: 2606.06853
- MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching | arXiv: 2604.23264
- MotionMaster: Generalizable Text-Driven Motion Generation and Editing
- MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting | arXiv: 2603.29296
- MotionV2V: Editing Motion in a Video
- Motus: A Unified Latent Action World Model
- MoVie: Broaden Your Views with Human Motion for Action Detection
- MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark | arXiv: 2601.02536
- MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second | arXiv: 2507.10065
- Moving Border Ownership for Event-based Motion Segmentation
- MPDiT: Multi-Patch Global-to-Local Transformer Architecture for Efficient Flow Matching | arXiv: 2603.26357
- MPL: Match-guided Prototype Learning for Few-shot Action Recognition
- MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answering
- MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior
- MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding | arXiv: 2512.02906
- MRI Contrast Enhancement Kinetics World Model | arXiv: 2602.19285
- MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale | arXiv: 2605.27235
- MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos
- MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognition
- MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting
- MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation | arXiv: 2511.10376
- MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding | arXiv: 2602.22932
- MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi-Scale Attention
- MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning | arXiv: 2603.25108
- MTA: Multimodal Task Alignment for BEV Perception and Captioning
- MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Scene | arXiv: 2604.17965
- MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model | arXiv: 2602.06393
- MUFASA: A Multi-Layer Framework for Slot Attention
- MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
- Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following | arXiv: 2511.21662
- Multi-Hierarchical Contrastive Spectral Fusion for Multi-View Clustering
- Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment (MoTiGA)
- Multi-Metric Representation Learning Strategy Based on Clustering for Fine-Grained Multimodal Sentiment Analysis
- Multi-modal Frequency Decomposition Network for Semantic Scene Completion
- Multi-Modal Image Fusion via Intervention-Stable Feature Learning | arXiv: 2603.23272
- Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery | arXiv: 2602.19910
- Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration
- Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models | arXiv: 2603.04846
- Multi-Prototype Compactness and Boundary-Aware Synthesis for Unsupervised Anomaly Detection
- Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning | arXiv: 2605.01736
- Multi-Scale Gradient-Guided Unrolling Architecture with Adaptive Mamba for Compressive Sensing
- Multi-Scale Local Speculative Decoding for Image Generation | arXiv: 2601.05149
- Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models | arXiv: 2505.17015
- Multi-speaker Attention Alignment for Multimodal Social Interaction
- Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation | arXiv: 2605.25220
- Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes | arXiv: 2604.19318
- Multi-View Hierarchical Alignment Learning for Spatial Transcriptomics
- Multi-view Pyramid Transformer: Look Coarser to See Broader
- MultiAnimate: Pose-Guided Image Animation Made Extensible
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation | arXiv: 2511.22989
- MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
- Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening
- Multimodal Causality-Driven Representation Learning for Generalizable Medical Image Segmentation | arXiv: 2508.05008
- Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance
- Multimodal Distribution Matching for Vision-Language Dataset Distillation | arXiv: 2605.23482
- Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration | arXiv: 2605.03820
- Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation | arXiv: 2603.12845
- Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
- Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation
- MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning | arXiv: 2602.20223
- Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex
- MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- MuM: Multi-View Masked Image Modeling for 3D Vision
- MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification | arXiv: 2602.20873
- Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training
- MusicInfuser: Making Video Diffusion Listen and Dance | arXiv: 2503.14505
- MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality | arXiv: 2603.26071
- MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy | arXiv: 2602.24222
- MV-Fashion: Towards Enabling Virtual Try-On and Size Estimation with Multi-View Paired Data
- MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction | arXiv: 2603.27542
- MV-TAP: Tracking Any Point in Multi-View Videos
- MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts
- MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation
- MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation | arXiv: 2601.06874
- MVInverse: Feed-forward Multiview Inverse Rendering in Seconds
- MVLM: Template-Free Tracking via Vision-Language Margin Confidence and Memory-Gated Tracking
- MVP: Multiple View Prediction Improves GUI Grounding
- NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filtering
- NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
- Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy | arXiv: 2603.02123
- NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration | arXiv: 2601.09823
- Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning | arXiv: 2603.06688
- NaTex: Seamless Texture Generation as Latent Color Diffusion
- Native and Compact Structured Latents for 3D Generation | arXiv: 2512.14692
- Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos | arXiv: 2605.26879
- NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
- NEAF: Natural Image Editing with Attention Fusion for Generalizable Test-time Optimization in Text-Guided Image Editing
- NeAR: Coupled Neural Asset–Renderer Stack | arXiv: 2511.18600
- NEC-Diff: Noise-Robust Event–RAW Complementary Diffusion for Seeing Motion in Extreme Darkness | arXiv: 2603.20005
- Negative Binomial Variational Autoencoders for Overdispersed Latent Modeling
- Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models | arXiv: 2511.16955
- Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models | arXiv: 2603.25994
- NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining
- NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos | arXiv: 2601.00393
- Nerfify: A Multi-Agent Framework for Turning NeRF Papers into Code | arXiv: 2603.00805
- NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training | arXiv: 2602.22059
- Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion
- Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequences | arXiv: 2602.22212
- Neural Collapse in Test-Time Adaptation | arXiv: 2512.10421
- Neural Differentiation in Deep Networks: A Theoretical Framework for Expressivity and Representational Diversity
- Neural Distribution Prior for LiDAR Out-of-Distribution Detection | arXiv: 2604.09232
- Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments | arXiv: 2604.12625
- Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy | arXiv: 2508.04728
- Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction | arXiv: 2604.15941
- Neural Mixture Density Processes
- Neural-Centric Video Processing Pipeline for Unified Multi-Task Inference
- Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control
- Neurodynamics-Driven Coupled Neural P Systems for Multi-Focus Image Fusion | arXiv: 2509.17704
- NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity | arXiv: 2604.09817
- NeuROK: Generative 4D Neural Object Kinematics | arXiv: 2605.30347
- NeuroRule: Bridging Vision and Logic with Differentiable Rule Induction
- NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initialization | arXiv: 2603.23104
- Next-Scale Autoregressive Models for Text-to-Motion Generation | arXiv: 2604.03799
- Next-Scale Prediction: A Self-Supervised Approach for Real-World Image Denoising
- NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
- NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation | arXiv: 2604.14706
- NI-Tex: Non-isometric Image-based Garment Texture Generation | arXiv: 2511.18765
- NIL: No-data Imitation Learning
- NimbusGS: Unified 3D Scene Reconstruction under Hybrid Weather | arXiv: 2603.27228
- NitroGen: An Open Foundation Model for Generalist Gaming Agents
- No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistency | arXiv: 2602.23559
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models | arXiv: 2603.25722
- No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priors | arXiv: 2602.23141
- No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection | arXiv: 2602.19248
- No Way To Steal My Face: Proactive Defense Against Identity-Preserving Personalized Generation
- Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFs | arXiv: 2603.12078
- Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignment | arXiv: 2603.11617
- Nonlinear Color Transfer via Learnable Bezier Flows
- Nonparametric Deep Fine-grained Clustering with Low-Rank Guided Vision-Language Model
- NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection | arXiv: 2603.21069
- Nope-SGS: 3D Gaussian Reconstruction from Unposed Spike Streams
- NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning | arXiv: 2602.21172
- Not All Birds Look The Same: Identity-Preserving Generation For Birds
- NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing | arXiv: 2603.02802
- NOWA: Null-space Optical Watermark for Invisible Capture Fingerprinting and Tamper Localization
- NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learning
- NTK-Guided Implicit Neural Teaching | arXiv: 2511.15487
- NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devices | arXiv: 2504.03118
- NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting
- OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning | arXiv: 2604.17052
- Object-Generalized Re-Identification: A Step Towards Universal Instance Perception
- Object-WIPER: Training-Free Object and Associated Effect Removal in Videos | arXiv: 2601.06391
- ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGS
- Obstruction Reasoning for Robotic Grasping
- OccAny: Generalized Unconstrained Urban 3D Occupancy | arXiv: 2603.23502
- Occluded Human Body Capture with Frequency Domain Denoising Prior
- Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Tracking | arXiv: 2603.06034
- OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective | arXiv: 2512.20770
- OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning
- OctoNav: Towards Generalist Embodied Navigation
- Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
- OctoT2I: A Self-Evolving Agentic Text-to-Image Router
- OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models | arXiv: 2603.09326
- ODGS-SLAM: Omnidirectional Gaussian Splatting SLAM
- Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting | arXiv: 2512.15508
- OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Control
- Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environments | arXiv: 2602.22025
- OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation
- OMG-Avatar: One-shot Multi-LOD Gaussian Head Avatar
- OMG-Bench: A New Challenging Benchmark for Skeleton-based Online Micro Hand Gesture Recognition | arXiv: 2512.16727
- OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance | arXiv: 2605.25778
- Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
- Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass
- Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detection
- Omni-Attack: Adversarial Attacks on Open-Ended VQA in Black-Box Multimodal LLMs
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization | arXiv: 2512.10955
- Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection | arXiv: 2605.01638
- Omni-MMSI: Toward Identity-Attributed Social Interaction Understanding | arXiv: 2604.00267
- Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning
- Omni2Sound: Towards Unified Video-Text-to-Audio Generation
- OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
- OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
- OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging | arXiv: 2603.21660
- OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion | arXiv: 2604.12356
- OmniGen2: Towards Instruction-Aligned Multimodal Generation
- OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
- OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens | arXiv: 2603.02138
- OmniRet: Efficient and High-Fidelity Omni Modality Retrieval | arXiv: 2603.02098
- OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text | arXiv: 2604.04348
- OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
- OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding | arXiv: 2604.25276
- OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models | arXiv: 2511.14582
- OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data
- OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring
- On the Role of Temporal Granularity in the Robustness of Spiking Neural Networks
- On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models | arXiv: 2603.27481
- One Algorithm to Align Them All
- One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs
- One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers | arXiv: 2603.12245
- One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
- One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination
- One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation
- One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer
- One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control | arXiv: 2603.18093
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- OneHOI: Unifying Human-Object Interaction Generation and Editing
- OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Camera | arXiv: 2511.03571
- OneSparse: A Unified Framework for Sparse Activation Layers in Vision Models
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
- OneThinker: All-in-one Reasoning Model for Image and Video | arXiv: 2512.03043
- Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precision
- Online3R: Online Learning for Consistent Sequential Reconstruction Based on Geometry Foundation Model
- OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery | arXiv: 2603.17355
- OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting | arXiv: 2603.18510
- OntoAug: Rethinking Generative Data Augmentation via Ontology Guidance
- Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generation
- Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles
- Open-Vocabulary Domain Generalization in Urban-Scene Segmentation | arXiv: 2602.18853
- Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
- OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data
- OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery | arXiv: 2603.27645
- OpenFS: Multi-Hand-Capable Fingerspelling Recognition with Implicit Signing-Hand Detection and Frame-Wise Letter-Conditioned Synthesis | arXiv: 2602.22949
- Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer
- OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments | arXiv: 2603.02390
- OpenMMReasoner: Pushing the Frontiers in Multimodal Reasoning with an Open and General Recipe
- OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Data
- OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
- OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness | arXiv: 2602.19035
- OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
- OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation | arXiv: 2603.27637
- Opti-NeuS: Neural Reconstruction for Dual-Layered Transparent and Opaque Objects
- Optical Diffraction-based Convolution for Semiconductor Lithography
- Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics
- OptiMVMap: Offline Vectorized Map Construction via Optimal Multi-vehicle Perspectives
- OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
- OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis
- OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation | arXiv: 2509.18600
- ORBIT: Benchmarking SfM in the Wild with 360° Video
- ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
- ORD: Object-Relation Decoupling for Generalized 3D Visual Grounding
- Order Matters: 3D Shape Generation from Sequential VR Sketches | arXiv: 2512.04761
- ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
- OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation
- ORION: ORthonormal Text Encoding for Universal VLM Adaptation
- OrionEdit: Bridging Reference and Source Images for Generalized Cross-Image Editing
- ORSATR-X: A Foundation Model based on Differential-and-Excitation Networks for Optical Remote Sensing Object Recognition
- OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style-Concept Adapters for Diffusion Models
- Orthogonal Spatial-Aware Multi-View Anchor Graph Clustering for Incomplete Remote Sensing Data
- ORV: 4D Occupancy-centric Robot Video Generation
- OS-FED: One Snapshot Is All You Need
- OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
- OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement
- OSMO: Open-vocabulary Self-eMOtion Tracking
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism
- Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation | arXiv: 2604.00452
- Outlier-Robust Diffusion Solvers for Inverse Problems | arXiv: 2605.09477
- Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos
- OVI-MAP: Open-Vocabulary Instance-Semantic Mapping
- OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
- P-Flow: Prompting Visual Effects Generation
- P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction
- P3Sim: Perceptual 3D Simulation with Physical World Modeling
- PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
- PackUV: Packed Gaussian UV Maps for 4D Volumetric Video
- PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
- PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Models
- PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery | arXiv: 2603.26068
- PAF: Perturbation-Aware Filtering for Open-Set Semi-Supervised Learning
- PAI-Bench: A Comprehensive Benchmark For Physical AI
- PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation | arXiv: 2601.07060
- PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation | arXiv: 2603.22193
- PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects
- PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving
- PaNDaS: Learnable Shape Interpolation Modeling with Localized Control
- Pano360: Perspective to Panoramic Vision with Geometric Consistency | arXiv: 2603.12013
- Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image | arXiv: 2603.05908
- PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
- PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery | arXiv: 2603.17571
- Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion | arXiv: 2605.25449
- Paparazzo: Active Mapping of Moving 3D Objects
- Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper
- PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detection | arXiv: 2603.06917
- Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression | arXiv: 2603.03615
- Parallel Jacobi Decoding for Fast Autoregressive Image Generation | arXiv: 2606.05703
- Parallel Rigidity Matters for Bundle Adjustment
- Parallelised Differentiable Straightest Geodesics for 3D Meshes | arXiv: 2603.15780
- ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
- Parameter-Efficient Adaptation for MLLMs via Implicit Modality Decomposition
- Parameter-efficient Continual Learning for Enhancing Plasticity without Forgetting under Limited Model Capacity
- Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection | arXiv: 2604.04444
- Parameterized Prompt for Incremental Object Detection
- ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parking
- Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory
- PARSE: Part-Aware Relational Spatial Modeling
- Part\(^{2}\)GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Partial Weakly-Supervised Oriented Object Detection
- ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation
- Particulate: Feed-Forward 3D Object Articulation | arXiv: 2512.11798
- ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis | arXiv: 2603.09611
- PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
- PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Models
- PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding
- PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion
- PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondence
- PAVAS: Physics-Aware Video-to-Audio Synthesis
- PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation
- PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation | arXiv: 2603.17520
- PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning | arXiv: 2605.13467
- PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection
- PE3R: Perception-Efficient 3D Reconstruction | arXiv: 2503.07507
- PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentation | arXiv: 2603.21528
- PECCAVI: Overcoming the Brittleness of AI Image Watermarking Under Visual Paraphrasing Attacks
- Perceiving the Near, Reasoning the Distant: Coherent Long-Horizon Trajectory Prediction for Autonomous Driving
- Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
- Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Rule | arXiv: 2506.09217
- Perceptual Neural Video Compression with Color Separation and Rank Chain
- Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
- PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing
- PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing | arXiv: 2603.19731
- PerpetualWonder: Long-horizon Action-conditioned 4D Scene Generation
- PersonaLive! Expressive Portrait Image Animation for Live Streaming
- Personalized Federated Training of Diffusion Models with Privacy Guarantees
- Personalized Image Descriptions from Attention Sequences
- Personalized Longitudinal Medical Report Generation via Temporally-Aware Federated Adaptation
- PersonaVLM: Long-Term Personalized Multimodal LLMs | arXiv: 2604.13074
- PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training | arXiv: 2604.00503
- PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting
- PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learning | arXiv: 2602.20537
- PG-VTON: Single-Pass Training-Free Virtual Try-On via Patch-Guided Reference Alignment
- PGA: Prior-free Generative Attack for Practical No-box Scenario
- PGR-Net: Prior-Guided ROI Reasoning Network for Brain Tumor MRI Segmentation | arXiv: 2603.21626
- pH-Strips for Selective Forgetting: A Blunt but Fast Diagnostic Baseline for Machine Unlearning
- PHAC: Promptable Human Amodal Completion | arXiv: 2603.14741
- Phantom: Physical Object Interactions as Dynamic Triggers for NMS-Exploited Backdoors
- Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics | arXiv: 2604.08503
- PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement | arXiv: 2509.24850
- Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals
- PhaseWin: Reducing Object-Level Attribution from Quadratic Complexity to Near-Linear Phase-Window Search
- PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors | arXiv: 2601.17470
- PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Prediction
- Photo-Guided Tooth Segmentation on 3D Oral Scan Model
- Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement
- PhotoFramer: Multi-modal Image Composition Instruction | arXiv: 2512.00993
- Phrase-grounded APO for Improving Chest X-ray Report Generation
- Phrase-Grounding-Aware Supervised Fine-Tuning for Chart Recognition via Side-Masked Attention
- PhyCo: Learning Controllable Physical Priors for Generative Motion | arXiv: 2604.28169
- PhyCritic: Multimodal Critic Models for Physical AI
- PhyGaP: Physically-Grounded Gaussians with Polarization Cues | arXiv: 2603.14001
- PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion
- PhysGaia: A Physics-Aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis | arXiv: 2506.02794
- PhysGen: Physically Grounded 3D Shape Generation for Industrial Design | arXiv: 2512.00422
- PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis | arXiv: 2508.13911
- PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimation | arXiv: 2511.18570
- PhysHead: Simulation-Ready Gaussian Head Avatars | arXiv: 2604.06467
- PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Video
- Physical Adversarial Clothing Evades Visible-Thermal Detectors via Non-Overlapping RGB-T Pattern | arXiv: 2605.04675
- Physical Object Understanding with a Physically Controllable World Model | arXiv: 2606.00439
- Physical Simulator In-the-Loop Video Generation | arXiv: 2603.06408
- Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts
- Physically Inspired Gaussian Splatting for HDR Novel View Synthesis | arXiv: 2603.28020
- Physically-Grounded Turbulence Mitigation with Frame-Shared Degradation Parameters
- Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction | arXiv: 2603.00149
- Physics-Guided Multistep Deformation Reversal for Ancient Bamboo Slip Restoration
- PhysInOne: Visual Physics Learning and Reasoning in One Suite | arXiv: 2604.09415
- PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting
- PhysSkin: Real-Time and Generalizable Physics-Based Skin Simulation | arXiv: 2603.23194
- PhysVid: Physics Aware Local Conditioning for Generative Video | arXiv: 2603.26285
- PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
- Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
- PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization
- PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing | arXiv: 2603.04598
- PinPoint: Focus, Don't Prune — Identifying Instruction-Relevant Regions for Information-Rich Image Understanding | arXiv: 2603.22815
- PIP-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matching | arXiv: 2602.20496
- PIX-TAB: Efficient PIXel-Precise TABle Structure Recognition Approach with Speculative Decoding and Region-Based Image Segmentation
- PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction | arXiv: 2603.05888
- PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation | arXiv: 2604.15670
- Pixel Motion Diffusion Is What We Need for Robot Control | arXiv: 2509.22652
- Pixel2Phys: Distilling Governing Laws from Visual Dynamics | arXiv: 2602.19516
- PixelDiT: Pixel Diffusion Transformers for Image Generation | arXiv: 2511.20645
- PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion | arXiv: 2602.12769
- Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision | arXiv: 2602.19715
- PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories
- PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching | arXiv: 2603.20818
- PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning
- Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model | arXiv: 2603.05438
- Plant Taxonomy Meets Plant Counting: A Fine-Grained, Taxonomic Dataset for Counting Hundreds of Plant Species | arXiv: 2603.21229
- Plenoptic Video Generation
- Plug-and-Play Incomplete Multi-View Clustering via Janus-Faced Affinity Learning with Topology Harmonization
- Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstruction
- Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers | arXiv: 2511.16156
- PMRNet: Physics-informed Multi-scale Refinement Network for Medical Image Segmentation
- PNG: Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning | arXiv: 2603.04870
- PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems
- POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation | arXiv: 2604.24171
- POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval
- PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems | arXiv: 2604.16540
- Point Cloud as a Foreign Language for Multi-modal Large Language Model
- Point4Cast: Streaming Dynamic Scene Reconstruction and Forecasting
- PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models | arXiv: 2603.00412
- PointCNN++: Performant Convolution on Native Points
- PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learning
- Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selection | arXiv: 2603.04337
- PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting
- Pointing at Parts: Training-Free Few-Shot Grounding in Multimodal LLMs
- PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
- POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
- Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors | arXiv: 2603.18782
- PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Model
- PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding | arXiv: 2604.04933
- PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation
- POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling
- PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes
- Polarization State Tracing for Reflection Removal and Color-Consistent Reconstruction
- Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning | arXiv: 2605.31115
- PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction
- Portable Active Learning for Object Detection | arXiv: 2605.10349
- PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment
- Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priors
- Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identification
- PoseAnything: General Pose-guided Video Generation with Part-aware Temporal Coherence
- PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose
- PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning
- PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splatting
- PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation | arXiv: 2506.21076
- PositionIC: Unified Position and Identity Consistency for Image Customization
- Post-training Feature Pruning for Fundus Images Classification
- PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation | arXiv: 2603.24078
- PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedback
- PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation
- POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse | arXiv: 2511.19339
- PowerCLIP: Powerset Alignment for Contrastive Pre-Training
- PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representation
- PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
- PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction
- PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detection
- PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration
- PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis | arXiv: 2604.04576
- PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation
- Precise Object and Effect Removal with Adaptive Target-Aware Attention | arXiv: 2505.22636
- Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering
- Predicting Spatial Transcriptomics from Histology Images via High-Order Multi-Cell Interaction Modeling
- Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models | arXiv: 2603.20808
- Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy | arXiv: 2603.26299
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models | arXiv: 2604.25642
- Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
- Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality | arXiv: 2512.07951
- Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidance
- Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation | arXiv: 2604.01474
- PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverage
- Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models | arXiv: 2603.22094
- PRISM: Learning a Shared Primitive Space for Transferable Skeleton Action Representation
- PRISM: Prototype-based Reasoning with Inter-modal Semantic Mining for Interpretable Image Recognition
- PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion | arXiv: 2505.22564
- PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes | arXiv: 2506.19117
- PrivateEyes: Gaze-Preserving Anonymization for Data Sharing
- PriVi: Towards a General-Purpose Video Model for Primate Behavior in the Wild | arXiv: 2511.09675
- PrivSynth: Alternating and Control-Based Optimization for Privacy and Utility in Synthetic Data
- ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices
- Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection | arXiv: 2603.25203
- Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completion
- Probabilistic Precipitation Nowcasting with Rectified Flow Transformers | arXiv: 2605.31204
- Probabilistic Prompt Adaptation for Unified Image Aesthetics and Quality Assessment
- Probing and Bridging Geometry–Interaction Cues for Affordance Reasoning in Vision Foundation Models | arXiv: 2602.20501
- ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformers
- ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation | arXiv: 2603.05530
- Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation
- Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
- Progressive Cross-Modal Causal Intervention for Long-Term Action Recognition
- Progressive Guessing to Fixed Point: Rethinking Human Motion Prediction with Deep Equilibrium Models
- Progressive Mask Distillation for Self-supervised Video Representation
- Progressive Multi-cue Alignment for Unaligned RGBT Tracking
- Progressive Neural Architecture Generation
- Progressive Supernet Training for Efficient Visual Autoregressive Modeling
- ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatars | arXiv: 2603.16447
- ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategy
- ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control
- ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
- PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On | arXiv: 2603.11675
- Prompt Yourself: Awakening Textual Semantics in 1D Visual Tokenizers
- Prompt-Anchored Vision–Text Distillation for Lifelong Person Re-identification | arXiv: 2605.05027
- Prompt-Free Universal Region Proposal Network | arXiv: 2603.17554
- Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensing
- PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligence
- PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward
- PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimization
- PromptMoE: A Segmentation Refinement Framework Leveraging Mixture of Experts for Improved Prompting
- PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts | arXiv: 2603.01650
- Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guarantees | arXiv: 2603.00324
- ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Prediction | arXiv: 2604.01081
- Property-Informed Diffusion-Based Text-to-Microstructure Generation
- PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models
- ProPhy: Progressive Physical Alignment for Dynamic World Simulation
- ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environments
- Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurement
- Protect to Adapt: Orthogonal Subspace Control with Ranked Negative-Prompt Curriculum for Few-Shot Action Recognition
- Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposure
- Prototype-as-Prompt: Multimodal Sentiment Prototypes Endowing Large Language Models the Capability to Perform Multimodal Sentiment Analysis
- Prototype-based Causal Intervention for Multi-Label Image Classification
- Prototype-Guided Concept Erasure in Diffusion Models | arXiv: 2603.08271
- Prototypical Action Reasoning Facilitated by Vision-Language Alignment for Egocentric Action Anticipation
- Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splatting
- Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
- Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment | arXiv: 2605.08064
- ProxyFL: A Proxy-Guided Framework for Federated Semi-Supervised Learning | arXiv: 2602.21078
- PRUE: A Practical Recipe for Field Boundary Segmentation at Scale | arXiv: 2603.27101
- Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives | arXiv: 2602.24136
- Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving | arXiv: 2508.13305
- PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion
- PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow | arXiv: 2603.25738
- PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards | arXiv: 2512.01236
- PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency | arXiv: 2604.01791
- PureCC: Pure Learning for Text-to-Image Concept Customization | arXiv: 2603.07561
- PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Models
- Push-and-Step: From RL-Based Balance Recovery to Physical Simulation of Dense Crowds
- Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning
- PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Grounding
- PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representations
- PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference
- PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
- QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessment | arXiv: 2603.03726
- QKD: Quantum-Gated Task-interaction Knowledge Distillation for Class-Incremental Learning | arXiv: 2604.11112
- QuadSync: Quadrifocal Tensor Synchronization via Tucker Decomposition | arXiv: 2602.22639
- Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization | arXiv: 2602.24059
- QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models
- Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models
- QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models | arXiv: 2602.20309
- QuCNet: Quantum Deep Learning Driven Multi-Circuit Network for Remote Sensing Image Classification
- Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift | arXiv: 2605.05328
- QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidence
- QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy
- Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding | arXiv: 2603.15167
- QuietPrune: Query-Guided Early Token Pruning for Vision-Language Models
- Quota-Calibrated Fine-Grained Alignment with Context-Aware Marginals for Text-based Person Retrieval
- QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer | arXiv: 2605.31124
- Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
- R\(^2\)TUA: Reconstruction-residual Based Targeted and Untargeted Attack Against Text-Image Person Re-Identification
- R-4B: Incentivizing General-Purpose Auto-Thinking in MLLMs via Bi-Mode Annealing and Reinforce Learning
- R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
- R2-Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejection
- R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSII | arXiv: 2604.08810
- R3-PCQA: Ray-Reprojection-Reinforcement for No-Reference 3D Point Cloud Quality Assessment
- R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment
- R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
- R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection | arXiv: 2603.11566
- RAAS: LLM Agentic System Architecture Search with GRPO
- Radar-Guided Polynomial Fitting for Metric Depth Estimation | arXiv: 2503.17182
- RADAR: VQ-VAE Decoder of VAR is a Good Student for Restoring Against Degradation by Acceleration
- Radiance Meshes for Volumetric Reconstruction
- RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generation
- RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detection
- RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation | arXiv: 2603.03617
- RAID: Retrieval-Augmented Anomaly Detection
- RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment | arXiv: 2603.00483
- RAM: Recover Any 3D Human Motion in-the-Wild | arXiv: 2603.19929
- RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation
- Random Wins All: Rethinking Grouping Strategies for Vision Tokens | arXiv: 2603.00486
- Rank-Guided Pseudo-Bias Learning for Robust Black-Box Adaptation
- RankOOD: Class Ranking-based Out-of-Distribution Detection
- RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing | arXiv: 2602.19753
- RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning
- RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion
- RARE: Learn to RAnk and REtrieve for Monocular 3D Object Detection
- Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signals | arXiv: 2604.02603
- Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought | arXiv: 2507.07685
- RaUF: Learning the Spatial Uncertainty Field of Radar
- RAVEN: Erasing Invisible Watermarks via Novel View Synthesis
- RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation
- RAW-Domain Degradation Models for Realistic Smartphone Super-Resolution | arXiv: 2603.12493
- RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusion
- RayNova: Scale-Temporal Autoregressive World Modeling in Ray Space | arXiv: 2602.20685
- RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation | arXiv: 2603.11106
- RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detection
- RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation | arXiv: 2604.03454
- Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
- Re-evaluating Continual VQA: Toward Fair and Robust Evaluation for Multimodal Continual Learning
- RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
- REACH: Explicit Recovery Behavior for Diffusion Policies
- Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
- Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMG
- ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering | arXiv: 2511.22715
- ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoning
- Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awareness
- Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs | arXiv: 2606.01620
- Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization
- Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human-Computer Interaction
- Real-Time Neural Video Compression with Unified Intra and Inter Coding
- Real-World Point Tracking with Verifier-Guided Pseudo-Labeling | arXiv: 2603.12217
- Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface | arXiv: 2512.19402
- Real2Sim2Real: RetinalDepth-64K for Depth Estimation in Posterior Segment Ophthalmic Surgery
- RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals
- RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs
- ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation | arXiv: 2605.16080
- Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning | arXiv: 2605.13852
- Reallocating Attention Across Layers to Reduce Multimodal Hallucination | arXiv: 2510.10285
- REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting | arXiv: 2510.16410
- RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark | arXiv: 2509.24897
- RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation | arXiv: 2603.14880
- REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting
- ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
- Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision | arXiv: 2603.27179
- ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps | arXiv: 2505.18675
- ReasonX: MLLM-Guided Intrinsic Image Decomposition
- ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIP
- ReBaPL: Repulsive Bayesian Prompt Learning
- RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Credits
- ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval | arXiv: 2602.01639
- RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenes
- Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learning | arXiv: 2603.05235
- ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling
- Reconstructing CLIP for Open-Vocabulary Dense Perception
- Reconstructing Spiking Neural Networks Using a Single Neuron with Autapses
- Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning | arXiv: 2603.22758
- Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Prediction | arXiv: 2603.10597
- Recovering Physically Plausible Human-Object Interactions from Monocular Videos | arXiv: 2606.05359
- RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Faces | arXiv: 2602.20618
- RECS4R: Bridging Semantics and Geometry for Referring Remote Sensing Interpretation
- Rectifying Latent Space for Generative Single-Image Reflection Removal
- RecTok: Reconstruction Distillation along Rectified Flow
- Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress | arXiv: 2603.17312
- Recurrent Video Masked Autoencoders
- Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Bases
- ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
- Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP
- Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Models
- ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusing
- RefAV: Towards Planning-Centric Scenario Mining
- Refaçade: Editing Object with Given Reference Texture
- Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
- Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning | arXiv: 2505.20107
- Reflection Separation from a Single Image via Joint Latent Diffusion | arXiv: 2606.04107
- ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation | arXiv: 2601.17468
- ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstruction
- Refracting Reality: Generating Images with Realistic Transparent Objects | arXiv: 2511.17340
- Reframing Long-Tailed Learning via Loss Landscape Geometry | arXiv: 2603.21217
- ReFTA: Breaking the Weight Reconstruction Bottleneck in Tensorized Parameter-Efficient Fine-Tuning
- RefTon: Reference Person Shot Assist Virtual Try-on | arXiv: 2511.00956
- ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understanding
- RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised HOI Detection
- Region-Adaptive Sampling for Diffusion Transformers
- Region-Aware Instance Consistency Learning for Micro-Expression Recognition
- Region-Wise Correspondence Prediction between Manga Line Art Images
- RegionFuse: Region-Adaptive Pixel Distribution Learning for Infrared and Visible Image Fusion
- RegionRoute: Regional Style Transfer with Diffusion Model
- Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence | arXiv: 2605.01450
- Regulating Rather than Constraining: Adaptive Guidance for Complex Spectral Reconstruction in Pansharpening
- RehearseVLA: Simulated Post-Training for VLAs with Physically-Consistent World Model | arXiv: 2509.24948
- ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
- Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning | arXiv: 2604.04379
- Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition
- Reinforcing Structured Chain-of-Thought for Video Understanding | arXiv: 2603.25942
- Reinforcing Video Object Segmentation to Think before it Segments
- Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference
- REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion | arXiv: 2601.16788
- Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editing | arXiv: 2603.17531
- ReLaGS: Relational Language Gaussian Splatting | arXiv: 2603.17605
- Relational Visual Similarity | arXiv: 2512.07833
- ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
- Reliable Clustering Number Estimation for Contrastive Multi-View Clustering
- Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learning
- Reliev3R: Relieving Feed-forward 3D Reconstruction from Multi-View Geometric Annotations | arXiv: 2604.00548
- Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Views
- RelightAnyone: A Generalized Relightable 3D Gaussian Head Model
- ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detection
- ReMatch: Boosting Representation through Matching for Multimodal Retrieval
- RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacks
- Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection | arXiv: 2603.18541
- ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformers
- ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data | arXiv: 2604.01082
- ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding | arXiv: 2602.16412
- ReMoT: Reinforcement Learning with Motion Contrast Triplets | arXiv: 2603.00461
- Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework
- Render-to-Adapt: Unsupervised Personal Adaptation for Gaze Estimation
- RenderFlow: Single-Step Neural Rendering via Flow Matching | arXiv: 2601.06928
- Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recovery | arXiv: 2603.01034
- Representation-Steered Incremental Adapter-Tuning for Class-Incremental Learning with Pre-Trained Models
- Repurposing 3D Generative Model for Autoregressive Layout Generation
- ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
- ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point-Supervised Segmentation for Remote Sensing Images
- ResCa: Residual Caching for Diffusion Transformers Acceleration
- ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenes | arXiv: 2601.11508
- ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
- Residual Connections Harm Generative Representation Learning | arXiv: 2404.10947
- Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering | arXiv: 2606.01911
- Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance | arXiv: 2602.01047
- Residual Diffusion Bridge Model for Image Restoration | arXiv: 2510.23116
- Residual Primitive Fitting of 3D Shapes with SuperFrusta
- ResiHMR: Residual-Limb Aware Single-Image 3D Human Mesh Recovery for Individuals with Limb Loss | arXiv: 2604.28025
- Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
- Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
- Resolving the Identity Crisis in Text-to-Image Generation | arXiv: 2510.01399
- Resolving the Stability-Plasticity Dilemma in Reinforcement Learning via Complementary Continual Critics
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
- Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
- RetFormer: Multimodal Retrieval for Enhancing Image Recognition
- Rethinking 2D-3D Registration: A Novel Network for High-Value Zone Selection and Representation Consistency Alignment
- Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights
- Rethinking BCE Loss for Multi-Label Image Recognition with Fine-Tuning
- Rethinking Box Supervision: Bias-Free Weakly Supervised Medical Segmentation
- Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation | arXiv: 2603.02139
- Rethinking Concept Bottleneck Models: From Pitfalls to Solutions | arXiv: 2603.05629
- Rethinking Cross-Modal Anchor Alignment for Mitigating Error Accumulation
- Rethinking Dataset Distillation: Hard Truths about Soft Labels | arXiv: 2604.18811
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- Rethinking Glyph Spatial Information in Font Generation
- Rethinking Intermediate Representation for VLM-based Robot Manipulation
- Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspective
- Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token | arXiv: 2603.19026
- Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance | arXiv: 2605.01325
- Rethinking Occlusion Modeling for UAV Tracking
- Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty | arXiv: 2603.16538
- Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation | arXiv: 2604.03738
- Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
- Rethinking SNN Online Training and Deployment: Gradient-Coherent Learning via Hybrid-Driven LIF Model | arXiv: 2410.07547
- Rethinking Token Reduction for Large Vision-Language Models
- Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
- Rethinking Visual Rearrangement from A Diffusion Perspective
- RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting | arXiv: 2603.13783
- RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
- Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?
- Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bank
- Retrieving Counterfactuals Improves Visual In-Context Learning | arXiv: 2603.16737
- RevINN: An End-to-End Invertible Neural Network for Reversible Adversarial Examples Generation
- Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
- Revisiting 3D Reconstruction Kernels as Low-Pass Filters
- Revisiting F-measure Optimization in Multi-Label Classification: A Sampling-based Approach
- Revisiting Geometric Obfuscation with Dual Convergent Lines for Privacy-Preserving Image Queries in Visual Localization | arXiv: 2604.22310
- Revisiting Learning with Noisy Labels: Active Forgetting and Noise Suppression
- Revisiting Model Stitching in the Foundation Model Era | arXiv: 2603.12433
- Revisiting Monocular SLAM with Spatio-Temporal Scene Modeling
- Revisiting Optimal Coding for I-ToF under Practical Sensor Constraints
- Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstruction
- Revisiting Sparsity Constraint Under High-Rank Property in Partial Multi-Label Learning
- Revisiting the Necessity of Full Accuracy: Weakly Supervised Object-Level Offset Correction for Misaligned Building Labels
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
- Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors
- Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learning | arXiv: 2603.07898
- Revisiting Visual Corruptions in LVLMs: A Shape-Texture Perspective on Model Failures
- REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
- REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancement | arXiv: 2604.27504
- Reviving ConvNeXt for Efficient Convolutional Diffusion Models | arXiv: 2603.09408
- Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
- Reward Sharpness-Aware Fine-Tuning for Diffusion Models
- RewardFlow: Generate Images by Optimizing What You Reward | arXiv: 2604.08536
- ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstruction | arXiv: 2601.16672
- Rewis3d: Reconstruction Improves Weakly-Supervised Semantic Segmentation | arXiv: 2603.06374
- RF4D: Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes
- RFDM: Residual Flow Diffusion Models for Video Editing
- RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
- RHCNet: Residual-Guided Hierarchical Calibration Network for Robust Underwater Object Detection
- RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos | arXiv: 2605.17014
- RHO: Robust Holistic OSM-Based Metric Cross-View Geo-Localization | arXiv: 2603.27758
- RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval
- RigMo: Unifying Rig and Motion Learning for Generative Animation
- RINO: Rotation-Invariant Non-Rigid Correspondences
- RISE: Single Static Radar-based Indoor Scene Understanding
- RiskProp: Collision-Anchored Self-Supervised Risk Propagation for Early Accident Anticipation | arXiv: 2603.27165
- RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360deg Image Quality Assessment
- RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning | arXiv: 2605.19033
- RMAE-ProGRess: Advancing Semantic Segmentation in Unstructured Environments
- RMIR: A Benchmark Dataset for Reasoning-Intensive Multimodal Image Retrieval
- RNED: Rotary Number Encoding and Decoding for Medical VLMs
- RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations | arXiv: 2603.01194
- RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
- RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extraction
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
- Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generation
- RoboAgent: Chaining Basic Capabilities for Embodied Task Planning | arXiv: 2604.07774
- RoboTAG: End-to-end Robot Pose Estimation via Topological Alignment Graph
- RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video | arXiv: 2511.22950
- RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning
- Robust Promptable Video Object Segmentation | arXiv: 2605.12006
- Robust Remote Sensing Image–Text Retrieval with Noisy Correspondence
- Robust Spiking Neural Networks by Temporal Mutual Information
- Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splatting
- Robustness Under Data Scarcity: Few-Shot Continual Adversarial Training for Evolving Threats
- RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations | arXiv: 2602.22013
- Role-SynthCLIP: A Role-Play Driven Diverse Synthetic Data Approach
- RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation
- Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models
- RoSAMDepth: Robust Self-supervised Depth Estimation Leveraging Segment Anything Model
- ROSE: Rotate Your Large Language Model to See
- Rosetta Stone for Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation
- Rotation Invariant and Symmetry Aware Pixel Difference Network for Remote Sensing Object Detection
- Rounded or Streamlined Head? Bridging Concept Bottleneck Models and Attribute-Described Object Parts
- Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoising
- RPGFusion: 4D Radar Prior-Guided Multi-Modal Fusion for 3D Detection
- rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training | arXiv: 2604.11156
- RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation | arXiv: 2603.24295
- RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting | arXiv: 2605.18263
- RunawayEvil: Jailbreaking the Image-to-Video Generative Models
- RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
- S\(^2\)-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
- S2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds | arXiv: 2512.00995
- S2C2Seg: Semantic-Spatial Consistency and Category Optimization for Open-Vocabulary Segmentation
- S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations
- S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs
- S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain | arXiv: 2605.08589
- SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors | arXiv: 2505.22499
- SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World | arXiv: 2602.18887
- SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
- SafeLogo: Turning Your Logos into Jailbreak Shields via Micro-Regional Adversarial Training
- SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers
- SAG-GNN: Semantic-Aware Guided GNN for Descriptor-Free 2D-3D Matching
- SAGA: Source Attribution of Generative AI Videos
- SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
- SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domains
- SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning
- SAIDO: Scene-Aware and Importance-Guided Dynamic Optimization for Generalizable AI-Generated Image Detection
- SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning | arXiv: 2603.05437
- Saliency-Driven Token Merging for Vision Transformers
- Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning
- Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward | arXiv: 2604.04500
- SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning | arXiv: 2603.26316
- SAM 3D Body: Robust Full-Body Human Mesh Recovery
- SAM 3D: 3Dfy Anything in Images
- SAM2Text: Towards Prompt-Free and Multi-Resolution Video Scene Text Segmentation
- Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination
- Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs | arXiv: 2512.08923
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- SAME: Sparse and Anchored Model Editing for Heterogeneous Incremental Learning under Limited Data
- SAMIX: Reinforcing SAM2 with Semantic Adapter and Reference Selecting Policy for Mix-Supervised Segmentation
- SAMosaic3D: Modular Scene Assembly for Real-Time 3D Segment Anything
- Sampling-Aware Quantization for Diffusion Models
- SAMTok: Representing Any Mask with Two Words
- SANER: Switchable Adapter with Non-parametric Enhanced Routing for Person De-Reidentification
- SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics | arXiv: 2603.12193
- SAQN: Semantic-based Adaptive Query Network for 3D Referring Expression Segmentation
- SAR2Net: Learning Spatially Anchored Representations for Retrieval-Guided Cross-Stain Alignment
- SARL-STG: A Spatially Aware Reinforcement Learning Framework for Refining MLLMs in Spatio-Temporal Video Grounding
- SARMAE: Masked Autoencoder for SAR Representation Learning | arXiv: 2512.16635
- SASNet: Spatially-Adaptive Sinusoidal Networks for INRs | arXiv: 2503.09750
- SAT-RRG: LLM-Guided Self-Adaptive Training for Radiology Report Generation with Token-Level Push–Pull Optimization
- SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross-Subject EEG-to-Image Retrieval | arXiv: 2603.20738
- SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion | arXiv: 2603.12764
- SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval | arXiv: 2603.08224
- Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits
- Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction
- Scalable Feature Matching via State Space Modeling and Sparse Correlation
- Scalable Multi-View Subspace Clustering with Tensorized Anchor Guidance
- Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models | arXiv: 2603.24721
- Scalable Trajectory Generation for Whole-Body Mobile Manipulation
- Scale Space Diffusion: Integrating Scale Space into the Diffusion Process
- Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
- Scaling Dense Event-Stream Pretraining from Visual Foundation Models
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- Scaling Multi-Identity Consistency for Image Customization via Multi-to-Multi Matching Paradigm
- Scaling Parallel Sequence Models to Vision Foundation Models
- Scaling Spatial Intelligence with Multimodal Foundation Models | arXiv: 2511.13719
- Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework | arXiv: 2603.07659
- Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism | arXiv: 2603.29252
- Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes
- Scaling View Synthesis Transformers (SVSM) | arXiv: 2602.21341
- Scaling Zero-Shot Reference-to-Video Generation
- Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems | arXiv: 2604.08366
- Scaling4D: Pushing the Frontier of Video Novel View Synthesis through Large-Scale Monocular Videos
- Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration
- SCAPO: Self-Supervised Category-Level Articulated Pose Estimation from a Single 3D Observation
- SCE-Depth: A Spherical Compound Eye Framework for Wide FOV Depth Estimation
- SCE-SLAM: Scale-Consistent Monocular SLAM via Scene Coordinate Embeddings
- SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens
- ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation
- Scene Grounding In the Wild | arXiv: 2603.26584
- Scene Reconstruction as Mapping Priors for 3D Detection | arXiv: 2605.22997
- Scene-Centric Unsupervised Video Panoptic Segmentation | arXiv: 2606.04925
- Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models | arXiv: 2512.21778
- SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
- Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
- SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations | arXiv: 2604.07990
- SceneTok: A Compressed, Diffusable Token Space for 3D Scenes
- SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System
- SCIEval: Evaluating and Benchmarking the Faithfulness of Scientific Image Generation and Interpretation with Large Multimodal Models
- Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling | arXiv: 2512.12675
- Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring | arXiv: 2506.21011
- SCoRe: Salience-Coverage Reduction for Vision Token Pruning in Vision-Language Models
- Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers
- SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation | arXiv: 2604.03134
- SDDF: Specificity-Driven Dynamic Focusing for Open-Vocabulary Camouflaged Object Detection | arXiv: 2603.26109
- SDGS: Spatial Difference Guided Gaussian Splatting for Simultaneous Localization and 3D Reconstruction
- SDTrack: A Baseline for Event-based Tracking via Spiking Neural Networks
- SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control
- SE(3)-Equivariance with Geometric and Topological Guidance for Category-Level Object Pose Estimation
- SEA-Flow3D: Simplified, Efficient, and Accurate Scene Flow via Spatial Vector Sampling and Multi-scale Refinement
- SEA-Vision: A Multilingual Benchmark for Document and Scene Text Understanding in Southeast Asia | arXiv: 2603.15409
- SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering
- SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models | arXiv: 2602.18993
- SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving | arXiv: 2604.08008
- SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
- SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker | arXiv: 2604.12502
- SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning
- SECOS: Semantic Capture for Rigorous Classification in Open-World Semi-Supervised Learning | arXiv: 2604.27596
- SeD-UD: An Influence-Driven and Hierarchically-Decoupled Information Bottleneck for Multimodal Intent Recognition
- See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
- See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
- See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs | arXiv: 2602.21497
- See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
- See Through the Noise: Improving Domain Generalization in Gaze Estimation | arXiv: 2604.16562
- See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
- See What We Cannot See: A Geo-guided Reasoning Benchmark for Object Counting under Adverse Earth Observation Conditions
- See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles | arXiv: 2509.13615
- SeeGroup: Multi-Layer Depth Estimation of Transparent Surfaces via Self-Determined Grouping
- Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding
- Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos
- Seeing Beyond: Extrapolative Domain Adaptive Panoramic Segmentation | arXiv: 2603.15475
- Seeing Both Sides: Towards Bidirectional Semantic Alignment for Open-Vocabulary Camouflaged Object Segmentation
- Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness | arXiv: 2602.19615
- Seeing Conversations: Communication Context Identification in Egocentric Video
- Seeing Depth Through Frequency and Motion: A Progressive Training Paradigm for Monocular Depth Estimation
- Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement | arXiv: 2603.22187
- Seeing Motion Through Polarity for Event-based Action Recognition
- Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark | arXiv: 2603.27259
- Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals
- Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events
- Seeing Through the Noise: Improving Infrared Small Target Detection and Segmentation from Noise Suppression Perspective
- Seeing Through the Shift: Causality-Inspired Robust Generalized Category Discovery
- Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions | arXiv: 2604.11579
- Seeing What Matters: A Training-Free Self-Guided Framework for Multimodal Detail Perception and Reasoning
- Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
- Seeing without Pixels: Perception from Camera Trajectories | arXiv: 2511.21681
- Seele: A Unified Acceleration Framework for Real-Time Gaussian Splatting on Mobile Devices
- SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation | arXiv: 2602.23359
- SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation | arXiv: 2512.03350
- SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation | arXiv: 2605.22658
- SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images
- SegGBC: Justifiable Coarse-to-Fine Granular-Ball Computing for Enhancing Clustering Image Segmentation
- SegMo: Co-Designing Content-Aware Sparsity and Locally-Cohesive Segment Parallelism for Efficient VLM Inference
- SegMoTE: Token-Level Mixture of Experts for Medical Image Segmentation
- SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models | arXiv: 2507.14811
- Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
- Select, Hypothesize and Verify: Towards Verified Neuron Concept Interpretation | arXiv: 2603.24953
- Selection-as-Nonlinearity: Bridging Attention and Activation via a Joint Game-Decision Lens for Interpretable, Discriminative Visual Representations
- Selective Amnesia using Contrastive Subnet Erasure for Class Level Unlearning in Vision Models
- Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation | arXiv: 2605.19340
- Selectively Extracting and Injecting Visual Attributes into Text-to-Image Models
- SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs
- Self-Attention Driven Tensor Representation for High-Order Data Recovery
- Self-Consistency for LLM-Based Motion Trajectory Generation and Verification | arXiv: 2603.29301
- Self-Corrected Image Generation with Explainable Latent Rewards | arXiv: 2603.24965
- Self-Critical Distillation Network for Video-based Commonsense Captioning
- Self-Diffusion Driven Blind Imaging
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- Self-guided Semantic Inspection for Zero-Shot Composed Image Retrieval
- Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation
- Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration
- SelfHVD: Self-Supervised Handheld Video Deblurring | arXiv: 2508.08605
- Selfi: Self-improving Reconstruction Engine via 3D Geometric Feature Alignment
- Semantic Alignment for Pose-Invariant Identity Preserving Diffusion
- Semantic Audio-Visual Navigation in Continuous Environments | arXiv: 2603.19660
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions
- Semantic Foam: Unifying Spatial and Semantic Scene Decomposition | arXiv: 2604.26262
- Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
- Semantic Scale Space: A Framework for Controllable Image Abstraction
- Semantic-Adaptive Diffusion for Dynamic Spatiotemporal Fusion
- Semantic-Guided Global-Local Collaborative Prompt Learning for Few-Shot Class Incremental Learning
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- SemanticVLA: Towards Semantic Reasoning over Action Memorization via Synergistic Explicit Trace and Latent Action Planning
- Semi-Supervised Conformal Prediction With Unlabeled Nonconformity Score | arXiv: 2505.21147
- Semi-supervised Echocardiography Video Segmentation via Anchor Semantic Awareness and Continuous Pseudo-label Reforging
- SemiGDA: Generative Dual-distribution Alignment for Semi-Supervised Medical Image Segmentation | arXiv: 2604.23274
- SemLayer: Semantic-aware Generative Segmentation and Layer Construction for Abstract Icons | arXiv: 2603.24039
- SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection | arXiv: 2604.18476
- SemVideo: Reconstructs What You Watch from Brain Activity via Hierarchical Semantic Guidance
- SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching
- SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning
- Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving | arXiv: 2605.22809
- SFR-Net: Steering-Fusion-Refining Network in Multi-label Zero-Shot Sewer Defect Detection
- SG-LoRA: Semantic-guided LoRA Parameters Generation
- SG-NLF: Spectral-Geometric Neural Fields for Pose-Free LiDAR View Synthesis | arXiv: 2603.12903
- SGAD-SLAM: Splatting Gaussians at Adjusted Depth for Better Radiance Fields in RGBD SLAM | arXiv: 2603.21055
- SGDE: Self-supervised Geometry Degradation Estimation Framework for Coded Aperture Compressive Spectral Imaging
- SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving
- SGI: Structured 2D Gaussians for Efficient and Compact Large Image Representation | arXiv: 2603.07789
- SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse-View Indoor Inverse Rendering | arXiv: 2603.27516
- SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals
- ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
- SHANDS: A Multi-View Dataset and Benchmark for Surgical Hand-Gesture and Error Recognition Toward Medical Training
- Shape-of-You: Fused Gromov-Wasserstein Optimal Transport for Semantic Correspondence in-the-Wild | arXiv: 2603.11618
- SHAPE: Structure-aware Hierarchical Unsupervised Domain Adaptation with Plausibility Evaluation for Medical Image Segmentation
- ShapeAR: Generating Editable Shape Layers via Autoregressive Diffusion
- ShapeR: Robust Conditional 3D Shape Generation from Casual Captures
- SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting | arXiv: 2603.28091
- SharpTimeGS: Sharp and Stable Dynamic Gaussian Splatting via Lifespan Modulation
- Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack
- ShelfOcc: Native 3D Supervision beyond LiDAR for Vision-Based Occupancy Estimation
- ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration | arXiv: 2603.00906
- Shoe Style-Invariant and Ground-Aware Learning for Dense Foot Contact Estimation | arXiv: 2511.22184
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild | arXiv: 2603.28760
- ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement | arXiv: 2512.13303
- ShowUI-π: Flow-based Generative Models as GUI Dexterous Hands
- ShreddingNet: Coarse-to-Fine Restoration for Multi-Source Shredded Manuscripts
- SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models | arXiv: 2604.17041
- SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
- SIGMA: A Physics-Based Benchmark for Gas Chimney Understanding in Seismic Images
- SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens
- SignPR: A Progressive Vector-Quantized Diffusion Framework for Sign Language Production
- Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning | arXiv: 2602.18867
- Similarity-Consistent Likelihood Diffusion enables Hidden Person Detection from Wall Reflections
- SimLBR: Learning to Detect Fake Images by Learning to Detect Real Images | arXiv: 2602.20412
- SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models | arXiv: 2512.05955
- Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization
- Simple but Effective Triplet-Based Compression Strategies for Compact Visual Localization
- Simple-ViLMedSAM: Simple Text Prompts Meet Vision-Language Models for Medical Image Segmentation
- SimplePoster: A Simple Baseline for Product Poster Generation | arXiv: 2605.08784
- SimRecon: SimReady Compositional Scene Reconstruction from Real Videos | arXiv: 2603.02133
- SimScale: Learning to Drive via Real-World Simulation at Scale | arXiv: 2511.23369
- SIMSPINE: A Biomechanics-Aware Simulation Framework for 3D Spine Motion Annotation and Benchmarking
- SineProject: Machine Unlearning for Stable Vision–Language Alignment | arXiv: 2511.18444
- SinGeo: Unlock Single Model's Potential for Robust Cross-View Geo-Localization
- Single-Round Scalable Analytic Federated Learning
- Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
- SIR: Structured Image Representations for Explainable Robot Learning
- SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation | arXiv: 2603.18599
- SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition | arXiv: 2603.29692
- Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation | arXiv: 2603.02190
- Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation
- SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
- SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation | arXiv: 2405.18716
- SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting | arXiv: 2604.19202
- SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs
- SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
- SkillSight: Efficient First-Person Skill Assessment with Gaze
- Skullptor: High Fidelity 3D Head Reconstruction in Seconds with Multi-View Normal Prediction
- Sky2Ground: A Benchmark for Site Modeling under Varying Altitude | arXiv: 2603.13740
- Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
- SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design | arXiv: 2511.13285
- SkySense-VITA: Towards Universal In-context Segmentation of Multi-modal Remote Sensing Imagery
- SL-HOI: Streamlined Open-Vocabulary Human-Object Interaction Detection
- SLARM: Streaming and Language-Aligned Reconstruction Model for Dynamic Scenes
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation | arXiv: 2603.29186
- Small Object, Great Challenge: A Benchmark for Small Object Visual Grounding
- SMAP: Semantic Route Planning with Map-Grounded Multimodal Alignment
- Smart Replay: Adaptive Scheduling of Memory Rehearsal for Computational Resource-Aware Incremental Learning
- SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs | arXiv: 2604.23996
- SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models
- Smoothing the Score Function to Enhance Generalization in Diffusion Models
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- SMV-EAR: Bring Spatiotemporal Multi-View Representation Learning into Efficient Event-Based Action Recognition
- SMVRT: Implicit Human 3D Modeling Using Sparse Multi-View Volumetric Reconstruction with Transformer Fusion
- SO(3)-Equivariant ViT-Adapter for Data-Efficient Zero-Shot Sim-to-Real Indoor Panoramic Depth Estimation
- SO-Bench: A Structural Output Evaluation of Multimodal LLM
- SoC: Semantic Orthogonal Calibration for Test-Time Prompt Tuning
- SoccerMaster: A Vision Foundation Model for Soccer Understanding | arXiv: 2512.11016
- SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
- Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction
- SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer | arXiv: 2603.07057
- SOLACE: Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards | arXiv: 2603.00918
- SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
- Solvability of the Viewing Graph Under the Affine Camera Model
- Solving a Nonlinear Blind Inverse Problem for Tagged MRI with Physics and Deep Generative Priors | arXiv: 2603.00882
- Solving Minimal Problems Without Matrix Inversion Using FFT-Based Interpolation | arXiv: 2605.06572
- SonoWorld: From One Image to a 3D Audio-Visual Scene | arXiv: 2603.28757
- SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs | arXiv: 2602.22716
- SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models
- Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation
- SounDiT: Geo-Contextual Soundscape-to-Landscape Generation
- SouPLe: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts | arXiv: 2603.22732
- Space-Time Forecasting of Dynamic Scenes with Motion-aware Gaussian Grouping
- SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
- SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time
- SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL | arXiv: 2512.04069
- SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection | arXiv: 2511.06702
- SPAR: Single-Pass Any-Resolution ViT for Open-Vocabulary Segmentation | arXiv: 2604.02252
- SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge
- SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs | arXiv: 2603.12382
- Sparse Spectral LoRA: Routed Experts for Medical VLMs
- Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
- Sparse-View Localization via Online Neural 3D Regression
- SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras | arXiv: 2603.26481
- Sparsely Timing the Change: A Spiking Temporal Framework for Remote Sensing Interpretation
- SparseOIT: Improving Order-Independent Transparency 3DGS via Active Set Method
- SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction
- SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model | arXiv: 2511.22039
- Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection | arXiv: 2604.26409
- Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion | arXiv: 2604.05780
- SparVAR: Exploring Sparsity in Visual Autoregressive Modeling for Training-Free Acceleration | arXiv: 2602.04361
- Spatia: Video Generation with Updatable Spatial Memory
- Spatial Matters: Position-Guided 3D Referring Expression Segmentation
- Spatial Retrieval Augmented Autonomous Driving
- Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
- Spatial-Frequency Collaborative Learning for Occluded Visible-Infrared Person Re-Identification
- Spatial-SAM: Spatially Consistent 3D Electron Microscopy Segmentation with SDF Memory and Semi-Supervised Learning
- Spatial-Spectral Residuals Informed Diffusion Neural Operator for Pan-sharpening
- Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning | arXiv: 2510.27606
- SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling
- SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models | arXiv: 2602.20901
- SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence | arXiv: 2505.17012
- SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning | arXiv: 2603.27437
- SpatialTree: How Spatial Intelligence Branches Out in MLLMs
- SpatialVID: A Large-Scale Video Dataset with Spatial Annotations
- Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking
- Spatio-Temporal Difference Guided Motion Deblurring with the Complementary Vision Sensor
- Spatiotemporal Pyramid Flow Matching for Climate Emulation
- SPDMark: Selective Parameter Displacement for Robust Video Watermarking | arXiv: 2512.12090
- Spe-BEVHead: Rethinking the Detection Head Design for Bird's-Eye-View Object Detection
- SPE-MVS: Spatial Position Encoding Enhanced Multi-View Stereo with Monocular Depth Priors
- SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding
- Specificity-aware Reinforcement Learning for Fine-grained Open-world Classification | arXiv: 2603.03197
- Spectral Conformal Risk Control: Distribution-Free Tail Guarantees via Bayesian Quadrature
- Spectral Mixture-of-Experts for Continual Learning
- Spectral Scalpel: Amplifying Adjacent Action Discrepancy via Frequency-Selective Filtering for Skeleton-Based Action Segmentation
- Spectral Super-Resolution via Adversarial Unfolding and Data-Driven Spectrum Regularization | arXiv: 2603.00920
- Spectrally Distilled Representations Aligned with Instruction-Augmented LLMs for Satellite Imagery
- SPECTRE: Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers
- Spectrum from Defocus: Fast Spectral Imaging with Chromatic Focal Stack
- SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping
- SpeeDiff: Scalable Pixel-Anchored End-to-End Latent Diffusion Model
- Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists | arXiv: 2603.09277
- SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation | arXiv: 2603.11492
- Spherical Leech Quantization for Visual Tokenization and Generation
- Spherical Voronoi: Directional Appearance as a Differentiable Partition of the Sphere
- SpiderCam: Low-Power Snapshot Depth from Differential Defocus
- Spike-driven Discrete Aggregation for Event-based Object Detection
- SpikeTrack: A Spike-driven Framework for Efficient Visual Tracking | arXiv: 2602.23963
- SpikeTrack: High-performance and Energy-efficient Event-Based Object Tracking with Spiking Neural Network
- SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras | arXiv: 2603.14885
- Spk2VidNet: A Hierarchical Recurrent Architecture for High-Fidelity Video Reconstruction from Long Spike-Camera Streams
- Splat-Based Metal Artifact Reduction in Cone-Beam CT via Compact Attenuation Modeling
- Splatent: Splatting Diffusion Latents for Novel View Synthesis | arXiv: 2512.09923
- SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting
- SplitFlux: Learning to Decouple Content and Style from a Single Image
- Spot The Ball: A Benchmark for Visual Social Inference
- SPOT: Spatiotemporal Prompt Optimization for Motion-Stabilized MLLM-Guided Video Segmentation
- SpotEdit: Selective Region Editing in Diffusion Transformers
- SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion
- SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed-Forward Gaussian Splatting | arXiv: 2602.24020
- SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
- SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names
- SRGCD: Stability-Driven Region Growth Framework for 3D Change Detection
- SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
- SSM-Aware Token-Efficient VMamba via Adaptive Patch Pruning and Merging for Person Re-Identification
- ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting
- Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation | arXiv: 2604.20336
- Stabilizing Feature Geometry in Noisy Pretrained Models for Robust Downstream Tasks
- Stabilizing Streaming Video Geometry via Dynamic Feature Normalization
- Stable and Efficient Single-Rollout RL for Multimodal Reasoning
- Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching
- Stable Spike: Dual Consistency Optimization via Bitwise AND Operations for Spiking Neural Networks | arXiv: 2603.11676
- StableMaterials: Enhancing Diversity in Material Generation via Semi-Supervised Learning
- StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets | arXiv: 2506.08013
- STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction | arXiv: 2603.20284
- STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
- Stake the Points: Structure-Faithful Instance Unlearning | arXiv: 2603.12915
- StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
- Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
- STAR-R1: Multi-View Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
- STAR: Test-Time Adaptation Can Enhance Universal Prompt Learning for Vision-Language Models
- STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows
- Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging | arXiv: 2603.18834
- STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction | arXiv: 2511.19854
- Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning | arXiv: 2603.11439
- STCast: Adaptive Boundary Alignment for Global and Regional Weather Forecasting | arXiv: 2509.25210
- STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution
- Stealing Split Learning Bottom Models by Recovering Embedding Geometry
- Steering Where to Diffuse: Generative Modeling of Phenotypic Response Simulation with Steered Diffusion Bridge
- STEPH: Sparse Task Vector Mixup with Hypernetworks for Efficient Knowledge Transfer in WSI Prognosis | arXiv: 2603.10526
- Stepwise-Flow-GRPO: Assigning Stepwise Credit to Denoising Steps in Flow-Matching Models
- Stereo World Model: Camera-Guided Stereo Video Generation
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- Stitch-a-Demo: Creating Video Demonstrations from Multistep Descriptions
- STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval
- Stochastic Ray Tracing for the Reconstruction of 3D Gaussian Splatting
- SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection | arXiv: 2605.14110
- StoryTailor: A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives | arXiv: 2602.21273
- StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars | arXiv: 2512.22065
- StreamDiT: Real-Time Streaming Text-to-Video Generation | arXiv: 2507.03745
- Streaming Diffusion Model for Fast Infrared and Visible Video Fusion
- Streaming Video Crime Anticipation with Spatio-Temporal Causal Reasoning
- Streaming Video Instruction Tuning (Streamo)
- StreamingTOM: Streaming Token Compression for Efficient Video Understanding | arXiv: 2510.18269
- Streamlined Knowledge Distillation
- StreamRAG: Enhancing Real-Time Video Understanding with Retrieval Augmentation
- StreamReady: Learning What to Answer and When in Long Streaming Videos | arXiv: 2603.08620
- StreamVLO: Streaming Visual-LiDAR Odometry with Cumulative Drift Compensation
- STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation | arXiv: 2604.02829
- Stronger Normalization-Free Transformers | arXiv: 2512.10938
- Structural Action Transformer for 3D Dexterous Manipulation
- Structural Graph Probing of Vision-Language Models
- Structure-Aware Representation Distillation for Tiny-Dense Object Segmentation
- Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation
- StructXLIP: Enhancing Vision-Language Models with Multimodal Structural Cues | arXiv: 2602.20089
- STUR3D: Spatio-Temporal Unified Representation Learning for 3D Object Detection
- Style-GRPO: Semantic-Aware Preference Optimization for Image Style Transfer Guided by Reward Modeling
- StyleDoctor: Towards Specialist Reward Model for Style-centric Generation Tasks
- StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References
- StyleTextGen: Style-Conditioned Multilingual Scene Text Generation | arXiv: 2605.14708
- SubFLOT: Efficient Personalized Federated Learning via Optimal Transport-based Submodel Extraction
- Subspace Alignment for CLIP-based Continual Learning via Canonical Correlation Analysis
- SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling | arXiv: 2602.23013
- SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting
- SuP: Sub-cloud Driven Point Cloud Registration
- Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation
- Suppressing Non-Semantic Noise in Masked Image Modeling Representations | arXiv: 2604.00172
- SURF: Signature-Retained Fast Video Generation
- SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark
- SV-GS: Sparse View 4D Reconstruction with Skeleton-Driven Gaussian Splatting
- SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration | arXiv: 2604.05079
- SVBench: Evaluation of Video Generation Models on Social Reasoning
- SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models | arXiv: 2606.02642
- SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution | arXiv: 2603.08536
- SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation | arXiv: 2603.19053
- SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead
- SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls | arXiv: 2602.23956
- SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation | arXiv: 2604.03723
- Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
- SyncDreamer: Controllable and Expressive Avatar Generation Beyond the Talking Head
- SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception
- SyncMos: Scalable Motion Synchronisation for Multi-Agent Scene Interaction
- Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos | arXiv: 2503.22174
- SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation
- Synthesizing Visual Concepts as Vision-Language Programs
- Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
- Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
- SynthRGB-T: Language-Vision Guided Image Translation for Diversity Synthesis
- T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
- TableMix: Enhancing Multimodal Table Reasoning in MLLMs from a Data-Centric Perspective
- Tackling Alignment Ambiguity in Person Retrieval through Conversational Attribute Mining
- Tackling Model Bias via Game-theoretic Multi-agent Collaboration Framework for Hateful Meme Classification
- TACO: Task-Aware Contrastive Learning for Joint LiDAR Localization and 3D Object Detection
- TacSIm: A Dataset and Benchmark for Football Tactical Style Imitation | arXiv: 2603.25199
- TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts | arXiv: 2601.08881
- TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking | arXiv: 2512.01329
- TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning
- Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes
- Talking Together: Synthesizing Co-Located 3D Conversations from Audio | arXiv: 2603.08674
- TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction | arXiv: 2512.02341
- TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery | arXiv: 2603.08075
- TAMER: A Tri-Modal Contrastive Alignment and Multi-Scale Embedding Refinement Framework for Zero-Shot ECG Diagnosis
- Taming Generative Diffusion Model for Task-Oriented Infrared Imaging
- Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning | arXiv: 2604.27833
- Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning | arXiv: 2512.24146
- Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models | arXiv: 2603.21085
- Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation | arXiv: 2605.13395
- Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control | arXiv: 2509.15130
- TANGO: Learning Distribution-wise Foundation Prior Consistency and Instance-wise Style Calibration for Medical Image Generalization
- TANGO: Text-Anchored Guided Optimization for Robust Fine-tuning Vision-Language Models under Label Noise
- TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration | arXiv: 2603.03792
- TAPE: Task-Adaptive Prototype Evolution in Audio-Language Models for Fully Few-shot Class-incremental Audio Classification
- TAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events
- TAR: Token-Aware Refinement for Fine-grained Generalized Category Discovery
- Target-Aware Invertible Encoder with Reconstruction Guidance for Infrared Small Target Detection
- TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts | arXiv: 2605.07256
- Task-Aware Image Signal Processor for Advanced Visual Perception
- Task-Driven Implicit Representations for Automated Design of LiDAR Systems
- Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation | arXiv: 2512.16740
- TaskForce: Cooperative Multi-agent Reinforcement Learning for Multi-task Optimization
- TaskIT: Memory-Efficient Fine-Tuning of Multi-LoRA LLMs via Cross-Task Importance Transfer
- Tavatar: Topology-Aware Gaussian Attribute Derivation for Animatable Human Avatars
- Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models | arXiv: 2603.00431
- TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration | arXiv: 2603.02943
- TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment | arXiv: 2603.22819
- Tea-Adapter: Teacher Adapter for Efficient Conditional Generation
- Teacher-Guided Routing for Sparse Vision Mixture-of-Experts
- Teaching DINOv3 About Partial 3D Geometry: A Self-Supervised Geometry-Aware Approach
- TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size | arXiv: 2603.07988
- TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models | arXiv: 2511.21145
- TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation | arXiv: 2602.19053
- TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures | arXiv: 2602.19679
- Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention | arXiv: 2511.20032
- Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model | arXiv: 2603.05012
- TempoControl: Temporal Attention Guidance for Text-to-Video Models
- TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
- Temporal Equilibrium MeanFlow: Bridging the Scale Gap for One-Step Generation
- Temporal Imbalance of Positive and Negative Supervision in Class-Incremental Learning | arXiv: 2603.02280
- Temporal Interaction in Spiking Transformers with Multi-Delay Mixer
- Temporal Inversion for Learning Interval Change in Chest X-Rays
- Temporal Representation Enhancement (TRE): Learning to Forget Dominant Patterns for Enhanced Temporal Spiking Features
- TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning
- TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
- TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR | arXiv: 2603.27344
- TESO: Online Tracking of Essential Matrix by Stochastic Optimization | arXiv: 2604.19420
- TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Test-Time Attention Purification for Backdoored Large Vision Language Models | arXiv: 2603.12989
- Test-time Ego-Exo-centric Adaptation for Action Anticipation via Multi-Label Prototype Growing and Dual-Clue Consistency | arXiv: 2603.09798
- Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling | arXiv: 2603.27665
- Test-Time Multi-Prompt Adaptation for Open-Vocabulary Remote Sensing Image Segmentation
- Test-Time Perturbation Tuning with Delayed Feedback for Vision-Language-Action Models
- Test-time Sparsity for Extreme Fast Action Diffusion
- Test-Time Training for LiDAR Semantic Segmentation under Corruption via Geometric Inlier Discrimination
- Text-Driven 3D Hand Motion Generation from Sign Language Data
- Text-guided Feature Disentanglement for Cross-modal Gait Recognition
- Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval | arXiv: 2603.12711
- Text-Printed Image: Bridging the Image-Text Modality Gap by "Printing" Text into Images
- TextFM: Robust Semi-dense Feature Matching with Language Guidance
- TextOVSR: Text-Guided Real-World Opera Video Super-Resolution
- TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering | arXiv: 2602.20903
- TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
- Text–Image Conditioned 3D Generation | arXiv: 2603.21295
- Texvent: Asynchronous Event Data Simulation via Text Prompt
- TF-CADE: Foreground-Concentrated Text-Video Alignment for Zero-Shot Temporal Action Detection
- TF-SSD: A Strong Pipeline via Synergic Mask Filter for Training-free Co-salient Object Detection
- TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion
- TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- TGTrack: Temporal Generative Learning for Unified Single Object Tracking
- The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models | arXiv: 2604.04857
- The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts | arXiv: 2505.17476
- The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery
- The Devil is in the Details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection | arXiv: 2512.20340
- The Drift Kernel: Why Diffusion Models Change Even When Told Not To
- The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
- The Golden Subspace: Where Efficiency Meets Generalization in Continual Test-Time Adaptation | arXiv: 2603.21928
- The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
- The Invisible Gorilla Effect in Out-of-distribution Detection | arXiv: 2602.20068
- The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition | arXiv: 2505.24840
- The Midas Touch for Metric Depth
- The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments
- The Missing Point in Vision Transformers for Universal Image Segmentation
- The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment | arXiv: 2511.21331
- The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers | arXiv: 2602.19096
- The Power of Prior: Training-Free Open-Vocabulary Semantic Segmentation with LLaVA
- The Road Less Seen: Segment Exploration for Weakly Supervised Video Anomaly Detection
- The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification
- The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations | arXiv: 2603.29034
- The Universal Normal Embedding | arXiv: 2603.21786
- TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation
- Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-Resolution through Heat Conduction Priors
- Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis
- Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection
- Thermally Activated Dual-Modal Adversarial Clothing against AI Surveillance Systems | arXiv: 2511.09829
- Think Before You Drive: World Model-Inspired Multimodal Grounding
- Think Visually, Reason Textually: Vision-Language Synergy in Abstract Reasoning
- Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
- Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding | arXiv: 2603.04977
- Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
- Think-Then-Generate: Structural Chain-of-Thought Reasoning for Consistent 3D Generation
- Think360: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth | arXiv: 2603.22689
- ThinkGen: Generalized Thinking for Visual Generation
- Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
- Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models | arXiv: 2604.05497
- Thinking in 360°: Humanoid Visual Search in the Wild
- Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World | arXiv: 2603.12746
- Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding
- Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
- Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
- Thinking with Programming Vision: Towards a Unified View for Thinking with Images
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
- Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
- ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference
- Through the Frequency Lens: Cross-Domain Generalisable Gaze Estimation with Adaptive Modulation
- TIACam: Text-Anchored Invariant Feature Learning with Auto-Augmentation for Camera-Robust Zero-Watermarking | arXiv: 2602.18863
- TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval | arXiv: 2603.24749
- TIM: Temporal Decoupling with Iterative Mutual-Refinement Model for Longitudinal Radiology Report Generation
- Time Blindness: Why Video-Language Models Can't See What Humans Can?
- Time Without Time: Pseudo-Temporal Representation for Space-Time Super-Resolution
- Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- Time-Specialized Event-Image Alignment for Blur-to-Video Decomposition
- TimeBridge: Self-Supervised Video Representation Learning via Start-End Joint Embedding and In-Between Frame Prediction
- TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs | arXiv: 2512.14698
- TimeRipples: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space
- TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
- TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models | arXiv: 2603.17828
- TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment | arXiv: 2604.12012
- TiViBench: Benchmarking Think-in-Video Reasoning for Video Generation
- TLMA: Mitigating the Impact of Weakly Labeled Information for Video Anomaly Detection
- TM-BSN: Triangular-Masked Blind-Spot Network for Real-World Self-Supervised Image Denoising | arXiv: 2604.04484
- Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models | arXiv: 2603.01400
- Token Warping Helps MLLMs Look from Nearby Viewpoints | arXiv: 2604.02870
- TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens
- TokenHand: Discrete Token Representation for Efficient Hand Mesh Reconstruction
- TokenLight: Precise Lighting Control in Images using Attribute Tokens | arXiv: 2604.15310
- TokenSplat: Token-aligned 3D Gaussian Splatting for Feed-forward Pose-free Reconstruction
- TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery
- Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity | arXiv: 2603.10990
- TopoCL: Topological Contrastive Learning for Medical Imaging
- TopoHR: Hierarchical Centerline Representation for Cyclic Topology Reasoning in Driving Scenes with Point-to-Instance Relations | arXiv: 2604.24119
- Topology-aware Feature Propagation for Unsupervised Non-rigid Point Cloud Correspondence
- TopoMA: Topology-Guided Multi-Agent Dense RGB 3D Reconstruction via Distributed Inference
- TopoMesh: High-Fidelity Mesh Autoencoding via Topological Unification | arXiv: 2603.24278
- TopoSlide: Topologically-Informed Histopathology Whole Slide Image Representation Learning
- TouchDream: 3D Object Completion through Imagined Touch
- Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
- Toward Early Quality Assessment of Text-to-Image Diffusion Models
- Toward Generalizable Whole Brain Representations with High-Resolution Light-Sheet Data | arXiv: 2603.29842
- Toward Low-Cost yet Effective Temporal Learning for UAV Tracking
- Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset | arXiv: 2603.04745
- Towards an Incremental Unified Multimodal Anomaly Detection: Augmenting Multimodal Denoising From an Information Bottleneck Perspective
- Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation | arXiv: 2501.05264
- Towards Calibrating Prompt Tuning of Vision-Language Models | arXiv: 2602.19024
- Towards Cross-Modal Preservation, Consistency and Alignment for Privacy-Preserving Visible-Infrared Person Re-Identification
- Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
- Towards Dynamic Modality Alignment in Multimodal Continual Learning
- Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data | arXiv: 2508.01450
- Towards Fine-Grained Attribution: Instance-Aware Preference Optimization for Aligning Diffusion Models
- Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
- Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning | arXiv: 2508.01603
- Towards Generalized Multimodal Homography Estimation
- Towards Generalized Representations for Low-Light Understanding: When Signal Constancy Meets Semantic Enrichment
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding | arXiv: 2603.26211
- Towards High-Quality Image Segmentation: Improving Topology Accuracy by Penalizing Neighbor Pixels | arXiv: 2603.18671
- Towards High-resolution and Disentangled Reference-based Sketch Colorization
- Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction | arXiv: 2603.04839
- Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization
- Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers
- Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models
- Towards Human-Like Robot Handwriting via Contour-Aware Generation
- Towards Intrinsic-Aware Monocular 3D Object Detection | arXiv: 2603.27059
- Towards Knowledge-augmented Bayesian Deep Learning For Computer Vision
- Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots
- Towards Multimodal Domain Generalization with Few Labels | arXiv: 2602.22917
- Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning | arXiv: 2601.09111
- Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset
- Towards Persistence: Learning Topological Constraints for Event-based Small Object Detection
- Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework | arXiv: 2605.07429
- Towards Policy-Adaptive Image Guardrail: Benchmark and Method
- Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training | arXiv: 2603.23885
- Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors | arXiv: 2604.12309
- Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models
- Towards Reliable Evaluation of Adversarial Robustness for Spiking Neural Networks
- Towards Robust Multi-Modal Semantic Segmentation with Teacher-Student Framework and Hybrid Prototype Distillation
- Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
- Towards Robust Sequential Decomposition for Complex Image Editing | arXiv: 2605.09233
- Towards Robust Vision Transformers: Path Dependency Analysis and a Simple Two-Stage Adversarial Training
- Towards Sparse Video Understanding and Reasoning | arXiv: 2602.13602
- Towards Stable Federated Continual Test-Time Adaptation in Wild World
- Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video
- Towards Stealthy and Effective Backdoor Attacks on Lane Detection: A Naturalistic Data Poisoning Approach
- Towards Storytelling Animations: Joint Synthesis of Human and Camera Motions
- Towards Streaming Referring Video Segmentation via Large Language Model
- Towards Training-Free Scene Text Editing | arXiv: 2603.24571
- Towards Uncertainty-aware Unsupervised Domain Adaptation for Videos and Time-Series with Causal Optimal Transport
- Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework
- Towards Universal Computational Aberration Correction in Photographic Cameras: A Comprehensive Benchmark Analysis | arXiv: 2603.12083
- Towards Visual Query Localization in the 3D World | arXiv: 2605.01498
- TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast | arXiv: 2506.13387
- TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
- Tracking by Predicting 3-D Gaussians Over Time
- Tracking through Severe Occlusion via Event-Derived Transient Cues
- Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation
- TrackMAE: Video Representation Learning via Track, Mask, and Predict | arXiv: 2603.27268
- TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation
- Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation | arXiv: 2511.22235
- Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning | arXiv: 2512.09706
- Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods | arXiv: 2603.15026
- Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers
- Training-free Motion Factorization for Compositional Video Generation | arXiv: 2603.09104
- Training-Free Open-Vocabulary Camouflaged Object Segmentation via Fine-Grained Object Binding and Adaptive Hybrid Prompt
- Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models
- Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters
- TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation | arXiv: 2605.01700
- TrajTok: Learning Trajectory Tokens Enhances Video Understanding | arXiv: 2602.22779
- Transform to Transfer: Boosting Adversarial Attack Transferability on Vision-Language Pre-training Models
- Transition Matching Distillation for Fast Video Generation
- Transition Models: Rethinking the Generative Learning Objective
- Translating Signals to Languages for sEMG-Based Activity Recognition
- TRANSPORTER: Transferring Visual Semantics from VLM Manifolds
- TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
- TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition
- TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration | arXiv: 2603.22882
- Tri-Modal Fusion Transformers for UAV-based Object Detection
- Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis | arXiv: 2602.19585
- TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection | arXiv: 2512.10652
- TriLite: Efficient WSOL with Universal Visual Features and Tri-Region Disentanglement | arXiv: 2602.23120
- TriSim: Tri-Dimensional Similarity Modeling with Extreme Value Theory for False-Negative Mitigation in Remote Sensing Image-Text Retrieval
- TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition | arXiv: 2512.01248
- TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models
- TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos
- TruckDrive: Long-Range Autonomous Highway Driving Dataset
- Trust-calibrated Collaborative Learning for Long-Tailed Visual Recognition
- TSTM: Temporal Segmentation for Task-relevant Mask in Visual Reinforcement Learning Generalization
- TT-Occ: Test-Time 3D Occupancy Prediction | arXiv: 2503.08485
- TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models | arXiv: 2604.15756
- TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models
- TTRV: Test-Time Reinforcement Learning for Vision Language Models
- tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction | arXiv: 2602.20160
- TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Tunable Soft Equivariance with Guarantees
- Turbo-GS: Accelerating 3D Gaussian Fitting for High-Resolution Radiance Fields | arXiv: 2412.13547
- Turning Pre-Trained Vision Transformers into End-to-End Histopathology Whole Slide Image Models for Survival Prediction
- Tutor-Student Reinforcement Learning: A Dynamic Curriculum for Robust Deepfake Detection | arXiv: 2603.24139
- TV2TV: A Unified Framework for Interleaved Language and Video Generation
- TVHighlights: LLM-Guided Human-Free Collaborative Training for Video Highlight Detection in Movies and TV Dramas
- TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
- Twin-T & TwintVQA: A Reliable Structure-Detail Separating VLM and a Comprehensive Benchmark for Chart and Table Tasks
- TWINGS: Thin Plate Splines Warp-aligned Initialization for Sparse-View Gaussian Splatting | arXiv: 2605.22069
- U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation | arXiv: 2602.23739
- U2Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation | arXiv: 2604.10056
- U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences | arXiv: 2512.02982
- UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- UAST: Unified Active Search and Tracking for Arbitrary Targets with UAVs
- UAV-CB: A Complex-Background RGB-T Dataset and Local Frequency Bridge Network for UAV Detection
- UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes
- UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution | arXiv: 2603.11680
- UCMNet: Uncertainty-Aware Context Memory Network for Under-Display Camera Image Restoration
- UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation | arXiv: 2604.10485
- UETrack: A Unified and Efficient Framework for Single Object Tracking | arXiv: 2603.01412
- UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling
- UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models | arXiv: 2512.11336
- UI-Lens: Assessing General MLLMs' Potential to Automate UI Display Quality Assurance
- UIKA: Fast Universal Head Avatar from Pose-Free Images | arXiv: 2601.07603
- ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting
- Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking From Sparse Inertial Sensors and Ranging-Based Between-Sensor Distances | arXiv: 2606.02153
- Ultra-Fast Neural Video Compression | arXiv: 2606.04410
- Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder
- UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding | arXiv: 2604.01749
- Unblur-SLAM: Dense Neural SLAM for Blurry Inputs | arXiv: 2603.26810
- Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
- Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models | arXiv: 2603.21426
- Uncertainty-Aware Modality Fusion for Unaligned RGB-T Salient Object Detection
- Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field | arXiv: 2605.30342
- Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models | arXiv: 2603.22042
- Underground Plant Exploration: Non-Destructive 3D Root Assessment with GPR Based on Point Graph Neural Network
- Understanding and Enforcing Weight Disentanglement in Task Arithmetic | arXiv: 2604.17078
- Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models | arXiv: 2603.27201
- Understanding Counting Mechanisms in Large Language and Vision-Language Models | arXiv: 2511.17699
- Understanding Task Transfer in Vision-Language Models | arXiv: 2511.18787
- Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability | arXiv: 2510.08138
- Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models | arXiv: 2604.03179
- Understanding, Accelerating, and Improving MeanFlow Training
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation | arXiv: 2511.18281
- Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities | arXiv: 2604.22177
- Uni-Hema: Unified Model for Digital Hematopathology
- UNI-OOD: Unified Object- and Image-level Out-of-Distribution Detection via Cross-Context Attentive Vision-Language Modeling
- Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images
- UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions | arXiv: 2511.03334
- UNICBench: UNIfied Counting Benchmark for MLLM | arXiv: 2603.00595
- UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits
- UniChange: Unifying Change Detection with Multimodal Large Language Model
- UniComp: Rethinking Video Compression Through Informational Uniqueness | arXiv: 2512.03575
- UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
- UniCorrn: Unified Correspondence Transformer Across 2D and 3D | arXiv: 2605.04044
- UniDAC: Universal Metric Depth Estimation for Any Camera
- UniDef: Universal Defense Against Unauthorized Image Manipulation
- UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos | arXiv: 2603.22264
- UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
- Unified Camera Positional Encoding for Controlled Video Generation | arXiv: 2512.07237
- Unified Customized Generation by Disentangled Reward Modeling
- Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization
- Unified Latent Space for Understanding and Generation via Semantic Auto-encoder
- Unified Multimodal Models as Auto-Encoders
- Unified Number-Free Text-to-Motion Generation Via Flow Matching
- Unified Personalized Understanding, Generating and Editing
- Unified Primitive Proxies for Structured Shape Completion | arXiv: 2601.00759
- Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention | arXiv: 2603.21957
- Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera | arXiv: 2511.18174
- Unified Vector Floorplan Generation via Markup Representation | arXiv: 2604.04859
- UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation | arXiv: 2603.14214
- Unifying Language-Action Understanding and Generation for Autonomous Driving
- Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation (VITA)
- Unifying Precise Keyframes and Semantic Control via Multi-level Diffusion
- UniGame: Turning a Unified Multimodal Model Into Its Own Adversary | arXiv: 2511.19413
- UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in RL
- UniGenDet: A Unified Generative-Discriminative Framework for Co-evolutionary Generation and Detection | arXiv: 2604.21904
- UniGeoRS: A Unified Benchmark for Tri-view Geo-Localization
- UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes | arXiv: 2511.23332
- UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
- UniLight: A Unified Representation for Lighting
- UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking | arXiv: 2512.09327
- UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark | arXiv: 2603.05075
- UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition
- UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression | arXiv: 2509.25934
- UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents
- UniPercept: A Unified Diffusion Model for Generalizable Visual Perception
- UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching | arXiv: 2606.05399
- UniPR: Unified Object-level Real-to-Sim Perception and Reconstruction from a Single Stereo Pair
- Unique Lives, Shared World: Learning from Single-Life Videos
- UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization | arXiv: 2603.03967
- UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register | arXiv: 2605.19622
- UniSER: A Foundation Model for Unified Soft Effects Removal
- UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass
- UniSpector: Towards Universal Open-set Defect Recognition via Spectral-Contrastive Visual Prompting | arXiv: 2604.02905
- UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
- UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes
- UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
- UniVBench: Towards Unified Evaluation for Video Foundation Models
- Universal 3D Shape Matching via Coarse-to-Fine Language Guidance | arXiv: 2602.19112
- Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent
- Universal-to-Specific: Dynamic Knowledge-Guided Multiple Instance Learning for Few-Shot Whole Slide Image Classification
- UniVerse: A Unified Modulation Framework for Segmentation-Free, Disentangled Multi-Concept Personalization
- UniVerse: Empower Unified Generation with Reasoning and Knowledge
- Unlearning without Forgetting: Securely Removing Targeted Concepts from Large-Scale Vision-Language Open-Vocabulary Detectors
- Unleashing Stealthy Backdoor Pandemic by Infecting a Single Diffusion Model
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection
- Unleashing Vision-Language Semantics for Deepfake Video Detection | arXiv: 2603.24454
- Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures
- Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge
- Unlocking Motion from Large Vision Models with a Semantic and Kinematic Duality for Gait Recognition
- Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework | arXiv: 2604.02877
- Unlocking Pre-trained Weights: Parameter Inheritance for Zero-Shot Initialization
- Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods | arXiv: 2603.25767
- Unlocking the Power of Critical Factors for 3D Visual Geometry Estimation | arXiv: 2604.21713
- Unlocking Token Rewards via Training-Free Reward Attribution
- Unpaired Image Deraining Using Reward-Guided Self-Reinforcement Strategy
- Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images | arXiv: 2604.19257
- UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision
- Unsafe2Safe: Controllable Image Anonymization for Downstream Utility | arXiv: 2603.28605
- Unstitching the Chimera: Frame-Level Risk and Train-Free Mitigation for Video Hallucination
- Unsupervised 3D Motion Estimation Using Event Camera
- Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors | arXiv: 2507.12336
- Unsupervised Multi-agent and Single-agent Perception from Cooperative Views
- Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model
- UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders
- Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling
- Urban-GS: A Unified 3D Gaussian Splatting Framework for Compact and High-Fidelity Aerial-to-Street Reconstruction
- URICA: A Uniformity Region Affine Identifier Capture Algorithm for Arbitrary Region Retrieval in Pathology Images
- URScenes: A Multi-scenario Dataset for Unstructured Road Environments
- UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation | arXiv: 2605.17742
- UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking | arXiv: 2602.23734
- UVU: Improving Multimodal Understanding via Vision-Language Unified Autoregressive Paradigm
- UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions
- V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs | arXiv: 2511.20223
- V-DPM: 4D Video Reconstruction with Dynamic Point Maps
- V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
- V2U4Real: A Real-world Large-scale Dataset for Vehicle-to-UAV Cooperative Perception
- VA-π: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
- VABench: A Comprehensive Benchmark for Audio-Video Generation
- VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
- Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision | arXiv: 2604.04934
- VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
- Variation-Aware Vision Token Dropping for Faster Large Vision-Language Models | arXiv: 2509.01552
- Variational Graph-based Normal Integration
- VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM | arXiv: 2603.09673
- VAST: Video Ability-Stratified Taxonomy for Data-Efficient Video Reasoning
- VCP-Attack: Visual-Contrastive Projection for Transferable Black-Box Targeted Attacks on Large Vision-Language Models
- VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging
- VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation | arXiv: 2305.23381
- VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency
- VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
- VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference | arXiv: 2603.29494
- VecGlypher: Unified Vector Glyph Generation with Language Models | arXiv: 2602.21461
- Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure
- VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation | arXiv: 2605.24398
- Velox: Learning Representations of 4D Geometry and Appearance | arXiv: 2605.04527
- VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba
- VENI: Variational Encoder for Natural Illumination
- Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping | arXiv: 2602.23980
- Verifying Neural Network Robustness with Dual Perturbations
- VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control | arXiv: 2601.05138
- VES-RFT: Rewarding Visual Evidence Sensitivity to Mitigate Hallucinations in Large Vision-Language Models
- VesMamba: 3D Pulmonary Vessel Segmentation from CT images via Mamba with Structural Perception and Scale-aware Filtering
- VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models | arXiv: 2510.18457
- VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation
- VGA: Empowering Aerial-Ground Localization by Visual Geometry Alignment
- VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
- VGG-T3: Offline Feed-Forward 3D Reconstruction at Scale | arXiv: 2602.23361
- VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving | arXiv: 2602.20794
- VGGT-\(\Omega\) | arXiv: 2605.15195
- VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation
- VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection | arXiv: 2603.00912
- VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
- VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement
- Vibe Spaces for Creatively Connecting and Expressing Visual Concepts
- ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body | arXiv: 2512.14234
- VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations
- Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
- Video Panels for Long Video Understanding | arXiv: 2509.23724
- Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
- Video-CoE: Reinforcing Video Event Prediction via Chain of Events
- Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models | arXiv: 2603.24484
- Video2Robo: 3DGS-based Synthetic Data from One Video Enables Scalable Robot Learning
- VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding | arXiv: 2512.12360
- VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice | arXiv: 2601.05175
- VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning | arXiv: 2511.19524
- VideoCoF: Unified Video Editing with Temporal Reasoner | arXiv: 2512.07469
- VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion | arXiv: 2503.23359
- VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
- VideoMaMa: Mask-Guided Video Matting via Generative Prior
- VidEoMT: Your ViT is Secretly Also a Video Segmentation Model | arXiv: 2602.17807
- VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition | arXiv: 2605.02834
- VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos
- VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking | arXiv: 2603.20185
- VideoSSR: Video Self-Supervised Reinforcement Learning
- VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
- VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
- VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer
- VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
- View-Aware Semantic Alignment for Aerial-Ground Person Re-Identification | arXiv: 2605.18192
- ViHOI: Human-Object Interaction Synthesis with Visual Priors | arXiv: 2603.24383
- ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting | arXiv: 2603.23186
- ViLearn: Accelerating Training Convergence of Image-to-3D Generation via Visibility Learning
- ViLoMem: Agentic Learner with Grow-and-Refine Multimodal Semantic Memory
- VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network | arXiv: 2605.07552
- Vinedresser3D: Agentic Text-guided 3D Editing | arXiv: 2602.19542
- VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA
- VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset
- VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation
- ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking | arXiv: 2512.14654
- VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation | arXiv: 2603.12918
- VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension | arXiv: 2601.12781
- VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation | arXiv: 2603.27060
- Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantized Code | arXiv: 2501.18328
- Virtual Immunohistochemistry Staining with Dual-Aligned Multi-Task Feature Guidance
- Virtual Nodes Guided Dynamic Graph Neural Network for Brain Tumor Segmentation with Missing Modalities
- VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding | arXiv: 2603.07071
- VisiLock: Authorizing Instruction-based Image editing with Dual Score Distillation
- VISion On Request: Enhanced VLLM Efficiency with Sparse, Dynamically Selected, Vision-Language Interactions | arXiv: 2603.23495
- Vision Transformers Need More Than Registers | arXiv: 2602.22394
- Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification | arXiv: 2603.19678
- Vision-Language Model Guided Source-Free Domain Adaptation via Optimal Transport
- Vision-Oriented Lightweight Neural Architecture Search with Budget-Adaptive Evaluation
- Vision-Speech Models: Teaching Speech Models to Converse about Images
- VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
- VisionLeaf: Entropy-Guided Leaf-First Reasoning for Efficient and Accurate Think-with-Image
- VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
- VisPlay: Self-Evolving Vision-Language Models
- VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models | arXiv: 2603.00207
- VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
- Vista4D: Video Reshooting with 4D Point Clouds | arXiv: 2604.21915
- VISTA: A Test-Time Self-Improving Video Generation Agent
- ViStoryBench: Comprehensive Benchmark Suite for Story Visualization | arXiv: 2505.24862
- Visual Diffusion Models are Geometric Solvers
- Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
- Visual Grounding for Object Questions
- Visual Personalization Turing Test
- Visual Prototype Conditioned Focal Region Generation for UAV-Based Object Detection
- Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
- Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering
- VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer | arXiv: 2603.07952
- VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes | arXiv: 2509.25339
- ViT3: Unlocking Test-Time Training in Vision | arXiv: 2512.01643
- VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
- ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning | arXiv: 2603.04265
- ViTPrompt: Training-Free Prompt Refinement with Visual Tokens for Open-Vocabulary Detection
- VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
- VKG-QA: Visual Knowledge Graph-based Question Answer for Large Multimodal Models
- VL-Eraser: Vacuum Distillation for Machine Unlearning in Vision-Language Models
- VL-RouterBench: A Benchmark for Vision-Language Model Routing | arXiv: 2512.23562
- VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling
- VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
- VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
- VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery | arXiv: 2602.19180
- VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models | arXiv: 2603.09826
- VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm | arXiv: 2512.02700
- VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models
- VLM4RSDet: Collaborative Optimization with Vision-Language Model for Enhancing Remote Sensing Object Detection
- VMD-FACT: A New Video Dataset and MLLM-based method for Detecting Realistic AI-Generated Video Misinformation
- VMonarch: Efficient Video Diffusion Transformers with Structured Attention
- Vocabulary Scaling Law: Tuning Open-vocabulary Predictors for Their Openness
- VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution
- VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
- Volumetric Functional Maps
- VOSR: A Vision-Only Generative Model for Image Super-Resolution | arXiv: 2604.03225
- Voxify3D: Pixel Art Meets Volumetric Rendering | arXiv: 2512.07834
- VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation
- VQ-VA World: Towards High-Quality Visual Question-Visual Answering
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- VRCLIP: Multimodal Canonical Correlation Alignment for CLIP-Driven Vision-Radio Person Re-Identification
- VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues | arXiv: 2506.21742
- VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments | arXiv: 2506.02387
- VSRELL: A Simple Baseline for Video Super-Resolution and Enhancement in Low-Light Environment
- VT-Intrinsic: Physics-Based Decomposition of Reflectance and Shading using a Single Visible-Thermal Image Pair | arXiv: 2509.10388
- VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
- VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping | arXiv: 2511.13587
- V²-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence
- W2W: Language-Model-Based Trajectory Prediction with Reinforcement Learning
- WaDi: Weight Direction-aware Distillation for One-step Image Synthesis | arXiv: 2603.08258
- WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation | arXiv: 2603.10703
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training | arXiv: 2603.25706
- Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI | arXiv: 2511.20620
- Watch and Learn: Learning to Use Computers from Online Videos | arXiv: 2510.04673
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding | arXiv: 2603.00512
- Wavelet-Driven 3D Anomaly Detection under Pose-Agnostic and Sparse-View
- Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning | arXiv: 2603.00550
- WeatherCity: Urban Scene Reconstruction with Controllable Multi-Weather Transformation
- WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
- WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs | arXiv: 2602.22142
- WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces
- WebGym: Scaling Training Environments for Long-Horizon Visual Web Agents with Realistic Tasks
- WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
- Weight Space Representation Learning via Neural Field Adaptation
- WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
- What Are You Doing? A Closer Look at Controllable Human Video Generation
- What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models | arXiv: 2603.00510
- What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models
- What Is the Optimal Ranking Score Between Precision and Recall? We Can Always Find It and It Is Rarely \(F_1\) | arXiv: 2511.22442
- What Is Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self-Evolution | arXiv: 2602.06450
- What Makes Good Synthetic Training Data for Zero-Shot Stereo Matching? | arXiv: 2504.16930
- What Matters in Practical Learned Image Compression
- What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs
- When Anonymity Breaks: Identifying Models Behind Text-to-Image Leaderboards
- When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse
- When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness
- When Do Models Actually Decide? Mapping the Layer-Wise Decision Timeline in Pretrained Neural Networks
- When Lines Meet Textures: Spatial-Frequency Aligned Diffusion Features for Cross-Sparsity Correspondence
- When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models
- When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters | arXiv: 2602.21977
- When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models | arXiv: 2604.08546
- When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators
- When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models | arXiv: 2511.21192
- When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering
- When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance | arXiv: 2602.20880
- When to Think and When to Look: Uncertainty-Guided Lookback | arXiv: 2511.15613
- When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs | arXiv: 2512.07580
- When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection
- When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm | arXiv: 2603.24079
- When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
- Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
- Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
- Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation | arXiv: 2509.22496
- Where, What, Why: Toward Explainable 3D-GS Watermarking | arXiv: 2603.08809
- Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models | arXiv: 2603.21484
- WhisperNet: A Scalable Solution for Bandwidth-Efficient Collaboration
- White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation | arXiv: 2605.19613
- WHU-MARS: A Multispectral Aerial-Ground Benchmark Towards Any-Scenario Person Re-Identification
- Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training
- Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approach For Long-Tailed Recognition
- Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs | arXiv: 2512.19918
- WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition
- WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering | arXiv: 2512.11237
- WildPose: A Unified Framework for Robust Pose Estimation in the Wild
- WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments
- Will Multimodal Models Be Dazzled by Multi-Image Visual Puzzles?
- WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
- WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval | arXiv: 2602.23029
- WiTTA-Bench: Benchmarking Test-Time Adaptation for WiFi Sensing
- WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios
- WonderZoom: Multi-Scale 3D World Generation
- World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
- WorldGen: From Text to Traversable and Interactive 3D Worlds
- WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World | arXiv: 2512.10958
- WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning | arXiv: 2512.02425
- WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
- WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories
- WPT: World-to-Policy Transfer via Online World Model Distillation | arXiv: 2511.20095
- Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting
- WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery
- X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection
- X-band Radar Non-Line-of-Sight Imaging
- X-Part: High Fidelity And Structure Coherent Shape Decomposition And Completion
- X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis
- X-WIN: Building Chest Radiograph World Model via Predictive Sensing | arXiv: 2511.14918
- x2-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space | arXiv: 2603.16671
- XPaintNet: An eXtreme Lightweight Framework for Stereoscopic Conversion without Inpainting Network
- XSeg: A Large-scale X-ray Contraband Segmentation Benchmark for Real-World Security Screening | arXiv: 2604.03706
- YieldSAT: A Multimodal Benchmark Dataset for High-Resolution Crop Yield Prediction
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion | arXiv: 2511.18734
- YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection
- YOLO-ULM: Ultra-Lightweight Models for Real-Time Object Detection
- YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
- You Only Erase Once: Erasing Anything without Bringing Unexpected Content
- Your Classifier Can Do More: Towards Balancing the Gaps in Classification, Robustness, and Generation | arXiv: 2505.19459
- Your Dissimilarities Define You: Complementary Learning Exploiting Class Diversities
- Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models
- Your One-Stop Solution for AI-Generated Video Detection
- Yume1.5: A Text-Controlled Interactive World Generation Model
- Z-Order Transformer for Feed-Forward Gaussian Splatting | arXiv: 2605.13465
- Zero-Shot Depth Completion with Vision-Language Model
- Zero-shot Detection of AI-Generated Image via RAW-RGB Alignment
- Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation
- Zero-Shot Reconstruction of Animatable 3D Avatars with Cloth Dynamics from a Single Image | arXiv: 2603.14772
- ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models | arXiv: 2605.11435
- Zina: Multimodal Fine-grained Hallucination Detection and Editing | arXiv: 2506.13130
- ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training
- ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
- Zoo3D: Zero-Shot 3D Object Detection at Scene Level
- ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
- β-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
- µVLM: A Vision Language Model for µNPUs
- ⊘ Source Models Leak What They Shouldn't ↛: Unlearning Zero-Shot Transfer in Domain Adaptation Through Adversarial Optimization | arXiv: 2604.08238