AAAI2026 Notes TODO¶
Total: 1382 | Completed: 1381 | Pending: 1
- "Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents | arXiv: 2511.20067
- "As Eastern Powers, I Will Veto." : An Investigation of Nation-Level Bias of Large Language Models in International Relations | arXiv: 2511.10695
- 10 Open Challenges Steering the Future of Vision-Language-Action Models | arXiv: 2511.05936
- 3D-ANC: Adaptive Neural Collapse for Robust 3D Point Cloud Recognition | arXiv: 2511.07040
- 3D-Free Meets 3D Priors: Novel View Synthesis from a Single Image with Pretrained Diffusion Guidance | arXiv: 2408.06157
- 3D4D: An Interactive Editable 4D World Model via 3D Video Generation | arXiv: 2511.08536
- 3DTeethSAM: Taming SAM2 for 3D Teeth Segmentation | arXiv: 2512.11557
- 4DSTR: Advancing Generative 4D Gaussians with Spatial-Temporal Rectification for High-Quality and Consistent 4D Generation | arXiv: 2511.07241
- A Closer Look at Knowledge Distillation in Spiking Neural Network Training | arXiv: 2511.06902
- A Coherence-Based Measure of AGI | arXiv: 2510.20784
- A Computable Game-Theoretic Framework for Multi-Agent Theory of Mind | arXiv: 2511.22536
- A Content-Preserving Secure Linguistic Steganography | arXiv: 2511.12565
- A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs | arXiv: 2505.23816
- A Data-Driven Model Predictive Control Framework for Multi-Aircraft TMA Routing Under Travel Time Uncertainty | arXiv: 2511.19452
- A Disease-Aware Dual-Stage Framework for Chest X-ray Report Generation | arXiv: 2511.12259
- A Distributed Asynchronous Generalized Momentum Algorithm Without Delay Bounds | arXiv: 2508.08218
- A Fast Heuristic Search Approach for Energy-Optimal Profile Routing for Electric Vehicles | arXiv: 2512.01331
- A Graph-Theoretical Perspective on Law Design for Multiagent Systems | arXiv: 2511.06361
- A Learning Framework For Cooperative Collision Avoidance of UAV Swarms Leveraging Domain Knowledge | arXiv: 2507.10913
- A Mind Cannot Be Smeared Across Time | arXiv: 2601.11620
- A Multi-Agent Conversational Bandit Approach to Online Evaluation and Selection of User-Aligned LLM Responses | arXiv: 2501.01849
- A New Strategy for Verifying Reach-Avoid Specifications in Neural Feedback Systems | arXiv: 2601.08065
- A Phase Transition for Opinion Dynamics with Competing Biases | arXiv: 2511.09434
- A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment | arXiv: 2603.10034
- A Reasoning Paradigm for Named Entity Recognition | arXiv: 2511.11978
- A Switching Framework for Online Interval Scheduling with Predictions | arXiv: 2511.16194
- A Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis | arXiv: 2512.22741
- A Theoretical Analysis of Detecting Large Model-Generated Time Series | arXiv: 2511.07104
- A Topological Rewriting of Tarski's Mereogeometry | arXiv: 2511.12727
- A Unified Convergence Analysis for Semi-Decentralized Learning: Sampled-to-Sampled vs. Sampled-to-All Communication | arXiv: 2511.11560
- A Unified Shape-Aware Foundation Model for Time Series Classification | arXiv: 2601.06429
- A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators | arXiv: 2511.20693
- AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs | arXiv: 2601.02771
- ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models | arXiv: 2601.07260
- Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward | arXiv: 2508.11143
- AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization | arXiv: 2603.11873
- Adapt-As-You-Walk Through the Clouds: Training-Free Online Test-Time Adaptation of 3D Vision-Language Foundation Models | arXiv: 2511.15311
- Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval | arXiv: 2512.00953
- Adaptive Fidelity Estimation for Quantum Programs with Graph-Guided Noise Awareness | arXiv: 2601.14713
- Adaptive Initial Residual Connections for GNNs with Theoretical Guarantees | arXiv: 2511.06598
- Adaptive Morph-Patch Transformer for Aortic Vessel Segmentation | arXiv: 2511.06897
- Adaptive Riemannian Graph Neural Networks | arXiv: 2508.02600
- Adaptive Theory of Mind for LLM-based Multi-Agent Coordination | arXiv: 2603.16264
- AdaptiveAD: Decoupling Scene Perception and Ego Status for End-to-End Autonomous Driving | arXiv: 2511.13079
- Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards | arXiv: 2506.14375
- AEDR: Training-Free AI-Generated Image Attribution via Autoencoder Double-Reconstruction | arXiv: 2507.18988
- AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios | arXiv: 2511.21053
- Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation | arXiv: 2511.06240
- Agent-SAMA: State-Aware Mobile Assistant | arXiv: 2505.23596
- AgentODRL: A Large Language Model-based Multi-agent System for ODRL Generation | arXiv: 2512.00602
- AgentSense: Virtual Sensor Data Generation Using LLM Agents in Simulated Home Environments | arXiv: 2506.11773
- AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search | arXiv: 2506.06017
- Aggregating Diverse Cue Experts for AI-Generated Image Detection | arXiv: 2601.08790
- AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions | arXiv: 2509.01787
- AHAN: Asymmetric Hierarchical Attention Network for Identical Twin Face Verification | arXiv: 2602.21503
- AI-based Traffic Modeling for Network Security and Privacy: Challenges Ahead | arXiv: 2503.22161
- AirDDE: Multifactor Neural Delay Differential Equations for Air Quality Forecasting | arXiv: 2603.17529
- Align to Structure: Aligning Large Language Models with Structural Information | arXiv: 2504.03622
- Align When They Want, Complement When They Need! Human-Centered Ensembles for Adaptive Human-AI Collaboration | arXiv: 2602.20104
- Aligning Generative Music AI with Human Preferences: Methods and Challenges | arXiv: 2511.15038
- Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping | arXiv: 2511.11551
- Aligning the True Semantics: Constrained Decoupling and Distribution Sampling for Cross-Modal Alignment | arXiv: 2603.05566
- AlignTree: Efficient Defense Against LLM Jailbreak Attacks | arXiv: 2511.12217
- Align³GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation | arXiv: 2511.11255
- ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs | arXiv: 2603.01792
- Alternative Fairness and Accuracy Optimization in Criminal Justice | arXiv: 2511.04505
- AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment | arXiv: 2511.09385
- Ambiguity-aware Truncated Flow Matching for Ambiguous Medical Image Segmentation | arXiv: 2511.06857
- AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design | arXiv: 2512.21613
- An Epistemic Perspective on Agent Awareness | arXiv: 2511.05977
- An Improved Privacy and Utility Analysis of Differentially Private SGD with Bounded Domain and Smooth Losses | arXiv: 2502.17772
- An Information Theoretic Evaluation Metric for Strong Unlearning | arXiv: 2405.17878
- An Invariant Latent Space Perspective on Language Model Inversion | arXiv: 2511.19569
- An LLM-Based Simulation Framework for Embodied Conversational Agents in Psychological Counseling | arXiv: 2410.22041
- An Overall Real-Time Mechanism for Classification and Quality Evaluation of Rice | arXiv: 2502.13764
- AnchorDS: Anchoring Dynamic Sources for Semantically Consistent Text-to-3D Generation | arXiv: 2511.11692
- AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation | arXiv: 2512.14095
- Angular Gradient Sign Method: Uncovering Vulnerabilities in Hyperbolic Networks | arXiv: 2511.12985
- Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation | arXiv: 2601.09212
- AnoStyler: Text-Driven Localized Anomaly Generation via Lightweight Style Transfer | arXiv: 2511.06687
- Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models | arXiv: 2508.18760
- Anti-adversarial Learning: Desensitizing Prompts for Large Language Models | arXiv: 2505.01273
- anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding | arXiv: 2506.00942
- Apo2Mol: 3D Molecule Generation via Dynamic Pocket-Aware Diffusion Models | arXiv: 2511.14559
- Approximation Algorithm for Constrained k-Center Clustering: A Local Search Approach | arXiv: 2601.11883
- APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval | arXiv: 2506.04953
- AquaSentinel: Next-Generation AI System Integrating Sensor Networks for Urban Underground Water Pipeline Anomaly Detection via Collaborative MoE-LLM Agent Architecture | arXiv: 2511.15870
- Arbitrary-Scale 3D Gaussian Super-Resolution | arXiv: 2508.16467
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment | arXiv: 2512.06196
- ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction | arXiv: 2511.12485
- Are Graph Transformers Necessary? Efficient Long-Range Message Passing with Fractal Nodes in MPNNs | arXiv: 2511.13010
- Area-Optimal Control Strategies for Heterogeneous Multi-Agent Pursuit | arXiv: 2511.15036
- Argumentative Debates for Transparent Bias Detection | arXiv: 2508.04511
- ASAG: Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance | arXiv: 2511.07499
- Assemble Your Crew: Automatic Multi-agent Communication Topology Design via Autoregressive Graph Generation | arXiv: 2507.18224
- Assessing LLMs for Serendipity Discovery in Knowledge Graphs: A Case for Drug Repurposing | arXiv: 2511.12472
- ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation | arXiv: 2512.09364
- AStar: Boosting Multimodal Reasoning with Automated Structured Thinking | arXiv: 2502.02339
- Asymmetric Cross-Modal Knowledge Distillation: Bridging Modalities with Weak Semantic Consistency | arXiv: 2511.08901
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning | arXiv: 2512.14709
- Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT | arXiv: 2603.11142
- Attention Retention for Continual Learning with Vision Transformers | arXiv: 2602.05454
- Authority Backdoor: A Certifiable Backdoor Mechanism for Authoring DNNs | arXiv: 2512.10600
- Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation | arXiv: 2410.12265
- AutoGLM: Autonomous Foundation Agents for GUIs | arXiv: 2411.00820
- AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research | arXiv: 2511.13333
- Automated Reproducibility Has a Problem Statement Problem | arXiv: 2601.04226
- Automating Complex Document Workflows via Stepwise and Rollback-Enabled Operations | arXiv: 2512.04445
- Autonomous Concept Drift Threshold Determination | arXiv: 2511.09953
- AutoPP: Towards Automated Product Poster Generation and Optimization | arXiv: 2512.21921
- AutoTool: Efficient Tool Selection for Large Language Model Agents | arXiv: 2511.14650
- AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models | arXiv: 2511.11299
- Axis-Aligned Document Dewarping | arXiv: 2507.15000
- A²LC: Active and Automated Label Correction for Semantic Segmentation | arXiv: 2506.11599
- Backdoor Attacks on Open Vocabulary Object Detectors via Multi-Modal Prompt Tuning | arXiv: 2511.12735
- Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines | arXiv: 2507.04726
- BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models | arXiv: 2511.10714
- BAID: A Benchmark for Bias Assessment of AI Detectors | arXiv: 2512.11505
- Balancing Multimodal Domain Generalization via Gradient Modulation and Projection | arXiv: 2603.14175
- BAMAS: Structuring Budget-Aware Multi-Agent Systems | arXiv: 2511.21572
- Bandit Learning in Housing Markets | arXiv: 2511.12629
- BAT: Learning Event-based Optical Flow with Bidirectional Adaptive Temporal Correlation | arXiv: 2503.03256
- BayesAgent: Bayesian Agentic Reasoning Under Uncertainty via Verbalized Probabilistic Graphical Modeling | arXiv: 2406.05516
- Bayesian Meta-Analyses Could Be More: A Case Study in Trial of Labor After a Cesarean-section Outcomes and Complications | arXiv: 2601.10089
- Bayesian Network Structural Consensus via Greedy Min-Cut Analysis | arXiv: 2504.00467
- BCE3S: Binary Cross-Entropy Based Tripartite Synergistic Learning for Long-tailed Recognition | arXiv: 2511.14097
- BCWildfire: A Long-term Multi-factor Dataset and Deep Learning Benchmark for Boreal Wildfire Risk Prediction | arXiv: 2511.17597
- BD-Net: Has Depth-Wise Convolution Ever Been Applied in Binary Neural Networks? | arXiv: 2511.17633
- Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images | arXiv: 2502.05066
- BeeRNA: Tertiary Structure-Based RNA Inverse Folding Using Artificial Bee Colony | arXiv: 2511.21781
- Behavior Tokens Speak Louder: Disentangled Explainable Recommendation with Behavior Vocabulary | arXiv: 2512.15614
- Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning | arXiv: 2511.10843
- Benchmarking LLMs for Political Science: A United Nations Perspective | arXiv: 2502.14122
- Beta Distribution Learning for Reliable Roadway Crash Risk Assessment | arXiv: 2511.04886
- Beyond Accuracy: A Cognitive Load Framework for Mapping the Capability Boundaries of Tool-use Agents | arXiv: 2601.20412
- Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection | arXiv: 2511.07301
- Beyond Cosine Similarity: Magnitude-Aware CLIP for No-Reference Image Quality Assessment | arXiv: 2511.09948
- Beyond Detection: Exploring Evidence-based Multi-Agent Debate for Misinformation Intervention and Persuasion | arXiv: 2511.07267
- Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces | arXiv: 2511.07587
- Beyond Fixed Depth: Adaptive Graph Neural Networks for Node Classification Under Varying Homophily | arXiv: 2511.06608
- Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models | arXiv: 2512.24058
- Beyond Monotonicity: Revisiting Factorization Principles in Multi-Agent Q-Learning | arXiv: 2511.09792
- Beyond Perplexity: Let the Reader Select Retrieval Summaries via Spectrum Projection Score | arXiv: 2508.05909
- Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning | arXiv: 2511.10037
- Beyond Semantic Features: Pixel-Level Mapping for Generalized AI-Generated Image Detection | arXiv: 2512.17350
- Beyond Sharpness: A Flatness Decomposition Framework for Efficient Continual Learning | arXiv: 2601.07636
- Beyond Superficial Forgetting: Thorough Unlearning through Knowledge Density Estimation and Block Re-insertion | arXiv: 2511.11667
- Beyond the Lower Bound: Bridging Regret Minimization and Best Arm Identification in Lexicographic Bandits | arXiv: 2511.05802
- Beyond the Mean: Fisher-Orthogonal Projection for Natural Gradient Descent in Large Batch Training | arXiv: 2508.13898
- Beyond World Models: Rethinking Understanding in AI Models | arXiv: 2511.12239
- Bi-Level Contextual Bandits for Individualized Resource Allocation under Delayed Feedback | arXiv: 2511.10572
- Bias Association Discovery Framework for Open-Ended LLM Generations | arXiv: 2508.01412
- BiasJailbreak: Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models | arXiv: 2410.13334
- BiCA: Effective Biomedical Dense Retrieval with Citation-Aware Hard Negatives | arXiv: 2511.08029
- Bid Farewell to Seesaw: Towards Accurate Long-tail Session-based Recommendation via Dual Constraints of Hybrid Intents | arXiv: 2511.08378
- Bidirectional Channel-selective Semantic Interaction for Semi-Supervised Medical Segmentation | arXiv: 2601.05855
- Bilevel MCTS for Amortized O(1) Node Selection in Classical Planning | arXiv: 2508.08385
- Bipartite Mode Matching for Vision Training Set Search from a Hierarchical Data Server | arXiv: 2601.09531
- BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models | arXiv: 2601.02147
- BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards | arXiv: 2602.18193
- Blue Teaming Function-Calling Agents | arXiv: 2601.09292
- Blur-Robust Detection via Feature Restoration: An End-to-End Framework for Prior-Guided Infrared UAV Target Detection | arXiv: 2511.14371
- BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning | arXiv: 2511.11421
- Boosting Adversarial Transferability via Ensemble Non-Attention | arXiv: 2511.08937
- Branch, or Layer? Zeroth-Order Optimization for Continual Learning of Vision-Language Models | arXiv: 2506.12409
- Break the Tie: Learning Cluster-Customized Category Relationships for Categorical Data Clustering | arXiv: 2511.09049
- Breaking the Adversarial Robustness-Performance Trade-off in Text Classification via Manifold Purification | arXiv: 2511.07888
- Breaking the Dyadic Barrier: Rethinking Fairness in Link Prediction Beyond Demographic Parity | arXiv: 2511.06568
- Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra | arXiv: 2511.06259
- Breaking the Stealth-Potency Trade-off in Clean-Image Backdoors with Generative Trigger Optimization | arXiv: 2511.07210
- Bridging Day and Night: Target-Class Hallucination Suppression in Unpaired Image Translation | arXiv: 2602.15383
- Bridging Granularity Gaps: Hierarchical Semantic Learning for Cross-Domain Few-Shot Segmentation | arXiv: 2511.12200
- Bridging Modalities via Progressive Re-alignment for Multimodal Test-Time Adaptation (BriMPR) | arXiv: 2511.22862
- Bridging Synthetic and Real Routing Problems via LLM-Guided Instance Generation and Progressive Adaptation | arXiv: 2511.10233
- Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content? | arXiv: 2512.21871
- Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages | arXiv: 2602.13867
- Bridging the Skills Gap: A Course Model for Modern Generative AI Education | arXiv: 2511.11757
- Bridging Vision and Language for Robust Context-Aware Surgical Point Tracking: The VL-SurgPT Dataset and Benchmark | arXiv: 2511.12026
- BugSweeper: Function-Level Detection of Smart Contract Vulnerabilities Using Graph Neural Networks | arXiv: 2512.09385
- C3RL: Rethinking the Combination of Channel-independence and Channel-mixing from Representation Learning | arXiv: 2507.17454
- C3TG: Conflict-aware, Composite, and Collaborative Controlled Text Generation | arXiv: 2511.09292
- CAD-VAE: Leveraging Correlation-Aware Latents for Comprehensive Fair Disentanglement | arXiv: 2503.07938
- CaDyT: Causal Structure Learning for Dynamical Systems with Theoretical Score Analysis | arXiv: 2512.14361
- CAE: Hierarchical Semantic Alignment for Image Clustering | arXiv: 2512.00904
- CAMERA: Multi-Matrix Joint Compression for MoE Models via Micro-Expert Redundancy Analysis | arXiv: 2508.02322
- CAMU: Context Augmentation for Meme Understanding | arXiv: 2504.17902
- Can Editing LLMs Inject Harm? | arXiv: 2407.20224
- Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution | arXiv: 2602.07414
- Can Protective Watermarking Safeguard the Copyright of 3D Gaussian Splatting? | arXiv: 2511.22262
- Can You Tell the Difference? Contrastive Explanations for ABox Entailments | arXiv: 2511.11281
- Canoe: Teaching LLMs to Maintain Contextual Faithfulness via Synthetic Tasks and RL | arXiv: 2505.16483
- Cash Flow Underwriting with Bank Transaction Data: Advancing MSME Financial Inclusion in Malaysia | arXiv: 2510.16066
- CASL: Curvature-Augmented Self-supervised Learning for 3D Anomaly Detection | arXiv: 2511.12909
- CAT-Net: A Cross-Attention Tone Network for Cross-Subject EEG-EMG Fusion Tone Decoding | arXiv: 2511.10935
- Catastrophic Forgetting in Kolmogorov-Arnold Networks | arXiv: 2511.12828
- CaTFormer: Causal Temporal Transformer with Dynamic Contextual Fusion for Driving Intention Prediction | arXiv: 2507.13425
- CATFormer: When Continual Learning Meets Spiking Transformers With Dynamic Thresholds | arXiv: 2603.15184
- Causal Inference Under Threshold Manipulation: Bayesian Mixture Modeling and Heterogeneous Treatment Effects | arXiv: 2509.19814
- Causal-Tune: Mining Causal Factors from Vision Foundation Models for Domain Generalized Semantic Segmentation | arXiv: 2512.16567
- CausalCLIP: Causally-Informed Feature Disentanglement and Filtering for Generalizable Detection of Generated Images | arXiv: 2512.13285
- Causality Matters: How Temporal Information Emerges in Video Language Models | arXiv: 2508.11576
- Causally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMs | arXiv: 2511.09018
- CausalTrace: A Neurosymbolic Causal Analysis Agent for Smart Manufacturing | arXiv: 2510.12033
- CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation | arXiv: 2508.07295
- CD-DPE: Dual-Prompt Expert Network Based on Convolutional Dictionary Feature Decoupling for Multi-Contrast MRI Super-Resolution | arXiv: 2511.14014
- CellStream: Dynamical Optimal Transport Informed Embeddings for Reconstructing Cellular Trajectories from Snapshots Data | arXiv: 2511.13786
- Center-Outward q-Dominance: A Sample-Computable Proxy for Strong Stochastic Dominance in Multi-Objective Optimisation | arXiv: 2511.12545
- Certified Branch-and-Bound MaxSAT Solving (Extended Version) | arXiv: 2511.10273
- Certified but Fooled! Breaking Certified Defences with Ghost Certificates | arXiv: 2511.14003
- Chain-of-Thought Driven Adversarial Scenario Extrapolation for Robust Language Models | arXiv: 2505.17089
- Characterizing AI Manipulation Risks in Brazilian YouTube Climate Discourse | arXiv: 2511.06091
- ChartEditor: A Reinforcement Learning Framework for Robust Chart Editing | arXiv: 2511.15266
- Chatsparent: An Interactive System for Detecting and Mitigating Cognitive Fatigue in LLMs | arXiv: 2601.11526
- CHDP: Cooperative Hybrid Diffusion Policies for RL in Parametric Environments | arXiv: 2601.05675
- Cheating Stereo Matching in Full-Scale: Physical Adversarial Attack against Binocular Depth Estimation | arXiv: 2511.14386
- Class-Partitioned VQ-VAE and Latent Flow Matching for Point Cloud Scene Generation | arXiv: 2601.12391
- Clear Nights Ahead: Towards Multi-Weather Nighttime Image Restoration | arXiv: 2505.16479
- ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration | arXiv: 2601.02763
- CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records | arXiv: 2507.22533
- Clinician-in-the-Loop Smart Home System to Detect Urinary Tract Infection Flare-Ups via Uncertainty-Aware Decision Support | arXiv: 2511.18334
- CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning | arXiv: 2512.15433
- CLIPPan: Adapting CLIP as A Supervisor for Unsupervised Pansharpening | arXiv: 2511.10896
- CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation | arXiv: 2503.05255
- Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents | arXiv: 2511.10705
- Co-Layout: LLM-driven Co-optimization for Interior Layout | arXiv: 2511.12474
- COACH: Collaborative Agents for Contextual Highlighting -- A Multi-Agent Framework for Sports Video Analysis | arXiv: 2512.01853
- Coarse-to-Fine Open-Set Graph Node Classification with Large Language Models | arXiv: 2512.16244
- CoCoLIT: ControlNet-Conditioned Latent Image Translation for MRI to Amyloid PET Synthesis | arXiv: 2508.01292
- CoEvo: Continual Evolution of Symbolic Solutions Using Large Language Models | arXiv: 2412.18890
- Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation | arXiv: 2511.13201
- Coherent Multi-Agent Trajectory Forecasting in Team Sports with CausalTraj | arXiv: 2511.18248
- Collaborative LLM Numerical Reasoning with Local Data Protection | arXiv: 2504.00299
- CometNet: Contextual Motif-guided Long-term Time Series Forecasting | arXiv: 2511.08049
- ComLQ: Benchmarking Complex Logical Queries in Information Retrieval | arXiv: 2511.12004
- Commonality in Few: Few-Shot Multimodal Anomaly Detection via Hypergraph-Enhanced Memory | arXiv: 2511.05966
- ComoRAG: A Cognitive-Inspired Memory-Organized RAG for Stateful Long Narrative Reasoning | arXiv: 2508.10419
- Compensating Distribution Drifts in Class-incremental Learning of Pre-trained Vision Transformers | arXiv: 2511.09926
- CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking | arXiv: 2511.15580
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models | arXiv: 2511.11751
- Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations | arXiv: 2601.12303
- Condensed Data Expansion Using Model Inversion for Knowledge Distillation | arXiv: 2408.13850
- Conditional Diffusion Model for Multi-Agent Dynamic Task Decomposition | arXiv: 2511.13137
- Conditional Information Bottleneck for Multimodal Fusion: Overcoming Shortcut Learning in Sarcasm Detection | arXiv: 2508.10644
- ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions | arXiv: 2511.14342
- Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning | arXiv: 2511.19516
- Connectivity-Guided Sparsification of 2-FWL GNNs Preserving Full Expressivity | arXiv: 2511.12838
- Consensus-Aligned Neuron Efficient Fine-Tuning Large Language Models for Multi-Domain Machine Translation | arXiv: 2602.05694
- Consistency-based Abductive Reasoning over Perceptual Errors of Multiple Pre-trained Models in Novel Environments | arXiv: 2505.19361
- Constrained and Robust Policy Synthesis with Satisfiability-Modulo-Probabilistic-Model-Checking | arXiv: 2511.08078
- Constrained Best Arm Identification with Tests for Feasibility | arXiv: 2511.09808
- Constrained Particle Seeking: Solving Diffusion Inverse Problems with Just Forward Passes | arXiv: 2603.01837
- ConSurv: Multimodal Continual Learning for Survival Analysis | arXiv: 2511.09853
- Continuous Degradation Modeling via Latent Flow Matching for Real-World Super-Resolution | arXiv: 2602.04193
- Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning | arXiv: 2511.14396
- Control Illusion: The Failure of Instruction Hierarchies in Large Language Models | arXiv: 2502.15851
- Controllable Financial Market Generation with Diffusion Guided Meta Agent | arXiv: 2408.12991
- Conversational Learning Diagnosis via Reasoning Multi-Turn Interactive Learning | arXiv: 2603.03236
- Convex Clustering Redefined: Robust Learning with the Median of Means Estimator | arXiv: 2511.14784
- ConvMix: A Mixed-Criteria Data Augmentation Framework for Conversational Dense Retrieval | arXiv: 2508.04001
- Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution | arXiv: 2511.19430
- CoordAR: One-Reference 6D Pose Estimation of Novel Objects via Autoregressive Coordinate Map Generation | arXiv: 2511.12919
- Coordinated Humanoid Robot Locomotion with Symmetry Equivariant Reinforcement Learning Policy | arXiv: 2508.01247
- Copyright Infringement Detection in Text-to-Image Diffusion Models via Differential Privacy | arXiv: 2509.23022
- CoRe-Fed: Bridging Collaborative and Representation Fairness via Federated Embedding Distillation | arXiv: 2602.00647
- Correcting False Alarms from Unseen: Adapting Graph Anomaly Detectors at Test Time | arXiv: 2511.07023
- Cost-Free Neutrality for the River Method | arXiv: 2512.14409
- Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment | arXiv: 2511.09105
- Counterfactual Explainable AI (XAI) Method for Deep Learning-Based Multivariate Time Series Classification | arXiv: 2511.13237
- CountSteer: Steering Attention for Object Counting in Diffusion Models | arXiv: 2511.11253
- CountVid: Open-World Object Counting in Videos | arXiv: 2506.15368
- COVR: Collaborative Optimization of VLMs and RL Agent for Visual-Based Control | arXiv: 2601.06122
- Creating Blank Canvas Against AI-Enabled Image Forgery | arXiv: 2511.22237
- CreBench: Human-Aligned Creativity Evaluation from Idea to Process to Product | arXiv: 2511.13626
- Credal Ensemble Distillation for Uncertainty Quantification | arXiv: 2511.13766
- CroPS: Improving Dense Retrieval with Cross-Perspective Positive Samples in Short-Video Search | arXiv: 2511.15443
- Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling | arXiv: 2511.07710
- Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition | arXiv: 2512.11239
- Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models | arXiv: 2601.08476
- Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models | arXiv: 2511.06793
- Cross-Sample Augmented Test-Time Adaptation for Personalized Intraoperative Hypotension Prediction | arXiv: 2512.15762
- Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation | arXiv: 2512.03521
- CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution | arXiv: 2511.21717
- CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models | arXiv: 2511.12263
- CTPD: Cross Tokenizer Preference Distillation | arXiv: 2601.11865
- CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion | arXiv: 2601.08619
- D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies | arXiv: 2511.16590
- DANCE: Density-Agnostic and Class-Aware Network for Point Cloud Completion | arXiv: 2511.07978
- DAPointMamba: Domain Adaptive Point Mamba for Point Cloud Completion | arXiv: 2511.20278
- Data Complexity of Querying Description Logic Knowledge Bases under Cost-Based Semantics | arXiv: 2511.07095
- Data Heterogeneity and Forgotten Labels in Split Federated Learning | arXiv: 2511.09736
- Data Verification is the Future of Quantum Computing Copilots | arXiv: 2602.04072
- Data Whitening Improves Sparse Autoencoder Learning | arXiv: 2511.13981
- DcMatch: Unsupervised Multi-Shape Matching with Dual-Level Consistency | arXiv: 2509.01204
- Deadline-Aware, Energy-Efficient Control of Domestic Immersion Hot Water Heaters | arXiv: 2601.18123
- Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification | arXiv: 2511.09933
- Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting | arXiv: 2512.07345
- Debiasing Machine Learning Predictions for Causal Inference Without Additional Ground Truth Data | arXiv: 2508.01341
- Decoding with Structured Awareness: Integrating Directional, Frequency-Spatial, and Structural Attention for Medical Image Segmentation | arXiv: 2512.05494
- Decomposition and Preprocessing of Ternary Constraint Networks | arXiv: 2511.11872
- DECOR: Deep Embedding Clustering with Orientation Robustness | arXiv: 2510.03328
- DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF | arXiv: 2511.19097
- Deep (Predictive) Discounted Counterfactual Regret Minimization | arXiv: 2511.08174
- Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning | arXiv: 2507.10007
- Deep Incomplete Multi-View Clustering via Hierarchical Imputation and Alignment | arXiv: 2601.09051
- DeepBooTS: Dual-Stream Residual Boosting for Drift-Resilient Time-Series Forecasting | arXiv: 2511.06893
- DeepDebater: A Superpersuasive Autonomous Policy Debating System | arXiv: 2511.17854
- DeepGB-TB: A Risk-Balanced Cross-Attention Gradient-Boosted Convolutional Network for Rapid, Interpretable Tuberculosis Screening | arXiv: 2508.02741
- DeepProofLog: Efficient Proving in Deep Stochastic Logic Programs | arXiv: 2511.08581
- DeepRAHT: Learning Predictive RAHT for Point Cloud Attribute Compression | arXiv: 2601.12255
- DeepRWCap: Neural-Guided Random-Walk Capacitance Solver for IC Design | arXiv: 2511.06831
- DeepTracer: Tracing Stolen Model via Deep Coupled Watermarks | arXiv: 2511.08985
- DeformTrace: A Deformable State Space Model with Relay Tokens for Temporal Forgery Localization | arXiv: 2603.04882
- DEIG: Detail-Enhanced Instance Generation with Fine-Grained Semantic Control | arXiv: 2602.18282
- Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability | arXiv: 2511.20662
- DeNAS-ViT: Data Efficient NAS-Optimized Vision Transformer for Ultrasound Image Segmentation | arXiv: 2407.04203
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents | arXiv: 2511.15392
- Depth-Synergized Mamba Meets Memory Experts for All-Day Image Reflection Separation | arXiv: 2601.00322
- Description Logics with Two Types of Definite Descriptions: Complexity, Expressiveness, and Automated Deduction | arXiv: 2512.06604
- Designing Incident Reporting Systems for Harms from General-Purpose AI | arXiv: 2511.05914
- Designing Truthful Mechanisms for Asymptotic Fair Division | arXiv: 2512.10892
- Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception | arXiv: 2504.06753
- Detecting the Future: All-at-Once Event Sequence Forecasting with Horizon Matching | arXiv: 2408.13131
- DeToNATION: Decoupled Torch Network-Aware Training on Interlinked Online Nodes | arXiv: 2502.06728
- Deviation Dynamics in Cardinal Hedonic Games | arXiv: 2511.11531
- Dexterous Manipulation Transfer via Progressive Kinematic-Dynamic Alignment | arXiv: 2511.10987
- DFDT: Dynamic Fast Decision Tree for IoT Data Stream Mining on Edge Devices | arXiv: 2502.14011
- DiA-gnostic VLVAE: Disentangled Alignment-Constrained Vision Language Variational AutoEncoder for Robust Radiology Reporting with Missing Modalities | arXiv: 2511.05968
- DiCaP: Distribution-Calibrated Pseudo-labeling for Semi-Supervised Multi-Label Learning | arXiv: 2511.20225
- DICE: Distilling Classifier-Free Guidance into Text Embeddings | arXiv: 2502.03726
- Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation | arXiv: 2511.09090
- DiffA: Large Language Diffusion Models Can Listen and Understand | arXiv: 2507.18452
- DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation | arXiv: 2601.03178
- Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models | arXiv: 2511.09973
- Differentiated Directional Intervention: A Framework for Evading LLM Safety Alignment | arXiv: 2511.06852
- Difficulty Controlled Diffusion Model for Synthesizing Effective Training Data | arXiv: 2411.18109
- Difficulty-Aware Label-Guided Denoising for Monocular 3D Object Detection | arXiv: 2511.13195
- DiffMM: Efficient Method for Accurate Noisy and Sparse Trajectory Map Matching via One Step Diffusion | arXiv: 2601.08482
- DiffOP: Reinforcement Learning of Optimization-Based Control Policies via Implicit Policy Gradients | arXiv: 2411.07484
- DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving | arXiv: 2511.17150
- Diffusion Reconstruction-Based Data Likelihood Estimation for Core-Set Selection | arXiv: 2511.19274
- DisCode: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning | arXiv: 2512.14420
- Discounted Cuts: A Stackelberg Approach to Network Disruption | arXiv: 2511.10804
- Distillation Dynamics: Towards Understanding Feature-Based Distillation in Vision Transformers | arXiv: 2511.06848
- Distilling Cross-Modal Knowledge via Feature Disentanglement | arXiv: 2511.19887
- Distilling Deep Reinforcement Learning into Interpretable Fuzzy Rules: An Explainable AI Framework | arXiv: 2603.13257
- Distilling Future Temporal Knowledge with Masked Feature Reconstruction for 3D Object Detection | arXiv: 2512.08247
- Distribution-Based Feature Attribution for Explaining the Predictions of Any Classifier | arXiv: 2511.09332
- Distributional Priors Guided Diffusion for Generating 3D Molecules in Low Data Regimes | arXiv: 2404.00962
- Distributionally Robust Online Markov Game with Linear Function Approximation | arXiv: 2511.07831
- Diversifying Counterattacks: Orthogonal Exploration for Robust CLIP Inference | arXiv: 2511.09064
- Divide, Conquer and Unite: Hierarchical Style-Recalibrated Prototype Alignment for Federated Medical Segmentation | arXiv: 2511.10945
- Do It for HER: First-Order Temporal Logic Reward Specification in Reinforcement Learning | arXiv: 2602.06227
- Do Large Language Models Think Like the Brain? Sentence-Level Evidences from Layer-Wise Embeddings and fMRI | arXiv: 2505.22563
- Do LLMs Feel? Teaching Emotion Recognition with Prompts, Retrieval, and Curriculum Learning | arXiv: 2511.07061
- Do LLMs Really Struggle at NL-FOL Translation? Revealing Their Strengths via a Novel Benchmarking Strategy | arXiv: 2511.11816
- Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging | arXiv: 2511.10712
- Do Retrieval Augmented Language Models Know When They Don't Know? | arXiv: 2509.01476
- Do We Need Perfect Data? Leveraging Noise for Domain Generalized Segmentation | arXiv: 2511.22948
- Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs | arXiv: 2512.11509
- Does Self-Evaluation Enable Wireheading in Language Models? | arXiv: 2511.23092
- DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models | arXiv: 2508.05685
- Domain Generalized Stereo Matching with Uncertainty-guided Data Augmentation | arXiv: 2508.01303
- Don't Start Over: A Cost-Effective Framework for Migrating Personalized Prompts Between LLMs | arXiv: 2601.12034
- DOS: Directional Object Separation in Text Embeddings for Multi-Object Image Generation | arXiv: 2510.14376
- DOS: Distilling Observable Softmaps of Zipfian Prototypes for Self-Supervised Point Representation | arXiv: 2512.11465
- DP-GenG: Differentially Private Dataset Distillation Guided by DP-Generated Data | arXiv: 2511.09876
- DR.Experts: Differential Refinement of Distortion-Aware Experts for Blind Image Quality Assessment | arXiv: 2602.09531
- DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation | arXiv: 2411.16657
- Drive As You Like: Strategy-Level Motion Planning Based on A Multi-Head Diffusion Model | arXiv: 2508.16947
- DriveFlow: Rectified Flow Adaptation for Robust 3D Object Detection in Autonomous Driving | arXiv: 2511.18713
- DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning | arXiv: 2506.06659
- DRMD: Deep Reinforcement Learning for Malware Detection under Concept Drift | arXiv: 2508.18839
- Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment | arXiv: 2511.13290
- DS-ATGO: Dual-Stage Synergistic Learning via Forward Adaptive Threshold and Backward Gradient Optimization for Spiking Neural Networks | arXiv: 2511.13050
- Dual-branch Spatial-Temporal Self-supervised Representation for Enhanced Road Network Learning | arXiv: 2511.06633
- Dual-Path Knowledge-Augmented Contrastive Alignment Network for Spatially Resolved Transcriptomics | arXiv: 2511.17685
- DualFete: Revisiting Teacher-Student Interactions from a Feedback Perspective for Semi-supervised Medical Image Segmentation | arXiv: 2511.09319
- DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling | arXiv: 2508.08961
- DW-DGAT: Dynamically Weighted Dual Graph Attention Network for Neurodegenerative Disease Diagnosis | arXiv: 2601.10001
- Dynamic Gaussian Scene Reconstruction from Unsynchronized Videos | arXiv: 2511.11175
- DynaQuant: Dynamic Mixed-Precision Quantization for Learned Image Compression | arXiv: 2511.07903
- EAGLE: Episodic Appearance- and Geometry-Aware Memory for Unified 2D-3D Visual Query Localization | arXiv: 2511.08007
- Earth-Adapter: Bridge Geospatial Domain Gaps with Mixture of Frequency Adaptation | arXiv: 2504.06220
- EASE: Practical and Efficient Safety Alignment for Small Language Models | arXiv: 2511.06512
- Easy to Learn, Yet Hard to Forget: Towards Robust Unlearning Under Bias | arXiv: 2602.21773
- EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding | arXiv: 2603.18001
- EchoLess: Label-Based Pre-Computation for Memory-Efficient Heterogeneous Graph Learning | arXiv: 2511.11081
- EcoAgent: An Efficient Device-Cloud Collaborative Multi-Agent Framework for Mobile Automation | arXiv: 2505.05440
- ECPv2: Fast, Efficient, and Scalable Global Optimization of Lipschitz Functions | arXiv: 2511.16575
- EEG-DLite: Dataset Distillation for Efficient Large EEG Model Training | arXiv: 2512.12210
- Efficient and Reliable Hitting-Set Computations for the Implicit Hitting Set Approach | arXiv: 2508.07015
- Efficient Chromosome Parallelization for Precision Medicine Genomic Workflows | arXiv: 2511.15977
- Efficient Multiagent Planning via Shared Action Suggestions | arXiv: 2412.11430
- Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression | arXiv: 2508.05337
- Efficient Thought Space Exploration Through Strategic Intervention | arXiv: 2511.10038
- EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI | arXiv: 2512.02020
- EfficientFSL: Enhancing Few-Shot Classification via Query-Only Tuning in Vision Transformers | arXiv: 2601.08499
- EFX and PO Allocation Exists for Two Types of Goods | arXiv: 2601.03438
- EgoEMS: A High-Fidelity Multimodal Egocentric Dataset for Cognitive Assistance in Emergency Medical Services | arXiv: 2511.09894
- ElementaryNet: A Non-Strategic Neural Network for Predicting Human Behavior in Normal-Form Games | arXiv: 2503.05925
- ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences | arXiv: 2505.17691
- EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens | arXiv: 2511.21106
- Emergent Persuasion: Will LLMs Persuade Without Being Prompted? | arXiv: 2512.22201
- EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation | arXiv: 2511.11002
- Empowering DINO Representations for Underwater Instance Segmentation via Aligner and Prompter | arXiv: 2511.08334
- Empowering Semantic-Sensitive Underwater Image Enhancement with VLM | arXiv: 2603.12773
- End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering | arXiv: 2511.09282
- Enhancing Binary Encoded Crime Linkage Analysis Using Siamese Network | arXiv: 2511.07651
- Enhancing Control Policy Smoothness by Aligning Actions with Predictions from Preceding States | arXiv: 2601.18479
- Enhancing DPSGD via Per-Sample Momentum and Low-Pass Filtering | arXiv: 2511.08841
- Enhancing Generalization of Depth Estimation Foundation Model via Weakly-Supervised Adaptation with Regularization | arXiv: 2511.14238
- Enhancing Logical Expressiveness in GNNs via Path-Neighbor Aggregation | arXiv: 2511.07994
- Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective | arXiv: 2511.06284
- Enhancing Noise Resilience in Face Clustering via Sparse Differential Transformer | arXiv: 2512.22612
- Enhancing Robustness of Offline RL Under Data Corruption via SAM | arXiv: 2511.17568
- Enhancing Rotation-Invariant 3D Learning with Global Pose Awareness and Attention Mechanisms | arXiv: 2511.08833
- Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief | arXiv: 2509.01564
- EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization | arXiv: 2511.10165
- EPSegFZ: Efficient Point Cloud Semantic Segmentation for Few- and Zero-Shot Scenarios | arXiv: 2511.11700
- EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion | arXiv: 2512.23173
- Error Correction in Radiology Reports: A Knowledge Distillation-Based Multi-Stage Framework | arXiv: 2406.15045
- ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation | arXiv: 2603.13154
- Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios | arXiv: 2601.03553
- Evaluating, Synthesizing, and Enhancing for Customer Support Conversation | arXiv: 2508.04423
- EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer | arXiv: 2509.12718
- Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding | arXiv: 2503.09143
- Expandable and Differentiable Dual Memories with Orthogonal Regularization for Exemplar-free Continual Learning | arXiv: 2511.09871
- Experience with Single Domain Generalization in Real World Medical Imaging Deployments | arXiv: 2601.16359
- Expert-Guided Prompting and Retrieval-Augmented Generation for Emergency Medical Service Question Answering | arXiv: 2511.10900
- ExpertAD: Enhancing Autonomous Driving Systems with Mixture of Experts | arXiv: 2511.11740
- Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based Report Generation | arXiv: 2512.06105
- Explaining Decentralized Multi-Agent Reinforcement Learning Policies | arXiv: 2511.10409
- Explanation-Preserving Augmentation for Semi-Supervised Graph Representation Learning | arXiv: 2410.12657
- Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction | arXiv: 2511.10134
- Explore and Establish Synergistic Effects between Weight Pruning and Coreset Selection | arXiv: 2511.09901
- Explore How to Inject Beneficial Noise in MLLMs | arXiv: 2511.12917
- Exploring LLMs for Scientific Information Extraction using the SciEx Framework | arXiv: 2512.10004
- Exploring Surround-View Fisheye Camera 3D Object Detection | arXiv: 2511.18695
- Exploring the Effects of Alignment on Numerical Bias in Large Language Models | arXiv: 2601.16444
- Exposing DeepFakes via Hyperspectral Domain Mapping | arXiv: 2511.11732
- Exposing the Cracks: Vulnerabilities of Retrieval-Augmented LLM-Based Machine Translation | arXiv: 2510.00829
- Expressive Temporal Specifications for Reward Monitoring | arXiv: 2511.12808
- ExtendAttack: Attacking Servers of LRMs via Extending Reasoning | arXiv: 2506.13737
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction | arXiv: 2511.13118
- Extreme Value Monte Carlo Tree Search for Classical Planning | arXiv: 2405.18248
- Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis | arXiv: 2511.10254
- Fact2Fiction: Targeted Poisoning Attack to Agentic Fact-checking System | arXiv: 2508.06059
- FactGuard: Event-Centric and Commonsense-Guided Fake News Detection | arXiv: 2511.10281
- Factor(U,T): Controlling Untrusted AI by Monitoring their Plans | arXiv: 2512.14745
- Failures to Surface Harmful Contents in Video Large Language Models | arXiv: 2508.10974
- Fair Model-Based Clustering | arXiv: 2602.21509
- FairGSE: Fairness-Aware Graph Neural Network without High False Positive Rates | arXiv: 2511.12132
- FaNe: Towards Fine-Grained Cross-Modal Contrast with False-Negative Reduction and Text-Conditioned Sparse Attention | arXiv: 2511.12215
- FantasyStyle: Controllable Stylized Distillation for 3D Gaussian Splatting | arXiv: 2508.08136
- Fast 3D Surrogate Modeling for Data Center Thermal Management | arXiv: 2511.11722
- FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning | arXiv: 2507.23318
- Faster Certified Symmetry Breaking Using Orders With Auxiliary Variables | arXiv: 2511.16637
- FDP: A Frequency-Decomposition Preprocessing Pipeline for Unsupervised Anomaly Detection in Brain MRI | arXiv: 2511.12899
- Feature-Centric Unsupervised Node Representation Learning Without Homophily Assumption | arXiv: 2512.15112
- FedALT: Federated Fine-Tuning through Adaptive Local Training with Rest-of-World LoRA | arXiv: 2503.11880
- Federated CLIP for Resource-Efficient Heterogeneous Medical Image Classification | arXiv: 2511.07929
- FedGRPO: Privately Optimizing Foundation Models with Group-Relative Rewards from Domain Clients | arXiv: 2602.12014
- FedPM: Federated Learning Using Second-order Optimization with Preconditioned Mixing of Local Parameters | arXiv: 2511.09100
- FedP²EFT: Federated Learning to Personalize PEFT for Multilingual LLMs | arXiv: 2502.04387
- Few-Shot Precise Event Spotting via Unified Multi-Entity Graph and Distillation | arXiv: 2511.14186
- FGM-HD: Boosting Generation Diversity of Fractal Generative Models through Hausdorff Dimension Induction | arXiv: 2511.08945
- FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing | arXiv: 2511.12151
- FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion | arXiv: 2512.11274
- Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration | arXiv: 2411.17686
- Finding Diverse Solutions Parameterized by Cliquewidth | arXiv: 2405.20931
- Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs | arXiv: 2601.11019
- Finding Time Series Anomalies using Granular-ball Vector Data Description | arXiv: 2511.12147
- Fine-Grained DINO Tuning with Dual Supervision for Face Forgery Detection | arXiv: 2511.12107
- Fine-Grained Representation for Lane Topology Reasoning | arXiv: 2511.12590
- Fine-Tuned LLMs Know They Don't Know: A Parameter-Efficient Approach to Recovering Honesty | arXiv: 2511.12991
- FineTec: Fine-Grained Action Recognition Under Temporal Corruption via Skeleton Decomposition and Sequence Completion | arXiv: 2512.25067
- FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding | arXiv: 2601.17258
- FineXtrol: Controllable Motion Generation via Fine-Grained Text | arXiv: 2511.18927
- FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation | arXiv: 2512.24903
- FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation | arXiv: 2511.07322
- First-Order Error Matters: Accurate Compensation for Quantized Large Language Models | arXiv: 2507.11017
- First-Order Representation Languages for Goal-Conditioned RL | arXiv: 2512.19355
- FlashKAT: Understanding and Addressing Performance Bottlenecks in the Kolmogorov-Arnold Transformer | arXiv: 2505.13813
- Flexible Concept Bottleneck Model | arXiv: 2511.06678
- Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment | arXiv: 2511.22345
- Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models | arXiv: 2511.07498
- Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation | arXiv: 2508.03663
- Forget Less by Learning from Parents Through Hierarchical Relationships | arXiv: 2601.01892
- Formal Abductive Latent Explanations for Prototype-Based Networks | arXiv: 2511.16588
- Formal Verification of Diffusion Auctions | arXiv: 2511.08765
- Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data | arXiv: 2508.15793
- Format Matters: The Robustness of Multimodal LLMs in Reviewing Evidence from Tables and Charts | arXiv: 2511.10075
- FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM | arXiv: 2512.25008
- FourierPET: Deep Fourier-based Unrolled Network for Low-count PET Reconstruction | arXiv: 2601.11680
- FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection | arXiv: 2502.15488
- Free-Form Scene Editor: Enabling Multi-Round Object Manipulation like in a 3D Engine | arXiv: 2511.13713
- FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting | arXiv: 2512.21104
- FreqCycle: A Multi-Scale Time-Frequency Analysis Method for Time Series Forecasting | arXiv: 2603.09661
- FreqRec: Exploiting Inter-Session Information with Frequency-enhanced Dual-Path Networks for Sequential Recommendation | arXiv: 2511.06285
- From Attribution to Action: Jointly ALIGNing Predictions and Explanations | arXiv: 2511.06944
- From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness | arXiv: 2602.12285
- From Classification to Ranking: Enhancing LLM Reasoning for MBTI Personality Detection | arXiv: 2601.18582
- From Decision Trees to Boolean Logic: A Fast and Unified SHAP Algorithm | arXiv: 2511.09376
- From IDs to Semantics: A Generative Framework for Cross-Domain Recommendation with Adaptive Semantic Tokenization | arXiv: 2511.08006
- From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks | arXiv: 2512.02580
- From Parameter to Representation: A Closed-Form Approach for Controllable Model Merging | arXiv: 2511.10943
- From Passive Perception to Active Memory: A Weakly Supervised Image Manipulation Localization Framework Driven by Coarse-Grained Annotations | arXiv: 2511.20359
- From Policy to Logic for Efficient and Interpretable Coverage Assessment | arXiv: 2601.01266
- From Pretrain to Pain: Adversarial Vulnerability of Video Foundation Models without Finetuning | arXiv: 2511.07049
- From Sequential to Recursive: Enhancing Decision-Focused Learning with Bidirectional Feedback | arXiv: 2511.08035
- From Single to Societal: Analyzing Persona-Induced Bias in Multi-Agent Interactions | arXiv: 2511.11789
- From Theory of Mind to Theory of Environment: Counterfactual Simulation of Latent Environmental Dynamics | arXiv: 2601.01599
- From Woofs to Words: Towards Intelligent Robotic Guide Dogs with Verbal Communication | arXiv: 2603.12574
- FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models | arXiv: 2511.16233
- FunKAN: Functional Kolmogorov-Arnold Network for Medical Image Enhancement and Segmentation | arXiv: 2509.13508
- G-UBS: Towards Robust Understanding of Implicit Feedback via Group-Aware User Behavior Simulation | arXiv: 2508.05709
- G2L: From Giga-Scale to Cancer-Specific Large-Scale Pathology Foundation Models via Efficient Fine-Tuning | arXiv: 2510.11176
- GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs | arXiv: 2508.16753
- Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment | arXiv: 2601.08849
- GateRA: Token-Aware Modulation for Parameter-Efficient Fine-Tuning | arXiv: 2511.17582
- Gaussian Blending: Rethinking Alpha Blending in 3D Gaussian Splatting | arXiv: 2511.15102
- GaussianImage++: Boosted Image Representation and Compression with 2D Gaussian Splatting | arXiv: 2512.19108
- GazeInterpreter: Parsing Eye Gaze to Generate Eye-Body-Coordinated Narrations | arXiv: 2511.16245
- GCL-OT: Graph Contrastive Learning with Optimal Transport for Heterophilic Text-Attributed Graphs | arXiv: 2511.16778
- GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization | arXiv: 2508.06899
- GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs | arXiv: 2511.13007
- GenCast: Generalizing Traffic Forecasting to Regions without Observations | arXiv: 2508.08947
- Gender Bias in Emotion Recognition by Large Language Models | arXiv: 2511.19785
- Gene Incremental Learning for Single-Cell Transcriptomics | arXiv: 2511.13762
- GenePheno: Interpretable Gene Knockout-Induced Phenotype Abnormality Prediction Framework | arXiv: 2511.09512
- Generalizable Slum Detection from Satellite Imagery with Mixture-of-Experts | arXiv: 2511.10300
- Generalization Bounds for Semi-supervised Matrix Completion with Distributional Side Information | arXiv: 2511.13049
- Generalized Geometry Encoding Volume for Real-time Stereo Matching | arXiv: 2512.06793
- Generalizing Analogical Inference from Boolean to Continuous Domains | arXiv: 2511.10416
- Generalizing Fair Clustering to Multiple Groups: Algorithms and Applications | arXiv: 2511.11539
- Generating Attribute-Aware Human Motions from Textual Prompt | arXiv: 2506.21912
- GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection | arXiv: 2501.11340
- Geometry Meets Light: Leveraging Geometric Priors for Universal Photometric Stereo under Limited Multi-Illumination Cues | arXiv: 2511.13015
- GEWDiff: Geometric Enhanced Wavelet-based Diffusion Model for Hyperspectral Image Super-resolution | arXiv: 2511.07103
- Ghost in the Transformer: Detecting Model Reuse with Invariant Spectral Signatures | arXiv: 2511.06390
- GHOST: Solving the Traveling Salesman Problem on Graphs of Convex Sets | arXiv: 2511.06471
- GIIM: Graph-based Learning of Inter- and Intra-view Dependencies for Multi-view Medical Image Diagnosis | arXiv: 2603.09446
- Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models | arXiv: 2501.05179
- Global-Lens Transformers: Adaptive Token Mixing for Dynamic Link Prediction | arXiv: 2511.12442
- GloCTM: Cross-Lingual Topic Modeling via a Global Context Space | arXiv: 2601.11872
- GOAL: Geometrically Optimal Alignment for Continual Generalized Category Discovery | arXiv: 2602.19872
- GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks | arXiv: 2601.13758
- Good-for-MDP State Reduction for Stochastic LTL Planning | arXiv: 2511.09073
- GP-MoLFormer-Sim: Test Time Molecular Optimization through Contextual Similarity Guidance | arXiv: 2506.05628
- GRAM-R²: Self-Training Generative Foundation Reward Models for Reward Reasoning | arXiv: 2509.02492
- GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval | arXiv: 2601.00584
- Graph of Verification: Structured Verification of LLM Reasoning with Directed Acyclic Graphs | arXiv: 2506.12509
- Graph Out-of-Distribution Detection via Test-Time Calibration with Dual Dynamic Dictionaries | arXiv: 2511.13541
- Graph Smoothing for Enhanced Local Geometry Learning in Point Cloud Analysis | arXiv: 2601.11102
- Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting | arXiv: 2603.06663
- Graph-Theoretic Consistency for Robust and Topology-Aware Semi-Supervised Histopathology Segmentation | arXiv: 2509.22689
- GraphTextack: A Realistic Black-Box Node Injection Attack on LLM-Enhanced GNNs | arXiv: 2511.12423
- Griffin: Aerial-Ground Cooperative Detection and Tracking Dataset and Benchmark | arXiv: 2503.06983
- GRIM: Task-Oriented Grasping with Conditioning on Generative Examples | arXiv: 2506.15607
- Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization | arXiv: 2601.06224
- Group Orthogonal Low-Rank Adaptation for RGB-T Tracking | arXiv: 2512.05359
- GROVER: Graph-guided Representation of Omics and Vision with Expert Regulation for Cancer Survival Prediction | arXiv: 2511.11730
- GSAP-ERE: Fine-Grained Scholarly Entity and Relation Extraction Focused on Machine Learning | arXiv: 2511.09411
- GT-SNT: A Linear-Time Transformer for Large-Scale Graphs via Spiking Node Tokenization | arXiv: 2504.11840
- GT2-GS: Geometry-aware Texture Transfer for Gaussian Splatting | arXiv: 2505.15208
- Guess or Recall? Training CNNs to Classify and Localize Memorization in LLMs | arXiv: 2508.02573
- Guided Perturbation Sensitivity (GPS): Detecting Adversarial Text via Embedding Stability and Word Importance | arXiv: 2508.11667
- GuideGen: A Text-Guided Framework for Paired Full-Torso Anatomy and CT Volume Generation | arXiv: 2403.07247
- Guideline-Consistent Segmentation via Multi-Agent Refinement | arXiv: 2509.04687
- H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation | arXiv: 2511.17079
- HACK: Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling | arXiv: 2504.09261
- Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models | arXiv: 2511.17170
- Hallucination Stations: On Some Basic Limitations of Transformer-Based Language Models | arXiv: 2507.07505
- Hard vs. Noise: Resolving Hard-Noisy Sample Confusion in Recommender Systems via Large Language Models | arXiv: 2511.07295
- Harmonic Dataset Distillation for Time Series Forecasting | arXiv: 2603.03760
- Harnessing Textual Semantic Priors for Knowledge Transfer and Refinement in CLIP-Driven Continual Learning | arXiv: 2508.01579
- Harnessing the Unseen: The Hidden Influence of Intrinsic Knowledge in Long-Context Language Models | arXiv: 2504.08202
- Harnessing Vision-Language Models for Time Series Anomaly Detection | arXiv: 2506.06836
- Hashed Watermark as a Filter: A Unified Defense Against Forging and Overwriting Attacks in Neural Network Watermarking | arXiv: 2507.11137
- HCF: Hierarchical Cascade Framework for Distributed Multi-Stage Image Compression | arXiv: 2508.02051
- HCPO: Hierarchical Conductor-Based Policy Optimization in Multi-Agent Reinforcement Learning | arXiv: 2511.12123
- HD2-SSC: High-Dimension High-Density Semantic Scene Completion for Autonomous Driving | arXiv: 2511.07925
- HeadHunt-VAD: Hunting Robust Anomaly-Sensitive Heads in MLLM for Tuning-Free Video Anomaly Detection | arXiv: 2512.17601
- HealSplit: Towards Self-Healing through Adversarial Distillation in Split Federated Learning | arXiv: 2511.11240
- Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR | arXiv: 2508.01166
- Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning | arXiv: 2601.11393
- Hierarchical Direction Perception via Atomic Dot-Product Operators for Rotation-Invariant Point Clouds Learning | arXiv: 2511.08240
- Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring | arXiv: 2512.22496
- Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification | arXiv: 2511.13575
- Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling | arXiv: 2511.11688
- HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models | arXiv: 2508.04663
- HiFusion: Hierarchical Intra-Spot Alignment and Regional Context Fusion for Spatial Gene Expression Prediction from Histopathology | arXiv: 2511.12969
- Higher-Order Responsibility | arXiv: 2506.01003
- HiLoMix: Robust High- and Low-Frequency Graph Learning Framework for Mixing Address Association | arXiv: 2511.07759
- HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment | arXiv: 2511.06653
- History-Aware Reasoning for GUI Agents | arXiv: 2511.09127
- HN-MVTS: HyperNetwork-based Multivariate Time Series Forecasting | arXiv: 2511.08340
- How Bias Binds: Measuring Hidden Associations for Bias Control in Text-to-Image Compositions | arXiv: 2511.07091
- How Does Alignment Enhance LLMs' Multilingual Capabilities? A Language Neurons Perspective | arXiv: 2505.21505
- How Hard is it to Explain Preferences Using Few Boolean Attributes? | arXiv: 2511.13445
- How Hard Is It to Rig a Tournament When Few Players Can Beat or Be Beaten by the Favorite? | arXiv: 2601.08530
- How Many Experts Are Enough? Towards Optimal Semantic Specialization for Mixture-of-Experts | arXiv: 2512.19765
- How to Marginalize in Causal Structure Learning? | arXiv: 2511.14001
- How Wide and How Deep? Mitigating Over-Squashing of GNNs via Channel Capacity Constrained Estimation | arXiv: 2511.06443
- HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding | arXiv: 2511.23178
- HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios | arXiv: 2511.08496
- HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning | arXiv: 2511.15574
- Human Cognition Inspired RAG with Knowledge Graph for Complex Problem Solving | arXiv: 2503.06567
- Human Cognitive Biases in Explanation-based Interaction: The Case of Within and Between Session Order Effect | arXiv: 2512.04764
- Human-Centric Open-Future Task Discovery: Formulation, Benchmark, and Scalable Tree-Based Search | arXiv: 2511.18929
- Human-in-the-Loop Interactive Report Generation for Chronic Disease Adherence | arXiv: 2601.06364
- Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing | arXiv: 2512.00881
- HybriDLA: Hybrid Generation for Document Layout Analysis | arXiv: 2511.19919
- HydroDCM: Hydrological Domain-Conditioned Modulation for Cross-Reservoir Inflow Prediction | arXiv: 2512.03300
- HyMoERec: Hybrid Mixture-of-Experts for Sequential Recommendation | arXiv: 2511.06388
- Hyperbolic Continuous Structural Entropy for Hierarchical Clustering | arXiv: 2512.00524
- Hyperbolic Hierarchical Alignment Reasoning Network for Text-3D Retrieval | arXiv: 2511.11045
- HyperSHAP: Shapley Values and Interactions for Explaining Hyperparameter Optimization | arXiv: 2502.01276
- Hypothesis Generation via LLM-Automated Language Bias for ILP | arXiv: 2505.21486
- I-CAM-UV: Integrating Causal Graphs over Non-Identical Variable Sets Using Causal Additive Models with Unobserved Variables | arXiv: 2603.03207
- I-INR: Iterative Implicit Neural Representations | arXiv: 2504.17364
- I2E: Real-Time Image-to-Event Conversion for High-Performance Spiking Neural Networks | arXiv: 2511.08065
- ICL-Router: In-Context Learned Model Representations for LLM Routing | arXiv: 2510.09719
- ICLR: Inter-Chrominance and Luminance Interaction for Natural Color Restoration in Low-Light Image Enhancement | arXiv: 2511.13607
- IdealTSF: Can Non-Ideal Data Contribute to Enhancing Time Series Forecasting? | arXiv: 2512.05442
- Identifying and Analyzing Performance-Critical Tokens in Large Language Models | arXiv: 2401.11323
- IE-SRGS: An Internal-External Knowledge Fusion Framework for High-Fidelity 3D Gaussian Splatting Super-Resolution | arXiv: 2511.22233
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference | arXiv: 2511.11306
- ImageBindDC: Compressing Multi-modal Data with ImageBind-based Condensation | arXiv: 2511.08263
- Importance-Aware Data Selection for Efficient LLM Instruction Tuning | arXiv: 2511.07074
- Improved Differentially Private Algorithms for Rank Aggregation | arXiv: 2511.11319
- Improved Masked Image Generation with Knowledge-Augmented Token Representations | arXiv: 2511.12032
- Improved Runtime Guarantees for the SPEA2 Multi-Objective Optimizer | arXiv: 2511.07150
- Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection | arXiv: 2511.06328
- Improving Region Representation Learning from Urban Imagery with Noisy Long-Caption Supervision | arXiv: 2511.07062
- Improving Sparse IMU-based Motion Capture with Motion Label Smoothing | arXiv: 2511.22288
- Improving Sustainability of Adversarial Examples in Class-Incremental Learning | arXiv: 2511.09088
- Improving the Convergence Rate of Ray Search Optimization for Query-Efficient Hard-Label Attacks | arXiv: 2512.21241
- Improving Value-based Process Verifier via Low-Cost Variance Reduction | arXiv: 2508.10539
- In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback | arXiv: 2511.09865
- Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement | arXiv: 2511.16331
- Incremental Maintenance of DatalogMTL Materialisations | arXiv: 2511.12169
- Induce, Align, Predict: Zero-Shot Stance Detection via Cognitive Inductive Reasoning | arXiv: 2506.13470
- Inductive Generative Recommendation via Retrieval-based Speculation | arXiv: 2410.02939
- InEx: Hallucination Mitigation via Introspection and Cross-Modal Multi-Agent Collaboration | arXiv: 2512.02981
- Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models | arXiv: 2508.10030
- InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization | arXiv: 2508.05731
- Infinite-Story: A Training-Free Consistent Text-to-Image Generation | arXiv: 2511.13002
- InfoCLIP: Bridging Vision-Language Pretraining and Open-Vocabulary Semantic Segmentation via Information-Theoretic Alignment Transfer | arXiv: 2511.15967
- InfoCom: Kilobyte-Scale Communication-Efficient Collaborative Perception with Information-Aware Feature Compression | arXiv: 2512.10305
- InfoDecom: Decomposing Information for Defending Against Privacy Leakage in Split Inference | arXiv: 2511.13365
- Information Theoretic Optimal Surveillance for Epidemic Prevalence in Networks | arXiv: 2601.04267
- Instance Generation for Meta-Black-Box Optimization through Latent Space Reverse Engineering | arXiv: 2509.15810
- Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation | arXiv: 2512.14048
- Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation | arXiv: 2508.01742
- Intermediate N-Gramming: Deterministic and Fast N-Grams For Large N and Large Datasets | arXiv: 2511.14955
- InterMoE: Individual-Specific 3D Human Interaction Generation via Dynamic Temporal-Selective MoE | arXiv: 2511.13488
- Interpretable Reward Model via Sparse Autoencoder | arXiv: 2508.08746
- Interpreting Fedspeak with Confidence: A LLM-Based Uncertainty-Aware Framework Guided by Monetary Policy Transmission Paths | arXiv: 2508.08001
- Intervention Efficiency and Perturbation Validation Framework: Capacity-Aware and Robust Clinical Model Selection under the Rashomon Effect | arXiv: 2511.14317
- Intrinsic Barriers and Practical Pathways for Human-AI Alignment: An Agreement-Based Complexity Analysis | arXiv: 2502.05934
- Investigating Data Pruning for Pretraining Biological Foundation Models at Scale | arXiv: 2512.12932
- Invisible Triggers, Visible Threats! Road-Style Adversarial Creation Attack for Visual 3D Detection in Autonomous Driving | arXiv: 2511.08015
- IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization | arXiv: 2508.08719
- Is the Information Bottleneck Robust Enough? Towards Label-Noise Resistant Information Bottleneck Learning | arXiv: 2512.10573
- iSeal: Encrypted Fingerprinting for Reliable LLM Ownership Verification | arXiv: 2511.08905
- iTimER: Reconstruction Error-Guided Irregularly Sampled Time Series Representation Learning | arXiv: 2511.06854
- JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion | arXiv: 2512.13014
- Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction | arXiv: 2509.10798
- Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring | arXiv: 2511.07803
- Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search | arXiv: 2509.09245
- Just Few States are Enough: Randomized Sparse Feedback for Stability of Dynamical Systems | arXiv: 2511.13870
- KDR-Agent: A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval | arXiv: 2511.19083
- Kernelized Edge Attention: Addressing Semantic Attention Blurring in Temporal Graph Neural Networks | arXiv: 2602.00596
- KineST: A Kinematics-guided Spatiotemporal State Space Model for Human Motion Tracking from Sparse Signals | arXiv: 2512.16791
- Know your Trajectory -- Trustworthy Reinforcement Learning Deployment through Importance-Based Trajectory Analysis | arXiv: 2512.06917
- Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning | arXiv: 2511.21002
- Knowledge-Guided Masked Autoencoder with Linear Spectral Mixing and Spectral-Angle-Aware Reconstruction | arXiv: 2512.12445
- KTCF: Actionable Recourse in Knowledge Tracing via Counterfactual Explanations for Education | arXiv: 2601.09156
- KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache | arXiv: 2506.08018
- L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention | arXiv: 2511.17910
- LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward | arXiv: 2506.04070
- LAMP: Learning Universal Adversarial Perturbations for Multi-Image Tasks via Pre-trained Models | arXiv: 2601.21220
- LampQ: Towards Accurate Layer-wise Mixed Precision Quantization for Vision Transformers | arXiv: 2511.10004
- Language Model Distillation: A Temporal Difference Imitation Learning Perspective | arXiv: 2505.20335
- Language Models and Logic Programs for Trustworthy Tax Reasoning | arXiv: 2508.21051
- Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework | arXiv: 2511.13189
- Laytrol: Preserving Pretrained Knowledge in Layout Control for Multimodal Diffusion Transformers | arXiv: 2511.07934
- LeanRAG: Knowledge-Graph-Based Generation with Semantic Aggregation and Hierarchical Retrieval | arXiv: 2508.10391
- Learning Cell-Aware Hierarchical Multi-Modal Representations for Robust Molecular Modeling | arXiv: 2511.21120
- Learning Compact Latent Space for Representing Neural Signed Distance Functions with High-fidelity Geometry Details | arXiv: 2511.14539
- Learning Conjugate Direction Fields for Planar Quadrilateral Mesh Generation | arXiv: 2511.11865
- Learning Fair Representations with Kolmogorov-Arnold Networks | arXiv: 2511.11767
- Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting | arXiv: 2511.13052
- Learning Network Dismantling Without Handcrafted Inputs | arXiv: 2508.00706
- Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding | arXiv: 2511.20073
- Learning Spatial Decay for Vision Transformers | arXiv: 2508.09525
- Learning Subgroups with Maximum Treatment Effects without Causal Heuristics | arXiv: 2511.20189
- Learning Time in Static Classifiers | arXiv: 2511.12321
- Learning to Collaborate: An Orchestrated-Decentralized Framework for Peer-to-Peer Collaborative Learning | arXiv: 2601.17133
- Learning to Generate and Extract: A Multi-Agent Collaboration Framework for Zero-shot Document-level Event Arguments Extraction | arXiv: 2603.02909
- Learning to Tell Apart: Weakly Supervised Video Anomaly Detection via Disentangled Semantic Alignment | arXiv: 2511.10334
- Learning Topology-Driven Multi-Subspace Fusion for Grassmannian Deep Networks | arXiv: 2511.08628
- Learning with Preserving for Continual Multitask Learning | arXiv: 2511.11676
- Length-Adaptive Interest Network for Balancing Long and Short Sequence Modeling in CTR Prediction | arXiv: 2601.19142
- Let the Model Learn to Feel: Mode-Guided Tonality Injection for Symbolic Music Emotion Recognition | arXiv: 2512.17946
- Let the Void Be Void: Robust Open-Set Semi-Supervised Learning via Selective Non-Alignment | arXiv: 2504.12569
- Leveraging Textual Compositional Reasoning for Robust Change Captioning | arXiv: 2511.22903
- LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence | arXiv: 2603.01651
- LiDAR-GS++: Improving LiDAR Gaussian Reconstruction via Diffusion Priors | arXiv: 2511.12304
- LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences | arXiv: 2508.03692
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models | arXiv: 2603.06874
- Life, Machine Learning, and the Search for Habitability: Predicting Biosignature Fluxes for the Habitable Worlds Observatory | arXiv: 2601.12557
- Lifelong Domain Adaptive 3D Human Pose Estimation | arXiv: 2512.23860
- Lightweight Optimal-Transport Harmonization on Edge Devices | arXiv: 2511.12785
- LILAD: Learning In-context Lyapunov-stable Adaptive Dynamics Models | arXiv: 2511.21846
- LiNeXt: Revisiting LiDAR Completion with Efficient Non-Diffusion Architectures | arXiv: 2511.10209
- Listen Like a Teacher: Mitigating Whisper Hallucinations using Adaptive Layer Attention and Knowledge Distillation | arXiv: 2511.14219
- Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models | arXiv: 2511.11039
- LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding | arXiv: 2601.15016
- LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval | arXiv: 2603.02888
- LLM Circuit Analyses Are Consistent Across Training and Scale | arXiv: 2407.10827
- LLM Targeted Underperformance Disproportionately Impacts Vulnerable Users | arXiv: 2406.17737
- LLM-as-a-Judge for Scalable Test Coverage Evaluation | arXiv: 2512.01232
- LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction | arXiv: 2512.18623
- LLMC+: Benchmarking Vision-Language Model Compression with a Plug-and-play Toolkit | arXiv: 2508.09981
- LLMs for Game Theory: Entropy-Guided In-Context Learning and Adaptive CoT Reasoning | arXiv: 2601.10775
- LLMTM: Benchmarking and Optimizing LLMs for Temporal Motif Analysis in Dynamic Graphs | arXiv: 2512.22266
- Local Guidance for Configuration-Based Multi-Agent Pathfinding | arXiv: 2510.19072
- Logical Characterizations of GNNs with Mean Aggregation | arXiv: 2507.18145
- LoKI: Low-damage Knowledge Implanting of Large Language Models | arXiv: 2505.22120
- LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs | arXiv: 2506.14429
- LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations | arXiv: 2512.09271
- LOOM: Personalized Learning Informed by Daily LLM Conversations Toward Long-Term Mastery via a Dynamic Learner Memory Graph | arXiv: 2511.21037
- LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation | arXiv: 2511.07876
- LoReTTA: A Low Resource Framework To Poison Continuous Time Dynamic Graphs | arXiv: 2511.07379
- Loss-Guided Auxiliary Agents for Overcoming Mode Collapse in GFlowNets | arXiv: 2505.15251
- Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory | arXiv: 2505.15055
- Lost in Time? A Meta-Learning Framework for Time-Shift-Tolerant Physiological Signal Transformation | arXiv: 2511.21500
- Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms | arXiv: 2602.07963
- Low-Rank Curvature for Zeroth-Order Optimization in LLM Fine-Tuning | arXiv: 2511.07971
- LUCID: Learning-Enabled Uncertainty-Aware Certification of Stochastic Dynamical Systems | arXiv: 2512.11750
- LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules | arXiv: 2511.21042
- LWGANet: Addressing Spatial and Channel Redundancy in Remote Sensing Visual Tasks with Light-Weight Grouped Attention | arXiv: 2501.10040
- M2FMoE: Multi-Resolution Multi-View Frequency Mixture-of-Experts for Extreme-Adaptive Time Series Forecasting | arXiv: 2601.08631
- M3SR: Multi-Scale Multi-Perceptual Mamba for Efficient Spectral Reconstruction | arXiv: 2601.08293
- Machine Learning for Sustainable Rice Production: Region-Scale Monitoring of Water-Saving Practices in Punjab, India | arXiv: 2507.08605
- MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models | arXiv: 2601.07141
- MACS: Multi-source Audio-to-Image Generation with Contextual Significance and Semantic Alignment | arXiv: 2503.10287
- MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering | arXiv: 2601.01926
- Magnitude Matters: A Superior Class of Similarity Metrics for Holistic Semantic Understanding | arXiv: 2509.19323
- Magnitude-Modulated Equivariant Adapter for Parameter-Efficient Fine-Tuning of Equivariant Graph Neural Networks | arXiv: 2511.06696
- MAISI-v2: Accelerated 3D High-Resolution Medical Image Synthesis with Rectified Flow and Region-specific Contrastive Loss | arXiv: 2508.05772
- MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes | arXiv: 2512.25015
- MambaMia: State-Space Hierarchical Compression for Hour-Long Video Understanding in Large Multimodal Models | arXiv: 2506.13564
- MambaSeg: Harnessing Mamba for Accurate and Efficient Image-Event Semantic Segmentation | arXiv: 2512.24243
- ManiLong-Shot: Interaction-Aware One-Shot Imitation Learning for Long-Horizon Manipulation | arXiv: 2512.16302
- MAPI-GNN: Multi-Activation Plane Interaction Graph Neural Network for Multimodal Medical Diagnosis | arXiv: 2512.20026
- MAPS: Multi-Agent Personality Shaping for Collaborative Reasoning | arXiv: 2503.16905
- Margin-aware Preference Optimization for Aligning Diffusion Models without Reference | arXiv: 2406.06424
- MARS: A Meta-Adaptive Reinforcement Learning Framework for Risk-Aware Multi-Agent Portfolio Management | arXiv: 2508.01173
- MARS: Multi-Agent Adaptive Reasoning with Socratic Guidance for Automated Prompt Optimization | arXiv: 2503.16874
- Mask the Redundancy: Evolving Masking Representation Learning for Multivariate Time-Series Clustering | arXiv: 2511.17008
- Mask2IV: Interaction-Centric Video Generation via Mask Trajectories | arXiv: 2510.03135
- Mass Concept Erasure in Diffusion Models with Concept Hierarchy | arXiv: 2601.03305
- MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy | arXiv: 2508.05592
- Matrix-Free Two-to-Infinity and One-to-Two Norms Estimation | arXiv: 2508.04444
- MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering | arXiv: 2511.12142
- MCMoE: Completing Missing Modalities with Mixture of Experts for Incomplete Multimodal Action Quality Assessment | arXiv: 2511.17397
- MCTS-SQL: Light-Weight LLMs can Master the Text-to-SQL through Monte Carlo Tree Search | arXiv: 2501.16607
- MCTSr-Zero: Self-Reflective Psychological Counseling Dialogues Generation via Principles and Adaptive Exploration | arXiv: 2505.23229
- MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics | arXiv: 2511.12525
- MDiff4STR: Mask Diffusion Model for Scene Text Recognition | arXiv: 2512.01422
- Measuring Model Performance in the Presence of an Intervention | arXiv: 2511.05805
- Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology | arXiv: 2601.11567
- MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis | arXiv: 2511.22018
- MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models | arXiv: 2509.23725
- Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models | arXiv: 2511.08252
- Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction | arXiv: 2511.13410
- MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging | arXiv: 2511.14806
- MeshA*: Efficient Path Planning With Motion Primitives | arXiv: 2412.10320
- MeshSplat: Generalizable Sparse-View Surface Reconstruction via Gaussian Splatting | arXiv: 2508.17811
- Meta Dynamic Graph for Traffic Flow Prediction | arXiv: 2601.10328
- MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization | arXiv: 2511.12113
- MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement | arXiv: 2511.12074
- MFmamba: A Multi-function Network for Panchromatic Image Resolution Restoration Based on State-Space Model | arXiv: 2511.18888
- MicroEvoEval: A Systematic Evaluation Framework for Image-Based Microstructure Evolution Prediction | arXiv: 2511.08955
- MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis | arXiv: 2505.17671
- MindCross: Fast New Subject Adaptation with Limited Data for Cross-subject Video Reconstruction from Brain Signals | arXiv: 2511.14196
- MindVote: When AI Meets the Wild West of Social Media Opinion | arXiv: 2505.14422
- Minimizing Inequity in Facility Location Games | arXiv: 2602.01048
- Minimum-Cost Network Flow with Dual Predictions | arXiv: 2601.20203
- MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains | arXiv: 2508.18260
- MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging | arXiv: 2511.10013
- Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering | arXiv: 2505.12189
- Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints | arXiv: 2511.10076
- Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution | arXiv: 2511.16024
- MMhops-R1: Multimodal Multi-hop Reasoning | arXiv: 2512.13573
- mmPred: Radar-based Human Motion Prediction in the Dark | arXiv: 2512.00345
- MOBA: A Material-Oriented Backdoor Attack against LiDAR-based 3D Object Detection | arXiv: 2511.09999
- MoBGS: Motion Deblurring Dynamic 3D Gaussian Splatting for Blurry Monocular Video | arXiv: 2504.15122
- Modality-Aware Bias Mitigation and Invariance Learning for Unsupervised Visible-Infrared Person Re-Identification | arXiv: 2512.07760
- Model Change for Description Logic Concepts | arXiv: 2603.05562
- Model Counting for Dependency Quantified Boolean Formulas | arXiv: 2511.07337
- Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior | arXiv: 2506.20606
- Modelling the Effects of Hearing Loss on Neural Coding in the Auditory Midbrain with Variational Conditioning | arXiv: 2506.03088
- MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm | arXiv: 2511.13760
- MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation | arXiv: 2512.22310
- MonoCLUE: Object-Aware Clustering Enhances Monocular 3D Object Detection | arXiv: 2511.07862
- Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback | arXiv: 2511.10032
- MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning | arXiv: 2511.12271
- More Than Irrational: Modeling Belief-Biased Agents | arXiv: 2511.12359
- MoSE: Hierarchical Self-Distillation Enhances Early Layer Embeddings | arXiv: 2503.03008
- MOTIF: Multi-strategy Optimization via Turn-based Interactive Framework | arXiv: 2508.03929
- MotionCharacter: Fine-Grained Motion Controllable Human Video Generation | arXiv: 2411.18281
- MoToRec: Sparse-Regularized Multimodal Tokenization for Cold-Start Recommendation | arXiv: 2602.11062
- MovSemCL: Movement-Semantics Contrastive Learning for Trajectory Similarity (Extension) | arXiv: 2511.12061
- MP1: MeanFlow Tames Policy Learning in 1-step for Robotic Manipulation | arXiv: 2507.10543
- MPA: Multimodal Prototype Augmentation for Few-Shot Learning | arXiv: 2602.10143
- MPD-SGR: Robust Spiking Neural Networks with Membrane Potential Distribution-Driven Surrogate Gradient Regularization | arXiv: 2511.12199
- MR-CoSMo: Visual-Text Memory Recall and Direct Cross-Modal Alignment Method for Query-Driven 3D Segmentation | arXiv: 2506.20991
- MUG: Meta-path-aware Universal Heterogeneous Graph Pre-Training | arXiv: 2602.22645
- MUG: Multi-agent Undercover Gaming — Hallucination Removal via Counterfactual Test for Multimodal Reasoning | arXiv: 2511.11182
- Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection | arXiv: 2511.13759
- Multi-Aspect Cross-modal Quantization for Generative Recommendation | arXiv: 2511.15122
- Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models | arXiv: 2511.16110
- Multi-granularity Interactive Attention Framework for Residual Hierarchical Pronunciation Assessment | arXiv: 2601.01745
- Multi-Metric Preference Alignment for Generative Speech Restoration | arXiv: 2508.17229
- Multi-Modal Assistance for Unsupervised Domain Adaptation on Point Cloud 3D Object Detection | arXiv: 2511.07966
- Multi-modal Dynamic Proxy Learning for Personalized Multiple Clustering | arXiv: 2511.07274
- Multigranular Evaluation for Brain Visual Decoding | arXiv: 2507.07993
- Multimodal Data Fusion to Capture Dynamic Interactions between Built Environment and Vulnerable Older Adults | arXiv: 2601.11545
- Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework | arXiv: 2506.02454
- Multiplicative Orthogonal Sequential Editing for Language Models (MOSE) | arXiv: 2601.07873
- MultiTab: A Scalable Foundation for Multitask Learning on Tabular Data | arXiv: 2511.09970
- Multivariate Gaussian Representation Learning for Medical Action Evaluation | arXiv: 2511.10060
- MVGD-Net: A Novel Motion-aware Video Glass Surface Detection Network | arXiv: 2601.13715
- MyGram: Modality-aware Graph Transformer with Global Distribution for Multi-modal Entity Alignment | arXiv: 2601.11885
- N2N-GQA: Noise-to-Narrative for Graph-Based Table-Text Question Answering Using LLMs | arXiv: 2601.06603
- NADIR: Differential Attention Flow for Non-Autoregressive Transliteration in Indic Languages | arXiv: 2601.12389
- Neighbor-aware Instance Refining with Noisy Labels for Cross-Modal Retrieval | arXiv: 2512.24064
- NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models | arXiv: 2512.07218
- Neural Bandit Based Optimal LLM Selection for a Pipeline of Tasks | arXiv: 2508.09958
- Neural Graph Navigation for Intelligent Subgraph Matching | arXiv: 2511.17939
- NeuroBridge: Bio-Inspired Self-Supervised EEG-to-Image Decoding via Cognitive Priors and Bidirectional Semantic Alignment | arXiv: 2511.06836
- New Synthetic Goldmine: Hand Joint Angle-Driven EMG Data Generation Framework for Micro-Gesture Recognition | arXiv: 2509.23359
- No-Regret Strategy Solving in Imperfect-Information Games via Pre-Trained Embedding | arXiv: 2511.12083
- NOTAM-Evolve: A Knowledge-Guided Self-Evolving Optimization Framework with LLMs for NOTAM Interpretation | arXiv: 2511.07982
- Note2Chat: Improving LLMs for Multi-Turn Clinical History Taking Using Medical Notes | arXiv: 2601.21551
- NTSFormer: A Self-Teaching Graph Transformer for Multimodal Isolated Cold-Start Node Classification | arXiv: 2507.04870
- NURBGen: High-Fidelity Text-to-CAD Generation through LLM-Driven NURBS Modeling | arXiv: 2511.06194
- NutriScreener: Retrieval-Augmented Multi-Pose Graph Attention Network for Malnourishment Screening | arXiv: 2511.16566
- O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model | arXiv: 2511.14368
- OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description | arXiv: 2511.12131
- Object-Centric Latent Action Learning | arXiv: 2502.09680
- Object-Centric World Models for Causality-Aware Reinforcement Learning | arXiv: 2511.14262
- OceanSplat: Object-aware Gaussian Splatting with Trinocular View Consistency for Underwater Scene Reconstruction | arXiv: 2601.04984
- OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive | arXiv: 2511.09914
- OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding | arXiv: 2511.17053
- OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding | arXiv: 2504.10825
- On Stealing Graph Neural Network Models | arXiv: 2511.07170
- On the Edge of Core (Non-)Emptiness: An Automated Reasoning Approach to Approval-Based Multi-Winner Voting | arXiv: 2512.16895
- On the Exponential Convergence for Offline RLHF with Pairwise Comparisons | arXiv: 2406.12205
- On the Information Processing of One-Dimensional Wasserstein Distances with Finite Samples | arXiv: 2511.12881
- On the Learning Dynamics of Two-Layer Linear Networks with Label Noise SGD | arXiv: 2603.10397
- On the Variability of Concept Activation Vectors | arXiv: 2509.24058
- One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow | arXiv: 2511.13035
- Online Linear Regression with Paid Stochastic Features | arXiv: 2511.08073
- Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning | arXiv: 2511.05894
- OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding | arXiv: 2408.11030
- OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval | arXiv: 2508.16438
- Opt3DGS: Optimizing 3D Gaussian Splatting with Adaptive Exploration and Curvature-Aware Exploitation | arXiv: 2511.13571
- Optimal Look-back Horizon for Time Series Forecasting in Federated Learning | arXiv: 2511.12791
- Optimal Welfare in Noncooperative Network Formation under Attack | arXiv: 2511.10845
- Optimized Algorithms for Text Clustering with LLM-Generated Constraints | arXiv: 2601.11118
- OptScale: Probabilistic Optimality for Inference-time Scaling | arXiv: 2506.22376
- OR-R1: Automating Modeling and Solving of Operations Research Optimization Problems | arXiv: 2511.09092
- ORVIT: Near-Optimal Online Distributionally Robust Reinforcement Learning | arXiv: 2508.03768
- Otter: Mitigating Background Distractions of Wide-Angle Few-Shot Action Recognition with Enhanced RWKV | arXiv: 2511.06741
- PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning | arXiv: 2511.17927
- PADiff: Predictive and Adaptive Diffusion Policies for Ad Hoc Teamwork | arXiv: 2511.07260
- Pairing-free Group-level Knowledge Distillation for Robust Gastrointestinal Lesion Classification in White-Light Endoscopy | arXiv: 2601.09209
- PANDA: Patch and Distribution-Aware Augmentation for Long-Tailed Exemplar-Free Continual Learning | arXiv: 2511.09791
- Panda: Test-Time Adaptation with Negative Data Augmentation | arXiv: 2511.10481
- PanFoMa: A Lightweight Foundation Model and Benchmark for Pan-Cancer Pathology Image Analysis | arXiv: 2512.03111
- PanoNav: Mapless Zero-Shot Object Navigation with Panoramic Scene Parsing and Dynamic Memory | arXiv: 2511.06840
- Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems | arXiv: 2507.17061
- ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations | arXiv: 2601.12289
- Parameter-Free Fine-tuning via Redundancy Elimination for Vision Foundation Models | arXiv: 2504.08915
- Parameterized Approximation Algorithms for TSP on Non-Metric Graphs | arXiv: 2503.03642
- Parametric Pareto Set Learning for Expensive Multi-Objective Optimization | arXiv: 2511.05815
- Parametrized Multi-Agent Routing via Deep Attention Models | arXiv: 2507.22338
- ParaRevSNN: A Parallel Reversible Spiking Neural Network for Efficient Training and Inference | arXiv: 2508.01223
- Pareto-Grid-Guided Large Language Models for Fast and High-Quality Heuristics Design in Multi-Objective Combinatorial Optimization | arXiv: 2507.20923
- ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models Using Pareto High-Quality Data | arXiv: 2504.16628
- Partial Action Replacement: Tackling Distribution Shift in Offline MARL | arXiv: 2511.07629
- Partially Shared Concept Bottleneck Models | arXiv: 2511.22170
- PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement | arXiv: 2511.13300
- PaSE: Prototype-aligned Calibration and Shapley-based Equilibrium for Multimodal Sentiment Analysis | arXiv: 2511.17585
- PathMind: A Retrieve-Prioritize-Reason Framework for Knowledge Graph Reasoning with Large Language Models | arXiv: 2511.14256
- PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis | arXiv: 2601.10945
- Pb4U-GNet: Resolution-Adaptive Garment Simulation via Propagation-before-Update Graph Network | arXiv: 2601.15110
- PCoKG: Personality-aware Commonsense Reasoning with Debate | arXiv: 2601.06234
- PEOAT: Personalization-Guided Evolutionary Question Assembly for One-Shot Adaptive Testing | arXiv: 2512.00439
- Perceive, Act and Correct: Confidence Is Not Enough for Hyperspectral Classification | arXiv: 2511.10068
- PERSIST: Persistent Instability in LLM's Personality Measurements | arXiv: 2508.04826
- Personality-guided Public-Private Domain Disentangled Hypergraph-Former Network for Multimodal Depression Detection | arXiv: 2511.12460
- Personalization of Large Foundation Models for Health Interventions | arXiv: 2601.03482
- Perspective from a Broader Context: Can Room Style Knowledge Help Visual Floorplan Localization? | arXiv: 2508.01216
- PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching | arXiv: 2511.12998
- Perturb Your Data: Paraphrase-Guided Training Data Watermarking | arXiv: 2512.17075
- Perturbing Best Responses in Zero-Sum Games | arXiv: 2511.12523
- PET2Rep: Towards Vision-Language Model-Driven Automated Radiology Report Generation for Positron Emission Tomography | arXiv: 2508.04062
- PFAvatar: Pose-Fusion 3D Personalized Avatar Reconstruction from Real-World Outfit-of-the-Day Photos | arXiv: 2511.12935
- pFed1BS: Personalized Federated Learning with Bidirectional Communication Compression via One-Bit Random Sketching | arXiv: 2511.13144
- Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks | arXiv: 2511.10008
- Pharos-ESG: A Framework for Multimodal Parsing, Contextual Narration, and Hierarchical Labeling of ESG Reports | arXiv: 2511.16417
- Phased One-Step Adversarial Equilibrium for Video Diffusion Models | arXiv: 2508.21019
- Phys-Liquid: A Physics-Informed Dataset for Estimating 3D Geometry and Volume of Transparent Deformable Liquids | arXiv: 2511.11077
- Physics-Informed Autonomous LLM Agents for Explainable Power Electronics Modulation Design | arXiv: 2411.14214
- Physics-Informed Deformable Gaussian Splatting: Towards Unified Constitutive Laws for Time-Evolving Material Field | arXiv: 2511.06299
- PhysicsCorrect: A Training-Free Approach for Stable Neural PDE Simulations | arXiv: 2507.02227
- PIMRL: Physics-Informed Multi-Scale Recurrent Learning for Burst-Sampled Spatiotemporal Dynamics | arXiv: 2503.10253
- PINGS-X: Physics-Informed Normalized Gaussian Splatting with Axes Alignment for Efficient Super-Resolution of 4D Flow MRI | arXiv: 2511.11048
- PIPHEN: Physical Interaction Prediction with Hamiltonian Energy Networks | arXiv: 2511.16200
- PlantTraitNet: An Uncertainty-Aware Multimodal Framework for Global-Scale Plant Trait Inference from Citizen Science Data | arXiv: 2511.06943
- Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback | arXiv: 2510.12089
- Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation | arXiv: 2511.08971
- Plug-and-Play Parameter-Efficient Tuning of Embeddings for Federated Recommendation | arXiv: 2512.13734
- PlugTrack: Multi-Perceptive Motion Analysis for Adaptive Fusion in Multi-Object Tracking | arXiv: 2511.13105
- PocketLLM: Ultimate Compression of Large Language Models via Meta Networks | arXiv: 2511.17637
- Point Cloud Quantization through Multimodal Prompting for 3D Understanding | arXiv: 2511.12079
- Point-SRA: Self-Representation Alignment for 3D Representation Learning | arXiv: 2601.01746
- Position on LLM-Assisted Peer Review: Addressing Reviewer Gap through Mentoring and Feedback | arXiv: 2601.09182
- Positional Bias in Multimodal Embedding Models: Do They Favor the Beginning, the Middle, or the End? | arXiv: 2511.11216
- Post Training Quantization for Efficient Dataset Condensation | arXiv: 2603.13346
- Posterior Label Smoothing for Node Classification | arXiv: 2406.00410
- PragWorld: A Benchmark Evaluating LLMs' Local World Model under Minimal Linguistic Alterations and Conversational Dynamics | arXiv: 2511.13021
- PRECISE: Reducing the Bias of LLM Evaluations Using Prediction-Powered Ranking Estimation | arXiv: 2601.18777
- Predict and Resist: Long-Term Accident Anticipation under Sensor Noise | arXiv: 2511.08640
- Predicting the Future by Retrieving the Past | arXiv: 2511.05859
- Predicting Video Slot Attention Queries from Random Slot-Feature Pairs | arXiv: 2508.01345
- Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback | arXiv: 2511.09047
- PrefixGPT: Prefix Adder Optimization by a Generative Pre-trained Transformer | arXiv: 2511.19472
- PressTrack-HMR: Pressure-Based Top-Down Multi-Person Global Human Mesh Recovery | arXiv: 2511.09147
- PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning | arXiv: 2509.22315
- Principles2Plan: LLM-Guided System for Operationalising Ethical Principles into Plans | arXiv: 2512.08536
- PriorDrive: Enhancing Online HD Map Construction with Unified Vector Priors | arXiv: 2409.05352
- PriorRG: Prior-Guided Contrastive Pre-training and Coarse-to-Fine Decoding for Chest X-ray Report Generation | arXiv: 2508.05353
- PRISM: Privacy-Aware Routing for Adaptive Cloud-Edge LLM Inference via Semantic Sketch Collaboration | arXiv: 2511.22788
- Privacy Auditing of Multi-Domain Graph Pre-Trained Model under Membership Inference Attack | arXiv: 2511.17989
- Privacy on the Fly: A Predictive Adversarial Transformation Network for Mobile Sensor Data | arXiv: 2511.07242
- Privacy-protected Retrieval-Augmented Generation for Knowledge Graph Question Answering | arXiv: 2508.08785
- Private Frequency Estimation via Residue Number Systems | arXiv: 2511.11569
- Probabilistic Hash Embeddings for Online Learning of Categorical Features | arXiv: 2511.20893
- ProBench: Benchmarking GUI Agents with Accurate Process Information | arXiv: 2511.09157
- ProbFM: Probabilistic Time Series Foundation Model with Uncertainty Decomposition | arXiv: 2601.10591
- Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models | arXiv: 2511.12464
- ProbLog4Fairness: A Neurosymbolic Approach to Modeling and Mitigating Bias | arXiv: 2511.09768
- ProCache: Constraint-Aware Feature Caching with Selective Computation for Diffusion Transformer Acceleration | arXiv: 2512.17298
- ProFuser: Progressive Fusion of Large Language Models | arXiv: 2408.04998
- Promoting Sustainable Web Agents: Benchmarking and Estimating Energy Consumption Through Empirical and Theoretical Analysis | arXiv: 2511.04481
- PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixing of Experts | arXiv: 2511.18116
- ProPL: Universal Semi-Supervised Ultrasound Image Segmentation via Prompt-Guided Pseudo-Labeling | arXiv: 2511.15057
- Prototype-Based Semantic Consistency Alignment for Domain Adaptive Retrieval | arXiv: 2512.04524
- ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders | arXiv: 2509.05309
- Provably Data-Driven Projection Method for Quadratic Programming | arXiv: 2509.04524
- Provably Efficient Multi-Objective Bandit Algorithms under Preference-Centric Customization | arXiv: 2502.13457
- Provably Minimum-Length Conformal Prediction Sets for Ordinal Classification | arXiv: 2511.16845
- Prune4Web: DOM Tree Pruning Programming for Web Agent | arXiv: 2511.21398
- PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis | arXiv: 2512.01442
- PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization | arXiv: 2511.16209
- PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis | arXiv: 2601.07344
- Put the Space of LoRA Initialization to the Extreme to Preserve Pre-trained Knowledge | arXiv: 2503.02659
- Q-FSRU: Quantum-Augmented Frequency-Spectral Fusion for Medical Visual Question Answering | arXiv: 2508.12036
- qa-FLoRA: Data-free Query-Adaptive Fusion of LoRAs for LLMs | arXiv: 2512.11366
- QGShap: Quantum Acceleration for Faithful GNN Explanations | arXiv: 2512.03099
- QiMeng-Kernel: Macro-Thinking Micro-Coding Paradigm for LLM-Based High-Performance GPU Kernel Generation | arXiv: 2511.20100
- Quantifying Conversational Reliability of Large Language Models under Multi-Turn Interaction | arXiv: 2603.01423
- QuantVSR: Low-Bit Post-Training Quantization for Real-World Video Super-Resolution | arXiv: 2508.04485
- QuEPT: Quantized Elastic Precision Transformers with One-Shot Calibration for Multi-Bit Switching | arXiv: 2602.12609
- Quiet Feature Learning in Algorithmic Tasks | arXiv: 2505.03997
- R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios | arXiv: 2511.16901
- RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket Analysis | arXiv: 2511.17045
- Radar-APLANC: Unsupervised Radar-based Heartbeat Sensing via Augmented Pseudo-Label and Noise Contrast | arXiv: 2511.08071
- RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence | arXiv: 2504.09862
- RadarMP: Motion Perception for 4D mmWave Radar in Autonomous Driving | arXiv: 2511.12117
- Radiation-Preserving Selective Imaging for Pediatric Hip Dysplasia: A Cross-Modal Approach | arXiv: 2511.18457
- RAGFort: Dual-Path Defense Against Proprietary Knowledge Base Extraction in Retrieval-Augmented Generation | arXiv: 2511.10128
- RAST: A Retrieval Augmented Spatio-Temporal Framework for Traffic Prediction | arXiv: 2508.16623
- RcAE: Recursive Reconstruction Framework for Unsupervised Industrial Anomaly Detection | arXiv: 2512.11284
- Real-Time 3D Object Detection with Inference-Aligned Learning | arXiv: 2511.16140
- Real-Time Trust Verification for Safe Agentic Actions Using TrustBench | arXiv: 2603.09157
- ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment | arXiv: 2511.19217
- Realism Control One-step Diffusion for Real-World Image Super-Resolution | arXiv: 2509.10122
- Realistic Curriculum Reinforcement Learning for Autonomous and Sustainable Marine Vessel Navigation | arXiv: 2601.10911
- Realistic Face Reconstruction from Facial Embeddings via Diffusion Models | arXiv: 2602.13168
- Realistic Synthetic Household Data Generation at Scale | arXiv: 2602.07243
- REAP: Enhancing RAG with Recursive Evaluation and Adaptive Planning for Multi-Hop Question Answering | arXiv: 2511.09966
- ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding | arXiv: 2511.12530
- Reasoning About the Unsaid: Misinformation Detection with Omission-Aware Graph Inference | arXiv: 2512.01728
- Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination | arXiv: 2507.10532
- Reasoning with Exploration: An Entropy Perspective | arXiv: 2506.14758
- ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models | arXiv: 2512.06328
- ReCast: Reliability-aware Codebook Assisted Lightweight Time Series Forecasting | arXiv: 2511.11991
- ReCode: Updating Code API Knowledge with Reinforcement Learning | arXiv: 2506.20495
- ReCoN-Ipsundrum: An Inspectable Recurrent Persistence Loop Agent with Affect-Coupled Cognition | arXiv: 2602.23232
- Rectification Reimagined: A Unified Mamba Model for Image Correction and Rectangling with Prompts | arXiv: 2512.18718
- Rectified Noise: A Generative Model Using Positive-incentive Noise | arXiv: 2511.07911
- RecToM: A Benchmark for Evaluating Machine Theory of Mind in LLM-based Conversational Recommender Systems | arXiv: 2511.22275
- Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation | arXiv: 2507.21450
- Reducing the Scope of Language Models | arXiv: 2410.21597
- Redundant Queries in DETR-Based 3D Detection: Unnecessary and Prunable | arXiv: 2412.02054
- ReFeed: Retrieval Feedback-Guided Dataset Construction for Style-Aware Query Rewriting | arXiv: 2603.01417
- Reference Recommendation based Membership Inference Attack against Hybrid-based Recommender Systems | arXiv: 2512.09442
- RefiDiff: Progressive Refinement Diffusion for Efficient Missing Data Imputation | arXiv: 2505.14451
- Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA | arXiv: 2511.11169
- RefineVAD: Semantic-Guided Feature Recalibration for Weakly Supervised Video Anomaly Detection | arXiv: 2511.13204
- Reflection-Driven Control for Trustworthy Code Agents | arXiv: 2512.21354
- ReflexDiffusion: Reflexion-Enhanced Trajectory Planning for High Lateral Acceleration in Autonomous Driving | arXiv: 2601.09377
- ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India | arXiv: 2512.18014
- RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service | arXiv: 2511.13329
- Regular Games – an Automata-Based General Game Playing Language | arXiv: 2511.10593
- Reimagining Anomalies: What if Anomalies Were Normal? | arXiv: 2402.14469
- REINA: Regularized Entropy Information-Based Loss for Efficient Simultaneous Speech Translation | arXiv: 2508.04946
- Reinforced Rate Control for Neural Video Compression via Inter-Frame Rate-Distortion Awareness | arXiv: 2601.19293
- RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers | arXiv: 2502.14377
- Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension | arXiv: 2504.14642
- Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG | arXiv: 2601.07192
- Remember Me: Bridging the Long-Range Gap in LVLMs with Three-Step Inference-Only Decay Resilience Strategies | arXiv: 2511.09868
- RENEW: Risk- and Energy-Aware Navigation in Dynamic Waterways | arXiv: 2601.16424
- Renormalization Group Guided Tensor Network Structure Search | arXiv: 2512.24663
- Resource Efficient Sleep Staging via Multi-Level Masking and Prompt Learning | arXiv: 2511.06785
- Rethinking Bias in Generative Data Augmentation for Medical AI: a Frequency Recalibration Approach | arXiv: 2511.12301
- Rethinking Direct Preference Optimization in Diffusion Models | arXiv: 2505.18736
- Rethinking Flow and Diffusion Bridge Models for Speech Enhancement | arXiv: 2602.18355
- Rethinking Long-tailed Dataset Distillation: A Uni-Level Framework with Unbiased Recovery and Relabeling | arXiv: 2511.18858
- Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective | arXiv: 2511.12170
- Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective | arXiv: 2511.11478
- Rethinking Rainy 3D Scene Reconstruction via Perspective Transforming and Brightness Tuning | arXiv: 2511.06734
- Rethinking Surgical Smoke: A Smoke-Type-Aware Laparoscopic Video Desmoking Method and Dataset | arXiv: 2512.02780
- Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach | arXiv: 2504.14137
- Rethinking the Spatio-Temporal Alignment of End-to-End 3D Perception | arXiv: 2512.23635
- Rethinking Visual Token Reduction in LVLMs under Cross-Modal Misalignment | arXiv: 2506.22283
- Retrieving Objects from 3D Scenes with Box-Guided Open-Vocabulary Instance Segmentation | arXiv: 2512.19088
- RetrySQL: Text-to-SQL Training with Retry Data for Self-Correcting Query Generation | arXiv: 2507.02529
- Revealing POMDPs: Qualitative and Quantitative Analysis for Parity Objectives | arXiv: 2511.13134
- Revisiting (Un)Fairness in Recourse by Minimizing Worst-Case Social Burden | arXiv: 2509.04128
- Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View | arXiv: 2511.06722
- Revitalizing Canonical Pre-Alignment for Irregular Multivariate Time Series Forecasting | arXiv: 2508.01971
- Reward Redistribution via Gaussian Process Likelihood Estimation | arXiv: 2503.17409
- REXO: Indoor Multi-View Radar Object Detection via 3D Bounding Box Diffusion | arXiv: 2511.17806
- RFKG-CoT: Relation-Driven Adaptive Hop-count Selection and Few-Shot Path Guidance for Knowledge-Aware QA | arXiv: 2512.15219
- Right Looks, Wrong Reasons: Compositional Fidelity in Text-to-Image Generation | arXiv: 2511.10136
- Risk-Sensitive Exponential Actor Critic | arXiv: 2602.07202
- RLSLM: A Hybrid Reinforcement Learning Framework Aligning Rule-Based Social Locomotion Model with Human Social Norms | arXiv: 2511.11323
- RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models (Oral) | arXiv: 2512.06811
- RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System | arXiv: 2511.18286
- Robust Long-term Test-Time Adaptation for 3D Human Pose Estimation through Motion Discretization | arXiv: 2511.18851
- Robust Out-of-Order Retrieval for Grid-Based Storage at Maximum Capacity | arXiv: 2601.19144
- Robust Tabular Foundation Models | arXiv: 2512.03307
- Robust Watermarking on Gradient Boosting Decision Trees | arXiv: 2511.09822
- RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation | arXiv: 2511.19895
- RRRA: Resampling and Reranking through a Retriever Adapter | arXiv: 2508.11670
- RS2-SAM2: Customized SAM2 for Referring Remote Sensing Image Segmentation | arXiv: 2503.07266
- RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images | arXiv: 2509.18711
- RTGaze: Real-Time 3D-Aware Gaze Redirection from a Single Image | arXiv: 2511.11289
- S-DAG: A Subject-Based Directed Acyclic Graph for Multi-Agent Heterogeneous Reasoning | arXiv: 2511.06727
- S2Drug: Bridging Protein Sequence and 3D Structure in Contrastive Representation Learning for Virtual Screening | arXiv: 2511.07006
- S5: Scalable Semi-Supervised Semantic Segmentation in Remote Sensing | arXiv: 2508.12409
- SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories | arXiv: 2511.08136
- SafeNlidb: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces | arXiv: 2511.06778
- SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge | arXiv: 2511.16743
- SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication | arXiv: 2508.11733
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation | arXiv: 2508.13866
- SAGE: Spuriousness-Aware Guided Prompt Exploration for Mitigating Multimodal Bias | arXiv: 2511.13005
- SAM-DAQ: Segment Anything Model with Depth-guided Adaptive Queries for RGB-D Video Salient Object Detection | arXiv: 2511.09870
- SAML: A Differentiable Semantic Meta-Learning Framework for Long-Tail Motion Prediction | arXiv: 2511.06649
- Sampling Control for Imbalanced Calibration in Semi-Supervised Learning | arXiv: 2511.18773
- SAOT: An Enhanced Locality-Aware Spectral Transformer for Solving PDEs | arXiv: 2511.18777
- SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger | arXiv: 2601.20312
- SAQ-SAM: Semantically-Aligned Quantization for Segment Anything Model | arXiv: 2503.06515
- SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension | arXiv: 2512.00582
- Satisficing and Optimal Generalised Planning via Goal Regression (Extended Version) | arXiv: 2511.11095
- Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding | arXiv: 2509.04685
- Scalable and Accurate Graph Reasoning with LLM-Based Multi-Agents | arXiv: 2410.05130
- Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation | arXiv: 2511.12779
- Scalable Vision-Guided Crop Yield Estimation | arXiv: 2511.12999
- SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling | arXiv: 2512.00466
- Scaling and Transferability of Annealing Strategies in Large Language Model Training | arXiv: 2512.13705
- Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents | arXiv: 2511.11772
- Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios | arXiv: 2511.20340
- SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation | arXiv: 2508.06194
- Scientific Knowledge-Guided Machine Learning for Vessel Power Prediction: A Comparative Study | arXiv: 2602.18403
- SCoPe: Intrinsic Semantic Space Control for Mitigating Copyright Infringement in LLMs | arXiv: 2511.07001
- SD-PSFNet: Sequential and Dynamic Point Spread Function Network for Image Deraining | arXiv: 2511.17993
- SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models | arXiv: 2508.06142
- SecMoE: Communication-Efficient Secure MoE Inference via Select-Then-Compute | arXiv: 2601.06790
- See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay | arXiv: 2603.11601
- Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models | arXiv: 2512.18004
- Seeing the Unseen: Zooming in the Dark with Event Cameras | arXiv: 2601.02206
- Segment and Matte Anything in a Unified Model (SAMA) | arXiv: 2601.12147
- Segment Anything Across Shots: A Method and Benchmark | arXiv: 2511.13715
- SELDON: Supernova Explosions Learned by Deep ODE Networks | arXiv: 2603.04392
- Self-Adaptive Graph Mixture of Models | arXiv: 2511.13062
- Self-Correction Distillation for Structured Data Question Answering | arXiv: 2511.07998
- Self-NPO: Data-Free Diffusion Model Enhancement via Truncated Diffusion Fine-Tuning | arXiv: 2505.11777
- Self-Supervised Inductive Logic Programming | arXiv: 2507.16405
- Self-supervised Multiplex Consensus Mamba for General Image Fusion | arXiv: 2512.20921
- SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation | arXiv: 2511.10518
- SEMC: Structure-Enhanced Mixture-of-Experts Contrastive Learning for Ultrasound Standard Plane Recognition | arXiv: 2511.12559
- Semi-Supervised High Dynamic Range Image Reconstructing via Bi-Level Uncertain Area Masking | arXiv: 2511.12939
- Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling | arXiv: 2509.16717
- Sentient: Detecting APTs Via Capturing Indirect Dependencies and Behavioral Logic | arXiv: 2502.06521
- SERL: Self-Examining Reinforcement Learning on Open-Domain | arXiv: 2511.07922
- Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems | arXiv: 2511.18467
- ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees | arXiv: 2602.07047
- Share Your Attention: Transformer Weight Sharing via Matrix-Based Dictionary Learning | arXiv: 2508.04581
- Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning | arXiv: 2511.08003
- Sheaf Graph Neural Networks via PAC-Bayes Spectral Optimization | arXiv: 2508.00357
- ShortageSim: Simulating Drug Shortages under Information Asymmetry | arXiv: 2509.01813
- Shrinking the Teacher: An Adaptive Teaching Paradigm for Asymmetric EEG-Vision Alignment | arXiv: 2511.11422
- SIGN: Schema-Induced Games for Naming | arXiv: 2510.21855
- Sim-to-Real: An Unsupervised Noise Layer for Screen-Camera Watermarking Robustness | arXiv: 2504.18906
- Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity Masks | arXiv: 2511.06665
- Simba: Towards High-Fidelity and Geometrically-Consistent Point Cloud Completion via Transformation Diffusion | arXiv: 2511.16161
- SimDiff: Simpler Yet Better Diffusion Model for Time Series Point Forecasting | arXiv: 2511.19256
- SimROD: A Simple Baseline for Raw Object Detection with Global and Local Enhancements | arXiv: 2503.07101
- Sketch-HARP: Hierarchical Autoregressive Sketch Generation for Flexible Stroke-Level Drawing Manipulation | arXiv: 2511.07889
- Skill Path: Unveiling Language Skills from Circuit Graphs | arXiv: 2410.01334
- SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping | arXiv: 2512.13494
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers | arXiv: 2512.20292
- SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection | arXiv: 2412.20665
- Small but Mighty: Dynamic Wavelet Expert-Guided Fine-Tuning of Large-Scale Models for Optical Remote Sensing Object Segmentation | arXiv: 2601.09108
- Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning | arXiv: 2512.15943
- Smart: A GNN-LLM Hybrid Surrogate Model for Dragonfly System Application Runtime Prediction | arXiv: 2511.11111
- SmartSplat: Feature-Smart Gaussians for Scalable Compression of Ultra-High-Resolution Images | arXiv: 2512.20377
- SMoFi: Step-wise Momentum Fusion for Split Federated Learning on Heterogeneous Data | arXiv: 2511.09828
- Soft Filtering: Guiding Zero-Shot Composed Image Retrieval with Prescriptive and Proscriptive Prompts | arXiv: 2512.20781
- SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models | arXiv: 2511.08379
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents | arXiv: 2512.14720
- Sonnet: Spectral Operator Neural Network for Multivariable Time Series Forecasting | arXiv: 2505.15312
- SOSControl: Enhancing Human Motion Generation through Saliency-Aware Symbolic Orientation and Timing Control | arXiv: 2601.14258
- SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization | arXiv: 2511.06222
- SpaCRD: Multimodal Deep Fusion of Histology and Spatial Transcriptomics for Cancer Region Detection | arXiv: 2603.06186
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models | arXiv: 2511.09993
- SPARC: OOD Generalization for Controlling 100 Unseen Vehicles with a Single Policy | arXiv: 2511.09737
- SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision | arXiv: 2506.15498
- SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning | arXiv: 2508.15212
- Sparse Additive Model Pruning for Order-Based Causal Structure Learning | arXiv: 2602.15306
- Sparse4DGS: 4D Gaussian Splatting for Sparse-Frame Dynamic Scene Reconstruction | arXiv: 2511.07122
- SparseCoop: Cooperative Perception with Kinematic-Grounded Queries | arXiv: 2512.06838
- SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder | arXiv: 2511.07896
- SparseSurf: Sparse-View 3D Gaussian Splatting for Surface Reconstruction | arXiv: 2511.14633
- SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation | arXiv: 2511.09555
- SpatioTemporal Difference Network for Video Depth Super-Resolution | arXiv: 2508.01259
- Spatiotemporal-Untrammelled Mixture of Experts for Multi-Person Motion Prediction | arXiv: 2512.21707
- SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models | arXiv: 2508.06372
- SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation | arXiv: 2509.13848
- SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization | arXiv: 2511.11663
- Speculative Sampling with Reinforcement Learning | arXiv: 2601.12212
- SphereDiff: Tuning-free Omnidirectional Panoramic Image and Video Generation via Spherical Latent Representation | arXiv: 2504.14396
- SpikCommander: A High-Performance Spiking Transformer with Multi-View Learning for Efficient Speech Command Recognition | arXiv: 2511.07883
- Spike Imaging Velocimetry: Dense Motion Estimation of Fluids Using Spike Cameras | arXiv: 2504.18864
- Spiking Heterogeneous Graph Attention Networks | arXiv: 2601.02401
- Spikingformer: A Key Foundation Model for Spiking Neural Networks | arXiv: 2304.11954
- Splat-SAP: Feed-Forward Gaussian Splatting for Human-Centered Scene with Scale-Aware Point Map Reconstruction | arXiv: 2511.22704
- Splats in Splats: Robust and Effective 3D Steganography towards Gaussian Splatting | arXiv: 2412.03121
- SplatSSC: Decoupled Depth-Guided Gaussian Splatting for Semantic Scene Completion | arXiv: 2508.02261
- Split-Layer: Enhancing Implicit Neural Representation by Maximizing the Dimensionality of Feature Space | arXiv: 2511.10142
- SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth | arXiv: 2508.11009
- SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention | arXiv: 2511.06446
- SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation | arXiv: 2512.01701
- Stabilizing Self-Consuming Diffusion Models with Latent Space Filtering | arXiv: 2511.12742
- Stable Voting and the Splitting of Cycles | arXiv: 2512.00616
- Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding | arXiv: 2511.13924
- Steering One-Step Diffusion Model with Fidelity-Rich Decoder for Fast Image Compression | arXiv: 2508.04979
- Steering Pretrained Drafters during Speculative Decoding | arXiv: 2511.09844
- StegaVAR: Privacy-Preserving Video Action Recognition via Steganographic Domain Analysis | arXiv: 2512.12586
- STELAR-Vision: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision | arXiv: 2508.08688
- STELLAR: Scene Text Editor for Low-Resource Languages and Real-World Data | arXiv: 2511.09977
- STEM Faculty Perspectives on Generative AI in Higher Education | arXiv: 2603.04001
- STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transitive Evaluation Model | arXiv: 2508.12096
- StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs Through Knowledge-Reasoning Fusion | arXiv: 2508.04440
- STMI: Segmentation-Guided Token Modulation with Cross-Modal Hypergraph Interaction for Multi-Modal Object Re-Identification | arXiv: 2603.00695
- SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios | arXiv: 2505.04201
- Stratified Knowledge-Density Super-Network for Scalable Vision Transformers | arXiv: 2511.11683
- Streaming Generated Gaussian Process Experts for Online Learning and Control: Extended Version | arXiv: 2508.03679
- Streaming Generation of Co-Speech Gestures via Accelerated Rolling Diffusion | arXiv: 2503.10488
- StreamSTGS: Streaming Spatial and Temporal Gaussian Grids for Real-Time Free-Viewpoint Video | arXiv: 2511.06046
- STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes | arXiv: 2508.10427
- Structural Approach to Guiding a Present-Biased Agent | arXiv: 2601.07763
- Structure-Aware Encodings of Argumentation Properties for Clique-width | arXiv: 2511.10767
- Structure-based RNA Design by Step-wise Optimization of Latent Diffusion Model | arXiv: 2601.19232
- Structured Language Generation Model: Loss Calibration and Formatted Decoding for Efficient Text | arXiv: 2402.08971
- Structured Personalization: Modeling Constraints as Matroids for Data-Minimal LLM Agents | arXiv: 2512.11907
- Studying Classifier(-Free) Guidance From A Classifier-Centric Perspective | arXiv: 2503.10638
- StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak | arXiv: 2511.10692
- SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition | arXiv: 2511.10091
- Surface-Based Visibility-Guided Uncertainty for Continuous Active 3D Neural Reconstruction | arXiv: 2405.02568
- SVD-NO: Learning PDE Solution Operators with SVD Integral Kernels | arXiv: 2511.10025
- Symbolic Planning and Multi-Agent Path Finding in Extremely Dense Environments with Unassigned Agents | arXiv: 2509.01022
- Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models | arXiv: 2506.10634
- SynWeather: Weather Observation Data Synthesis across Multiple Regions and Variables via a General Diffusion Transformer | arXiv: 2511.08291
- T-LoRA: Single Image Diffusion Model Customization Without Overfitting | arXiv: 2507.05964
- T-Rex-Omni: Integrating Negative Visual Prompt in Generic Object Detection | arXiv: 2511.08997
- T2Agent: A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search | arXiv: 2505.19768
- T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model | arXiv: 2510.22300
- Tab-PET: Graph-Based Positional Encodings for Tabular Transformers | arXiv: 2511.13338
- TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing | arXiv: 2511.13283
- Tackling Resource-Constrained and Data-Heterogeneity in Federated Learning with Double-Weight Sparse Pack | arXiv: 2601.01840
- TAdaRAG: Task Adaptive Retrieval-Augmented Generation via On-the-Fly Knowledge Graph Construction | arXiv: 2511.12520
- TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning | arXiv: 2508.04565
- Talk, Snap, Complain: Validation-Aware Multimodal Expert Framework for Fine-Grained Customer Grievances | arXiv: 2511.14693
- TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech | arXiv: 2511.05817
- TAPA: Training-Free Adaptation of Programmatic Agents via LLM-Guided Program Synthesis in Dynamic Environments | arXiv: 2508.11425
- Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective | arXiv: 2511.16170
- Targeted Data Protection for Diffusion Model by Matching Training Trajectory | arXiv: 2512.10433
- Task Aware Modulation Using Representation Learning for Upscaling of Terrestrial Carbon Fluxes | arXiv: 2603.09974
- Task Prototype-Based Knowledge Retrieval for Multi-Task Learning from Partially Annotated Data | arXiv: 2601.07474
- Task-Aware Retrieval Augmentation for Dynamic Recommendation | arXiv: 2511.12495
- Task-Specific Distance Correlation Matching for Few-Shot Action Recognition | arXiv: 2512.11340
- TawPipe: Topology-Aware Weight Pipeline Parallelism for Accelerating Long-Context Large Models Training | arXiv: 2511.09741
- TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models | arXiv: 2507.10643
- TDCNet: Spatio-Temporal Context Learning with Temporal Difference Convolution for Moving IRSTD | arXiv: 2511.09352
- TDSNNs: Competitive Topographic Deep Spiking Neural Networks for Visual Cortex Modeling | arXiv: 2508.04270
- TEMPLE: Incentivizing Temporal Understanding of Video LLMs via Progressive Pre-SFT Alignment | arXiv: 2503.16929
- Temporal Inconsistency Guidance for Super-resolution Video Quality Assessment | arXiv: 2412.18933
- Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection | arXiv: 2511.13784
- Test-driven Reinforcement Learning in Continuous Control | arXiv: 2511.07904
- Test-time Diverse Reasoning by Riemannian Activation Steering | arXiv: 2511.08305
- Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion | arXiv: 2511.12432
- Text-guided Controllable Diffusion for Realistic Camouflage Images Generation | arXiv: 2511.20218
- Text-to-Scene with Large Reasoning Models | arXiv: 2509.26091
- TextShield-R1: Reinforced Reasoning for Tampered Text Detection | arXiv: 2602.19828
- TG-Field: Geometry-Aware Radiative Gaussian Fields for Tomographic Reconstruction | arXiv: 2602.11705
- TGDD: Trajectory Guided Dataset Distillation with Balanced Distribution | arXiv: 2512.02469
- The Confidence Trap: Gender Bias and Predictive Certainty in LLMs | arXiv: 2601.07806
- The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models | arXiv: 2511.20344
- The Limitations and Power of NP-Oracle-Based Functional Synthesis Techniques | arXiv: 2512.20572
- The Publication Choice Problem | arXiv: 2511.13678
- The Triangle of Similarity: A Multi-Faceted Framework for Comparing Neural Network Representations | arXiv: 2601.17093
- Theoretical and Empirical Analysis of Lehmer Codes to Search Permutation Spaces with Evolutionary Algorithms | arXiv: 2511.19089
- Theory of Mind for Explainable Human-Robot Interaction | arXiv: 2512.23482
- Think How Your Teammates Think: Active Inference Can Benefit Decentralized Execution | arXiv: 2511.18761
- Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-Making | arXiv: 2511.12876
- Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction | arXiv: 2511.07943
- Thucy: An LLM-based Multi-Agent System for Claim Verification across Relational Databases | arXiv: 2512.03278
- Time, Identity and Consciousness in Language Model Agents | arXiv: 2603.09043
- TimeBill: Time-Budgeted Inference for Large Language Models | arXiv: 2512.21859
- TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks | arXiv: 2511.06283
- TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis | arXiv: 2511.10325
- To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance | arXiv: 2511.12121
- ToC: Tree-of-Claims Search with Multi-Agent Language Models | arXiv: 2511.16972
- TOFA: Training-Free One-Shot Federated Adaptation for Vision-Language Models | arXiv: 2511.16423
- Tokenize Once, Recommend Anywhere: Unified Item Tokenization for Multi-domain LLM-based Recommendation | arXiv: 2511.12922
- TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents | arXiv: 2504.12679
- Tool4POI: A Tool-Augmented LLM Framework for Next POI Recommendation | arXiv: 2511.06405
- TopoReformer: Mitigating Adversarial Attacks Using Topological Purification in OCR Models | arXiv: 2511.15807
- TOSC: Task-Oriented Shape Completion for Open-World Dexterous Grasp Generation from Partial Point Clouds | arXiv: 2601.05499
- TouchFormer: A Robust Transformer-based Framework for Multimodal Material Perception | arXiv: 2511.19509
- Toward Gaze Target Detection in Young Autistic Children | arXiv: 2511.11244
- Towards 3D Object-Centric Feature Learning for Semantic Scene Completion | arXiv: 2511.13031
- Towards a Common Framework for Autoformalization | arXiv: 2509.09810
- Towards a Foundation Model for Partial Differential Equations Across Physics Domains | arXiv: 2511.21861
- Towards a Rigorous Understanding of the Population Dynamics of the NSGA-III: Tight Runtime Bounds | arXiv: 2511.07125
- Towards Affordance-Aware Robotic Dexterous Grasping with Human-like Priors | arXiv: 2508.08896
- Towards Authentic Movie Dubbing with Retrieve-Augmented Director-Actor Interaction Learning | arXiv: 2511.14249
- Towards Better Code Understanding in Decoder-Only Models with Contrastive Learning | arXiv: 2406.12326
- Towards Effective and Efficient Context-aware Nucleus Detection in Histopathology Whole Slide Images | arXiv: 2503.05678
- Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models | arXiv: 2511.17982
- Towards Human-AI Accessibility Mapping in India: VLM-Guided Annotations and POI-Centric Analysis in Chandigarh | arXiv: 2602.09216
- Towards Inference-Time Scaling for Continuous Space Reasoning | arXiv: 2510.12167
- Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space | arXiv: 2602.22879
- Towards Long-window Anchoring in Vision-Language Model Distillation | arXiv: 2512.21576
- Towards Multiple Missing Values-Resistant Unsupervised Graph Anomaly Detection | arXiv: 2511.09917
- Towards Non-Stationary Time Series Forecasting with Temporal Stabilization and Frequency Differencing | arXiv: 2511.08229
- Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance | arXiv: 2511.12844
- Towards Scalable Web Accessibility Audit with MLLMs as Copilots | arXiv: 2511.03471
- Towards Temporal Fusion Beyond the Field of View for Camera-based Semantic Scene Completion | arXiv: 2511.12498
- Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing | arXiv: 2512.13055
- Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance | arXiv: 2512.11421
- Towards Ultrasound-based Reliable Disease Diagnosis Using Causal Inference
- TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents | arXiv: 2601.05899
- TRACE: A Generalizable Drift Detector for Streaming Data-Driven Optimization | arXiv: 2512.07082
- Tracking and Segmenting Anything in Any Modality | arXiv: 2511.19475
- Tractable Weighted First-Order Model Counting with Bounded Treewidth Binary Evidence | arXiv: 2511.09174
- Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities | arXiv: 2503.17979
- Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs | arXiv: 2512.03994
- Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial Perturbation | arXiv: 2602.11213
- Transferable Hypergraph Attack via Injecting Nodes into Pivotal Hyperedges | arXiv: 2511.10698
- TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model | arXiv: 2503.24067
- Transparent Networks for Multivariate Time Series | arXiv: 2410.10535
- TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning | arXiv: 2504.16505
- Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference | arXiv: 2512.08860
- TrinityDNA: A Bio-Inspired Foundational Model for Efficient Long-Sequence DNA Modeling | arXiv: 2507.19229
- Truth, Justice, and Secrecy: Cake Cutting Under Privacy Constraints | arXiv: 2511.09882
- TruthfulRAG: Resolving Factual-level Conflicts in Retrieval-Augmented Generation with Knowledge Graphs | arXiv: 2511.10375
- TSBOW: Traffic Surveillance Benchmark for Occluded Vehicles Under Various Weather Conditions | arXiv: 2602.05414
- TSGDiff: Rethinking Synthetic Time Series Generation from a Pure Graph Perspective | arXiv: 2511.12174
- TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding | arXiv: 2508.04369
- TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models | arXiv: 2508.19257
- TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding | arXiv: 2511.10241
- Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLMs | arXiv: 2508.20384
- Uncovering Bias Paths with LLM-guided Causal Discovery: An Active Learning and Dynamic Scoring Approach | arXiv: 2506.12227
- Uncovering Pretraining Code in LLMs: A Syntax-Aware Attribution Approach | arXiv: 2511.07033
- Uncovering Zero-Shot Generalization Gaps in Time-Series Foundation Models Using Real-World Videos | arXiv: 2509.26347
- Understanding Dynamic Scenes in Egocentric 4D Point Clouds | arXiv: 2508.07251
- Understanding Syllogistic Reasoning in LLMs from Formal and Natural Language Perspectives | arXiv: 2512.12620
- UniABG: Unified Adversarial View Bridging and Graph Correspondence for Unsupervised Cross-View Geo-Localization | arXiv: 2511.12054
- UniC-Lift: Unified 3D Instance Segmentation via Contrastive Learning | arXiv: 2512.24763
- UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment | arXiv: 2511.15831
- UniHR: Hierarchical Representation Learning for Unified Knowledge Graph Link Prediction | arXiv: 2411.07019
- Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation | arXiv: 2508.14031
- Universal Safety Controllers with Learned Prophecies | arXiv: 2511.11390
- Unleashing Semantic and Geometric Priors for 3D Scene Completion | arXiv: 2508.13601
- Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment | arXiv: 2503.07334
- Unlocking Efficient Vehicle Dynamics Modeling via Analytic World Models | arXiv: 2502.10012
- UNSEEN: Enhancing Dataset Pruning from a Generalization Perspective | arXiv: 2511.12988
- Unsupervised Feature Selection Through Group Discovery | arXiv: 2511.09166
- Unsupervised Motion-Compensated Decomposition for Cardiac MRI Reconstruction via Neural Representation | arXiv: 2511.11436
- Unsupervised Multi-Parameter Inverse Solving for Reducing Ring Artifacts in 3D X-Ray CBCT | arXiv: 2412.05853
- URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding | arXiv: 2511.10552
- Urban Incident Prediction with Graph Neural Networks: Integrating Government Ratings and Crowdsourced Reports | arXiv: 2506.08740
- UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories | arXiv: 2512.09607
- use a unified model for universal sound separation and extraction
- Using Certifying Constraint Solvers for Generating Step-wise Explanations | arXiv: 2511.10428
- UVLM: Benchmarking Video Language Model for Underwater World Understanding | arXiv: 2507.02373
- Variance Computation for Weighted Model Counting with Knowledge Compilation Approach | arXiv: 2601.03523
- Vascular Anatomy-aware Self-supervised Pre-training for X-ray Angiogram Analysis | arXiv: 2602.11536
- Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models | arXiv: 2412.04939
- Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-editors | arXiv: 2512.13860
- VGGT-DP: Generalizable Robot Control via Vision Foundation Models | arXiv: 2509.18778
- ViDia2Std: A Parallel Corpus and Methods for Low-Resource Vietnamese Dialect-to-Standard Translation | arXiv: 2603.10211
- VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness | arXiv: 2601.12672
- VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-use | arXiv: 2410.16400
- VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction | arXiv: 2509.19002
- Virtual Multiplex Staining for Histological Images Using a Marker-wise Conditioned Diffusion Model | arXiv: 2508.14681
- Vision Transformers are Circulant Attention Learners | arXiv: 2512.21542
- Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach | arXiv: 2601.00388
- Vision-Only Gaussian Splatting for Collaborative Semantic Occupancy Prediction | arXiv: 2508.10936
- Vista: Scene-Aware Optimization for Streaming Video Question Answering Under Post-Hoc Queries | arXiv: 2602.08448
- VitalDiagnosis: AI-Driven Ecosystem for 24/7 Vital Monitoring and Chronic Disease Management | arXiv: 2601.15798
- VK-Det: Visual Knowledge Guided Prototype Learning for Open-Vocabulary Aerial Object Detection | arXiv: 2511.18075
- vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs | arXiv: 2511.09540
- VoiceCloak: A Multi-Dimensional Defense Framework against Unauthorized Diffusion-based Voice Cloning | arXiv: 2505.12332
- Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health Understanding | arXiv: 2603.01816
- VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models | arXiv: 2511.11438
- VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation | arXiv: 2511.12030
- VPN: Visual Prompt Navigation | arXiv: 2508.01766
- VSPO: Validating Semantic Pitfalls in Ontology via LLM-Based CQ Generation | arXiv: 2511.07991
- VTinker: Guided Flow Upsampling and Texture Mapping for High-Resolution Video Frame Interpolation | arXiv: 2511.16124
- W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search | arXiv: 2511.11518
- Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions | arXiv: 2603.14189
- WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking | arXiv: 2511.07863
- Wavelet Enhanced Adaptive Frequency Filter for Sequential Recommendation | arXiv: 2511.07028
- WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images | arXiv: 2511.08987
- Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning | arXiv: 2512.15274
- When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion? | arXiv: 2511.10059
- When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets | arXiv: 2510.00332
- When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF | arXiv: 2512.00709
- When Person Re-Identification Meets Event Camera: A Benchmark Dataset and An Attribute-guided Re-Identification Framework | arXiv: 2507.13659
- When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents | arXiv: 2512.02445
- When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents | arXiv: 2601.00513
- When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video Recommendation | arXiv: 2511.18700
- When Trackers Date Fish: A Benchmark and Framework for Underwater Multiple Fish Tracking | arXiv: 2507.06400
- Where and What Matters: Sensitivity-Aware Task Vectors for Many-Shot Multimodal In-Context Learning | arXiv: 2511.08246
- Where Norms and References Collide: Evaluating LLMs on Normative Reasoning | arXiv: 2602.02975
- Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position | arXiv: 2508.12398
- Whispering Agents: An Event-Driven Covert Communication Protocol for the Internet of Agents | arXiv: 2508.02188
- Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study | arXiv: 2506.19794
- Why Isn't Relational Learning Taking Over the World? | arXiv: 2507.13558
- With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems | arXiv: 2512.22211
- WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving | arXiv: 2512.19133
- X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework | arXiv: 2601.03194
- X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning | arXiv: 2508.07607
- XLinear: A Lightweight and Accurate MLP-Based Model for Long-Term Time Series Forecasting with Exogenous Inputs | arXiv: 2601.09237
- Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection | arXiv: 2601.07232
- YOLO-IOD: Towards Real Time Incremental Object Detection | arXiv: 2512.22973
- Your AI-Generated Image Detector Can Secretly Achieve SOTA Accuracy, If Calibrated | arXiv: 2602.01973
- Yours or Mine? Overwriting Attacks Against Neural Audio Watermarking | arXiv: 2509.05835
- Zero-Reference Joint Low-Light Enhancement and Deblurring via Visual Autoregressive Modeling with VLM-Derived Modulation | arXiv: 2511.18591