0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

RefAV: Towards Planning-Centric Scenario MiningarXiv 2025Obfuscated Activations Bypass LLM Latent-Space DefensesarXiv 2024Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future DirectionsarXiv 2025CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography ChallengesarXiv 2025MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximizationarXiv 2024AI PERSONA: Towards Life-long Personalization of LLMsarXiv 2024Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable PuzzlesarXiv 2025Modality Curation: Building Universal Embeddings for Advanced Multimodal Information RetrievalarXiv 2025Benchmarking Multimodal Knowledge Conflict for Large Multimodal ModelsarXiv 2025MASKSEARCH: A Universal Pre-Training Framework to Enhance Agentic Search CapabilityarXiv 2025FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language ModelsarXiv 2025Text-Driven Tumor SynthesisarXiv 2024Dynamic Scaling of Unit Tests for Code Reward ModelingarXiv 2025CorrFill: Enhancing Faithfulness in Reference-based Inpainting with Correspondence Guidance in Diffusion ModelsarXiv 2025EmotiCrafter: Text-to-Emotional-Image Generation based on Valence-Arousal ModelICCV 2025Nonisotropic Gaussian Diffusion for Realistic 3D Human Motion PredictionCVPR 2025 1Eliciting In-context Retrieval and Reasoning for Long-context Large Language ModelsarXiv 2025FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts ModelsarXiv 2025Decoupled Global-Local Alignment for Improving Compositional UnderstandingarXiv 2025Steering the CensorShip: Uncovering Representation Vectors for LLM "Thought" ControlarXiv 2025Adaptive Retrieval Without Self-Knowledge? Bringing Uncertainty Back HomearXiv 2025PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language ModelsarXiv 2025CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and InteractionsarXiv 2025GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning ChainsarXiv 2025Can MLLMs Guide Me Home? A Benchmark Study on Fine-Grained Visual Reasoning from Transit MapsarXiv 2025Reward-Guided Speculative Decoding for Efficient LLM ReasoningarXiv 2025Understanding Multimodal LLMs Under Distribution Shifts: An Information-Theoretic ApproacharXiv 2025Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-TuningarXiv 2025IPO: Iterative Preference Optimization for Text-to-Video GenerationarXiv 2025CoS: Chain-of-Shot Prompting for Long Video UnderstandingarXiv 2025Video-MMLU: A Massive Multi-Discipline Lecture Understanding BenchmarkarXiv 2025ReasoningV: Efficient Verilog Code Generation with Adaptive Hybrid Reasoning ModelarXiv 2025A Survey on Image Quality Assessment: Insights, Analysis, and Future OutlookarXiv 2025ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent FrameworkarXiv 2025Scaling Image and Video Generation via Test-Time Evolutionary SearcharXiv 2025Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry UnderstandingarXiv 2025FastMCTS: A Simple Sampling Strategy for Data SynthesisarXiv 2025iAgent: LLM Agent as a Shield between User and Recommender SystemsarXiv 2025ReVISE: Learning to Refine at Test-Time via Intrinsic Self-VerificationarXiv 2025Generative AI Act II: Test Time Scaling Drives Cognition EngineeringarXiv 2025OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image ReasoningarXiv 2025SpatialScore: Towards Unified Evaluation for Multimodal Spatial UnderstandingarXiv 2025KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing ModelsarXiv 2025KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical ReasoningarXiv 2025GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement LearningarXiv 2025R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and SearcharXiv 2025R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement LearningarXiv 2025Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning ModelsarXiv 2025Can Masked Autoencoders Also Listen to Birds?arXiv 2025KiRAG: Knowledge-Driven Iterative Retriever for Enhancing Retrieval-Augmented GenerationarXiv 2025VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video ModelsarXiv 2025$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing BenchmarkarXiv 2025Sleep-time Compute: Beyond Inference Scaling at Test-timearXiv 2025Drop-Upcycling: Training Sparse Mixture of Experts with Partial Re-initializationarXiv 2025BodyGen: Advancing Towards Efficient Embodiment Co-Designbodygen-advancing-towards-efficientSplit Gibbs Discrete Diffusion Posterior SamplingarXiv 2025LADM: Long-context Training Data Selection with Attention-based Dependency Measurement for LLMsarXiv 2025LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from PixelsarXiv 2026Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language ModelsarXiv 2025PhyX: Does Your Model Have the "Wits" for Physical Reasoning?arXiv 2025Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response TheoryarXiv 2025The MASK Benchmark: Disentangling Honesty From Accuracy in AI SystemsarXiv 2025More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAGarXiv 2025SafeArena: Evaluating the Safety of Autonomous Web AgentsarXiv 2025Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred SkillsarXiv 2025UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban SpacesarXiv 2025S1-Bench: A Simple Benchmark for Evaluating System 1 Thinking Capability of Large Reasoning ModelsarXiv 2025LoVR: A Benchmark for Long Video Retrieval in Multimodal ContextsarXiv 2025Do Language Models Use Their Depth Efficiently?arXiv 2025Efficient Agent Training for Computer UsearXiv 2025Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM ReasoningarXiv 2025Reasoning Path Compression: Compressing Generation Trajectories for Efficient LLM ReasoningarXiv 2025EmoAgent: Assessing and Safeguarding Human-AI Interaction for Mental Health SafetyarXiv 2025SurgRAW: Multi-Agent Workflow with Chain-of-Thought Reasoning for Surgical IntelligencearXiv 2025BannerAgency: Advertising Banner Design with Multimodal LLM AgentsarXiv 2025ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language ModelsarXiv 2025SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio InformationarXiv 2025Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMsarXiv 2025Contrastive Prompting Enhances Sentence Embeddings in LLMs through Inference-Time SteeringarXiv 2025Towards Visuospatial Cognition via Hierarchical Fusion of Visual ExpertsarXiv 2025Synthetic Data RL: Task Definition Is All You NeedarXiv 2025Is Artificial Intelligence Generated Image Detection a Solved Problem?arXiv 2025CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal InstructionarXiv 2026SepPrune: Structured Pruning for Efficient Deep Speech SeparationarXiv 2025Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement LearningarXiv 2025Foundation Protocol: A Coordination Layer for Agentic SocietyarXiv 2026HoloDreamer: Holistic 3D Panoramic World Generation from Text DescriptionsarXiv 2024Rethinking Repetition Problems of LLMs in Code GenerationarXiv 2025PointArena: Probing Multimodal Grounding Through Language-Guided PointingarXiv 2025TIP: Token Importance in On-Policy DistillationarXiv 2026SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement LearningarXiv 2026QUEST: Training Frontier Deep Research Agents with Fully Synthetic TasksarXiv 2026GemDepth: Geometry-Embedded Features for 3D-Consistent Video DeptharXiv 2026OmniLottie: Generating Vector Animations via Parameterized Lottie TokensarXiv 2026ThriftAttention: Selective Mixed Precision for Long-Context FP4 AttentionarXiv 2026System Prompt Optimization with Meta-LearningarXiv 2025MAI-UI Technical Report: Real-World Centric Foundation GUI AgentsarXiv 2025Qwen-Image-Layered: Towards Inherent Editability via Layer DecompositionarXiv 2025Flexora: Flexible Low Rank Adaptation for Large Language ModelsarXiv 2024MOVA: Towards Scalable and Synchronized Video-Audio GenerationarXiv 2026Near, far: Patch-ordering enhances vision foundation models' scene understandingarXiv 2024CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective VideoarXiv 2026LEAD: Minimizing Learner-Expert Asymmetry in End-to-End DrivingarXiv 2025Large Video Planner Enables Generalizable Robot ControlarXiv 2025ReactiveGWM: Steering NPC in Reactive Game World ModelsarXiv 2026Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response AssistancearXiv 2026Recursive Multi-Agent SystemsarXiv 2026CodePDE: An Inference Framework for LLM-driven PDE Solver GenerationarXiv 2025ReSurgSAM2: Referring Segment Anything in Surgical Video via Credible Long-term TrackingarXiv 2025TRAIL: Trace Reasoning and Agentic Issue LocalizationarXiv 2025TempMe: Video Temporal Token Merging for Efficient Text-Video RetrievalarXiv 2024VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World ModelarXiv 2026From Skills to Talent: Organising Heterogeneous Agents as a Real-World CompanyarXiv 2026Vision-Language-Action Models for Autonomous Driving: Past, Present, and FuturearXiv 2025SDF-Net: Structure-Aware Disentangled Feature Learning for Opticall-SAR Ship Re-identificationarXiv 2026Extend3D: Town-Scale 3D GenerationarXiv 2026Unified Continuous Generative ModelsarXiv 2025Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentarXiv 2025Learning from Peers in Reasoning ModelsarXiv 2025LegiLM: A Fine-Tuned Legal Language Model for Data CompliancearXiv 2024E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and ReasoningarXiv 2024PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific DocumentsarXiv 2026NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UAV Search MissionsarXiv 2024GuidedQuant: Large Language Model Quantization via Exploiting End Loss GuidancearXiv 2025V^3: Viewing Volumetric Videos on Mobiles via Streamable 2D Dynamic GaussiansarXiv 2024MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from TextbooksarXiv 2025X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIParXiv 2025ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web AgentsarXiv 2024Benchmarking Traditional Machine Learning and Deep Learning Models for Fault Detection in Power TransformersarXiv 2025Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety RequirementsarXiv 2024X-Reasoner: Towards Generalizable Reasoning Across Modalities and DomainsarXiv 2025OSUniverse: Benchmark for Multimodal GUI-navigation AI AgentsarXiv 2025NTIRE 2025 Challenge on UGC Video Enhancement: Methods and ResultsarXiv 2025SEFE: Superficial and Essential Forgetting Eliminator for Multimodal Continual Instruction TuningarXiv 2025Efficient Multivariate Time Series Forecasting via Calibrated Language Models with Privileged Knowledge DistillationarXiv 2025The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and AudioarXiv 2024DiT4Edit: Diffusion Transformer for Image EditingarXiv 2024LensNet: An End-to-End Learning Framework for Empirical Point Spread Function Modeling and Lensless Imaging ReconstructionarXiv 2025M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation ModelsarXiv 2024Multi-Reward as Condition for Instruction-based Image EditingarXiv 2024VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video UnderstandingarXiv 2025A Benchmark for Long-Form Medical Question AnsweringarXiv 2024TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in ActionarXiv 2025DiMoDif: Discourse Modality-information Differentiation for Audio-visual Deepfake Detection and LocalizationarXiv 2024OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion ModelsarXiv 2024VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User SimulationCVPR 2025 1Novel View Extrapolation with Video Diffusion PriorsarXiv 2024MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and ManipulationarXiv 2026Visual Test-time Scaling for GUI Agent GroundingICCV 2025LENSLLM: Unveiling Fine-Tuning Dynamics for LLM SelectionarXiv 2025Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice RoutingarXiv 2025Retrofitting Large Language Models with Dynamic TokenizationarXiv 2024Spatiotemporal Skip Guidance for Enhanced Video Diffusion SamplingCVPR 2025 1FactCheXcker: Mitigating Measurement Hallucinations in Chest X-ray Report Generation ModelsCVPR 2025 1Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time AlignmentCVPR 2025 1Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning OptimizationarXiv 2025AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?arXiv 2024NVComposer: Boosting Generative Novel View Synthesis with Multiple Sparse and Unposed ImagesCVPR 2025 1Beyond the Last Answer: Your Reasoning Trace Uncovers More than You ThinkarXiv 2025BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice TextarXiv 2025Reconstructing Context: Evaluating Advanced Chunking Strategies for Retrieval-Augmented GenerationarXiv 2025POINTS1.5: Building a Vision-Language Model towards Real World ApplicationsarXiv 2024δ-mem: Efficient Online Memory for Large Language ModelsarXiv 2026UltraShape 1.0: High-Fidelity 3D Shape Generation via Scalable Geometric RefinementarXiv 2025AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and RestorationarXiv 2024Efficient Reasoning for LLMs through Speculative Chain-of-ThoughtarXiv 2025LazyDiT: Lazy Learning for the Acceleration of Diffusion TransformersarXiv 2024Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and CoveragearXiv 2024Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question AnsweringarXiv 2024PERSE: Personalized 3D Generative Avatars from A Single PortraitCVPR 2025 1Expressing stigma and inappropriate responses prevents LLMs from safely replacing mental health providersarXiv 2025Task-Oriented Communications for Visual Navigation with Edge-Aerial Collaboration in Low Altitude EconomyarXiv 2025Graph Generative Pre-trained TransformerarXiv 2025ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language ModelsCVPR 2025 1Redundancy Principles for MLLMs BenchmarksarXiv 2025Enhancing LLM-Based Agents via Global Planning and Hierarchical ExecutionarXiv 2025Temporal Preference Optimization for Long-Form Video UnderstandingarXiv 2025Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes DomainsarXiv 2025You Only Prune Once: Designing Calibration-Free Model Compression With Policy LearningarXiv 2025Dialogue Systems for Emotional Support via Value ReinforcementarXiv 2025VeriCoder: Enhancing LLM-Based RTL Code Generation through Functional Correctness ValidationarXiv 2025Enhancing Code Generation for Low-Resource Languages: No Silver BulletarXiv 2025MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence GenerationarXiv 2025StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D GaussiansarXiv 2025CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust TranspilationarXiv 2025Forget What You Know about LLMs Evaluations - LLMs are Like a ChameleonarXiv 2025SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World BugsarXiv 2025Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video UnderstandingarXiv 2025One Example Shown, Many Concepts Known! Counterexample-Driven Conceptual Reasoning in Mathematical LLMsarXiv 2025MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense ConnectionsarXiv 2025ImageRAG: Dynamic Image Retrieval for Reference-Guided Image GenerationarXiv 2025V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multi-Modal Large Language ModelsarXiv 2025InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative ReasonersarXiv 2025MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World ConversationarXiv 2025Unhackable Temporal Rewarding for Scalable Video MLLMsarXiv 2025Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMsarXiv 2025GIMMICK -- Globally Inclusive Multimodal Multitask Cultural Knowledge BenchmarkingarXiv 2025Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMsarXiv 2025CodeCriticBench: A Holistic Code Critique Benchmark for Large Language ModelsarXiv 2025Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive QueriesarXiv 2025

Back to Papers