All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language ModelsarXiv 2026Efficient Reasoning with Balanced ThinkingarXiv 2026OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using AgentarXiv 2026One View Is Enough! Monocular Training for In-the-Wild Novel View GenerationarXiv 2026TRACE: Capability-Targeted Agentic TrainingarXiv 2026LatentLens: Revealing Highly Interpretable Visual Tokens in LLMsarXiv 2026Scaling Spatial Intelligence with Multimodal Foundation ModelsarXiv 2025In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task DataarXiv 2025TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist ModelsarXiv 2026OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General RecipearXiv 2025IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMsarXiv 2026GARDO: Reinforcing Diffusion Models without Reward HackingarXiv 2025The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language ModelsarXiv 2026World Models for Policy Refinement in StarCraft IIarXiv 2026Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?arXiv 2025UniPool: A Globally Shared Expert Pool for Mixture-of-ExpertsarXiv 2026Type-Checked Compliance: Deterministic Guardrails for Agentic Financial Systems Using Lean 4 Theorem ProvingarXiv 2026Context Cascade Compression: Exploring the Upper Limits of Text CompressionarXiv 2025TwinAligner: Visual-Dynamic Alignment Empowers Physics-aware Real2Sim2Real for Robotic ManipulationarXiv 2025FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow MatchingarXiv 2026Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward ModelarXiv 2026PhysX-Anything: Simulation-Ready Physical 3D Assets from Single ImagearXiv 2025WorldMM: Dynamic Multimodal Memory Agent for Long Video ReasoningarXiv 2025Multiplex Thinking: Reasoning via Token-wise Branch-and-MergearXiv 2026SynthVerse: A Large-Scale Diverse Synthetic Dataset for Point TrackingarXiv 2026Qworld: Question-Specific Evaluation Criteria for LLMsarXiv 2026Depth Anything in 360^circ: Towards Scale Invariance in the WildarXiv 2025MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive ScalingarXiv 2025VisMem: Latent Vision Memory Unlocks Potential of Vision-Language ModelsarXiv 2025Reinforcing Action Policies by ProphesyingarXiv 2025Is Nano Banana Pro a Low-Level Vision All-Rounder? A Comprehensive Evaluation on 14 Tasks and 40 DatasetsarXiv 2025Affinity Contrastive Learning for Skeleton-based Human Activity UnderstandingarXiv 2026AgentEHR: Advancing Autonomous Clinical Decision-Making via Retrospective SummarizationarXiv 2026OneHOI: Unifying Human-Object Interaction Generation and EditingarXiv 2026UI-Venus-1.5 Technical ReportarXiv 2026Micro Language Models Enable Instant ResponsesarXiv 2026Collision-Free Humanoid Traversal in Cluttered Indoor ScenesarXiv 2026Depth Anything 3: Recovering the Visual Space from Any ViewsarXiv 2025daVinci-Dev: Agent-native Mid-training for Software EngineeringarXiv 2026Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning EcosystemarXiv 2025OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language ModelsarXiv 2025RF-DETR: Neural Architecture Search for Real-Time Detection TransformersarXiv 2025Deep Research: A Systematic SurveyarXiv 2025RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AIarXiv 2026WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement LearningarXiv 2026Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon TasksarXiv 2026LeJEPA: Provable and Scalable Self-Supervised Learning Without the HeuristicsarXiv 2025Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ LanguagesarXiv 2025Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement LearningarXiv 2026AdaTooler-V: Adaptive Tool-Use for Images and VideosarXiv 2025General Agentic Memory Via Deep ResearcharXiv 2025Rethinking the Trust Region in LLM Reinforcement LearningarXiv 2026Scaling Behavior of Discrete Diffusion Language ModelsarXiv 2025Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional DialectsarXiv 2026Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon AgentsarXiv 2026V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation ModelsarXiv 2025MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectional Blending with Hierarchical DensificationarXiv 2025Soft Anisotropic Diagrams for Differentiable Image RepresentationarXiv 2026A Hybrid Approach for Closing the Sim2real Appearance Gap in Game Engine Synthetic DatasetsarXiv 2026Robot Learning from a Physical World ModelarXiv 2025RIVER: A Real-Time Interaction Benchmark for Video LLMsarXiv 2026MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric MethodsarXiv 2026Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and DataarXiv 2025RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable EnvironmentsarXiv 2025WMPO: World Model-based Policy Optimization for Vision-Language-Action ModelsarXiv 2025Cognitive Foundations for Reasoning and Their Manifestation in LLMsarXiv 2025VisPlay: Self-Evolving Vision-Language Models from ImagesarXiv 2025MOOZY: A Patient-First Foundation Model for Computational PathologyarXiv 2026Monocular Normal Estimation via Shading Sequence EstimationarXiv 2026Large Language Models Explore by Latent DistillingarXiv 2026MeKi: Memory-based Expert Knowledge Injection for Efficient LLM ScalingarXiv 2026Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal PoliciesarXiv 2025KLASS: KL-Guided Fast Inference in Masked Diffusion ModelsarXiv 2025JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and GenerationarXiv 2025DeepEyesV2: Toward Agentic Multimodal ModelarXiv 2025Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearcharXiv 2025Visual Spatial TuningarXiv 2025Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment ConstructionarXiv 2025NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference RewardsarXiv 2025LoopTool: Closing the Data-Training Loop for Robust LLM Tool CallsarXiv 2025MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial IntelligencearXiv 2025Teaching Pretrained Language Models to Think Deeper with Retrofitted
RecurrencearXiv 2025Think-at-Hard: Dynamic Looped Transformers for Improved ReasoningarXiv 2025WAY: Estimation of Vessel Destination in Worldwide AIS TrajectoryarXiv 2025TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative ModelsarXiv 2025Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-FollowingarXiv 2025LongCat-Video Technical ReportarXiv 2025Search Self-play: Pushing the Frontier of Agent Capability without
SupervisionarXiv 2025DeepAnalyze: Agentic Large Language Models for Autonomous Data SciencearXiv 2025Think with 3D: Geometric Imagination Grounded Spatial Reasoning from
Limited ViewsarXiv 2025Nav-R1: Reasoning and Navigation in Embodied ScenesarXiv 2025Training-Free Group Relative Policy OptimizationarXiv 2025UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement LearningarXiv 2025The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic,
and Long-Horizon Task ExecutionarXiv 2025A Vision-Language-Action-Critic Model for Robotic Real-World
Reinforcement LearningarXiv 2025Diffusion Transformers with Representation AutoencodersarXiv 2025Epona: Autoregressive Diffusion World Model for Autonomous DrivingICCV 2025Promptomatix: An Automatic Prompt Optimization Framework for Large Language ModelsarXiv 2025WebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv 2025Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion ForcingarXiv 2025RynnVLA-001: Using Human Demonstrations to Improve Robot ManipulationarXiv 2025Evaluating Memory in LLM Agents via Incremental Multi-Turn InteractionsarXiv 2025V-Thinker: Interactive Thinking with ImagesarXiv 2025Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language ModelsarXiv 2025$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene ForecastingarXiv 2025Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning ModelsarXiv 2025FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow PoliciesarXiv 2025DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real WorldarXiv 2025REASONEDIT: Towards Reasoning-Enhanced Image Editing ModelsarXiv 2025Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model
Self-DistillationarXiv 2025Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete
Denoising Diffusion ProcessarXiv 2025Trace Anything: Representing Any Video in 4D via Trajectory FieldsarXiv 2025WebDancer: Towards Autonomous Information Seeking AgencyarXiv 2025WebSailor: Navigating Super-human Reasoning for Web AgentarXiv 2025WebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentarXiv 2025SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering
Tasks?arXiv 2025IGGT: Instance-Grounded Geometry Transformer for Semantic 3D
ReconstructionarXiv 2025VStyle: A Benchmark for Voice Style Adaptation with Spoken InstructionsarXiv 2025SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable
Sparse-Linear AttentionarXiv 2025ThinkMorph: Emergent Properties in Multimodal Interleaved
Chain-of-Thought ReasoningarXiv 2025Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMsICCV 2025A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic SystemsarXiv 2025GEPA: Reflective Prompt Evolution Can Outperform Reinforcement LearningarXiv 2025UniPixel: Unified Object Referring and Segmentation for Pixel-Level
Visual ReasoningarXiv 2025A Systematic Analysis of Hybrid Linear AttentionarXiv 2025A Survey on Diffusion Language ModelsarXiv 2025Emu3.5: Native Multimodal Models are World LearnersarXiv 2025X-Part: high fidelity and structure coherent shape decompositionarXiv 2025P3-SAM: Native 3D Part SegmentationarXiv 2025A Survey of Vibe Coding with Large Language ModelsarXiv 2025Scaling Agents via Continual Pre-trainingarXiv 2025ReSum: Unlocking Long-Horizon Search Intelligence via Context SummarizationarXiv 2025WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement LearningarXiv 2025WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep ResearcharXiv 2025LightMem: Lightweight and Efficient Memory-Augmented GenerationarXiv 2025MIRIX: Multi-Agent Memory System for LLM-Based AgentsarXiv 2025UI-S1: Advancing GUI Automation via Semi-online Reinforcement LearningarXiv 2025Mobile-Agent-v3: Fundamental Agents for GUI AutomationarXiv 2025InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and EfficiencyarXiv 2025Seed-Prover: Deep and Broad Reasoning for Automated Theorem ProvingarXiv 2025Persona Vectors: Monitoring and Controlling Character Traits in Language ModelsarXiv 2025MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and
Training RecipearXiv 2025Locality in Image Diffusion Models Emerges from Data StatisticsarXiv 2025The Landscape of Agentic Reinforcement Learning for LLMs: A SurveyarXiv 2025Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite
ImageryarXiv 2025Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future FrontiersarXiv 2025Pretraining Large Language Models with NVFP4arXiv 2025Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video GenerationarXiv 2025Stand-In: A Lightweight and Plug-and-Play Identity Control for Video GenerationarXiv 2025Revolutionizing Reinforcement Learning Framework for Diffusion Large Language ModelsarXiv 2025MindJourney: Test-Time Scaling with World Models for Spatial ReasoningarXiv 2025DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledgedreamvla-a-vision-language-action-modelThyme: Think Beyond ImagesarXiv 2025SSRL: Self-Search Reinforcement LearningarXiv 2025ARE: Scaling Up Agent Environments and EvaluationsarXiv 2025A Survey on Latent ReasoningarXiv 2025VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with
Voxel-Aligned PredictionarXiv 2025HuMo: Human-Centric Video Generation via Collaborative Multi-Modal ConditioningarXiv 2025VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action ModelarXiv 2025GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement LearningarXiv 20253D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene UnderstandingarXiv 2025MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol ServersarXiv 2025Puppeteer: Rig and Animate Your 3D ModelsarXiv 2025A Survey of Context Engineering for Large Language ModelsarXiv 2025RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic AgentsarXiv 2025UI-Venus Technical Report: Building High-performance UI Agents with RFTarXiv 2025AnyUp: Universal Feature UpsamplingarXiv 2025Transition Models: Rethinking the Generative Learning ObjectivearXiv 2025A Survey of Self-Evolving Agents: On Path to Artificial Super IntelligencearXiv 2025MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDEarXiv 2025SpatialTrackerV2: 3D Point Tracking Made Easyspatialtrackerv2-3d-point-tracking-made-easyNoise Hypernetworks: Amortizing Test-Time Compute in Diffusion ModelsarXiv 2025Chronos-2: From Univariate to Universal ForecastingarXiv 2025A Survey of Data Agents: Emerging Paradigm or Overstated Hype?arXiv 2025CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement
LearningarXiv 2025SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior
Reasoning LLMsarXiv 2025Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion ModelsICCV 2025LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action
ModelsarXiv 2025Qwen3Guard Technical ReportarXiv 2025Rolling Forcing: Autoregressive Long Video Diffusion in Real TimearXiv 2025Differentiable Reward Optimization for LLM based TTS systemarXiv 2025MedDINOv3: How to adapt vision foundation models for medical image segmentation?arXiv 2025Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised
Reinforcement LearningarXiv 2025Agentic Entropy-Balanced Policy OptimizationarXiv 2025WideSearch: Benchmarking Agentic Broad Info-SeekingarXiv 2025DiT360: High-Fidelity Panoramic Image Generation via Hybrid TrainingarXiv 2025When Tokens Talk Too Much: A Survey of Multimodal Long-Context Token Compression across Images, Videos, and AudiosarXiv 2025A Survey of Reinforcement Learning for Large Reasoning ModelsarXiv 2025Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware
Finetuning and MLLM Implicit FeedbackarXiv 2025Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image EditingarXiv 2025ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform
DataarXiv 2025VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual DocumentsarXiv 2025CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ SegmentationarXiv 2025Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D
AssetsarXiv 2025NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at ScalearXiv 2025A Survey on Vision-Language-Action Models: An Action Tokenization PerspectivearXiv 2025GTA1: GUI Test-time Scaling AgentarXiv 2025pi-Flow: Policy-Based Few-Step Generation via Imitation DistillationarXiv 2025HaluMem: Evaluating Hallucinations in Memory Systems of AgentsarXiv 2025Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language ModelsarXiv 2025