All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document IntelligencearXiv 2026OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free AdaptationarXiv 2026UniT: Unified Geometry Learning with Group Autoregressive TransformerarXiv 2026DeepSeekMath-V2: Towards Self-Verifiable Mathematical ReasoningarXiv 2025PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video GenerationarXiv 2026What matters for Representation Alignment: Global Information or Spatial Structure?arXiv 2025Encoder-Free Human Motion Understanding via Structured Motion DescriptionsarXiv 2026Endless Terminals: Scaling RL Environments for Terminal AgentsarXiv 2026Principled RL for Diffusion LLMs Emerges from a Sequence-Level PerspectivearXiv 2025Trainable Log-linear Sparse Attention for Efficient Diffusion TransformersarXiv 2025MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-HeadarXiv 2026CUA-Skill: Develop Skills for Computer Using AgentarXiv 2026Autonomous Agents Coordinating Distributed Discovery Through Emergent Artifact ExchangearXiv 2026Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching DistillationarXiv 2025Expert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsarXiv 2026Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?arXiv 2026RealWonder: Real-Time Physical Action-Conditioned Video GenerationarXiv 2026Known By Their Actions: Fingerprinting LLM Browser Agents via UI TracesarXiv 2026ShotStream: Streaming Multi-Shot Video Generation for Interactive StorytellingarXiv 2026Solving Physics Olympiad via Reinforcement Learning on Physics SimulatorsarXiv 2026Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time TrainingarXiv 2026DMax: Aggressive Parallel Decoding for dLLMsarXiv 2026LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA ModelsarXiv 2026When Vision Speaks for SoundarXiv 2026AstraNav-World: World Model for Foresight Control and ConsistencyarXiv 2025SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous DrivingarXiv 2026Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object DetectionarXiv 2026MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardwarearXiv 2026Raster2Seq: Polygon Sequence Generation for Floorplan ReconstructionarXiv 2026OmniForcing: Unleashing Real-time Joint Audio-Visual GenerationarXiv 2026"I Didn't Make the Micro Decisions": Measuring, Inducing, and Exposing Goal-Level AI Contributions in CollaborationarXiv 2026Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object TrackingarXiv 2026AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion ModelarXiv 2026Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video GenerationarXiv 2026SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World TasksarXiv 2026EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect ErasingarXiv 2026SceneAligner: 3D-Grounded Floorplan Localization in the WildarXiv 2026UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image DetectionarXiv 2026AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature PromptingarXiv 2026RigidFormer: Learning Rigid Dynamics using TransformersarXiv 2026CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement LearningarXiv 2025Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation ExplainersarXiv 2025ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated WorkspacesarXiv 2026Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-ExpertsarXiv 2026Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement LearningarXiv 2025PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive LearningarXiv 2026Diversity-Preserved Distribution Matching Distillation for Fast Visual SynthesisarXiv 2026ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-ThoughtarXiv 2026Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language ModelsarXiv 2026T5Gemma-TTS Technical ReportarXiv 2026Interactive Evaluation Requires a Design SciencearXiv 2026InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image GenerationarXiv 2026InCoder-32B: Code Foundation Model for Industrial ScenariosarXiv 2026ShowUI-Aloha: Human-Taught GUI AgentarXiv 2026Seg-ReSearch: Segmentation with Interleaved Reasoning and External SearcharXiv 2026Monet: Reasoning in Latent Visual Space Beyond Images and LanguagearXiv 2025Stroke of Surprise: Progressive Semantic Illusions in Vector SketchingarXiv 2026Long Context Pre-Training with Lighthouse AttentionarXiv 2026Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question ReformulationarXiv 2026Wan-Move: Motion-controllable Video Generation via Latent Trajectory GuidancearXiv 2025Learning to Continually Learn via Meta-learning Agentic Memory DesignsarXiv 2026Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?arXiv 2026Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning EngineeringarXiv 2026From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM AgentsarXiv 2026CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security VulnerabilityarXiv 2026EditThinker: Unlocking Iterative Reasoning for Any Image EditorarXiv 2025LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World ModelsarXiv 2026Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill EnsemblesarXiv 2026ToolOrchestra: Elevating Intelligence via Efficient Model and Tool OrchestrationarXiv 2025Meta-learning In-Context Enables Training-Free Cross Subject Brain DecodingarXiv 2026Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE RoutersarXiv 2026SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative TasksarXiv 2026AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding BenchmarkarXiv 2026Soft Adaptive Policy OptimizationarXiv 2025MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity BarrierarXiv 2026Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-RolloutarXiv 2025Shallow-π: Knowledge Distillation for Flow-based VLAsarXiv 2026PersonaVLM: Long-Term Personalized Multimodal LLMsarXiv 2026Semantic Generative Tuning for Unified Multimodal ModelsarXiv 2026TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert OffloadarXiv 2026Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit TrajectoriesarXiv 2026FrontierSmith: Synthesizing Open-Ended Coding Problems at ScalearXiv 2026TEMPO: Scaling Test-time Training for Large Reasoning ModelsarXiv 2026LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial HardeningarXiv 2026HunyuanVideo 1.5 Technical ReportarXiv 2025Real-World Point Tracking with Verifier-Guided Pseudo-LabelingarXiv 2026Stereo World Model: Camera-Guided Stereo Video GenerationarXiv 2026MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image SegmentationarXiv 2026Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language ReasoningarXiv 2025AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World ContextsarXiv 2026LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement ModelsarXiv 2026Can LLMs Predict Their Own Failures? Self-Awareness via Internal CircuitsarXiv 2025Repurposing Geometric Foundation Models for Multi-view DiffusionarXiv 2026LATTICE: Democratize High-Fidelity 3D Generation at ScalearXiv 2025When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial ReasoningarXiv 2026The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified AutoencodingarXiv 2025QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading StrategiesarXiv 2026GigaWorld-0: World Models as Data Engine to Empower Embodied AIarXiv 2025MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM SafetyarXiv 2026DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image GenerationarXiv 2025Debiased Model-based Representations for Sample-efficient Continuous ControlarXiv 2026StereoVLA: Enhancing Vision-Language-Action Models with Stereo VisionarXiv 2025Explaining CLIP Zero-shot Predictions Through ConceptsarXiv 2026AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization AgentsarXiv 2026NGM: A Plug-and-Play Training-Free Memory Module for LLMsarXiv 2026daVinci-LLM:Towards the Science of PretrainingarXiv 2026Steerable Visual RepresentationsarXiv 2026MinT: Managed Infrastructure for Training and Serving Millions of LLMsarXiv 2026D-FINE-seg: Object Detection and Instance Segmentation Framework with multi-backend deploymentarXiv 2026From Holo Pockets to Electron Density: GPT-style Drug Design with DensityarXiv 2026CFG-Ctrl: Control-Based Classifier-Free Diffusion GuidancearXiv 2026ThetaEvolve: Test-time Learning on Open ProblemsarXiv 2025Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensarXiv 2025UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic SparsificationarXiv 2026DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and PlanningarXiv 2026ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning ModelarXiv 2026COP-GEN: Latent Diffusion Transformer for Copernicus Earth Observation DataarXiv 2026Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-TrainingarXiv 2026FireRed-OCR Technical ReportarXiv 2026EasyVideoR1: Easier RL for Video UnderstandingarXiv 2026MedSAM3: Delving into Segment Anything with Medical ConceptsarXiv 2025AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent SystemsarXiv 2026Semantic Audio-Visual Navigation in Continuous EnvironmentsarXiv 2026DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep ResearcharXiv 2025Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video GeneratorarXiv 2026AgentWall: A Runtime Safety Layer for Local AI AgentsarXiv 2026Spatia: Video Generation with Updatable Spatial MemoryarXiv 2025IntentGrasp: A Comprehensive Benchmark for Intent UnderstandingarXiv 2026LongCat-Image Technical ReportarXiv 2025SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational AutoencoderarXiv 2025MEME: Multi-entity & Evolving Memory EvaluationarXiv 2026A Self-Evolving Framework for Efficient Terminal Agents via Observational Context CompressionarXiv 2026Learning POMDP World Models from Observations with Language-Model PriorsarXiv 2026Large-Scale Terminal Agentic Trajectory Generation from Dockerized EnvironmentsarXiv 2026RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic FeedbackarXiv 2026MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video GenerationarXiv 2026CADReasoner: Iterative Program Editing for CAD Reverse EngineeringarXiv 2026ModelLens: Finding the Best for Your Task from Myriads of ModelsarXiv 2026General Agent EvaluationarXiv 2026SERE: Similarity-based Expert Re-routing for Efficient Batch Decoding in MoE ModelsarXiv 2026Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical ConstraintsarXiv 2026CooperBench: Why Coding Agents Cannot be Your Teammates YetarXiv 2026SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?arXiv 2026ViFeEdit: A Video-Free Tuner of Your Video Diffusion TransformerarXiv 2026MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language ModelsarXiv 2026LongVT: Incentivizing "Thinking with Long Videos" via Native Tool CallingarXiv 2025FrankenMotion: Part-level Human Motion Generation and CompositionarXiv 2026Demystifying Video ReasoningarXiv 2026Thoth: Mid-Training Bridges LLMs to Time Series UnderstandingarXiv 2026SkillOrchestra: Learning to Route Agents via Skill TransferarXiv 2026SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous DrivingarXiv 2025LLM2Vec-Gen: Generative Embeddings from Large Language ModelsarXiv 2026DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert ReportarXiv 2026π-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAsarXiv 2026MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video NarrativesarXiv 2025Micro-Defects Expose Macro-Fakes: Detecting AI-Generated Images via Local Distributional ShiftsarXiv 2026CompactAttention: Accelerating Chunked Prefill with Block-Union KV SelectionarXiv 2026MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language ModelsarXiv 2026OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset ValuearXiv 2025MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video GenerationarXiv 2026Fast-SAM3D: 3Dfy Anything in Images but FasterarXiv 2026On-Policy Self-Evolution via Failure Trajectories for Agentic Safety AlignmentarXiv 2026Logical Phase Transitions: Understanding Collapse in LLM Logical ReasoningarXiv 2026VoxMind: An End-to-End Agentic Spoken Dialogue SystemarXiv 2026MEG-XL: Data-Efficient Brain-to-Text via Long-Context Pre-TrainingarXiv 2026DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool UsearXiv 2026PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation ModelsarXiv 2026Agent Banana: High-Fidelity Image Editing with Agentic Thinking and ToolingarXiv 2026Global Rotation Equivariant Phase Modeling for Speech Enhancement with Deep Magnitude-Phase InteractionarXiv 2026MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile RobotsarXiv 2025SAM 3: Segment Anything with ConceptsarXiv 2025Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated ReasoningarXiv 2025RynnVLA-002: A Unified Vision-Language-Action and World ModelarXiv 2025Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple SiliconarXiv 2026ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and ReasoningarXiv 2026RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test TimearXiv 2026Accurate and scalable exchange-correlation with deep learningarXiv 2026Large Language Model Reasoning FailuresarXiv 2026GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance EngineersarXiv 2026TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-TransformersarXiv 2026SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution ScenariosarXiv 2025LatentChem: From Textual CoT to Latent Thinking in Chemical ReasoningarXiv 2026MARBLE: Multi-Aspect Reward Balance for Diffusion RLarXiv 2026PixelSmile: Toward Fine-Grained Facial Expression EditingarXiv 2026Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward ModelingarXiv 2026RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine GenerationarXiv 2026PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated ReasoningarXiv 2026StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory AbstractionarXiv 2026PresentAgent-2: Towards Generalist Multimodal Presentation AgentsarXiv 2026Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive DrafterarXiv 2025How to Correctly Report LLM-as-a-Judge EvaluationsarXiv 2025RoMa v2: Harder Better Faster Denser Feature MatchingarXiv 2025From Word to World: Can Large Language Models be Implicit Text-based World Models?arXiv 2025EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise SettingsarXiv 2026Tucano 2 Cool: Better Open Source LLMs for PortuguesearXiv 2026Protecting Language Models Against Unauthorized Distillation through Trace RewritingarXiv 2026Agent-R1: A Unified and Modular Framework for Agentic Reinforcement LearningarXiv 2025MiMo-Embodied: X-Embodied Foundation Model Technical ReportarXiv 2025DiP: Taming Diffusion Models in Pixel SpacearXiv 2025Context Forcing: Consistent Autoregressive Video Generation with Long ContextarXiv 2026