All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon LayersarXiv 2025V-DPM: 4D Video Reconstruction with Dynamic Point MapsarXiv 2026End-to-End Test-Time Training for Long ContextarXiv 2025AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature DiscoveryarXiv 2026PianoCoRe: Combined and Refined Piano MIDI DatasetarXiv 2026Representation Fréchet Loss for Visual GenerationarXiv 2026Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End DrivingarXiv 2026InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous AgentsarXiv 2026Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural ConversationarXiv 2026AI Can Learn Scientific TastearXiv 2026Fast-FoundationStereo: Real-Time Zero-Shot Stereo MatchingarXiv 2025Test-Time Training with KV Binding Is Secretly Linear AttentionarXiv 2026Towards a Science of AI Agent ReliabilityarXiv 2026GameDevBench: Evaluating Agentic Capabilities Through Game DevelopmentarXiv 2026Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoringarXiv 2026FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition SystemarXiv 20264DThinker: Thinking with 4D Imagery for Dynamic Spatial UnderstandingarXiv 2026Your Embedding Model is SMARTer Than You ThinkarXiv 2026MeshSplatting: Differentiable Rendering with Opaque MeshesarXiv 2025AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image AlignmentarXiv 2026UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous DrivingarXiv 2026Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVRarXiv 2026Minimalist Visual Inertial OdometryarXiv 2026Agent-as-a-JudgearXiv 2026Much Ado About Noising: Dispelling the Myths of Generative Robotic ControlarXiv 2025Autoregressive Image Generation with Masked Bit ModelingarXiv 2026Toward Efficient Agents: Memory, Tool learning, and PlanningarXiv 2026SkillNet: Create, Evaluate, and Connect AI SkillsarXiv 2026ViVa: A Video-Generative Value Model for Robot Reinforcement LearningarXiv 2026MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation ModelsarXiv 2026TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMsarXiv 2025Sci-CoE: Co-evolving Scientific Reasoning LLMs via Geometric Consensus with Sparse SupervisionarXiv 2026SKILL0: In-Context Agentic Reinforcement Learning for Skill InternalizationarXiv 2026UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and TexturearXiv 2025ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and FeedbackarXiv 2026RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian SplattingarXiv 2026Feed-Forward 3D Scene Modeling: A Problem-Driven PerspectivearXiv 2026Learning Versatile Humanoid Manipulation with Touch DreamingarXiv 2026Lost in Stories: Consistency Bugs in Long Story Generation by LLMsarXiv 2026Targeted Neuron Modulation via Contrastive Pair SearcharXiv 2026HY3D-Bench: Generation of 3D AssetsarXiv 2026Incantation: Natural Language as the Action Interface for Multi-Entity Video World ModelsarXiv 2026Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent SkillsarXiv 2026Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical MemoryarXiv 2026Anisotropic Modality AlignarXiv 2026OpenSearch-VL: An Open Recipe for Frontier Multimodal Search AgentsarXiv 2026INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive ModelingarXiv 2026DrawMotion: Generating 3D Human Motions by Freehand DrawingarXiv 2026VidEoMT: Your ViT is Secretly Also a Video Segmentation ModelarXiv 2026EquiformerV3: Scaling Efficient, Expressive, and General SE(3)-Equivariant Graph Attention TransformersarXiv 2026EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic SynthesisarXiv 2026MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered AssistantsarXiv 2026See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object UnderstandingarXiv 2026Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?arXiv 2026Fast Spatial Memory with Elastic Test-Time TrainingarXiv 2026DVD: Deterministic Video Depth Estimation with Generative PriorsarXiv 2026ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied NavigationarXiv 2026Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language ModelsarXiv 2026AIDABench: AI Data Analytics BenchmarkarXiv 2026Solve the Loop: Attractor Models for Language and ReasoningarXiv 2026MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AIarXiv 2026Strips as Tokens: Artist Mesh Generation with Native UV SegmentationarXiv 2026How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic SettingsarXiv 2026WAFT-Stereo: Warping-Alone Field Transforms for Stereo MatchingarXiv 2026GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal AgentsarXiv 2026π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon WorkflowsarXiv 2026AOrchestra: Automating Sub-Agent Creation for Agentic OrchestrationarXiv 2026HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action ModelsarXiv 2025On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language ModelsarXiv 2025MultiWorld: Scalable Multi-Agent Multi-View Video World ModelsarXiv 2026Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language ModelsarXiv 2026SuperOcc: Toward Cohesive Temporal Modeling for Superquadric-based Occupancy PredictionarXiv 2026Deep Whole-body ParkourarXiv 2026Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal InteractionarXiv 2026CL-bench: A Benchmark for Context LearningarXiv 2026Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground TrutharXiv 2026Manifold-Aware Exploration for Reinforcement Learning in Video GenerationarXiv 2026Video Streaming Thinking: VideoLLMs Can Watch and Think SimultaneouslyarXiv 2026LLaDA2.1: Speeding Up Text Diffusion via Token EditingarXiv 2026WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous DrivingarXiv 2025Contact-Anchored Proprioceptive Odometry for Quadruped RobotsarXiv 2026What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent DiffusionarXiv 2026BOOKMARKS: Efficient Active Storyline Memory for Role-playingarXiv 2026Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion ModelsarXiv 2026ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action ModelsarXiv 2026DROID-SLAM in the WildarXiv 2026RefineAnything: Multimodal Region-Specific Refinement for Perfect Local DetailsarXiv 2026Building AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons LearnedarXiv 2026LLaDA2.0: Scaling Up Diffusion Language Models to 100BarXiv 2025Towards Scalable Pre-training of Visual Tokenizers for GenerationarXiv 2025ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use AgentsarXiv 2026MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud AgentsarXiv 2026Embarrassingly Simple Self-Distillation Improves Code GenerationarXiv 2026EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at ScalearXiv 2026Revisiting the Platonic Representation Hypothesis: An Aristotelian ViewarXiv 2026AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and SecurityarXiv 2026XSkill: Continual Learning from Experience and Skills in Multimodal AgentsarXiv 2026Learning Visual Feature-Based World Models via Residual Latent ActionarXiv 2026Geo-Align: Video Generation Alignment via Metric Geometry RewardarXiv 2026PhotoFlow: Agentic 3D Virtual Photography MissionsarXiv 2026GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment SimulatorsarXiv 2025WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric RepresentationarXiv 2026ThoughtTrace: Understanding User Thoughts in Real-World LLM InteractionsarXiv 2026AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level ContextarXiv 2026Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended TasksarXiv 2026Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite ImagearXiv 2026Does Synthetic Layered Design Data Benefit Layered Design Decomposition?arXiv 2026Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model DevelopmentarXiv 2026TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route GenerationarXiv 2026Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test GenerationarXiv 2026OProver: A Unified Framework for Agentic Formal Theorem ProvingarXiv 2026A Simple Baseline for Streaming Video UnderstandingarXiv 2026UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated SupervisionarXiv 2026An Empirical Study of Automating Agent EvaluationarXiv 2026TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D TrackingarXiv 2026Mobile-GS: Real-time Gaussian Splatting for Mobile DevicesarXiv 2026dtour: a steerable tour de vis through high-dimensional dataarXiv 2026UniRecGen: Unifying Multi-View 3D Reconstruction and GenerationarXiv 2026MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPUarXiv 2026Continuous-Time Distribution Matching for Few-Step Diffusion DistillationarXiv 2026Scientific reasoning does not reliably translate into scientific forecasting in frontier AIarXiv 2026Attention Sink in Transformers: A Survey on Utilization, Interpretation, and MitigationarXiv 2026Q-ARVD: Quantizing Autoregressive Video Diffusion ModelsarXiv 2026Accelerating Speculative Decoding with Block Diffusion Draft TreesarXiv 2026Follow the Mean: Reference-Guided Flow MatchingarXiv 2026PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual WorldarXiv 2026PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View ReasoningarXiv 2025Forecasting Downstream Performance of LLMs With Proxy MetricsarXiv 2026LongCat-Flash-Thinking-2601 Technical ReportarXiv 2026Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal PerceptionarXiv 2026The Y-Combinator for LLMs: Solving Long-Context Rot with λ-CalculusarXiv 2026Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse AutoencodersarXiv 2026SimScale: Learning to Drive via Real-World Simulation at ScalearXiv 2025LongCat-Next: Lexicalizing Modalities as Discrete TokensarXiv 2026DM4CT: Benchmarking Diffusion Models for Computed Tomography ReconstructionarXiv 2026Neural Thickets: Diverse Task Experts Are Dense Around Pretrained WeightsarXiv 2026Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and OutputsarXiv 2026Kiwi-Edit: Versatile Video Editing via Instruction and Reference GuidancearXiv 2026VideoFlexTok: Flexible-Length Coarse-to-Fine Video TokenizationarXiv 2026AI4SLT: Empirical Processes in Lean 4 for Formal Statistical Learning TheoryarXiv 2026Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian SplattingarXiv 2026Revisiting Text Ranking in Deep ResearcharXiv 2026LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action AlignmentarXiv 2026Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry TransformersarXiv 2026ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement ArenasarXiv 2026KinDER: A Physical Reasoning Benchmark for Robot Learning and PlanningarXiv 2026PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant AttacksarXiv 2026KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM ServingarXiv 2026AURA: Always-On Understanding and Real-Time Assistance via Video StreamsarXiv 2026LoL: Longer than Longer, Scaling Video Generation to HourarXiv 2026OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMsarXiv 2026Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action ModelsarXiv 2026The Assistant Axis: Situating and Stabilizing the Default Persona of Language ModelsarXiv 2026Spectral Attention Steering for Prompt HighlightingarXiv 2026Dynamic Skill Lifecycle Management for Agentic Reinforcement LearningarXiv 2026DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion TransformerarXiv 2026PhysBrain 1.0 Technical ReportarXiv 2026CEPO: RLVR Self-Distillation using Contrastive Evidence Policy OptimizationarXiv 2026Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-MakingarXiv 2026UNIGEOCLIP: Unified Geospatial Contrastive LearningarXiv 2026LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement LearningarXiv 2026FlashSampling: Fast and Memory-Efficient Exact SamplingarXiv 2026IntentVLA: Short-Horizon Intent Modeling for Aliased Robot ManipulationarXiv 2026SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion ModelsarXiv 2026Tracking Capabilities for Safer AgentsarXiv 2026Vision-Language-Action Safety: Threats, Challenges, Evaluations, and MechanismsarXiv 2026LawThinker: A Deep Research Legal Agent in Dynamic EnvironmentsarXiv 2026ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker AgentsarXiv 2026ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object InteractionsarXiv 2026Revisiting On-Policy Distillation: Empirical Failure Modes and Simple FixesarXiv 2026LPNSR: Prior-Enhanced Diffusion Image Super-Resolution via LR-Guided Noise PredictionarXiv 2026Proact-VL: A Proactive VideoLLM for Real-Time AI CompanionsarXiv 2026Interpretable Embeddings with Sparse Autoencoders: A Data Analysis ToolkitarXiv 2025Generative World RendererarXiv 2026SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable WorldsarXiv 2026On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientistsarXiv 20263D-RE-GEN: 3D Reconstruction of Indoor Scenes with a Generative FrameworkarXiv 2025Guiding a Diffusion Transformer with the Internal Dynamics of ItselfarXiv 2025LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?arXiv 2026K-EXAONE Technical ReportarXiv 2026MAGMA: A Multi-Graph based Agentic Memory Architecture for AI AgentsarXiv 2026Base Models Look Human To AI DetectorsarXiv 2026ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative RankingarXiv 2026ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled IlluminationarXiv 2026Make Each Token Count: Towards Improving Long-Context Performance with KV Cache EvictionarXiv 2026VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint LayerarXiv 2025MultiShotMaster: A Controllable Multi-Shot Video Generation FrameworkarXiv 2025XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural SensitivityarXiv 2026POINTS-GUI-G: GUI-Grounding JourneyarXiv 2026HEARTS: Benchmarking LLM Reasoning on Health Time SeriesarXiv 2026Sparking Scientific Creativity via LLM-Driven Interdisciplinary InspirationarXiv 2026BabyVision: Visual Reasoning Beyond LanguagearXiv 2026SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation ModelarXiv 2025Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the ShieldarXiv 2025Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion TransformerarXiv 2025OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video EditingarXiv 2025Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem ScalearXiv 2026WorldCache: Accelerating World Models for Free via Heterogeneous Token CachingarXiv 2026RewardHarness: Self-Evolving Agentic Post-TrainingarXiv 2026T^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement LearningarXiv 2026