All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM ReasoningarXiv 2025EgoSim: An Egocentric Multi-view Simulator and Real Dataset for Body-worn Cameras during Motion and ActivityarXiv 2025Science-T2I: Addressing Scientific Illusions in Image SynthesisCVPR 2025 1Antidistillation SamplingarXiv 2025UncAD: Towards Safe End-to-end Autonomous Driving via Online Map UncertaintyarXiv 2025Safe LLM-Controlled Robots with Formal Guarantees via Reachability AnalysisarXiv 2025Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path SupervisionarXiv 2025LADDER: Self-Improving LLMs Through Recursive Problem DecompositionarXiv 2025Implicit Reasoning in Transformers is Reasoning through ShortcutsarXiv 2025ROCKET-2: Steering Visuomotor Policy via Cross-View Goal AlignmentarXiv 2025Better Process Supervision with Bi-directional Rewarding SignalsarXiv 2025S2S-Arena, Evaluating Speech2Speech Protocols on Instruction Following with Paralinguistic InformationarXiv 2025Understanding the Limits of Lifelong Knowledge Editing in LLMsarXiv 2025LazyReview A Dataset for Uncovering Lazy Thinking in NLP Peer ReviewsarXiv 2025Painting with Words: Elevating Detailed Image Captioning with Benchmark and Alignment LearningarXiv 2025Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoningtwo-heads-are-better-than-one-test-timeMavors: Multi-granularity Video Representation for Multimodal Large Language ModelarXiv 2025MultiLoKo: a multilingual local knowledge benchmark for LLMs spanning 31 languagesarXiv 2025BiasEdit: Debiasing Stereotyped Language Models via Model EditingarXiv 2025GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent TrainingICCV 2025Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human FeedbackarXiv 2025Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical InvestigationarXiv 2025CULEMO: Cultural Lenses on Emotion -- Benchmarking LLMs for Cross-Cultural Emotion UnderstandingarXiv 2025KV-Distill: Nearly Lossless Learnable Context Compression for LLMsarXiv 2025RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video ModelsICCV 2025CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM EraarXiv 2025Personalize Anything for Free with Diffusion TransformerarXiv 2025Reward-Instruct: A Reward-Centric Approach to Fast Photo-Realistic Image GenerationarXiv 2025VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User InteractionsarXiv 2026Reinforcement Learning via Self-DistillationarXiv 2026OpenComputer: Verifiable Software Worlds for Computer-Use AgentsarXiv 2026Self-Distillation Enables Continual LearningarXiv 2026TurboDiffusion: Accelerating Video Diffusion Models by 100-200 TimesarXiv 2025AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMsarXiv 2026CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?arXiv 2026AutoFigure: Generating and Refining Publication-Ready Scientific IllustrationsarXiv 2026Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time ScalingarXiv 2026Balancing Fidelity and Diversity in Diffusion Models via Symmetric Attention Decomposition: Hopfield PerspectivearXiv 2026Advancing Open-source World ModelsarXiv 2026CodeTracer: Towards Traceable Agent StatesarXiv 2026LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced ColleaguesarXiv 2026TerminalWorld: Benchmarking Agents on Real-World Terminal TasksarXiv 2026HumanNet: Scaling Human-centric Video Learning to One Million HoursarXiv 2026OneThinker: All-in-one Reasoning Model for Image and VideoarXiv 2025Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and GroundingarXiv 2026Equilibrium Reasoners: Learning Attractors Enables Scalable ReasoningarXiv 2026dLLM: Simple Diffusion Language ModelingarXiv 2026Innovator-VL: A Multimodal Large Language Model for Scientific DiscoveryarXiv 2026LongVideoAgent: Multi-Agent Reasoning with Long VideosarXiv 2025Claw-Eval: Toward Trustworthy Evaluation of Autonomous AgentsarXiv 2026PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality DatasetarXiv 2026CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic ReasoningarXiv 2026NeoVerse: Enhancing 4D World Model with in-the-wild Monocular VideosarXiv 2026Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-trainingarXiv 2026TerraScope: Pixel-Grounded Visual Reasoning for Earth ObservationarXiv 2026Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation ModelarXiv 2026REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search AgentsarXiv 2026FireRed-Image-Edit-1.0 Techinical ReportarXiv 2026Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive RecipearXiv 2026TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for RoboticsarXiv 2026HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D WorldsarXiv 2026Efficient Universal Perception EncoderarXiv 2026UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World ModelingarXiv 2026A Survey of Large Audio Language Models: Generalization, Trustworthiness, and OutlookarXiv 2026Gen-Searcher: Reinforcing Agentic Search for Image GenerationarXiv 20264RC: 4D Reconstruction via Conditional Querying Anytime and AnywherearXiv 2026Sapiens2arXiv 2026RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing ModelsarXiv 2026Learning Sim-to-Real Humanoid Locomotion in 15 MinutesarXiv 2025RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL SystemarXiv 2026VLASH: Real-Time VLAs via Future-State-Aware Asynchronous InferencearXiv 2025LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AVarXiv 2026X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and InteractionarXiv 2026Yume-1.5: A Text-Controlled Interactive World Generation ModelarXiv 2025Learning Agentic Policy from Action GuidancearXiv 2026Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement LearningarXiv 2026WildDet3D: Scaling Promptable 3D Detection in the WildarXiv 2026Internal Safety Collapse in Frontier Large Language ModelsarXiv 2026GigaWorld-Policy: An Efficient Action-Centered World--Action ModelarXiv 2026Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM SystemsarXiv 2026MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent MemoryarXiv 2026Solaris: Building a Multiplayer Video World Model in MinecraftarXiv 2026daVinci-Env: Open SWE Environment Synthesis at ScalearXiv 2026Any to Full: Prompting Depth Anything for Depth Completion in One StagearXiv 2026LitePT: Lighter Yet Stronger Point TransformerarXiv 2025WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World ModelingarXiv 2025TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous AgentsarXiv 2026Grounding World Simulation Models in a Real-World MetropolisarXiv 2026MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage GenerationarXiv 2026MoCapAnything V2: End-to-End Motion Capture for Arbitrary SkeletonsarXiv 2026MAIC-UI: Making Interactive Courseware with Generative UIarXiv 2026CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied IntelligencearXiv 2026SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image GenerationarXiv 2026Awaking Spatial Intelligence in Unified Multimodal Understanding and GenerationarXiv 2026From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language ModelsarXiv 2026PEEK: Context Map as an Orientation Cache for Long-Context LLM AgentsarXiv 2026OpenWorldLib: A Unified Codebase and Definition of Advanced World ModelsarXiv 2026SignRoundV2: Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMsarXiv 2025Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence TransformationarXiv 2026Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon AgentsarXiv 2026Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active ParametersarXiv 2026GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience DistillationarXiv 2026ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold LearningarXiv 2026Can AI Agents Answer Your Data Questions? A Benchmark for Data AgentsarXiv 2026HY-Embodied-0.5: Embodied Foundation Models for Real-World AgentsarXiv 2026The Latent Space: Foundation, Evolution, Mechanism, Ability, and OutlookarXiv 2026Gen3R: 3D Scene Generation Meets Feed-Forward ReconstructionarXiv 2026Position: Agentic Evolution is the Path to Evolving LLMsarXiv 2026OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded ReasoningarXiv 2026TriAttention: Efficient Long Reasoning with Trigonometric KV CompressionarXiv 2026EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RLarXiv 2026Stage-adaptive Token Selection for Efficient Omni-modal LLMsarXiv 2026Aurora: Unified Video Editing with a Tool-Using AgentarXiv 2026RynnBrain: Open Embodied Foundation ModelsarXiv 2026General Multimodal Protein Design Enables DNA-Encoding of ChemistryarXiv 2026Learning to Retrieve from Agent TrajectoriesarXiv 2026N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language ModelsarXiv 2025Reinforcing Few-step Generators via Reward-Tilted Distribution MatchingarXiv 2026Stream-T1: Test-Time Scaling for Streaming Video GenerationarXiv 2026Attention ResidualsarXiv 2026OmniShotCut: Holistic Relational Shot Boundary Detection with Shot-Query TransformerarXiv 2026InternVLA-A1: Unifying Understanding, Generation and Action for Robotic ManipulationarXiv 2026SAMTok: Representing Any Mask with Two WordsarXiv 2026ShapeR: Robust Conditional 3D Shape Generation from Casual CapturesarXiv 2026Unified Camera Positional Encoding for Controlled Video GenerationarXiv 2025DynamicVLA: A Vision-Language-Action Model for Dynamic Object ManipulationarXiv 2026SWE-Lego: Pushing the Limits of Supervised Fine-tuning for Software Issue ResolvingarXiv 2026Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative CompressionarXiv 2025SimVLA: A Simple VLA Baseline for Robotic ManipulationarXiv 2026OmniWeaving: Towards Unified Video Generation with Free-form Composition and ReasoningarXiv 2026Step-DeepResearch Technical ReportarXiv 2025GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement LearningarXiv 2026Anticipate and Learn: Unleashing Idle-Time Compute in Proactive AgentsarXiv 2026Channel-wise Vector QuantizationarXiv 2026MotiMotion: Motion-Controlled Video Generation with Visual ReasoningarXiv 2026CoSPlay: Cooperative Self-Play at Test-Time with Self-Generated Code and Unit TestarXiv 2026Accelerating Streaming Video Large Language Models via Hierarchical Token CompressionarXiv 2025Orchard: An Open-Source Agentic Modeling FrameworkarXiv 2026Step-Audio-R1.5 Technical ReportarXiv 2026RAGEN-2: Reasoning Collapse in Agentic RLarXiv 2026One-Eval: An Agentic System for Automated and Traceable LLM EvaluationarXiv 2026ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRAarXiv 2026Flash-KMeans: Fast and Memory-Efficient Exact K-MeansarXiv 2026From Context to Skills: Can Language Models Learn from Context Skillfully?arXiv 2026SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive WeightingarXiv 2026Towards Embodied AI with MuscleMimic: Unlocking full-body musculoskeletal motor learning at scalearXiv 2026SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness EngineeringarXiv 2026UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion PriorsarXiv 2026CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel GenerationarXiv 2026BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM EvaluationarXiv 2026ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI AgentsarXiv 2026SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous IntegrationarXiv 2026SketchVLM: Vision language models can annotate images to explain thoughts and guide usersarXiv 2026OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone EnvironmentsarXiv 2026World-R1: Reinforcing 3D Constraints for Text-to-Video GenerationarXiv 2026CutClaw: Agentic Hours-Long Video Editing via Music SynchronizationarXiv 2026IQuest-Coder-V1 Technical ReportarXiv 2026A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon AgentsarXiv 2026IndexCache: Accelerating Sparse Attention via Cross-Layer Index ReusearXiv 2026Prompt Relay: Inference-Time Temporal Control for Multi-Event Video GenerationarXiv 2026HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search AgentsarXiv 2026LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent ReasoningarXiv 2026The DAWN of World-Action Interactive ModelsarXiv 2026Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal MathematicsarXiv 2026Geometry-Grounded Gaussian SplattingarXiv 2026Dispersion Loss Counteracts Embedding Condensation and Improves Generalization in Small Language ModelsarXiv 2026SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous AgentsarXiv 2026RedSage: A Cybersecurity Generalist LLMarXiv 2026MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and RetrievalarXiv 2026KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic ExplorationarXiv 2026OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video UnderstandingarXiv 2026OmniGAIA: Towards Native Omni-Modal AI AgentsarXiv 2026FASTER: Rethinking Real-Time Flow VLAsarXiv 2026Learning a Generative Meta-Model of LLM ActivationsarXiv 2026Repurposing 3D Generative Model for Autoregressive Layout GenerationarXiv 2026χ_{0}: Resource-Aware Robust Manipulation via Taming Distributional InconsistenciesarXiv 2026DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable RewardsarXiv 2026DARE: Diffusion Large Language Models Alignment and Reinforcement ExecutorarXiv 2026Latent Particle World Models: Self-supervised Object-centric Stochastic Dynamics ModelingarXiv 2026Matérn Noise for Triangulation-Agnostic Flow Matching on MeshesarXiv 2026AutoResearch AI: Towards AI-Powered Research Automation for Scientific DiscoveryarXiv 2026Auditing Agent Harness SafetyarXiv 2026DVGT: Driving Visual Geometry TransformerarXiv 2025FrontierCS: Evolving Challenges for Evolving IntelligencearXiv 2025Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite LengtharXiv 2025Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment GeneralizationarXiv 2026Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent PretrainingarXiv 2026Idea2Story: An Automated Pipeline for Transforming Research Concepts into Complete Scientific NarrativesarXiv 2026Agentic World Modeling: Foundations, Capabilities, Laws, and BeyondarXiv 2026Hierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics ModelingarXiv 2026SWE-Milestone: Evaluating AI Agents on Continuous Software EvolutionarXiv 2026Towards Generalizable Robotic Manipulation in Dynamic EnvironmentsarXiv 2026LoGeR: Long-Context Geometric Reconstruction with Hybrid MemoryarXiv 2026DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open DataarXiv 2026Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital WorldarXiv 2026d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory DistillationarXiv 2026AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel OptimizationarXiv 2026Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability LearningarXiv 2026DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI AgentsarXiv 2026CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene CoveragearXiv 2026