All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and GenerationarXiv 2025HunyuanImage 3.0 Technical ReportarXiv 2025Fast-dLLM v2: Efficient Block-Diffusion LLMarXiv 2025EvoAgentX: An Automated Framework for Evolving Agentic WorkflowsarXiv 2025Agent KB: Leveraging Cross-Domain Experience for Agentic Problem SolvingarXiv 2025Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RLarXiv 2025LLM Economist: Large Population Models and Mechanism Design in Multi-Agent Generative SimulacraarXiv 2025StreamingVLM: Real-Time Understanding for Infinite Video StreamsarXiv 2025Streaming 4D Visual Geometry TransformerarXiv 2025R-Zero: Self-Evolving Reasoning LLM from Zero DataarXiv 2025PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D
Part UnderstandingarXiv 2025Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM ReasoningarXiv 2025Pixie: Fast and Generalizable Supervised Learning of 3D Physics from PixelsarXiv 2025Kimi Linear: An Expressive, Efficient Attention ArchitecturearXiv 2025TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP
EnvironmentsarXiv 2025Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI AgentsarXiv 2025MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex ScenesarXiv 2025StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context ModelingarXiv 2025Memento: Fine-tuning LLM Agents without Fine-tuning LLMsarXiv 2025Reconstruction Alignment Improves Unified Multimodal ModelsarXiv 2025Interleaving Reasoning for Better Text-to-Image GenerationarXiv 2025WithAnyone: Towards Controllable and ID Consistent Image GenerationarXiv 2025BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research AgentarXiv 2025HPSv3: Towards Wide-Spectrum Human Preference ScoreICCV 2025Scientific Algorithm Discovery by Augmenting AlphaEvolve with Deep
ResearcharXiv 2025UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language InterfacearXiv 2025OmniNWM: Omniscient Driving Navigation World ModelsarXiv 2025MoVieS: Motion-Aware 4D Dynamic View Synthesis in One SecondarXiv 2025Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World ModelarXiv 2025UME-R1: Exploring Reasoning-Driven Generative Multimodal EmbeddingsarXiv 2025Building a Foundational Guardrail for General Agentic Systems via
Synthetic DataarXiv 2025A Survey on Vision-Language-Action Models for Autonomous DrivingarXiv 2025FlowRL: Matching Reward Distributions for LLM ReasoningarXiv 2025Spatial Forcing: Implicit Spatial Representation Alignment for
Vision-language-action ModelarXiv 2025Automating Steering for Safe Multimodal Large Language ModelsarXiv 2025MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP
UsearXiv 2025Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement LearningarXiv 2025HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video
NarrativesarXiv 2025PresentAgent: Multimodal Agent for Presentation Video GenerationarXiv 2025Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and MethodologyarXiv 2025AHELM: A Holistic Evaluation of Audio-Language ModelsarXiv 2025One ruler to measure them all: Benchmarking multilingual long-context language modelsarXiv 2025Waver: Wave Your Way to Lifelike Video GenerationarXiv 2025AWorld: Orchestrating the Training Recipe for Agentic AIarXiv 20253D and 4D World Modeling: A SurveyarXiv 2025Self-Forcing++: Towards Minute-Scale High-Quality Video GenerationarXiv 2025See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned
Aerial NavigationarXiv 2025GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image DatasetarXiv 2025Unimedvl: Unifying Medical Multimodal Understanding And Generation
Through Observation-Knowledge-AnalysisarXiv 2025Beyond Log Likelihood: Probability-Based Objectives for Supervised
Fine-Tuning across the Model Capability ContinuumarXiv 2025MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal EmbeddingsarXiv 2025SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement LearningarXiv 2025LangSplatV2: High-dimensional 3D Language Gaussian Splatting with 450+ FPSarXiv 2025In-the-Flow Agentic System Optimization for Effective Planning and Tool UsearXiv 2025LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video GenerationarXiv 2026Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-CorrectionarXiv 2025We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical ReasoningarXiv 2025Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image GenerationarXiv 2025Latent Chain-of-Thought for Visual ReasoningarXiv 2025Meta CLIP 2: A Worldwide Scaling RecipearXiv 2025ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code GenerationarXiv 2025AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement LearningarXiv 2025SANA-Video: Efficient Video Generation with Block Linear Diffusion
TransformerarXiv 2025USO: Unified Style and Subject-Driven Generation via Disentangled and Reward LearningarXiv 2025PhysX: Physical-Grounded 3D Asset GenerationarXiv 2025Multimodal Referring Segmentation: A SurveyarXiv 2025InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to ManipulationarXiv 2025InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for
Generalist Robot PolicyarXiv 2025Thinking with Camera: A Unified Multimodal Model for Camera-Centric
Understanding and GenerationarXiv 2025ContextGen: Contextual Layout Anchoring for Identity-Consistent
Multi-Instance GenerationarXiv 2025VChain: Chain-of-Visual-Thought for Reasoning in Video GenerationarXiv 2025Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel
ExecutionarXiv 20254KAgent: Agentic Any Image to 4K Super-ResolutionarXiv 2025UniREditBench: A Unified Reasoning-based Image Editing BenchmarkarXiv 2025LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?arXiv 2025Pruning the Unsurprising: Efficient Code Reasoning via First-Token SurprisalarXiv 2025OS Agents: A Survey on MLLM-based Agents for General Computing Devices UsearXiv 2025STream3R: Scalable Sequential 3D Reconstruction with Causal TransformerarXiv 2025OpenCUA: Open Foundations for Computer-Use AgentsarXiv 2025ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language ModelsarXiv 2025UMO: Scaling Multi-Identity Consistency for Image Customization via Matching RewardarXiv 2025SPG: Sandwiched Policy Gradient for Masked Diffusion Language ModelsarXiv 2025WebExplorer: Explore and Evolve for Training Long-Horizon Web AgentsarXiv 2025Learning Few-Step Diffusion Models by Trajectory Distribution MatchingICCV 2025TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive GenerationarXiv 2025MCPEval: Automatic MCP-based Deep Evaluation for AI Agent ModelsarXiv 2025MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing AgentsarXiv 2025Explain Before You Answer: A Survey on Compositional Visual ReasoningarXiv 2025Reasoning with Sampling: Your Base Model is Smarter Than You ThinkarXiv 2025LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech EnhancementarXiv 2025Vlaser: Vision-Language-Action Model with Synergistic Embodied ReasoningarXiv 2025VLA-R1: Enhancing Reasoning in Vision-Language-Action ModelsarXiv 2025Diffusion Language Models are Super Data LearnersarXiv 2025Reconstructing 4D Spatial Intelligence: A SurveyarXiv 2025MedReseacher-R1: Expert-Level Medical Deep Researcher via A
Knowledge-Informed Trajectory Synthesis FrameworkarXiv 2025Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in
MLLMsarXiv 2025Genie Envisioner: A Unified World Foundation Platform for Robotic ManipulationarXiv 2025The Geometry of Reasoning: Flowing Logics in Representation SpacearXiv 2025ChronoEdit: Towards Temporal Reasoning for Image Editing and World
SimulationarXiv 2025Latent Diffusion Model without Variational AutoencoderarXiv 2025AutoIOT: LLM-Driven Automated Natural Language Programming for AIoT ApplicationsarXiv 2025LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal
TrainingarXiv 2025Efficient Agents: Building Effective Agents While Reducing CostarXiv 2025WorldVLA: Towards Autoregressive Action World ModelarXiv 2025Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit ReasoningarXiv 2025VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D SpacearXiv 2025TTT3R: 3D Reconstruction as Test-Time TrainingarXiv 2025SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam?arXiv 2025Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine TranslationarXiv 2025dParallel: Learnable Parallel Decoding for dLLMsarXiv 2025SAIL-VL2 Technical ReportarXiv 2025ExGRPO: Learning to Reason from ExperiencearXiv 2025VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified
Rewards in World SimulatorsarXiv 2025MMKE-Bench: A Multimodal Editing Benchmark for Diverse Visual KnowledgearXiv 2025FlexVAR: Flexible Visual Autoregressive Modeling without Residual PredictionarXiv 2025Visual Autoregressive Modeling for Instruction-Guided Image EditingarXiv 2025VMoBA: Mixture-of-Block Attention for Video Diffusion ModelsarXiv 2025HumanOmniV2: From Understanding to Omni-Modal Reasoning with ContextarXiv 2025Step-Audio 2 Technical ReportarXiv 2025Go to Zero: Towards Zero-shot Motion Generation with Million-scale DataICCV 2025Video-Thinker: Sparking "Thinking with Videos" via Reinforcement
LearningarXiv 2025The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMsarXiv 2025Towards a Unified View of Large Language Model Post-TrainingarXiv 2025Franca: Nested Matryoshka Clustering for Scalable Visual Representation LearningarXiv 20254DNeX: Feed-Forward 4D Generative Modeling Made EasyarXiv 2025OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World ModelingarXiv 2025MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP ServersarXiv 2025OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding
LLMarXiv 2025Where LLM Agents Fail and How They can Learn From FailuresarXiv 2025RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via
Multi-Stage Reinforcement LearningarXiv 2025SEAL: Semantic Aware Image Watermarkingseal-semantic-aware-image-watermarkingEraRAG: Efficient and Incremental Retrieval Augmented Generation for Growing CorporaarXiv 2025FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every LanguagearXiv 2025X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great AgainarXiv 2025Visual Representation Alignment for Multimodal Large Language ModelsarXiv 2025DeepScientist: Advancing Frontier-Pushing Scientific Findings
ProgressivelyarXiv 2025F1: A Vision-Language-Action Model Bridging Understanding and Generation to ActionsarXiv 2025On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic WeightingarXiv 2025Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMsarXiv 2025Discrete Diffusion for Reflective Vision-Language-Action Models in
Autonomous DrivingarXiv 2025TigerLLM -- A Family of Bangla Large Language ModelsarXiv 2025Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified
Self-PlayarXiv 2025CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding TasksarXiv 2025ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and EditingarXiv 2025VisionThink: Smart and Efficient Vision Language Model via Reinforcement LearningarXiv 2025Kwai Keye-VL 1.5 Technical ReportarXiv 2025Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual ReasoningarXiv 2025MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI AgentsarXiv 2025UncTrack: Reliable Visual Object Tracking with Uncertainty-Aware Prototype Memory NetworkarXiv 2025Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVRarXiv 2025ReportBench: Evaluating Deep Research Agents via Academic Survey TasksarXiv 2025From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by
Composing Old OnesarXiv 2025Autoregressive Image Generation with Randomized Parallel DecodingarXiv 2025ScreenCoder: Advancing Visual-to-Code Generation for Front-End Automation via Modular Multimodal AgentsarXiv 2025Ovis2.5 Technical ReportarXiv 2025RLP: Reinforcement as a Pretraining ObjectivearXiv 2025villa-X: Enhancing Latent Action Modeling in Vision-Language-Action ModelsarXiv 2025SparseD: Sparse Attention for Diffusion Language ModelsarXiv 2025OBS-Diff: Accurate Pruning For Diffusion Models in One-ShotarXiv 2025CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome RewardarXiv 2025PICABench: How Far Are We from Physically Realistic Image Editing?arXiv 2025LongSplat: Robust Unposed 3D Gaussian Splatting for Casual Long VideosICCV 2025On the Generalization of SFT: A Reinforcement Learning Perspective with Reward RectificationarXiv 2025Spatial Mental Modeling from Limited ViewsarXiv 2025ETCH: Generalizing Body Fitting to Clothed Humans via Equivariant TightnessICCV 2025Can Language Models Follow Multiple Turns of Entangled Instructions?arXiv 2025Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RLarXiv 2025Grounded Chain-of-Thought for Multimodal Large Language ModelsarXiv 2025SIU3R: Simultaneous Scene Understanding and 3D Reconstruction Beyond Feature AlignmentarXiv 2025Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?ICCV 2025WinT3R: Window-Based Streaming Reconstruction with Camera Token PoolarXiv 2025MoGA: Mixture-of-Groups Attention for End-to-End Long Video GenerationarXiv 2025Cache-to-Cache: Direct Semantic Communication Between Large Language
ModelsarXiv 2025LiveTradeBench: Seeking Real-World Alpha with Large Language ModelsarXiv 2025Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and PerformancearXiv 2025Unified Vision-Language-Action ModelarXiv 2025Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM DiversityarXiv 2025SWE-QA: Can Language Models Answer Repository-level Code Questions?arXiv 2025PixNerd: Pixel Neural Field DiffusionarXiv 2025SceneGen: Single-Image 3D Scene Generation in One Feedforward PassarXiv 2025PyVision: Agentic Vision with Dynamic ToolingarXiv 2025Ovis-U1 Technical ReportarXiv 2025TexVerse: A Universe of 3D Objects with High-Resolution TexturesarXiv 2025CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven
ImagesarXiv 2025Defeating the Training-Inference Mismatch via FP16arXiv 2025On the Theoretical Limitations of Embedding-Based RetrievalarXiv 2025ROSE: Remove Objects with Side Effects in VideosarXiv 2025EditScore: Unlocking Online RL for Image Editing via High-Fidelity
Reward ModelingarXiv 2025OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference LearningarXiv 2025Rethinking Decoder Design: Improving Biomarker Segmentation Using Depth-to-Space Restoration and Residual Linear Attentionrethinking-decoder-design-improving-biomarkerObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian SplattingICCV 2025FlashWorld: High-quality 3D Scene Generation within SecondsarXiv 2025Embodied-R1: Reinforced Embodied Reasoning for General Robotic ManipulationarXiv 2025Tree Search for LLM Agent Reinforcement LearningarXiv 2025MMSearch-R1: Incentivizing LMMs to SearcharXiv 2025UniVerse-1: Unified Audio-Video Generation via Stitching of ExpertsarXiv 2025Thinking with Video: Video Generation as a Promising Multimodal
Reasoning ParadigmarXiv 2025FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame
SpotlightingarXiv 2025Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video GenerationarXiv 2025DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal AlignmentarXiv 2025