All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Ming-UniVision: Joint Image Understanding and Generation with a Unified
Continuous TokenizerarXiv 2025Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale
Thinking ModelarXiv 2025Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned RepresentationsarXiv 2025FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive BenchmarkarXiv 2025SAMed-2: Selective Memory Enhanced Medical Segment Anything ModelarXiv 2025CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement LearningarXiv 2025Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models TrainingarXiv 2025TempFlow-GRPO: When Timing Matters for GRPO in Flow ModelsarXiv 2025EgoX: Egocentric Video Generation from a Single Exocentric VideoarXiv 2025SeC: Advancing Complex Video Object Segmentation via Progressive Concept ConstructionarXiv 2025Depth Anything at Any ConditionarXiv 2025DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose PriorarXiv 2025TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based ModelingarXiv 2025Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal
EvidencearXiv 2025Emergent Hierarchical Reasoning in LLMs through Reinforcement LearningarXiv 2025Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual SearcharXiv 2025A Survey on Efficient Vision-Language-Action ModelsarXiv 2025Speed Always Wins: A Survey on Efficient Architectures for Large Language ModelsarXiv 2025Perception-Aware Policy Optimization for Multimodal ReasoningarXiv 2025RLPR: Extrapolating RLVR to General Domains without VerifiersarXiv 2025CriticLean: Critic-Guided Reinforcement Learning for Mathematical FormalizationarXiv 2025Zebra-CoT: A Dataset for Interleaved Vision Language ReasoningarXiv 2025Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View ScenesarXiv 2025From One to More: Contextual Part Latents for 3D GenerationICCV 2025VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View MemoryICCV 2025The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research IdeasarXiv 2025OmniGen2: Exploration to Advanced Multimodal GenerationarXiv 2025BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via
Balanced Policy Optimization with Adaptive ClippingarXiv 2025Hierarchical Cross-modal Prompt Learning for Vision-Language ModelsICCV 2025Visual Multi-Agent System: Mitigating Hallucination Snowballing via
Visual FlowarXiv 2025Gaussian Variation Field Diffusion for High-fidelity Video-to-4D SynthesisICCV 2025Cut2Next: Generating Next Shot via In-Context TuningarXiv 2025Reasoning in Space via Grounding in the WorldarXiv 2025Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised ModelsarXiv 2025MolmoAct: Action Reasoning Models that can Reason in SpacearXiv 2025Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray AnalysisarXiv 2025Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMsarXiv 2025Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics EmulationarXiv 2025Equilibrium Matching: Generative Modeling with Implicit Energy-Based
ModelsarXiv 2025SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from ExperiencearXiv 2025UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image
GenerationarXiv 2025Efficient Multi-modal Large Language Models via Progressive Consistency
DistillationarXiv 2025From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning AgentsarXiv 2025cAST: Enhancing Code Retrieval-Augmented Generation with Structural Chunking via Abstract Syntax TreearXiv 2025Energy-Based Transformers are Scalable Learners and ThinkersarXiv 2025SMARTIES: Spectrum-Aware Multi-Sensor Auto-Encoder for Remote Sensing ImagesICCV 2025ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World ShortsarXiv 2025The Quest for Generalizable Motion Generation: Data, Model, and
EvaluationarXiv 2025Accurate and Efficient Low-Rank Model Merging in Core SpacearXiv 2025Latent Denoising Makes Good Visual TokenizersarXiv 2025Steering Out-of-Distribution Generalization with Concept Ablation Fine-TuningarXiv 2025InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic LayoutsarXiv 2025Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement LearningarXiv 2025How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven
PerspectivearXiv 2025World-in-World: World Models in a Closed-Loop WorldarXiv 2025Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution LensarXiv 2025Lost in Embeddings: Information Loss in Vision-Language ModelsarXiv 2025NANO3D: A Training-Free Approach for Efficient 3D Editing Without MasksarXiv 2025SWE-Exp: Experience-Driven Software Issue ResolutionarXiv 2025LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMsarXiv 2025SciVideoBench: Benchmarking Scientific Video Reasoning in Large
Multimodal ModelsarXiv 2025Omni-Video: Democratizing Unified Video Understanding and GenerationarXiv 2025Cyber-Zero: Training Cybersecurity Agents without RuntimearXiv 2025Mind2Web 2: Evaluating Agentic Search with Agent-as-a-JudgearXiv 2025Pre-Trained Policy Discriminators are General Reward ModelsarXiv 2025InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech SystemsarXiv 2025Spotlight on Token Perception for Multimodal Reinforcement LearningarXiv 2025AgentSynth: Scalable Task Generation for Generalist Computer-Use AgentsarXiv 2025Mitigating Object Hallucinations via Sentence-Level Early InterventionICCV 2025CoMAS: Co-Evolving Multi-Agent Systems via Interaction RewardsarXiv 2025MOSPA: Human Motion Generation Driven by Spatial AudioarXiv 2025Learning to Optimize Multi-Objective Alignment Through Dynamic Reward WeightingarXiv 2025Thinking Beyond Tokens: From Brain-Inspired Intelligence to Cognitive Foundations for Artificial General Intelligence and its Societal ImpactarXiv 2025ShotBench: Expert-Level Cinematic Understanding in Vision-Language ModelsarXiv 2025ReasonRank: Empowering Passage Ranking with Strong Reasoning AbilityarXiv 2025Auto-Regressively Generating Multi-View Consistent ImagesICCV 2025From AI for Science to Agentic Science: A Survey on Autonomous Scientific DiscoveryarXiv 2025UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and GenerationICCV 2025LMR-BENCH: Evaluating LLM Agent's Ability on Reproducing Language Modeling ResearcharXiv 2025RAG-R1 : Incentivize the Search and Reasoning Capabilities of LLMs through Multi-query ParallelismarXiv 2025XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT ModulationarXiv 2025GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World AnomaliesarXiv 2025MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal
Mathematical ReasoningarXiv 2025IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse RenderingarXiv 2025iLRM: An Iterative Large 3D Reconstruction ModelarXiv 2025Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI SynergyarXiv 2025UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAGarXiv 2025UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and UnderstandingICCV 2025Mesh-Informed Neural Operator : A Transformer Generative ApproacharXiv 2025Uni-MMMU: A Massive Multi-discipline Multimodal Unified BenchmarkarXiv 2025OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene UnderstandingarXiv 2025Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM ReasoningarXiv 2025MOSAIC: Multi-Subject Personalized Generation via Correspondence-Aware Alignment and DisentanglementarXiv 2025DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid TokenizerarXiv 2025HeurAgenix: Leveraging LLMs for Solving Complex Combinatorial Optimization ChallengesarXiv 2025AMO-Bench: Large Language Models Still Struggle in High School Math
CompetitionsarXiv 2025Low-probability Tokens Sustain Exploration in Reinforcement Learning
with Verifiable RewardarXiv 2025UserRL: Training Interactive User-Centric Agent via Reinforcement
LearningarXiv 2025Phantom-Data : Towards a General Subject-Consistent Video Generation DatasetarXiv 2025CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & SparsificationarXiv 2025VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal ReasoningarXiv 2025mmBERT: A Modern Multilingual Encoder with Annealed Language LearningarXiv 2025Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?arXiv 2025Reverse-Engineered Reasoning for Open-Ended GenerationarXiv 2025T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image GenerationarXiv 2025CellForge: Agentic Design of Virtual Cell ModelsarXiv 2025AVoCaDO: An Audiovisual Video Captioner Driven by Temporal OrchestrationarXiv 2025RoboScape: Physics-informed Embodied World ModelarXiv 2025From reactive to cognitive: brain-inspired spatial intelligence for embodied agentsarXiv 2025OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni
MLLMsarXiv 2025Spurious Rewards: Rethinking Training Signals in RLVRarXiv 2025INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization
FormatsarXiv 2025DCPO: Dynamic Clipping Policy OptimizationarXiv 2025MegaScience: Pushing the Frontiers of Post-Training Datasets for Science ReasoningarXiv 2025WAInjectBench: Benchmarking Prompt Injection Detections for Web AgentsarXiv 2025LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMsarXiv 2025Omni-Effects: Unified and Spatially-Controllable Visual Effects GenerationarXiv 2025UserBench: An Interactive Gym Environment for User-Centric AgentsarXiv 2025Diffusion Language Models Know the Answer Before DecodingarXiv 2025Jointly Reinforcing Diversity and Quality in Language Model GenerationsarXiv 2025Visual Jigsaw Post-Training Improves MLLMsarXiv 2025Post-training for Deepfake Speech DetectionarXiv 2025Your Agent May Misevolve: Emergent Risks in Self-evolving LLM AgentsarXiv 2025Geometric-Mean Policy OptimizationarXiv 2025Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research PapersarXiv 2025Human2LocoMan: Learning Versatile Quadrupedal Manipulation with Human PretrainingarXiv 2025InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy OptimizationarXiv 2025InfiniPot-V: Memory-Constrained KV Cache Compression for Streaming Video UnderstandingarXiv 2025Mixing Mechanisms: How Language Models Retrieve Bound Entities In-ContextarXiv 2025VOTE: Vision-Language-Action Optimization with Trajectory Ensemble VotingarXiv 2025Rethinking Query-based Transformer for Continual Image Segmentationrethinking-query-based-transformer-forKnowRL: Exploring Knowledgeable Reinforcement Learning for FactualityarXiv 2025MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and
Open ResourcesarXiv 2025Lumos-1: On Autoregressive Video Generation from a Unified Model PerspectivearXiv 2025RLEP: Reinforcement Learning with Experience Replay for LLM ReasoningarXiv 2025VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative VideosICCV 2025DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code GenerationarXiv 2025ASPO: Asymmetric Importance Sampling Policy OptimizationarXiv 2025FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and ChallengingarXiv 2025LIMI: Less is More for AgencyarXiv 2025SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human GenerationarXiv 2025OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning MitigationarXiv 2025AdaMuon: Adaptive Muon OptimizerarXiv 2025Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with
the MME-CoF BenchmarkarXiv 2025HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI AssistantsarXiv 2025From Editor to Dense Geometry EstimatorarXiv 2025POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document ConversionarXiv 2025rStar2-Agent: Agentic Reasoning Technical ReportarXiv 2025FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion ModelICCV 2025R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningarXiv 2025Sequential Diffusion Language ModelsarXiv 2025How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision TasksarXiv 2025Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and TrendsarXiv 2025TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate ThemarXiv 2025GThinker: Towards General Multimodal Reasoning via Cue-Guided RethinkingarXiv 2025Region-based Cluster Discrimination for Visual Representation LearningICCV 2025EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage DiversityarXiv 2025UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon
ScenariosarXiv 2025Eliciting Secret Knowledge from Language ModelsarXiv 2025RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguardsarXiv 2025AgroBench: Vision-Language Model Benchmark in AgricultureICCV 2025Exploring the Potential of LLMs as Personalized Assistants: Dataset, Evaluation, and AnalysisarXiv 2025Factuality Matters: When Image Generation and Editing Meet Structured
VisualsarXiv 2025Dens3R: A Foundation Model for 3D Geometry PredictionarXiv 2025The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMsarXiv 2025Table-R1: Inference-Time Scaling for Table ReasoningarXiv 2025OJBench: A Competition Level Code Benchmark For Large Language ModelsarXiv 2025VR-Thinker: Boosting Video Reward Models through Thinking-with-Image
ReasoningarXiv 2025Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data ContaminationarXiv 2025ReForm: Reflective Autoformalization with Prospective Bounded Sequence
OptimizationarXiv 2025TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images
ReasoningarXiv 2025Sotopia-RL: Reward Design for Social IntelligencearXiv 2025VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in VideosarXiv 2025Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal
Reasoning in MLLMsarXiv 2025ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid MotionsarXiv 2025Adaptive Classifier-Free Guidance via Dynamic Low-Confidence MaskingarXiv 2025Beyond Correctness: Harmonizing Process and Outcome Rewards through RL TrainingarXiv 2025SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMsICCV 2025The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable RewardarXiv 2025Meta SecAlign: A Secure Foundation LLM Against Prompt Injection AttacksarXiv 2025ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMsarXiv 2025TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement LearningarXiv 2025Time Blindness: Why Video-Language Models Can't See What Humans Can?arXiv 2025TADA: Training-free Attribution and Out-of-Domain Detection of Audio DeepfakesarXiv 2025CE-GPPO: Controlling Entropy via Gradient-Preserving Clipping Policy
Optimization in Reinforcement LearningarXiv 2025Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional ChinesearXiv 2025SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?arXiv 2025TalkPlay-Tools: Conversational Music Recommendation with LLM Tool
CallingarXiv 2025SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics ReasoningarXiv 2025REARANK: Reasoning Re-ranking Agent via Reinforcement LearningarXiv 2025Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional EffectivenessarXiv 2025LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-TuningarXiv 2025Adaptive Graph Pruning for Multi-Agent CommunicationarXiv 2025Let LLMs Break Free from Overthinking via Self-Braking TuningarXiv 2025CLEVER: A Curated Benchmark for Formally Verified Code GenerationarXiv 2025GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection BehaviorarXiv 2025SWE-Debate: Competitive Multi-Agent Debate for Software Issue ResolutionarXiv 2025EditP23: 3D Editing via Propagation of Image Prompts to Multi-ViewarXiv 2025GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action ControlarXiv 2025SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering AgentsarXiv 2025