All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive LearningarXiv 2025FinalMLP: An Enhanced Two-Stream MLP Model for CTR Predictionfinalmlp-an-enhanced-two-stream-mlp-model-forUltraGCN: Ultra Simplification of Graph Convolutional Networks for RecommendationarXiv 2021SimpleX: A Simple and Strong Baseline for Collaborative FilteringarXiv 2021ScaleDepth: Decomposing Metric Depth Estimation into Scale Prediction and Relative Depth EstimationarXiv 2024Librispeech Transducer Model with Internal Language Model Prior CorrectionarXiv 2021Why does CTC result in peaky behavior?arXiv 2021Monotonic segmental attention for automatic speech recognitionarXiv 2022Predictable Scale: Part I -- Optimal Hyperparameter Scaling Law in Large Language Model PretrainingarXiv 2025MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet ServicesarXiv 2022Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge GenerationarXiv 2025Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth FusionCVPR 2025 1Learning Harmonized Representations for Speculative SamplingarXiv 2024HUMOTO: A 4D Dataset of Mocap Human Object InteractionsICCV 2025Taming the Titans: A Survey of Efficient LLM Inference ServingarXiv 2025UniCombine: Unified Multi-Conditional Combination with Diffusion TransformerICCV 2025GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Modelsgrpo-lead-a-difficulty-aware-reinforcementMME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMsarXiv 2025ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement LearningarXiv 2025Adversarial Attacks against Closed-Source MLLMs via Feature Optimal AlignmentarXiv 2025Neural LightRig: Unlocking Accurate Object Normal and Material Estimation with Multi-Light DiffusionCVPR 2025 1UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI AgentsarXiv 2025FreeScale: Unleashing the Resolution of Diffusion Models via Tuning-Free Scale FusionICCV 2025GALLa: Graph Aligned Large Language Models for Improved Source Code UnderstandingarXiv 2024CP-Guard: Malicious Agent Detection and Defense in Collaborative Bird's Eye View PerceptionarXiv 2024StructEval: Benchmarking LLMs' Capabilities to Generate Structural OutputsarXiv 2025MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning ResearcharXiv 2025SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and BeyondarXiv 2025Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control SignalsarXiv 2025Fast-Slow Thinking for Large Vision-Language Model ReasoningarXiv 2025Reinforcement Learning Teachers of Test Time ScalingarXiv 2025MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual EncodersCVPR 2025 1The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMsarXiv 2025ReFocus: Visual Editing as a Chain of Thought for Structured Image UnderstandingarXiv 2025Can Multimodal Large Language Models Understand Spatial Relations?arXiv 2025Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question AnsweringarXiv 2025Robust Change Captioning in Remote Sensing: SECOND-CC Dataset and MModalCC FrameworkarXiv 2025MIFNet: Learning Modality-Invariant Features for Generalizable Multimodal Image MatchingarXiv 2025ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory LearningarXiv 2024IRIS: Interactive Research Ideation System for Accelerating Scientific DiscoveryarXiv 2025FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual RegistersICCV 2025T-JEPA: Augmentation-Free Self-Supervised Learning for Tabular DataarXiv 2024WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement LearningarXiv 2025Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest QuestionsarXiv 2025Play to Generalize: Learning to Reason Through Game PlayarXiv 2025DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPOarXiv 2025Learning Adaptive Parallel Reasoning with Language ModelsarXiv 2025Teaching Language Models to Critique via Reinforcement LearningarXiv 2025One2Any: One-Reference 6D Pose Estimation for Any ObjectCVPR 2025 1AuraFusion360: Augmented Unseen Region Alignment for Reference-based 360° Unbounded Scene InpaintingarXiv 2025The Curse of Depth in Large Language ModelsarXiv 2025GAS: Generative Avatar Synthesis from a Single ImageICCV 2025NatureLM: Deciphering the Language of Nature for Scientific DiscoveryarXiv 2025Value-Guided Search for Efficient Chain-of-Thought ReasoningarXiv 2025DanceTogether! Identity-Preserving Multi-Person Interactive Video GenerationarXiv 2025SelfCite: Self-Supervised Alignment for Context Attribution in Large Language ModelsarXiv 2025VeriThinker: Learning to Verify Makes Reasoning Model EfficientarXiv 2025SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine UnlearningarXiv 2025Mol-LLaMA: Towards General Understanding of Molecules in Large Molecular Language ModelarXiv 2025FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative SamplingarXiv 2025Know You First and Be You Better: Modeling Human-Like User Simulators via Implicit ProfilesarXiv 2025ARPO:End-to-End Policy Optimization for GUI Agents with Experience ReplayarXiv 2025ChemMLLM: Chemical Multimodal Large Language ModelarXiv 2025AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic ScenariosarXiv 2025Benchmarking Retrieval-Augmented Multimomal Generation for Document Question AnsweringarXiv 2025Multi-Step Visual Reasoning with Visual Tokens Scaling and VerificationarXiv 2025Adversarial Paraphrasing: A Universal Attack for Humanizing AI-Generated TextarXiv 2025Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement LearningarXiv 2025LARP: Tokenizing Videos with a Learned Autoregressive Generative Priorlarp-tokenizing-videos-with-a-learnedBabel: Open Multilingual Large Language Models Serving Over 90% of Global SpeakersarXiv 2025OpenSatMap: A Fine-grained High-resolution Satellite Dataset for Large-scale Map ConstructionarXiv 2024Vision-Language Models Can Self-Improve Reasoning via ReflectionarXiv 2024Progent: Programmable Privilege Control for LLM AgentsarXiv 2025CRAKEN: Cybersecurity LLM Agent with Knowledge-Based ExecutionarXiv 2025Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual CounterfactsarXiv 2025Learn to Reason Efficiently with Adaptive Length-based Reward ShapingarXiv 2025LION-FS: Fast & Slow Video-Language Thinker as Online Video AssistantCVPR 2025 1MVPaint: Synchronized Multi-View Diffusion for Painting Anything 3DCVPR 2025 1Adaptive Caching for Faster Video Generation with Diffusion TransformersICCV 2025Video Action DifferencingarXiv 2025ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?arXiv 2024MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement LearningarXiv 2025RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge InjectionarXiv 2025TinyV: Reducing False Negatives in Verification Improves RL for LLM ReasoningarXiv 2025VideoEval-Pro: Robust and Realistic Long Video Understanding EvaluationarXiv 2025LLaVA-OneVision-2: Towards Next-Generation Perceptual IntelligencearXiv 2026Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question AnsweringarXiv 2024Distilling Diversity and Control in Diffusion ModelsarXiv 2025OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language PretrainingICCV 2025Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image GeneratorCVPR 2025 1Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference TimearXiv 2025Interleaved Scene Graphs for Interleaved Text-and-Image Generation AssessmentarXiv 2024R3: Robust Rubric-Agnostic Reward ModelsarXiv 2025FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal GuidanceCVPR 2025 1Critic-V: VLM Critics Help Catch VLM Errors in Multimodal ReasoningCVPR 2025 1Diffusion Self-Distillation for Zero-Shot Customized Image GenerationCVPR 2025 1Adapting Large Language Models to Log Analysis with Interpretable Domain KnowledgearXiv 2024LamRA: Large Multimodal Model as Your Advanced Retrieval AssistantCVPR 2025 1ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step VerificationarXiv 2025PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language ModelsCVPR 2025 1SAT: Dynamic Spatial Aptitude Training for Multimodal Language ModelsarXiv 2024VeriReason: Reinforcement Learning with Testbench Feedback for Reasoning-Enhanced Verilog Generationverireason-reinforcement-learning-withCustomized Retrieval Augmented Generation and Benchmarking for EDA Tool Documentation QAarXiv 2024Cracking the Code of Hallucination in LVLMs with Vision-aware Head DivergencearXiv 2024Towards Effective and Efficient Continual Pre-training of Large Language ModelsarXiv 2024MediAug: Exploring Visual Augmentation in Medical ImagingarXiv 2025GuardReasoner-VL: Safeguarding VLMs via Reinforced ReasoningarXiv 2025PoE-World: Compositional World Modeling with Products of Programmatic ExpertsarXiv 2025MedCaseReasoning: Evaluating and learning diagnostic reasoning from clinical case reportsarXiv 2025Are We in the AI-Generated Text World Already? Quantifying and Monitoring AIGT on Social MediaarXiv 2024SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMsarXiv 2025AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language ModelsarXiv 2025MMTU: A Massive Multi-Task Table Understanding and Reasoning BenchmarkarXiv 2025Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal VerificationarXiv 2025Search Arena: Analyzing Search-Augmented LLMsarXiv 2025Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual SimulationsarXiv 2025Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning ModelsarXiv 2025Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMsarXiv 2025Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm PerspectivearXiv 2025ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement LearningarXiv 2026RoboMME: Benchmarking and Understanding Memory for Robotic Generalist PoliciesarXiv 2026InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific DiscoveryarXiv 2026Rethinking the Stability-Plasticity Trade-off in Continual Learning from an Architectural PerspectivearXiv 2025Go-Browse: Training Web Agents with Structured ExplorationarXiv 2025Distilling foundation models for robust and efficient models in digital pathologyarXiv 2025Falcon PerceptionarXiv 2026TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language ModelsarXiv 2025Grounded Multi-Hop VideoQA in Long-Form Egocentric VideosarXiv 2024RandLoRA: Full-rank parameter-efficient fine-tuning of large modelsarXiv 2025DeepRAG: Thinking to Retrieval Step by Step for Large Language ModelsarXiv 2025Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous DrivingarXiv 2025Layer by Layer: Uncovering Hidden Representations in Language ModelsarXiv 2025Large Language Models for Recommendation with Deliberative User Preference AlignmentarXiv 2025VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language ModelsarXiv 2025DGenNO: A Novel Physics-aware Neural Operator for Solving Forward and Inverse PDE Problems based on Deep, Generative Probabilistic ModelingarXiv 2025INSID3: Training-Free In-Context Segmentation with DINOv3arXiv 2026A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language ModelsarXiv 2025IssueBench: Millions of Realistic Prompts for Measuring Issue Bias in LLM Writing AssistancearXiv 2025CRANE: Reasoning with constrained LLM generationarXiv 2025OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language ModelsarXiv 2025Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion TransformersarXiv 2025MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language ModelsarXiv 2025CoT-RAG: Integrating Chain of Thought and Retrieval-Augmented Generation to Enhance Reasoning in Large Language ModelsarXiv 2025Towards Robust ESG Analysis Against Greenwashing Risks: Aspect-Action Analysis with Cross-Category GeneralizationarXiv 2025KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory SystemsarXiv 2024Thus Spake Long-Context Large Language ModelarXiv 2025Scalable Equilibrium Sampling with Sequential Boltzmann GeneratorsarXiv 2025Retrieval-Augmented Generation with Conflicting EvidencearXiv 2025RANGE: Retrieval Augmented Neural Fields for Multi-Resolution Geo-EmbeddingsCVPR 2025 1Esoteric Language Models: A Family of Any-Order Diffusion LLMsarXiv 2025Angles Don't Lie: Unlocking Training-Efficient RL Through the Model's Own SignalsarXiv 2025Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data EfficiencyarXiv 2025IDEAW: Robust Neural Audio Watermarking with Invertible Dual-EmbeddingEMNLP2024One-Shot is Enough: Consolidating Multi-Turn Attacks into Efficient Single-Turn Prompts for LLMsarXiv 2025SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice SynthesisarXiv 2026PRE-Mamba: A 4D State Space Model for Ultra-High-Frequent Event Camera DerainingarXiv 2025FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video GenerationarXiv 2025MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?arXiv 2025World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task PlanningarXiv 2025GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time AlignmentarXiv 2024OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue ResolutionarXiv 2025EvEnhancer: Empowering Effectiveness, Efficiency and Generalizability for Continuous Space-Time Video Super-Resolution with EventsCVPR 2025 1JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation FrameworkarXiv 2024ViSpeak: Visual Instruction Feedback in Streaming VideosICCV 2025Edit Transfer: Learning Image Editing via Vision In-Context RelationsarXiv 2025Training-Free Adaptive Diffusion with Bounded Difference Approximation StrategyarXiv 2024Efficient Diffusion Models: A Comprehensive Survey from Principles to PracticesarXiv 2024MedArabiQ: Benchmarking Large Language Models on Arabic Medical TasksarXiv 2025SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video GenerationarXiv 2024Accelerating Diffusion LLMs via Adaptive Parallel DecodingarXiv 2025Knowing You Don't Know: Learning When to Continue Search in Multi-round RAG through Self-PracticingarXiv 2025FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language ModelsarXiv 2025RADLADS: Rapid Attention Distillation to Linear Attention Decoders at ScalearXiv 2025Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in SpacesarXiv 2025Context is Gold to find the Gold Passage: Evaluating and Training Contextual Document EmbeddingsarXiv 2025TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache SelectionarXiv 2024A Preview of XiYan-SQL: A Multi-Generator Ensemble Framework for Text-to-SQLarXiv 2024BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive LearningarXiv 2025VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?arXiv 2025Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software EngineeringarXiv 2025UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement LearningarXiv 2025Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency OptimizationarXiv 2025Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language ModelsarXiv 2025Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization and Temporal Motion ModulationarXiv 2025Do I Know This Entity? Knowledge Awareness and Hallucinations in Language ModelsarXiv 2024Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw PuzzlesarXiv 2025Learning beyond Teacher: Generalized On-Policy Distillation with Reward ExtrapolationarXiv 2026UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference ImageCVPR 2025 1Measuring Sycophancy of Language Models in Multi-turn DialoguesarXiv 2025Precise In-Parameter Concept Erasure in Large Language ModelsarXiv 2025EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video GuidancearXiv 2025Text2Grad: Reinforcement Learning from Natural Language FeedbackarXiv 2025When Models Reason in Your Language: Controlling Thinking Trace Language Comes at the Cost of AccuracyarXiv 2025RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS EnvironmentsarXiv 2025Adaptive Rank, Reduced Forgetting: Knowledge Retention in Continual Learning Vision-Language Models with Dynamic Rank-Selective LoRAarXiv 2024Turbo3D: Ultra-fast Text-to-3D GenerationCVPR 2025 1Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language ModelsarXiv 2024MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video ScenariosarXiv 2025Pretraining Language Models to Ponder in Continuous SpacearXiv 2025AutoReproduce: Automatic AI Experiment Reproduction with Paper LineagearXiv 2025