All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature ExtractionarXiv 2025BrushEdit: All-In-One Image Inpainting and EditingarXiv 2024A Survey on Data Selection for Language ModelsarXiv 2024Hide and Seek (HaS): A Lightweight Framework for Prompt Privacy ProtectionarXiv 2023FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature ImplementationarXiv 2025NormalCrafter: Learning Temporally Consistent Normals from Video Diffusion PriorsICCV 2025InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language ModelsarXiv 2025IDArb: Intrinsic Decomposition for Arbitrary Number of Input Views and IlluminationsarXiv 2024What's In My Big Data?arXiv 2023WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language ModelsarXiv 2024Can Generative Geospatial Diffusion Models Excel as Discriminative Geospatial Foundation Models?ICCV 2025TLDR: Extreme Summarization of Scientific DocumentsFindings of the Association for Computational Linguistics 2020M1: Towards Scalable Test-Time Compute with Mamba Reasoning ModelsarXiv 2025GeoUni: A Unified Model for Generating Geometry Diagrams, Problems and Problem SolutionsarXiv 2025Structural Scaffolds for Citation Intent Classification in Scientific Publicationsstructural-scaffolds-for-citation-intent-1LEMUR Neural Network Dataset: Towards Seamless AutoMLarXiv 2025The Semantic Scholar Open Data PlatformarXiv 2023Steepest Descent Density Control for Compact 3D Gaussian SplattingCVPR 2025 1Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech TraitsarXiv 2025TCSinger 2: Customizable Multilingual Zero-shot Singing Voice SynthesisarXiv 2025Text Generation Beyond Discrete Token SamplingarXiv 2025A Dataset of Peer Reviews (PeerRead): Collection, Insights and NLP Applicationsa-dataset-of-peer-reviews-peerread-collection-1Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Textmultimodal-c4-an-open-billion-scale-corpus-ofAgent Lumos: Unified and Modular Training for Open-Source Language AgentsarXiv 2023Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP TasksarXiv 2022Longformer: The Long-Document TransformerarXiv 2020Don't Stop Pretraining: Adapt Language Models to Domains and Tasksdon-t-stop-pretraining-adapt-language-models-1FlexSelect: Flexible Token Selection for Efficient Long Video UnderstandingarXiv 20253DEnhancer: Consistent Multi-View Diffusion for 3D EnhancementCVPR 2025 1Adver-City: Open-Source Multi-Modal Dataset for Collaborative Perception Under Adverse Weather ConditionsarXiv 2024Universal Neural FunctionalsarXiv 2024A Survey on Knowledge-Oriented Retrieval-Augmented GenerationarXiv 2025DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-trainingarXiv 2025TinyLLaVA-Video-R1: Towards Smaller LMMs for Video ReasoningarXiv 2025Tuning Language Models by ProxyarXiv 2024Enhancing Retrieval-Augmented Generation: A Study of Best PracticesarXiv 2025Tele-LLMs: A Series of Specialized Large Language Models for TelecommunicationsarXiv 2024S2WAT: Image Style Transfer via Hierarchical Vision Transformer using Strips Window AttentionarXiv 2022Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning AgentarXiv 2024ImageNet-21K Pretraining for the MassesarXiv 2021Deformable GANs for Pose-based Human Image Generationdeformable-gans-for-pose-based-human-image-1Streaming Radiance Fields for 3D Video SynthesisarXiv 2022Controlling Vision-Language Models for Multi-Task Image RestorationarXiv 2023DziriBERT: a Pre-trained Language Model for the Algerian DialectarXiv 2021Producing and Leveraging Online Map Uncertainty in Trajectory PredictionCVPR 2024 1Denoising Diffusion Bridge ModelsarXiv 2023Learning to Reason for Long-Form Story GenerationarXiv 2025Online 3D Bin Packing with Constrained Deep Reinforcement LearningarXiv 2020DeepSVG: A Hierarchical Generative Network for Vector Graphics AnimationNeurIPS 2020 12LAVIB: A Large-scale Video Interpolation BenchmarkarXiv 2024Topical-Chat: Towards Knowledge-Grounded Open-Domain Conversationstopical-chat-towards-knowledge-grounded-openTEACh: Task-driven Embodied Agents that ChatarXiv 2021Unified Multimodal Discrete DiffusionarXiv 2025Contextual Encoder-Decoder Network for Visual Saliency PredictionarXiv 2019WhaleNet: a Novel Deep Learning Architecture for Marine Mammals Vocalizations on Watkins Marine Mammal Sound DatabasearXiv 2024AtMan: Understanding Transformer Predictions Through Memory Efficient Attention ManipulationNeurIPS 2023 11Multimodal Motion Conditioned Diffusion Model for Skeleton-based Video Anomaly DetectionICCV 2023 1Mixture of Diffusers for scene composition and high resolution image generationarXiv 2023LYT-NET: Lightweight YUV Transformer-based Network for Low-light Image EnhancementarXiv 2024Causal Diffusion Autoencoders: Toward Counterfactual Generation via Diffusion Probabilistic ModelsarXiv 2024A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and ToxicityarXiv 2024RecurrentGPT: Interactive Generation of (Arbitrarily) Long TextarXiv 2023Fully $1\times1$ Convolutional Network for Lightweight Image Super-ResolutionarXiv 2023Scaling Rich Style-Prompted Text-to-Speech DatasetsarXiv 2025Tiny Transformers for Environmental Sound Classification at the EdgearXiv 2021UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own ReasoningarXiv 2025Optimizing Anytime Reasoning via Budget Relative Policy OptimizationarXiv 2025CoIn: Counting the Invisible Reasoning Tokens in Commercial Opaque LLM APIsarXiv 2025AIR-Bench: Automated Heterogeneous Information Retrieval BenchmarkarXiv 2024EpiCoder: Encompassing Diversity and Complexity in Code GenerationarXiv 2025Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language GroundingarXiv 2025GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D GaussiansCVPR 2024 1MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference OptimizationarXiv 2024Overcoming Data Limitation in Medical Visual Question AnsweringarXiv 2019SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator TrajectoriesarXiv 2025Ambiguous Medical Image Segmentation using Diffusion ModelsCVPR 2023 1Handwritten Text Generation from Visual ArchetypesCVPR 2023 1DICEPTION: A Generalist Diffusion Model for Visual Perceptual TasksarXiv 2025Matcher: Segment Anything with One Shot Using All-Purpose Feature MatchingarXiv 2023Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document RetrievalCVPR 2025 1Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local SimilaritiesarXiv 2024What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?arXiv 2024Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future PerspectivesarXiv 2025CV-VAE: A Compatible Video VAE for Latent Generative Video ModelsarXiv 2024Making LLaMA SEE and Draw with SEED TokenizerarXiv 2023FreeNoise: Tuning-Free Longer Video Diffusion via Noise ReschedulingarXiv 2023FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximationfima-q-post-training-quantization-for-visionTreeRL: LLM Reinforcement Learning with On-Policy Tree SearcharXiv 2025GlyphControl: Glyph Conditional Control for Visual Text Generationglyphcontrol-glyph-conditional-control-forFaithful Logical Reasoning via Symbolic Chain-of-ThoughtarXiv 2024Simplifying, Stabilizing and Scaling Continuous-Time Consistency ModelsarXiv 2024SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent EvaluationarXiv 2024Foundations and Recent Trends in Multimodal Mobile Agents: A SurveyarXiv 2024Bhasha-Abhijnaanam: Native-script and romanized Language Identification for 22 Indic languagesarXiv 2023In-Context Retrieval-Augmented Language ModelsarXiv 2023FFB: A Fair Fairness Benchmark for In-Processing Group Fairness MethodsarXiv 2023AnnaAgent: Dynamic Evolution Agent System with Multi-Session Memory for Realistic Seeker SimulationarXiv 2025MMHCL: Multi-Modal Hypergraph Contrastive Learning for RecommendationarXiv 2025EPAM-Net: An Efficient Pose-driven Attention-guided Multimodal Network for Video Action RecognitionarXiv 2024MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement LearningarXiv 2024Cross-View Meets Diffusion: Aerial Image Synthesis with Geometry and Text GuidancearXiv 2024Particle Video Revisited: Tracking Through Occlusions Using Point TrajectoriesarXiv 2022RelightVid: Temporal-Consistent Diffusion Model for Video RelightingarXiv 2025SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image EditingICCV 2025Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model ReasoningarXiv 2024Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph StructuresarXiv 2025MR. Video: "MapReduce" is the Principle for Long Video UnderstandingarXiv 2025War and Peace (WarAgent): Large Language Model-based Multi-Agent Simulation of World WarsarXiv 2023Train Offline, Test Online: A Real Robot Learning BenchmarkarXiv 2023MARS: Unleashing the Power of Variance Reduction for Training Large ModelsarXiv 2024Husky: A Unified, Open-Source Language Agent for Multi-Step ReasoningarXiv 2024AIGS: Generating Science from AI-Powered Automated FalsificationarXiv 2024AfriHate: A Multilingual Collection of Hate Speech and Abusive Language Datasets for African LanguagesarXiv 2025Ankh: Optimized Protein Language Model Unlocks General-Purpose ModellingarXiv 2023Scale-Aware Modulation Meet TransformerICCV 2023 1T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image GenerationCVPR 2025 1Making Convolutional Networks Shift-Invariant AgainarXiv 2019Raze to the Ground: Query-Efficient Adversarial HTML Attacks on Machine-Learning Phishing Webpage DetectorsarXiv 2023NoLiMa: Long-Context Evaluation Beyond Literal MatchingarXiv 2025ClimateLearn: Benchmarking Machine Learning for Weather and Climate Modelingclimatelearn-benchmarking-machine-learningFlowReasoner: Reinforcing Query-Level Meta-AgentsarXiv 2025RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the WildarXiv 2025HALO: Hierarchical Autonomous Logic-Oriented Orchestration for Multi-Agent LLM SystemsarXiv 2025AdapterHub: A Framework for Adapting TransformersEMNLP 2020 11Adapters: A Unified Library for Parameter-Efficient and Modular Transfer LearningarXiv 2023AmadeusGPT: a natural language interface for interactive animal behavioral analysisamadeusgpt-a-natural-language-interface-forAssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion GenerationarXiv 2024EUR-Lex-Sum: A Multi- and Cross-lingual Dataset for Long-form Summarization in the Legal DomainarXiv 2022Model-tuning Via Prompts Makes NLP Models Adversarially RobustarXiv 2023NExT-Mol: 3D Diffusion Meets 1D Language Modeling for 3D Molecule GenerationarXiv 2025Agent models: Internalizing Chain-of-Action Generation into Reasoning modelsarXiv 2025VORTEX: Physics-Driven Data Augmentations Using Consistency Training for Robust Accelerated MRI Reconstructionvortex-physics-driven-data-augmentations-forMolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal AdapterarXiv 2023NIRVANA: Neural Implicit Representations of Videos with Adaptive Networks and Autoregressive Patch-wise ModelingCVPR 2023 1StepCoder: Improve Code Generation with Reinforcement Learning from Compiler FeedbackarXiv 2024AlphaOne: Reasoning Models Thinking Slow and Fast at Test TimearXiv 2025Question Answering for Privacy Policies: Combining Computational and Legal Perspectivesquestion-answering-for-privacy-policiesDraw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image GenerationarXiv 2025FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning EvaluationarXiv 2025Skinned Motion Retargeting with Dense Geometric Interaction PerceptionarXiv 2024DomURLs_BERT: Pre-trained BERT-based Model for Malicious Domains and URLs Detection and ClassificationarXiv 2024Social-Implicit: Rethinking Trajectory Prediction Evaluation and The Effectiveness of Implicit Maximum Likelihood EstimationarXiv 2022Progressive Gradient Flow for Robust N:M Sparsity Training in TransformersarXiv 2024SeaBird: Segmentation in Bird's View with Dice Loss Improves Monocular 3D Detection of Large ObjectsCVPR 2024 1InvestLM: A Large Language Model for Investment using Financial Domain Instruction TuningarXiv 2023MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical NotesarXiv 2024PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMsarXiv 2024Attention Tracker: Detecting Prompt Injection Attacks in LLMsarXiv 2024Vision Transformer for Small-Size DatasetsarXiv 2021GTSinger: A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing TasksarXiv 2024Conformal Risk ControlarXiv 2022NuiScene: Exploring Efficient Generation of Unbounded Outdoor ScenesICCV 20253DTopia: Large Text-to-3D Generation Model with Hybrid Diffusion PriorsarXiv 2024GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D GenerationCVPR 2024 1Contrastive Deep Nonnegative Matrix Factorization for Community DetectionarXiv 2023LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMsarXiv 2025Unified Dual-Intent Translation for Joint Modeling of Search and RecommendationarXiv 2024Large Batch Optimization for Deep Learning: Training BERT in 76 minuteslarge-batch-optimization-for-deep-learningMonitoring Decomposition Attacks in LLMs with Lightweight Sequential MonitorsarXiv 2025Image-Text Co-Decomposition for Text-Supervised Semantic SegmentationCVPR 2024 1Contrastive Demonstration Tuning for Pre-trained Language ModelsarXiv 2022Editing Language Model-based Knowledge Graph EmbeddingsarXiv 2023BioClinical ModernBERT: A State-of-the-Art Long-Context Encoder for Biomedical and Clinical NLParXiv 2025Earnings-22: A Practical Benchmark for Accents in the WildarXiv 2022TableRAG: A Retrieval Augmented Generation Framework for Heterogeneous Document ReasoningarXiv 2025BERT Rediscovers the Classical NLP Pipelinebert-rediscovers-the-classical-nlp-pipeline-1ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal ModelsarXiv 2025Q8BERT: Quantized 8Bit BERTarXiv 2019Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement LearningarXiv 2025Order-agnostic Identifier for Large Language Model-based Generative RecommendationarXiv 2025Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Schemediffusion-based-voice-conversion-with-fast-1VeriThoughts: Enabling Automated Verilog Code Generation using Reasoning and Formal VerificationarXiv 2025Time-R1: Towards Comprehensive Temporal Reasoning in LLMsarXiv 2025HumaniBench: A Human-Centric Framework for Large Multimodal Models EvaluationarXiv 2025BLEUBERI: BLEU is a surprisingly effective reward for instruction followingarXiv 2025Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion ModelsarXiv 2025On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and PerspectivearXiv 2025LangCoop: Collaborative Driving with LanguagearXiv 2025Compile Scene Graphs with Reinforcement LearningarXiv 2025SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM AgentsarXiv 2025ZeroGUI: Automating Online GUI Learning at Zero Human CostarXiv 2025VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-TuningarXiv 2025ZPressor: Bottleneck-Aware Compression for Scalable Feed-Forward 3DGSarXiv 2025KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document UnderstandingarXiv 2025Hymba: A Hybrid-head Architecture for Small Language ModelsarXiv 2024VideoGrain: Modulating Space-Time Attention for Multi-grained Video EditingarXiv 2025ArtGS: Building Interactable Replicas of Complex Articulated Objects via Gaussian SplattingarXiv 2025Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective ResamplingarXiv 2025Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring ModelsarXiv 2025OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text GenerationCVPR 2025 1Hierarchical Transformers Are More Efficient Language Modelshierarchical-transformers-are-more-efficient-1Reformer: The Efficient TransformerICLR 2020 1Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language ModelsarXiv 2025VeLO: Training Versatile Learned Optimizers by Scaling UparXiv 2022A Token-level Text Image Foundation Model for Document UnderstandingICCV 2025Visual Text Processing: A Comprehensive Review and Unified EvaluationarXiv 2025Learning to Detect Multi-class Anomalies with Just One Normal Image PromptarXiv 2025HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene GenerationarXiv 2025MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological AssessmentarXiv 2025DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow DecodingICCV 2025