All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
LoRA-GA: Low-Rank Adaptation with Gradient ApproximationarXiv 2024An Evaluation Dataset for Intent Classification and Out-of-Scope Predictionan-evaluation-dataset-for-intent-1Safety at Scale: A Comprehensive Survey of Large Model SafetyarXiv 2025Answering Complex Open-Domain Questions with Multi-Hop Dense RetrievalICLR 2021 1LongForm: Effective Instruction Tuning with Reverse InstructionsarXiv 2023Robust Model-based Face Reconstruction through Weakly-Supervised Outlier SegmentationCVPR 2023 1Learning Trajectory-Aware Transformer for Video Super-ResolutionCVPR 2022 1ShapeLLM: Universal 3D Object Understanding for Embodied InteractionarXiv 2024Visualizing Linguistic Diversity of Text Datasets Synthesized by Large Language ModelsarXiv 2023The Oscars of AI Theater: A Survey on Role-Playing with Language ModelsarXiv 2024SiMBA: Simplified Mamba-Based Architecture for Vision and Multivariate Time seriesarXiv 2024ScisummNet: A Large Annotated Corpus and Content-Impact Models for Scientific Paper Summarization with Citation NetworksarXiv 2019RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language ModelsarXiv 2023Stable-Makeup: When Real-World Makeup Transfer Meets Diffusion ModelarXiv 2024Leveraging the Feature Distribution in Transfer-based Few-Shot LearningarXiv 2020Towards a Unified Multi-Dimensional Evaluator for Text GenerationarXiv 2022Howl: A Deployed, Open-Source Wake Word Detection SystemEMNLP (NLPOSS) 2020 11NerfBridge: Bringing Real-time, Online Neural Radiance Field Training to RoboticsarXiv 2023Large Language Model-Brained GUI Agents: A SurveyarXiv 2024Geometric Algebra Transformergeometric-algebra-transformerNOPE: Novel Object Pose Estimation from a Single ImageCVPR 2024 1Cotatron: Transcription-Guided Speech Encoder for Any-to-Many Voice Conversion without Parallel DataarXiv 2020FEAR: Fast, Efficient, Accurate and Robust Visual TrackerarXiv 2021HeadStudio: Text to Animatable Head Avatars with 3D Gaussian SplattingarXiv 2024KEPLER: A Unified Model for Knowledge Embedding and Pre-trained Language RepresentationarXiv 2019LIMR: Less is More for RL ScalingarXiv 2025MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer NetworkarXiv 2023From Word Models to World Models: Translating from Natural Language to the Probabilistic Language of ThoughtarXiv 2023Fast Feedforward 3D Gaussian Splatting CompressionarXiv 2024MCANet: Medical Image Segmentation with Multi-Scale Cross-Axis AttentionarXiv 2023LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge DistillationarXiv 2024When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context TrainingarXiv 2024Reference-based Video Super-Resolution Using Multi-Camera Video TripletsCVPR 2022 1DE-GAN: A Conditional Generative Adversarial Network for Document Enhancementde-gan-a-conditional-generative-adversarialChangen2: Multi-Temporal Remote Sensing Generative Change Foundation ModelarXiv 2024Self-Alignment Pretraining for Biomedical Entity RepresentationsNAACL 2021 4REST: Retrieval-Based Speculative DecodingarXiv 2023CapsFusion: Rethinking Image-Text Data at ScaleCVPR 2024 1Most Language Models can be Poets too: An AI Writing Assistant and Constrained Text Generation Studiomost-language-models-can-be-poets-too-an-aiFull-Gradient Representation for Neural Network Visualizationfull-gradient-representation-for-neuralNeural Networks and the Chomsky HierarchyarXiv 2022Lion: Adversarial Distillation of Proprietary Large Language ModelsarXiv 2023FitNets: Hints for Thin Deep NetsarXiv 2014Golos: Russian Dataset for Speech ResearcharXiv 2021Instruction Tuning for Large Language Models: A SurveyarXiv 2023LVM-Med: Learning Large-Scale Self-Supervised Vision Models for Medical Imaging via Second-order Graph Matchinglvm-med-learning-large-scale-self-supervisedMagicTime: Time-lapse Video Generation Models as Metamorphic SimulatorsarXiv 2024ViTamin: Designing Scalable Vision Models in the Vision-Language EraCVPR 2024 1Vision-Only Robot Navigation in a Neural Radiance WorldarXiv 2021BigCodec: Pushing the Limits of Low-Bitrate Neural Speech CodecarXiv 2024CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen LanguagesarXiv 2025Embodied Understanding of Driving ScenariosarXiv 2024Making Large Language Models Perform Better in Knowledge Graph CompletionarXiv 2023RelationNet++: Bridging Visual Representations for Object Detection via Transformer DecoderNeurIPS 2020 12CoMoSpeech: One-Step Speech and Singing Voice Synthesis via Consistency ModelarXiv 2023Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token MigrationCVPR 2023 1KR-BERT: A Small-Scale Korean-Specific Language ModelarXiv 2020Controllable Text-to-3D Generation via Surface-Aligned Gaussian SplattingarXiv 2024DeltaEdit: Exploring Text-free Training for Text-Driven Image ManipulationCVPR 2023 1PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language InstructionsarXiv 2024VideoRoPE: What Makes for Good Video Rotary Position Embedding?arXiv 2025Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-AlignmentarXiv 2024Key.Net: Keypoint Detection by Handcrafted and Learned CNN Filterskey-net-keypoint-detection-by-handcrafted-andReal3D: Scaling Up Large Reconstruction Models with Real-World ImagesarXiv 2024Progressive-Hint Prompting Improves Reasoning in Large Language Modelshttps-arxiv-org-abs-2304-09797Image-to-Lidar Self-Supervised Distillation for Autonomous Driving DataCVPR 2022 1DDP: Diffusion Model for Dense Visual PredictionICCV 2023 1Peregrine: A Pattern-Aware Graph Mining SystemarXiv 2020Improving Language Model Negotiation with Self-Play and In-Context Learning from AI FeedbackarXiv 2023VL-Adapter: Parameter-Efficient Transfer Learning for Vision-and-Language TasksCVPR 2022 1"I'm sorry to hear that": Finding New Biases in Language Models with a Holistic Descriptor DatasetarXiv 2022IEPile: Unearthing Large-Scale Schema-Based Information Extraction CorpusarXiv 2024RobBERT: a Dutch RoBERTa-based Language ModelFindings of the Association for Computational Linguistics 2020mGPT: Few-Shot Learners Go MultilingualarXiv 2022PAQ: 65 Million Probably-Asked Questions and What You Can Do With ThemarXiv 2021Restoring Images in Adverse Weather Conditions via Histogram TransformerarXiv 2024QuadSwarm: A Modular Multi-Quadrotor Simulator for Deep Reinforcement Learning with Direct Thrust ControlarXiv 2023SParC: Cross-Domain Semantic Parsing in Contextsparc-cross-domain-semantic-parsing-in-1Steerable discovery of neural audio effectsarXiv 2021Neural Generation for Czech: Data and BaselinesarXiv 2019HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion GuidancearXiv 2023Automated Machine Learning: State-of-The-Art and Open ChallengesarXiv 2019Gradient Boosting Neural Networks: GrowNetgradient-boosting-neural-networks-grownet-1MagicLens: Self-Supervised Image Retrieval with Open-Ended InstructionsarXiv 2024CodeBERTScore: Evaluating Code Generation with Pretrained Models of CodearXiv 2023FocalFormer3D : Focusing on Hard Instance for 3D Object DetectionarXiv 2023Scaling Data Generation in Vision-and-Language NavigationICCV 2023 1ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language ModelsarXiv 2024Towards Realistic Low-resource Relation Extraction: A Benchmark with Empirical Baseline StudyarXiv 2022Fine-Tuning Pre-trained Language Model with Weak Supervision: A Contrastive-Regularized Self-Training ApproachNAACL 2021 4Scaling Laws for Fine-Grained Mixture of ExpertsarXiv 2024Transition-Based Dependency Parsing with Stack Long Short-Term Memorytransition-based-dependency-parsing-with-5ERS: a novel comprehensive endoscopy image dataset for machine learning, compliant with the MST 3.0 specificationarXiv 2022Contrastive Decoding: Open-ended Text Generation as OptimizationarXiv 2022Speech Denoising Without Clean Training Data: A Noise2Noise ApproacharXiv 2021IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image GenerationarXiv 2024RAGEval: Scenario Specific RAG Evaluation Dataset Generation FrameworkarXiv 2024HouseDiffusion: Vector Floorplan Generation via a Diffusion Model with Discrete and Continuous DenoisingCVPR 2023 1From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language ModelsarXiv 2023PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise TrainingarXiv 2023Perturbation Augmentation for Fairer NLParXiv 2022BitDelta: Your Fine-Tune May Only Be Worth One BitarXiv 2024ScribblePrompt: Fast and Flexible Interactive Segmentation for Any Biomedical ImagearXiv 2023EHRSHOT: An EHR Benchmark for Few-Shot Evaluation of Foundation Modelsehrshot-an-ehr-benchmark-for-few-shotSHMT: Self-supervised Hierarchical Makeup Transfer via Latent Diffusion ModelsarXiv 2024TopoMLP: A Simple yet Strong Pipeline for Driving Topology ReasoningarXiv 2023Cedille: A large autoregressive French language modelarXiv 2022SiTH: Single-view Textured Human Reconstruction with Image-Conditioned DiffusionCVPR 2024 1MoCapAct: A Multi-Task Dataset for Simulated Humanoid ControlarXiv 2022BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Networkbigvsan-enhancing-gan-based-neural-vocodersUniPAD: A Universal Pre-training Paradigm for Autonomous DrivingCVPR 2024 1FAST: Faster Arbitrarily-Shaped Text Detector with Minimalist Kernel RepresentationarXiv 2021MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain ConversationarXiv 2022StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language ModelsarXiv 2024Detection, Tracking, and Counting Meets Drones in Crowds: A BenchmarkCVPR 2021 1Neural Audio Fingerprint for High-specific Audio Retrieval based on Contrastive LearningarXiv 2020Q-GaLore: Quantized GaLore with INT4 Projection and Layer-Adaptive Low-Rank GradientsarXiv 2024TART: A plug-and-play Transformer module for task-agnostic reasoningarXiv 2023RAG and RAU: A Survey on Retrieval-Augmented Language Model in Natural Language ProcessingarXiv 2024Learning Mesh Representations via Binary Space Partitioning Tree NetworksarXiv 2021TransTab: Learning Transferable Tabular Transformers Across TablesarXiv 2022Text-Only Training for Image Captioning using Noise-Injected CLIParXiv 2022Synthesizing Coherent Story with Auto-Regressive Latent Diffusion ModelsarXiv 2022Chat-Scene: Bridging 3D Scene and Large Language Models with Object IdentifiersarXiv 2023Video ReCap: Recursive Captioning of Hour-Long VideosCVPR 2024 1A Multi-task Learning Model for Chinese-oriented Aspect Polarity Classification and Aspect Term ExtractionarXiv 2019VoCo-LLaMA: Towards Vision Compression with Large Language ModelsCVPR 2025 1BAD-NeRF: Bundle Adjusted Deblur Neural Radiance FieldsCVPR 2023 1A General Framework for Inference-time Scaling and Steering of Diffusion ModelsarXiv 2025From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by SteparXiv 2024Real-Time Open-Domain Question Answering with Dense-Sparse Phrase Indexreal-time-open-domain-question-answering-with-1CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense PredictionarXiv 2023Transformer-VQ: Linear-Time Transformers via Vector QuantizationarXiv 2023CharacterBERT: Reconciling ELMo and BERT for Word-Level Open-Vocabulary Representations From CharactersCOLING 2020 8Global-Local Path Networks for Monocular Depth Estimation with Vertical CutDeptharXiv 2022Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual UnderstandingarXiv 2021Pushing the Limits of Simple Pipelines for Few-Shot Learning: External Data and Fine-Tuning Make a DifferenceCVPR 2022 1VISA: Reasoning Video Object Segmentation via Large Language ModelsarXiv 2024InPars-v2: Large Language Models as Efficient Dataset Generators for Information RetrievalarXiv 2023An empirical study of LLaMA3 quantization: from LLMs to MLLMsarXiv 2024From Matching to Generation: A Survey on Generative Information RetrievalarXiv 2024Revisiting Scene Text Recognition: A Data PerspectiveICCV 2023 1MixLoRA: Enhancing Large Language Models Fine-Tuning with LoRA-based Mixture of ExpertsarXiv 2024UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion RecognitionarXiv 2022Real-Time Neural Light Field on Mobile DevicesCVPR 2023 1BlendFace: Re-designing Identity Encoders for Face-SwappingICCV 2023 1OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance SegmentationarXiv 2023Diffusion-SDF: Text-to-Shape via Voxelized DiffusionCVPR 2023 1HyperDiffusion: Generating Implicit Neural Fields with Weight-Space DiffusionICCV 2023 1ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language ModelsarXiv 2023Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language ModelsarXiv 2022A Recurrent Vision-and-Language BERT for NavigationarXiv 2020Transformers Can Do Arithmetic with the Right EmbeddingsarXiv 2024Towards Economical Inference: Enabling DeepSeek's Multi-Head Latent Attention in Any Transformer-based LLMsarXiv 2025Neuro-GPT: Towards A Foundation Model for EEGarXiv 2023PoseScript: Linking 3D Human Poses and Natural LanguagearXiv 2022Learning Multi-dimensional Edge Feature-based AU Relation Graph for Facial Action Unit RecognitionarXiv 2022Doppelgangers: Learning to Disambiguate Images of Similar StructuresICCV 2023 1TryOffAnyone: Tiled Cloth Generation from a Dressed PersonarXiv 2024HI-SLAM2: Geometry-Aware Gaussian SLAM for Fast Monocular Scene ReconstructionarXiv 2024ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLarXiv 2024Structured Pruning Learns Compact and Accurate ModelsACL 2022 5What does a platypus look like? Generating customized prompts for zero-shot image classificationICCV 2023 1ResumeFlow: An LLM-facilitated Pipeline for Personalized Resume Generation and RefinementarXiv 2024GenTranslate: Large Language Models are Generative Multilingual Speech and Machine TranslatorsarXiv 2024OneBit: Towards Extremely Low-bit Large Language ModelsarXiv 2024ShAPO: Implicit Representations for Multi-Object Shape, Appearance, and Pose OptimizationarXiv 2022Making a MIRACL: Multilingual Information Retrieval Across a Continuum of LanguagesarXiv 2022SQL-o1: A Self-Reward Heuristic Dynamic Search Method for Text-to-SQLarXiv 2025LingoQA: Visual Question Answering for Autonomous DrivingarXiv 2023Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic TaskarXiv 2022Automatically Neutralizing Subjective Bias in TextarXiv 2019SegMAN: Omni-scale Context Modeling with State Space Models and Local Attention for Semantic SegmentationCVPR 2025 1InstructZero: Efficient Instruction Optimization for Black-Box Large Language ModelsarXiv 2023Zero-Shot Composed Image Retrieval with Textual InversionICCV 2023 1Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 TasksarXiv 2024VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion ModelsCVPR 2024 1Not All Patches are What You Need: Expediting Vision Transformers via Token ReorganizationsarXiv 2022A Pilot Study for Chinese SQL Semantic Parsinga-pilot-study-for-chinese-sql-semantic-1Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B PeoplearXiv 2024Learning to Filter Context for Retrieval-Augmented GenerationarXiv 2023Revisiting the Parameter Efficiency of Adapters from the Perspective of Precision RedundancyICCV 2023 1cosFormer: Rethinking Softmax in Attentioncosformer-rethinking-softmax-in-attentionLogoDet-3K: A Large-Scale Image Dataset for Logo DetectionarXiv 2020Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking OraclesarXiv 2023MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the MetaversearXiv 2025Temporal Enhanced Training of Multi-view 3D Object Detector via Historical Object PredictionICCV 2023 1Accelerating Diffusion Transformers with Token-wise Feature CachingarXiv 2024ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI SystemsCVPR 2025 1Temperature Steerable Flows and Boltzmann GeneratorsarXiv 2021MVGS: Multi-view-regulated Gaussian Splatting for Novel View SynthesisarXiv 2024Face Anonymization Made SimplearXiv 2024Towards Fully Automated Manga TranslationarXiv 2020ControlLLM: Augment Language Models with Tools by Searching on GraphsarXiv 2023GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image GenerationICCV 2025BookSum: A Collection of Datasets for Long-form Narrative SummarizationarXiv 2021Exposing flaws of generative model evaluation metrics and their unfair treatment of diffusion modelsexposing-flaws-of-generative-model-evaluationSound Event Detection Using Spatial Features and Convolutional Recurrent Neural NetworkarXiv 2017RaTrack: Moving Object Detection and Tracking with 4D Radar Point CloudarXiv 2023In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space SteeringarXiv 2023