0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

ConViT: Improving Vision Transformers with Soft Convolutional Inductive BiasesarXiv 2021Enhancing Detail Preservation for Customized Text-to-Image Generation: A Regularization-Free ApproacharXiv 2023ReLoRA: High-Rank Training Through Low-Rank UpdatesarXiv 2023DualPrompt: Complementary Prompting for Rehearsal-free Continual LearningarXiv 2022ORPO: Monolithic Preference Optimization without Reference ModelarXiv 2024DeLighT: Deep and Light-weight Transformerdelight-deep-and-light-weight-transformerConditional Image-to-Video Generation with Latent Flow Diffusion ModelsCVPR 2023 1QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMsarXiv 2024Video ChatCaptioner: Towards Enriched Spatiotemporal DescriptionsarXiv 2023TPLinker: Single-stage Joint Extraction of Entities and Relations Through Token Pair LinkingCOLING 2020 8Multi-scale self-guided attention for medical image segmentationmulti-scale-guided-attention-for-medical-1Panoptic Scene Graph GenerationarXiv 2022Knowledge Graphs Meet Multi-Modal Learning: A Comprehensive SurveyarXiv 2024Robustness Testing of Language Understanding in Task-Oriented DialogACL 2021 5CUAD: An Expert-Annotated NLP Dataset for Legal Contract ReviewarXiv 2021Deep Dual-resolution Networks for Real-time and Accurate Semantic Segmentation of Road ScenesarXiv 2021HAWQ: Hessian AWare Quantization of Neural Networks with Mixed-Precisionhawq-hessian-aware-quantization-of-neuralJoint Audio and Speech UnderstandingarXiv 2023Magic-Me: Identity-Specific Video Customized DiffusionarXiv 2024Masked Siamese Networks for Label-Efficient LearningarXiv 2022LLMs for Knowledge Graph Construction and Reasoning: Recent Capabilities and Future OpportunitiesarXiv 2023Make Me a BNN: A Simple Strategy for Estimating Bayesian Uncertainty from Pre-trained ModelsCVPR 2024 1TinyAgent: Function Calling at the EdgearXiv 2024InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision GeneralistsarXiv 2023Honeybee: Locality-enhanced Projector for Multimodal LLMCVPR 2024 1SAINT: Improved Neural Networks for Tabular Data via Row Attention and Contrastive Pre-Trainingsaint-improved-neural-networks-for-tabular-1DreamLLM: Synergistic Multimodal Comprehension and CreationarXiv 2023Understanding Contrastive Representation Learning through Alignment and Uniformity on the HyperspherearXiv 2020CoNT: Contrastive Neural Text GenerationarXiv 2022ILVR: Conditioning Method for Denoising Diffusion Probabilistic ModelsICCV 2021 10Visual Speech Recognition for Multiple Languages in the WildarXiv 2022Read Like Humans: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text RecognitionCVPR 2021 1Decoding speech perception from non-invasive brain recordingsarXiv 2022StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech SynthesisarXiv 2022MP-SENet: A Speech Enhancement Model with Parallel Denoising of Magnitude and Phase SpectraarXiv 2023Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction FollowingarXiv 2023GARField: Group Anything with Radiance FieldsCVPR 2024 1Proactive Agent: Shifting LLM Agents from Reactive Responses to Active AssistancearXiv 20243DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint VideosCVPR 2024 1Learning the Beauty in Songs: Neural Singing Voice BeautifierACL 2022 5HAWQV3: Dyadic Neural Network QuantizationarXiv 2020DPE: Disentanglement of Pose and Expression for General Video Portrait EditingCVPR 2023 1Rethinking Channel Dimensions for Efficient Model DesignCVPR 2021 1Beyond Specialization: Assessing the Capabilities of MLLMs in Age and Gender Estimationbeyond-specialization-assessing-theSDFusion: Multimodal 3D Shape Completion, Reconstruction, and GenerationCVPR 2023 1Lightweight Image Super-Resolution with Information Multi-distillation NetworkarXiv 2019LinkBERT: Pretraining Language Models with Document LinksACL 2022 5Sample Efficient Reinforcement Learning via Model-Ensemble Exploration and ExploitationarXiv 2021The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervisionthe-neuro-symbolic-concept-learnerA Distractor-Aware Memory for Visual Object Tracking with SAM2CVPR 2025 1Differential Diffusion: Giving Each Pixel Its StrengtharXiv 2023AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image GenerationarXiv 2024A Survey on LLM Test-Time Compute via Search: Tasks, LLM Profiling, Search Algorithms, and Relevant FrameworksarXiv 2025DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability CurvaturearXiv 2023Single-Stage Diffusion NeRF: A Unified Approach to 3D Generation and ReconstructionICCV 2023 1Adam-mini: Use Fewer Learning Rates To Gain MorearXiv 2024AMC: AutoML for Model Compression and Acceleration on Mobile Devicesamc-automl-for-model-compression-and-1TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity RecognitionarXiv 2017DNABERT-2: Efficient Foundation Model and Benchmark For Multi-Species GenomearXiv 2023LightTrack: Finding Lightweight Neural Networks for Object Tracking via One-Shot Architecture SearchCVPR 2021 1VectorMapNet: End-to-end Vectorized HD Map LearningarXiv 2022Robustness Gym: Unifying the NLP Evaluation LandscapeNAACL 2021 4Global Context Vision TransformersarXiv 2022FLatten Transformer: Vision Transformer using Focused Linear AttentionICCV 2023 1Deep Layer Aggregationdeep-layer-aggregation-1Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion TransformerarXiv 2024UnifiedQA: Crossing Format Boundaries With a Single QA SystemFindings of the Association for Computational Linguistics 2020Multimodal Garment Designer: Human-Centric Latent Diffusion Models for Fashion Image EditingICCV 2023 1GENERator: A Long-Context Generative Genomic Foundation ModelarXiv 2025PC-DARTS: Partial Channel Connections for Memory-Efficient Architecture SearchICLR 2020 1WildGaussians: 3D Gaussian Splatting in the WildarXiv 2024Med-Flamingo: a Multimodal Medical Few-shot LearnerarXiv 2023Pose Flow: Efficient Online Pose TrackingarXiv 2018Rotate to Attend: Convolutional Triplet Attention ModulearXiv 2020Image Inpainting via Generative Multi-column Convolutional Neural Networksimage-inpainting-via-generative-multi-column-1Collaborative Diffusion for Multi-Modal Face Generation and EditingCVPR 2023 1Attentive Temporal Pooling for Conformer-based Streaming Language Identification in Long-form SpeecharXiv 2022On the Planning Abilities of Large Language Models : A Critical InvestigationarXiv 2023PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about ChangeNeurIPS 2023 11GO-SLAM: Global Optimization for Consistent 3D Instant ReconstructionICCV 2023 1AxCell: Automatic Extraction of Results from Machine Learning PapersEMNLP 2020 11Evaluation of CNN-based Automatic Music Tagging ModelsarXiv 2020trajdata: A Unified Interface to Multiple Human Trajectory Datasetstrajdata-a-unified-interface-to-multipleWavelet Diffusion Models are fast and scalable Image GeneratorsCVPR 2023 1Inference Performance Optimization for Large Language Models on CPUsarXiv 2024ProDiff: Progressive Fast Diffusion Model For High-Quality Text-to-SpeecharXiv 2022ClinicalBERT: Modeling Clinical Notes and Predicting Hospital ReadmissionarXiv 2019Score-CAM: Score-Weighted Visual Explanations for Convolutional Neural NetworksarXiv 2019BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous DrivingarXiv 2022ADOPT: Modified Adam Can Converge with Any $β_2$ with the Optimal RatearXiv 2024MonoDETR: Depth-guided Transformer for Monocular 3D Object DetectionICCV 2023 1Energy-based Out-of-distribution DetectionNeurIPS 2020 12PhotoDoodle: Learning Artistic Image Editing from Few-Shot Pairwise DataarXiv 2025FiTv2: Scalable and Improved Flexible Vision Transformer for Diffusion ModelarXiv 2024SVGDreamer: Text Guided SVG Generation with Diffusion ModelCVPR 2024 1Landmark Attention: Random-Access Infinite Context Length for TransformersarXiv 2023Chinese Text Recognition with A Pre-Trained CLIP-Like Model Through Image-IDS AligningICCV 2023 1Seeing What You Said: Talking Face Generation Guided by a Lip Reading ExpertCVPR 2023 1OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video GenerationarXiv 2024TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous VariablesarXiv 2024TailorNet: Predicting Clothing in 3D as a Function of Human Pose, Shape and Garment Styletailornet-predicting-clothing-in-3d-as-aAlignBench: Benchmarking Chinese Alignment of Large Language ModelsarXiv 2023Unified Vision-Language Pre-Training for Image Captioning and VQAarXiv 2019Epipolar Transformersepipolar-transformers-1Real-time self-adaptive deep stereoreal-time-self-adaptive-deep-stereo-1Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learningmastering-visual-continuous-control-improved-1MuSc: Zero-Shot Industrial Anomaly Classification and Segmentation with Mutual Scoring of the Unlabeled ImagesarXiv 2024LLaVA-Grounding: Grounded Visual Chat with Large Multimodal ModelsarXiv 2023MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised TrainingarXiv 2023UNISURF: Unifying Neural Implicit Surfaces and Radiance Fields for Multi-View ReconstructionICCV 2021 10FreeDrag: Feature Dragging for Reliable Point-based Image EditingCVPR 2024 1Scaling Deep Contrastive Learning Batch Size under Memory Limited SetupACL (RepL4NLP) 2021 8StructGPT: A General Framework for Large Language Model to Reason over Structured DataarXiv 2023Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from PixelsICLR 2021 1YourBench: Easy Custom Evaluation Sets for EveryonearXiv 2025How Much Can CLIP Benefit Vision-and-Language Tasks?arXiv 2021GeneGPT: Augmenting Large Language Models with Domain Tools for Improved Access to Biomedical InformationarXiv 2023MathPile: A Billion-Token-Scale Pretraining Corpus for MatharXiv 2023End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based AttractorsarXiv 2020TeCH: Text-guided Reconstruction of Lifelike Clothed HumansarXiv 2023ReZero is All You Need: Fast Convergence at Large DeptharXiv 2020GeometryCrafter: Consistent Geometry Estimation for Open-world Videos with Diffusion PriorsICCV 2025GeoCode: Interpretable Shape ProgramsarXiv 2022Learning to Prove Theorems via Interacting with Proof AssistantsarXiv 2019Faster Diffusion via Temporal Attention DecompositionarXiv 2024StyleSinger: Style Transfer for Out-of-Domain Singing Voice SynthesisarXiv 2023Self-Attention Between Datapoints: Going Beyond Individual Input-Output Pairs in Deep LearningNeurIPS 2021 12Attention Strategies for Multi-Source Sequence-to-Sequence LearningarXiv 2017Drive Like a Human: Rethinking Autonomous Driving with Large Language ModelsarXiv 2023FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech SynthesisarXiv 2022SE(3) diffusion model with application to protein backbone generationarXiv 2023Meta-Prompting: Enhancing Language Models with Task-Agnostic ScaffoldingarXiv 2024Speech Resynthesis from Discrete Disentangled Self-Supervised RepresentationsarXiv 2021Editable Scene Simulation for Autonomous Driving via Collaborative LLM-AgentsCVPR 2024 1LongVU: Spatiotemporal Adaptive Compression for Long Video-Language UnderstandingarXiv 2024In-Context Learning Unlocked for Diffusion Modelsin-context-learning-unlocked-for-diffusionTabFact: A Large-scale Dataset for Table-based Fact VerificationICLR 2020 1AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language ModelsarXiv 2023Scaling Transformers for Low-Bitrate High-Quality Speech CodingarXiv 2024Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event TaggersarXiv 2023FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text GenerationarXiv 2023VILA-U: a Unified Foundation Model Integrating Visual Understanding and GenerationarXiv 2024SSAST: Self-Supervised Audio Spectrogram TransformerarXiv 2021OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with TextarXiv 2024When Do Program-of-Thoughts Work for Reasoning?arXiv 2023SummEval: Re-evaluating Summarization EvaluationarXiv 2020Audio-Visual Segmentation with SemanticsarXiv 2023Single Motion DiffusionarXiv 2023Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-DistillationarXiv 2024RenderOcc: Vision-Centric 3D Occupancy Prediction with 2D Rendering SupervisionarXiv 2023Dual Diffusion Implicit Bridges for Image-to-Image TranslationarXiv 2022Diffusion-based Generation, Optimization, and Planning in 3D ScenesCVPR 2023 1GRAF: Generative Radiance Fields for 3D-Aware Image SynthesisNeurIPS 2020 12MiniF2F: a cross-system benchmark for formal Olympiad-level mathematicsminif2f-a-cross-system-benchmark-for-formal-1Diffusion-TS: Interpretable Diffusion for General Time Series GenerationarXiv 2024CelebV-Text: A Large-Scale Facial Text-Video DatasetCVPR 2023 1Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized LabelsCVPR 2021 1Gradient Episodic Memory for Continual Learninggradient-episodic-memory-for-continual-1ParsBERT: Transformer-based Model for Persian Language UnderstandingarXiv 2020Benchmarking Neural Network Training AlgorithmsarXiv 2023MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop QueriesarXiv 2024FramePainter: Endowing Interactive Image Editing with Video Diffusion PriorsICCV 2025Scaling Up and Distilling Down: Language-Guided Robot Skill AcquisitionarXiv 2023GauHuman: Articulated Gaussian Splatting from Monocular Human VideosCVPR 2024 1Stable Flow: Vital Layers for Training-Free Image EditingCVPR 2025 1Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback LearningarXiv 2023MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text TranslationarXiv 2023Image Scene Graph Generation (SGG) BenchmarkarXiv 2021Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language ProcessingarXiv 2021Multi-instrument Music Synthesis with Spectrogram DiffusionarXiv 2022SelFlow: Self-Supervised Learning of Optical Flowselflow-self-supervised-learning-of-optical-1Few-NERD: A Few-Shot Named Entity Recognition DatasetACL 2021 5Cross Modal Transformer: Towards Fast and Robust 3D Object DetectionICCV 2023 1A Survey on Vision-Language-Action Models for Embodied AIarXiv 2024InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context MemoryarXiv 2024An Architecture Combining Convolutional Neural Network (CNN) and Support Vector Machine (SVM) for Image ClassificationarXiv 2017Single-Path NAS: Designing Hardware-Efficient ConvNets in less than 4 HoursarXiv 2019LayoutGPT: Compositional Visual Planning and Generation with Large Language ModelsNeurIPS 2023 11i-RevNet: Deep Invertible Networksi-revnet-deep-invertible-networks-1HuatuoGPT-II, One-stage Training for Medical Adaption of LLMsarXiv 2023Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous DrivingCVPR 2024 1Adversarial NLI: A New Benchmark for Natural Language Understandingadversarial-nli-a-new-benchmark-for-natural-1LLMGA: Multimodal Large Language Model based Generation AssistantarXiv 2023KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache QuantizationarXiv 2024Kandinsky 3.0 Technical ReportarXiv 2023BEEP! Korean Corpus of Online News Comments for Toxic Speech Detectionbeep-korean-corpus-of-online-news-comments-1MagicBrush: A Manually Annotated Dataset for Instruction-Guided Image EditingNeurIPS 2023 11CBNet: A Composite Backbone Network Architecture for Object DetectionarXiv 2021InstructUIE: Multi-task Instruction Tuning for Unified Information ExtractionarXiv 2023Geo4D: Leveraging Video Generators for Geometric 4D Scene ReconstructionICCV 2025Student Classroom Behavior Detection based on YOLOv7-BRA and Multi-Model FusionarXiv 2023MACE: Mass Concept Erasure in Diffusion ModelsCVPR 2024 1L-Eval: Instituting Standardized Evaluation for Long Context Language ModelsarXiv 2023Denoising Vision TransformersarXiv 2024Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic SegmentationarXiv 2023TediGAN: Text-Guided Diverse Face Image Generation and ManipulationCVPR 2021 1MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for MedicinearXiv 2024Dynamic Gaussians Mesh: Consistent Mesh Reconstruction from Dynamic ScenesarXiv 2024Focal Sparse Convolutional Networks for 3D Object DetectionCVPR 2022 1Text-Guided Synthesis of Eulerian CinemagraphsarXiv 2023

Back to Papers