All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement LearningarXiv 2025Advancing Transformer Architecture in Long-Context Large Language Models: A Comprehensive SurveyarXiv 2023Locally Attentional SDF Diffusion for Controllable 3D Shape GenerationarXiv 2023LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image UnderstandingarXiv 2023DDFM: Denoising Diffusion Model for Multi-Modality Image FusionICCV 2023 1TaleCrafter: Interactive Story Visualization with Multiple CharactersarXiv 2023Keypoint CommunitiesICCV 2021 10Thought Cloning: Learning to Think while Acting by Imitating Human Thinkingthought-cloning-learning-to-think-whileiCaRL: Incremental Classifier and Representation Learningicarl-incremental-classifier-and-1Scoring Time Intervals using Non-Hierarchical Transformer For Automatic Piano TranscriptionarXiv 2024UA-GEC: Grammatical Error Correction and Fluency Corpus for the Ukrainian LanguagearXiv 2021PatternRank: Leveraging Pretrained Language Models and Part of Speech for Unsupervised Keyphrase ExtractionarXiv 2022Reliable Fidelity and Diversity Metrics for Generative ModelsICML 2020 1GPT-InvestAR: Enhancing Stock Investment Strategies through Annual Report Analysis with Large Language ModelsarXiv 2023PASS: An ImageNet replacement for self-supervised pretraining without humansNeurIPS Workshop ImageNet_PPF 2021 12Efficient Spatially Sparse Inference for Conditional GANs and Diffusion ModelsarXiv 2022SafetyBench: Evaluating the Safety of Large Language ModelsarXiv 2023Towards Efficient and Scale-Robust Ultra-High-Definition Image DemoireingarXiv 2022Data Selection for Language Models via Importance Resamplingdata-selection-for-language-models-viaDepth-Regularized Optimization for 3D Gaussian Splatting in Few-Shot ImagesarXiv 2023Super-resolution of Sentinel-2 images: Learning a globally applicable deep neural networkarXiv 2018Diffusion Model-Based Video Editing: A SurveyarXiv 2024ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddingstoolkengpt-augmenting-frozen-language-modelsRestoreFormer++: Towards Real-World Blind Face Restoration from Undegraded Key-Value PairsarXiv 2023Deformable Style TransferECCV 2020 8SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human ReconstructionCVPR 2024 1APOLLO: SGD-like Memory, AdamW-level PerformancearXiv 2024MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert CachearXiv 2024Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech RecognitionarXiv 2023Geometric Latent Diffusion Models for 3D Molecule GenerationarXiv 2023Data Augmentation for Scene Text RecognitionarXiv 2021A Corpus for Reasoning About Natural Language Grounded in Photographsa-corpus-for-reasoning-about-natural-language-1Text Segmentation as a Supervised Learning Tasktext-segmentation-as-a-supervised-learning-1Easy and Efficient Transformer : Scalable Inference Solution For large NLP modelarXiv 2021Enhanced LSTM for Natural Language Inferenceenhanced-lstm-for-natural-language-inference-1PSALM: Pixelwise SegmentAtion with Large Multi-Modal ModelarXiv 2024Depth Any Camera: Zero-Shot Metric Depth Estimation from Any CameraCVPR 2025 1Reversible Column NetworksarXiv 2022Local Self-Attention over Long Text for Efficient Document RetrievalarXiv 2020Squeezeformer: An Efficient Transformer for Automatic Speech RecognitionarXiv 2022Efficient Diffusion Training via Min-SNR Weighting StrategyICCV 2023 1NMS Strikes BackarXiv 2022Programming Every Example: Lifting Pre-training Data Quality like Experts at ScalearXiv 2024CPED: A Large-Scale Chinese Personalized and Emotional Dialogue Dataset for Conversational AIarXiv 2022Learned Inertial Odometry for Autonomous Drone RacingarXiv 2022Improved Knowledge Distillation via Teacher AssistantarXiv 2019MarIA: Spanish Language ModelsarXiv 2021SpeedySpeech: Efficient Neural Speech SynthesisarXiv 2020Temporal Attentive Alignment for Large-Scale Video Domain Adaptationtemporal-attentive-alignment-for-large-scale-1LLMLight: Large Language Models as Traffic Signal Control AgentsarXiv 2023Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion ModelsarXiv 2023FasterCache: Training-Free Video Diffusion Model Acceleration with High QualityarXiv 2024Pheme: Efficient and Conversational Speech GenerationarXiv 2024A Supervised Approach to Extractive Summarisation of Scientific Papersa-supervised-approach-to-extractive-1Corrected CBOW Performs as well as Skip-gramcorrected-cbow-performs-as-well-as-skip-gramDataset QuantizationICCV 2023 1Do ImageNet Classifiers Generalize to ImageNet?NeurIPS Workshop ImageNet_PPF 2021 12MedFMC: A Real-world Dataset and Benchmark For Foundation Model Adaptation in Medical Image ClassificationarXiv 2023Make Your LLM Fully Utilize the ContextarXiv 2024AMT: All-Pairs Multi-Field Transforms for Efficient Frame InterpolationCVPR 2023 1StableIdentity: Inserting Anybody into Anywhere at First SightarXiv 2024Combining EfficientNet and Vision Transformers for Video Deepfake DetectionarXiv 2021BAD-Gaussians: Bundle Adjusted Deblur Gaussian SplattingarXiv 2024PG-Video-LLaVA: Pixel Grounding Large Video-Language ModelsarXiv 2023HRDA: Context-Aware High-Resolution Domain-Adaptive Semantic SegmentationarXiv 2022Solving Inverse Problems in Medical Imaging with Score-Based Generative Modelssolving-inverse-problems-in-medical-imagingVisual Adversarial Examples Jailbreak Aligned Large Language ModelsarXiv 2023Implicit Neural Representation for Cooperative Low-light Image EnhancementICCV 2023 1BlackMamba: Mixture of Experts for State-Space ModelsarXiv 2024The Newspaper Navigator Dataset: Extracting And Analyzing Visual Content from 16 Million Historic Newspaper Pages in Chronicling AmericaarXiv 2020Root Mean Square Layer Normalizationroot-mean-square-layer-normalization-1Computation-Efficient Era: A Comprehensive Survey of State Space Models in Medical Image AnalysisarXiv 2024Prompt Pre-Training with Twenty-Thousand Classes for Open-Vocabulary Visual Recognitionprompt-pre-training-with-twenty-thousandInternal Video Inpainting by Implicit Long-range PropagationICCV 2021 10A Survey of Resource-efficient LLM and Multimodal Foundation ModelsarXiv 2024Localizing Objects with Self-Supervised Transformers and no LabelsarXiv 2021Animate-A-Story: Storytelling with Retrieval-Augmented Video GenerationarXiv 2023BLIVA: A Simple Multimodal LLM for Better Handling of Text-Rich Visual QuestionsarXiv 2023Block-Recurrent TransformersarXiv 2022Wordflow: Social Prompt Engineering for Large Language ModelsarXiv 2024CtrLoRA: An Extensible and Efficient Framework for Controllable Image GenerationarXiv 2024Seismic Signal Denoising and Decomposition Using Deep Neural NetworksarXiv 20183DitScene: Editing Any Scene via Language-guided Disentangled Gaussian SplattingarXiv 2024Semantic Image Synthesis via Diffusion ModelsarXiv 2022Multi-Modal Temporal Attention Models for Crop Mapping from Satellite Time SeriesarXiv 2021The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing & Attribution in AIarXiv 2023Judging a Book By its CoverarXiv 2016Robust Mean Teacher for Continual and Gradual Test-Time AdaptationCVPR 2023 1SegViTv2: Exploring Efficient and Continual Semantic Segmentation with Plain Vision TransformersarXiv 2023ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart ReasoningarXiv 2024GPTScore: Evaluate as You DesirearXiv 2023BridgeData V2: A Dataset for Robot Learning at ScalearXiv 2023Scattered Mixture-of-Experts ImplementationarXiv 2024Spatial-Temporal-Decoupled Masked Pre-training for Spatiotemporal
ForecastingarXiv 2023A Vector Quantized Approach for Text to Speech Synthesis on Real-World Spontaneous SpeecharXiv 2023LongAlign: A Recipe for Long Context Alignment of Large Language ModelsarXiv 2024Inserting Anybody in Diffusion Models via Celeb Basisinserting-anybody-in-diffusion-models-viaDescribing Videos by Exploiting Temporal Structuredescribing-videos-by-exploiting-temporal-1BurstGPT: A Real-world Workload Dataset to Optimize LLM Serving SystemsarXiv 2024DM-NeRF: 3D Scene Geometry Decomposition and Manipulation from 2D ImagesarXiv 2022A Keypoint-based Global Association Network for Lane DetectionCVPR 2022 1Language Models Represent Space and TimearXiv 2023MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation ExpertsarXiv 2024Anti-DreamBooth: Protecting users from personalized text-to-image synthesisICCV 2023 1Harnessing Explanations: LLM-to-LM Interpreter for Enhanced Text-Attributed Graph Representation LearningarXiv 2023Benchmarking LLMs via Uncertainty QuantificationarXiv 2024KnowAgent: Knowledge-Augmented Planning for LLM-Based AgentsarXiv 2024A Sanity Check for AI-generated Image DetectionarXiv 2024Unsupervised State Representation Learning in Atariunsupervised-state-representation-learning-in-1Polarized Self-Attention: Towards High-quality Pixel-wise Regressionpolarized-self-attention-towards-high-qualityFlash-VStream: Efficient Real-Time Understanding for Long Video StreamsarXiv 2025SparseFusion: Fusing Multi-Modal Sparse Representations for Multi-Sensor 3D Object DetectionICCV 2023 1ConsistI2V: Enhancing Visual Consistency for Image-to-Video GenerationarXiv 2024Interactive Medical Image Segmentation: A Benchmark Dataset and BaselineCVPR 2025 1NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient FrameworkarXiv 2021Re3: Generating Longer Stories With Recursive Reprompting and RevisionarXiv 2022MolScribe: Robust Molecular Structure Recognition with Image-To-Graph GenerationarXiv 2022Contextual Object Detection with Multimodal Large Language ModelsarXiv 2023Consistency Flow Matching: Defining Straight Flows with Velocity ConsistencyarXiv 2024Implicit Identity Representation Conditioned Memory Compensation Network for Talking Head video GenerationICCV 2023 1Boosting Latent Diffusion with Flow MatchingarXiv 2023ConceptLab: Creative Concept Generation using VLM-Guided Diffusion Prior ConstraintsarXiv 2023SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning TasksarXiv 2025Unsupervised Corpus Aware Language Model Pre-training for Dense Passage RetrievalACL 2022 5Virtual Adversarial Training: A Regularization Method for Supervised and Semi-Supervised LearningarXiv 2017BatchFormer: Learning to Explore Sample Relationships for Robust Representation LearningCVPR 2022 1ConvBERT: Improving BERT with Span-based Dynamic ConvolutionNeurIPS 2020 12Choose a Transformer: Fourier or GalerkinNeurIPS 2021 12CHESS: Contextual Harnessing for Efficient SQL SynthesisarXiv 2024Navigation-Guided Sparse Scene Representation for End-to-End Autonomous DrivingarXiv 2024SummVis: Interactive Visual Analysis of Models, Data, and Evaluation for Text SummarizationACL 2021 5ComDrive: Comfort-Oriented End-to-End Autonomous DrivingarXiv 2024Connecting the Dots: Floorplan Reconstruction Using Two-Level QueriesCVPR 2023 1SGDR: Stochastic Gradient Descent with Warm RestartsarXiv 2016Graph Neural Networks for Decentralized Multi-Robot Path PlanningarXiv 2019AutoSDF: Shape Priors for 3D Completion, Reconstruction and GenerationCVPR 2022 1Fast Model Editing at Scalefast-model-editing-at-scaleDiffusion Models for Imperceptible and Transferable Adversarial AttackarXiv 2023FAN: Fourier Analysis NetworksarXiv 2024SimpleClick: Interactive Image Segmentation with Simple Vision TransformersICCV 2023 1WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal ResearcharXiv 2023Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech GenerationarXiv 2021MapTracker: Tracking with Strided Memory Fusion for Consistent Vector HD MappingarXiv 2024CodeTrans: Towards Cracking the Language of Silicon's Code Through Self-Supervised Deep Learning and High Performance ComputingarXiv 2021Rethinking Mobile Block for Efficient Attention-based ModelsICCV 2023 1Graph-ToolFormer: To Empower LLMs with Graph Reasoning Ability via Prompt Augmented by ChatGPTarXiv 2023Egocentric Video-Language PretrainingarXiv 2022SpellGCN: Incorporating Phonological and Visual Similarities into Language Models for Chinese Spelling Checkspellgcn-incorporating-phonological-and-1Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software ImprovementarXiv 2024SUNet: Swin Transformer UNet for Image DenoisingarXiv 2022One-for-All: Generalized LoRA for Parameter-Efficient Fine-tuningarXiv 2023CFDBench: A Large-Scale Benchmark for Machine Learning Methods in Fluid DynamicsarXiv 2023DocPrompting: Generating Code by Retrieving the DocsarXiv 2022Relation DETR: Exploring Explicit Position Relation Prior for Object DetectionarXiv 2024MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question AnsweringarXiv 2022Detecting Deepfakes with Self-Blended ImagesCVPR 2022 1Transfer Learning for Pose Estimation of Illustrated CharactersarXiv 2021DailyTalk: Spoken Dialogue Dataset for Conversational Text-to-SpeecharXiv 2022Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific AdaptationarXiv 2024Stitchable Neural NetworksCVPR 2023 1Towards Seamless Adaptation of Pre-trained Models for Visual Place RecognitionarXiv 2024Constitutional AI: Harmlessness from AI FeedbackarXiv 2022Tutorial on amortized optimizationarXiv 2022LoLCATs: On Low-Rank Linearizing of Large Language ModelsarXiv 2024VeCLIP: Improving CLIP Training via Visual-enriched CaptionsarXiv 2023DeepInteraction++: Multi-Modality Interaction for Autonomous DrivingarXiv 2024Active Prompting with Chain-of-Thought for Large Language ModelsarXiv 2023FlauBERT: Unsupervised Language Model Pre-training for Frenchflaubert-unsupervised-language-model-pre-1Various Lengths, Constant Speed: Efficient Language Modeling with Lightning AttentionarXiv 2024Generative Judge for Evaluating AlignmentarXiv 2023VerSe: A Vertebrae Labelling and Segmentation Benchmark for Multi-detector CT ImagesarXiv 2020KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model ApplicationarXiv 2023Is ChatGPT A Good Translator? Yes With GPT-4 As The EnginearXiv 2023Mix3D: Out-of-Context Data Augmentation for 3D ScenesarXiv 2021Delete, Retrieve, Generate: A Simple Approach to Sentiment and Style Transferdelete-retrieve-generate-a-simple-approach-to-1Pretrained Transformers as Universal Computation EnginesarXiv 2021BanglaBERT: Language Model Pretraining and Benchmarks for Low-Resource Language Understanding Evaluation in BanglaFindings (NAACL) 2022 7Inception TransformerarXiv 2022Im4D: High-Fidelity and Real-Time Novel View Synthesis for Dynamic ScenesarXiv 2023WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the WildarXiv 2024MedRAG: Enhancing Retrieval-augmented Generation with Knowledge Graph-Elicited Reasoning for Healthcare CopilotarXiv 2025PERF: Panoramic Neural Radiance Field from a Single PanoramaarXiv 2023VisualAgentBench: Towards Large Multimodal Models as Visual Foundation AgentsarXiv 2024Frozen Transformers in Language Models Are Effective Visual Encoder LayersarXiv 2023Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language ModelsarXiv 2024Predicting Prosodic Prominence from Text with Pre-trained Contextualized Word RepresentationsWS (NoDaLiDa) 2019 9Hierarchical Integration Diffusion Model for Realistic Image Deblurringhierarchical-integration-diffusion-model-forRethinking Spatial Dimensions of Vision TransformersICCV 2021 10MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View StereoarXiv 2024MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge GraphsarXiv 2025NeO 360: Neural Fields for Sparse View Synthesis of Outdoor ScenesICCV 2023 1Fine-grained Image Captioning with CLIP RewardFindings (NAACL) 2022 7GALIP: Generative Adversarial CLIPs for Text-to-Image SynthesisCVPR 2023 1ScholarCopilot: Training Large Language Models for Academic Writing with Accurate CitationsarXiv 2025OpenMask3D: Open-Vocabulary 3D Instance Segmentationopenmask3d-open-vocabulary-3d-instanceMIS-FM: 3D Medical Image Segmentation using Foundation Models Pretrained on a Large-Scale Unannotated DatasetarXiv 2023ViCo: Plug-and-play Visual Condition for Personalized Text-to-image GenerationarXiv 2023SkipNet: Learning Dynamic Routing in Convolutional Networksskipnet-learning-dynamic-routing-in-1DistiLLM: Towards Streamlined Distillation for Large Language ModelsarXiv 2024FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language ModelsarXiv 2023