All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Advancing Model Pruning via Bi-level OptimizationarXiv 2022Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language ModelsarXiv 2024ClimODE: Climate and Weather Forecasting with Physics-informed Neural ODEsarXiv 2024Pretraining Without AttentionarXiv 2022Towards a Unified Copernicus Foundation Model for Earth VisionICCV 2025ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific DiscoveryarXiv 2024Dynamic 3D Gaussian Tracking for Graph-Based Neural Dynamics ModelingarXiv 2024Fine-Tuned Language Models Generate Stable Inorganic Materials as TextarXiv 2024POMATO: Marrying Pointmap Matching with Temporal Motion for Dynamic 3D ReconstructionICCV 2025Towards Real-World Blind Face Restoration with Generative Diffusion PriorarXiv 2023Focus on Your Instruction: Fine-grained and Multi-instruction Image Editing by Attention ModulationCVPR 2024 1Neural Scene Chronologyneural-scene-chronologyWhose Opinions Do Language Models Reflect?arXiv 2023Midi Miner -- A Python library for tonal tension and track classificationarXiv 2019TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action CountingCVPR 2022 1DSBench: How Far Are Data Science Agents to Becoming Data Science Experts?arXiv 2024Meteor: Mamba-based Traversal of Rationale for Large Language and Vision ModelsarXiv 2024Guess the Instruction! Flipped Learning Makes Language Models Stronger Zero-Shot LearnersarXiv 2022FlexConv: Continuous Kernel Convolutions with Differentiable Kernel Sizesflexconv-continuous-kernel-convolutions-withTGIF: A New Dataset and Benchmark on Animated GIF Descriptiontgif-a-new-dataset-and-benchmark-on-animated-1Allies: Prompting Large Language Model with Beam SearcharXiv 2023STP: Self-play LLM Theorem Provers with Iterative Conjecturing and ProvingarXiv 2025Unified Multivariate Gaussian Mixture for Efficient Neural Image CompressionCVPR 2022 1GraphTranslator: Aligning Graph Model to Large Language Model for Open-ended TasksarXiv 2024MasakhaNER: Named Entity Recognition for African LanguagesarXiv 2021Gaussian Error Linear Units (GELUs)arXiv 2016Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward SystemsarXiv 2025Learning a Decision Tree Algorithm with TransformersarXiv 2024LOB-Based Deep Learning Models for Stock Price Trend Prediction: A Benchmark StudyarXiv 2023DPHuBERT: Joint Distillation and Pruning of Self-Supervised Speech ModelsarXiv 2023Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion ModelarXiv 2024Operationalizing a National Digital Library: The Case for a Norwegian Transformer ModelNoDaLiDa 2021 5A Style-aware Discriminator for Controllable Image TranslationCVPR 2022 1MM-IFEngine: Towards Multimodal Instruction FollowingarXiv 2025BAT: Behavior-Aware Human-Like Trajectory Prediction for Autonomous DrivingarXiv 2023DeepWriting: Making Digital Ink Editable via Deep Generative ModelingarXiv 2018PRESTO: A Multilingual Dataset for Parsing Realistic Task-Oriented DialogsarXiv 2023Convolutional Pose Machinesconvolutional-pose-machines-1MasakhaNER 2.0: Africa-centric Transfer Learning for Named Entity RecognitionarXiv 2022Dataset Condensation via Efficient Synthetic-Data ParameterizationarXiv 2022Efficient World Models with Context-Aware TokenizationarXiv 2024Toward Universal Text-to-Music RetrievalarXiv 2022CT2Rep: Automated Radiology Report Generation for 3D Medical ImagingarXiv 2024Envision3D: One Image to 3D with Anchor Views InterpolationarXiv 2024Understanding and Mitigating Copying in Diffusion Modelsunderstanding-and-mitigating-copying-inBenchmarking Natural Language Understanding Services for building Conversational AgentsarXiv 2019Open-World Instance Segmentation: Exploiting Pseudo Ground Truth From Learned Pairwise AffinityCVPR 2022 1GeneOH Diffusion: Towards Generalizable Hand-Object Interaction Denoising via Denoising DiffusionarXiv 2024Urban Architect: Steerable 3D Urban Scene Generation with Layout PriorarXiv 2024Generative Inbetweening through Frame-wise Conditions-Driven Video GenerationCVPR 2025 1ConvFinQA: Exploring the Chain of Numerical Reasoning in Conversational Finance Question AnsweringarXiv 2022Tool-Planner: Task Planning with Clusters across Multiple ToolsarXiv 2024ARAGOG: Advanced RAG Output GradingarXiv 2024Dissecting Tensor Cores via Microbenchmarks: Latency, Throughput and
Numeric BehaviorsarXiv 2022UUKG: Unified Urban Knowledge Graph Dataset for Urban Spatiotemporal Predictionuukg-unified-urban-knowledge-graph-datasetAll you need is a good initall-you-need-is-a-good-init-1DEGAS: Detailed Expressions on Full-Body Gaussian AvatarsarXiv 2024SmoothLLM: Defending Large Language Models Against Jailbreaking AttacksarXiv 2023DirectMHP: Direct 2D Multi-Person Head Pose Estimation with Full-range AnglesarXiv 2023Should You Mask 15% in Masked Language Modeling?arXiv 2022Rectifying the Shortcut Learning of Background for Few-Shot LearningNeurIPS 2021 12SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement LearningarXiv 2024Learning Language Games through Interactionlearning-language-games-through-interaction-1TechGPT-2.0: A large language model project to solve the task of knowledge graph constructionarXiv 2024Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement LearningarXiv 2024PET-SQL: A Prompt-Enhanced Two-Round Refinement of Text-to-SQL with Cross-consistencyarXiv 2024Scalable AI Safety via Doubly-Efficient DebatearXiv 2023Open3DIS: Open-Vocabulary 3D Instance Segmentation with 2D Mask GuidanceCVPR 2024 1Encoder-Decoder Based Convolutional Neural Networks with Multi-Scale-Aware Modules for Crowd CountingarXiv 2020Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative ModelsICCV 2025TypeSQL: Knowledge-based Type-Aware Neural Text-to-SQL GenerationarXiv 2018POINTER: Constrained Progressive Text Generation via Insertion-based Generative Pre-trainingEMNLP 2020 11Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language ModelsarXiv 2024Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical NotesarXiv 2023Spiking Graph Convolutional Networksspiking-graph-convolutional-networksR-MAE: Regions Meet Masked AutoencodersarXiv 2023COLD Decoding: Energy-based Constrained Text Generation with Langevin DynamicsarXiv 2022LLM4SGG: Large Language Models for Weakly Supervised Scene Graph GenerationCVPR 2024 1Simulating Fluids in Real-World Still ImagesICCV 2023 1JFLEG: A Fluency Corpus and Benchmark for Grammatical Error Correctionjfleg-a-fluency-corpus-and-benchmark-for-1B-cos Networks: Alignment is All We Need for InterpretabilityCVPR 2022 1EMDM: Efficient Motion Diffusion Model for Fast and High-Quality Motion GenerationarXiv 2023Stable Diffusion Segmentation for Biomedical Images with Single-step
Reverse ProcessarXiv 2024DREAM: Efficient Dataset Distillation by Representative MatchingICCV 2023 1General Purpose Audio Effect RemovalarXiv 2023JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to SpeecharXiv 2022Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative ModelsarXiv 2024HQ-Edit: A High-Quality Dataset for Instruction-based Image EditingarXiv 2024Paint by Inpaint: Learning to Add Image Objects by Removing Them FirstCVPR 2025 1Generative Knowledge Graph Construction: A ReviewarXiv 2022Efficient Diffusion Policies for Offline Reinforcement Learningefficient-diffusion-policies-for-offlineFashionformer: A simple, Effective and Unified Baseline for Human Fashion Segmentation and RecognitionarXiv 2022Consistent Direct Time-of-Flight Video Depth Super-ResolutionCVPR 2023 1Zero-Shot Learning with Common Sense Knowledge GraphsarXiv 2020Consistent Style TransferarXiv 2022SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language ModelarXiv 2024SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion TransformerarXiv 2024Self-Supervised Bug Detection and RepairNeurIPS 2021 12Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative DecodingarXiv 2024Guiding Large Language Models via Directional Stimulus Promptingguiding-large-language-models-via-directionalCoAID: COVID-19 Healthcare Misinformation DatasetarXiv 2020PREF: Phasorial Embedding Fields for Compact Neural RepresentationsarXiv 2022RussianSuperGLUE: A Russian Language Understanding Evaluation BenchmarkEMNLP 2020 11Flow of Reasoning:Training LLMs for Divergent Problem Solving with Minimal ExamplesarXiv 2024ARBERT & MARBERT: Deep Bidirectional Transformers for ArabicarXiv 2020The Linear Representation Hypothesis and the Geometry of Large Language ModelsarXiv 2023A Dataset for Document Grounded Conversationsa-dataset-for-document-grounded-conversations-1Advancing Language Model Reasoning through Reinforcement Learning and Inference ScalingarXiv 2025Deep vanishing point detection: Geometric priors make dataset variations vanishCVPR 2022 1Prompt a Robot to Walk with Large Language ModelsarXiv 2023Path-Level Network Transformation for Efficient Architecture Searchpath-level-network-transformation-for-1Multi-lingual Evaluation of Code Generation ModelsarXiv 2022SaySelf: Teaching LLMs to Express Confidence with Self-Reflective RationalesarXiv 2024GARF: Gaussian Activated Radiance Fields for High Fidelity Reconstruction and Pose EstimationarXiv 2022Challenges and Opportunities in Offline Reinforcement Learning from Visual ObservationsarXiv 2022FinePOSE: Fine-Grained Prompt-Driven 3D Human Pose Estimation via Diffusion ModelsCVPR 2024 1When Does Self-Supervision Help Graph Convolutional Networks?ICML 2020 1The Geometry of Categorical and Hierarchical Concepts in Large Language ModelsarXiv 2024Object as Query: Lifting any 2D Object Detector to 3D DetectionICCV 2023 1LongVideoBench: A Benchmark for Long-context Interleaved Video-Language UnderstandingarXiv 2024Complex Logical Reasoning over Knowledge Graphs using Large Language ModelsarXiv 2023A Pair Programming Framework for Code Generation via Multi-Plan Exploration and Feedback-Driven RefinementarXiv 2024Change is Hard: A Closer Look at Subpopulation ShiftarXiv 2023Can Large Language Models Infer Causation from Correlation?arXiv 2023ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less ReparameterizationarXiv 2024Human101: Training 100+FPS Human Gaussians in 100s from 1 ViewarXiv 2023StyleTokenizer: Defining Image Style by a Single Instance for
Controlling Diffusion ModelsarXiv 2024Dynamic Prompt Learning: Addressing Cross-Attention Leakage for Text-Based Image Editingdynamic-prompt-learning-addressing-crossInstance-aware Dynamic Prompt Tuning for Pre-trained Point Cloud ModelsICCV 2023 1TimeLMs: Diachronic Language Models from TwitterACL 2022 5Uni-Sign: Toward Unified Sign Language Understanding at ScalearXiv 2025LGT-Net: Indoor Panoramic Room Layout Estimation with Geometry-Aware Transformer NetworkCVPR 2022 1Decision-Oriented Dialogue for Human-AI CollaborationarXiv 2023Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMsarXiv 2023What is the Role of Small Models in the LLM Era: A SurveyarXiv 2024Semantic-Aware Scene RecognitionarXiv 2019ClusterLLM: Large Language Models as a Guide for Text ClusteringarXiv 2023Flacuna: Unleashing the Problem Solving Power of Vicuna using FLAN Fine-TuningarXiv 2023VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPTvtg-gpt-tuning-free-zero-shot-video-temporalTwo Tales of Persona in LLMs: A Survey of Role-Playing and PersonalizationarXiv 2024Spectrum-guided Multi-granularity Referring Video Object SegmentationICCV 2023 13DGazeNet: Generalizing Gaze Estimation with Weak-Supervision from Synthetic ViewsarXiv 2022Deep Learning Models for Multilingual Hate Speech DetectionarXiv 2020B-PROP: Bootstrapped Pre-training with Representative Words Prediction for Ad-hoc RetrievalarXiv 2021All in Tokens: Unifying Output Space of Visual Tasks via Soft TokenICCV 2023 1A Simple Recipe for Multilingual Grammatical Error CorrectionACL 2021 5SplineCam: Exact Visualization and Characterization of Deep Network Geometry and Decision BoundariesCVPR 2023 1SinFusion: Training Diffusion Models on a Single Image or VideoarXiv 2022Can Foundation Models Wrangle Your Data?arXiv 2022Valentine: Evaluating Matching Techniques for Dataset DiscoveryarXiv 2020Topo4D: Topology-Preserving Gaussian Splatting for High-Fidelity 4D Head CapturearXiv 2024Deep Learning on a Data Diet: Finding Important Examples Early in TrainingNeurIPS 2021 12PERFECT: Prompt-free and Efficient Few-shot Learning with Language ModelsarXiv 2022SegPrompt: Boosting Open-world Segmentation via Category-level Prompt LearningICCV 2023 1Selective Annotation Makes Language Models Better Few-Shot LearnersarXiv 2022Talk the Walk: Navigating New York City through Grounded DialoguearXiv 2018DENTEX: An Abnormal Tooth Detection with Dental Enumeration and Diagnosis Benchmark for Panoramic X-raysarXiv 2023AutoMix: Automatically Mixing Language ModelsarXiv 2023Long-context LLMs Struggle with Long In-context LearningarXiv 2024VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term ModelingCVPR 2025 1Gramian Multimodal Representation Learning and AlignmentarXiv 2024Red-Teaming Large Language Models using Chain of Utterances for Safety-AlignmentarXiv 2023Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkersarXiv 2023VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality GenerationarXiv 2025DreamSpace: Dreaming Your Room Space with Text-Driven Panoramic Texture PropagationarXiv 2023Scaling Sentence Embeddings with Large Language ModelsarXiv 2023Lookup Table meets Local Laplacian Filter: Pyramid Reconstruction
Network for Tone MappingarXiv 2023Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling PerformancearXiv 2024Differentiable JPEG: The Devil is in the DetailsarXiv 2023Low-light Image Enhancement via Breaking Down the DarknessarXiv 2021SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch NormalizationarXiv 2024CrossLoc: Scalable Aerial Localization Assisted by Multimodal Synthetic DataCVPR 2022 1Spatial-Temporal Transformer Networks for Traffic Flow ForecastingarXiv 2020Parallel and High-Fidelity Text-to-Lip GenerationarXiv 2021Grad DFT: a software library for machine learning enhanced density functional theoryarXiv 2023TiC-CLIP: Continual Training of CLIP ModelsarXiv 2023Causal Evaluation of Language ModelsarXiv 2024BlackVIP: Black-Box Visual Prompting for Robust Transfer LearningCVPR 2023 1SecureBERT: A Domain-Specific Language Model for CybersecurityarXiv 2022SC4D: Sparse-Controlled Video-to-4D Generation and Motion TransferarXiv 2024SecureBERT: A Domain-Specific Language Model for CybersecurityarXiv 2022F-LMM: Grounding Frozen Large Multimodal ModelsCVPR 2025 1MetaShift: A Dataset of Datasets for Evaluating Contextual Distribution Shifts and Training Conflictsmetashift-a-dataset-of-datasets-forOn Prompt-Driven Safeguarding for Large Language ModelsarXiv 2024A Hierarchical Recurrent Encoder-Decoder For Generative Context-Aware Query SuggestionarXiv 2015JaQuAD: Japanese Question Answering Dataset for Machine Reading ComprehensionarXiv 2022Exploring Frequency-Inspired Optimization in Transformer for Efficient Single Image Super-Resolutionfeature-modulation-transformer-cross-1GALAXY: A Generative Pre-trained Model for Task-Oriented Dialog with Semi-Supervised Learning and Explicit Policy InjectionarXiv 2021Image Inpainting with External-internal Learning and Monochromic BottleneckCVPR 2021 1HTNet for micro-expression recognitionarXiv 2023LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language ModelsarXiv 2023The birth of Romanian BERTFindings of the Association for Computational Linguistics 2020MTRAG: A Multi-Turn Conversational Benchmark for Evaluating Retrieval-Augmented Generation SystemsarXiv 2025A Multimodal Automated Interpretability AgentarXiv 2024MiraGe: Editable 2D Images using Gaussian SplattingarXiv 2024BIG-Bench Extra HardarXiv 2025Scaling Expert Language Models with Unsupervised Domain DiscoveryarXiv 2023Cross-modal Memory Networks for Radiology Report Generationcross-modal-memory-networks-for-radiologyAttention Calibration for Disentangled Text-to-Image PersonalizationCVPR 2024 1Masked Autoencoders Enable Efficient Knowledge DistillersCVPR 2023 1