All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Blended-NeRF: Zero-Shot Object Generation and Blending in Existing Neural Radiance FieldsarXiv 2023ProgressGym: Alignment with a Millennium of Moral ProgressarXiv 2024End-to-end Knowledge Retrieval with Multi-modal QueriesarXiv 2023Learning ASR-Robust Contextualized Embeddings for Spoken Language UnderstandingarXiv 2019SimROD: A Simple Adaptation Method for Robust Object DetectionICCV 2021 10ProtAugment: Unsupervised diverse short-texts paraphrasing for intent detection meta-learningprotaugment-unsupervised-diverse-short-texts-1Automatically Extracting Numerical Results from Randomized Controlled Trials with Large Language ModelsarXiv 2024Systematic Assessment of Tabular Data Synthesis AlgorithmsarXiv 2024Finding the Law: Enhancing Statutory Article Retrieval via Graph Neural NetworksarXiv 2023Textual Prompt Guided Image RestorationarXiv 2023ProtSolM: Protein Solubility Prediction with Multi-modal FeaturesarXiv 2024Improving Steering Vectors by Targeting Sparse Autoencoder FeaturesarXiv 2024Aligning Large Language Models through Synthetic FeedbackarXiv 2023Local Search GFlowNetsarXiv 2023Multilingual Sentence Transformer as A Multilingual Word AlignerarXiv 2023Robust and Scalable Bayesian Online Changepoint DetectionarXiv 2023Bilinear MLPs enable weight-based mechanistic interpretabilityarXiv 2024VILP: Imitation Learning with Latent Video PlanningarXiv 2025CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and ReasoningarXiv 2024SambaMixer: State of Health Prediction of Li-ion Batteries using Mamba State Space ModelsarXiv 2024Global Adaptation meets Local Generalization: Unsupervised Domain Adaptation for 3D Human Pose EstimationICCV 2023 1Can Large Language Models Truly Understand Prompts? A Case Study with Negated PromptsarXiv 2022A Survey on Large Language Models with Multilingualism: Recent Advances and New FrontiersarXiv 2024Speech-MASSIVE: A Multilingual Speech Dataset for SLU and BeyondarXiv 2024MEDIC: A Multi-Task Learning Dataset for Disaster Image ClassificationarXiv 2021Let's Synthesize Step by Step: Iterative Dataset Synthesis with Large Language Models by Extrapolating Errors from Small ModelsarXiv 2023Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps DomainarXiv 2023MeteoRA: Multiple-tasks Embedded LoRA for Large Language ModelsarXiv 20244D Myocardium Reconstruction with Decoupled Motion and Shape ModelICCV 2023 1HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement LearningarXiv 2024Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHFarXiv 2024Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency TrainingarXiv 2023NT5?! Training T5 to Perform Numerical ReasoningarXiv 2021Yes, BM25 is a Strong Baseline for Legal Case RetrievalarXiv 2021Toward Large Kernel ModelsarXiv 2023Dynamic Rewarding with Prompt Optimization Enables Tuning-free Self-Alignment of Language ModelsarXiv 2024Simplified Temporal Consistency Reinforcement LearningarXiv 2023Large Multimodal Models as General In-Context ClassifiersarXiv 2026AFPQ: Asymmetric Floating Point Quantization for LLMsarXiv 2023C5T5: Controllable Generation of Organic Molecules with Transformersc5t5-controllable-generation-of-organic-1Artificial Text Detection via Examining the Topology of Attention MapsEMNLP 2021 11Source-free Video Domain Adaptation by Learning Temporal Consistency for Action RecognitionarXiv 2022The Devil is in the Upsampling: Architectural Decisions Made Simpler for Denoising with Deep Image PriorICCV 2023 1Tag-LLM: Repurposing General-Purpose LLMs for Specialized DomainsarXiv 2024Tractable Control for Autoregressive Language GenerationarXiv 2023UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic AssessmentarXiv 2024FinVis-GPT: A Multimodal Large Language Model for Financial Chart AnalysisarXiv 2023Summary-Source Proposition-level Alignment: Task, Datasets and Supervised BaselineCoNLL (EMNLP) 2021 11MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient EvaluationarXiv 2024Revisiting Block-based Quantisation: What is Important for Sub-8-bit LLM Inference?arXiv 2023Pairing interacting protein sequences using masked language modelingarXiv 2023Dual-Alignment Pre-training for Cross-lingual Sentence EmbeddingarXiv 2023A soft nearest-neighbor framework for continual semi-supervised learningICCV 2023 1Recurrent Attention Networks for Long-text ModelingarXiv 2023Libra: Leveraging Temporal Images for Biomedical Radiology AnalysisarXiv 2024Hatemoji: A Test Suite and Adversarially-Generated Dataset for Benchmarking and Detecting Emoji-based HateNAACL 2022 7CaSiNo: A Corpus of Campsite Negotiation Dialogues for Automatic Negotiation SystemsNAACL 2021 4What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formationarXiv 2024AISHELL-NER: Named Entity Recognition from Chinese SpeecharXiv 2022Lumbar spine segmentation in MR images: a dataset and a public benchmarkarXiv 2023Accelerating Image Generation with Sub-path Linear Approximation ModelarXiv 2024ORacle: Large Vision-Language Models for Knowledge-Guided Holistic OR Domain ModelingarXiv 2024Noisy Self-Knowledge Distillation for Text SummarizationNAACL 2021 4Graphusion: A RAG Framework for Knowledge Graph Construction with a Global PerspectivearXiv 2024NegativePrompt: Leveraging Psychology for Large Language Models Enhancement via Negative Emotional StimuliarXiv 2024Video Representation Learning with Visual Tempo ConsistencyarXiv 2020VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMsarXiv 2024Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative AgentsarXiv 2025DB-SAM: Delving into High Quality Universal Medical Image SegmentationarXiv 2024Dynamic Knowledge Routing Network For Target-Guided Open-Domain ConversationarXiv 2020Denoising Task Routing for Diffusion ModelsarXiv 2023PA-RAG: RAG Alignment via Multi-Perspective Preference OptimizationarXiv 2024Representing Part-Whole Hierarchies in Foundation Models by Learning Localizability, Composability, and Decomposability from Anatomy via Self-SupervisionarXiv 2024TLDR9+: A Large Scale Resource for Extreme Summarization of Social Media PostsEMNLP (newsum) 2021 11Towards Near-imperceptible Steganographic Texttowards-near-imperceptible-steganographic-1Confidence-aware Non-repetitive Multimodal Transformers for TextCapsarXiv 2020PLNet: Plane and Line Priors for Unsupervised Indoor Depth EstimationarXiv 2021Efficient 3D Recognition with Event-driven Spike Sparse ConvolutionarXiv 2024TELEClass: Taxonomy Enrichment and LLM-Enhanced Hierarchical Text Classification with Minimal SupervisionarXiv 2024Reprogramming Pretrained Language Models for Antibody Sequence InfillingarXiv 2022ImgTrojan: Jailbreaking Vision-Language Models with ONE ImagearXiv 2024FinanceMath: Knowledge-Intensive Math Reasoning in Finance DomainsarXiv 2023MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for ReasoningarXiv 2024Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQAarXiv 2024MoT: Memory-of-Thought Enables ChatGPT to Self-ImprovearXiv 2023Learning Certified Individually Fair RepresentationsNeurIPS 2020 12Image generation with shortest path diffusionarXiv 2023OntoTune: Ontology-Driven Self-training for Aligning Large Language ModelsarXiv 2025Predicting Code Coverage without ExecutionarXiv 2023Hyperparameter Tuning is All You Need for LISTANeurIPS 2021 12Understanding and Improving Encoder Layer Fusion in Sequence-to-Sequence Learningunderstanding-and-improving-encoder-layerLongGenBench: Long-context Generation BenchmarkarXiv 2024LENS: A Learnable Evaluation Metric for Text SimplificationarXiv 2022Part2Object: Hierarchical Unsupervised 3D Instance SegmentationarXiv 2024MasakhaNEWS: News Topic Classification for African languagesarXiv 2023Retrieval-Augmented Decision Transformer: External Memory for In-context RLarXiv 2024Learning Multi-Step Reasoning by Solving Arithmetic TasksarXiv 2023Language Imbalance Driven Rewarding for Multilingual Self-improvingarXiv 2024Prompt-Based Monte-Carlo Tree Search for Goal-Oriented Dialogue Policy PlanningarXiv 2023Is the Reversal Curse a Binding Problem? Uncovering Limitations of Transformers from a Basic Generalization FailurearXiv 2025OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM TrainingarXiv 2025Variational Wasserstein gradient flowvariational-wasserstein-gradient-flowJust-DREAM-about-it: Figurative Language Understanding with DREAM-FLUTEarXiv 2022Boosting Language Models Reasoning with Chain-of-Knowledge PromptingarXiv 2023MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language ModelsarXiv 2024I4VGen: Image as Free Stepping Stone for Text-to-Video GenerationarXiv 2024Supervised Homography Learning with Realistic Dataset GenerationICCV 2023 1Portrait Diffusion: Training-free Face Stylization with Chain-of-PaintingarXiv 2023ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented GenerationarXiv 2025Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement LearningarXiv 2024Can Large Language Models Transform Computational Social Science?arXiv 2023Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET BenchmarkarXiv 2023STeCa: Step-level Trajectory Calibration for LLM Agent LearningarXiv 2025Learning Passage Impacts for Inverted IndexesarXiv 2021To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoningarXiv 2024Axiom-based Grad-CAM: Towards Accurate Visualization and Explanation of CNNsarXiv 2020VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language ModelsarXiv 2025Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language ModelsarXiv 2025BASKET: A Large-Scale Video Dataset for Fine-Grained Skill EstimationCVPR 2025 1TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement LearningarXiv 2023From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction TuningarXiv 2023Escaping Saddle Points for Effective Generalization on Class-Imbalanced DataarXiv 2022Arithmetic Without Algorithms: Language Models Solve Math With a Bag of HeuristicsarXiv 2024Decomposing The Dark Matter of Sparse AutoencodersarXiv 2024Multimodal Knowledge Alignment with Reinforcement LearningarXiv 2022Truth or Mirage? Towards End-to-End Factuality Evaluation with LLM-OasisarXiv 2024PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem SolvingarXiv 2025Maria: A Visual Experience Powered Conversational AgentACL 2021 5The Transient Nature of Emergent In-Context Learning in Transformersthe-transient-nature-of-emergent-in-contextPix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level CaptioningarXiv 2025Inference-Time Policy Adapters (IPA): Tailoring Extreme-Scale LMs without Fine-tuningarXiv 2023Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path ReasoningarXiv 2024Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for DialoguearXiv 2024ConGraT: Self-Supervised Contrastive Pretraining for Joint Graph and Text EmbeddingsarXiv 2023Hey AI, Can You Solve Complex Tasks by Talking to Agents?Findings (ACL) 2022 5WOUAF: Weight Modulation for User Attribution and Fingerprinting in Text-to-Image Diffusion ModelsCVPR 2024 1SciMMIR: Benchmarking Scientific Multi-modal Information RetrievalarXiv 2024An Investigation of LLMs' Inefficacy in Understanding Converse RelationsarXiv 2023How to Robustify Black-Box ML Models? A Zeroth-Order Optimization Perspectivehow-to-robustify-black-box-ml-models-a-zerothImproving Knowledge Distillation via Regularizing Feature Norm and DirectionarXiv 2023DSPNet: Dual-vision Scene Perception for Robust 3D Question AnsweringCVPR 2025 1Contamination Bias in Linear RegressionsarXiv 2021SwarmBrain: Embodied agent for real-time strategy game StarCraft II via large language modelsarXiv 2024ChrEn: Cherokee-English Machine Translation for Endangered Language RevitalizationEMNLP 2020 11Resonance RoPE: Improving Context Length Generalization of Large Language ModelsarXiv 2024What Makes Graph Neural Networks Miscalibrated?arXiv 2022Spatial-Aware Token for Weakly Supervised Object LocalizationICCV 2023 1SPANet: Frequency-balancing Token Mixer using Spectral Pooling Aggregation ModulationICCV 2023 1HARP: A challenging human-annotated math reasoning benchmarkarXiv 2024Boosting Jailbreak Attack with MomentumarXiv 2024General Instance Distillation for Object DetectionCVPR 2021 1MAIR: A Massive Benchmark for Evaluating Instructed RetrievalarXiv 2024The Surprising Performance of Simple Baselines for Misinformation DetectionarXiv 2021Increasing Liquid State Machine Performance with Edge-of-Chaos Dynamics Organized by Astrocyte-modulated PlasticityNeurIPS 2021 12INFWIDE: Image and Feature Space Wiener Deconvolution Network for Non-blind Image Deblurring in Low-Light ConditionsarXiv 2022Energy-based Automated Model EvaluationarXiv 2024IRGen: Generative Modeling for Image RetrievalarXiv 2023Learning meters of Arabic and English poems with Recurrent Neural Networks: a step forward for language understanding and synthesisarXiv 2019CoAnnotating: Uncertainty-Guided Work Allocation between Human and Large Language Models for Data AnnotationarXiv 2023AMPERE: AMR-Aware Prefix for Generation-Based Event Argument Extraction ModelarXiv 2023Testing the Ability of Language Models to Interpret Figurative LanguageNAACL 2022 7Deep Laplacian-based Options for Temporally-Extended ExplorationarXiv 2023Do You Remember? Overcoming Catastrophic Forgetting for Fake Audio DetectionarXiv 2023Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation GenerationarXiv 2023Defending Against Unforeseen Failure Modes with Latent Adversarial TrainingarXiv 2024Learning Fair Representation via Distributional Contrastive Disentanglementlearning-fair-representation-via-1Pareto Manifold Learning: Tackling multiple tasks via ensembles of single-task modelsarXiv 2022Probabilistic Tree-of-thought Reasoning for Answering Knowledge-intensive Complex QuestionsarXiv 2023JointMatch: A Unified Approach for Diverse and Collaborative Pseudo-Labeling to Semi-Supervised Text ClassificationarXiv 2023SauvolaNet: Learning Adaptive Sauvola Network for Degraded Document BinarizationarXiv 2021Human Pose Estimation on Privacy-Preserving Low-Resolution Depth ImagesarXiv 2020CCC-wav2vec 2.0: Clustering aided Cross Contrastive Self-supervised learning of speech representationsarXiv 2022Closing the Gap between TD Learning and Supervised Learning -- A Generalisation Point of ViewarXiv 2024From Hypergraph Energy Functions to Hypergraph Neural NetworksarXiv 2023PHEE: A Dataset for Pharmacovigilance Event Extraction from TextarXiv 2022AROMA: Preserving Spatial Structure for Latent PDE Modeling with Local Neural FieldsarXiv 2024Think Twice: Perspective-Taking Improves Large Language Models' Theory-of-Mind CapabilitiesarXiv 2023Physics-Informed Learning of Characteristic Trajectories for Smoke ReconstructionarXiv 2024SfM-TTR: Using Structure from Motion for Test-Time Refinement of Single-View Depth NetworksCVPR 2023 1Hierarchical Deconstruction of LLM Reasoning: A Graph-Based Framework for Analyzing Knowledge UtilizationarXiv 2024StyleInV: A Temporal Style Modulated Inversion Network for Unconditional Video GenerationICCV 2023 1Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You ThinkCVPR 2025 1MLP Can Be A Good Transformer LearnerCVPR 2024 1Circumventing Concept Erasure Methods For Text-to-Image Generative ModelsarXiv 2023Efficient Physics-Based Learned Reconstruction Methods for Real-Time 3D Near-Field MIMO Radar ImagingarXiv 2023End-to-end Domain-Adversarial Voice Activity DetectionarXiv 2019Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt RewritingCVPR 2024 1TeSLA: Test-Time Self-Learning With Automatic Adversarial AugmentationCVPR 2023 1BAFFLE: A Baseline of Backpropagation-Free Federated LearningarXiv 2023A Trembling House of Cards? Mapping Adversarial Attacks against Language AgentsarXiv 2024AfroLM: A Self-Active Learning-based Multilingual Pretrained Language Model for 23 African LanguagesarXiv 2022Actor-agnostic Multi-label Action Recognition with Multi-modal QueryarXiv 2023ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT PipelinesarXiv 2025Inversion Circle Interpolation: Diffusion-based Image Augmentation for Data-scarce ClassificationCVPR 2025 1Slimmable Generative Adversarial NetworksarXiv 2020Demonstrating specification gaming in reasoning modelsarXiv 2025miniCTX: Neural Theorem Proving with (Long-)ContextsarXiv 2024An Interpretable Neuro-Symbolic Reasoning Framework for Task-Oriented Dialogue GenerationACL 2022 5RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language ModelsarXiv 2023Data Augmentation Approaches in Natural Language Processing: A SurveyarXiv 2021