All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Automatic Curriculum Expert Iteration for Reliable LLM ReasoningarXiv 2024IndicSUPERB: A Speech Processing Universal Performance Benchmark for Indian languagesarXiv 2022Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language ModelsarXiv 2023Enhancing Visual Place Recognition via Fast and Slow Adaptive Biasing in Event CamerasarXiv 2024Model Criticism for Long-Form Text GenerationarXiv 2022SEA: Sparse Linear Attention with Estimated Attention MaskarXiv 2023SALSA-Lite: A Fast and Effective Feature for Polyphonic Sound Event Localization and Detection with Microphone ArraysarXiv 2021Finding the Task-Optimal Low-Bit Sub-Distribution in Deep Neural NetworksarXiv 2021The Pushshift Reddit DatasetarXiv 2020End-to-end Training for Recommendation with Language-based User ProfilesarXiv 2024LLM-DetectAIve: a Tool for Fine-Grained Machine-Generated Text DetectionarXiv 2024Can Linguistic Knowledge Improve Multimodal Alignment in Vision-Language Pretraining?arXiv 2023Attention-Based Recurrence for Multi-Agent Reinforcement Learning under
Stochastic Partial ObservabilityarXiv 2023Prompter: Zero-shot Adaptive Prefixes for Dialogue State Tracking Domain AdaptationarXiv 2023FactPICO: Factuality Evaluation for Plain Language Summarization of Medical EvidencearXiv 2024When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex CiphersarXiv 2024Bias Out-of-the-Box: An Empirical Analysis of Intersectional Occupational Biases in Popular Generative Language ModelsNeurIPS 2021 12Evidential Turing Processesevidential-turing-processes-1TurkishMMLU: Measuring Massive Multitask Language Understanding in TurkisharXiv 2024A Large-Scale Study of Probabilistic Calibration in Neural Network RegressionarXiv 2023BootPIG: Bootstrapping Zero-shot Personalized Image Generation Capabilities in Pretrained Diffusion ModelsarXiv 2024A Benchmark and Dataset for Post-OCR text correction in SanskritarXiv 2022Creative Birds: Self-Supervised Single-View 3D Style TransferICCV 2023 1Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image ClassificationarXiv 2023DiG-IN: Diffusion Guidance for Investigating Networks -- Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual ExplanationsarXiv 2023Mentor-KD: Making Small Language Models Better Multi-step ReasonersarXiv 2024Evaluating the Robustness of Interpretability Methods through Explanation Invariance and EquivarianceNeurIPS 2023 11$\texttt{MixGR}$: Enhancing Retriever Generalization for Scientific Domain through Complementary GranularityarXiv 2024One Eye is All You Need: Lightweight Ensembles for Gaze Estimation with Single EncodersarXiv 2022RoMe: A Robust Metric for Evaluating Natural Language GenerationACL 2022 5Non-Vacuous Generalization Bounds for Large Language ModelsarXiv 2023P1AC: Revisiting Absolute Pose From a Single Affine CorrespondenceICCV 2023 1A Fair and Comprehensive Comparison of Multimodal Tweet Sentiment Analysis MethodsarXiv 2021Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News ArticlesarXiv 2023AdaptiveStep: Automatically Dividing Reasoning Step through Model ConfidencearXiv 2025Avoiding Inference Heuristics in Few-shot Prompt-based FinetuningEMNLP 2021 11Algorithmic progress in language modelsarXiv 2024IsamasRed: A Public Dataset Tracking Reddit Discussions on Israel-Hamas
ConflictarXiv 2024Repairing without Retraining: Avoiding Disparate Impact with Counterfactual DistributionsarXiv 2019How Large Language Models are Transforming Machine-Paraphrased PlagiarismarXiv 2022Benchmarking Llama2, Mistral, Gemma and GPT for Factuality, Toxicity, Bias and Propensity for HallucinationsarXiv 2024Competing for Shareable Arms in Multi-Player Multi-Armed BanditsarXiv 2023Revisit Input Perturbation Problems for LLMs: A Unified Robustness Evaluation Framework for Noisy Slot Filling TaskarXiv 2023LychSim: A Controllable and Interactive Simulation Framework for Vision ResearcharXiv 2026Language-Informed Visual Concept LearningarXiv 2023Learning Evolving Tools for Large Language ModelsarXiv 2024QALD-9-plus: A Multilingual Dataset for Question Answering over DBpedia and Wikidata Translated by Native Speakersqald-9-plus-a-multilingual-dataset-for-1Gumbel Counterfactual Generation From Language ModelsarXiv 2024Seeking and Updating with Live Visual KnowledgearXiv 2025Leveraging Unlabeled Data to Predict Out-of-Distribution Performanceleveraging-unlabeled-data-to-predict-out-ofEvaluating Large Language Models on Graphs: Performance Insights and Comparative AnalysisarXiv 2023OVOR: OnePrompt with Virtual Outlier Regularization for Rehearsal-Free Class-Incremental LearningarXiv 2024Enhancing Low-Resource Relation Representations through Multi-View DecouplingarXiv 2023Multicalibration as Boosting for RegressionarXiv 2023Learning Shared Safety Constraints from Multi-task Demonstrationslearning-shared-safety-constraints-from-multiMulti-band MelGAN: Faster Waveform Generation for High-Quality
Text-to-SpeecharXiv 2020Magneto: Combining Small and Large Language Models for Schema MatchingarXiv 2024Augment and Reduce: Stochastic Inference for Large Categorical DistributionsICML 2018Cross-document Event Coreference Search: Task, Dataset and ModelingarXiv 2022SOLD: Sinhala Offensive Language DatasetarXiv 2022Adapting Pretrained Transformer to Lattices for Spoken Language UnderstandingarXiv 2020Rethinking Token Reduction for State Space ModelsarXiv 2024Semi-Supervised Learning via Weight-aware Distillation under Class Distribution MismatchICCV 2023 1Memory Injections: Correcting Multi-Hop Reasoning Failures during Inference in Transformer-Based Language ModelsarXiv 2023Distilling Motion Planner Augmented Policies into Visual Control Policies for Robot ManipulationarXiv 2021Scaling Data Diversity for Fine-Tuning Language Models in Human AlignmentarXiv 2024Node Embedding from Neural Hamiltonian Orbits in Graph Neural NetworksarXiv 2023Taming Diffusion for Dataset Distillation with High RepresentativenessarXiv 2025Probabilistic Precision and Recall Towards Reliable Evaluation of Generative ModelsICCV 2023 1UIUC_BioNLP at SemEval-2021 Task 11: A Cascade of Neural Models for Structuring Scholarly NLP ContributionsarXiv 2021CoMAT: Chain of Mathematically Annotated Thought Improves Mathematical ReasoningarXiv 2024DeepSeek-R1 Thoughtology: Let's think about LLM ReasoningarXiv 2025Spectral Adapter: Fine-Tuning in Spectral SpacearXiv 2024Unsupervised Enrichment of Persona-grounded Dialog with Background StoriesACL 2021 5Improving the Accuracy-Robustness Trade-Off of Classifiers via Adaptive SmoothingarXiv 2023GSAP-NER: A Novel Task, Corpus, and Baseline for Scholarly Entity Extraction Focused on Machine Learning Models and DatasetsarXiv 2023Modulate Your Spectrum in Self-Supervised LearningarXiv 2023FuxiTranyu: A Multilingual Large Language Model Trained with Balanced DataarXiv 2024Mastering Symbolic Operations: Augmenting Language Models with Compiled Neural NetworksarXiv 2023M-ABSA: A Multilingual Dataset for Aspect-Based Sentiment AnalysisarXiv 2025Can Prompt Probe Pretrained Language Models? Understanding the Invisible Risks from a Causal ViewACL 2022 5Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only TrainingarXiv 2024Text Summarization Using Large Language Models: A Comparative Study of MPT-7b-instruct, Falcon-7b-instruct, and OpenAI Chat-GPT ModelsarXiv 2023Ev-TTA: Test-Time Adaptation for Event-Based Object RecognitionCVPR 2022 1Towards Deeply Unified Depth-aware Panoptic Segmentation with Bi-directional Guidance LearningICCV 2023 1LegalLens: Leveraging LLMs for Legal Violation Identification in Unstructured TextarXiv 2024ROCK: Causal Inference Principles for Reasoning about Commonsense CausalityarXiv 2022KDEformer: Accelerating Transformers via Kernel Density EstimationarXiv 2023Greed is Good: Exploration and Exploitation Trade-offs in Bayesian OptimisationarXiv 2019EAGER: Asking and Answering Questions for Automatic Reward Shaping in Language-guided RLarXiv 2022ClinicalMamba: A Generative Clinical Language Model on Longitudinal Clinical NotesarXiv 2024TLDR: Token Loss Dynamic Reweighting for Reducing Repetitive Utterance GenerationarXiv 2020Hard No-Box Adversarial Attack on Skeleton-Based Human Action Recognition with Skeleton-Motion-Informed GradientICCV 2023 1Pre-train or Annotate? Domain Adaptation with a Constrained BudgetEMNLP 2021 11Mokav: Execution-driven Differential Testing with LLMsarXiv 2024Beyond Imitation: Leveraging Fine-grained Quality Signals for AlignmentarXiv 2023A Roadmap to Pluralistic AlignmentarXiv 2024SMILe: Leveraging Submodular Mutual Information For Robust Few-Shot Object DetectionarXiv 2024Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised PretrainingarXiv 2023Discriminator-Cooperated Feature Map Distillation for GAN CompressionCVPR 2023 1Navigating Dataset Documentations in AI: A Large-Scale Analysis of Dataset Cards on Hugging FacearXiv 2024From Imitation to Introspection: Probing Self-Consciousness in Language ModelsarXiv 2024Training Audio Captioning Models without AudioarXiv 2023Continuous Diffusion for Mixed-Type Tabular DataarXiv 2023It's All in the Heads: Using Attention Heads as a Baseline for Cross-Lingual Transfer in Commonsense ReasoningarXiv 2021SOUS VIDE: Cooking Visual Drone Navigation Policies in a Gaussian Splatting VacuumarXiv 2024Scaling Laws for Linear Complexity Language ModelsarXiv 2024SEED: Accelerating Reasoning Tree Construction via Scheduled Speculative DecodingarXiv 2024Augmented Sliced Wasserstein Distancesaugmented-sliced-wasserstein-distances-1OT-VP: Optimal Transport-guided Visual Prompting for Test-Time AdaptationarXiv 2024Know Your Limits: Uncertainty Estimation with ReLU Classifiers Fails at Reliable OOD DetectionarXiv 2020Expediting Large-Scale Vision Transformer for Dense Prediction without Fine-tuningarXiv 2022A multifidelity approach to continual learning for physical systemsarXiv 2023Multi-source Semantic Graph-based Multimodal Sarcasm Explanation GenerationarXiv 2023Introducing Language Guidance in Prompt-based Continual LearningICCV 2023 1Sequential Voting with Relational Box Fields for Active Object DetectionCVPR 2022 1AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient OptimizationCVPR 2025 1ChartReformer: Natural Language-Driven Chart Image EditingarXiv 2024FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language ModelsarXiv 2025Unmasking real-world audio deepfakes: A data-centric approacharXiv 2025Prediction Error-based Classification for Class-Incremental LearningarXiv 2023Learning to Learn from APIs: Black-Box Data-Free Meta-LearningarXiv 2023Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChainarXiv 2023ChartCheck: Explainable Fact-Checking over Real-World Chart ImagesarXiv 2023QUERT: Continual Pre-training of Language Model for Query Understanding in Travel Domain SearcharXiv 2023YOLO9tr: A Lightweight Model for Pavement Damage Detection Utilizing a Generalized Efficient Layer Aggregation Network and Attention MechanismarXiv 2024Learning Rewards from Linguistic FeedbackarXiv 2020LLM Cognitive Judgements Differ From HumanarXiv 2023Structured World Representations in Maze-Solving TransformersarXiv 2023Are Large-scale Soft Labels Necessary for Large-scale Dataset Distillation?arXiv 2024Learning to Refuse: Towards Mitigating Privacy Risks in LLMsarXiv 2024Feature Expansion for Graph Neural NetworksarXiv 2023FineCIR: Explicit Parsing of Fine-Grained Modification Semantics for Composed Image RetrievalarXiv 2025Marathon: A Race Through the Realm of Long Context with Large Language ModelsarXiv 2023DALE: Generative Data Augmentation for Low-Resource Legal NLParXiv 2023Neural Foundations of Mental Simulation: Future Prediction of Latent Representations on Dynamic ScenesNeurIPS 2023 11Grounding Dialogue Systems via Knowledge Graph Aware Decoding with Pre-trained TransformersarXiv 2021Optimizing Hyperparameters with Conformal Quantile RegressionarXiv 2023Under-Display Camera Image Restoration with Scattering EffectICCV 2023 1Re-ReST: Reflection-Reinforced Self-Training for Language AgentsarXiv 2024HealthFC: Verifying Health Claims with Evidence-Based Medical Fact-CheckingarXiv 2023The Integration of Semantic and Structural Knowledge in Knowledge Graph Entity TypingarXiv 2024A Comprehensive Analysis of Adapter EfficiencyarXiv 2023Linear Causal Disentanglement via InterventionsarXiv 2022Models and Datasets for Cross-Lingual Summarisationmodels-and-datasets-for-cross-lingualElements of World Knowledge (EWOK): A cognition-inspired framework for evaluating basic world knowledge in language modelsarXiv 2024CONDAQA: A Contrastive Reading Comprehension Dataset for Reasoning about NegationarXiv 2022Story Visualization by Online Text Augmentation with Context MemoryICCV 2023 1TreeMix: Compositional Constituency-based Data Augmentation for Natural Language UnderstandingNAACL 2022 7Benchmarking Knowledge Boundary for Large Language Models: A Different Perspective on Model EvaluationarXiv 2024Perception Datasets for Anomaly Detection in Autonomous Driving: A SurveyarXiv 2023Abstraction-of-Thought Makes Language Models Better ReasonersarXiv 2024Data Roaming and Quality Assessment for Composed Image RetrievalarXiv 2023Geometric-Facilitated Denoising Diffusion Model for 3D Molecule GenerationarXiv 2024AnswerSumm: A Manually-Curated Dataset and Pipeline for Answer SummarizationNAACL 2022 7Investigating Transfer Learning in Multilingual Pre-trained Language Models through Chinese Natural Language InferenceFindings (ACL) 2021 8Energy-guided Entropic Neural Optimal TransportarXiv 2023Protein Multimer Structure Prediction via Prompt LearningarXiv 2024Enhancing Continual Relation Extraction via Classifier DecompositionarXiv 2023DEPLAIN: A German Parallel Corpus with Intralingual Translations into Plain Language for Sentence and Document SimplificationarXiv 2023Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human RatingsarXiv 2024Sequential Training of Neural Networks with Gradient BoostingarXiv 2019Defending Against Patch-based Backdoor Attacks on Self-Supervised LearningCVPR 2023 1Scope is all you need: Transforming LLMs for HPC CodearXiv 2023Empower Large Language Model to Perform Better on Industrial Domain-Specific Question AnsweringarXiv 2023Failures Pave the Way: Enhancing Large Language Models through Tuning-free Rule AccumulationarXiv 2023ARAUS: A Large-Scale Dataset and Baseline Models of Affective Responses
to Augmented Urban SoundscapesarXiv 2022A CLIP-Hitchhiker's Guide to Long Video RetrievalarXiv 2022Knowledge-Aware Federated Active Learning with Non-IID DataICCV 2023 1Preparing Lessons for Progressive Training on Language ModelsarXiv 2024Almost AI, Almost Human: The Challenge of Detecting AI-Polished WritingarXiv 2025Knowledge Distillation Based on Transformed Teacher MatchingarXiv 2024Get an A in Math: Progressive Rectification PromptingarXiv 2023mEdIT: Multilingual Text Editing via Instruction TuningarXiv 2024Less is More for Long Document Summary Evaluation by LLMsarXiv 2023SUMMIT: Source-Free Adaptation of Uni-Modal Models to Multi-Modal TargetsICCV 2023 1DTT: An Example-Driven Tabular Transformer for Joinability by Leveraging
Large Language ModelsarXiv 2023U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMsarXiv 2024The Value of Out-of-Distribution DataarXiv 2022GlobalWoZ: Globalizing MultiWoZ to Develop Multilingual Task-Oriented Dialogue SystemsACL 2022 5MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation SystemsarXiv 2024Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical DocumentsarXiv 2025DAIC-WOZ: On the Validity of Using the Therapist's prompts in Automatic Depression Detection from Clinical InterviewsarXiv 2024STAR-R1: Spacial TrAnsformation Reasoning by Reinforcing Multimodal LLMsarXiv 2025RAG Playground: A Framework for Systematic Evaluation of Retrieval Strategies and Prompt Engineering in RAG SystemsarXiv 2024DiS-ReX: A Multilingual Dataset for Distantly Supervised Relation ExtractionACL 2022 5Exploiting Reasoning Chains for Multi-hop Science Question AnsweringFindings (EMNLP) 2021 11Controllable Mixed-Initiative Dialogue Generation through PromptingarXiv 2023Towards Computationally Feasible Deep Active LearningFindings (NAACL) 2022 7Dichotomy of Early and Late Phase Implicit Biases Can Provably Induce GrokkingarXiv 2023Just One Byte (per gradient): A Note on Low-Bandwidth Decentralized Language Model Finetuning Using Shared RandomnessarXiv 2023How Transformers Learn Causal Structure with Gradient DescentarXiv 2024The 3D-PC: a benchmark for visual perspective taking in humans and machinesarXiv 2024zkDL: Efficient Zero-Knowledge Proofs of Deep Learning TrainingarXiv 2023Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language BootstrappingarXiv 2024Lego-MT: Learning Detachable Models for Massively Multilingual Machine TranslationarXiv 2022How does the pre-training objective affect what large language models
learn about linguistic properties?arXiv 2022"That Is a Suspicious Reaction!": Interpreting Logits Variation to Detect NLP Adversarial AttacksarXiv 2022Leveraging Large Language Models for Node Generation in Few-Shot Learning on Text-Attributed GraphsarXiv 2023Digital Peter: Dataset, Competition and Handwriting Recognition MethodsarXiv 2021