0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Few-Shot Character Understanding in Movies as an Assessment to Meta-Learning of Theory-of-MindarXiv 2022Whatcha lookin' at? DeepLIFTing BERT's Attention in Question AnsweringarXiv 2019Optimizing Deep Learning Models For Raspberry PiarXiv 2023Causality Guided Disentanglement for Cross-Platform Hate Speech DetectionarXiv 2023Deciphering the Interplay of Parametric and Non-parametric Memory in Retrieval-augmented Language ModelsarXiv 2024Bugs in Large Language Models Generated Code: An Empirical StudyarXiv 2024E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight AnchoringarXiv 2026Multilingual Machine Translation with Hyper-AdaptersarXiv 2022Removing Non-Stationary Knowledge From Pre-Trained Language Models for Entity-Level Sentiment Classification in FinancearXiv 2023On Investigating the Conservative Property of Score-Based Generative ModelsarXiv 2022DASS: Differentiable Architecture Search for Sparse neural networksarXiv 2022Anomaly Detection in Large-Scale Cloud Systems: An Industry Case and DatasetarXiv 2024Asymptotically free sketched ridge ensembles: Risks, cross-validation, and tuningarXiv 2023Sudden Drops in the Loss: Syntax Acquisition, Phase Transitions, and Simplicity Bias in MLMsarXiv 2023CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language ModelsarXiv 2025Causal de Finetti: On the Identification of Invariant Causal Structure in Exchangeable Datacausal-de-finetti-on-the-identification-ofPrecision Aquaculture: An Integrated Computer Vision and IoT Approach for Optimized Tilapia FeedingarXiv 2024Question rewriting? Assessing its importance for conversational question answeringarXiv 2022EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential ReasoningarXiv 2024Low-Resource Court Judgment Summarization for Common Law SystemsarXiv 2024In-Context Learning Dynamics with Random Binary SequencesarXiv 2023Neural Contextual Bandits without RegretarXiv 2021Automated Dynamic Algorithm ConfigurationarXiv 2022Teaching Transformers Causal Reasoning through Axiomatic TrainingarXiv 2024Exploring the Benefits of Visual Prompting in Differential PrivacyICCV 2023 1Personalized Denoising Implicit Feedback for Robust Recommender SystemarXiv 2025Reading Subtext: Evaluating Large Language Models on Short Story Summarization with WritersarXiv 2024MimeQA: Towards Socially-Intelligent Nonverbal Foundation ModelsarXiv 2025Towards Faithful Explanations: Boosting Rationalization with Shortcuts DiscoveryarXiv 2024Certified Robustness to Word Substitution Ranking Attack for Neural Ranking ModelsarXiv 2022Model Editing at Scale leads to Gradual and Catastrophic ForgettingarXiv 2024Synergies between Disentanglement and Sparsity: Generalization and Identifiability in Multi-Task LearningarXiv 2022Cluster-Specific Predictions with Multi-Task Gaussian ProcessesarXiv 2020AutoEval Done Right: Using Synthetic Data for Model EvaluationarXiv 2024Machine Learning Workflow to Explain Black-box Models for Early Alzheimer's Disease Classification Evaluated for Multiple DatasetsarXiv 2022Task-Adaptive Tokenization: Enhancing Long-Form Text Generation Efficacy in Mental Health and BeyondarXiv 2023Never Lost in the Middle: Mastering Long-Context Question Answering with Position-Agnostic Decompositional TrainingarXiv 2023Cross-lingual Argument Mining in the Medical DomainarXiv 2023Prompt Space Optimizing Few-shot Reasoning Success with Large Language ModelsarXiv 2023The Effectiveness of Data Augmentation in Image Classification using Deep LearningarXiv 2017Dataset and Lessons Learned from the 2024 SaTML LLM Capture-the-Flag CompetitionarXiv 2024Unsupervised Learning and Exploration of Reachable Outcome SpacearXiv 2019Key Protected Classification for Collaborative LearningarXiv 2019Variational Hierarchical Dialog Autoencoder for Dialog State Tracking Data AugmentationEMNLP 2020 11WL meet VCarXiv 2023To be or not to be stable, that is the question: understanding neural networks for inverse problemsarXiv 2022NNOSE: Nearest Neighbor Occupational Skill ExtractionarXiv 2024Adaptive Regularization of Representation Rank as an Implicit Constraint of Bellman EquationarXiv 2024CrossIn: An Efficient Instruction Tuning Approach for Cross-Lingual Knowledge AlignmentarXiv 2024You can remove GPT2's LayerNorm by fine-tuningarXiv 2024ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline ContextarXiv 2024Label Noise: Ignorance Is BlissarXiv 2024Lost in the Folds: When Cross-Validation Is Not a Deep Ensemble for Uncertainty EstimationarXiv 2026Marginal Tail-Adaptive Normalizing Flowsmarginal-tail-adaptive-normalizing-flowsDefending Against Disinformation Attacks in Open-Domain Question AnsweringarXiv 2022Learning heterogeneous delays in a layer of spiking neurons for fast motion detectionarXiv 2023ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task PlanningarXiv 2023Flesch or Fumble? Evaluating Readability Standard Alignment of Instruction-Tuned Language ModelsarXiv 2023Automated Coding of Under-Studied Medical Concept Domains: Linking Physical Activity Reports to the International Classification of Functioning, Disability, and HealtharXiv 2020What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific PresentationsarXiv 2025Guardrail Baselines for Unlearning in LLMsarXiv 2024ACR Loss: Adaptive Coordinate-based Regression Loss for Face AlignmentarXiv 2022WebSuite: Systematically Evaluating Why Web Agents FailarXiv 2024The Fellowship of the LLMs: Multi-Agent Workflows for Synthetic Preference Optimization Dataset GenerationarXiv 2024TASA: Deceiving Question Answering Models by Twin Answer Sentences AttackarXiv 2022Differentiable Model Selection for Ensemble LearningarXiv 2022Are Gaussian data all you need? Extents and limits of universality in high-dimensional generalized linear estimationarXiv 2023Honey, I Shrunk the Language: Language Model Behavior at Reduced ScalearXiv 2023An Expanded Massive Multilingual Dataset for High-Performance Language TechnologiesarXiv 2025Which Side Are You On? A Multi-task Dataset for End-to-End Argument Summarisation and EvaluationarXiv 2024Chain-of-Instructions: Compositional Instruction Tuning on Large Language ModelsarXiv 2024A Novel Multi-Stage Prompting Approach for Language Agnostic MCQ Generation using GPTarXiv 2024Structured Stochastic Gradient MCMCstructured-stochastic-gradient-mcmc-1Model Selection for Bayesian AutoencodersNeurIPS 2021 12UniGen: Universal Domain Generalization for Sentiment Classification via Zero-shot Dataset GenerationarXiv 2024Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-TeachingarXiv 2024README: Bridging Medical Jargon and Lay Understanding for Patient Education through Data-Centric NLParXiv 2023Learning Rate Schedules in the Presence of Distribution ShiftarXiv 2023Revisiting Knowledge Distillation for Autoregressive Language ModelsarXiv 2024Single and Multi-Hop Question-Answering Datasets for Reticular Chemistry with GPT-4-TurboarXiv 2024CoCoNUT: Structural Code Understanding does not fall out of a treearXiv 20253-in-1: 2D Rotary Adaptation for Efficient Finetuning, Efficient Batching and ComposabilityarXiv 2024Unveiling the Human-like Similarities of Automatic Facial Expression Recognition: An Empirical Exploration through Explainable AIarXiv 2024Should We Fine-Tune or RAG? Evaluating Different Techniques to Adapt LLMs for DialoguearXiv 2024The Confidence-Competence Gap in Large Language Models: A Cognitive StudyarXiv 2023Implicit Personalization in Language Models: A Systematic StudyarXiv 2024Multi-Fidelity Covariance Estimation in the Log-Euclidean GeometryarXiv 2023Nonparametric extensions of randomized response for private confidence setsarXiv 2022Translation and Fusion Improves Zero-shot Cross-lingual Information ExtractionarXiv 2023Identifiability and Generalizability in Constrained Inverse Reinforcement LearningarXiv 2023Event-Centric Question Answering via Contrastive Learning and Invertible Event TransformationarXiv 2022MixFlows: principled variational inference via mixed flowsarXiv 2022DELPHI: Data for Evaluating LLMs' Performance in Handling Controversial IssuesarXiv 2023Arabic Synonym BERT-based Adversarial Examples for Text ClassificationarXiv 2024Can We Enhance Bug Report Quality Using LLMs?: An Empirical Study of LLM-Based Bug Report GenerationarXiv 2025CEval: A Benchmark for Evaluating Counterfactual Text GenerationarXiv 2024BPO: Staying Close to the Behavior LLM Creates Better Online LLM AlignmentarXiv 2024Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource LanguagesarXiv 2024Zero- and Few-Shot Prompting with LLMs: A Comparative Study with Fine-tuned Models for Bangla Sentiment AnalysisarXiv 2023Tighter Information-Theoretic Generalization Bounds from SupersamplesarXiv 2023Generative Social ChoicearXiv 2023Skill Machines: Temporal Logic Skill Composition in Reinforcement LearningarXiv 2022Discovering Knowledge-Critical Subnetworks in Pretrained Language ModelsarXiv 2023Early Time Classification with Accumulated Accuracy Gap ControlarXiv 2024Large Language Models are biased to overestimate profoundnessarXiv 2023NaijaHate: Evaluating Hate Speech Detection on Nigerian Twitter Using Representative DataarXiv 2024Overview of AuTexTification at IberLEF 2023: Detection and Attribution of Machine-Generated Text in Multiple DomainsarXiv 2023REPT: Bridging Language Models and Machine Reading Comprehension via Retrieval-Based Pre-trainingFindings (ACL) 2021 8Comparing Inferential Strategies of Humans and Large Language Models in Deductive ReasoningarXiv 2024Enhancing the General Agent Capabilities of Low-Parameter LLMs through Tuning and Multi-Branch ReasoningarXiv 2024Where Are We? Evaluating LLM Performance on African LanguagesarXiv 2025A Causal Lens for Evaluating Faithfulness MetricsarXiv 2025Robust Online Video Instance Segmentation with Track QueriesarXiv 2022Automatic Data Augmentation via Invariance-Constrained LearningarXiv 2022Rethinking Learning Rate Tuning in the Era of Large Language ModelsarXiv 2023How Much Do LLMs Hallucinate across Languages? On Multilingual Estimation of LLM Hallucination in the WildarXiv 2025MMICT: Boosting Multi-Modal Fine-Tuning with In-Context ExamplesarXiv 2023Dissecting FLOPs along input dimensions for GreenAI cost estimationsarXiv 2021A Baseline Readability Model for CebuanoNAACL (BEA) 2022 7Towards a Robust Framework for Multimodal Hate Detection: A Study on Video vs. Image-based ContentarXiv 2025Intrinsic Sliced Wasserstein Distances for Comparing Collections of Probability Distributions on Manifolds and GraphsarXiv 2020Label Distributionally Robust Losses for Multi-class Classification: Consistency, Robustness and AdaptivityarXiv 2021A Theoretical Framework for Inference LearningarXiv 2022A Little Pretraining Goes a Long Way: A Case Study on Dependency Parsing Task for Low-resource Morphologically Rich LanguagesEACL 2021 2DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference OptimizationarXiv 2025Data Augmentation for Hypernymy DetectionEACL 2021 2ShareLoRA: Parameter Efficient and Robust Large Language Model Fine-tuning via Shared Low-Rank AdaptationarXiv 2024LLMs Can Plan Only If We Tell ThemarXiv 2025Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM AgentsarXiv 2025ChronoSense: Exploring Temporal Understanding in Large Language Models with Time Intervals of EventsarXiv 2025Offensive Language Identification in Greekoffensive-language-identification-in-greek-1AutoTemplate: A Simple Recipe for Lexically Constrained Text GenerationarXiv 2022Evaluating the Capabilities of Large Language Models for Multi-label Emotion UnderstandingarXiv 2024Balancing the Style-Content Trade-Off in Sentiment Transfer Using Polarity-Aware DenoisingarXiv 2023SitPose: Real-Time Detection of Sitting Posture and Sedentary Behavior Using Ensemble Learning With Depth SensorarXiv 2024Transparency Helps Reveal When Language Models Learn MeaningarXiv 2022Project and Forget: Solving Large-Scale Metric Constrained ProblemsarXiv 2020Text classification dataset and analysis for Uzbek languagearXiv 2023Synthetic Knowledge Ingestion: Towards Knowledge Refinement and Injection for Enhancing Large Language ModelsarXiv 2024STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming MediaarXiv 2026Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI ModelsarXiv 2024Chain-of-Dictionary Prompting Elicits Translation in Large Language ModelsarXiv 2023Pruning artificial neural networks: a way to find well-generalizing, high-entropy sharp minimaarXiv 2020A Transformer-Based Approach for Smart Invocation of Automatic Code CompletionarXiv 2024QUEST: Query Stream for Practical Cooperative PerceptionarXiv 2023ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language UnderstandingarXiv 2024SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic GradingarXiv 2024Knowledge-to-SQL: Enhancing SQL Generation with Data Expert LLMarXiv 2024Reasoning Limitations of Multimodal Large Language Models. A case study of Bongard ProblemsarXiv 2024Retrieval-Augmented Generation with Estimation of Source ReliabilityarXiv 2024RadioGalaxyNET: Dataset and Novel Computer Vision Algorithms for the Detection of Extended Radio Galaxies and Infrared HostsarXiv 2023Are AI Detectors Good Enough? A Survey on Quality of Datasets With Machine-Generated TextsarXiv 2024Extending Context Window of Large Language Models from a Distributional PerspectivearXiv 2024BlindHarmony: "Blind" Harmonization for MR Images via Flow modelICCV 2023 1Pulling Target to Source: A New Perspective on Domain Adaptive Semantic SegmentationarXiv 2023Importance Weighting Can Help Large Language Models Self-ImprovearXiv 2024ECon: On the Detection and Resolution of Evidence ConflictsarXiv 2024Clipping Improves Adam-Norm and AdaGrad-Norm when the Noise Is Heavy-TailedarXiv 2024COMMUNITY-CROSS-INSTRUCT: Unsupervised Instruction Generation for Aligning Large Language Models to Online CommunitiesarXiv 2024Structured Like a Language Model: Analysing AI as an Automated SubjectarXiv 2022Problematic Tokens: Tokenizer Bias in Large Language ModelsarXiv 2024Jointly Predicting Emotion, Age, and Country Using Pre-Trained Acoustic EmbeddingarXiv 2022Federated Zeroth-Order Optimization using Trajectory-Informed Surrogate GradientsarXiv 2023Comparative Study on the Performance of Categorical Variable Encoders in Classification and Regression TasksarXiv 2024Offline Data Enhanced On-Policy Policy Gradient with Provable GuaranteesarXiv 2023Alternating Local Enumeration (TnALE): Solving Tensor Network Structure Search with Fewer EvaluationsarXiv 2023Exploring the Curious Case of Code PromptsarXiv 2023The relationship between reasoning and performance in large language models--o3 (mini) thinks harder, not longerarXiv 2025DVPT: Dynamic Visual Prompt Tuning of Large Pre-trained Models for Medical Image AnalysisarXiv 2023Math Word Problem Solving by Generating Linguistic Variants of Problem StatementsarXiv 2023Evaluation Measures of Individual Item Fairness for Recommender Systems: A Critical StudyarXiv 2023Are Large Language Models Good Prompt Optimizers?arXiv 2024Understanding the Learning Dynamics of Alignment with Human FeedbackarXiv 2024Forecasting Internally Displaced Population Migration Patterns in Syria and YemenarXiv 2018Variational sparse inverse Cholesky approximation for latent Gaussian processes via double Kullback-Leibler minimizationarXiv 2023Estimating Large Language Model Capabilities without Labeled Test DataarXiv 2023Covariate balancing using the integral probability metric for causal inferencearXiv 2023Simplex Random FeaturesarXiv 2023How transformers learn structured data: insights from hierarchical filteringarXiv 2024FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem ProvingarXiv 2024Learning Mixtures of Markov Chains and MDPsarXiv 2022A non-asymptotic approach for model selection via penalization in high-dimensional mixture of experts modelsarXiv 2021RidgeBase: A Cross-Sensor Multi-Finger Contactless Fingerprint DatasetarXiv 2023PAC-Bayesian Generalization Bounds for Adversarial Generative ModelsarXiv 2023The Factuality Tax of Diversity-Intervened Text-to-Image Generation: Benchmark and Fact-Augmented InterventionarXiv 2024A Corpus for Sentence-level Subjectivity Detection on English News ArticlesarXiv 2023A Tale of Two DRAGGNs: A Hybrid Approach for Interpreting Action-Oriented and Goal-Oriented Instructionsa-tale-of-two-draggns-a-hybrid-approach-for-1Fast Adversarial Training with Smooth ConvergenceICCV 2023 1Linguistic Generalizability of Test-Time Scaling in Mathematical ReasoningarXiv 2025Lessons learned from the evaluation of Spanish Language ModelsarXiv 2022GeoMultiTaskNet: remote sensing unsupervised domain adaptation using geographical coordinatesarXiv 2023Teaching Models to Balance Resisting and Accepting PersuasionarXiv 2024Semi-supervised Active Learning for Video Action DetectionarXiv 2023LAMPAT: Low-Rank Adaption for Multilingual Paraphrasing Using Adversarial TrainingarXiv 2024Bagging Provides Assumption-free StabilityarXiv 2023There is No Big Brother or Small Brother: Knowledge Infusion in Language Models for Link Prediction and Question AnsweringarXiv 2023A Large-Scale Dataset for Biomedical Keyphrase GenerationarXiv 2022PDDLEGO: Iterative Planning in Textual EnvironmentsarXiv 2024Rethinking and Refining the Distinct MetricACL 2022 5InstructAvatar: Text-Guided Emotion and Motion Control for Avatar GenerationarXiv 2024

Back to Papers