All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQarXiv 2024Exploring Large Language Models for Ontology AlignmentarXiv 2023Less is More: Selective Layer Finetuning with SubTuningarXiv 2023Analogy Generation by Prompting Large Language Models: A Case Study of InstructGPTarXiv 2022Unsupervised domain adaptation for clinician pose estimation and instance segmentation in the operating roomarXiv 2021Advancing Intelligent Sequence Modeling: Evolution, Trade-offs, and Applications of State-Space Architectures from S4 to MambaarXiv 2025MoralDial: A Framework to Train and Evaluate Moral Dialogue Systems via Moral DiscussionsarXiv 2022Confidence through AttentionMTSummit 2017 9RFLA: A Stealthy Reflected Light Adversarial Attack in the Physical WorldICCV 2023 1Accelerating Resonance Searches via Signature-Oriented Pre-trainingarXiv 2024A path-norm toolkit for modern networks: consequences, promises and challengesarXiv 2023Quantifying Generalization Complexity for Large Language ModelsarXiv 2024WeCheck: Strong Factual Consistency Checker via Weakly Supervised LearningarXiv 2022PuoBERTa: Training and evaluation of a curated language model for SetswanaarXiv 2023Improving Variational Autoencoders with Density Gap-based RegularizationarXiv 2022Towards Automatic Boundary Detection for Human-AI Collaborative Hybrid Essay in EducationarXiv 2023PhyloGFN: Phylogenetic inference with generative flow networksarXiv 2023From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language RepresentationarXiv 2024Learning the Legibility of Visual Text PerturbationsarXiv 2023CaLMQA: Exploring culturally specific long-form question answering across 23 languagesarXiv 2024Hierarchical Recurrent Neural Networks for Conditional Melody Generation with Long-term StructurearXiv 2021NewTerm: Benchmarking Real-Time New Terms for Large Language Models with Annual UpdatesarXiv 2024Learning to Imagine: Visually-Augmented Natural Language GenerationarXiv 2023The Fine-Tuning Paradox: Boosting Translation Quality Without Sacrificing LLM AbilitiesarXiv 2024Can We Verify Step by Step for Incorrect Answer Detection?arXiv 2024Investigating Societal Biases in a Poetry Composition SystemGeBNLP (COLING) 2020 12Self-Training Large Language Models for Tool-Use Without DemonstrationsarXiv 2025Backdoor Defense via Suppressing Model ShortcutsarXiv 2022Sloth: scaling laws for LLM skills to predict multi-benchmark performance across familiesarXiv 2024Data-independent Module-aware Pruning for Hierarchical Vision TransformersarXiv 2024PAC Prediction Sets Under Label ShiftarXiv 2023Pixel-level Scene Understanding in One Token: Visual States Need What-is-Where CompositionarXiv 2026COLEP: Certifiably Robust Learning-Reasoning Conformal Prediction via Probabilistic CircuitsarXiv 2024Med-EASi: Finely Annotated Dataset and Models for Controllable Simplification of Medical TextsarXiv 2023Posterior Sampling Based on Gradient Flows of the MMD with Negative Distance KernelarXiv 2023Evaluating and Modeling Social Intelligence: A Comparative Study of Human and AI CapabilitiesarXiv 2024How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive PromptsarXiv 2024ClimRetrieve: A Benchmarking Dataset for Information Retrieval from Corporate Climate DisclosuresarXiv 2024Overwriting Pretrained Bias with Finetuning DataICCV 2023 1ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using AgentsarXiv 2026Improving equilibrium propagation without weight symmetry through Jacobian homeostasisarXiv 2023Cross-lingual Editing in Multilingual Language ModelsarXiv 2024Measuring Vision-Language STEM Skills of Neural ModelsarXiv 2024CoDa: Constrained Generation based Data Augmentation for Low-Resource NLParXiv 2024PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual AlignmentarXiv 2024Preserving Modality Structure Improves Multi-Modal LearningICCV 2023 1DDoS-UNet: Incorporating temporal information using Dynamic Dual-channel UNet for enhancing super-resolution of dynamic MRIarXiv 2022Incorporating Word Sense Disambiguation in Neural Language ModelsarXiv 2021Linear Representations of Sentiment in Large Language ModelsarXiv 2023Adversarial robustness of amortized Bayesian inferencearXiv 2023Sense Less, Generate More: Pre-training LiDAR Perception with Masked Autoencoders for Ultra-Efficient 3D SensingarXiv 2024Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting FrameworkarXiv 2024Predicting Change, Not States: An Alternate Framework for Neural PDE SurrogatesarXiv 2024CroissantLLM: A Truly Bilingual French-English Language ModelarXiv 2024Extrinsic Evaluation of Cultural Competence in Large Language ModelsarXiv 2024AnaloBench: Benchmarking the Identification of Abstract and Long-context AnalogiesarXiv 2024Demystifying Local and Global Fairness Trade-offs in Federated Learning Using Partial Information DecompositionarXiv 2023LLM-RankFusion: Mitigating Intrinsic Inconsistency in LLM-based RankingarXiv 2024Leave-one-out Distinguishability in Machine LearningarXiv 2023Multi-granular Legal Topic Classification on Greek LegislationEMNLP (NLLP) 2021 11STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language ModelsarXiv 2024Ensemble Distillation for Unsupervised Constituency ParsingarXiv 2023Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation TrainingarXiv 2024Semantic Decomposition of Question and SQL for Text-to-SQL ParsingarXiv 2023I-Nema: A Biological Image Dataset for Nematode RecognitionarXiv 2021Neural signature kernels as infinite-width-depth-limits of controlled ResNetsarXiv 2023A Neural Pairwise Ranking Model for Readability AssessmentFindings (ACL) 2022 5Multi-Document Summarization with Centroid-Based PretrainingarXiv 2022Robust Recommender System: A Survey and Future DirectionsarXiv 2023What time is it? Temporal Analysis of NovelsEMNLP 2020 11Revealing and Mitigating the Challenge of Detecting Character Knowledge Errors in LLM Role-PlayingarXiv 2024Language Model Alignment with Elastic Resetlanguage-model-alignment-with-elastic-resetCOPAL-ID: Indonesian Language Reasoning with Local Culture and NuancesarXiv 2023BIRCO: A Benchmark of Information Retrieval Tasks with Complex ObjectivesarXiv 2024Human-like Linguistic Biases in Neural Speech Models: Phonetic Categorization and Phonotactic Constraints in Wav2Vec2.0arXiv 2024Investigating Neural Machine Translation for Low-Resource Languages: Using Bavarian as a Case StudyarXiv 2024TaskWeb: Selecting Better Source Tasks for Multi-task NLParXiv 2023Towards Interpretable Hate Speech Detection using Large Language Model-extracted RationalesarXiv 2024Policy Gradient in Robust MDPs with Global Convergence GuaranteearXiv 2022Multi-task Active Learning for Pre-trained Transformer-based ModelsarXiv 2022Leveraging Multimodal LLM for Inspirational User Interface SearcharXiv 2025Beyond AUROC & co. for evaluating out-of-distribution detection performancearXiv 2023MMLU-Pro+: Evaluating Higher-Order Reasoning and Shortcut Learning in LLMsarXiv 2024What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt EngineeringarXiv 2024Object-centric architectures enable efficient causal representation learningarXiv 2023Attacking by Aligning: Clean-Label Backdoor Attacks on Object DetectionarXiv 2023LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuningarXiv 2025Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic CollaborationarXiv 2024Dissecting Distribution InferencearXiv 2022Enhancing Neural Network Interpretability with Feature-Aligned Sparse AutoencodersarXiv 2024Towards Anytime Fine-tuning: Continually Pre-trained Language Models with Hypernetwork PromptarXiv 2023WDiscOOD: Out-of-Distribution Detection via Whitened Linear Discriminant AnalysisICCV 2023 1How to Determine the Most Powerful Pre-trained Language Model without Brute Force Fine-tuning? An Empirical SurveyarXiv 2023Seeing Through Touch: Tactile-Driven Visual Localization of Material RegionsarXiv 2026Debiased Collaborative Filtering with Kernel-Based Causal BalancingarXiv 2024Exploring Format Consistency for Instruction TuningarXiv 2023A Simple Baseline that Questions the Use of Pretrained-Models in Continual LearningarXiv 2022Learning to Refine with Fine-Grained Natural Language FeedbackarXiv 2024Localized Symbolic Knowledge Distillation for Visual Commonsense Modelslocalized-symbolic-knowledge-distillation-forNapSS: Paragraph-level Medical Text Simplification via Narrative Prompting and Sentence-matching SummarizationarXiv 2023GAMED-Snake: Gradient-aware Adaptive Momentum Evolution Deep Snake Model for Multi-organ SegmentationarXiv 2025Causality-Enhanced Behavior Sequence Modeling in LLMs for Personalized RecommendationarXiv 2024Additive Causal Bandits with Unknown GrapharXiv 2023Exploring the Potential of Encoder-free Architectures in 3D LMMsarXiv 2025On the Identifiability and Estimation of Causal Location-Scale Noise ModelsarXiv 2022Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual SettingsarXiv 2025What Makes Sentences Semantically Related: A Textual Relatedness Dataset and Empirical StudyarXiv 2021ALWOD: Active Learning for Weakly-Supervised Object DetectionICCV 2023 1Uncovering hidden geometry in Transformers via disentangling position and contextarXiv 2023ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMsarXiv 2024Bio-SIEVE: Exploring Instruction Tuning Large Language Models for Systematic Review AutomationarXiv 2023End-to-End Learning for Stochastic Optimization: A Bayesian PerspectivearXiv 2023CLIPSyntel: CLIP and LLM Synergy for Multimodal Question Summarization in HealthcarearXiv 2023Reasoning of Large Language Models over Knowledge Graphs with Super-RelationsarXiv 2025Chain-of-Action: Faithful and Multimodal Question Answering through Large Language ModelsarXiv 2024Provably Robust Conformal Prediction with Improved EfficiencyarXiv 2024Efficient Backdoor Attacks for Deep Neural Networks in Real-world ScenariosarXiv 2023ACCENT: An Automatic Event Commonsense Evaluation Metric for Open-Domain Dialogue SystemsarXiv 2023An Analysis of Social Biases Present in BERT Variants Across Multiple LanguagesarXiv 2022Adapters for Altering LLM Vocabularies: What Languages Benefit the Most?arXiv 2024Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning ModelarXiv 2025What's documented in AI? Systematic Analysis of 32K AI Model CardsarXiv 2024Factorization Vision Transformer: Modeling Long Range Dependency with Local Window CostarXiv 2023Deep Network Uncertainty Maps for Indoor NavigationarXiv 2018Are Hard Examples also Harder to Explain? A Study with Human and Model-Generated ExplanationsarXiv 2022PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity MaximizationarXiv 2024Adapting Monolingual Models: Data can be Scarce when Language Similarity is HighFindings (ACL) 2021 8ChatGPT as a Math Questioner? Evaluating ChatGPT on Generating Pre-university Math QuestionsarXiv 2023Hyperbolic Diffusion Embedding and Distance for Hierarchical Representation LearningarXiv 2023Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMsarXiv 2025Malafide: a novel adversarial convolutive noise attack against deepfake and spoofing detection systemsarXiv 2023Mind the Gap Between Conversations for Improved Long-Term Dialogue GenerationarXiv 2023Expressive Losses for Verified Robustness via Convex CombinationsarXiv 2023Multi-View and Multi-Scale Alignment for Contrastive Language-Image Pre-training in MammographyarXiv 2024How to Protect Yourself from 5G Radiation? Investigating LLM Responses to Implicit MisinformationarXiv 2025MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in PerceptionarXiv 2024Instruction Tuned Models are Quick LearnersarXiv 2023Complementary Explanations for Effective In-Context LearningarXiv 2022BIGRoC: Boosting Image Generation via a Robust Classifierbigroc-boosting-image-generation-via-a-robust-1Diffusion Models as Optimizers for Efficient Planning in Offline RLarXiv 2024Target-Guided Open-Domain Conversation PlanningCOLING 2022 10Hiding in Plain Sight: Disguising Data Stealing Attacks in Federated LearningarXiv 2023Efficient Retrieval Augmented Generation from Unstructured Knowledge for Task-Oriented DialogarXiv 2021For self-supervised learning, Rationality implies generalization, provablyfor-self-supervised-learning-rationalityLewis's Signaling Game as beta-VAE For Natural Word Lengths and SegmentsarXiv 2023Fish-Vista: A Multi-Purpose Dataset for Understanding & Identification of Traits from ImagesCVPR 2025 1Circuit Component Reuse Across Tasks in Transformer Language ModelsarXiv 2023LLM Harmony: Multi-Agent Communication for Problem SolvingarXiv 2024Subject-driven Text-to-Image Generation via Preference-based Reinforcement LearningarXiv 2024LoRaLay: A Multilingual and Multimodal Dataset for Long Range and Layout-Aware SummarizationarXiv 2023Interpretable-by-Design Text Understanding with Iteratively Generated Concept BottleneckarXiv 2023Overcoming Recency Bias of Normalization Statistics in Continual Learning: Balance and Adaptationovercoming-recency-bias-of-normalizationDon't Say What You Don't Know: Improving the Consistency of Abstractive Summarization by Constraining Beam SearcharXiv 2022Socratic Pretraining: Question-Driven Pretraining for Controllable SummarizationarXiv 2022Reassessing Layer Pruning in LLMs: New Insights and MethodsarXiv 2024ChatGPT4PCG Competition: Character-like Level Generation for Science BirdsarXiv 2023Crossing Linguistic Horizons: Finetuning and Comprehensive Evaluation of Vietnamese Large Language ModelsarXiv 2024Hint-Aug: Drawing Hints from Foundation Vision Transformers Towards Boosted Few-Shot Parameter-Efficient TuningCVPR 2023 1Exploring Jiu-Jitsu Argumentation for Writing Peer Review RebuttalsarXiv 2023On the Role of Images for Analyzing Claims in Social MediaarXiv 2021Hostility Detection Dataset in HindiarXiv 2020Easily Accessible Text-to-Image Generation Amplifies Demographic Stereotypes at Large ScalearXiv 2022Maestro: Uncovering Low-Rank Structures via Trainable DecompositionarXiv 2023Logic Against Bias: Textual Entailment Mitigates Stereotypical Sentence ReasoningarXiv 2023Extending Conformal Prediction to Hidden Markov Models with Exact Validity via de Finetti's Theorem for Markov ChainsarXiv 2022Do Not Train It: A Linear Neural Architecture Search of Graph Neural NetworksarXiv 2023Summarizing, Simplifying, and Synthesizing Medical Evidence Using GPT-3 (with Varying Success)arXiv 2023Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual AlignmentarXiv 2023Exploring the Capabilities of LLMs for Code Change Related TasksarXiv 2024SAFARI: Versatile and Efficient Evaluations for Robustness of InterpretabilityICCV 2023 1Learning useful representations for shifting tasks and distributionsarXiv 2022Differentiable Multi-Target Causal Bayesian Experimental DesignarXiv 2023DenseNet: Implementing Efficient ConvNet Descriptor PyramidsarXiv 2014LLM Teacher-Student Framework for Text Classification With No Manually Annotated Data: A Case Study in IPTC News Topic ClassificationarXiv 2024Probabilistic Imputation for Time-series Classification with Missing DataarXiv 2023Auto-ICL: In-Context Learning without Human SupervisionarXiv 2023Vocabulary-free Image Classification and Semantic SegmentationarXiv 2024Bayesian Neural Controlled Differential Equations for Treatment Effect EstimationarXiv 2023Which Explanation Should I Choose? A Function Approximation Perspective to Characterizing Post Hoc ExplanationsarXiv 2022FEABench: Evaluating Language Models on Multiphysics Reasoning AbilityarXiv 2025ChatGPT Based Data Augmentation for Improved Parameter-Efficient Debiasing of LLMsarXiv 2024Generalized Sum Pooling for Metric LearningICCV 2023 1Harnessing the Power of Prompt-based Techniques for Generating School-Level Questions using Large Language ModelsarXiv 2023Medical large language models are easily distractedarXiv 2025RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language ModelsarXiv 2023MentalChat16K: A Benchmark Dataset for Conversational Mental Health AssistancearXiv 2025Cutting Through the Noise: Boosting LLM Performance on Math Word ProblemsarXiv 2024LeFusion: Controllable Pathology Synthesis via Lesion-Focused Diffusion ModelsarXiv 2024Adapt then Unlearn: Exploiting Parameter Space Semantics for Unlearning in Generative Adversarial NetworksarXiv 2023The Test of Tests: A Framework For Differentially Private Hypothesis TestingarXiv 2023Learning Optimal Predictive Checklistslearning-optimal-predictive-checklistsLocalising In-Domain Adaptation of Transformer-Based Biomedical Language ModelsarXiv 2022LLM Cyber Evaluations Don't Capture Real-World RiskarXiv 2025What Are the Odds? Language Models Are Capable of Probabilistic ReasoningarXiv 2024Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation DatasetarXiv 2024Quantifying Feature Space Universality Across Large Language Models via Sparse AutoencodersarXiv 2024Multilingual Vision-Language Pre-training for the Remote Sensing DomainarXiv 2024In Conclusion Not Repetition: Comprehensive Abstractive Summarization With Diversified Attention Based On Determinantal Point Processesin-conclusion-not-repetition-comprehensive-1Clinical knowledge in LLMs does not translate to human interactionsarXiv 2025Autoregressive Pre-Training on Pixels and TextsarXiv 2024