All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
Modeling Hierarchical Structures with Continuous Recursive Neural NetworksarXiv 2021SOAR: Scene-debiasing Open-set Action Recognitionsoar-scene-debiasing-open-set-actionReverse Engineering of Imperceptible Adversarial Image Perturbationsreverse-engineering-of-imperceptibleExplanation Graph Generation via Pre-trained Language Models: An Empirical Study with Contrastive LearningACL 2022 5Depthwise Convolution is All You Need for Learning Multiple Visual DomainsarXiv 2019AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive ScenariosarXiv 2024MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object DetectionarXiv 2024Measuring and Improving Compositional Generalization in Text-to-SQL via
Component AlignmentarXiv 2022Improving the Diffusability of AutoencodersarXiv 2025Domain-Adaptive Text Classification with Structured Knowledge from Unlabeled DataarXiv 2022Towards Heterogeneous Long-tailed Learning: Benchmarking, Metrics, and ToolboxarXiv 2023A Song of (Dis)agreement: Evaluating the Evaluation of Explainable Artificial Intelligence in Natural Language ProcessingarXiv 2022Let's Verify Math Questions Step by SteparXiv 2025Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption RewritesarXiv 2023Balancing Discriminability and Transferability for Source-Free Domain AdaptationarXiv 2022Cross Contrasting Feature Perturbation for Domain GeneralizationICCV 2023 1CR-LT-KGQA: A Knowledge Graph Question Answering Dataset Requiring Commonsense Reasoning and Long-Tail KnowledgearXiv 2024Parameter-Efficient Conversational Recommender System as a Language Processing TaskarXiv 2024Search Engines in an AI Era: The False Promise of Factual and Verifiable Source-Cited ResponsesarXiv 2024Unveiling the Generalization Power of Fine-Tuned Large Language ModelsarXiv 2024BrainCLIP: Bridging Brain and Visual-Linguistic Representation Via CLIP for Generic Natural Visual Stimulus DecodingarXiv 2023Are Large Language Models Good Classifiers? A Study on Edit Intent Classification in Scientific Document RevisionsarXiv 2024Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videosvinoground-scrutinizing-lmms-over-denseCliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical ScenariosarXiv 2024RECOMBINER: Robust and Enhanced Compression with Bayesian Implicit Neural RepresentationsarXiv 20233D Feature Prediction for Masked-AutoEncoder-Based Point Cloud PretrainingarXiv 2023Conformal Prediction with Missing ValuesarXiv 2023Evaluating Interpolation and Extrapolation Performance of Neural Retrieval ModelsarXiv 2022A Comprehensive Survey of Accelerated Generation Techniques in Large Language ModelsarXiv 2024Good Questions Help Zero-Shot Image ReasoningarXiv 2023DeepOIS: Gyroscope-Guided Deep Optical Image Stabilizer CompensationarXiv 2021FANet: Feature Amplification Network for Semantic Segmentation in Cluttered BackgroundarXiv 2024MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue ResolutionarXiv 2024Non-Sequential Graph Script Induction via Multimedia GroundingarXiv 2023DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable LearnersarXiv 2024XAlign: Cross-lingual Fact-to-Text Alignment and Generation for Low-Resource LanguagesarXiv 2022Holistic Representation Learning for Multitask Trajectory Anomaly DetectionarXiv 2023A Theoretical Analysis of Catastrophic Forgetting through the NTK Overlap MatrixarXiv 2020Cyclical Curriculum LearningarXiv 2022Author's Sentiment PredictionCOLING 2020 8Image Representations Learned With Unsupervised Pre-Training Contain Human-like BiasesarXiv 2020Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language ModelsarXiv 2024GENEVA: Benchmarking Generalizability for Event Argument Extraction with Hundreds of Event Types and Argument RolesarXiv 2022The Art of SOCRATIC QUESTIONING: Recursive Thinking with Large Language ModelsarXiv 2023ChapterBreak: A Challenge Dataset for Long-Range Language ModelsNAACL 2022 7Taxi1500: A Multilingual Dataset for Text Classification in 1500 LanguagesarXiv 2023Follow Me: Conversation Planning for Target-driven Recommendation Dialogue SystemsarXiv 2022Control Globally, Understand Locally: A Global-to-Local Hierarchical Graph Network for Emotional Support ConversationarXiv 2022Help me write a poem: Instruction Tuning as a Vehicle for Collaborative Poetry WritingarXiv 2022MITS-GAN: Safeguarding Medical Imaging from Tampering with Generative Adversarial NetworksarXiv 2024Muharaf: Manuscripts of Handwritten Arabic Dataset for Cursive Text RecognitionarXiv 2024Adversarial Training on Purification (AToP): Advancing Both Robustness and GeneralizationarXiv 2024Memory-Augmented Reinforcement Learning for Image-Goal NavigationarXiv 2021Multimodal Deep Models for Predicting Affective Responses Evoked by MoviesarXiv 2019Prompting Disentangled Embeddings for Knowledge Graph Completion with Pre-trained Language ModelarXiv 2023Unveiling the Potential of Segment Anything Model 2 for RGB-Thermal Semantic Segmentation with Language GuidancearXiv 2025Specialized Document Embeddings for Aspect-based Similarity of Research PapersarXiv 2022LMM-VQA: Advancing Video Quality Assessment with Large Multimodal ModelsarXiv 2024T5APR: Empowering Automated Program Repair across Languages through
Checkpoint EnsemblearXiv 2023InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion GenerationarXiv 2024HumanVLM: Foundation for Human-Scene Vision-Language ModelarXiv 2024Exploring Perceptual Limitation of Multimodal Large Language ModelsarXiv 2024Needle Threading: Can LLMs Follow Threads through Near-Million-Scale Haystacks?arXiv 2024Self-Supervised Monocular Depth Estimation by Direction-aware Cumulative Convolution NetworkICCV 2023 1How Far Can Transformers Reason? The Globality Barrier and Inductive ScratchpadarXiv 2024Sheaf4Rec: Sheaf Neural Networks for Graph-based Recommender SystemsarXiv 2023Segmentation-guided Layer-wise Image Vectorization with Gradient FillsarXiv 2024Applying sparse autoencoders to unlearn knowledge in language modelsarXiv 2024Mitigating Label Biases for In-context LearningarXiv 2023Multi-modal Instruction Tuned LLMs with Fine-grained Visual PerceptionCVPR 2024 1How far is Language Model from 100% Few-shot Named Entity Recognition in Medical DomainarXiv 2023Post-training Quantization for Neural Networks with Provable GuaranteesarXiv 2022VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document UnderstandingarXiv 2025Prompting as Probing: Using Language Models for Knowledge Base ConstructionarXiv 2022RoFT: A Tool for Evaluating Human Detection of Machine-Generated TextEMNLP 2020 11Large Language Models are Pretty Good Zero-Shot Video Game Bug DetectorsarXiv 2022Mitigating Accuracy-Robustness Trade-off via Balanced Multi-Teacher Adversarial DistillationarXiv 2023Pruning Adversarially Robust Neural Networks without Adversarial ExamplesarXiv 2022Maximize to Explore: One Objective Function Fusing Estimation, Planning, and ExplorationNeurIPS 2023 11KG-Retriever: Efficient Knowledge Indexing for Retrieval-Augmented Large Language ModelsarXiv 2024Optimal management of a stochastically varying population when policy adjustment is costlyarXiv 2015Stance Prediction and Claim Verification: An Arabic Perspectivestance-prediction-and-claim-verification-an-1Dialogue Chain-of-Thought Distillation for Commonsense-aware Conversational AgentsarXiv 2023Knowledge Graph-based Retrieval-Augmented Generation for Schema MatchingarXiv 2025Long Context vs. RAG for LLMs: An Evaluation and RevisitsarXiv 2024Representation Learning for Resource-Constrained Keyphrase GenerationarXiv 2022Quantifying and Optimizing Global Faithfulness in Persona-driven Role-playingarXiv 2024PRD: Peer Rank and Discussion Improve Large Language Model based EvaluationsarXiv 2023Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also MattersarXiv 2024CALM : A Multi-task Benchmark for Comprehensive Assessment of Language Model BiasarXiv 2023Multi3Hate: Multimodal, Multilingual, and Multicultural Hate Speech Detection with Vision-Language ModelsarXiv 2024Improving Probability-based Prompt Selection Through Unified Evaluation and AnalysisarXiv 2023Increasing Model Capacity for Free: A Simple Strategy for Parameter Efficient Fine-tuningarXiv 2024Are self-explanations from Large Language Models faithful?arXiv 2024NNSmith: Generating Diverse and Valid Test Cases for Deep Learning CompilersarXiv 2022Self-Contained Stylization via Steganography for Reverse and Serial Style TransferarXiv 2018B4: Towards Optimal Assessment of Plausible Code Solutions with Plausible TestsarXiv 2024On Domain-Specific Post-Training for Multimodal Large Language ModelsarXiv 2024IRFL: Image Recognition of Figurative LanguagearXiv 2023Deconfounded Representation Similarity for Comparison of Neural NetworksarXiv 2022Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module OperationarXiv 2023BioMamba: Domain-Adaptive Biomedical Language ModelsarXiv 2024FG-CXR: A Radiologist-Aligned Gaze Dataset for Enhancing Interpretability in Chest X-Ray Report GenerationarXiv 2024Leveraging Generative AI Models for Synthetic Data Generation in Healthcare: Balancing Research and PrivacyarXiv 2023InforMask: Unsupervised Informative Masking for Language Model PretrainingarXiv 2022POSIX: A Prompt Sensitivity Index For Large Language ModelsarXiv 2024Do We Truly Need So Many Samples? Multi-LLM Repeated Sampling Efficiently Scales Test-Time ComputearXiv 2025Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language ModelarXiv 2024Real-Time Flying Object Detection with YOLOv8arXiv 2023Token-level and sequence-level loss smoothing for RNN language modelstoken-level-and-sequence-level-loss-smoothing-1Adding Conditional Control to Diffusion Models with Reinforcement LearningarXiv 2024One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing FrameworkarXiv 2025Application of Deep Learning in Generating Structured Radiology Reports: A Transformer-Based TechniquearXiv 2022Bayes Conditional Distribution Estimation for Knowledge Distillation Based on Conditional Mutual InformationarXiv 2024CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language ModelsarXiv 2024DiffEnc: Variational Diffusion with a Learned EncoderarXiv 2023Generating Lead Sheets with Affect: A Novel Conditional seq2seq FrameworkarXiv 2021Multi-hop Evidence Retrieval for Cross-document Relation ExtractionarXiv 2022High-order finite element method for atomic structure calculationsarXiv 2023MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual AlignmentarXiv 2024Multi-label affordance mapping from egocentric visionICCV 2023 1Scraping Social Media Photos Posted in Kenya and Elsewhere to Detect and Analyze Food TypesarXiv 2019L-DAWA: Layer-wise Divergence Aware Weight Aggregation in Federated Self-Supervised Visual Representation LearningICCV 2023 1FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMsarXiv 2024High Perceptual Quality Image Denoising with a Posterior Sampling CGANarXiv 2021Knowledge-based in silico models and dataset for the comparative evaluation of mammography AI for a range of breast characteristics, lesion conspicuities and dosesknowledge-based-in-silico-models-and-datasetActivation Steering for Chain-of-Thought CompressionarXiv 2025Large Legal Fictions: Profiling Legal Hallucinations in Large Language ModelsarXiv 2024Measuring Moral Dimensions in Social Media with MformerarXiv 2023ISLTranslate: Dataset for Translating Indian Sign LanguagearXiv 2023Cross-Domain Data Integration for Named Entity Disambiguation in Biomedical TextFindings (EMNLP) 2021 11A Multi-Power Law for Loss Curve Prediction Across Learning Rate SchedulesarXiv 2025MetaModulation: Learning Variational Feature Hierarchies for Few-Shot Learning with Fewer TasksarXiv 2023Document-aligned Japanese-English Conversation Parallel CorpusWMT (EMNLP) 2020 11Tubelet-Contrastive Self-Supervision for Video-Efficient GeneralizationICCV 2023 1Beat the AI: Investigating Adversarial Human Annotation for Reading ComprehensionarXiv 2020SuperHF: Supervised Iterative Learning from Human FeedbackarXiv 2023Clifford Group Equivariant Simplicial Message Passing NetworksarXiv 2024Tackling the Challenges in Scene Graph Generation with Local-to-Global InteractionsarXiv 2021An Early Evaluation of GPT-4V(ision)arXiv 2023HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph EvolutionarXiv 2026Time Travel in LLMs: Tracing Data Contamination in Large Language ModelsarXiv 2023Excuse me, sir? Your language model is leaking (information)arXiv 2024Learning to Reason with Neural Networks: Generalization, Unseen Data and Boolean MeasuresarXiv 2022ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code GenerationarXiv 2024CrIBo: Self-Supervised Learning via Cross-Image Object-Level BootstrappingarXiv 2023Not All Semantics are Created Equal: Contrastive Self-supervised Learning with Automatic Temperature IndividualizationarXiv 2023A fine-grained comparison of pragmatic language understanding in humans and language modelsarXiv 2022Data Bootstrapping Approaches to Improve Low Resource Abusive Language Detection for Indic LanguagesarXiv 2022ToXCL: A Unified Framework for Toxic Speech Detection and ExplanationarXiv 2024Disjoint Masking with Joint Distillation for Efficient Masked Image ModelingarXiv 2022gaBERT -- an Irish Language ModelarXiv 2021Few-Shot Backdoor Attacks on Visual Object Trackingfew-shot-backdoor-attacks-on-visual-objectCertified Training: Small Boxes are All You NeedarXiv 2022The ALCHEmist: Automated Labeling 500x CHEaper Than LLM Data AnnotatorsarXiv 2024Don't Forget Your ABC's: Evaluating the State-of-the-Art in Chat-Oriented Dialogue SystemsarXiv 2022TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning DataarXiv 2024Why Not Simply Translate? A First Swedish Evaluation Benchmark for Semantic SimilarityarXiv 2020UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World UnderstandingarXiv 2024Memorize, Factorize, or be Naïve: Learning Optimal Feature Interaction Methods for CTR PredictionarXiv 2021Environmental Claim DetectionarXiv 2022Unsupervised Open-Vocabulary Object Localization in VideosICCV 2023 1Natural Language Inference in Context -- Investigating Contextual Reasoning over Long TextsarXiv 2020USC: An Open-Source Uzbek Speech Corpus and Initial Speech Recognition ExperimentsarXiv 2021Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text MatchingarXiv 2024Large Language Models Can Self-Improve At Web Agent TasksarXiv 2024Continued Pretraining for Better Zero- and Few-Shot PromptabilityarXiv 2022The Moral Machine Experiment on Large Language ModelsarXiv 2023A Three-regime Model of Network PruningarXiv 2023Pareto Domain Adaptationpareto-domain-adaptationRevisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?arXiv 2025The Alternative Annotator Test for LLM-as-a-Judge: How to Statistically Justify Replacing Human Annotators with LLMsarXiv 2025reBEN: Refined BigEarthNet Dataset for Remote Sensing Image AnalysisarXiv 2024SignCLIP: Connecting Text and Sign Language by Contrastive LearningarXiv 2024Closing the Curious Case of Neural Text DegenerationarXiv 2023You Know What I'm Saying: Jailbreak Attack via Implicit ReferencearXiv 2024TweepFake: about Detecting Deepfake TweetsarXiv 2020Neural-Symbolic Collaborative Distillation: Advancing Small Language Models for Complex Reasoning TasksarXiv 2024Efficient Neural Ranking using Forward IndexesarXiv 2021Process-Supervised LLM Recommenders via Flow-guided TuningarXiv 2025FoundPAD: Foundation Models Reloaded for Face Presentation Attack DetectionarXiv 2025CodeReef: an open platform for portable MLOps, reusable automation actions and reproducible benchmarkingarXiv 2020LaWa: Using Latent Space for In-Generation Image WatermarkingarXiv 2024MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Modelsmm-iq-benchmarking-human-like-abstraction-andContent-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware ConsistencyarXiv 2025Cross-Care: Assessing the Healthcare Implications of Pre-training Data on Language Model BiasarXiv 2024Revisiting Active Learning in the Era of Vision Foundation ModelsarXiv 2024Quantum Multi-Model FittingCVPR 2023 1Non-Exchangeable Conformal Risk ControlarXiv 2023Thermometer: Towards Universal Calibration for Large Language ModelsarXiv 2024Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question AnsweringarXiv 2024Measuring Fairness in Ranked OutputsarXiv 2016LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field EnlargementarXiv 2025Visualizing Sound Directivity via Smartphone SensorsarXiv 2017MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart ProblemsarXiv 2024Stochastic interpolants with data-dependent couplingsarXiv 2023MemLLM: Finetuning LLMs to Use An Explicit Read-Write MemoryarXiv 2024AVA-Speech: A Densely Labeled Dataset of Speech Activity in MoviesarXiv 2018StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction FollowingarXiv 2025MISS: A Generative Pretraining and Finetuning Approach for Med-VQAarXiv 2024