0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

Retrieval Augmentation for Commonsense Reasoning: A Unified ApproacharXiv 2022Parametric Augmentation for Time Series Contrastive LearningarXiv 2024Value Kaleidoscope: Engaging AI with Pluralistic Human Values, Rights, and DutiesarXiv 2023CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion RecognitionarXiv 2023QT-DoG: Quantization-aware Training for Domain GeneralizationarXiv 2024EvoLMM: Self-Evolving Large Multimodal Models with Continuous RewardsarXiv 2025Distilling Causal Effect from Miscellaneous Other-Class for Continual Named Entity RecognitionarXiv 2022SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion ModelsarXiv 2025MCoNaLa: A Benchmark for Code Generation from Multiple Natural LanguagesarXiv 2022On Pre-Training for Visuo-Motor Control: Revisiting a Learning-from-Scratch BaselinearXiv 2022Towards Efficient Fine-tuning of Pre-trained Code Models: An Experimental Study and BeyondarXiv 2023How Do Large Language Models Acquire Factual Knowledge During Pretraining?arXiv 2024Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game ModelsarXiv 2024A Practical Machine Learning Approach for Dynamic Stock RecommendationarXiv 2025ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to VideoarXiv 2023High-Dimension Human Value Representation in Large Language ModelsarXiv 2024MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of MusicarXiv 2024Training Language Models to Win Debates with Self-Play Improves Judge AccuracyarXiv 2024Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLMarXiv 2025GOAL: Global-local Object Alignment LearningCVPR 2025 1HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal ReasoningarXiv 2024ManyTypes4Py: A Benchmark Python Dataset for Machine Learning-based Type InferencearXiv 2021Adaptive Data-Free QuantizationCVPR 2023 1Training Effective Neural Sentence Encoders from Automatically Mined ParaphrasesarXiv 2022Prune Spatio-temporal Tokens by Semantic-aware Temporal AccumulationICCV 2023 1ZeroComp: Zero-shot Object Compositing from Image Intrinsics via DiffusionarXiv 2024Grokking of Hierarchical Structure in Vanilla TransformersarXiv 2023PS-TTL: Prototype-based Soft-labels and Test-Time Learning for Few-shot Object DetectionarXiv 2024Self-collaboration Code Generation via ChatGPTarXiv 2023Towards Efficient Diffusion-Based Image Editing with Instant Attention MasksarXiv 2024Weakly Supervised 3D Object Detection via Multi-Level Visual GuidancearXiv 2023MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation modelsarXiv 2024Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine UnlearningarXiv 2024VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video CaptioningarXiv 2025Ethicist: Targeted Training Data Extraction Through Loss Smoothed Soft Prompting and Calibrated Confidence EstimationarXiv 2023Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And MorearXiv 2025Cryptonite: A Cryptic Crossword Benchmark for Extreme Ambiguity in LanguageEMNLP 2021 11Pruning via Merging: Compressing LLMs via Manifold Alignment Based Layer MergingarXiv 2024Feature Contamination: Neural Networks Learn Uncorrelated Features and Fail to GeneralizearXiv 2024OntoChat: a Framework for Conversational Ontology Engineering using Language ModelsarXiv 2024TopoLM: brain-like spatio-functional organization in a topographic language modelarXiv 2024Shepherding Slots to Objects: Towards Stable and Robust Object-Centric LearningCVPR 2023 1Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation ApproacharXiv 2024Disentangling Uncertainty in Machine Translation EvaluationarXiv 2022TinyStyler: Efficient Few-Shot Text Style Transfer with Authorship EmbeddingsarXiv 2024Generalized Planning for the Abstraction and Reasoning CorpusarXiv 2024CookGAN: Meal Image Synthesis from IngredientsarXiv 2020CoNeTTE: An efficient Audio Captioning system leveraging multiple datasets with Task EmbeddingarXiv 2023NovelQA: Benchmarking Question Answering on Documents Exceeding 200K TokensarXiv 2024Towards Good Practices for Missing Modality Robust Action RecognitionarXiv 2022RecipeGPT: Generative Pre-training Based Cooking Recipe Generation and Evaluation SystemarXiv 2020GAMMA: Revisiting Template-based Automated Program Repair via Mask PredictionarXiv 2023DataPerf: Benchmarks for Data-Centric AI Developmentdataperf-benchmarks-for-data-centric-aiRevisiting Data-Free Knowledge Distillation with Poisoned TeachersarXiv 2023Soft Masking for Cost-Constrained Channel PruningarXiv 2022TransKD: Transformer Knowledge Distillation for Efficient Semantic SegmentationarXiv 2022Widget Captioning: Generating Natural Language Description for Mobile User Interface ElementsEMNLP 2020 11Common Sense Beyond English: Evaluating and Improving Multilingual Language Models for Commonsense ReasoningACL 2021 5Structural Entities Extraction and Patient Indications Incorporation for Chest X-ray Report GenerationarXiv 2024MAAT: Mamba Adaptive Anomaly Transformer with association discrepancy for time seriesarXiv 2025[CLS] Token Tells Everything Needed for Training-free Efficient MLLMsarXiv 2024A Mixture of Surprises for Unsupervised Reinforcement LearningarXiv 2022Multi-Modal and Multi-Attribute Generation of Single Cells with CFGenarXiv 2024Enhancing Retrieval and Managing Retrieval: A Four-Module Synergy for Improved Quality and Efficiency in RAG SystemsarXiv 2024M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language ModelsarXiv 2023Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model SupportarXiv 2024PostEdit: Posterior Sampling for Efficient Zero-Shot Image EditingarXiv 2024DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized DocumentsarXiv 2023Red Teaming Language Model Detectors with Language ModelsarXiv 2023Toward Self-Improvement of LLMs via Imagination, Searching, and CriticizingarXiv 2024Delving into the Openness of CLIParXiv 2022SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and DialectsarXiv 2023Analysing The Impact of Sequence Composition on Language Model Pre-TrainingarXiv 2024Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial StatementsarXiv 2024Protecting Your LLMs with Information BottleneckarXiv 2024Comparative Opinion Summarization via Collaborative DecodingFindings (ACL) 2022 5Causal Estimation of Memorisation ProfilesarXiv 2024Step-Controlled DPO: Leveraging Stepwise Error for Enhanced Mathematical ReasoningarXiv 2024Caution for the Environment: Multimodal Agents are Susceptible to Environmental DistractionsarXiv 2024SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-ReflectionarXiv 2024I Can't Believe It's Not Scene Flow!arXiv 2024RORL: Robust Offline Reinforcement Learning via Conservative SmoothingarXiv 2022Multiview Aerial Visual Recognition (MAVREC): Can Multi-view Improve Aerial Visual Perception?CVPR 2024 1Higher-order Graph Convolutional Network with Flower-Petals Laplacians on Simplicial ComplexesarXiv 2023EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature FusionarXiv 2025Jointly Modeling Inter- & Intra-Modality Dependencies for Multi-modal LearningarXiv 2024The SOFC-Exp Corpus and Neural Approaches to Information Extraction in the Materials Science Domainthe-sofc-exp-corpus-and-neural-approaches-to-1UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language ModelsarXiv 2025Variational Attention: Propagating Domain-Specific Knowledge for Multi-Domain Learning in Crowd CountingICCV 2021 10CRIL: Continual Robot Imitation Learning via Generative and Prediction ModelarXiv 2021SSL4EO-S12 v1.1: A Multimodal, Multiseasonal Dataset for Pretraining, UpdatedarXiv 2025PolygonGNN: Representation Learning for Polygonal Geometries with Heterogeneous Visibility GrapharXiv 2024Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language ModelsarXiv 2022RoleCraft-GLM: Advancing Personalized Role-Playing in Large Language ModelsarXiv 2023PianoBART: Symbolic Piano Music Generation and Understanding with Large-Scale Pre-TrainingarXiv 2024Spatially and Spectrally Consistent Deep Functional MapsICCV 2023 1AVT2-DWF: Improving Deepfake Detection with Audio-Visual Fusion and Dynamic Weighting StrategiesarXiv 2024Predicting emotion from music videos: exploring the relative contribution of visual and auditory information to affective responsesarXiv 2022DefSent: Sentence Embeddings using Definition SentencesACL 2021 5Bridging State and History Representations: Understanding Self-Predictive RLarXiv 2024On the Surprising Effectiveness of Attention Transfer for Vision TransformersarXiv 2024Generalizing Few-Shot NAS with Gradient Matchinggeneralizing-few-shot-nas-with-gradientDistinguishing Ignorance from Error in LLM HallucinationsarXiv 2024MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn InteractionsarXiv 2024CLERC: A Dataset for Legal Case Retrieval and Retrieval-Augmented Analysis GenerationarXiv 2024Why So Gullible? Enhancing the Robustness of Retrieval-Augmented Models against Counterfactual NoisearXiv 2023PrimeComposer: Faster Progressively Combined Diffusion for Image Composition with Attention SteeringarXiv 2024Swiss-Judgment-Prediction: A Multilingual Legal Judgment Prediction BenchmarkEMNLP (NLLP) 2021 11ANPL: Towards Natural Programming with Interactive Decompositionanpl-towards-natural-programming-withMALADE: Orchestration of LLM-powered Agents with Retrieval Augmented Generation for PharmacovigilancearXiv 2024Megadiff: A Dataset of 600k Java Source Code Changes Categorized by Diff SizearXiv 2021Measuring Implicit Bias in Explicitly Unbiased Large Language ModelsarXiv 2024The Benefits of a Concise Chain of Thought on Problem-Solving in Large Language ModelsarXiv 2024TASAR: Transfer-based Attack on Skeletal Action RecognitionarXiv 2024A smile is all you need: Predicting limiting activity coefficients from SMILES with natural language processingarXiv 2022Knowledge Verification to Nip Hallucination in the BudarXiv 2024Two Stones Hit One Bird: Bilevel Positional Encoding for Better Length ExtrapolationarXiv 2024Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMsarXiv 2024Transformer Language Models without Positional Encodings Still Learn Positional InformationarXiv 2022From Uncertainty to Trust: Enhancing Reliability in Vision-Language Models with Uncertainty-Guided Dropout DecodingarXiv 2024DataStates-LLM: Lazy Asynchronous Checkpointing for Large Language ModelsarXiv 2024A Contrastive Cross-Channel Data Augmentation Framework for Aspect-based Sentiment AnalysisCOLING 2022 10Balancing Logit Variation for Long-tailed Semantic Segmentationbalancing-logit-variation-for-long-tailedSegformer++: Efficient Token-Merging Strategies for High-Resolution Semantic SegmentationarXiv 2024WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global CuisinesarXiv 2024Sequential Short-Text Classification with Recurrent and Convolutional Neural Networkssequential-short-text-classification-with-1ZeroFlow: Scalable Scene Flow via DistillationarXiv 2023TuneTables: Context Optimization for Scalable Prior-Data Fitted NetworksarXiv 2024Hypothesis Search: Inductive Reasoning with Language ModelsarXiv 2023BMRetriever: Tuning Large Language Models as Better Biomedical Text RetrieversarXiv 2024Learning Control-Oriented Dynamical Structure from DataarXiv 2023PARTNER: Level up the Polar Representation for LiDAR 3D Object DetectionICCV 2023 1CHAI: Clustered Head Attention for Efficient LLM InferencearXiv 2024GLAD: Content-aware Dynamic Graphs For Log Anomaly DetectionarXiv 2023Adaptive Soft Contrastive LearningarXiv 2022Variational Open-Domain Question AnsweringarXiv 2022GenHPF: General Healthcare Predictive Framework with Multi-task Multi-source LearningarXiv 2022Automatic extraction of materials and properties from superconductors scientific literaturearXiv 2022A Benchmark and Asymmetrical-Similarity Learning for Practical Image Copy DetectionarXiv 2022Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation ModelsarXiv 2024Evaluating the Faithfulness of Importance Measures in NLP by Recursively Masking Allegedly Important Tokens and RetrainingarXiv 2021OPDMulti: Openable Part Detection for Multiple ObjectsarXiv 2023Rethinking Multiple Instance Learning for Whole Slide Image Classification: A Good Instance Classifier is All You NeedarXiv 2023Connecting the Dots between Audio and Text without Parallel Data through Visual Knowledge TransferarXiv 2021Representation Noising: A Defence Mechanism Against Harmful FinetuningarXiv 2024EEG-based Cross-Subject Driver Drowsiness Recognition with an Interpretable Convolutional Neural NetworkarXiv 2021Bidirectional Stereo Image Compression with Cross-Dimensional Entropy ModelarXiv 2024The Goldilocks of Pragmatic Understanding: Fine-Tuning Strategy Matters for Implicature Resolution by LLMsthe-goldilocks-of-pragmatic-understandingRedesigning Multi-Scale Neural Network for Crowd CountingarXiv 2022IterGen: Iterative Semantic-aware Structured LLM Generation with BacktrackingarXiv 2024Augmenting Math Word Problems via Iterative Question ComposingarXiv 2024How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?arXiv 2024Effective Prompt Extraction from Language ModelsarXiv 2023Phi-Ground Tech Report: Advancing Perception in GUI GroundingarXiv 2025BurstAttention: An Efficient Distributed Attention Framework for Extremely Long SequencesarXiv 2024A2C is a special case of PPOarXiv 2022Contrastive Learning for Prompt-Based Few-Shot Language LearnersNAACL 2022 7Supported Policy Optimization for Offline Reinforcement LearningarXiv 2022Goldfish: Monolingual Language Models for 350 LanguagesarXiv 2024Quantifying the Knowledge in GNNs for Reliable Distillation into MLPsarXiv 2023MetaQA: Combining Expert Agents for Multi-Skill Question AnsweringarXiv 2021RAR-b: Reasoning as Retrieval BenchmarkarXiv 2024SALT: Distinguishable Speaker Anonymization Through Latent Space TransformationarXiv 2023M-FLAG: Medical Vision-Language Pre-training with Frozen Language Models and Latent Space Geometry OptimizationarXiv 2023Optimal Linear Decay Learning Rate Schedules and Further RefinementsarXiv 2023MARS: Model-agnostic Biased Object Removal without Additional Supervision for Weakly-Supervised Semantic SegmentationICCV 2023 1Flipping Coins to Estimate Pseudocounts for Exploration in Reinforcement LearningarXiv 2023Modular Pluralism: Pluralistic Alignment via Multi-LLM CollaborationarXiv 2024Co-design Hardware and Algorithm for Vector SearcharXiv 2023DUnE: Dataset for Unified EditingarXiv 2023Calibrating Large Language Models Using Their Generations OnlyarXiv 2024Cross-Domain Foundation Model Adaptation: Pioneering Computer Vision Models for Geophysical Data AnalysisarXiv 2024The Jailbreak Tax: How Useful are Your Jailbreak Outputs?arXiv 2025Unsupervised Hashing with Similarity Distribution CalibrationarXiv 2023Explaining Reinforcement Learning with Shapley ValuesarXiv 2023FedConv: A Learning-on-Model Paradigm for Heterogeneous Federated ClientsarXiv 2025Meaning Representations from Trajectories in Autoregressive ModelsarXiv 2023Automatically Select Emotion for Response via Personality-affected Emotion TransitionFindings (ACL) 2021 8Visual Query Tuning: Towards Effective Usage of Intermediate Representations for Parameter and Memory Efficient Transfer LearningCVPR 2023 1EgoLoc: Revisiting 3D Object Localization from Egocentric Videos with Visual QueriesICCV 2023 1DocLayLLM: An Efficient and Effective Multi-modal Extension of Large Language Models for Text-rich Document UnderstandingarXiv 2024SimMatchV2: Semi-Supervised Learning with Graph ConsistencyICCV 2023 1RigorLLM: Resilient Guardrails for Large Language Models against Undesired ContentarXiv 2024Graph Transformers for Large GraphsarXiv 2023MIMO Is All You Need : A Strong Multi-In-Multi-Out Baseline for Video PredictionarXiv 2022Contextualization Distillation from Large Language Model for Knowledge Graph CompletionarXiv 2024Benchmarking Large Language Models on Controllable Generation under Diversified InstructionsarXiv 2024KeyPoint Relative Position Encoding for Face RecognitionCVPR 2024 1Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable SummarizationarXiv 2023The GitHub Recent Bugs Dataset for Evaluating LLM-based Debugging ApplicationsarXiv 2023TOOLVERIFIER: Generalization to New Tools via Self-VerificationarXiv 2024Probing the limitations of multimodal language models for chemistry and materials researcharXiv 2024IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language ModelsarXiv 2024Graph RAG-Tool FusionarXiv 2025FreeBind: Free Lunch in Unified Multimodal Space via Knowledge FusionarXiv 2024Dataset Condensation with Contrastive SignalsarXiv 2022Introspective Planning: Aligning Robots' Uncertainty with Inherent Task AmbiguityarXiv 2024DOROTHIE: Spoken Dialogue for Handling Unexpected Situations in Interactive Autonomous Driving AgentsarXiv 2022Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model MergingarXiv 2025Unveiling the Pitfalls of Knowledge Editing for Large Language ModelsarXiv 2023

Back to Papers