0

All papers

Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.

CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt TuningarXiv 2024Table Meets LLM: Can Large Language Models Understand Structured Table Data? A Benchmark and Empirical StudyarXiv 2023Toward Real Text Manipulation Detection: New Dataset and New SolutionarXiv 2023CUTS: A Deep Learning and Topological Framework for Multigranular Unsupervised Medical Image SegmentationarXiv 2022Direct Preference-based Policy Optimization without Reward Modelingdirect-preference-based-policy-optimizationBeyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex ModelsarXiv 2024MeshSegmenter: Zero-Shot Mesh Semantic Segmentation via Texture SynthesisarXiv 2024Large Language Model Distilling Medication Recommendation ModelarXiv 2024CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled VideosarXiv 2022Unleashing the Power of Visual Prompting At the Pixel LevelarXiv 2022A Distributional Lens for Multi-Aspect Controllable Text GenerationarXiv 2022Wojood: Nested Arabic Named Entity Corpus and Recognition using BERTLREC 2022 6Visual correspondence-based explanations improve AI robustness and human-AI team accuracyarXiv 2022Certified Patch Robustness via Smoothed Vision Transformerscertified-patch-robustness-via-smoothedEfficient Inference of Vision Instruction-Following Models with Elastic CachearXiv 2024The Pitfalls of Simplicity Bias in Neural NetworksNeurIPS 2020 12Self-Training Elicits Concise Reasoning in Large Language ModelsarXiv 2025Faster and Lighter LLMs: A Survey on Current Challenges and Way ForwardarXiv 2024Virchow: A Million-Slide Digital Pathology Foundation ModelarXiv 2023Improved Visual-Spatial Reasoning via R1-Zero-Like TrainingarXiv 2025Random Sub-Samples Generation for Self-Supervised Real Image DenoisingICCV 2023 1A Comprehensive Empirical Evaluation on Online Continual LearningarXiv 2023Unsafe Diffusion: On the Generation of Unsafe Images and Hateful Memes From Text-To-Image ModelsarXiv 2023DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image GenerationarXiv 2024Can MLLMs Perform Text-to-Image In-Context Learning?arXiv 2024Transparent Shape from a Single View Polarization ImageICCV 2023 1Discover and Cure: Concept-aware Mitigation of Spurious CorrelationarXiv 2023SQuALITY: Building a Long-Document Summarization Dataset the Hard WayarXiv 2022Polynormer: Polynomial-Expressive Graph Transformer in Linear TimearXiv 2024VB-LoRA: Extreme Parameter Efficient Fine-Tuning with Vector BanksarXiv 2024WikiAsp: A Dataset for Multi-domain Aspect-based SummarizationarXiv 2020AdsorbML: A Leap in Efficiency for Adsorption Energy Calculations using Generalizable Machine Learning PotentialsarXiv 2022WiCE: Real-World Entailment for Claims in WikipediaarXiv 2023InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4arXiv 2023Exploring Diverse In-Context Configurations for Image CaptioningNeurIPS 2023 11Meta-DMoE: Adapting to Domain Shift by Meta-Distillation from Mixture-of-ExpertsarXiv 2022Automatic Text-based Personality Recognition on Monologues and Multiparty Dialogues Using Attentive Networks and Contextual EmbeddingsarXiv 2019SAMO: Speaker Attractor Multi-Center One-Class Learning for Voice Anti-SpoofingarXiv 2022Continuous Remote Sensing Image Super-Resolution based on Context Interaction in Implicit Function SpacearXiv 2023Disentanglement via Latent Quantizationdisentanglement-via-latent-quantizationFederated Recommendation with Additive PersonalizationarXiv 2023GriSPy: A Python package for Fixed-Radius Nearest Neighbors SearcharXiv 2019Harnessing Multimodal Large Language Models for Multimodal Sequential RecommendationarXiv 2024MC-Blur: A Comprehensive Benchmark for Image DeblurringarXiv 2021How Does Pre-trained Wav2Vec 2.0 Perform on Domain Shifted ASR? An Extensive Benchmark on Air Traffic Control CommunicationsarXiv 2022MapFormer: Boosting Change Detection by Using Pre-change InformationICCV 2023 1E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow ModelsarXiv 2026Sound Localization from Motion: Jointly Learning Sound Direction and Camera RotationICCV 2023 1Quo Vadis: Hybrid Machine Learning Meta-Model based on Contextual and Behavioral Malware RepresentationsarXiv 2022The Definitive Guide to Policy Gradients in Deep Reinforcement Learning: Theory, Algorithms and ImplementationsarXiv 2024SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented GenerationarXiv 2024If beam search is the answer, what was the question?EMNLP 2020 11How Effective Are Neural Networks for Fixing Security VulnerabilitiesarXiv 2023Tracking through Containers and Occluders in the WildCVPR 2023 1Shatter and Gather: Learning Referring Image Segmentation with Text SupervisionICCV 2023 1GFlowNet-EM for learning compositional latent variable modelsarXiv 2023Large-Scale Contextualised Language Modelling for NorwegianNoDaLiDa 2021 5A context-aware knowledge transferring strategy for CTC-based ASRarXiv 2022CST5: Data Augmentation for Code-Switched Semantic ParsingarXiv 2022Discriminative Class Tokens for Text-to-Image Diffusion ModelsICCV 2023 1Learning Bottleneck Concepts in Image ClassificationCVPR 2023 1Sound propagation in realistic interactive 3D scenes with parameterized sources using deep neural operatorsarXiv 2023Emergent Representations of Program Semantics in Language Models Trained on ProgramsarXiv 2023Fast and accurate object detection in high resolution 4K and 8K video using GPUsarXiv 2018Re-ReND: Real-time Rendering of NeRFs across DevicesICCV 2023 1MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question AnsweringarXiv 2025DREAM: Diffusion Rectification and Estimation-Adaptive ModelsCVPR 2024 1Region Attention Transformer for Medical Image RestorationarXiv 2024Proving Test Set Contamination in Black Box Language ModelsarXiv 2023Impact of Corpora Quality on Neural Machine TranslationarXiv 2018How Far Are We from Intelligent Visual Deductive Reasoning?arXiv 2024Using Automatically Extracted Minimum Spans to Disentangle Coreference Evaluation from Boundary Detectionusing-automatically-extracted-minimum-spans-1On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and GeneralizabilityarXiv 2024Disentangling Spatial and Temporal Learning for Efficient Image-to-Video Transfer LearningICCV 2023 1SPEC5G: A Dataset for 5G Cellular Network Protocol AnalysisarXiv 2023MUSTARD: Mastering Uniform Synthesis of Theorem and Proof DataarXiv 2024Shift-tolerant Perceptual Similarity Metricshift-tolerant-perceptual-similarity-metricLexi: Self-Supervised Learning of the UI LanguagearXiv 2023VisRL: Intention-Driven Visual Perception via Reinforced ReasoningICCV 2025Coverage-centric Coreset Selection for High Pruning RatesarXiv 2022FreeCOS: Self-Supervised Learning from Fractals and Unlabeled Images for Curvilinear Object SegmentationICCV 2023 1M3Net: Multimodal Multi-task Learning for 3D Detection, Segmentation, and Occupancy Prediction in Autonomous DrivingarXiv 2025Training a Generally Curious AgentarXiv 2025Bidirectional Generation of Structure and Properties Through a Single Molecular Foundation ModelarXiv 2022Implicit Temporal Modeling with Learnable Alignment for Video RecognitionICCV 2023 1Exploring Chemical Space with Score-based Out-of-distribution GenerationarXiv 2022Towards the Generalization of Contrastive Self-Supervised LearningarXiv 2021Image Retrieval from Contextual DescriptionsACL 2022 5Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-ExpertsarXiv 2024Long-Term Photometric Consistent Novel View Synthesis with Diffusion ModelsICCV 2023 1Black is to Criminal as Caucasian is to Police: Detecting and Removing Multiclass Bias in Word Embeddingsblack-is-to-criminal-as-caucasian-is-to-1HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene InteractionsarXiv 2026What Makes a Reward Model a Good Teacher? An Optimization PerspectivearXiv 2025AdvDiff: Generating Unrestricted Adversarial Examples using Diffusion ModelsarXiv 2023The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?arXiv 2024WPO: Enhancing RLHF with Weighted Preference OptimizationarXiv 2024EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video RetrievalarXiv 2024A Pragmatic Guide to Geoparsing EvaluationarXiv 2018Choreographer: Learning and Adapting Skills in ImaginationarXiv 2022Back to Optimization: Diffusion-based Zero-Shot 3D Human Pose EstimationarXiv 2023An Empirical Study of End-to-End Video-Language Transformers with Masked Visual ModelingCVPR 2023 1Cross-modal Causal Relation Alignment for Video Question Groundingcross-modal-causal-relation-alignment-forMAMBA: an Effective World Model Approach for Meta-Reinforcement LearningarXiv 2024Modality-Aware Contrastive Instance Learning with Self-Distillation for Weakly-Supervised Audio-Visual Violence DetectionarXiv 2022UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the WebarXiv 2023Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMsICCV 2025ProCreate, Don't Reproduce! Propulsive Energy Diffusion for Creative GenerationarXiv 2024AI Playground: Unreal Engine-based Data Ablation Tool for Deep LearningarXiv 2020ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation ModelsarXiv 2024A Dataset of Dynamic Reverberant Sound Scenes with Directional Interferers for Sound Event Localization and DetectionarXiv 2021Mirror Descent Policy Optimizationmirror-descent-policy-optimization-1MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation ModelsarXiv 2025CoTEVer: Chain of Thought Prompting Annotation Toolkit for Explanation VerificationarXiv 2023Multi-agent Long-term 3D Human Pose Forecasting via Interaction-aware Trajectory ConditioningCVPR 2024 1A Structure-Aware Relation Network for Thoracic Diseases Detection and SegmentationarXiv 2021Q-Probe: A Lightweight Approach to Reward Maximization for Language ModelsarXiv 2024Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up AugmentationarXiv 2023Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical ReasoningarXiv 2024Can We Edit Factual Knowledge by In-Context Learning?arXiv 2023Vega-MT: The JD Explore Academy Translation System for WMT22arXiv 2022Focal-UNet: UNet-like Focal Modulation for Medical Image SegmentationarXiv 2022Measuring Human and AI Values Based on Generative Psychometrics with Large Language ModelsarXiv 2024Making Reconstruction-based Method Great Again for Video Anomaly DetectionarXiv 2023Knowledge-Infused Prompting: Assessing and Advancing Clinical Text Data Generation with Large Language ModelsarXiv 2023SHAS: Approaching optimal Segmentation for End-to-End Speech TranslationarXiv 2022SINDER: Repairing the Singular Defects of DINOv2arXiv 2024Learning Video Context as Interleaved Multimodal SequencesarXiv 2024GATEAU: Selecting Influential Samples for Long Context AlignmentarXiv 2024Sparse Modular Activation for Efficient Sequence Modelingsparse-modular-activation-for-efficientFrom Sky to the Ground: A Large-scale Benchmark and Simple Baseline Towards Real Rain RemovalICCV 2023 1Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing GuidancearXiv 2025AgentRewardBench: Evaluating Automatic Evaluations of Web Agent TrajectoriesarXiv 2025Controlled Text Generation for Large Language Model with Dynamic Attribute GraphsarXiv 2024From Pretraining Data to Language Models to Downstream Tasks: Tracking the Trails of Political Biases Leading to Unfair NLP ModelsarXiv 2023VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors EmbeddingCVPR 2025 1Boundary Guided Learning-Free Semantic Control with Diffusion Modelsboundary-guided-learning-free-semanticTransforMatcher: Match-to-Match Attention for Semantic CorrespondencearXiv 2022Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of ThoughtarXiv 2025HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language GeneralizationarXiv 2024Aligning Instruction Tasks Unlocks Large Language Models as Zero-Shot Relation ExtractorsarXiv 2023Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model EvaluationCVPR 2025 1X-Stance: A Multilingual Multi-Target Dataset for Stance DetectionarXiv 2020Goal-Driven Explainable Clustering via Language DescriptionsarXiv 2023MultiEURLEX -- A multi-lingual and multi-label legal document classification dataset for zero-shot cross-lingual transferarXiv 2021RelayAttention for Efficient Large Language Model Serving with Long System PromptsarXiv 2024Mastering the Unsupervised Reinforcement Learning Benchmark from PixelsarXiv 2022Divide and Conquer: 3D Point Cloud Instance Segmentation With Point-Wise BinarizationICCV 2023 1RRWNet: Recursive Refinement Network for effective retinal artery/vein segmentation and classificationarXiv 2024Contrastive Learning of Sentence Embeddings from ScratcharXiv 2023Text-image Alignment for Diffusion-based PerceptionCVPR 2024 1GrainGrasp: Dexterous Grasp Generation with Fine-grained Contact GuidancearXiv 2024Less is More: Task-aware Layer-wise Distillation for Language Model CompressionarXiv 2022Contrastive Model Adaptation for Cross-Condition Robustness in Semantic SegmentationICCV 2023 1Magnitude Invariant Parametrizations Improve Hypernetwork LearningarXiv 2023Improving Protein Optimization with Smoothed Fitness LandscapesarXiv 2023StoryGPT-V: Large Language Models as Consistent Story VisualizersCVPR 2025 1Factorizing Perception and Policy for Interactive Instruction FollowingICCV 2021 10Few-shot Named Entity Recognition with Self-describing NetworksACL 2022 5Improving Contrastive Learning of Sentence Embeddings from AI FeedbackarXiv 2023Neural Implicit Dictionary via Mixture-of-Expert TrainingarXiv 2022CoMAE: A Multi-factor Hierarchical Framework for Empathetic Response GenerationFindings (ACL) 2021 8A Dense Reward View on Aligning Text-to-Image Diffusion with PreferencearXiv 2024Metacognitive Prompting Improves Understanding in Large Language ModelsarXiv 2023JudgeLRM: Large Reasoning Models as a JudgearXiv 2025Feature Programming for Multivariate Time Series PredictionarXiv 2023Can ChatGPT Replace Traditional KBQA Models? An In-depth Analysis of the Question Answering Performance of the GPT LLM FamilyarXiv 2023Graphusion: Leveraging Large Language Models for Scientific Knowledge Graph Fusion and Construction in NLP EducationarXiv 2024ML-Dev-Bench: Comparative Analysis of AI Agents on ML development workflowsarXiv 2025Idempotence and Perceptual Image CompressionarXiv 2024DELL: Generating Reactions and Explanations for LLM-Based Misinformation DetectionarXiv 2024Visual Style Prompt Learning Using Diffusion Models for Blind Face RestorationarXiv 2024NL2TL: Transforming Natural Languages to Temporal Logics using Large Language ModelsarXiv 2023Minimizing the Accumulated Trajectory Error to Improve Dataset DistillationCVPR 2023 1A critical analysis of self-supervision, or what we can learn from a single imageICLR 2020 1CLAMP: Prompt-based Contrastive Learning for Connecting Language and Animal PoseCVPR 2023 1Rationales for Sequential PredictionsEMNLP 2021 11Unifying Generation and Prediction on Graphs with Latent Graph DiffusionarXiv 2024CodeIE: Large Code Generation Models are Better Few-Shot Information ExtractorsarXiv 2023CoFE-RAG: A Comprehensive Full-chain Evaluation Framework for Retrieval-Augmented Generation with Enhanced Data DiversityarXiv 2024The infrastructure powering IBM's Gen AI model developmentarXiv 2024Tree Prompting: Efficient Task Adaptation without Fine-TuningarXiv 2023Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA TaskarXiv 20223DSNet: Unsupervised Shape-to-Shape 3D Style TransferarXiv 2020Maximum Entropy Reinforcement Learning via Energy-Based Normalizing FlowarXiv 2024Long-Tailed Visual Recognition via Self-Heterogeneous Integration with Knowledge ExcavationCVPR 2023 1Evaluating Language Models as Synthetic Data GeneratorsarXiv 2024Watermarking Text Generated by Black-Box Language ModelsarXiv 2023The Pitfalls of Memorization: When Memorization Hurts GeneralizationarXiv 2024Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision TransformersCVPR 2024 1A Statutory Article Retrieval Dataset in FrenchACL 2022 5Cross Initialization for Personalized Text-to-Image GenerationarXiv 2023ConDA: Contrastive Domain Adaptation for AI-generated Text DetectionarXiv 2023SparseCraft: Few-Shot Neural Reconstruction through Stereopsis Guided Geometric LinearizationarXiv 2024Topic-Aware Multi-turn Dialogue ModelingarXiv 2020RBGNet: Ray-based Grouping for 3D Object DetectionCVPR 2022 1Deep Image Harmonization with Learnable AugmentationICCV 2023 1A Second Wave of UD Hebrew Treebanking and Cross-Domain ParsingarXiv 2022Unlearning Concepts in Diffusion Model via Concept Domain Correction and Concept Preserving GradientarXiv 2024Data-efficient Fine-tuning for LLM-based RecommendationarXiv 2024Counterfactual Conservative Q Learning for Offline Multi-agent Reinforcement Learningcounterfactual-conservative-q-learning-for

Back to Papers