All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
ScatSimCLR: self-supervised contrastive learning with pretext task regularization for small-scale datasetsscatsimclr-self-supervised-contrastive-1AIGCIQA2023: A Large-scale Image Quality Assessment Database for AI Generated Images: from the Perspectives of Quality, Authenticity and CorrespondencearXiv 2023Stage-wise Fine-tuning for Graph-to-Text GenerationACL 2021 5GACELA -- A generative adversarial context encoder for long audio inpaintingarXiv 2020Discovering Interpretable Directions in the Semantic Latent Space of Diffusion ModelsarXiv 2023Pushing the Limits of Zero-shot End-to-End Speech TranslationarXiv 2024Masked Attribute Description Embedding for Cloth-Changing Person Re-identificationarXiv 2024Prompting Is All You Need: Automated Android Bug Replay with Large
Language ModelsarXiv 2023Controllable Preference Optimization: Toward Controllable Multi-Objective AlignmentarXiv 2024One-Step Diffusion Distillation via Deep Equilibrium Modelsone-step-diffusion-distillation-via-deepPROMPTFUZZ: Harnessing Fuzzing Techniques for Robust Testing of Prompt Injection in LLMsarXiv 2024Feature Guided Masked Autoencoder for Self-supervised Learning in Remote SensingarXiv 2023Collab-RAG: Boosting Retrieval-Augmented Generation for Complex Question Answering via White-Box and Black-Box LLM CollaborationarXiv 2025TASTEset -- Recipe Dataset and Food Entities Recognition BenchmarkarXiv 2022Audio Retrieval with Natural Language QueriesarXiv 2021Class-Aware Mask-Guided Feature Refinement for Scene Text RecognitionarXiv 2024No Fear of Classifier Biases: Neural Collapse Inspired Federated Learning with Synthetic and Fixed ClassifierICCV 2023 1In or Out? Fixing ImageNet Out-of-Distribution Detection EvaluationarXiv 2023Generating Visual Spatial Description via Holistic 3D Scene UnderstandingarXiv 2023Interventional Causal Representation LearningarXiv 2022LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial RelationsarXiv 2024Timo: Towards Better Temporal Reasoning for Language ModelsarXiv 2024AI-generated text boundary detection with RoFTarXiv 2023Cross-Domain Ensemble Distillation for Domain Generalizationcross-domain-ensemble-distillation-for-domain-1End-to-end Autonomous Driving with Semantic Depth Cloud Mapping and Multi-agentarXiv 2022How to think step-by-step: A mechanistic understanding of chain-of-thought reasoningarXiv 2024ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion ModelsarXiv 2023Apparate: Rethinking Early Exits to Tame Latency-Throughput Tensions in ML ServingarXiv 2023LLM Honeypot: Leveraging Large Language Models as Advanced Interactive Honeypot SystemsarXiv 2024Gradient-based Parameter Selection for Efficient Fine-TuningCVPR 2024 1Self-Adapting Large Visual-Language Models to Edge Devices across Visual ModalitiesarXiv 2024Advanced Semantics for Commonsense Knowledge ExtractionarXiv 2020Rethinking Benchmarks for Cross-modal Image-text RetrievalarXiv 2023NoisyQuant: Noisy Bias-Enhanced Post-Training Activation Quantization for Vision TransformersCVPR 2023 1Neural Compression and Filtering for Edge-assisted Real-time Object Detection in Challenged NetworksarXiv 2020Attention Approximates Sparse Distributed MemoryNeurIPS 2021 12Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3arXiv 2024Diffusion Noise Feature: Accurate and Fast Generated Image DetectionarXiv 2023Neural Media Bias Detection Using Distant Supervision With BABE -- Bias Annotations By ExpertsarXiv 2022Meta-Learning Online Adaptation of Language ModelsarXiv 2023This Email Could Save Your Life: Introducing the Task of Email Subject Line Generationthis-email-could-save-your-life-introducing-1ENAT: Rethinking Spatial-temporal Interactions in Token-based Image SynthesisarXiv 2024Accelerating Exploration with Unlabeled Prior Dataaccelerating-exploration-with-unlabeled-priorHyperbolic Safety-Aware Vision-Language ModelsCVPR 2025 1A Novel Dataset for Keypoint Detection of quadruped Animals from ImagesarXiv 2021On the Safety of Conversational Models: Taxonomy, Dataset, and BenchmarkFindings (ACL) 2022 5Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time ComputearXiv 2025LASER: LAtent SpacE Rendering for 2D Visual LocalizationCVPR 2022 1DAPR: A Benchmark on Document-Aware Passage RetrievalarXiv 2023Leveraging Large Language Models for NLG Evaluation: Advances and ChallengesarXiv 2024SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment OptimizationarXiv 2024Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual HallucinationarXiv 2024Meta-learning via Language Model In-context TuningACL 2022 5Learning from History for Byzantine Robust OptimizationarXiv 2020Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge GraphsarXiv 2024AI Agents That MatterarXiv 2024GRADE: Benchmarking Discipline-Informed Reasoning in Image EditingarXiv 2026Stacking Brick by Brick: Aligned Feature Isolation for Incremental Face Forgery DetectionCVPR 2025 1Active Instruction Tuning: Improving Cross-Task Generalization by Training on Prompt Sensitive TasksarXiv 2023Mass-Producing Failures of Multimodal Systems with Language Modelsmass-producing-failures-of-multimodal-systemsCleanCoNLL: A Nearly Noise-Free Named Entity Recognition DatasetarXiv 2023Learning Signed Hyper Surfaces for Oriented Point Cloud Normal EstimationCVPR 2023 1Pruning Deep Neural Networks from a Sparsity Perspectivepruning-deep-neural-networks-from-a-sparsityScaling Autonomous Agents via Automatic Reward Modeling And PlanningarXiv 2025Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized DataarXiv 2025Neural Continuous-Discrete State Space Models for Irregularly-Sampled Time SeriesarXiv 2023Person Re-Identification without Identification via Event AnonymizationICCV 2023 1Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?arXiv 2023Integrating View Conditions for Image SynthesisarXiv 2023Token Prediction as Implicit Classification to Identify LLM-Generated TextarXiv 2023Safe Offline Reinforcement Learning with Real-Time Budget ConstraintsarXiv 2023Learning Flexible Body Collision Dynamics with Hierarchical Contact Mesh TransformerarXiv 2023DINOISER: Diffused Conditional Sequence Learning by Manipulating NoisesarXiv 2023Are Natural Domain Foundation Models Useful for Medical Image Classification?arXiv 2023MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level SupervisionarXiv 2025Are we certain it's anomalous?arXiv 2022LeSICiN: A Heterogeneous Graph-based Approach for Automatic Legal Statute Identification from Indian Legal DocumentsarXiv 2021Dissecting Human and LLM PreferencesarXiv 2024Multimodal Task Vectors Enable Many-Shot Multimodal In-Context LearningarXiv 2024HyperMixer: An MLP-based Low Cost Alternative to TransformersarXiv 2022GridPull: Towards Scalability in Learning Implicit Representations from 3D Point CloudsICCV 2023 1Fcaformer: Forward Cross Attention in Hybrid Vision TransformerICCV 2023 1The Health Gym: Synthetic Health-Related Datasets for the Development of Reinforcement Learning AlgorithmsarXiv 2022Masked Structural Growth for 2x Faster Language Model Pre-trainingarXiv 2023Deep Unlearning via Randomized Conditionally Independent HessiansCVPR 2022 1Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse PromptsarXiv 2024textTOvec: Deep Contextualized Neural Autoregressive Topic Models of Language with Distributed Compositional Priortexttovec-deep-contextualized-neural-1Long-Tailed Recognition by Mutual Information Maximization between Latent Features and Ground-Truth LabelsarXiv 2023Berlin V2X: A Machine Learning Dataset from Multiple Vehicles and Radio Access TechnologiesarXiv 2022TAN Without a Burn: Scaling Laws of DP-SGDarXiv 2022Pre-RMSNorm and Pre-CRMSNorm Transformers: Equivalent and Efficient Pre-LN TransformersNeurIPS 2023 11From One to Many: Expanding the Scope of Toxicity Mitigation in Language ModelsarXiv 2024How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image EditingarXiv 2026Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language ModelsarXiv 2024ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language ModelsarXiv 2024Learning Multi-Level Features with Matryoshka Sparse AutoencodersarXiv 2025Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documentsdocument-haystacks-vision-language-reasoning-1OOP: Object-Oriented Programming Evaluation Benchmark for Large Language ModelsarXiv 2024CrackNex: a Few-shot Low-light Crack Segmentation Model Based on Retinex Theory for UAV InspectionsarXiv 2024Learning to Reason via Mixture-of-Thought for Logical ReasoningarXiv 2025Black Box Few-Shot Adaptation for Vision-Language modelsICCV 2023 1MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language ModelarXiv 2024Confidence Score for Source-Free Unsupervised Domain AdaptationarXiv 2022Mind the Gap! Injecting Commonsense Knowledge for Abstractive Dialogue SummarizationCOLING 2022 10Two-in-One Depth: Bridging the Gap Between Monocular and Binocular Self-supervised Depth EstimationICCV 2023 1SemARFlow: Injecting Semantics into Unsupervised Optical Flow Estimation for Autonomous DrivingICCV 2023 1RaftMLP: How Much Can Be Done Without Attention and with Less Spatial Locality?arXiv 2021NCHO: Unsupervised Learning for Neural 3D Composition of Humans and ObjectsICCV 2023 1Debate on Graph: a Flexible and Reliable Reasoning Framework for Large Language ModelsarXiv 2024Ad-datasets: a meta-collection of data sets for autonomous drivingarXiv 2022Rank-DistiLLM: Closing the Effectiveness Gap Between Cross-Encoders and LLMs for Passage Re-RankingarXiv 2024VarAD: Lightweight High-Resolution Image Anomaly Detection via Visual Autoregressive ModelingarXiv 2024Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image GenerationarXiv 2023Value Gradient weighted Model-Based Reinforcement Learningvalue-gradient-weighted-model-basedOn the (In)fidelity and Sensitivity for ExplanationsarXiv 2019New Job, New Gender? Measuring the Social Bias in Image Generation ModelsarXiv 2024Solving High Frequency and Multi-Scale PDEs with Gaussian ProcessesarXiv 2023LawInstruct: A Resource for Studying Language Model Adaptation to the Legal DomainarXiv 2024VinDr-SpineXR: A deep learning framework for spinal lesions detection and classification from radiographsarXiv 2021Fine-Tuning Visual Autoregressive Models for Subject-Driven GenerationarXiv 2025Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning TracesarXiv 2024ReGAL: Refactoring Programs to Discover Generalizable AbstractionsarXiv 2024ChartInstruct: Instruction Tuning for Chart Comprehension and ReasoningarXiv 2024ALaRM: Align Language Models via Hierarchical Rewards ModelingarXiv 2024ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning
with Dual-Modality Guided PromptarXiv 2024Automatic Generation of Socratic Subquestions for Teaching Math Word ProblemsarXiv 2022UniKeyphrase: A Unified Extraction and Generation Framework for Keyphrase PredictionFindings (ACL) 2021 8HARDMath: A Benchmark Dataset for Challenging Problems in Applied MathematicsarXiv 2024CODESYNC: Synchronizing Large Language Models with Dynamic Code Evolution at ScalearXiv 2025Multilingual LAMA: Investigating Knowledge in Multilingual Pretrained Language ModelsEACL 2021 2Learning Precise Affordances from Egocentric Videos for Robotic ManipulationICCV 2025Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed?arXiv 2023ReactXT: Understanding Molecular "Reaction-ship" via Reaction-Contextualized Molecule-Text PretrainingarXiv 2024Prompt Flow Integrity to Prevent Privilege Escalation in LLM AgentsarXiv 2025VISIT: Visualizing and Interpreting the Semantic Information Flow of TransformersarXiv 2023Can OOD Object Detectors Learn from Foundation Models?arXiv 2024Scaling Graph Convolutions for Mobile VisionarXiv 2024Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning AttackarXiv 2024Image Watermarks are Removable Using Controllable Regeneration from Clean NoisearXiv 2024LLM4TS: Aligning Pre-Trained LLMs as Data-Efficient Time-Series ForecastersarXiv 2023BPE Gets Picky: Efficient Vocabulary Refinement During Tokenizer TrainingarXiv 2024Question-Aware Gaussian Experts for Audio-Visual Question AnsweringCVPR 2025 1The rising costs of training frontier AI modelsarXiv 2024Language-Specific Representation of Emotion-Concept Knowledge Causally Supports Emotion InferencearXiv 2023Schema-Driven Information Extraction from Heterogeneous TablesarXiv 2023Knowledge graph enhanced retrieval-augmented generation for failure mode and effects analysisarXiv 2024A general-purpose material property data extraction pipeline from large polymer corpora using Natural Language ProcessingarXiv 2022GraphInstruct: Empowering Large Language Models with Graph Understanding and Reasoning CapabilityarXiv 2024COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video EditingarXiv 2024GPFL: Simultaneously Learning Global and Personalized Feature Information for Personalized Federated LearningICCV 2023 1"Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented GenerationarXiv 2023Hierarchical Task Learning from Language Instructions with Unified Transformers and Self-MonitoringFindings (ACL) 2021 8Soft Self-Consistency Improves Language Model AgentsarXiv 2024Digital Discovery of interferometric Gravitational Wave DetectorsarXiv 2023Why Is Prompt Tuning for Vision-Language Models Robust to Noisy Labels?ICCV 2023 1Extrapolating Large Language Models to Non-English by Aligning LanguagesarXiv 2023Efficient Joint Optimization of Layer-Adaptive Weight Pruning in Deep Neural NetworksICCV 2023 1Learning Semi-supervised Gaussian Mixture Models for Generalized Category DiscoveryICCV 2023 1Frequency-Adaptive Pan-Sharpening with Mixture of ExpertsarXiv 2024OMPQ: Orthogonal Mixed Precision QuantizationarXiv 2021LLaST: Improved End-to-end Speech Translation System Leveraged by Large Language ModelsarXiv 2024Adapting Vision Foundation Models for Robust Cloud Segmentation in Remote Sensing ImagesarXiv 2024MGMAE: Motion Guided Masking for Video Masked AutoencodingICCV 2023 1Sheet Music Transformer: End-To-End Optical Music Recognition Beyond Monophonic TranscriptionarXiv 2024Physics-Driven Turbulence Image Restoration with Stochastic RefinementICCV 2023 1Flow4D: Leveraging 4D Voxel Network for LiDAR Scene Flow EstimationarXiv 2024Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language ModelsarXiv 2023Best Prompts for Text-to-Image Models and How to Find ThemarXiv 2022Progressive Open Space Expansion for Open-Set Model AttributionCVPR 2023 1STARC: Structured Annotations for Reading Comprehensionstarc-structured-annotations-for-reading-1Discriminative Deep Dyna-Q: Robust Planning for Dialogue Policy Learningdiscriminative-deep-dyna-q-robust-planning-1Multiresolution Equivariant Graph Variational Autoencodermultiresolution-equivariant-graph-variationalDomain generalization of 3D semantic segmentation in autonomous drivingICCV 2023 1Atla Selene Mini: A General Purpose Evaluation ModelarXiv 2025ImbSAM: A Closer Look at Sharpness-Aware Minimization in Class-Imbalanced RecognitionICCV 2023 1InfoCTM: A Mutual Information Maximization Perspective of Cross-Lingual Topic ModelingarXiv 2023Context Compression for Auto-regressive Transformers with Sentinel TokensarXiv 2023Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language ModelsarXiv 2024Efficient multi-prompt evaluation of LLMsarXiv 2024TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video GenerationarXiv 2024GaPro: Box-Supervised 3D Point Cloud Instance Segmentation Using Gaussian Processes as Pseudo LabelersICCV 2023 1xGQA: Cross-Lingual Visual Question AnsweringFindings (ACL) 2022 5Towards Distribution-Agnostic Generalized Category Discoverytowards-distribution-agnostic-generalizedActivity-aware Human Mobility Prediction with Hierarchical Graph Attention Recurrent NetworkarXiv 2022Temporal and cross-modal attention for audio-visual zero-shot learningarXiv 2022Generalizable Decision Boundaries: Dualistic Meta-Learning for Open Set Domain GeneralizationICCV 2023 1Multi-Turn Code Generation Through Single-Step RewardsarXiv 2025Robust Evaluation of Diffusion-Based Adversarial PurificationICCV 2023 1CLIP meets GamePhysics: Towards bug identification in gameplay videos using zero-shot transfer learningarXiv 2022MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and RecognitionICCV 2023 1OReX: Object Reconstruction from Planar Cross-sections Using Neural FieldsCVPR 2023 1Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next LevelarXiv 2024ReGen: Zero-Shot Text Classification via Training Data Generation with Progressive Dense RetrievalarXiv 2023Collaborative Sampling in Generative Adversarial NetworksarXiv 2019Judging the Judges: A Collection of LLM-Generated Relevance JudgementsarXiv 2025SelfElicit: Your Language Model Secretly Knows Where is the Relevant EvidencearXiv 2025Self-Supervised Learning with Lie Symmetries for Partial Differential Equationsself-supervised-learning-with-lie-symmetriesEfficient Estimation of Word Representations in Vector SpacearXiv 2013Hi-End-MAE: Hierarchical encoder-driven masked autoencoders are stronger vision learners for medical image segmentationarXiv 2025PRISE: LLM-Style Sequence Compression for Learning Temporal Action Abstractions in ControlarXiv 2024