All papers
Every paper that carries a page of its own here. The Papers page leads with what is trending and lets you filter the recent catalog; this is the plain index of the rest.
SeeGULL: A Stereotype Benchmark with Broad Geo-Cultural Coverage Leveraging Generative ModelsarXiv 202370 years of machine learning in geoscience in reviewarXiv 2020Adaptive Nonlinear Latent Transformation for Conditional Face EditingICCV 2023 1What You See is What You Read? Improving Text-Image Alignment Evaluationwhat-you-see-is-what-you-read-improving-textInferAligner: Inference-Time Alignment for Harmlessness through Cross-Model GuidancearXiv 2024HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code GenerationarXiv 2024Counting Out Time: Class Agnostic Video Repetition Counting in the Wildcounting-out-time-class-agnostic-videoSysBench: Can Large Language Models Follow System Messages?arXiv 2024Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?arXiv 2024Multi-view Self-supervised Disentanglement for General Image DenoisingICCV 2023 1Pooling And Attention: What Are Effective Designs For LLM-Based Embedding Models?arXiv 2024Making Your First Choice: To Address Cold Start Problem in Vision Active LearningarXiv 2022Multi-expert Prompting Improves Reliability, Safety, and Usefulness of Large Language ModelsarXiv 2024Object-Centric Multiple Object TrackingICCV 2023 1Vector-Quantized Autoregressive Predictive CodingarXiv 2020Graph Neural Networks and Representation Embedding for Table Extraction in PDF DocumentsarXiv 2022Improving Medical Predictions by Irregular Multimodal Electronic Health Records ModelingarXiv 2022LongWanjuan: Towards Systematic Measurement for Long Text QualityarXiv 2024Query-as-context Pre-training for Dense Passage RetrievalarXiv 2022OLAPH: Improving Factuality in Biomedical Long-form Question AnsweringarXiv 2024Co-MTP: A Cooperative Trajectory Prediction Framework with Multi-Temporal Fusion for Autonomous DrivingarXiv 2025Learning Code Preference via Synthetic EvolutionarXiv 2024Hypothetical Minds: Scaffolding Theory of Mind for Multi-Agent Tasks with Large Language ModelsarXiv 2024DreamSampler: Unifying Diffusion Sampling and Score Distillation for Image ManipulationarXiv 2024Breaking the Low-Rank Dilemma of Linear AttentionCVPR 2025 1Unified Demonstration Retriever for In-Context LearningarXiv 2023Text2PDE: Latent Diffusion Models for Accessible Physics SimulationarXiv 2024ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long VideosCVPR 2025 1LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation TasksarXiv 2024Rethinking Symbolic Regression Datasets and Benchmarks for Scientific DiscoveryarXiv 2022MuMA-ToM: Multi-modal Multi-Agent Theory of MindarXiv 2024Divide and not forget: Ensemble of selectively trained experts in Continual LearningarXiv 2024TESTEVAL: Benchmarking Large Language Models for Test Case GenerationarXiv 2024X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising UsabilityarXiv 2025RSPNet: Relative Speed Perception for Unsupervised Video Representation LearningarXiv 2020Deep Multiview Clustering by Contrasting Cluster AssignmentsICCV 2023 1Unlocking Emergent Modularity in Large Language ModelsarXiv 2023Position-Enhanced Visual Instruction Tuning for Multimodal Large Language ModelsarXiv 2023EIA: Environmental Injection Attack on Generalist Web Agents for Privacy LeakagearXiv 2024BadEdit: Backdooring large language models by model editingarXiv 2024Understanding and Mitigating the Label Noise in Pre-training on Downstream TasksarXiv 2023Expand, Rerank, and Retrieve: Query Reranking for Open-Domain Question AnsweringarXiv 2023video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language ModelarXiv 2025InstructDET: Diversifying Referring Object Detection with Generalized InstructionsarXiv 2023Reasoning with Latent Diffusion in Offline Reinforcement LearningarXiv 2023DiffTAD: Temporal Action Detection with Proposal Denoising DiffusionICCV 2023 1Graph of Records: Boosting Retrieval Augmented Generation for Long-context Summarization with GraphsarXiv 2024Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and MitigationarXiv 2023SMART: Self-Aware Agent for Tool Overuse MitigationarXiv 2025Generative Pretrained Hierarchical Transformer for Time Series ForecastingarXiv 2024REBAR: Retrieval-Based Reconstruction for Time-series Contrastive LearningarXiv 2023ComCLIP: Training-Free Compositional Image and Text MatchingarXiv 2022Emotion-Anchored Contrastive Learning Framework for Emotion Recognition in ConversationarXiv 2024AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question AnsweringarXiv 2023Asymmetry in Low-Rank Adapters of Foundation ModelsarXiv 2024JOTR: 3D Joint Contrastive Learning with Transformers for Occluded Human Mesh RecoveryICCV 2023 1Reduced Precision Floating-Point Optimization for Deep Neural Network On-Device Learning on MicroControllersarXiv 2023MechAgents: Large language model multi-agent collaborations can solve mechanics problems, generate new data, and integrate knowledgearXiv 2023Strongly Incremental Constituency Parsing with Graph Neural NetworksNeurIPS 2020 12Tem-adapter: Adapting Image-Text Pretraining for Video Question AnswerICCV 2023 1HAZARD Challenge: Embodied Decision Making in Dynamically Changing EnvironmentsarXiv 2024Understanding and Enhancing the Transferability of Jailbreaking AttacksarXiv 2025Exploring the Naturalness of AI-Generated ImagesarXiv 2023Bayesian Prompt Learning for Image-Language Model GeneralizationICCV 2023 1COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-trainingCVPR 2025 1Adversarial Score Distillation: When score distillation meets GANCVPR 2024 1POLITICS: Pretraining with Same-story Article Comparison for Ideology Prediction and Stance DetectionFindings (NAACL) 2022 7Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language ModelsarXiv 2023Robust Task Representations for Offline Meta-Reinforcement Learning via Contrastive LearningarXiv 2022You Actually Look Twice At it (YALTAi): using an object detection approach instead of region segmentation within the Kraken enginearXiv 2022MAP: Multimodal Uncertainty-Aware Vision-Language Pre-training ModelCVPR 2023 1Eventful Transformers: Leveraging Temporal Redundancy in Vision TransformersICCV 2023 1Diffusion-Based Neural Network Weights GenerationarXiv 2024Using Large Language Models for Knowledge Engineering (LLMKE): A Case Study on WikidataarXiv 2023Single-subject Multi-contrast MRI Super-resolution via Implicit Neural RepresentationsarXiv 2023CompAct: Compressing Retrieved Documents Actively for Question AnsweringarXiv 2024Instruction-tuning Aligns LLMs to the Human BrainarXiv 2023Leveraging Inpainting for Single-Image Shadow RemovalICCV 2023 1Turning large language models into cognitive modelsarXiv 2023Elephants Never Forget: Memorization and Learning of Tabular Data in Large Language ModelsarXiv 2024Procedural Image Programs for Representation LearningarXiv 2022Massive Editing for Large Language Models via Meta LearningarXiv 2023Large Language Models Only Pass Primary School Exams in Indonesia: A Comprehensive Test on IndoMMLUarXiv 2023GridFormer: Residual Dense Transformer with Grid Structure for Image Restoration in Adverse Weather ConditionsarXiv 2023OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offsarXiv 2024Of Human Criteria and Automatic Metrics: A Benchmark of the Evaluation of Story GenerationCOLING 2022 10Geodesic Multi-Modal Mixup for Robust Fine-TuningNeurIPS 2023 11Exploring Transformer Backbones for Heterogeneous Treatment Effect EstimationarXiv 2022Improving Mini-batch Optimal Transport via Partial Transportationimproving-mini-batch-optimal-transport-viaDiscoScore: Evaluating Text Generation with BERT and Discourse CoherencearXiv 2022Promising or Elusive? Unsupervised Object Segmentation from Real-world Single ImagesarXiv 2022Cerbero-7B: A Leap Forward in Language-Specific LLMs Through Enhanced Chat Corpus Generation and EvaluationarXiv 2023VPP: Efficient Conditional 3D Generation via Voxel-Point Progressive Representationvpp-efficient-conditional-3d-generation-viaGraspLDM: Generative 6-DoF Grasp Synthesis using Latent Diffusion ModelsarXiv 2023Mamba-FSCIL: Dynamic Adaptation with Selective State Space Model for Few-Shot Class-Incremental LearningarXiv 2024It Takes Two to Tango: Mixup for Deep Metric Learningit-takes-two-to-tango-mixup-for-deep-metric-1Emotional Chatting Machine: Emotional Conversation Generation with Internal and External MemoryarXiv 2017ClidSum: A Benchmark Dataset for Cross-Lingual Dialogue SummarizationarXiv 2022SimPSI: A Simple Strategy to Preserve Spectral Information in Time
Series Data AugmentationarXiv 2023Visuo-Tactile Transformers for ManipulationarXiv 2022Analyzing and Reducing Catastrophic Forgetting in Parameter Efficient TuningarXiv 2024Explore-Instruct: Enhancing Domain-Specific Instruction Coverage through Active ExplorationarXiv 2023Improving Robustness for Joint Optimization of Camera Poses and Decomposed Low-Rank Tensorial Radiance FieldsarXiv 2024Solving Oscillation Problem in Post-Training Quantization Through a Theoretical PerspectiveCVPR 2023 1MultiCapCLIP: Auto-Encoding Prompts for Zero-Shot Multilingual Visual CaptioningarXiv 2023A Practical Contrastive Learning Framework for Single-Image Super-ResolutionarXiv 2021Dialect prejudice predicts AI decisions about people's character, employability, and criminalityarXiv 2024MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMsarXiv 2024FairDomain: Achieving Fairness in Cross-Domain Medical Image Segmentation and ClassificationarXiv 2024Can LLMs Understand Time Series Anomalies?arXiv 2024SGIFormer: Semantic-guided and Geometric-enhanced Interleaving Transformer for 3D Instance SegmentationarXiv 2024Replay: Multi-modal Multi-view Acted Videos for Casual HolographyICCV 2023 1Distilling Script Knowledge from Large Language Models for Constrained Language PlanningarXiv 2023Implicit Search via Discrete Diffusion: A Study on ChessarXiv 2025Selective Weak Supervision for Neural Information RetrievalarXiv 2020A Data-Based Perspective on Transfer LearningCVPR 2023 1From Pixel to Patch: Synthesize Context-aware Features for Zero-shot Semantic SegmentationarXiv 2020Pixel Adaptive Deep Unfolding Transformer for Hyperspectral Image ReconstructionICCV 2023 1Multi-metrics adaptively identifies backdoors in Federated learningICCV 2023 1SCONE: Surface Coverage Optimization in Unknown Environments by Volumetric IntegrationarXiv 2022Beyond Surface Statistics: Scene Representations in a Latent Diffusion ModelarXiv 2023Parameter Efficient Fine-tuning of Self-supervised ViTs without Catastrophic ForgettingarXiv 2024Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language ModelarXiv 2024NEREL: A Russian Dataset with Nested Named Entities, Relations and EventsRANLP 2021 9Context Clues: Evaluating Long Context Models for Clinical Prediction Tasks on EHRsarXiv 2024SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM TrainingarXiv 2025TiM4Rec: An Efficient Sequential Recommendation Model Based on
Time-Aware Structured State Space Duality ModelarXiv 2024Linear Adversarial Concept ErasurearXiv 2022Leaving Reality to Imagination: Robust Classification via Generated DatasetsarXiv 2023Auxiliary Tasks Benefit 3D Skeleton-based Human Motion PredictionICCV 2023 1RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image UnderstandingarXiv 2024MotionBank: A Large-scale Video Motion Benchmark with Disentangled Rule-based AnnotationsarXiv 2024PA&DA: Jointly Sampling PAth and DAta for Consistent NASCVPR 2023 1Visual Haystacks: A Vision-Centric Needle-In-A-Haystack BenchmarkarXiv 2024PiCO: Peer Review in LLMs based on the Consistency OptimizationarXiv 2024Towards Holistic Surgical Scene UnderstandingarXiv 2022SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified FlowarXiv 2024ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency DistillationarXiv 2023Instruction Following without Instruction TuningarXiv 2024Language Models as Hierarchy EncodersarXiv 2024HiLo: Exploiting High Low Frequency Relations for Unbiased Panoptic Scene Graph GenerationICCV 2023 1A Large Recurrent Action Model: xLSTM enables Fast Inference for Robotics TasksarXiv 2024WESPER: Zero-shot and Realtime Whisper to Normal Voice Conversion for
Whisper-based Speech InteractionsarXiv 2023CMDA: Cross-Modality Domain Adaptation for Nighttime Semantic SegmentationICCV 2023 1Distilling Cognitive Backdoor Patterns within an ImagearXiv 2023Attention Lens: A Tool for Mechanistically Interpreting the Attention Head Information Retrieval MechanismarXiv 2023LLM-Empowered State Representation for Reinforcement LearningarXiv 2024AutoToM: Automated Bayesian Inverse Planning and Model Discovery for Open-ended Theory of MindarXiv 2025BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoningarXiv 2025Democratizing Reasoning Ability: Tailored Learning from Large Language ModelarXiv 2023DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based SamplingarXiv 2024Adaptable and Reliable Text Classification using Large Language ModelsarXiv 2024MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in VideosarXiv 2025On Circuit-based Hybrid Quantum Neural Networks for Remote Sensing Imagery ClassificationarXiv 2021FIMO: A Challenge Formal Dataset for Automated Theorem ProvingarXiv 2023Empowering Low-Light Image Enhancer through Customized Learnable PriorsICCV 2023 1MARS: Paying more attention to visual attributes for text-based person searcharXiv 2024Text-To-Concept (and Back) via Cross-Model AlignmentarXiv 2023PWESuite: Phonetic Word Embeddings and Tasks They FacilitatearXiv 2023Better Zero-Shot Reasoning with Role-Play PromptingarXiv 2023SPTNet: An Efficient Alternative Framework for Generalized Category Discovery with Spatial Prompt TuningarXiv 2024Multi-Task Reinforcement Learning with Mixture of Orthogonal ExpertsarXiv 2023MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of VideosCVPR 2024 1DeOcc-1-to-3: 3D De-Occlusion from a Single Image via Self-Supervised Multi-View DiffusionarXiv 2025Intra- & Extra-Source Exemplar-Based Style Synthesis for Improved Domain GeneralizationarXiv 2023NeuroBOLT: Resting-state EEG-to-fMRI Synthesis with Multi-dimensional
Feature MappingarXiv 2024Structure-Informed Protein Language ModelarXiv 2024Streamlining Redundant Layers to Compress Large Language ModelsarXiv 2024FlightScope: An Experimental Comparative Review of Aircraft Detection Algorithms in Satellite ImageryarXiv 2024WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language ModelsarXiv 2024On Generalization in Coreference ResolutionCRAC (ACL) 2021 11A Framework for Integrating Gesture Generation Models into Interactive Conversational AgentsarXiv 2021BANSAC: A dynamic BAyesian Network for adaptive SAmple ConsensusICCV 2023 1CoTexT: Multi-task Learning with Code-Text TransformerACL (NLP4Prog) 2021 8Improving Pretrained Cross-Lingual Language Models via Self-Labeled Word AlignmentACL 2021 5Bayesian Low-rank Adaptation for Large Language ModelsarXiv 2023Large Language Models are Built-in Autoregressive Search EnginesarXiv 2023Graph Generation with Diffusion MixturearXiv 2023GCoNet+: A Stronger Group Collaborative Co-Salient Object DetectorarXiv 2022FigureQA: An Annotated Figure Dataset for Visual Reasoningfigureqa-an-annotated-figure-dataset-for-1Two-shot Video Object SegmentationCVPR 2023 1A Multimodal Knowledge-enhanced Whole-slide Pathology Foundation ModelarXiv 2024SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled Variational AutoencodersarXiv 2024Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-TranslationarXiv 2024Learning to Edit: Aligning LLMs with Knowledge EditingarXiv 2024Question Answering over Electronic Devices: A New Benchmark Dataset and a Multi-Task Learning based QA FrameworkFindings (EMNLP) 2021 11CR-Walker: Tree-Structured Graph Reasoning and Dialog Acts for Conversational RecommendationEMNLP 2021 11PRompt Optimization in Multi-Step Tasks (PROMST): Integrating Human Feedback and Heuristic-based SamplingarXiv 2024Improved Test-Time Adaptation for Domain GeneralizationCVPR 2023 1Task-Oriented Dialogue with In-Context LearningarXiv 2024MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical ReasoningarXiv 2024APNet: An All-Frame-Level Neural Vocoder Incorporating Direct Prediction
of Amplitude and Phase SpectraarXiv 2023IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language ModelarXiv 2024Latte: Latent Diffusion Transformer for Video GenerationarXiv 2024BOLT: Boost Large Vision-Language Model Without Training for Long-form Video UnderstandingCVPR 2025 1Optimal Transport-based Alignment of Learned Character Representations for String Similarityoptimal-transport-based-alignment-of-learned-1Predicting Stock Market Time-Series Data using CNN-LSTM Neural Network ModelarXiv 2023Simulating User Satisfaction for the Evaluation of Task-oriented Dialogue SystemsarXiv 2021NaijaSenti: A Nigerian Twitter Sentiment Corpus for Multilingual Sentiment AnalysisLREC 2022 6Relation Preserving Triplet Mining for Stabilising the Triplet Loss in Re-identification Systemsrelation-preserving-triplet-mining-for-1